目前最详细的大圆模型测试各种设备都有,有手机,有电脑,有 Mac,有 Windows。
全文概述
本文详细记录了多种硬件设备在运行LLM大模型推理时的表现,重点测试了不同模型在不同硬件上的TTFT和TPS等性能指标。涵盖了从高端显卡到移动设备的广泛硬件,并展示了各模型在特定条件下的表现。
硬件设备与模型介绍
测试涉及多种硬件设备,包括NVIDIA RTX系列显卡、Dell工作站、HP Omen笔记本及iPhone和小米手机等。模型方面,主要测试了Qwen3、LLama3、DeepSeek R1等多款开源模型,参数规模从8B到240B不等。
推理性能测试方法
所有测试均基于gguf格式,默认开启flash attention以提升效率。测试问题为简单的‘吕洞宾的故事’,并通过vllm工具测试单用户和多用户的最大吞吐量。结果显示,显存大小对模型运行效果有显著影响。
关键测试结果
结果显示,RTX8000显卡能轻松运行70B模型,而拥有128G内存的m4max设备则能运行大部分模型。对于移动端设备,如iPhone 15 Max Pro和小米14 Ultra,在Qwen3模型上也表现出色,尽管CPU性能较弱但依然能达到35 tokens/秒的速度。
未来展望
作者计划继续更新更多设备和模型的测试数据,并考虑按设备类型分类发布新文章。此外,还将探索更高效的量化模型,以进一步优化推理性能。
已收藏
去我的收藏夹