最全LLM大模型推理成绩实测(20260523)

2026-05-24 10:13:27

目前最详细的大圆模型测试各种设备都有,有手机,有电脑,有 Mac,有 Windows。

最全LLM大模型推理成绩实测(20260523)
AI为你总结

全文概述

本文详细记录了多种硬件设备在运行LLM大模型推理时的表现,重点测试了不同模型在不同硬件上的TTFT和TPS等性能指标。涵盖了从高端显卡到移动设备的广泛硬件,并展示了各模型在特定条件下的表现。

硬件设备与模型介绍

测试涉及多种硬件设备,包括NVIDIA RTX系列显卡、Dell工作站、HP Omen笔记本及iPhone和小米手机等。模型方面,主要测试了Qwen3、LLama3、DeepSeek R1等多款开源模型,参数规模从8B到240B不等。

推理性能测试方法

所有测试均基于gguf格式,默认开启flash attention以提升效率。测试问题为简单的‘吕洞宾的故事’,并通过vllm工具测试单用户和多用户的最大吞吐量。结果显示,显存大小对模型运行效果有显著影响。

关键测试结果

结果显示,RTX8000显卡能轻松运行70B模型,而拥有128G内存的m4max设备则能运行大部分模型。对于移动端设备,如iPhone 15 Max Pro和小米14 Ultra,在Qwen3模型上也表现出色,尽管CPU性能较弱但依然能达到35 tokens/秒的速度。

未来展望

作者计划继续更新更多设备和模型的测试数据,并考虑按设备类型分类发布新文章。此外,还将探索更高效的量化模型,以进一步优化推理性能。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

0
扫一下,分享更方便,购买更轻松