当前位置:
AIGC文章详情

小米大模型飙到1000tps,背后三大黑科技深度解析

源自35位全网作者

06-11 07:13

2024年6月9日,小米公司发布了其万亿参数大模型MiMo-V2.5-Pro的“UltraSpeed”模式,引发了业界的广泛关注。这一模式由小米MiMo团队与AI编译优化系统团队TileRT联合推出,其核心亮点在于,它在单台标准的8卡通用GPU服务器上,实现了超过1000 tokens/s(每秒生成字符数)的推理速度,峰值可达1200 tokens/s。这一速度不仅刷新了万亿参数级别模型的推理纪录,更重要的是,它并未依赖昂贵的定制化芯片,从而显著降低了极速AI推理的落地门槛。

1000tps是如何实现的?三大技术支柱解析

在大型语言模型领域,万亿参数规模通常意味着强大的能力,但也伴随着巨大的计算开销和缓慢的响应速度。传统的大模型采用“自回归”解码方式,即逐字生成,下一个字的输出必须等待上一个字计算完成,这导致GPU的大量并行计算能力被闲置。小米此次的速度突破,并非单一技术的功劳,而是模型、算法与底层系统全链路协同设计(Codesign)的成果,主要依赖于以下三大技术支柱:

1. FP4量化:为模型精准“瘦身”

万亿参数模型体积庞大,对显存和带宽构成了巨大压力。为解决此问题,MiMo团队采用了FP4量化技术。但这并非简单的全局压缩,而是针对其混合专家(MoE)架构的特性,仅对占据绝大多数参数量的“专家层”执行4-bit量化处理,而模型的注意力机制等核心模块则保留原始精度。通过这种选择性的“瘦身”,在大幅降低显存占用、缓解带宽压力的同时,保证了模型整体的推理能力基本不受影响。

2. DFlash投机解码:从“逐字吐”到“成块出”

这是实现速度飞跃最关键的技术之一。传统的投机解码方案使用一个轻量“草稿模型”来预测token,但草稿模型本身也是逐字生成的,效率提升有限。小米引入了名为“DFlash”的块并行推测解码方案,彻底改变了这一模式。DFlash的草稿模型不再逐字预测,而是借鉴了扩散模型的思想,一次性并行生成一整段文本区块(例如8个tokens)。随后,主模型对这一整个区块进行一次性并行验证。

这种“批量预测、批量验证”的模式,大幅提升了单轮运算的效率。根据官方数据,在代码生成和数理推理等结构化场景中,平均每一轮验证可以确认6到7个tokens,远超传统方案的2到3个。这意味着大模型每进行一次前向传播,就能产出更多的有效内容,从而实现了生成效率的指数级提升。

小米大模型飙到1000tps,背后三大黑科技深度解析

3. TileRT推理系统:压榨硬件潜能,消除延迟间隙

当生成速度达到千级token/秒的量级时,任何微小的系统延迟都会成为瓶颈。为此,AI编译优化团队TileRT重构了GPU的执行架构。其核心在于引入“持久化内核引擎”,将整个推理流程编译为常驻GPU的计算流水线,避免了传统模式下频繁启动和切换算子所带来的延迟开销。同时,通过“异构流水线协作”技术,将计算、数据搬运和通信等任务精细拆解,交由GPU内部不同单元精密协作,让硬件算力始终处于满负荷运转状态,消除了执行间隙,将GPU的潜能压榨到极致

小米大模型飙到1000tps,背后三大黑科技深度解析

速度突破的意义与影响

将万亿参数模型的速度提升至1000 tps,其意义远不止是“更快”。

它为AI应用开辟了新的可能性。毫秒级的响应速度使得万亿大模型能够无缝接入对时间极度敏感的场景,例如高频量化交易、实时反欺诈风控、智能竞价等。在医疗领域,更快的推理速度意味着AI辅助手术或影像分析能更快给出预判,为医生争取宝贵的救治时间。

“速度即智能”。在同样的时间内,模型可以并行探索数十条不同的推理路径,并在后台进行自动验证和纠错(如Best-of-N策略),从而显著提升最终输出内容的质量与准确性。对于AI编程助手(Coding Agent)等应用,极速的响应不再让开发者面对屏幕苦等,生产力得到极大解放。

这次突破的另一个重要意义在于,它是在通用GPU上实现的。相较于业界一些依赖Cerebras晶圆级芯片或Groq定制芯片等专用硬件的方案,小米的纯软件与算法优化路线展示了一条更具普适性和成本效益的技术路径,降低了行业部署高性能大模型的门槛。

市场反响与客观审视

MiMo-V2.5-Pro的UltraSpeed模式目前以API形式限时开放申请,定价为标准版的3倍,但提供约10倍的速度体验。根据官方信息,该模式吸引了大量企业和开发者的关注。

当然,我们也需要客观看待这一进展。1000 tps指的是模型的“生成输出速度”,并不等同于“思考速度”,即模型处理复杂指令、进行检索和多轮逻辑推理的首token延迟依然存在。同时,该模式目前采取申请制限时开放,并设有严格的使用次数和时长限制,表明其背后的高速算力资源仍是稀缺的。其在真实世界复杂多任务并发场景下的性能表现,还有待更大规模的实践检验。

小米MiMo-V2.5-Pro的UltraSpeed模式无疑是AI推理工程领域的一次重要突破。它不仅展示了通过模型与系统深度协同优化所能达到的惊人效果,也预示着大模型行业的竞争正从单纯的参数规模和能力比拼,转向模型能力、推理速度与成本效率并重的多维度竞争。那个大模型不再“一字一顿”说话的未来,正加速到来。

内容由AI生成

精选参考来源

1. 这个厉害了,天下武功,唯快不破。小米发布了 MiMo-V2.5-Pro 的 UltraSpeed 模式,在通用 GPU ...

这个厉害了,天下武功,唯快不破。小米发布了 MiMo-V2.5-Pro 的 UltraSpeed 模式,在通用 GPU ... 这个厉害了,天下武功,唯快不破。小米发布了 MiMo-V2.5-Pro

2. 小米大模型推理速度首次突破每秒1000个token

小米大模型推理速度首次突破每秒1000个token 小米大模型推理速度首次突破每秒1000个tokeni黑马1781002082 6月9日,小米MiMo团队与AI编译优化系统组TileRT联合推出Mi

3. 算力界的“大地震”:小米MiMo-V2.5-Pro在8张显卡上跑出1000t/s

算力界的“大地震”:小米MiMo-V2.5-Pro在8张显卡上跑出1000t/s 算力界的“大地震”:小米MiMo-V2.5-Pro在8张显卡上跑出1000t/s知识大胖1780964885 在AI模

4. 终于还是用上了 MiMo-V2.5-Pro-UltraSpeed这速度简直了,录个屏展示一下。给了它一个长段的提示词,让...

终于还是用上了 MiMo-V2.5-Pro-UltraSpeed这速度简直了,录个屏展示一下。给了它一个长段的提示词,让... 终于还是用上了 MiMo-V2.5-Pro-UltraSpeed这速度简

5. 刚刚mi­mo官宣和Ti­l­e­RT AI联合推出Mi­Mo-V2.5-Pro的Ul­t­r­a­S­p­e­ed模式...

刚刚mi­mo官宣和Ti­l­e­RT AI联合推出Mi­Mo-V2.5-Pro的Ul­t­r­a­S­p­e­ed模式... 刚刚mi­mo官宣和Ti­l­e­RT AI联合推出Mi­Mo-V2.5

6. 如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的?

如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的? 一千个 token,一秒钟。你没有看错。2026 年 6 月 9 日,小米 MiMo 团队联合

7. #小米大模型刷新全球最快推理速度# MiMo 团队与 TileRT 团队联合发布了MiMo-V2.5-Pro的Ultra...

#小米大模型刷新全球最快推理速度# MiMo 团队与 TileRT 团队联合发布了MiMo-V2.5-Pro的Ultra... MiMo 团队与 TileRT 团队联合发布了MiMo-V2.5-Pr

8. 小米MiMo跑出千Token/秒,大模型推理迎来新突破

小米MiMo跑出千Token/秒,大模型推理迎来新突破 小米MiMo跑出千Token/秒,大模型推理迎来新突破迷雾里闪烁的灯光1780966068 先给你个直观体感:1000 tokens/秒到底有多

9. 小米MiMo-V2.5-Pro-UltraSpeed正式发布 1T参数模型

小米MiMo-V2.5-Pro-UltraSpeed正式发布 1T参数模型 小米MiMo-V2.5-Pro-UltraSpeed正式发布 1T参数模型CNMO科技1780976123 【CNMO科技消

10. 如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的?

如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的? 技术细节建议看小米官方的博客,讲的还是比较清楚的。主要是三点:FP4推理、新的投机解码方案以及内

11. 小米MiMo新模型输出速度突破1000 tokens每秒

小米MiMo新模型输出速度突破1000 tokens每秒 小米MiMo新模型输出速度突破1000 tokens每秒三言科技1780985345 6月9日消息,小米创始人雷军在社交平台发文,宣布小米大模

12. 今天,小米MiMo-V2.5-Pro-UltraSpeed,在通用GPU上让万亿参数模型的生成速度突破了1000 tok...

今天,小米MiMo-V2.5-Pro-UltraSpeed,在通用GPU上让万亿参数模型的生成速度突破了1000 tok... 今天,小米MiMo-V2.5-Pro-UltraSpeed,在通用GPU

13. 小米大模型上线新模式 推理速度突破1000 tokens/s

小米大模型上线新模式 推理速度突破1000 tokens/s 小米大模型上线新模式 推理速度突破1000 tokens/s新京报1780975072 新京报贝壳财经讯(记者陈维城)6月8日晚,小米Mi

14. 如何评价小米6月9日发布的MiMo-V2.5-Pro-UltraSpeed模式?

如何评价小米6月9日发布的MiMo-V2.5-Pro-UltraSpeed模式? 小米在ai领域的动作还是非常多的。今年以来可以说是喜报频传。3月份首先内测了Mimo-v2系列,推出了万亿参数级别的大

15. 如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的?

如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的? 今天 HN 上小米 MiMo 的 UltraSpeed 模式飙到了 539 票。我翻了翻技术博客

16. 如何评价小米6月9日发布的MiMo-V2.5-Pro-UltraSpeed模式?

如何评价小米6月9日发布的MiMo-V2.5-Pro-UltraSpeed模式? 我想用尽量没接触过AI的人也能听懂的话,给大家解释一下他有什么用?能影响什么?(第一章是纯科普内容,不需要的同学们可以

17. 小米 MiMo 团队与 TileRT 团队联合发布了MiMo-V2.5-Pro的UltraSpeed模式,在通用GPU集...

小米 MiMo 团队与 TileRT 团队联合发布了MiMo-V2.5-Pro的UltraSpeed模式,在通用GPU集... 小米 MiMo 团队与 TileRT 团队联合发布了MiMo-V2.5-

18. 小米技术专门发文介绍了MiMo V2.5-Pro-UltraSpeed,我摘几个重要的:1.提速的必要性常规低速大模型如...

小米技术专门发文介绍了MiMo V2.5-Pro-UltraSpeed,我摘几个重要的:1.提速的必要性常规低速大模型如... 小米技术专门发文介绍了MiMo V2.5-Pro-UltraSpeed,

19. 里程碑式的产业突破:小米mimo把万亿参数 MoE 旗舰模型的生成速度,从行业普遍的68–192 tokens/s直接拉...

里程碑式的产业突破:小米mimo把万亿参数 MoE 旗舰模型的生成速度,从行业普遍的68–192 tokens/s直接拉... 里程碑式的产业突破:小米mimo把万亿参数 MoE 旗舰模型的生成速度,

20. #小米大模型刷新全球最快推理速度#与 iOS 27 的 AI 形成明确“反观”的是小米 Mimo 大模型:小米 MiMo...

#小米大模型刷新全球最快推理速度#与 iOS 27 的 AI 形成明确“反观”的是小米 Mimo 大模型:小米 MiMo... 与 iOS 27 的 AI 形成明确“反观”的是小米 Mimo 大模型:

21. 小米上线MiMo-V2.5-Pro-UltraSpeed模式,刷新旗舰模型推理速度

小米上线MiMo-V2.5-Pro-UltraSpeed模式,刷新旗舰模型推理速度 小米上线MiMo-V2.5-Pro-UltraSpeed模式,刷新旗舰模型推理速度北京商报1780983766 北京

22. 小米MiMo V2.5-Pro-UltraSpeed体验了一晚上,技术层面就不聊了,聊点别的吧如果说小米新的大模型反应速...

小米MiMo V2.5-Pro-UltraSpeed体验了一晚上,技术层面就不聊了,聊点别的吧如果说小米新的大模型反应速... 小米MiMo V2.5-Pro-UltraSpeed体验了一晚上,技术层

23. 说真的,看到小米这次 MiMo-V2.5‑Pro UltraSpeed 的数据,还是挺惊讶的。万亿参数大模型,推理速度直...

说真的,看到小米这次 MiMo-V2.5‑Pro UltraSpeed 的数据,还是挺惊讶的。万亿参数大模型,推理速度直... 说真的,看到小米这次 MiMo-V2.5‑Pro UltraSpeed

24. #小米大模型刷新全球最快推理速度#这次更新核心聚焦大模型推理速度优化,在通用GPU设备上,实现了万亿参数AI模型的速度突...

#小米大模型刷新全球最快推理速度#这次更新核心聚焦大模型推理速度优化,在通用GPU设备上,实现了万亿参数AI模型的速度突... 这次更新核心聚焦大模型推理速度优化,在通用GPU设备上,实现了万亿参数A

25. 小米MiMo-V2.5-Pro-UltraSpeed正式发布,在通用 GPU 上将万亿参数模型的生成速度首次突破 100...

小米MiMo-V2.5-Pro-UltraSpeed正式发布,在通用 GPU 上将万亿参数模型的生成速度首次突破 100... 小米MiMo-V2.5-Pro-UltraSpeed正式发布,在通用 G

26. 如何看待小米 MiMo 的 UltraSpeed 内测, 大模型加速收费会是常态么?

如何看待小米 MiMo 的 UltraSpeed 内测, 大模型加速收费会是常态么? 确实非常厉害,这次没有小字,实打实的1000,甚至能到1100-1200.价格也不贵。问题就是mimoV2.5 p

27. 小米发布MiMo-V2.5-Pro UltraSpeed模式,3倍价格10倍输出体验

小米发布MiMo-V2.5-Pro UltraSpeed模式,3倍价格10倍输出体验 小米发布MiMo-V2.5-Pro UltraSpeed模式,3倍价格10倍输出体验IT之家1780936089

28. 小米AI重大突破!万亿大模型推理速度飙升至1000Token/s

小米AI重大突破!万亿大模型推理速度飙升至1000Token/s 小米AI重大突破!万亿大模型推理速度飙升至1000Token/sLiAo喜乐常在1780967477 2026年6月,小米AI实验室M

29. 万亿参数模型,首次突破 1000 tokens/s

万亿参数模型,首次突破 1000 tokens/s 天下武功,唯快不破。 今天,MiMo 联合 TileRT 发布 MiMo-V2.5-Pro UltraSpeed 模式——在通用 GPU 上,让万亿

30. 小米推出MiMo-V2.5-Pro UltraSpeed极速模式,万亿参数模型速度突破1000tokens/s

小米推出MiMo-V2.5-Pro UltraSpeed极速模式,万亿参数模型速度突破1000tokens/s 小米推出MiMo-V2.5-Pro UltraSpeed极速模式,万亿参数模型速度突破1

31. Xiaomi's Insane 1000 Tokens/Sec GPU Hack

Xiaomi's Insane 1000 Tokens/Sec GPU Hack A phone giant just crushed GPT-5.5 on speed—without any cus

32. 小米在大模型赛道已经无敌了。通用 GPU 上将万亿参数模型的生成速度首次突破 1000 tokens/s!点开视频感受一...

小米在大模型赛道已经无敌了。通用 GPU 上将万亿参数模型的生成速度首次突破 1000 tokens/s!点开视频感受一... 小米在大模型赛道已经无敌了。通用 GPU 上将万亿参数模型的生成速度首次

33. 雷军:3倍价格10倍速度!小米万亿参数模型1000 tokens/s狂飙,只需8张GPU

雷军:3倍价格10倍速度!小米万亿参数模型1000 tokens/s狂飙,只需8张GPU 雷军:3倍价格10倍速度!小米万亿参数模型1000 tokens/s狂飙,只需8张GPU智东西17809871

34. #小米大模型刷新全球最快推理速度# 这次速度突破,来源于模型架构和底层系统的双向深度优化,并非简单的参数压缩或功能阉割...

#小米大模型刷新全球最快推理速度# 这次速度突破,来源于模型架构和底层系统的双向深度优化,并非简单的参数压缩或功能阉割... 这次速度突破,来源于模型架构和底层系统的双向深度优化,并非简单的参数

35. 看到这个1000 tokens/s的推理速度,确实挺夸张的。万亿参数还能跑这么快,说明在推理优化这块真下了功夫。之前大家...

看到这个1000 tokens/s的推理速度,确实挺夸张的。万亿参数还能跑这么快,说明在推理优化这块真下了功夫。之前大家... 看到这个1000 tokens/s的推理速度,确实挺夸张的。万亿参数还能
0
扫一下,分享更方便,购买更轻松
2评论

  • 精彩
  • 最新
  • 喜欢,买了

    校验提示文案

    提交
  • 这不是玩,别管算的准不准,就说快不快就行了

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章