小米AI卷出1000tps新速度,揭秘背后系统工程三板斧

源自36位全网作者

06-11 07:37

2026年6月9日,小米MiMo团队联合AI系统公司TileRT共同发布了MiMo-V2.5-Pro大模型的UltraSpeed模式,这一消息在AI圈引发了广泛关注。其核心亮点是在一台标准的8卡通用GPU服务器上,将万亿参数大模型的文本生成速度推向了前所未有的1000 tokens/s(tps),峰值可达1200 tps。

对于普通用户而言,1000 tps意味着一篇千字短文几乎在眨眼之间就能生成,远超人类的阅读速度。这不仅是等待时间的缩短,更标志着AI的应用方式可能发生质变。更关键的是,这一突破并未使用昂贵的定制化专用芯片,而是在通用硬件上实现的,展示了深厚的系统工程能力。那么,这一惊人的速度是如何实现的呢?答案在于模型、算法和系统三个层面的协同优化。

第一板斧:模型精准“瘦身”——FP4量化

大模型参数量巨大,推理时对显存和带宽的压力是主要瓶颈之一。最直接的加速方法是量化,即降低模型参数的精度。小米的做法并非简单粗暴地将整个模型压缩,而是采取了更精细的策略。

MiMo-V2.5-Pro采用了混合专家(MoE)架构,其中大部分参数集中在“专家(Expert)”层。这些专家层主要负责计算,而模型的“决策中枢”则由路由(Router)和注意力(Attention)等模块承担。小米的优化方案是,仅对参数量巨大但非决策核心的专家层进行FP4(4-bit浮点数)量化,而保持关键模块的原始精度。这种做法好比只给大象的身体“抽脂”,而不损伤其大脑,从而在大幅降低显存占用和带宽压力的同时,几乎无损地保持了模型的综合能力。

第二板斧:解码流程革命——DFlash推测解码

传统大模型的文本生成方式是“自回归”(Autoregressive),即逐字生成,下一个字的输出必须依赖上一个字的结果。这种串行模式严重限制了GPU并行计算能力的发挥。为解决此问题,业界提出了“投机解码”(Speculative Decoding)方案:用一个轻量级的“草稿模型”快速生成一段候选文本,再由强大的“主模型”一次性并行验证。

然而,过去的投机解码方案中,草稿模型本身也大多采用自回归方式生成,效率提升有限。小米此次引入的DFlash技术则是对这一流程的革命。DFlash的核心思想借鉴了图像生成领域的扩散模型,让草稿模型不再逐字猜测,而是在一次前向传播中,并行预测并生成一整块(Block)的文本。

这样一来,主模型每次验证的就不再是几个零散的token,而是一个完整的文本块。根据小米公布的数据,在代码生成等结构化场景下,平均每轮验证可以接受6到7个token。这意味着主模型的工作效率被放大了数倍,将“逐字确认”升级为“整段验收”,这是实现1000 tps速度最关键的一步。

第三板斧:系统底层优化——TileRT推理系统

有了优化的模型和算法,还需要一个高效的执行系统来确保硬件算力被充分利用。在AI推理过程中,不同的计算任务(算子)之间切换会产生延迟和开销。当速度达到千级tps时,这些微小的间隙就成了不可忽视的瓶颈。

与小米合作的TileRT推理系统通过重构GPU执行架构来解决这一问题。它采用持久化内核(Persistent Kernel)与异构流水线等技术,将计算任务无缝衔接,消除了算子切换带来的延迟,让GPU的计算单元能够持续满负荷运转,榨干硬件的每一分性能。

小米AI卷出1000tps新速度,揭秘背后系统工程三板斧

如何客观看待1000 tps?

这不仅仅是“更快”,它解锁了全新的应用场景。对于AI Agent(智能体)、代码助手、高频量化交易、实时反欺诈等要求毫秒级响应的场景,过去因延迟而无法使用大型顶级模型的困境被打破。速度的提升,意味着AI在同样时间内可以进行更多轮的思考、验证和纠错,从而可能带来智能的“质变”。

小米AI卷出1000tps新速度,揭秘背后系统工程三板斧

这一成果是模型与系统“协同设计”(Codesign)的典范。它证明了在不依赖专用硬件的情况下,通过软件和算法的全栈优化,同样可以达到极限性能,为AI的普及和部署降低了门槛。

但同时也要认识到,UltraSpeed模式是一种为追求极致低延迟而进行的“特化”。它通过牺牲并发能力(即同时处理多个请求的能力),将服务器资源集中于单个任务,以实现最快的单请求响应。这解释了其“3倍价格”的定价策略——用户为这种独占性的、高成本的低延迟服务支付溢价。对于需要同时服务大量用户的应用场景,该方案的整体吞吐量可能并非最优。

小米AI卷出1000tps新速度,揭秘背后系统工程三板斧

小米MiMo-V2.5-Pro的UltraSpeed模式是一次里程碑式的工程实践。它通过FP4量化、DFlash解码和TileRT系统优化的三位一体,不仅刷新了万亿参数模型的速度纪录,更重要的是,它为业界展示了一条在通用硬件上实现极致AI性能的可行路径,预示着一个反应更迅速、应用更广泛的AI时代正加速到来。

内容由AI生成

精选参考来源

1. 如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的?

如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的? 一千个 token,一秒钟。你没有看错。2026 年 6 月 9 日,小米 MiMo 团队联合

2. 小米MiMo把token速度干到了1000tokens/s!!

小米MiMo把token速度干到了1000tokens/s!! 激动,作为股东非常激动。 小米MiMoV2.5Pro模型刚刚推出UltraSpeed档位,每秒输出1000个tokens,而且是标准8卡

3. 如何评价小米6月9日发布的MiMo-V2.5-Pro-UltraSpeed模式?

如何评价小米6月9日发布的MiMo-V2.5-Pro-UltraSpeed模式? 中国万亿参数大模型又多了一个能进第一梯队的选手,而且这次是跑在通用 GPU 上。 看到「1000 tokens/s」和

4. 这个厉害了,天下武功,唯快不破。小米发布了 MiMo-V2.5-Pro 的 UltraSpeed 模式,在通用 GPU ...

这个厉害了,天下武功,唯快不破。小米发布了 MiMo-V2.5-Pro 的 UltraSpeed 模式,在通用 GPU ... 这个厉害了,天下武功,唯快不破。小米发布了 MiMo-V2.5-Pro

5. MiMo推出1000 Token/s超高速模型|体验测评

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。

6. 小米把 1t 模型做到了 1000Tokens/秒

小米把 1t 模型做到了 1000Tokens/秒 小米 MiMo 团队与 TileRT_AI 联合发布 MiMo-V2.5-Pro-UltraSpeed 模型,首次在单节点标准 8-GPU 上实现

7. 小米发布MiMo-V2.5-Pro-UltraSpeed模型

小米发布MiMo-V2.5-Pro-UltraSpeed模型 大模型 今天发布了最新的MiMo-V2.5-Pro-UltraSpeed大模型,采用采用块级 Masked 并行预测替代传统 Draft

8. MIMO-V2.5-Pro UltraSpeed,1T模型1000TPS

MIMO-V2.5-Pro UltraSpeed,1T模型1000TPS 小米最新博客发布了 Mimo V2.5 Pro 的 UltraSpeed 模式。这个模式下可以实现远超标准服务的 TPS 速度

9. 小米发布MiMo-V2.5-Pro UltraSpeed模式,3倍价格10倍输出体验

小米发布MiMo-V2.5-Pro UltraSpeed模式,3倍价格10倍输出体验 小米发布MiMo-V2.5-Pro UltraSpeed模式,3倍价格10倍输出体验IT之家1780936089

10. 昨晚看到小米MiMo发了个大招,必须来跟大家聊聊。 MiMo-V2.5-Pro正式上线了UltraSpeed模式,直接把...

昨晚看到小米MiMo发了个大招,必须来跟大家聊聊。 MiMo-V2.5-Pro正式上线了UltraSpeed模式,直接把... 昨晚看到小米MiMo发了个大招,必须来跟大家聊聊。 MiMo-V2.5-

11. AI资讯|小米AI大模型速度第一:1分钟复刻Mac

AI资讯|小米AI大模型速度第一:1分钟复刻Mac 小米这次卷的不只汽车了,而是大模型速度。 今天上午MiMo × TileRT 联合发布了 MiMo-V2.5-Pro-UltraSpeed。根据宣传

12. 算力界的“大地震”:小米MiMo-V2.5-Pro在8张显卡上跑出1000t/s

算力界的“大地震”:小米MiMo-V2.5-Pro在8张显卡上跑出1000t/s 算力界的“大地震”:小米MiMo-V2.5-Pro在8张显卡上跑出1000t/s知识大胖1780964885 在AI模

13. 如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的?

如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的? 技术细节建议看小米官方的博客,讲的还是比较清楚的。主要是三点:FP4推理、新的投机解码方案以及内

14. 刚刚mi­mo官宣和Ti­l­e­RT AI联合推出Mi­Mo-V2.5-Pro的Ul­t­r­a­S­p­e­ed模式...

刚刚mi­mo官宣和Ti­l­e­RT AI联合推出Mi­Mo-V2.5-Pro的Ul­t­r­a­S­p­e­ed模式... 刚刚mi­mo官宣和Ti­l­e­RT AI联合推出Mi­Mo-V2.5

15. #小米大模型刷新全球最快推理速度#MiMo发布了V2.5-Pro-UltraSpeed,这是业内首次在万亿(1T)参数模...

#小米大模型刷新全球最快推理速度#MiMo发布了V2.5-Pro-UltraSpeed,这是业内首次在万亿(1T)参数模... MiMo发布了V2.5-Pro-UltraSpeed,这是业内首次在万亿

16. 小米上线MiMo-V2.5-Pro-UltraSpeed模式,刷新旗舰模型推理速度

小米上线MiMo-V2.5-Pro-UltraSpeed模式,刷新旗舰模型推理速度 小米上线MiMo-V2.5-Pro-UltraSpeed模式,刷新旗舰模型推理速度北京商报1780983766 北京

17. 小米MiMo-V2.5-Pro-UltraSpeed正式发布 1T参数模型

小米MiMo-V2.5-Pro-UltraSpeed正式发布 1T参数模型 小米MiMo-V2.5-Pro-UltraSpeed正式发布 1T参数模型CNMO科技1780976123 【CNMO科技消

18. 如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的?

如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的? 技术上说的有点太细了,对合规不太好。技术上提到用的是MXFP4,但目前境内合规支持FP4的卡只有

19. 说真的,看到小米这次 MiMo-V2.5‑Pro UltraSpeed 的数据,还是挺惊讶的。万亿参数大模型,推理速度直...

说真的,看到小米这次 MiMo-V2.5‑Pro UltraSpeed 的数据,还是挺惊讶的。万亿参数大模型,推理速度直... 说真的,看到小米这次 MiMo-V2.5‑Pro UltraSpeed

20. 小米MiMo-V2.5-Pro-UltraSpeed正式发布1T参数模型,标准8卡GPU节点,生成速度突破1000 to...

小米MiMo-V2.5-Pro-UltraSpeed正式发布1T参数模型,标准8卡GPU节点,生成速度突破1000 to... 小米MiMo-V2.5-Pro-UltraSpeed正式发布1T参数模型

21. 小米技术专门发文介绍了MiMo V2.5-Pro-UltraSpeed,我摘几个重要的:1.提速的必要性常规低速大模型如...

小米技术专门发文介绍了MiMo V2.5-Pro-UltraSpeed,我摘几个重要的:1.提速的必要性常规低速大模型如... 小米技术专门发文介绍了MiMo V2.5-Pro-UltraSpeed,

22. 小米大模型推理速度首次突破每秒1000个token

小米大模型推理速度首次突破每秒1000个token 小米大模型推理速度首次突破每秒1000个tokeni黑马1781002082 6月9日,小米MiMo团队与AI编译优化系统组TileRT联合推出Mi

23. #小米大模型刷新全球最快推理速度#与 iOS 27 的 AI 形成明确“反观”的是小米 Mimo 大模型:小米 MiMo...

#小米大模型刷新全球最快推理速度#与 iOS 27 的 AI 形成明确“反观”的是小米 Mimo 大模型:小米 MiMo... 与 iOS 27 的 AI 形成明确“反观”的是小米 Mimo 大模型:

24. #小米大模型刷新全球最快推理速度#“一旦你尝到了这种速度,就很难回头了”,这是外网博主们对MiMo大模型推理速度的高度评...

#小米大模型刷新全球最快推理速度#“一旦你尝到了这种速度,就很难回头了”,这是外网博主们对MiMo大模型推理速度的高度评... “一旦你尝到了这种速度,就很难回头了”,这是外网博主们对MiMo大模型推

25. #小米大模型刷新全球最快推理速度# MiMo 团队与 TileRT 团队联合发布了MiMo-V2.5-Pro的Ultra...

#小米大模型刷新全球最快推理速度# MiMo 团队与 TileRT 团队联合发布了MiMo-V2.5-Pro的Ultra... MiMo 团队与 TileRT 团队联合发布了MiMo-V2.5-Pr

26. #小米大模型刷新全球最快推理速度#小米在AI推理工程层面确实做到了全球顶尖,小米究竟掌握了什么天顶星科技啊 1000 t...

#小米大模型刷新全球最快推理速度#小米在AI推理工程层面确实做到了全球顶尖,小米究竟掌握了什么天顶星科技啊 1000 t... 小米在AI推理工程层面确实做到了全球顶尖,小米究竟掌握了什么天顶星科技啊

27. 小米MiMo-V2.5-Pro-UltraSpeed上线后,赢得了全球开发者的广泛赞誉,一起来看看开发者们的真实反馈👇🏻...

小米MiMo-V2.5-Pro-UltraSpeed上线后,赢得了全球开发者的广泛赞誉,一起来看看开发者们的真实反馈👇🏻... 小米MiMo-V2.5-Pro-UltraSpeed上线后,赢得了全球开

28. 小米MiMo-V2.5-Pro-UltraSpeed正式发布,在通用 GPU 上将万亿参数模型的生成速度首次突破 100...

小米MiMo-V2.5-Pro-UltraSpeed正式发布,在通用 GPU 上将万亿参数模型的生成速度首次突破 100... 小米MiMo-V2.5-Pro-UltraSpeed正式发布,在通用 G

29. 今天,小米MiMo-V2.5-Pro-UltraSpeed,在通用GPU上让万亿参数模型的生成速度突破了1000 tok...

今天,小米MiMo-V2.5-Pro-UltraSpeed,在通用GPU上让万亿参数模型的生成速度突破了1000 tok... 今天,小米MiMo-V2.5-Pro-UltraSpeed,在通用GPU

30. #小米大模型刷新全球最快推理速度#2026年6月,小米AI实验室MiMo团队联手TileRT团队,放出了一个惊艳行业的A...

#小米大模型刷新全球最快推理速度#2026年6月,小米AI实验室MiMo团队联手TileRT团队,放出了一个惊艳行业的A... 2026年6月,小米AI实验室MiMo团队联手TileRT团队,放出了一

31. #小米大模型刷新全球最快推理速度#这次更新核心聚焦大模型推理速度优化,在通用GPU设备上,实现了万亿参数AI模型的速度突...

#小米大模型刷新全球最快推理速度#这次更新核心聚焦大模型推理速度优化,在通用GPU设备上,实现了万亿参数AI模型的速度突... 这次更新核心聚焦大模型推理速度优化,在通用GPU设备上,实现了万亿参数A

32. 如何评价小米6月9日发布的MiMo-V2.5-Pro-UltraSpeed模式?

如何评价小米6月9日发布的MiMo-V2.5-Pro-UltraSpeed模式? 这个优化注定不可能成为主流。DFlash 也好 MTP 也好,这些投机解码都是以牺牲整体吞吐量为前提的——草稿模型多猜

33. 小米大模型上线新模式 推理速度突破1000 tokens/s

小米大模型上线新模式 推理速度突破1000 tokens/s 小米大模型上线新模式 推理速度突破1000 tokens/s新京报1780975072 新京报贝壳财经讯(记者陈维城)6月8日晚,小米Mi

34. 小米在大模型赛道已经无敌了。通用 GPU 上将万亿参数模型的生成速度首次突破 1000 tokens/s!点开视频感受一...

小米在大模型赛道已经无敌了。通用 GPU 上将万亿参数模型的生成速度首次突破 1000 tokens/s!点开视频感受一... 小米在大模型赛道已经无敌了。通用 GPU 上将万亿参数模型的生成速度首次

35. 雷军:3倍价格10倍速度!小米万亿参数模型1000 tokens/s狂飙,只需8张GPU

雷军:3倍价格10倍速度!小米万亿参数模型1000 tokens/s狂飙,只需8张GPU 雷军:3倍价格10倍速度!小米万亿参数模型1000 tokens/s狂飙,只需8张GPU智东西17809871

36. #小米大模型刷新全球最快推理速度#小米这个速度,怎么说呢一边觉得离谱,一边又觉得:好像是小米干出来的,那也正常。你很牛叉...

#小米大模型刷新全球最快推理速度#小米这个速度,怎么说呢一边觉得离谱,一边又觉得:好像是小米干出来的,那也正常。你很牛叉... 小米这个速度,怎么说呢一边觉得离谱,一边又觉得:好像是小米干出来的,那也
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章