2026年6月9日,小米MiMo团队联合AI系统公司TileRT共同发布了MiMo-V2.5-Pro大模型的UltraSpeed模式,这一消息在AI圈引发了广泛关注。其核心亮点是在一台标准的8卡通用GPU服务器上,将万亿参数大模型的文本生成速度推向了前所未有的1000 tokens/s(tps),峰值可达1200 tps。
对于普通用户而言,1000 tps意味着一篇千字短文几乎在眨眼之间就能生成,远超人类的阅读速度。这不仅是等待时间的缩短,更标志着AI的应用方式可能发生质变。更关键的是,这一突破并未使用昂贵的定制化专用芯片,而是在通用硬件上实现的,展示了深厚的系统工程能力。那么,这一惊人的速度是如何实现的呢?答案在于模型、算法和系统三个层面的协同优化。
第一板斧:模型精准“瘦身”——FP4量化
大模型参数量巨大,推理时对显存和带宽的压力是主要瓶颈之一。最直接的加速方法是量化,即降低模型参数的精度。小米的做法并非简单粗暴地将整个模型压缩,而是采取了更精细的策略。
MiMo-V2.5-Pro采用了混合专家(MoE)架构,其中大部分参数集中在“专家(Expert)”层。这些专家层主要负责计算,而模型的“决策中枢”则由路由(Router)和注意力(Attention)等模块承担。小米的优化方案是,仅对参数量巨大但非决策核心的专家层进行FP4(4-bit浮点数)量化,而保持关键模块的原始精度。这种做法好比只给大象的身体“抽脂”,而不损伤其大脑,从而在大幅降低显存占用和带宽压力的同时,几乎无损地保持了模型的综合能力。
第二板斧:解码流程革命——DFlash推测解码
传统大模型的文本生成方式是“自回归”(Autoregressive),即逐字生成,下一个字的输出必须依赖上一个字的结果。这种串行模式严重限制了GPU并行计算能力的发挥。为解决此问题,业界提出了“投机解码”(Speculative Decoding)方案:用一个轻量级的“草稿模型”快速生成一段候选文本,再由强大的“主模型”一次性并行验证。
然而,过去的投机解码方案中,草稿模型本身也大多采用自回归方式生成,效率提升有限。小米此次引入的DFlash技术则是对这一流程的革命。DFlash的核心思想借鉴了图像生成领域的扩散模型,让草稿模型不再逐字猜测,而是在一次前向传播中,并行预测并生成一整块(Block)的文本。
这样一来,主模型每次验证的就不再是几个零散的token,而是一个完整的文本块。根据小米公布的数据,在代码生成等结构化场景下,平均每轮验证可以接受6到7个token。这意味着主模型的工作效率被放大了数倍,将“逐字确认”升级为“整段验收”,这是实现1000 tps速度最关键的一步。
第三板斧:系统底层优化——TileRT推理系统
有了优化的模型和算法,还需要一个高效的执行系统来确保硬件算力被充分利用。在AI推理过程中,不同的计算任务(算子)之间切换会产生延迟和开销。当速度达到千级tps时,这些微小的间隙就成了不可忽视的瓶颈。
与小米合作的TileRT推理系统通过重构GPU执行架构来解决这一问题。它采用持久化内核(Persistent Kernel)与异构流水线等技术,将计算任务无缝衔接,消除了算子切换带来的延迟,让GPU的计算单元能够持续满负荷运转,榨干硬件的每一分性能。

如何客观看待1000 tps?
这不仅仅是“更快”,它解锁了全新的应用场景。对于AI Agent(智能体)、代码助手、高频量化交易、实时反欺诈等要求毫秒级响应的场景,过去因延迟而无法使用大型顶级模型的困境被打破。速度的提升,意味着AI在同样时间内可以进行更多轮的思考、验证和纠错,从而可能带来智能的“质变”。

这一成果是模型与系统“协同设计”(Codesign)的典范。它证明了在不依赖专用硬件的情况下,通过软件和算法的全栈优化,同样可以达到极限性能,为AI的普及和部署降低了门槛。
但同时也要认识到,UltraSpeed模式是一种为追求极致低延迟而进行的“特化”。它通过牺牲并发能力(即同时处理多个请求的能力),将服务器资源集中于单个任务,以实现最快的单请求响应。这解释了其“3倍价格”的定价策略——用户为这种独占性的、高成本的低延迟服务支付溢价。对于需要同时服务大量用户的应用场景,该方案的整体吞吐量可能并非最优。

小米MiMo-V2.5-Pro的UltraSpeed模式是一次里程碑式的工程实践。它通过FP4量化、DFlash解码和TileRT系统优化的三位一体,不仅刷新了万亿参数模型的速度纪录,更重要的是,它为业界展示了一条在通用硬件上实现极致AI性能的可行路径,预示着一个反应更迅速、应用更广泛的AI时代正加速到来。