2024年6月9日,小米公司发布了其万亿参数大模型MiMo-V2.5-Pro的“UltraSpeed”模式,引发了业界的广泛关注。这一模式由小米MiMo团队与AI编译优化系统团队TileRT联合推出,其核心亮点在于,它在单台标准的8卡通用GPU服务器上,实现了超过1000 tokens/s(每秒生成字符数)的推理速度,峰值可达1200 tokens/s。这一速度不仅刷新了万亿参数级别模型的推理纪录,更重要的是,它并未依赖昂贵的定制化芯片,从而显著降低了极速AI推理的落地门槛。
1000tps是如何实现的?三大技术支柱解析
在大型语言模型领域,万亿参数规模通常意味着强大的能力,但也伴随着巨大的计算开销和缓慢的响应速度。传统的大模型采用“自回归”解码方式,即逐字生成,下一个字的输出必须等待上一个字计算完成,这导致GPU的大量并行计算能力被闲置。小米此次的速度突破,并非单一技术的功劳,而是模型、算法与底层系统全链路协同设计(Codesign)的成果,主要依赖于以下三大技术支柱:
1. FP4量化:为模型精准“瘦身”
万亿参数模型体积庞大,对显存和带宽构成了巨大压力。为解决此问题,MiMo团队采用了FP4量化技术。但这并非简单的全局压缩,而是针对其混合专家(MoE)架构的特性,仅对占据绝大多数参数量的“专家层”执行4-bit量化处理,而模型的注意力机制等核心模块则保留原始精度。通过这种选择性的“瘦身”,在大幅降低显存占用、缓解带宽压力的同时,保证了模型整体的推理能力基本不受影响。
2. DFlash投机解码:从“逐字吐”到“成块出”
这是实现速度飞跃最关键的技术之一。传统的投机解码方案使用一个轻量“草稿模型”来预测token,但草稿模型本身也是逐字生成的,效率提升有限。小米引入了名为“DFlash”的块并行推测解码方案,彻底改变了这一模式。DFlash的草稿模型不再逐字预测,而是借鉴了扩散模型的思想,一次性并行生成一整段文本区块(例如8个tokens)。随后,主模型对这一整个区块进行一次性并行验证。
这种“批量预测、批量验证”的模式,大幅提升了单轮运算的效率。根据官方数据,在代码生成和数理推理等结构化场景中,平均每一轮验证可以确认6到7个tokens,远超传统方案的2到3个。这意味着大模型每进行一次前向传播,就能产出更多的有效内容,从而实现了生成效率的指数级提升。

3. TileRT推理系统:压榨硬件潜能,消除延迟间隙
当生成速度达到千级token/秒的量级时,任何微小的系统延迟都会成为瓶颈。为此,AI编译优化团队TileRT重构了GPU的执行架构。其核心在于引入“持久化内核引擎”,将整个推理流程编译为常驻GPU的计算流水线,避免了传统模式下频繁启动和切换算子所带来的延迟开销。同时,通过“异构流水线协作”技术,将计算、数据搬运和通信等任务精细拆解,交由GPU内部不同单元精密协作,让硬件算力始终处于满负荷运转状态,消除了执行间隙,将GPU的潜能压榨到极致。

速度突破的意义与影响
将万亿参数模型的速度提升至1000 tps,其意义远不止是“更快”。
它为AI应用开辟了新的可能性。毫秒级的响应速度使得万亿大模型能够无缝接入对时间极度敏感的场景,例如高频量化交易、实时反欺诈风控、智能竞价等。在医疗领域,更快的推理速度意味着AI辅助手术或影像分析能更快给出预判,为医生争取宝贵的救治时间。
“速度即智能”。在同样的时间内,模型可以并行探索数十条不同的推理路径,并在后台进行自动验证和纠错(如Best-of-N策略),从而显著提升最终输出内容的质量与准确性。对于AI编程助手(Coding Agent)等应用,极速的响应不再让开发者面对屏幕苦等,生产力得到极大解放。
这次突破的另一个重要意义在于,它是在通用GPU上实现的。相较于业界一些依赖Cerebras晶圆级芯片或Groq定制芯片等专用硬件的方案,小米的纯软件与算法优化路线展示了一条更具普适性和成本效益的技术路径,降低了行业部署高性能大模型的门槛。
市场反响与客观审视
MiMo-V2.5-Pro的UltraSpeed模式目前以API形式限时开放申请,定价为标准版的3倍,但提供约10倍的速度体验。根据官方信息,该模式吸引了大量企业和开发者的关注。
当然,我们也需要客观看待这一进展。1000 tps指的是模型的“生成输出速度”,并不等同于“思考速度”,即模型处理复杂指令、进行检索和多轮逻辑推理的首token延迟依然存在。同时,该模式目前采取申请制限时开放,并设有严格的使用次数和时长限制,表明其背后的高速算力资源仍是稀缺的。其在真实世界复杂多任务并发场景下的性能表现,还有待更大规模的实践检验。
小米MiMo-V2.5-Pro的UltraSpeed模式无疑是AI推理工程领域的一次重要突破。它不仅展示了通过模型与系统深度协同优化所能达到的惊人效果,也预示着大模型行业的竞争正从单纯的参数规模和能力比拼,转向模型能力、推理速度与成本效率并重的多维度竞争。那个大模型不再“一字一顿”说话的未来,正加速到来。
一共呕吐家里
校验提示文案
多出爆文早恰饭
校验提示文案
多出爆文早恰饭
校验提示文案
一共呕吐家里
校验提示文案