小米MiMo冲到1000TPS,AI助手终于少等一会
如果你平时用代码助手、办公 AI、手机语音助手,小米 MiMo 这次 1000 TPS 有必要留意。6月9日公开的 MiMo-V2.5-Pro UltraSpeed,在 1T 参数模型、单台 8 卡通用 GPU 节点上,做到每秒约 1000 个 token,演示峰值还能到 1200 左右。
它离普通消费者掏钱下单还远,但和日常体验关系很近。你让 AI 写文案、改代码、生成页面原型,或者让车机和家居设备听懂一句话,等待时间都会影响你还愿不愿意继续用。小米这次的看点,不在参数名字有多热闹,落在 AI 助手能不能少让人干等。

买不买先放一边,响应速度更影响体验
普通人看大模型,容易被一串缩写绕晕。1T、MoE、FP4、DFlash、TileRT,放在一起像工程师菜单。
换到使用场景里,判断非常简单。你发出指令以后,它能不能快点给结果。
智能音箱晚两秒关灯,你会烦。车机晚两秒执行空调指令,你会觉得不可靠。代码助手补一个函数,等太久就会打断思路。办公 AI 写摘要、做表格、改邮件,如果每次都让人盯着光标发呆,工具吸引力会迅速下降。

提速方式,可以用大白话理解
小米公开材料里提到三条路线,FP4、DFlash、TileRT。
FP4 可以理解成给模型做压缩,尤其是压 MoE 里的专家层,让它少占资源。DFlash 像让一个轻量助手先打草稿,大模型不再一个 token 一个 token 确认,而是成块检查。TileRT 负责压短 GPU 执行过程里的交接空档。
这三件事叠起来,才有了这次的速度数字。它比较打动我的地方,是小米没有把提速全押在专用硬件上,也没有只靠缩小模型来换响应。

开发者和重度AI用户会先有体感
从现阶段看,最容易感受到 UltraSpeed 的人,大概率是开发者和重度 AI 工具用户。
公开演示里有 10 秒生成贪吃蛇、1 分钟复刻 MacOS 界面这类案例。前端原型、小游戏、脚本、插件,这些任务对生成速度很敏感。模型快一点,开发者就能更愿意反复试,错了立刻改,对了继续加功能。
办公场景也会受益。写邮件、做摘要、改方案,这些任务本身不一定很难,但频次高。每次少等几秒,一天下来体感会很明显。

普通用户现在不用为速度焦虑
这次 UltraSpeed 更像一次限时能力展示和开发者入口。
小米公开页面写到,UltraSpeed API 采用限时申请方式,试用窗口是 2026年6月9日到6月23日,API 价格是 MiMo-V2.5-Pro 的 3 倍,但给出约 10 倍生成速度的体验说法。免费 Chat 体验也有排队和会话时长限制。
所以我的建议很直接。如果你只是普通聊天、偶尔写点文案,没必要为了这个速度焦虑。标准模型、其他常用 AI 服务已经能覆盖很多轻需求。如果你是开发者,或者手里有代码生成、批量内容、内部工具、客服助手这类高频任务,那 UltraSpeed 值得申请体验。

体验时重点看连续多轮表现
如果你能拿到体验资格,我会优先看四个地方。
第一,看连续多轮生成会不会降速。很多模型开头很快,越聊越慢,长上下文一上来体验就掉。第二,看代码和自然语言的速度差异,自己常用什么就看什么。第三,看回答质量有没有被速度拖累,快错了会让人返工更烦。第四,看工具调用能不能跟上。如果模型吐字很快,调用文件、插件、设备时还是卡,整体体验依旧会被拖住。
对小米来说,后面更重要的是把这套能力放进手机、车机、智能家居和开发工具里。1000 TPS 写在页面上很漂亮,用户手边少等几秒,才会让人愿意每天打开。
