小米MiMo-V2.5-Pro UltraSpeed:万亿参数模型跑到 1000 tokens/s
6 月 9 日,小米 MiMo 联合 TileRT 发布了 MiMo-V2.5-Pro 的 UltraSpeed 模式。万亿参数模型在通用 GPU 上跑到了 1000 tokens/s。
这不是靠专用加速器硬堆算力。小米的说法是"模型与系统的极致 Codesign"——从模型架构到系统软件做联合优化,单台 8 卡的标准商用节点就能跑出这个速度。
十倍速度,三倍价格
UltraSpeed API 已经上线,定价是标准 Pro 版的 3 倍。MiMo-V2.5-Pro 的标准价格:
输入(缓存命中):¥0.025/百万 tokens
输入(缓存未命中):¥3/百万 tokens
输出:¥6/百万 tokens
3 倍后输出约 ¥18/百万 tokens。如果你的场景对延迟敏感,这个溢价可以接受。
官方喊的是"3 倍价格,10 倍输出体验"。不适用 Token Plan,仅限 API。
体验门槛不低
UltraSpeed 采用申请制,只开放两周:6 月 9 日到 6 月 23 日。通过后可以限时免费试用 Chat,但限制不少:
每账号每天最多进队 10 次
单次会话上限 30 分钟
空闲超 5 分钟自动释放
图片背后:MiMo 这一年
MiMo 是小米的大模型系列,演进速度不慢:
2025 年 12 月
:MiMo-V2-Flash 发布,150 tokens/s
2026 年 3 月
:MiMo-V2-Pro 发布,Agent 能力进入全球第一梯队
2026 年 4 月
:MiMo-V2.5-Pro 发布,1.02T 参数 MoE,42B 激活参数,100 万上下文窗口,MIT 协议全量开源
2026 年 6 月
:UltraSpeed 模式,1000 tokens/s
配合 TileRT 的推理优化,这个速度在国产模型里算快的。
值得关注的点
1000 tokens/s 是什么概念?每秒大概 700 个汉字。10 秒做个贪吃蛇,1 分钟复刻一个 macOS 界面。用在 Agent 场景里,响应从"等一下"变成"马上"。
不过目前用得上的人很少——两周窗口、申请制、每日限额。小米说是"资源供给有限",但也不排除 UltraSpeed 在生产环境下的稳定性和成本还没完全跑通。
如果这波内测验证了 Codesign 路线,后续降价和正式上线是可以预期的。到时候最难受的,大概是那些还在靠堆硬件来提速的。

校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案