小米MiMo-V2.5-Pro UltraSpeed:万亿参数模型跑到 1000 tokens/s
6 月 9 日,小米 MiMo 联合 TileRT 发布了 MiMo-V2.5-Pro 的 UltraSpeed 模式。万亿参数模型在通用 GPU 上跑到了 1000 tokens/s。
这不是靠专用加速器硬堆算力。小米的说法是"模型与系统的极致 Codesign"——从模型架构到系统软件做联合优化,单台 8 卡的标准商用节点就能跑出这个速度。
十倍速度,三倍价格
UltraSpeed API 已经上线,定价是标准 Pro 版的 3 倍。MiMo-V2.5-Pro 的标准价格:
输入(缓存命中):¥0.025/百万 tokens
输入(缓存未命中):¥3/百万 tokens
输出:¥6/百万 tokens
3 倍后输出约 ¥18/百万 tokens。如果你的场景对延迟敏感,这个溢价可以接受。
官方喊的是"3 倍价格,10 倍输出体验"。不适用 Token Plan,仅限 API。
体验门槛不低
UltraSpeed 采用申请制,只开放两周:6 月 9 日到 6 月 23 日。通过后可以限时免费试用 Chat,但限制不少:
每账号每天最多进队 10 次
单次会话上限 30 分钟
空闲超 5 分钟自动释放
图片背后:MiMo 这一年
MiMo 是小米的大模型系列,演进速度不慢:
2025 年 12 月
:MiMo-V2-Flash 发布,150 tokens/s
2026 年 3 月
:MiMo-V2-Pro 发布,Agent 能力进入全球第一梯队
2026 年 4 月
:MiMo-V2.5-Pro 发布,1.02T 参数 MoE,42B 激活参数,100 万上下文窗口,MIT 协议全量开源
2026 年 6 月
:UltraSpeed 模式,1000 tokens/s
配合 TileRT 的推理优化,这个速度在国产模型里算快的。
值得关注的点
1000 tokens/s 是什么概念?每秒大概 700 个汉字。10 秒做个贪吃蛇,1 分钟复刻一个 macOS 界面。用在 Agent 场景里,响应从"等一下"变成"马上"。
不过目前用得上的人很少——两周窗口、申请制、每日限额。小米说是"资源供给有限",但也不排除 UltraSpeed 在生产环境下的稳定性和成本还没完全跑通。
如果这波内测验证了 Codesign 路线,后续降价和正式上线是可以预期的。到时候最难受的,大概是那些还在靠堆硬件来提速的。

aut22
校验提示文案
泪骑蜗牛狂奔
校验提示文案
值友1260962422
校验提示文案
值友2627922348
校验提示文案
泪骑蜗牛狂奔
校验提示文案
值友2627922348
校验提示文案
aut22
校验提示文案
值友1260962422
校验提示文案