小米MiMo-V2.5-Pro UltraSpeed:万亿参数模型跑到 1000 tokens/s

2026-06-10 11:28:04 0点赞 3收藏 4评论

6 月 9 日,小米 MiMo 联合 TileRT 发布了 MiMo-V2.5-Pro 的 UltraSpeed 模式。万亿参数模型在通用 GPU 上跑到了 1000 tokens/s。

这不是靠专用加速器硬堆算力。小米的说法是"模型与系统的极致 Codesign"——从模型架构到系统软件做联合优化,单台 8 卡的标准商用节点就能跑出这个速度。

十倍速度,三倍价格

UltraSpeed API 已经上线,定价是标准 Pro 版的 3 倍。MiMo-V2.5-Pro 的标准价格:

  • 输入(缓存命中):¥0.025/百万 tokens

  • 输入(缓存未命中):¥3/百万 tokens

  • 输出:¥6/百万 tokens

3 倍后输出约 ¥18/百万 tokens。如果你的场景对延迟敏感,这个溢价可以接受。

官方喊的是"3 倍价格,10 倍输出体验"。不适用 Token Plan,仅限 API。

体验门槛不低

UltraSpeed 采用申请制,只开放两周:6 月 9 日到 6 月 23 日。通过后可以限时免费试用 Chat,但限制不少:

  • 每账号每天最多进队 10 次

  • 单次会话上限 30 分钟

  • 空闲超 5 分钟自动释放

图片图片

背后:MiMo 这一年

MiMo 是小米的大模型系列,演进速度不慢:

  • 2025 年 12 月

    :MiMo-V2-Flash 发布,150 tokens/s

  • 2026 年 3 月

    :MiMo-V2-Pro 发布,Agent 能力进入全球第一梯队

  • 2026 年 4 月

    :MiMo-V2.5-Pro 发布,1.02T 参数 MoE,42B 激活参数,100 万上下文窗口,MIT 协议全量开源

  • 2026 年 6 月

    :UltraSpeed 模式,1000 tokens/s

配合 TileRT 的推理优化,这个速度在国产模型里算快的。

值得关注的点

1000 tokens/s 是什么概念?每秒大概 700 个汉字。10 秒做个贪吃蛇,1 分钟复刻一个 macOS 界面。用在 Agent 场景里,响应从"等一下"变成"马上"。

不过目前用得上的人很少——两周窗口、申请制、每日限额。小米说是"资源供给有限",但也不排除 UltraSpeed 在生产环境下的稳定性和成本还没完全跑通。

如果这波内测验证了 Codesign 路线,后续降价和正式上线是可以预期的。到时候最难受的,大概是那些还在靠堆硬件来提速的。

展开 收起
4评论

  • 精彩
  • 最新
  • 估计是技术储备以后给具身智能用的,写代码用不着这么快

    校验提示文案

    提交
  • 喜欢

    校验提示文案

    提交
  • 性价比高

    校验提示文案

    提交
  • 性价比高

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
3
扫一下,分享更方便,购买更轻松