小米MiMo-V2.6凌晨开源:46分是"开源第一"不是"闭源平替"——跑分、成本、实测三本账对完再切工作流

源自136位全网作者

07:03

今天凌晨(9月22日),大模型圈又是一场连夜蹲守:小米 MiMo 团队发布并开源了 MiMo-V2.6 系列,几小时后马斯克的 Grok 4.7 也同日交卷——更戏剧的是,两个分属开源和闭源阵营的模型,在 Artificial Analysis 综合智能指数上拿到了相同的 46 分,单任务成本却差了近 29 倍。微博36氪

如果你是天天把模型接进 Agent、写代码、跑工作流的重度用户,这一波真正的纠结点不是"小米牛不牛",而是三个非常具体的问题:46 分到底是什么口径?便宜是不是真的便宜?社区实测为什么吵成一团?这篇文章把三本账一次对完。

第一本账:46 分是"开源第一",不是"闭源平替"

先说清楚这 46 分是哪来的。小米引用的是 Artificial Analysis 综合智能指数 v4.3.2,MiMo-V2.6-Pro 拿到 46.32 分,超过 Kimi K3、Qwen3.8 Max 和 GLM-5.3,登顶开源权重模型榜,也是国产模型第一;相比前代 MiMo-V2.5-Pro 的 26 分,一轮训练直接提了 20 分。放在全榜看,它是第六名,前面还有 53 分档的 Claude Fable 5.1 和 GPT-6 Astra。微博36氪哔哩哔哩

小米MiMo-V2.6凌晨开源:46分是

注意三个容易误读的地方:

  1. 同分的 Grok 4.7 是"xhigh"档。综合指数 46 分是总分口径,分项上各家有强有弱,"跑分和马斯克一样"是热搜句式,不是能力画等号。微博

  2. 分项不是全面领先。小米自己公布的数据里就有输的项:ProgramBench 上 Pro 拿 26.5 分,低于 Claude Opus 5 的 37 分;TerminalBench 4.0 拿 34.9 分,低于 Claude Opus 5 的 49 分;Toolathlon-Verified、GDPval-AA 2.1 也不是最高。赢面集中在 DeepSWE v1.1(71.9 分,上一代只有 19 分)、TerminalBench 2.1(89.9 分)、OSWorld-Verified(82 分)和 AutomationBench v1.0.6(53.1 分,高于官方对比表里的 Claude Opus 5、GPT-5.6 Sol 和 Claude Fable 5)。36氪

小米MiMo-V2.6凌晨开源:46分是

  1. "全模态"指输入侧。两款模型原生支持文本、图像、视频、音频输入,统一编码成同一序列处理,最长 100 万 token 上下文——是"看得多",不是"什么都会"。36氪

一句话总结第一本账:长程软件工程和 Agent 任务是真的强,部分编程细分项还差闭源旗舰一截,“开源第一"这个标签本身没水分,但别脑补成"闭源可以退订了”。

小米MiMo-V2.6凌晨开源:46分是

第二本账:便宜的秘密不是单价,是"话少 + 快"

成本这本账最有意思,因为它反直觉。

先看单价:MiMo-V2.6 的 API 定价和 V2.5 系列一致,输入约 0.43 美元/百万 token。 说实话,单看输入单价它并不算最便宜的,甚至比一些国产模型贵。微博36氪

小米MiMo-V2.6凌晨开源:46分是

但 AA 的成本口径算的是"干完一件事花多少钱":MiMo-V2.6-Pro 每项智能指数任务成本 0.13 美元,整场评估跑下来 206.66 美元;Grok 4.7(xhigh)每项任务 3.74 美元,整场 4967.35 美元,差了近 29 倍。 按 AA 数据,Claude 单任务成本 7.63 美元,MiMo 是它的约 1/57。36氪哔哩哔哩

输入单价更贵、总账反而最省,原因主要两个:一是 Grok 4.7 在评估中生成了 2.4 亿个 token(中位数是 9400 万),"话多"直接烧钱;二是 MiMo 的速度,AA 测得约 125 token/秒,约为 Claude 的两倍。36氪

另外还有个为高实时场景准备的 MiMo-V2.6-Pro-UltraSpeed,官方称输出速度最高是标准 Pro 的 20 倍,B站 UP 主实测 token 速度大概在 300~400 t/s。 对需要模型"多跑几轮"的自动化客服、批量代码审查这类高频场景,这个成本结构是实打实的降价。36氪哔哩哔哩

所以挑模型时别只看单价牌,看"干完一件事的总账"——这是这次发布最值得带走的一个挑模型方法。

第三本账:社区实测吵成一团,关键变量是 harness

模型发布不到 24 小时,B站的实测视频已经刷屏,但结论严重分裂,我把分歧点整理成三组:

分歧一:官方桌面端反而拖后腿。 有 UP 主用官方 MiMo Desktop 测鹈鹕骑 SVG,跑了一个半小时,转弯衔接、扶车把这些细节全有问题;听劝换成其他 harness 重测同样的案例,场景细节、材质和动画明显改善——评论区直接刷起"专武不如别人家 harness""自家 harness 投毒"的调侃,官方也回应了 MiMo Desktop 的死循环和性能问题在修。 有人用 Claude Code 接 MiMo-2.6 测同样的鹈鹕题,表现明显更好,"专武拖后腿"直接成了社区热梗。 也就是说,你看到的差评里,有一部分是桌面客户端的锅,不是模型的锅。哔哩哔哩哔哩哔哩哔哩哔哩

分歧二:Flash 可能比 Pro 好用。 同一批实测里,Flash 版的鹈鹕骑车整体优于 Pro(转弯顺滑、知道扶车把),3D 赛车完成度上乘,有 UP 主直接说"怀疑小米发布错模型了"。 Flash 总参数 3090 亿、激活约 150 亿,只有 Pro 的三分之一体量,成本更低——对轻量场景,先试 Flash 再上 Pro 是更划算的路径。哔哩哔哩36氪

分歧三:慢和敏感。 有前端 one-shot 实测里 MiMo Pro 用了 1 小时 12 分,而 DeepSeek 4.1 flash 用 31 分钟、Step5 用 24 分钟就交卷。 还有用户做游戏时频繁撞上内容审核,“敏感肌"问题在国内模型里依然存在。但也有正面案例:有金融投研用户在 Agent 工作流里蹬了一整天,结论是"2.6 相比 2.5 属于质变,复杂任务完成度和准确性好了很多”,配合高缓存命中率,“很耐蹬”。哔哩哔哩哔哩哔哩

347 万美元买来的到底是什么

这次发布真正值得行业记住的,不是参数(Pro 总参数 1.02 万亿、激活约 420 亿),而是小米把一场大规模强化学习训练全程公开直播了:6 天、30 步、两款模型各处理约 75 万条轨迹,账单 347 万美元,训练曲线、任务通过率、基础设施故障谁都能围观。36氪

小米MiMo-V2.6凌晨开源:46分是

技术上也没有单点魔法,就是混合任务同训(编程、通用智能体、视觉、网络安全)、组内比较奖励(区分"都做对了但谁路径更短")、外加冻结 MoE Router 防专家漂移这一整套工程。36氪

罗福莉称之为"探索 RSI(递归自我改进)的一步"——但注意口径:这里的"自我改进"发生在人类设计的训练闭环里,不等于模型能自己启动下一轮训练。36氪

顺带一提,这次同步开源的不只是权重(MIT 许可证),还有 7K+ 任务环境、端到端 RL 框架和轻量化 Agent 框架,甚至有一个从 Qwen 架构蒸馏的 9B 小模型,已经有 UP 主在消费级显卡上本地跑通了。 训练环境能否被独立复现,是接下来最值得盯的验证点。微博36氪哔哩哔哩

谁该现在切,谁该再等等

  • 重 Agent、长程代码任务、预算敏感的开发者:现在就值得切。DeepSWE 71.9 分加单任务 0.13 美元的组合,在开源里目前没有对手,本地部署党直接上 HuggingFace。

  • 轻量场景用户:先试 Flash,够用就别上 Pro,实测里 Flash 的交付感不输甚至更好。

  • 依赖桌面客户端的普通用户:等 MiMo Desktop 修完再说,现在它是最短的板。

  • 闭源旗舰重度依赖者:分项差距(ProgramBench、TerminalBench 4.0)还在,别急着全量迁移,可以先在批量、高频、成本敏感的环节做分流。

  • 所有人:记两个后续信号——Grok 4.8 马斯克预告本周完成预训练(2.5 万亿参数、新 C++ 训练栈),以及小米这套 RL 训练环境会不会被第三方独立复现。 这两个信号任何一个落地,榜单格局都可能重排。36氪

国产开源模型已经占了全球下载量的 41%、OpenRouter 前六全是国产,MiMo-V2.6 又把开源天花板从 26 分顶到 46 分。 但对你自己的工作流来说,46 分只是入场券——真正决定要不要切的,永远是上面这三本账。微博哔哩哔哩

内容由AI生成

精选参考来源

1. MiMoV2.6跑分和马斯克Grok一样

2. 罗福莉和马斯克同日正面交锋:相同跑分,成本却差 29 倍

3. 【兴证通信】AI日报20260922:小米凌晨发布并开源MiMo-V2.6系列

4. 小米MiMo-V2.6干到开源第一:46分,一道题0.13美元

5. 罗福莉押注大规模RL、小米最强开源模型亮相:6天烧掉2000多万,多个 Agent 基准比肩闭源旗舰

6. MiMo-V2.6正式开源!Pro版本46分登顶Artificial Analysis

7. 小米MiMo2.6实测:开源权重模型第一,成本只有Claude的1/57

8. MimoV2.6实测!竟吊打所有开源模型?!

9. Mimo2.6Pro测评报告!结果可能不是你想要的!

10. 我是不是低估了MiMo-V2.6-Pro?听劝换harness后,我重新测了一遍

11. mimov2.6鹈鹕测试和DeepSeek对比

12. Mimo2.6Flash测评报告!怀疑小米发布错模型了!

13. 【模型测评】Mimo2.6Pro vs DeepSeek4.1F vs Step5:前端oneshot实测

14. 小米开源MiMoV2.6性能测试和AMD本地实战!小内存卡也能跑

15. 小米MiMo-V2.6用347万美元干了件大事:不靠堆算力,只靠强化学习

16. 小米MiMoV2.6登顶开源第一:强化学习的暴力美学深度拆解

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章