如果你这两天刷过任何一个科技社区,大概率已经被"斩杀线"三个字糊过脸:9月22日,小米发布并开源MiMo-V2.6系列模型,在Artificial Analysis综合智能指数上拿到46分,相比上一代MiMo-V2.5-Pro的26分直接提升了20分,超过Kimi K3、Qwen3.8-Max和GLM-5.3,成为该榜单得分最高的开源权重模型,成绩与同期发布的Grok 4.7持平。微博上"我米NB,新的斩杀线"一条帖子赞冲到一千多,B站评测视频两天播放破15万,知乎相关问题浏览量破百万,连"罗圣"这个梗都出来了。知乎新浪微博
但刷屏归刷屏,真正用AI干活的人关心的其实是三个很实际的问题:这个"开源第一"含金量到底多少?要不要把手头的API换掉?以及——为什么好几个实测up主测完都在夸完分数之后转头开骂?
我把36氪的发布稿、知乎技术派的拆解、B站实测党的视频和评论区翻了一遍,把这三件事一次说清。
一、先看真本事:46分意味着什么,347万美元烧出了什么
先给结论:这次不是营销,提升是实打实的一代跳变。上一代MiMo-V2.5-Pro在同榜只拿26分,这一代直接拉到46分上下,涨了20分。这个跨度放在动辄零点几分挤牙膏的榜单生态里,属于换挡级别的。拆开看几个关键基准:DeepSWE v1.1(真实软件工程)71.9分,接近DeepSeek V4.1 Flash的74.2、Claude Opus 5和GPT6 Astra的74.0,开源模型第一次在硬核编程榜上贴住闭源第一梯队;Toolathlon-verified(工具调用)76.9分,高于GPT5.6 Sol的74.9;JobBench(真实职业任务)62.0分,仅次于Claude Opus 5的65.7。36氪
比分数更值得说的是这次训练本身的透明度。小米把一场持续近6天的强化学习训练全程直播公开:两个模型各跑30个RL step,各产生约75万条训练轨迹,成本分别约85万美元和262万美元——合计约347万美元,直播时被网友算出"1秒烧10美元"。训练曲线、奖励机制、任务配比、成本构成全部写进了技术报告,还开放了约7000个RL任务环境、验证器、端到端训练框架,外加一个从Qwen3.5-9B蒸馏来的9B小模型,给算力有限的研究者复现用。36氪
罗福莉发帖说这次的研究创新和工程难度"超过我曾部分参与的DeepSeek R1",按算力投入衡量"很可能是开源模型团队迄今规模最大的单次RL训练之一"。这话有PR成分,但训练过程全公开,社区是拿放大镜看过的,目前没有翻车实锤。36氪

二、但"开源第一"前面有三个限定词,刷屏帖不会告诉你
第一个限定词:开源第一,不是全球第一。雷军自己的说法就很克制:MiMo2.6在AA智能指数上开源模型第一、所有模型排名并列第六。具体到单项,MiMo-V2.6-Pro在TerminalBench 4.0只有34.9分,而GPT6 Astra是59.6、Claude Fable 5.1是55.1,差距肉眼可见;多项网络安全评测也整体落后头部闭源模型;网页与可视化生成上,GPT6 Astra的82.2分对比MiMo的72.3,仍隔着一档。你的活儿如果是长时间终端操作、安全攻防,它现在替代不了顶配闭源。新浪微博36氪

第二个限定词:综合指数是平均值。46分是把强项和弱项摊平的结果,单项上它有超GPT5.6 Sol的工具调用,也有排不进第一梯队的终端任务。拿它当"全面超越"讲的自媒体,可以直接划走。
第三个限定词:单价便宜,token量翻倍了。知乎技术博主拆解指出,V2.6推理输出token(含思考过程)比V2.5翻了一倍。单价低不等于账单低,这笔账下面细算。知乎
三、最大的隐藏变量:harness——同一个模型,换个壳结论完全不同
这是我这次翻评论区最大的收获,也是所有发布稿都没写的部分。B站up主@kate人不错 发了个标题很拧巴的视频:《我是不是低估了MiMo-V2.6-Pro?听劝换harness后,我重新测了一遍》,播放2.3万。事情是这样的:他第一遍用小米自家的MiMoDesktop测,成绩平平;换成第三方工具链重测,结论直接反转。哔哩哔哩
评论区直接把原因捅破了,高赞评论一个比一个扎心:“怪了,他在自己客户端不思考,来zcode就会雷霆大思考”;“专武纯粹是副优化”“自家harness投毒,也是没谁了”;“Mimo Desktop的团队纯内鬼……内测的时候连智能体并行的文件修改权限都弄不明白,loop一直卡死”。翻译成人话:模型本体确实是第一梯队,但小米自家桌面端MiMoDesktop(这次刚结束内测转正)配套的工具链拖了后腿,同一个模型换到别的壳里表现明显更好。另一位实测up主的标题更直接:《测试过程最痛苦的模型之二》。知乎上也有人网页实测动态SVG,第一版渲染直接报错。哔哩哔哩哔哩哔哩知乎
所以你的真实体验等于模型分数乘以工具链适配度,后者是所有刷屏帖都不会告诉你的隐藏变量。
四、钱的账:单价、token量、缓存命中,三笔一起算
先把价格表摆出来(元/百万token,官方定价):
版本 | 缓存命中输入 | 普通输入 | 输出 |
|---|---|---|---|
MiMo-V2.6-Flash | 0.02 | 1 | 2 |
MiMo-V2.6-Pro | 0.025 | 3 | 6 |
Pro-UltraSpeed | 0.25 | 30 | 60 |
几个参照:评论区开发者对比,DeepSeek V4.1 Flash是0.02/1/4,MiMo Flash输出端便宜一半;小米官方称同等智能水平下价格为海外模型的1/20至1/60。按Artificial Analysis跑评测任务的实际消耗算,MiMo-V2.6-Pro平均每个任务0.13美元,约为DeepSeek V4.1 Flash(0.27美元)的一半。36氪知乎

但换模型之前,三笔账要一起算:
token量账。 V2.6输出token翻倍,意味着长链路agent任务的实际花费要在单价基础上打个折扣再比较——省一半单价,多花一倍token,可能打个平手。
缓存命中账。 评论区有金融投研用户的实测结论是,买token plan之后缓存命中能到95%以上,日常使用很耐蹬。多轮对话和agent场景里,命中率高低直接决定你按0.02元那列还是按1元那列付费,差距是50倍。哔哩哔哩
速度账。 Pro-UltraSpeed最高20倍输出速度,但价格是普通Pro的10倍。只有交互式编码、实时演示这类对延迟极度敏感的场景才值,后台批量跑任务纯属烧钱。
五、三类人,三种做法
如果你是重度开发者、agent玩家:API可以直接切,分数和价格都是真的,但别把MiMoDesktop当主力工具链——评论区实测党的一致建议是"做游戏比DeepSeek强,但不要用他们家的Desktop",等它日更稳定一两个月再说。
如果你是普通用户:不用急着折腾API和token plan。MiMo-V2.6已上线小米AI Studio等平台可以直接体验,小米的手机、车机生态迟早会跟上这代模型。顺带说个真实好评样本:有金融投研用户在WorkBuddy里"蹬了一天",结论是"2.6相较于2.5属于质变,复杂任务完成度和准确性好了很多"——重度垂直场景的人已经用脚投票了。哔哩哔哩
如果你在观望:盯三个信号。一是MiMo-V3——9月23日罗福莉已经公布了新进展,V3将采用全新架构,核心技术HySparse2主打预填充更少、KV缓存更小、长文本检索更强,在100万token长度下预填充计算量降低5倍以上,这一代如果不急可以等下一代。二是MiMoDesktop的更新频率和死循环修复进度。三是Grok 4.7的第三方横评——目前初步评测普遍是"价格可以,能力一般",等更充分的对比数据出来再下结论。新浪微博哔哩哔哩
最后说句实在的。这波发布里最值钱的可能不是46分,而是小米把347万美元的训练过程、成本和7000个任务环境全开源了——开源社区拿到的不只是鱼,还有渔。下次再被"斩杀线""封神"刷屏的时候,建议先问三个问题:分数是什么口径?短板在哪一项?用什么harness测的?问完这三个,你就是评论区最清醒的人。