9月22日,小米凌晨发布并开源了MiMo-V2.6系列;9月24日,小米五天内连发的实测长文刷屏;同一天,GitHub上冒出一个叫mimo-link的小工具,作者开场白就一句:“受够了MiMo Desktop的无限循环。“一边是"46分登顶全球开源第一”,一边是买完订阅的用户吐槽"一直死循环流口水”,这两件事都是真的。这篇不复述发布会通稿,就把充值、买订阅、等V3这三个真实纠结拆开算一遍。
一、先盘清楚:这周到底发了什么、开源到什么程度
MiMo-V2.6是三个版本的组合:全模态旗舰Pro(总参数1.02T、激活约42B,文本、图片、视频、音频四种输入都能吃,上下文拉到1,048,576 token)、高效推理版Flash(总参数309B、激活约15B)、以及Pro的超高速模式UltraSpeed(官方称输出速度最高达Pro的20倍)。三档全部原生全模态、全部支持1M上下文。微博知乎
开源的诚意确实罕见:不只MIT协议放出全量权重,技术报告、训练代码、强化学习环境与研究资源一起放,还附送一个MiMo-V2.6-Distill-Qwen-9B蒸馏版,连RL后训练都是9月19日先直播跑的。公开口径里,这轮强化学习后训练烧了6天、约347万美元;Flash-RL单算约85万美元。微博今日头条
成绩要看细,不能只看"登顶"俩字。第三方平台Artificial Analysis综合智能指数上,Pro拿到46.32分,开源第一、国产第一,上一代V2.5-Pro只有26分——关键是基座没换,还是1.02T那套架构,涨幅几乎全来自后训练,DeepSWE v1.1长程软件工程基准上Pro从58.4涨到72.57、Flash从48.8涨到65.68,Terminal-Bench 4.0在开源模型里排第三(前面还有GLM-5.3和Qwen 3.8 Max)。雷军本人9月22日中午发帖贴出的那张AA柱状图也说得很直白:开源模型第一,所有模型排名并列第六。 它前面那几根更高的柱子,基本还是GPT、Claude这些闭源旗舰。"登顶开源第一"是真的,"可以替代闭源旗舰"目前没有任何一家测评敢签这个字。今日头条微博

二、价格账:为什么这周大家都在问"换不换"
API沿用V2.5定价,小米开放平台的账目大致是:Pro输入约3元/百万token、输出6元,Flash输入1元、输出2元;缓存命中输入低到Pro 0.025元、Flash 0.02元;不着急出结果的批量推理还能再打半折。媒体和测评的横向口径是"同等智能水平下价格为海外同档模型的1/20到1/60"。最扎眼的对照组是:发布同一天Grok 4.7也在AA拿了46分,账单差出约二十倍,而且Grok这代自身速度从60掉到38.8、单任务成本从1.86美元涨到3.74。llm-stats上还有个更狠的数字:MiMo-V2.6-Flash综合分45.6,反超GPT-5.5 Pro的44.8,每token价格便宜385.7倍。今日头条微博知乎

知乎上有开发者实测API直连:TTFT(首字返回)稳定在1秒左右,吐字200 TPS以上,和DeepSeek V4.1 Flash官方一个量级——日常使用速度完全无感。知乎
便宜是真便宜,但便宜本身不是换模型的理由,选错版本才是这轮最容易白烧钱的地方。
三、选型判断:别按榜单选,按"任务失败一次亏多少"选
Pro和Flash名字像亲兄弟,活法完全不同,而目前第三方还没有统一的同门横评基准(benchlm直接标注no shared benchmark verdict),社区还在跑分。能依据的是侧重信号:Pro在长程任务基准DeepSWE上72.57对Flash的65.68,官方也把多模态专业工作流往Pro压;Flash的定位官方写得直白——在智能、效率、成本三者间取最佳平衡。小米技术报告里那张V2.6与上一代、与闭源旗舰的分项对比表,是目前能拿到的最完整的"同题答卷":知乎

所以判断标准就一条:这个任务失败一次,你亏多少。
走量的活给Flash:批量处理、日常问答、跑批、轻量Agent。Agent循环的token消耗是普通对话的几十倍,一天几百万token的任务量,Flash输出2元/百万对Pro的6元/百万,省下来的是真预算;缓存命中率高的重复上下文,0.02元的输入价基本等于白送。知乎
重活长活给Pro:几百页文档一口气读完、整个代码仓库通读后动手改、多轮长任务链。这种活Flash的窗口和成功率装不下,硬塞就是截断返工——返工一次烧掉的token和人力,比Pro贵出来的差价多得多。
强实时交互看UltraSpeed:但注意Pro的"雷霆思考"模式有用户实测反馈响应偏慢,实时场景别默认用Pro裸跑。
四、三个真实翻车点:买之前先看
第一颗雷:MiMo Desktop订阅。 9月23日桌面客户端正式版上线,同步推出会员订阅,官方话术里最亮的是"60倍用量额度",覆盖Office与网页文件生成、图片音乐视频生成剪辑、多任务并行。然后社区口碑很快翻车:知乎有人买了套餐吐槽"一直死循环流口水",mimo-link作者把问题说得更工程化——自带harness太差、模型降智、token用量完全不透明,“总怕哪天直接用爆”。他的解法是开源一个路由器,把Desktop内置的本地llm-server接到Codex/Hermes这些更好用的harness上,项目两天内就挂上了GitHub。注意这个方案自己的坑:Desktop必须保持运行、能力端口随会话漂移、Codex还需要本机做协议转换。一句话结论:同样的模型,API直连比订阅桌面端稳;冲着"入口"买会员,你买到的可能是这个harness。知乎
第二颗雷:免费额度撑不过一个长任务。 知乎开发者9月28日刚发的实测:用OpenCode+MiMo-V2.6-Flash跑两个耗时数小时的真实工程任务,主要需求都以可接受成本完成、人工测试无功能性问题,但免费额度在长任务中途耗尽——繁重任务必须上付费API;而且3轮自动代码审查后仍残留4个minor问题,仍需人工复核(下面这张就是他的任务终报截图)。"扛得住"和"免费扛得住"是两回事。知乎

第三颗雷:本地部署的宣传话术。 MIT全量权重确实人人可下载,"量化后普通消费级显卡也有机会运行"这类说法也在流传,但把账算出来:Flash总参数309B,哪怕按4bit量化,光权重就150GB以上,Pro的万亿参数更是数据中心话题。想在单机上跑的,正经路径是官方那个Distill-Qwen-9B蒸馏版,而不是去量化榜单第一。知乎
五、V3已经预告了,要不要等?
MiMo-V2.6发布才两天,团队负责人罗福莉就预告了V3的核心推理架构HySparse2,论文同步挂上arXiv。数字很针对痛点:百万token成本分析里Prefill计算量降至1/5,KV Cache从12GB压到2.7GB;模型按YOCO思路拆前后两半,49层里Prefill只跑前25层,分离部署时Prefill节点的权重存储接近减半;长文检索MRCR-v2、RULER-v2也有提升。知乎

但两个提醒:其一,5.02倍是计算量口径,不是实测速度,官方自己都还没放出实测;其二,V3没有公布发布时间。判断也很简单——如果你的痛点恰恰是长上下文Agent的缓存和Prefill成本,V3的数字是照着你的账单设计的,值得挂个观察;如果你现在就有活要干,V2.6已经够把活干完,而且API定价沿用前代、权重全开源,换用和退出的沉没成本都很低,为一张期货架构表空转这几周,不值得。
六、按人群收尾:你该做哪一步
纯聊天轻度用户:别碰订阅,免费额度或直接用现成入口,模型再便宜也省不出体感差异。
跑批量/轻Agent的:API直连充小额,默认Flash,能走非实时批就吃半价;缓存命中价低,重复上下文场景成本近乎为零。
改长代码/喂整库的:Pro起步,预算按"失败一次亏多少"留,别按token单价算小账。
想本地折腾的:Distill-Qwen-9B先跑起来,309B和1.02T的显卡账另开计划。
已经买了Desktop会员的:mimo-link这类社区路由方案可以试,但接受"Desktop必须常开、端口会漂"的新麻烦。
接下来盯四个信号就够了:V3官宣时HySparse2的实测速度(而非计算量口径);Desktop是否修好harness并把用量透明化;Pro/Flash统一的第三方横评什么时候出来;以及这轮"同分20倍价差"会不会逼出海外阵营的下一轮降价。榜单第一是小米的,账是本自己的——这一周真正值得抄下来的,不是46分,是那三条选型和避坑的线。