这几天AI圈出了件新鲜事:别人家训模型捂得严严实实,小米直接把训练过程挂到网上"直播"了。
9月15日晚,小米新一代自研大模型MiMo-V2.6的Pro和Flash两条训练线先后启动。17日凌晨,小米大模型负责人罗福莉把围观地址发到了X上,配文"沉寂了近半年"——过去半年她的团队一直在研究一个问题:强化学习到底能扩展到什么程度。这个网页上能看到实时跳动的累计花费、每轮消耗的token、阶段性测试成绩,甚至训练出了什么故障。有知乎答主第一反应是:"卧槽,现在生产级的大模型居然直播训练???"那条问题下已经聚了113万次浏览。36氪知乎知乎
截至今天(9月20日),最新进展是:Flash版的这轮强化学习已经收官,直播页显示stopped,总账85.4万美元;Pro还在跑。罗福莉预告,未来几周会逐步开源相关细节,但模型本身还没发布。知乎

热闹归热闹,这波直播里哪些信息是真的硬、哪些要打个折听,我把它拆成四本账,你对完再决定要不要跟着喊"小米AI站起来了"。
第一本账:成绩账——"超claude-opus-4.8"能信几成
先看最刺激的。直播页公开了一项叫DeepSWE v1.1的软件开发测试——让模型在真实开源项目里加功能、修bug,新代码还得不能改坏原有功能。9月17日的中途成绩:Pro通过率65.78%,Flash 60.77%,知乎有分析认为Pro这个分数大概和Gemini-3.7-Flash一个档位。36氪知乎
到9月20日Flash收官时,它的DeepSWE分数停在65.68。有知乎答主把它放进公开榜对比,大约能排到第十一、十二位,超过了claude-opus-4.8和deepseek-v4-flash——考虑到Flash只是个310B总参数、15B激活的轻量模型,这个成绩确实值得高看一眼。知乎

但先别急着转发,三个折扣必须打在前面:
一是这是训练中途采集的分数,直播页的stopped不等于训练全部完成,模型也没正式发布,罗福莉自己说的口径是"未来几周逐步开源细节"。二是从曲线看,Flash在step 18之后一直在60到66之间震荡,没有向上突破的迹象,社区判断在不加容量的情况下这基本就是它的天花板了。三是另一项AutomationBench测试里Flash跑出了52.70%、反而超过了Pro,听着更猛,但这个基准分公开集和私有集两套榜单(公开集最强的Claude Opus 5也只有50.3%,私有集第一只有41.4%),小米没说明跑的是哪套,所以这个分数没法和外界直接比,只能看个"Flash不低于Pro"的内部相对关系。知乎
一句话总结成绩账:方向是真进步,幅度要等正式发布才能下结论。谁现在拿"超Claude"当定论喊,谁就是在替小米提前开香槟。
第二本账:成本账——行业第一次把前沿RL明码标价
这可能是这次直播对行业最值钱的部分。大模型训练烧钱人人都知道,但到底怎么个烧法,从来没有厂商摊开给全网看过。这次页面上全有:
按36氪9月17日下午的记录,Pro跑了45个多小时花了约93万美元,折合每小时2万美元上下;Flash跑了约40个半小时花了约41.6万美元,每小时约1万美元。两条线并着跑,合计就是每小时约3万美元、折合人民币21万元——这就是"一小时烧掉一辆Model 3"的出处。到9月20日,知乎问题下的口径是累计成本已超过200万美元。36氪知乎
Flash收官后,社区把它的总账拆得明明白白:85.4万美元,81.4B token,75.3万个样本,历时3天11小时。再往细里看,每一个训练step要过1568条prompt,每条做16次尝试,合计25088条轨迹,单step消耗20到30亿token。数据配比也公开了:代码类占67.7%,视觉13.1%,通用12.1%,网络安全4.1%,纯对话只有3.0%——重心明摆着押在Agent和编码能力上。为什么这么押?罗福莉此前解释过:软件开发需要连续处理很多问题,练出来的规划能力和上下文管理方法,能迁移到其他复杂任务上。知乎36氪知乎

有知乎答主顺手算了笔单价:MiMo-V2.6 Pro的训练成本约合36美元/百万token,“这可是宝贵数据,看看模型厂商的成本”。还有评论点破了一层窗户纸:公开成本,可能也是在为新模型定价做铺垫——毕竟小米V2.5系列5月底刚经历过一轮大降价,实测缓存命中高的话比DeepSeek还便宜。如果V2.6延续这个打法,受益的就是所有拿API干活的开发者。知乎知乎
第三本账:故障账——最圈粉的居然是两条重启公告
这次直播最反常识的地方,是小米连"翻车"都直播了。
页面顶部挂着故障通报:Pro因为一个计算节点出现显存问题(也就是GPU OOM)需要重启;Flash在一组数据上遇到基础设施错误,约3小时没能正确识别,最后回退到第15步重新来过。平时大家看到的模型发布,都是一份整理好的成绩单,训练里出过什么岔子、重来过几次,外界根本没机会知道。这次分数上涨和故障重启同时挂在同一个页面上,知乎有人评价"小米这一波真大方"。36氪知乎

懂行的围观群众也真来了。Meta研究员、前OpenAI研究员Lucas Beyer一边调侃罗福莉说的扩大训练规模三个方向其实是"算力、算力,还是算力",一边专门点赞:小米居然连"目前花了多少钱"都公开。加州大学圣迭戈分校的强化学习研究者Yu-Xiang Wang说自己"看得移不开眼",还提了个要求:希望团队把训练中遇到的问题记录下来——那几条重启公告恰好就是他想要的。曾任康奈尔教授、参与过Cursor模型研发的Sasha Rush也拿着手机盯直播,自嘲看一项编程任务的响应长度"看出了赌徒上头的感觉"。36氪
从3月让匿名模型Hunter Alpha混上OpenRouter"猜猜我是谁",到这次直接把后训练Dashboard敞开,小米在AI上的传播路数越来越清晰:不憋大招式发布,改用过程透明换信任。你说这是营销,它确实是营销;但敢把GPU OOM写进公告的营销,门槛比开发布会喊跑分高多了——成绩可以挑着发,故障通报造不了假。36氪
第四本账:落地账——这事跟你买小米设备有什么关系
如果只是AI圈的行为艺术,值得看但不值得你我上心。关键在小米的身份:它是个"人车家全生态"厂商。
把时间线拉长看:去年12月MiMo大模型首发;今年4月V2.5系列发布并开源;5月底API大降价;7月15日小米官宣MiMo端侧模型通过国家大模型备案,同时给出一个数字——2026年小米将在AI领域投入160亿元,AI、芯片、OS被列为三大长期技术赛道,MiMo要通过端云协同"全面赋能人车家全生态"。8月,V2.5登上OpenRouter全球调用量第一,央视《经济半小时》探访了MiMo团队。而就在这几天,小米18 Pro系列官宣9月23日发布、首发搭载澎湃OS 4。微博微博
也就是说,你在小米手机上用的小爱、在车里用的语音助手、澎湃OS 4里的AI功能,底层能力将越来越取决于MiMo这条线的成色。这次直播等于把"小米AI到底有没有真东西"这个问题,从口水战变成了可以围观的数据。当然也要留一分清醒:榜单分数不等于端上体验,模型塞进手机、汽车之后响应快不快、好不好用,得等设备端实测说话——去年V2.5"调用量全球第一"的时候,知乎照样有高赞回答说"绝大部分人根本听都没听说过这个小米大模型"。知乎
对完之后,三类人怎么接
开发者/AI工具党:现在就能动手。V2.5系列API经过5月降价已是市场地板价,缓存命中高的场景实测比DeepSeek还便宜,拿来跑任务不心疼。V2.6等两个节点:正式发布时的官方基准口径,以及API定价是否延续低价策略。罗福莉承诺的"未来几周开源细节"值得加个关注——如果连RL训练配方都开出来,V2.5时代"发布即开源"的传统大概率会延续。

米粉/生态用户:这波直播是你对"小米AI"重新校准预期的最好窗口。方向上可以放心——训练重心押在Agent和编码,说明小米想要的是能连续干活的AI,不是聊天玩具;但别被中途分数带了节奏,真正的验收节点是V2.6正式发布,以及它落进澎湃OS 4和小爱同学之后的设备端实测。
纯围观群众:记住两个谈资就够了。一,这是行业第一次有厂商把生产级大模型的强化学习全程挂网上直播,连成本带故障。二,一小时烧3万美元、五天烧掉200多万,AI军备竞赛的价码从此有了实感。
最后留一份观察信号清单,接下来的几周盯这几件事就行:①Pro这轮训练的最终收官成绩和总成本;②开源的具体范围——是只开训练细节,还是连权重一起开;③V2.6正式发布时的官方基准,和这次直播中途分数差多少;④API定价,验证"公开成本是为定价做铺垫"的猜测;⑤9月23日澎湃OS 4发布时,端侧AI功能有没有用上MiMo的新能力。
五件事落定之前,"小米AI到底行不行"这个问题,谁也别急着给终局答案——但至少现在,我们是看着它一笔一笔花钱训出来的,这待遇,全行业独一份。