“AI自己教自己”一周五处冒头:OpenAI被曝让AI写GPU内核、Qwen自称零人参与迭代33轮、Opus 5.5被猜是蒸馏来的——换订阅、改API之前,先分清实锤、推测和自我披露

源自113位全网作者

09-25 10:18

这周刷AI新闻的朋友,大概每隔几小时就要看到一次"AI自己训练自己":一会儿是OpenAI被曝让AI自己写GPU内核,一会儿是阿里在云栖大会上说Qwen零人参与迭代了一个月,一会儿又有人猜刚发布的Opus 5.5根本不是人从头训出来的,是内部"教师模型"蒸馏出来的"压缩版"。配上"奥特曼急发全球暂停令""人类打造的最后一代AI"这种标题,很容易要么上头、要么焦虑。

我的建议是:先把这波刷屏拆成三层——实锤、推测、自我披露——再决定要不要为它换订阅、改工作流或者只是存个谈资。这周的事值得单独写一篇,因为它不是一家的营销,而是OpenAI、Anthropic、阿里、谷歌和国内高校联盟在七天之内,从五个不同方向同时摸到了同一扇门上。

先看这周到底发生了什么

把时间线拉平,五条线其实说的是同一件事。9月6日,OpenAI在官方博客《研究加速:OpenAI内部视角》里自己承认,AI参与AI研发的飞轮已经在内部转起来了,这条在微博上拿到了九百多个赞。 9月17日,谷歌DeepMind放出Dream-RSI论文,让AI通过"回放梦境"——也就是重放自己过去的探索记录——低成本测试新策略,尝试把递归自我改进做成一套可循环的方法。 9月19日,上海交大、清华、上海AI实验室等机构联合发了篇论文,标题直接叫《人类打造的最后一代AI》,给出了一套五级的AI自我进化路线图,最末一级是AI彻底改写自己的升级逻辑。微博微博知乎专栏

9月22日,两件事同日发生。云栖大会上,阿里披露Qwen3.8-Max在人类零参与的情况下自主迭代超过一个月、完成33轮有效迭代,Artificial Analysis评测分数从40提到45,还自主适配了新款GPU、把下一代模型的推理吞吐量提升96%。 同一天,The Information曝出OpenAI内部的模型已经能自己编写GPU内核程序和优化方案,工程师给一个优化示例,AI就能自己跑上几周,原本要几年的实验被压缩到一周。 也是这一天,OpenAI官方发布了一份全球安全倡议,罕见地把RSI单列一节。9月24日,谷歌工程师PatrickCToulme在X上发帖,推测刚发布两天的Opus 5.5是由Anthropic内部更强的教师模型Model2蒸馏而来,可能是首个走通RSI路径的产品模型。知乎专栏36氪36氪

七天,五家,同一个方向。这在以前叫概念,这周开始像路线图了。

第一层:哪些是实锤

AI深度参与AI研发,这层是有多方证据的,而且大多是公司自己承认的。OpenAI的博客自述,加上The Information的曝光,指向同一件事:写GPU内核这种过去要年薪几百万美金的顶尖工程师通宵干的活,现在大部分由模型接手,多智能体之间还能自发协作,不惊动人类。 Anthropic这边更早就给了数字:截至2026年5月,他们代码库里超过80%的代码由Claude撰写,而2025年2月之前这个比例还是个位数;工程师人均每日合并代码量比2024年增长了约8倍;2026年4月,Claude用约800个小时把某类API错误降低了1000倍。36氪36氪

国内这边的对应披露来自阿里:Qwen3.8-Max自己搭建训练流程、自己构造训练数据、自己设计实验并定位缺陷,连续迭代一个月33轮;面对一块它没见过的平头哥新款GPU,自主适配并优化了Qwen3.8-Flash的推理框架;在芯片设计环节只拿到一份总线模块规范,就自主跑完了前端、验证、后端全链路,60多个小时调用EDA工具上万次,把一块生产级芯片模块的面积缩小了42%。知乎专栏

但这里要如实标注:阿里这三个数字全部来自大会上的官方口径,网易科技、赛迪网等媒体当天都做了报道,但第三方复现和独立评测目前还没有跟上。它属于"有官方信源的自我披露",不是"已被独立验证的实锤",这个区别在后面判断时会用到。知乎专栏

第二层:哪些只是推测

Opus 5.5是"教师模型蒸馏娃"这个说法,是这周传播最广、但证据最薄的一环。PatrickCToulme的推理逻辑是:Opus 5.5性能与旗舰Fable 5.1持平、成本却降了40%,这种"又强又便宜"的反常规组合,最合理的解释是它由内部更强的Model2蒸馏而来——小模型继承大模型的能力,推理成本大幅下降。目前没有任何公开证据直接证实这一点,Anthropic的发布文档里对训练方式只字未提。36氪

不过这个猜测也不是空穴来风。Anthropic确实公开确认过内部存在比Mythos5更强的Model2,并被大量用于代码生成、数据生成和代理任务;更微妙的信号是,Anthropic在安全条款里把"蒸馏攻击"单独列为威胁,还在Opus 5.5上专门引入了"保留推理链"这类反蒸馏机制——一家公司防什么,往往说明什么在它的技术体系里分量很重。 知乎上已经有实测党得出类似体感,有专栏直接测试后怀疑Opus 5.5就是Fable 5.1的量化版或者自家蒸馏版。36氪知乎专栏

所以这一层的准确表述是:蒸馏路线有旁证、无实证,Anthropic不承认也不否认。

第三层:哪些根本还没发生

“AI失控”"人类要被踢出局"的叙事,可以缓一缓,因为第一个泼冷水的是OpenAI自己。那份全球安全倡议里写得明明白白:全自主RSI今天并未发生,在能安全做到之前不应推进。 注意说这句话的主语,正是正在让AI写GPU内核的OpenAI。36氪

它呼吁的是各国AI安全研究所网络制定全球技术标准,核心诉求包括:评估企业内部多少研发由AI自动完成、什么情况必须强制触发人工审查、建立类似航空业的事故分级上报机制。同日还有一条更耐人寻味的消息:OpenAI和Anthropic正在谈判互相测试对方的商用模型——当年Anthropic创始团队正是因为安全理念不合才从OpenAI出走的,现在两家要互查了。36氪

这周的另一组对照是:联合国大会场外,头部机构呼吁前沿AI安全标准覆盖RSI、协调减速;而场内各家的大会主论坛上,RSI进展是一个接一个的产品亮点。有人把这总结成一句话,我觉得很准:规则在起草,能力已经上路。知乎专栏

说回跟你钱包的关系

如果你不是从业者,这波趋势落到你身上,最直接的通道是价格。这里有一条第一次能讲圆的成本传导链:AI参与研发→训练和迭代成本下降→用大教师模型蒸馏出更小的产品模型→推理价格下降。Opus 5.5就是这条链上的第一个样本:输入输出token定价每百万4美元和20美元,比Opus 5降20%;Agent任务和编程场景里占大头的缓存读取,从每百万0.50美元降到0.20美元,直接砍了60%;再叠加完成同等任务消耗的token更少,综合成本降约40%,输出速度还快了30%。 知乎上已经有人拿它和GPT-6 Sol同天实测,五个案例跑下来花了六百多块钱,也有人用一块钱的DeepSeek在别的引擎里复刻了Opus 5.5刷屏的3D游戏案例——贵的和便宜的差距在缩小,这是普通用户能摸到的实惠。36氪知乎知乎专栏

但硬币的另一面也要看:自我迭代一旦加速,烧的算力不是变少而是变多。阿里同场抛出的规划是真武V900芯片、最高50万卡集群、2032年20GW数据中心——模型自己迭代的次数越多,需要的燃料越多。小米那边直播了6天强化学习训练,官方披露训练成本约262万美元。"模型变便宜"和"训练变烧钱"同时为真,中间的差价就是蒸馏技术在赚。知乎专栏

三类人各自看什么

API开发者和Agent重度用户:这波最实的红利是缓存读取降价,Opus 5.5缓存读降到0.20美元一百万token,如果你的工作流里Agent长会话占比高,优先把提示词和上下文结构改造成缓存友好,这一项的节省比换模型还大。蒸馏路线如果被各家跟进,"够用的小模型"会持续变便宜,重活用旗舰、杂活用蒸馏版会越来越划算。

订阅用户:不用这周就换门派。Opus 5.5的降价主要落在API侧,订阅档位的体感变化还要等一等。真正值得等的是GPT-7和Astra下一代发布时,会不会跟进"旗舰能力、蒸馏价格"这个打法——那才是订阅党吃到红利的时候。

观察党和谈资党:记住三个数字和一个概念就够了——80%(Anthropic代码库里AI写的比例)、33轮(Qwen零人参与迭代)、60%(缓存读取降幅),概念是"时间差":安全标准的起草节奏以周和届计,能力的上路节奏以版本和周计,两个计时器的距离就是接下来所有故事的发生地。

接下来盯这五个信号

一是OpenAI和Anthropic的互测协议是否正式落地,这是两家从对手变同行的标志性节点;二是Qwen那三个数字——40到45分、96%吞吐提升、42%面积缩减——有没有第三方复现;三是Anthropic会不会在某个时点官宣Model2,等于变相承认蒸馏路线;四是OpenAI那份安全倡议里的人类监督触发机制,会不会进入某个国家的正式标准;五是下一次旗舰模型发布时,缓存和输入价格是否再降一轮,那将确认"蒸馏降价"不是促销而是结构性趋势。

以上信息截至9月25日。这周的趋势一句话总结:AI开始自己教自己这件事,实锤的部分比你想的少,落地的部分比你想的快,而它最终传导到你账单上的速度,取决于那条蒸馏链路能跑多顺。先别急着站队"突破"还是"噱头",把上面的验证节点一个个核掉,答案会自己浮出来。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章