这个国庆假期,AI 圈的主线剧情不是模型发布,而是 Anthropic 在"做科学"。
第一张牌是 9 月 22 日摆下的:Anthropic 当天发布了 Claude Opus 5.5。接下来的剧情才叫密集:新酶、九圈、内部自报、新算法、汤姆逊难题、开源框架,11 天连开 6 张牌,连 EndpointsNews 对生命科学团队的专访都成了收尾的一环。知乎知乎
一、六张牌,把宣传口径和论文口径并排放
第一张牌:新酶——"950 个智能体"是宣传语,"77 个小时"才是账本
官宣话术很炸:约 950 个 Claude 智能体并行工作 21 小时、消耗约 2.1 亿词元,只给一条方向性提示,就从近 20 万个逆转录酶里翻出一个此前未被完整表征的噬菌体酶系统,命名 ART,Nature 用《Anthropic’s AI biolab finds ‘CRISPR-like’ DNA in viruses》的标题报道,CRISPR 先驱张锋审阅背书。流窜AI
论文口径是另一组数:119 项任务、949 次智能体会话、累计 77 个智能体小时、实际经过 21.5 小时——"950 个智能体"是会话数,不是 950 位科学家连上 21 小时的班。码途漫谈
边界也是官方自己划的:AI 只承担数据检索、候选筛选和假设整理,湿实验由人类科学家完成,不能据此认定 ART 具备基因编辑能力,而底层那台逆转录酶早已被人类识别过。流窜AI
真正冷的一盆水:团队把同类搜索又跑了十次,每次都错过了那个阵列。一次灵光能证明路走得通,"稳定产出的流水线"还没有立起来。码途漫谈
第二张牌:九圈——机器先抢了纪录,另一支中国团队同时抵达
此前在该模型中的最高纪录停留在八圈,由 SLAC 国家加速器实验室的 Lance Dixon 与合作者于 2023 年创下;Claude 用 Fable 5.1 跑在 Claude Science 平台上连续数天,任务描述只有一句加反复"继续",真把九圈六粒子散射振幅算了出来。机器之心
破纪录者本人把关:Dixon 独立验证了结果,称这是"一场相当了不起的胜利",还补了一句——除了他的合作者,没人比 Claude 更懂他们团队 2019 和 2023 那两篇论文。机器之心
账本也公开了:折合到普通用户身上约一两千美元,大头是长时间跑模型,真正数值计算约 100 美元,相当于 96 个 CPU 跑一周。机器之心
平行线线索:中科院理论物理所何颂团队早在 9 月 17 日就在 Zenodo 公开了二圈至九圈符号数据集,他们同样用了 AI(基于 GPT-6),但只算约束条件、框架由人搭——果实熟了,不是单机奇迹。机器之心
最诚实的是下战书的人自己:von Hippel 复盘说 Claude 用的是已知方法,只是比人类此前愿意投入的算力多了一些,他的结论是"低垂的果实比预想的多",研究者应该去试,但要准备好验证结果的方案。机器之心
第三张牌:26% 自报——车速表自己装、自己读
官方口径:2026 年 8 月,公司内部 AI 研发工作里 26% 由 Claude"主导",2 月还不到 1%,5 月合进生产代码库的代码超过 80% 由 Claude 写,最常用的内部平台上同时跑着约 3 万个智能体。贾诩Jiaxu
但这把尺子的打分者也是 Claude:模型和人给同一节点打出完全相同等级的比例是 59%,人和人之间只有 35%——刻度本身就糊,而 26% 恰好落在最容易起分歧的 AL3/AL4 分界上。贾诩Jiaxu
OpenAI 也在 9 月 7 日前后报了自家进度条:“automated research intern"达成,下一个目标是 2028 年 3 月做出"automated AI researcher”。两家的方法学对不上,数字没法直接比;"独立评估员常驻"还没落地之前,这块仪表盘确实是司机自己装、自己读。
第四张牌:C-HD 算法——复杂度赢在纸面,工程还没排队上桌
“Claude 发明比 Dijkstra 更优的最短路算法”,话题冲到 15.9 万阅读,但回答区当场把账算清:复杂度确实更优,但常数差得多,数据量约 10^1000 及以上才用时更短。"写出一支新算法"算一层,"改变工程实践"目前还没到那一层。知乎
第五张牌:汤姆逊难题——人类刚贴上墙,AI 接着爆破
社区把时间线摆得很直:N=8 是在 9 月 18 日由 Liudmyla Kryvonos、Lukas Liehr 和 Mitchell A. Taylor 三位数学家共同完成的。四天后,AI 版本来了——按同一篇回答的话说,“Vals AI 连思路都没改,直接调参把 N = 7 爆破了”。质疑方补刀:人类证明只有几百行,AI 的"证明"更像拿区间算术打补丁、近 8MB 的代码,陶哲轩说的那种"无意义数学"就是这种。这张牌双方都还在审,谁都别急着站队。知乎
第六张牌:BootLoops——36 篇手稿 18 个领域,但每个领域都说"没什么意思"
哈佛教授施瓦茨交了 3 个月的底:他和 19 位合作者带着 Claude 从约 400 个候选问题筛出推进,最终完成 36 篇学术手稿,横跨 18 个领域,配套科研框架 BootLoops 1.0 以 MIT 协议开源,不绑定任何模型。DeepTech深科技
最有价值的两个瞬间都是"泼冷水":Claude 在他主场物理上声称突破时,他一眼能看出真假;可在陌生领域声称重大成果时,他"除了点头赞叹,根本无从反驳"——只好逐个发邮件找领域资深专家把关,几乎每次结论都一样:技术推导挑不出毛病,算出来的东西在领域内"没什么意思"。他自己的总结是:Claude 和 GPT 确实擅长科学,但它们并不是科学家。DeepTech深科技
他还立了一条值得抄走的验收标准:一个费曼图只有在完整的函数解析形式已知、且能通过一个 Python 脚本在普通笔记本上算到任意精度时,才算真正被攻克——对着 30 位有效数字的比对,AI 没有蒙混空间。DeepTech深科技
专家重新定了题之后,硬货才浮出水面:用"不等式证书"等工具分析了"千人基因组计划"中 113 位冈比亚人基因组里的 57 亿对相邻突变,发现对标准祖先模型的偏离约 95% 可用"基因转换"解释——而经典连锁统计分析长期忽略了这一机制。这才是"AI 跑、人定题"的完成形态。DeepTech深科技
二、六张牌摆完,其实只有三笔账
第一笔,算力账:AI 把"找"的成本打到了地板上——几千美元跑通一个九圈纪录,21.5 小时看完人类专家几周的量;但"验"一点没便宜:重跑十次会错过、张锋们仍在掌舵,券商也把话说明白了——湿实验验证已经成为 AI 制药的关键瓶颈。流窜AI
第二笔,打分账:每个数先问三件事——统计口径是什么、分是谁打的、能不能复现。“950 个智能体"和"77 个智能体小时”、“80% 代码"和"26% 主导”、“攻克百年难题"和"调参爆破 N=7”,是同一件事穿不同衣服。这轮少见的体面在于,Anthropic 把"不能认定具备基因编辑能力"这种话主动写进了发布材料,用社区的话说,这种克制在这个行业里比发现本身稀罕。流窜AI
第三笔,层次账:六张牌全部停在同一层——找到了候选、跑通了纪录、写出了手稿;没有一张走到"讲清功能、改变实践"那一层。ART 功能未知,C-HD 常数难看,生态学结果"多数生态学家会耸耸肩",群体遗传学要等专家重新定题才亮出 95% 的基因转换。
三、两派吵得凶,吵的其实不是事实
吹的阵营证据是真的:Nature 报道、张锋和 Dixon 的验证、下战书者本人承认"这类工作它现在能可靠地完成"。嘲讽阵营的证据也是真的:重跑十次落空、何颂团队同批抵达、爆破 N=7、近 8MB 的代码。两边摊开来看用的是同一批论文和同一组数字——分歧只在"用人类已知配方跑通一次"该记什么功。所以围观的人不必站 feed 的两端:把预期放在"一个极快、极细致、但需要你先设计验证的博士后"上,既不过乐观,也不过悲观。
四、你能从里面拿走哪一段
如果你在做科研、或者正在读研,三个动作。一,下次再看到"AI 发现某某",先问口径、打分人、复现性,三样问不齐就按传闻引用。二,别只把 BootLoops 当工具,把它当方法:先设计"便宜可验证"的判据,再扔任务给 AI,顺手按"别的领域早有成熟解法"这条线扫一遍自己领域的卡壳题。三,落地门槛早有人总结过:一是数据出不出得去——涉及未发表数据、临床或实验材料,通不过合规审查的模型,能力再强也直接出局。基因转换和中性理论的例子用的全是公开数据,这才是跑得通的路。知乎
如果你做开发者或工作流,真正的信号不在具体模型名,在产品形态:Claude Science、BootLoops 这类"任务编排 harness"正在成为科研新入口;而旗舰 SKU 的换代速度——9 月 1 日 Fable 5.1、9 月 22 日 Opus 5.5——就是提醒:长期工作流别绑死在单模型单版本上。
如果你只是围观和写稿,记四条"还没发生"的红线:“AI 发现了 CRISPR 基因编辑工具”(官方自己说不能认定);“950 个智能体=950 位科学家连上 21 小时班”(论文口径是累计 77 个智能体小时);“AI 拿下千禧年难题”——OpenAI 9 月初那则纳维-斯托克斯反例目前仍在接受数学界审视;“Claude 完全自主主导了 26% 的研发”(26% 里没有任何一块是完全自主的,打分者还是 Claude 自己)。机器之心
下一步的观察信号全带日期:何颂与 Dixon 的正式论文;汤姆逊 N=7 的学术认定结果;Anthropic 的"独立评估员常驻"落不落地;内部测量下一次更新——已有人把 26% 拟合成"10 月冲 50%"的曲线,对答案别错过;以及 ART 功能研究的后续,这一项大概率按年计、不按天计。
这轮"AI 做科学"真正值钱的增量,不是机器超过了人类,而是"找"和"跑"开始像云账单一样计价,“验"和"定题"依然是人类年。看烟花的人都在等下一个奇迹词,能下手的人已经把问题换成"这个发现验证起来贵不贵、由谁来验”。把实锤和宣传分进两本账——下一次"突破"骗不到你,下一个 Dixon 时刻真来了,你也第一时间看得懂它的分量。