当前位置:
AIGC文章详情

AlphaFold团队解散,Claude拿下15个靶点中的14个:一个月看懂AI科研的“换道”

源自74位全网作者

13:11

7月底,谷歌DeepMind把2024年诺贝尔化学奖得主所在的AlphaFold团队解散了。评论区一片“一个时代落幕”的惋惜。

但把接下来一个月发生的事串起来看,你会发现剧情可能正好相反:AI科研没有退潮,它换道了。

一个月内发生了三件事,今天用一篇文章给你捋清楚,顺便聊聊以后再看到“AI搞科研”的新闻,该怎么判断真假深浅。

第一件事:诺奖团队解散,但核心人物去了哪里很重要

据《金融时报》7月29日报道,DeepMind解散了开发AlphaFold的专职团队,多数研究人员被调往Gemini、AI编程、基因组学、酶设计和核聚变等项目,一部分转入Alphabet旗下的AI制药公司Isomorphic Labs。微博原论文的全职作者中,约四分之一已经彻底离职。微博

单看这条新闻,像是“谷歌放弃蛋白质研究”。但注意人员的流向:AlphaFold联合创始人、诺奖得主John Jumper更早之前已加入Anthropic。36氪8月5日,谷歌“地基元老”Jeff Dean宣布离开谷歌,和Oriol、Sanjay、Quoc三位长期合作者共同创立Discovery Loop,目标就是让AI自主进行知识发现和自动科研。36氪前DeepMind资深研究科学家曹原则联合创立了Unreasonable Labs,同样押注AI4S。

换句话说,做AlphaFold那批最顶尖的人,没有散场,而是从“专用模型团队”流向了“通用AI做科研”的阵营。这更像路线切换,不像撤退。

背景是,DeepMind的战略重心已经转向Gemini这样的通用大模型,Hassabis转任董事长后仍主管AGI与科学部门。专用科学模型的时代任务完成了:蛋白质结构预测这个问题被解决到拿诺奖的程度,接下来的增量不在“再做一个AlphaFold”,而在让AI自己跑完整个科研流程。

第二件事:Claude从零设计蛋白质,15个靶点拿下14个

8月中下旬,Anthropic发布博客,复盘了Claude在蛋白质设计上的一次完整实验,数据、提示词全部开源在Hugging Face,这让它比一般的“重大突破”通稿可信得多。

先说清楚这次做的不是AlphaFold式的“结构预测”(已知序列,预测折叠形状),而是更难的反向任务:给定一个目标蛋白,从零设计一个自然界不存在的新蛋白,让它精准“黏住”目标上的特定位点。这种叫minibinder的微型结合蛋白通常只有50到70个氨基酸,是很多药物的作用基础。

参与实验的是Mythos Preview和Opus 4.8两个模型,它们可以自主调用论文、网络资源和多个专业蛋白质模型。Claude从头设计了1320个蛋白候选,交给外部实验室生产验证,354个成功结合目标,15个靶点拿下14个,最高命中率35.1%——这个赛道目前的典型命中率只有10%到15%。36氪

AlphaFold团队解散,Claude拿下15个靶点中的14个:一个月看懂AI科研的“换道”

几个硬靶点的表现更能说明问题:RBX1靶点此前在Adaptyv Bio举办的设计比赛中,全部参赛者整体命中率只有3.7%,Claude单独挑战做到40%,排名第一的设计结合强度还超过了那场比赛245个参赛作品里的冠军。36氪TNFα(一种炎症信号蛋白)的结合位点藏在凹槽里,多个专家团队曾在此碰壁,这次被Opus 4.8攻下,设计出的蛋白还能同时结合人类、食蟹猴和小鼠的TNFα——这意味着后续动物实验不用换个物种就重新设计一遍。

但更有信息量的是失败的部分:换成麦芽糖结合蛋白MBP,Claude的90个设计全部没有确认成功,只有一个出现微弱信号。而且哪个模型强也不稳定——整体更强的Mythos Preview在TNFα上翻车,反倒是Opus 4.8做出来了,Anthropic自己承认没搞明白原因。

所以“输入靶点,AI自动吐新药”还早得很。真正被验证的是:AI能以极少的人类输入,端到端跑完过去要专家花数周乃至数月组织和筛选的设计流程。

同一实验还有容易被忽略的下半场:Claude Opus 5拿着实验室返回的NMR(核磁共振)和LC-MS(液相色谱-质谱)原始数据,只靠两句话的任务说明,没有厂商软件、没人指导,分别用23分钟和19分钟完成解析,测得样品纯度96.4%,实验室实测96.33%,只差0.07个百分点。36氪这类化学分析是药物研发里最磨人、最吃经验、最容易出错的环节之一,AI接得住,意味着门槛、成本和时间一起降。

AlphaFold团队解散,Claude拿下15个靶点中的14个:一个月看懂AI科研的“换道”

值得注意的是,Anthropic同时表态:能力更强的Fable 5暂不对普通用户开放这类生命科学任务——能设计药物蛋白的能力,同样可能被用于危险的生物研究。公司称正在筹备面向科学家的专属访问计划。这个克制本身,比任何突破都值得记住。

第三件事:今天,AI科研终于有了一把“尺子”

前两件新闻,一件像坏消息,一件像好消息,那AI离“自主做科研”到底还有多远?8月26日,一个评测基准给出了第一批量化答案。

ASI-Bench由清华大学人工智能学院助理教授陈勇超联合麻省理工、哈佛、卡内基梅隆、中科大、微软研究院等十余所机构开发,是一个专为衡量AI系统“科学自主性”而设计的基准测试。知乎它的设计很巧:60个项目级科研任务覆盖数学、物理、化学、生物、材料等11个领域,同一个任务按信息梯度喂给AI多次——从给完整方法(B1),到只给方法名称(B2),再到不给具体方法(B3),看人类一步步放手后模型还能走多远。

AlphaFold团队解散,Claude拿下15个靶点中的14个:一个月看懂AI科研的“换道”

首批测试了Codex、Claude Code、Kimi Code等6种智能体框架搭配GPT-5.6、Opus 5等模型的18组配置。给完整方法指导时,18组配置平均得50.92分;撤掉方法后,平均分掉到27.17,相比B1下降23.75分,几乎腰斩。知乎跌幅最大的一步发生在B1到B2,也就是“详细方法没了、只剩方法名字”的时候——平均分一下掉21.28分。表现最好的组合也一样:Codex+GPT-5.6 Sol从71.78掉到51.60,Claude Code+Opus 5从全场最高的72.29掉到40.70。

AlphaFold团队解散,Claude拿下15个靶点中的14个:一个月看懂AI科研的“换道”

失败归因更有意思:62%的失败集中在科学决策环节——科学建模、方法选择、鲁棒性判断;只有约26%是纯数值执行问题。知乎翻译成大白话:当前AI科研的瓶颈不是“算不对”,而是人类不告诉它该怎么算时,它不知道该算什么、为什么这样算。这跟前DeepMind科学家曹原的判断对上了——要真正解决科学问题,模型需要提出新假设、验证新假设,并不断自我更新,而现在这些能力还很远。36氪

三件事连起来,是一条清晰的换道曲线

把三件事放在一张图上:专用模型团队解散,人才和资本流向通用智能体方向;通用大模型交出第一个可公开验证的端到端科研实验;同一时间,衡量“自主科研”的标尺问世。一个领域从押注单点突破,转向押注全流程自动化,并且开始建立自己的评价体系——这是赛道成熟的标志,不是衰落的标志。

当然,热度越高越要留一分冷静。“说AI能治愈癌症更像是一种陈词滥调,而非鼓舞人心,大多数人认为这是欺骗性的。”8月16日,Anthropic CEO Dario Amodei自己就在X上写下了这句话。微博

还有一个更隐蔽的风险值得知道:今年发表的一项Nature研究分析了4130万篇自然科学论文,发现参与AI增强研究的科学家发文量是其他人的3.02倍、引用数是4.84倍,但科研共同体的集体知识覆盖范围缩小了4.63%,七成以上子领域出现类似收缩。知乎AI让每个人跑得更快,但大家可能正跑向同一条赛道——科研最危险的集体失败,不是一起犯错,而是一起做对同一类事情。

以后再刷到“AI攻克某某难题”的新闻,给你三个可以立刻上手的判断动作:

一看有没有湿实验验证。纯计算的“预测成功”和实验室里真的结合、真的测出来,是两回事。这次Claude实验之所以分量重,就是因为354个结合结果全部来自外部实验室实测。

二看有没有基线对比。命中率35.1%本身没意义,对比“行业典型10%-15%”和“人类比赛3.7%”才能判断成色。没有对照组的突破,大概率是通稿。

三看它自主到哪一步。参照ASI-Bench的思路:给完整方法能做出来,是工具;只给方向还能自己选方法、自己验证,才叫科研自主。前者已经不少,后者才刚刚开始。

接下来值得持续盯的信号:Anthropic的科学家专属访问计划落地时间和首批成果;ASI-Bench开放任务贡献后,各家模型在低信息条件下的分数变化;Isomorphic Labs和Jeff Dean新公司Discovery Loop的第一份成绩单。AI科研这场换道,8月只是发车。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章