如果你最近刷到 AI 制药相关的内容,大概率见过这组数字:76.1% 对 47.9%。
故事也很会挑结构:一家成立才三年的公司,开源了一个模型,在公开基准上把 DeepMind 的 AlphaFold3 赢了将近 28 个点,随后拿到 1 亿美元融资。社区里已经有人管它叫"国产 AlphaFold4"。知乎"让 AlphaFold3 下岗"的标题,直接被写进了文章。知乎
乍一看像又一次代际碾压。但我把几个信源交叉核对了一遍,结论可以先说:新模型在抗体方向的优势是真的,值得关注,但"下岗"这个叙事,掺了不少公关水分。
先说清楚发生了什么
这个模型叫 OpenDDE,寻明生科(Aureka Biotechnologies)7 月初发布并开源,开源版参数 655M,代码和模型权重以 Apache-2.0 许可证开放。知乎论文名字很长:《Folding, Reasoning, and Scaling with Open-source Drug Discovery Engine》。它家闭源的完整版叫 AuraIDE,OpenDDE 是开源预览版。

8 月 11 日,公司宣布完成总额 1 亿美元的 B 系列融资,累计融资接近 2 亿美元,钱投给下一代生物基座模型和自家实验平台。知乎也就是说:融资是真的,开源是真的,跑分也是真的。问题出在跑分怎么看。
4 组数字,一个都不能少
第一组,是传播最广的那组:第三方平台 Tamarind Bio 复测,在公开基准 FoldBench v1(113 个抗体—抗原复合物、172 个界面)上,OpenDDE 的成功率 76.1%,AlphaFold3 是 47.9%。知乎融资通稿里引用的那份第三方评测,标题直接写着"Open Models Beat AlphaFold3"。知乎
第二组,很少被转述:OpenDDE 自己的技术报告里,FoldBench-AB 这一栏写的是 70.0%,跟第三方复测差了 6 个点——评测口径不完全一致。知乎连复测方和被测方都对不齐同一个数字,你就知道这类基准对实现细节有多敏感。
第三组:换个基准,故事就不一样了。另外两个抗体基准 PXMeter-AB 和 2026ARK-AB 上,OpenDDE 的成绩是 51.0% 和 66.4%,换到更严格的分布外测试,领先幅度还要再收一截。知乎76.1% 是多个数字里最高的那个,不是全貌。
第四组最该看,也最难写进标题:这些百分比的含义,是"预测结果达到 DockQ > 0.23 的体系比例",而不是平均 DockQ。知乎而 DockQ > 0.23 在行业里只是 acceptable 门槛——大致找对表位和结合方向,离原子级精度还远。
更要命的是,OpenDDE 的 Oracle 成绩(已知标准答案后回头挑最好的那个)明显高于 Ranked 成绩(按自己的置信度挑)。知乎意思是它有时能生成正确结构,但不一定能稳稳把它挑出来。对真做研发的人来说,排序能力往往比生成能力更实用。
四组数字放在一起,结论是:OpenDDE 在抗体—抗原复合物预测上确实强,值得部署来试,但这是"特定任务的明显优势",不是"全面代际领先"。

而这,恰好是 AlphaFold3 的主场劣势
为什么偏偏是抗体?抗体—抗原本来就是 AlphaFold3 最不擅长的一项:这一系模型最依赖的线索是共进化——同源序列在漫长进化里一起变,模型靠这些痕迹推断空间上谁挨着谁,但抗体的可变区是免疫系统现场随机重排出来的,跟抗原之间根本没有共同进化的历史,线索没了,模型只能猜。知乎所以 47.9% 不是 AF3"衰退"了,是它在最弱的科目里拿的最低分。换到蛋白—蛋白、蛋白—小分子、蛋白—核酸这些科目,AF3 依然是榜单上的强项,Boltz-2、Protenix 一堆模型也还在同一条线上互追。"下岗"两个字当标题可以,真做研发,没人会因为一个单科成绩把主力工具换掉。
结构预测赢了,也不等于制药赢了
这件事还有一层容易被略过去。寻明生科自己讲过一个数据:之前用 AlphaFold 一系模型做抗体设计,一次给 50 条序列,回来通常只有五六条有活性;今年把 OpenDDE 接进流程,同样 50 条,30 多条有活性——但这一半功劳不在模型,在实验室,他们把活性测试从 96 孔板搬进了微米级液滴,反应体积缩小约一百万倍。知乎换成单细胞功能筛选平台后,一个实验可以表征 100 万到 1000 万个分子,比传统方式提高了五六个数量级。知乎
这说明什么?结构预测全对,也不代表分子在细胞里真能干成事。PDB 里躺着几十万个结构,没有一条告诉你这分子进了细胞会发生什么,这也是"生物世界模型"这个说法目前听着热闹、却拿不出任何公开可验证内容的原因。知乎

我的判断清单
做抗体—抗原共折叠的:OpenDDE 值得一试,Apache-2.0 开源,655M 参数,RTX 4090 级别的卡就能跑推理。但记得跟 AF3、Boltz 系模型并排跑,多个模型收敛到的表位和位姿,比单模型的高分更可信;在完成自己的内部验证之前,别直接拿模型置信度当研发决策依据。知乎
做其他结构预测的:AF3 依然是稳妥首选,而且 2026 年 7 月 23 日之后,权重免申请、公开 URL 直接下载,本地部署门槛是历史最低的。知乎
纯围观的:以后再看到"某某跑分碾压某某",先问三个问题——复测是官方还是第三方?换个基准、做分布外测试,优势还在吗?比的是结构指标,还是功能指标?
后面还有几个信号值得盯:OpenDDE 从 Preview 转正式版、排序能力能不能追上生成能力、能不能拿出"用了之后实验成功率真的提高"的项目级数据,以及 IsoDDE 和 Boltz-2 的下一步动作。
最后一句:AlphaFold3 没有下岗。真实发生的事,是结构预测进入了细分专业化阶段——抗体有抗体的强手,小分子有小分子的强手。这 28 分的掌声值得给抗体领域的进步,但"下岗"式标题,可以略过。