这一个月,生信圈基本是"连着被炸"的状态。
8月6日,当期的《Science》封面论文:斯坦福大学团队用基因组语言模型,从零设计出自然界不存在的完整噬菌体基因组——AI生成了约70万个候选基因组,团队挑出302个合成测试,最终16种全新噬菌体"活"了下来,能在细菌内自主复制、感染大肠杆菌。知乎更震撼的是,冷冻电镜确认其中一个生成的噬菌体,用了进化距离极远的DNA包装蛋白来构建衣壳——模型不是在抄序列,而是学到了基因组组件之间可以互相替换的"语法"。知乎

震感还没过去,人们又翻出今年上半年的旧炸点:谷歌DeepMind的ERA系统登上《Nature》,这是一套能自动编写专家级科学软件的AI系统。知乎在单细胞RNA测序批次整合任务上,它自动探索出40种新方法,全部超越当时公开排行榜上人类开发的所有方法;同期登上《Nature》的多智能体系统Robin,则把"文献—实验—分析"做成了全自主闭环,而社区对这一波Nature Agent三连发的总结是:涉及软件书写、实验方案设计、闭环科学发现。小红书
与此同时,从业者端的体感更直接。小红书上"用Codex跑生信,全流程教学"“零基础教学|用AI跑通GEO数据库,5分钟出图"这类帖子动辄上千点赞、几千收藏;有人"生信基础一般,学的一知半解”,用Codex两天完成了一篇手稿从原始数据整理、统计分析到出图的所有工作。小红书也有人把这几个月形容为"最爽也是最焦虑":从之前每天开jupyter一行一行写、一行一行debug,到现在像个小PI一样天天指挥agent。小红书知乎上,"生物信息学还有出路吗"这周还有新回答;8月12日,又有人提出新问题:AI在生物信息学研究中有哪些值得推荐的用法,它将如何重塑该领域的工作流程。知乎
AI设计了病毒、写了分析工具、还在跑分析流程——生物信息学这个专业,看起来像是被四面合围。但把论文、社区帖子和就业讨论按顺序读完,我的判断是:这一波冲击碾过的不是生物信息学本身,而是其中纯执行层的工作。看清这一点,学习和职业方向的决策会简单很多。
AI已经接管的:能力已经分三层
把信号摊开看,AI在生信里的能力已经分成三层。
第一层是"跑成熟流程"。从GEO这类公共数据库取数、质控、差异分析到出图的链路,AI编码工具已经相当熟练。"零基础的我居然可以生信分析了"这种上千收藏的帖子,说明这一层的门槛已经被压到接近于零。小红书
第二层是"自主完成分析闭环"。今年3月就有解读报道,《Nature Methods》的研究让智能体集成scanpy、scvi-tools等单细胞分析工具,完成方案生成、自我批判、代码执行、结果解读、迭代重规划全流程。知乎小红书上也有人给Codex搭了完整生信工作流,从创建项目、配置环境,到QC、UMAP、聚类和Marker分析,完整跑一遍,报错隔天再打开,它仍然知道进行到哪一步。小红书这已经不是"你写一句、它改一段",而是"你给任务、它交结果"。
第三层是"发现新方法"。这是最让人后背发凉的一层:ERA不是跑现有工具,而是自己写工具。它把LLM代码生成和AlphaZero式树搜索结合,维护一棵全局候选方案树,每轮在代码沙盒里自动评分反馈,最终在批次整合任务上写出40种新方法,超越排行榜上所有人类方案。知乎

但注意:这三层有一个共同前提——问题已经被定义清楚、数据已经备好。“问题问得对不对"和"数据靠不靠谱”,AI目前都还交给人。
AI做不了的:生成很便宜,验证很贵
再看噬菌体论文里那个数字:302个方案,16个活了,成功率5.3%。知乎AI极擅长"生成",但"筛选与验证"的成本一分没降:冷冻电镜确认衣壳蛋白、噬菌体鸡尾酒对抗耐药菌,每一步都依赖湿实验。AI把设计的前线大幅前移了,验证的闸门却还握在人手里。

社区里的反例同样扎心。"5分钟出图"听着很美,但这类帖子下最高赞的追问往往是同一句:我怎么知道图是对的?一篇系统梳理生信基础模型的《国家科学评论》综述,点名的挑战有四个:可解释性欠缺、评估标准混乱、幻觉、数据质量与偏见。翻译得直白一点,模型给你编一个看起来很合理但完全错误的生物学结论,这比单纯的准确率低更可怕。知乎热门基因数据堆成山,冷门基因几乎没有;拿带偏见的数据直接跑AI,得到的不是洞察,是被放大的偏见。
贬值的是代码,升值的是判断

把这张基础模型矩阵图看明白:基因组学、转录组学、蛋白质组学、药物发现、单细胞分析,AI的能力全部集中在"预测"和"生成"两类任务上。而真实科研的价值链在这两环之外,还有三环:提出问题、判断数据、验证结论。正在贬值的,恰恰是前两环里最机械的部分。
最先感到寒意的是"标准化流程操作员"。小红书那篇《生信就业盘点》写得很清楚:本科生能拿到的多为测序公司的生信分析技术员,工作内容是跑标准化分析流程。小红书这一层,正是AI替代速度最快的靶心。知乎的回答更直接:如果工作和实验组经常对接,就会沦为实验组发文章的免费工具人。知乎工具人岗位,从来不是因为AI来了才不值钱的。
与此同时,三种能力正在升值:定义问题的能力(把"老板想要一张图"翻译成清晰、可验证的分析问题)、看穿数据的能力(质控、批次效应、结论是否站得住)、与湿实验闭环的能力(把计算结果变成可验证的实验)。这周知乎的讨论里,做ai4bio方向的人透露,这个方向国内就业"出去总包30~50之间"。知乎企业买单的是能解决问题的人,不是会把工具跑熟的人。
三种人,三种账
如果你是湿实验或临床背景、想进生信:好消息是,"先花半年学Linux和R"的入场券已经作废。直接拿AI工具跑通自己的数据,边跑边补方法原理,效率更高;但要把七成精力花在理解每种分析方法的假设和失效模式上——你不懂原理,AI跑得越快,错得越自信。
如果你是生信在读研究生或工作一两年:别再把"流程跑得比谁都快"当核心资产打磨。往上走:问题定义、QC判断、结果解读;往深扎:绑定一个具体领域的实验资源。"像个小PI一样指挥agent"的人和害怕agent的人,往往是同一批人,区别只在于把自己放在了判断侧还是执行侧。
如果你想做方法、做算法:ERA证明AI也能生成方法,但《国家科学评论》综述点名的、领域当下最缺的东西——统一评估基准、可解释性、幻觉检测——恰恰是人该站的位置:设计评估、构建数据、做可验证的验证。做"评估与验证",就是站在水位上涨的一侧。
值得继续观察的信号
Codex、Claude这类工具的生信Skills生态已经成形,“必装Skills"清单都出现了——观察它们是否进入实验室的日常SOP;观察新的《Nature》《Science》Agent论文,是从"跑分演示"走向"真实工作流复用”,还是停在宣传页;观察测序公司、药企的招聘JD,是否开始写"AI协作分析能力";观察OpenProblems这类公开排行榜的更替——当AI自我超越成为常态,"方法创新"四个字的定义本身就会改写。
生信没有变得更卷。恰恰相反,把一个生物学问题变成数据证据的成本,是史上最低的时候。作废的是"靠入门门槛吃饭"的旧生存逻辑。门槛被抽掉之后,拼的是谁能问出更好的问题、谁能把数据看得更透。