10月10日,B站UP主"喵了个猫了个咪了个猫"的《AI算法对抗大赛》更新了第5集:12个大模型被分成6支双人队,限时接力改造一份又慢又乱、还藏着坑的C++老代码——有的快了上千倍,有的比原来还慢。 题目、提示词、每个模型交卷的原样代码和逐组成绩已全部开源于GitHub,任何人都能复现这场对决。 这场实验对"多智能体协作如何颠覆传统研发"给出的回答相当具体:颠覆不在"更多AI写代码",而在研发重心从"写"转向"验证与接手"。哔哩哔哩GitHub
赛制:先提速、再找茬、后接手,输出必须逐字节不变
被优化的对象是一个仓储机器人调度仿真程序:慢、乱,还藏着5个"看起来像bug、实际必须保留"的怪行为——取消失败也计数、救援只充一半电、充到90%就离开充电桩、距离相同选编号大的机器人、平均延迟四舍五入。更麻烦的是,旧文档和代码注释写的是另一回事,只有拿输出和基线对拍才能发现。比赛分三轮:第1轮由"主程"模型限时提速,但对任何合法输入,输出都必须和基线逐字节相同,交卷前还要给队友写一份交接文档;第2轮由"测试手"模型给另外5队主程的代码构造合法输入找反例,输出不同、异常退出或超过60秒都算击穿;第3轮测试手在会话归零后接手本队主程的代码,修好别人找到的反例、实现三个需求变更,再继续优化。 团队100分总分由7个分项加权:主程速度15、抗反例10、主程盲评5、找反例20、接手正确20、接手速度20、终版盲评10。 计分文件里的旧称"攻击"“击穿”,指的就是测试手找反例,改名原因下文再说。GitHubGitHub
结果:最快2743倍,最惨一队全线崩溃
冠军是队F:MiMo V2.6 Pro打主程、GPT-6 Astra当测试手,团队总分90.8,第2、3轮都经过了重赛才定案。 五支成功完赛的队伍,终版比原始代码快了约400到2700倍——前三名快到了Windows计时精度的下限,主办方只能改成连跑多遍取平均来重测,否则0.016秒的刻度根本量不出差距。 最戏剧性的是队D:DeepSeek V4.1 Flash的主程版只快了7倍,Opus 5.5接手之后,终版相对旧基线的几何平均加速冲到全场最高的2743倍,测试手的"增值"高达629倍。GitHubGitHubGitHub
另一端是队E:GLM 5.3的主程版在一组隐藏负载上直接超时,Grok 4.7第3轮用满45分钟交回一行没改的代码,终版在9组隐藏负载上全部出错,团队总分只剩20.4。 同一道题、同一套规则、同样的限时,结果从提速2700倍塌到彻底跑不了。两极之间隔着的不是运气,而是协作结构。GitHub
差距的根源:提速容易,"行为不变"才难
真正决定名次的是第二轮的找茬环节。6份主程代码里,四家犯了同一种毛病:把基线里"用到才算"的寻路改成提前算好再缓存——语义上看着无害,特定输入下输出却已经变了,随机测试测不出来,最终7个缺陷点全是被测试手针对性构造反例翻出来的。 围观完比赛的程序员在评论区给出了最实用的一条结论:不要随便改屎山,鬼知道那坨老代码有什么奇怪的特性。 这正是AI研发与传统研发分道扬镳的地方:模型生成"看起来正确"的代码越来越便宜,"被验证正确"依然要靠行为边界定义、对拍工具和专职找茬的对手。GitHub哔哩哔哩
记分板的设计:60分给了"读别人写的代码"
计分权重本身就是一种表态:找反例20分、接手正确20分、接手速度20分,100分里有60分花在"处理和接手别人写的代码"上,纯生成速度只值15分。现场还有主程、测试手两张个人榜,以及由三个参赛模型匿名执行的可维护性盲评——AI写、AI攻、AI接手、AI互评,研发链上的每个角色都配了机器岗位。主办方对结论同样克制:每个模型每轮只跑了一次,这只是这一场的结果,不是能力排名。 第3集的附加实验还显示,同一个模型只换工具,实力值能差120分以上——"谁带队、用什么agent框架"和"模型本身"同样重要。 而6支队伍的配对靠随机抽签,有观众一针见血:这组队只有分数上的关系,没有多少工作上的协作。 真实团队能复制到什么深度,仍是开放问题。GitHubGitHub哔哩哔哩
产业对照:多智能体已是编程工具标配,技术债正是主战场
这场"自制比赛"踩中的议题,正是商用工具过去一年推进的方向。2026年2月2日,OpenAI发布Codex桌面应用,定位不再是补全助手,而是官方的说法——一个"代理的指挥中心":开发者同时委派多项编码任务,智能体在后台独立运行、各自在隔离的代码副本里并行工作,单个智能体可连续工作约30分钟。36氪
OpenAI CEO Sam Altman点明了这类系统的主战场:AI特别擅长做那些人类工程师最不愿意做的事情,比如重构代码、清理历史遗留问题、补齐测试覆盖。 "12个AI改屎山"因此不是猎奇节目,而是正在被工具兑现的产品叙事——Codex应用发布时,过去一个月已有超过100万名开发者用过Codex。连模型厂商自己也在回应AI生成的代码垃圾:OpenAI产品负责人Tibo Sottiaux发帖称,未来的模型会更擅长删除和简化代码。36氪知乎
冷静的边界:多智能体没有自动红利
真实研发团队不是比赛重播。Google Research、MIT与Google DeepMind合作的《Towards a Science of Scaling Agent Systems》做了260组受控配置,平均结论相当冷淡:多智能体相对单智能体的收益只有-0.3%,95%置信区间从-58.7%一直跨到+77.2%。 同一批实验里最好的组合高出80.8%,最差的低了70.0%——方向不取决于"多叫几个Agent",而取决于任务能否拆成可独立验收的子块、单智能体基线是否已经够高。协调的账单也必须记:不同架构的通信token开销相对单智能体从58%到515%不等,若按打到同等成绩来算,token可能要花1.6到6.2倍。知乎
这场比赛自己也交了真实的账单:规则原稿里"测试手"叫"攻手"、“找反例"叫"击穿”,这类说法被Claude和OpenAI的安全机制当成网络攻击任务拦下过,主办方只能整体改名重跑。 主办方的订阅账号还在比赛途中被封,按置顶评论的说法,这期损失非常惨重,没有退款,损失128美元。 对个人开发者这是几百美元的学费;对企业,这就是把多智能体放上生产线之前必须先补的课:权限边界、审计留痕、渠道稳定性。GitHub哔哩哔哩
回到标题的问题:多智能体正在颠覆研发,颠覆的是分工,不是人数。这场比赛演示的形态是——代码由AI接力生成,正确性由独立的AI对手和盲评逼出来,人退到出题、定规则和验收的位置,毕竟题目、规则和裁判仍由主办方编写,选手代码全部原样存档。 想把多智能体用进自己项目的团队,可以带着三个问题去对照这场比赛:任务能不能切成独立验收的子块,单智能体基线是不是已经够高,token、延迟、重试的协调账单有没有被单独记账。至于"上千倍提速"和"比原来还慢"为什么同场出现——一支队伍的上限,取决于验证环节的密度,而不是成员能力的总和。GitHub