12个AI组队优化“屎山”代码:最快提速2700多倍,为什么有的反而变慢了?

源自13位全网作者

10-10 22:02

这个热搜词条来自今天上午刚发布的一场真实比赛:B站UP主"喵了个猫了个咪了个猫"发布了"AI算法对抗大赛"第5集,12个大模型组队接力,改一份又慢又乱、还藏着陷阱的老代码——有的提速上千倍,有的改完反而更慢、甚至直接坏掉。 比赛题目、裁判程序、每个模型提交的原样代码和成绩,已经在GitHub开源。哔哩哔哩

官方公布的赛果是:五份成功的终版比原始代码快了约400~2700倍,最快的跑到了Windows计时精度的下限,主办方不得不把每组负载连跑多遍取平均才分得出名次。 另一端同样戏剧化:有队伍的终版全部出错,也有"优化"后的版本在个别对抗性输入上比未优化的参考写法还慢。GitHub

这一集和这个系列前四集"让AI写游戏bot互打几千局"的玩法不同,第一次把比赛改成了真实的工程活:不打对战,12个模型分成6支双人队,接力优化一份又慢又乱的老代码,还要互相给对方的代码找反例。 题目是一个C++仓储机器人调度仿真,基线代码里藏着5个必须原样保留的怪行为,比如取消失败也计数、充到90%就离开充电桩,而随题附带的旧文档和代码注释写的全是另一回事。 也就是说,AI不仅要改得快,还不能在字节级别改变输出——这正是真实世界里碰十几年老代码时的处境。GitHubGitHub

比赛分三轮,6个主程和6个测试手随机配对抽签分队:第1轮,主程在"输出与基线逐字节相同"的前提下尽量提速,交卷前还要给队友写一份交接文档;第2轮,测试手拿另外5队的代码构造合法输入找反例,输出不同、异常退出或60秒内没结束都算,越没被人找到的缺陷越值钱;第3轮,测试手在全新会话里接手本队代码,修好别人指出的反例,实现订单老化、载货耗电、报表加字段三项需求变更,再继续优化。团队总分由主程速度、抗反例、找反例、接手正确、接手速度、两轮盲评等7个分项加权。

最终排名:队F(主程MiMo V2.6 Pro、测试手GPT-6 Astra)以90.8分拿下团队第一,队C(Gemini 3.8 Flash+GPT-6.1 Sol)77.9分第二,队A(Kimi K3+Sonnet 5.5)71.4分第三,垫底的队E只有20.4分。 值得注意的是,冠军既不是提速榜头名,也不是找bug最多的模型,而是两轮都没掉链子的那支队。GitHub

"有的比原来还慢"有明确的技术来源。第2轮汇总的缺陷点显示,四家主程犯了同一种回归错误:把基线里"用到才算"的寻路改成提前全部算好再缓存——正常负载下确实更快,但遇到目的地不可达、封锁频繁变化的对抗性输入,就会把算力浪费在大量无用预计算上,甚至退化到超时,主办方明确写道"随机对拍测不出来"。 赛后复测还抓到同一类问题:队B由Fable 5.1接手后的终版,在参考实现只需5.9秒就能跑完的输入上连续超时,一次跑了97.3秒。GitHubGitHub

队E的情况最极端:接手手Grok 4.7第3轮用满45分钟,交上来的代码一行没改,9组隐藏负载全部出错;UP主怀疑账号当时被官方降智,但从记录上无法证实。 这类"提速报表全绿、边角输入悄悄回退"的现象,恰好是AI改真实老代码时最需要提防的坑:光看平均性能数字不足以证明改动安全,必须带对抗用例验收。GitHub

主程榜和测试手榜则给出了另外两个反直觉的结果。主程榜首不是提速101倍的Gemini 3.8 Flash,而是88倍的Kimi K3——它的代码没有一名测试手找到反例,而Gemini速度分拿满却被5名测试手找到反例,单项"抗反例"直接归零。GitHub

测试手榜上最亮眼的是"在别人留下的烂摊子上继续优化"的能力:DeepSeek V4.1 Flash的主程原版只比基线快7倍,Opus 5.5接手后终版冲到2743倍,单轮增值约629倍;GPT-6 Astra则靠找到6个缺陷点登顶测试手榜。 换句话说,这一集真正测的不是"谁写的代码跑得快",而是从理解遗留代码、留下交接文档、接手他人工作到对抗性找问题的整条工程链。GitHub

成绩也带着明确的适用边界:每个模型每轮只跑了一次,主办方自己强调这是"这一场"的结果,不是能力排名;第2、3轮首次比赛因提示词没讲清楚、各家条件不一致而整体作废重赛。 工具的影响也不小——同一个模型只换agent工具,第3集的附加实验就测出实力值差120分以上。 不过通过者的底线过硬:五份成功终版各自用1500个随机边界用例与参考实现逐字节对拍,0个不一致。GitHubGitHubGitHub

“可读性"上则不用对AI太有信心。三个参赛模型对12份匿名代码做了可维护性盲评,最高的一份终版只得7.8分(折合百分制约71分),而盲评标尺上"干净的参考实现"是75分、原始屎山是10分:提速上千倍之后的AI代码,离人类工整写法仍有可见距离,但它们甩开的是原来那座"山”。GitHub

最后是一个场外细节,可能比比赛结果更值得用AI干活的人留心。比赛内部原本把找反例环节称为"攻防"“击穿”,但这套说法被Claude和OpenAI的安全机制当成网络攻击任务拦下过,主办方不得不整体改名才跑得完。 UP主还在置顶评论里说,比赛期间被封了一个账号:“这期损失非常惨重,被A/封了个5x,我才用了一周啊😭没退款,损失128刀”。 换句话说,用AI做正经的代码审查和优化,目前还得绕开安全审查误伤这一道现实的坎。GitHubB站

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章