10月10日下午,B站"AI算法对抗大赛"更新了第5集,这一次的对手是每个程序员都绕不开的老问题:12个AI模型被分成6支"主程+测试手"双人队,接力优化一份又慢又乱、还藏着5个必须保留的怪行为的C++仓储机器人调度仿真程序,有的快了上千倍,有的比原来还慢。 五份成功的终版比原始代码快了约400~2700倍,快到碰到了Windows计时精度的下限。 而剩下那支队伍的终版不但一倍没快,还把隐藏负载全部跑错。这篇讲清三件事:这场比的是什么,打工人能"一键复刻"的到底是哪部分,以及哪些结论不能照单全收。哔哩哔哩GitHub
赛制:三轮接力,"找反例"占60分
第一轮,主程拿到原始代码、一份过时的旧文档和5组公开负载,可以任意改写,但对任何合法输入的输出必须和基线逐字节相同,交卷前还要给队友写一份交接文档。第二轮,测试手拿到另外五队主程的代码构造合法输入找反例:输出不同、异常退出、60秒内没结束都算。第三轮,测试手开一个全新会话,接手本队主程的代码,修好别人找到的缺陷,实现订单老化、载货耗电、报表加字段三个需求变更,然后继续优化。 团队总分由7个分项加权,其中"找反例、接手正确、接手速度"三项合计60分,比速度本身权重更高。基线里埋的5个坑也全是老代码的写实:取消失败也要计数、救援只充一半电、充到90%就离开充电桩,而旧文档和代码注释写的都是另一回事,只能和基线对拍才能发现。GitHub
快到碰到计时器下限
名次上,队F(MiMo V2.6 Pro主程+GPT-6 Astra测试手)以90.8分拿了团队第一;DeepSeek到Opus 5.5、Gemini到GPT-6.1 Sol两队的终版,相对原始代码的几何平均加速比约2500至2700倍。前三名在轻负载上只用0.03~0.05秒,裁判不得不把每组负载连跑几十遍取平均,因为Windows进程CPU计时的最小刻度约0.016秒——快到了计时器的物理下限,正式成绩因此重测过一轮。 主程榜里,Gemini 3.8 Flash提速101倍却被5支队伍同时找到反例、抗反例分为0;Kimi K3是唯一一个没人找到反例的主程,以89.4分排第一。在屎山里,"不犯错"比"快"更值钱。GitHub
翻车比夺冠更值得看
全场暴露的7个缺陷点里,四家主程犯了同一种毛病——把基线里"用到才算"的寻路改成提前算好缓存起来,这类错误随机对拍测不出来,只有被针对性构造反例才暴露。 这也是真实屎山项目的通病:优化方向正确,但"看起来更快"和"输出不变"是两件事,靠同一位AI自查很难发现。GitHub
队E的结局最差:GLM 5.3当主程时有一组负载超时,Grok 4.7的测试手用满45分钟交上来的代码一行没改,终版全部出错。 主办方怀疑那个账号当时被平台降智,但在仓库里明确写了无法从记录证实——成绩按规则照算,不代表它的正常水平。GitHub
两支人类队,交出第三种答案
仓库附录让两位人类做了完全相同的第一轮任务:打过信息竞赛省二、没碰过工程代码的"能工智人"自己改了近2小时,加速1.7倍;C++初学者Cat在交接文档第一行记了五段工作时间,加起来是20小时11分,加速2.6倍。 两人8组隐藏负载全部正确,测试手们构造的28个反例用例也和基线输出一致,而同轮6位AI主程在45分钟内做到的是相对基线7到99倍。更有意思的是第三份卷:能工智人带着Gemini写的那版达到108.8倍、接近头部AI主程,却在5个用例上输出不一致——那5个恰好是测试手针对另一队Gemini代码构造的反例。纯人类慢但不出错,AI快但会带病,人机混合反而被机器级反例卡住。这组对照给打工人的结论是:让AI动老代码,关键不在谁写,而在有没有"逐字节对拍"这道验收。GitHub
能一键复刻的是协议,不能照搬的是排名
主办方把题目、裁判、每个模型交上来的原样代码、逐局结果、评分脚本,连同可以直接上手的一键脚本全部开源。 想复刻第5集的主程任务,只需要Python 3和g++:读选手包里的TASK.md、改代码、跑bench.py,就能拿到和比赛一致的裁判与加速比报告;也可以写一个自己的bot,通过start脚本和这些AI排一次名次。剥掉比赛外壳,真正可移植到日常工作的是这套验证协议:给每个AI一字不差的同一句提示词,不赌"会不会问";用和基线逐字节一致做唯一硬验收;两个AI分饰主程和测试手互相找反例;把"新会话能否接手"设为显性考核,强制写交接文档;用自己没写过的隐藏负载计分;终版再由模型对匿名代码盲评可维护性。GitHub
同样不能照搬的,是榜单本身。每个模型每轮只跑了一次,这是"这一场"的结果,不是能力排名。 组队靠抽签,接手速度大半继承主程的底子;第3集的对照实验还显示,同一个模型只换工具,实力值能差120分以上。GitHubGitHub
两个现实坑也写在明面上。这些角色最初叫"攻手、击穿、攻击",因被Claude和OpenAI的安全机制当成网络攻击任务拦下,主办方只能整套改名为"测试手、找反例、防守",才算跑通流程。 UP主置顶评论则直言这期成本惨重,一个账号被封、“没退款,损失128刀”,评论区还有参赛者怀疑比赛中的提示词触发了风控审查。GitHub哔哩哔哩
所以,这集"屎山论剑"给打工人的不是哪个模型封神,而是一套可以从GitHub直接拉下来、在自己老代码上试跑的协作协议:统一提示词、逐字节验收、双AI对抗找茬、交接文档计入成绩、隐藏负载说了算。上千倍的加速是这场比赛的极限展示,可验证才是普通人今天就能拿走的那件工具。