10 月 10 日下午,B 站 UP 主"喵了个猫了个咪了个猫"更新了"AI 算法对抗大赛"第 5 集:12 个模型分成 6 支双人队,接力优化一份又慢又乱的 C++ 老代码,最快的提速上千倍,有的却比原来还慢。 题目、提示词、各队原样代码、成绩和裁判脚本在发布当天同步开源进了 GitHub,仓库的说法是"全部比赛材料"。 这等于第一次把"堆一堆大模型订阅干工程活划不划算"的账本摊开在能复算的证据面前:票面价比想象中便宜,真正贵的三样东西——限额、封号、渠道漂移——没有一样写在价目表上。哔哩哔哩GitHub
这场比赛的规则,比多数 AI 写代码演示严格
12 个模型在同一台 Windows 11 电脑上做题,分成"主程"和"测试手"两档各 6 个、随机配对成 6 队:第 1 轮主程给基线提速且输出逐字节不变,第 2 轮测试手去别队代码里构造反例,第 3 轮测试手换新会话接手本队代码,修回归、加需求、继续提速,每轮 45 分钟封顶,赛后用隐藏负载统一计时。 成绩是两极的:五份成功的终版比原始代码快了约 400~2700 倍,快到碰到 Windows 计时精度的下限;MiMo V2.6 Pro 配 GPT-6 Astra 的队 F 以 90.8 分拿下团队第一,用谷歌免费额度参赛的 Gemini 3.8 Flash 主程榜跑出 101 倍平均加速、却被全部 5 名测试手找到反例,而 Grok 4.7 用满 45 分钟交上来的代码一行没改,整队归零。GitHubGitHub
12 个席位的票价:叠加起来没有想象中贵
先分清这 12 个席位是怎么进来的:三个 Claude 模型走 Anthropic 官方订阅、两个 GPT 模型走 OpenAI 官方订阅,Kimi、DeepSeek、GLM、MiMo 四家经 Cline 通行证调用——豆包就是在这一步被换掉的,“Cline 余额通道对豆包的计费异常地贵,改走火山方舟”,Gemini 用的是谷歌免费额度,Grok 是账号池调度的官方账号。仓库没有公布实际账单。 票面价可以对着公开整理估:Claude Pro 月付 20 美元,再往上一档是 Max,100 美元一个月起。 国产侧按同一时期的比价整理,GLM 的 Pro 套餐 149 元约 2500M token。 把这些票按各自门槛叠加,整场的月票价大概率落在几百元到几百美元的区间——注意这是票面推算而非主办方账单,但方向是清楚的:单看订阅费,堆 12 个席位并不贵。GitHub知乎知乎专栏
人类对照组,才是这笔账的分母
仓库附录里有一组不进任何榜单的数字:两位人类选手拿到和 AI 一模一样的第 1 轮选手包做同一道题,不限时。C++ 初学者 Cat 在交接文档第一行记了五段工作时间,加起来是 20 小时 11 分,提速 2.6 倍;有竞赛背景的能工智人自己做了大约 2 小时,提速 1.7 倍;他带着 Gemini 另写的那一份平均提速 108.8 倍,却在测试手留下的 28 个反例用例里有 5 个输出不一致。 人类慢但稳,AI 在 45 分钟封顶内快出一个数量级还能全对,"人带模型"的组合反而先栽在正确性上。同样是"买输出",票面价的订阅几乎不可能贵;前提是你买到的输出稳定可用——而这恰恰是比赛花了三天反复验证失败的部分。GitHub
价目表之外的三张账单
第一张是限额。10 月 6 日第一轮赛后的晚上,Grok、Sol、Astra 三家正常做完,Claude 三家却"因为用户的额度用完",整个第 3 轮推迟到两天之后。 这不是这家比赛的新烦恼:第 1 集简介里 UP 主已经写过"glm真的没额度了对不起",还提到走 OpenRouter 通道时"大出血了"。 供给端也在收紧——Kimi K3 刚发布,月之暗面就停掉了新订阅,官方理由写得很直白:需求逼近了现有算力的上限。GitHub哔哩哔哩知乎
第二张是封号。10 月 8 日晚,主办方的 Fable 账号被 Anthropic 封掉,当晚开赛的 Sonnet、Opus 和替补 Astra 全部作废,次日账号才恢复,队 B 的第 3 轮差点换人顶替。 UP 主在评论区自述这次"才用了一周",没退款,“损失128刀”;评论区有人猜测封号与比赛途中的提示词触发审查有关,这属于无法核实的推测。GitHub哔哩哔哩
第三张是渠道漂移:你付钱买到的,未必是你以为的那个模型。GLM 名义上走官方生态的工具,实际"经 Cline 通行证路由到第三方量化版",DeepSeek、Kimi、MiMo 同样没走各家的官方接口。GitHub
第 2 轮第一次开跑时,任务措辞里的"攻防""击穿"让 Fable 直接拒绝执行,GPT 两家也被 OpenAI 的网络安全分类器中止,改写成"回归测试"才放行。 而仓库公平性说明里有一句现成的总警告:第 3 集的附加实验显示,同一个模型只换工具,实力值能差 120 分以上。GitHubGitHub
划不划算,取决于你买的是哪一种确定性
那篇知乎回答里有一句比任何价目表都好用的话:订阅是租一个带闸门的水管,接口是买水。 如果目标是比较模型、验证多智能体流程,堆订阅是划算的:几百元的票价换回 12 个并行入口和一套能逐字节复算的材料,这种比赛除了堆订阅没有第二种开法。如果目标是稳定的生产级编码助手,堆叠反而是最贵的用法——限额会让你等、封号会打断你、渠道漂移让你测到的不是真实水平,这场从 10 月 6 日跑到 9 日的比赛,作废、重跑、替补贯穿始终。 最后一条边界是仓库自己写在"解读时请注意"里的:每个模型每轮只跑了一次,这些成绩是"这一场"的结果,不是能力排名。 把名次当采购清单,本身就是对这笔成本账的误读——堆订阅费买得到入场券,买不到确定性,后者才是这场实验真正测出来的东西。知乎GitHubGitHub