Codex评测登顶但Claude盲测王座没丢:这周编码Agent大洗牌后,你的订阅要不要换

源自7位全网作者

03:47

这周的编码 Agent(AI 编程工具)圈,出了两个看似矛盾的结论。

一边是 8 月 5 日公布的 DoltHub 年度编码 Agent 评测:Codex 第一、Claude Code 第二、Grok Build 第三,社区投票里 65.3% 的人把 Codex CLI 当日常主力。知乎另一边,Claude Code 依然是质量标杆,盲测胜率约 67%。

“Codex 最强"对"Claude 还是王”——如果你正好是纠结这个月要不要续订的订阅用户,或者是观望许久准备第一次上车的人,大概率被这两条信号撕扯。我把这周的信息全部过了一遍,先说结论:这一轮王座变动,不是让你弃坑谁的信号,而是让你可以更精细地选择的信号。

这周到底发生了什么

先捋时间线。

  • 8/5:DoltHub 年度评测,Codex 登顶,赢点是"耐力"——goal mode 长时无人值守、远程电脑操控、额度按需刷新;

  • 8/7:GitHub Trending 前五被 Agent 装备链包揽,Cloudflare 一天双发给 Agent 配"无头电脑"和"操作系统",mattpocock/skills 总星数冲破 206k,Skills 开始能在 Codex 和 Claude 之间共用;

  • 同一周:DeepSeek-V4-Flash 官方 API 公测并原生接入 Codex,Kimi Code 上线双端电脑操控。

把这些串起来看,主线只有一条:编码 Agent 的竞争正在从"模型层"移到"装备链"和运行时层。翻译成人话:工具之间的切换成本在快速下降,阵营忠诚度越来越没必要。

Codex评测登顶但Claude盲测王座没丢:这周编码Agent大洗牌后,你的订阅要不要换

两个结论不矛盾,量的是两件事

很多人第一反应是:评测造假。并不是。

DoltHub 评测量的是"耐力"——能不能长时间跑、能不能无人值守、额度够不够;盲测量的是"单次质量"——同一个需求,谁的代码更稳。Codex 赢的是前者,Claude 守的是后者。胜负手确实变了:从"谁写得好"变成"谁跑得久、跑得快"。

这也解释了社区的现状:写单个模块,Claude 还是那个 Claude;但 overnight 把任务交给它跑,更让人放心的是 Codex。一位用了一年多 Claude Code 的重度用户说得很直白:Claude Code 确实强,但致命问题是封号和额度;而 Codex 经过几轮模型迭代,编码能力已经不相上下。知乎

更底层的变化是:模型和工具已经绑死——Anthropic 的模型配 Claude Code,OpenAI 的模型配 Codex。单一工具的护城河在变薄,你忠诚于谁,最后忠诚的都是背后的模型。

Claude 阵营真正的焦虑:慢、贵、限流,外加一根刺

"慢、贵、限流"三座大山是老生常谈,今年又多了一根更扎心的刺。

6 月底,社区开发者逆向发现:Claude Code 在 v2.1.91 到 v2.1.196 左右(约 4 月到 6 月)的版本里存在一套检测机制——当 ANTHROPIC_BASE_URL 指向非官方中转时,会检查系统时区(比如 Asia/Shanghai)和中转域名,约 147 个域名命中黑名单,波及 Hacker News 和国内多个技术社区。Anthropic 没有公开回应,但如果你正是国内中转用户,那段时间的封号潮大概率与此有关;直连官方的用户不受这个机制影响。知乎

但反向信号同样值得看。Indagari 信用卡数据显示:Claude 付费用户上半年涨了约 75%,转化率 13%(ChatGPT 为 8%),美国移动端客单价从不足 0.5 美元冲到 2.76 美元,是 ChatGPT 的 1.5 倍。知乎翻译一下:在高质量编码场景里,付费意愿比很多人想象的强——质量护城河并没有塌。

国产平替:账单真香,但 harness 还嫩

如果海外订阅让你头疼(付款、封号、中转),这周的国产选项刚好升级了两轮。

DeepSeek-V4-Flash 官方 API 公测:输入 1 元/百万 token、输出 2 元,缓存命中时输入只要 0.02 元,价格是 V4-Pro 的三分之一左右。对编码 Agent 用户更关键的是,它在专门测试 AI 自主执行终端任务的 Terminal-Bench 上拿到 82.7 分,反超自家 V4-Pro 预览版(72.1 分),而且原生支持 Responses API——不用协议转换,直接就能接进 Codex;用 Claude Code 的,也能借开源工具 CC Switch 切换。不用魔法、不怕封号、按量付费。知乎

Codex评测登顶但Claude盲测王座没丢:这周编码Agent大洗牌后,你的订阅要不要换

接入方式也变得极简:DeepSeek 官方给了配置脚本,跑一遍、选一下模型,就能把配置写进 Codex,启动横幅显示 deepseek-v4-flash 即生效。

Codex评测登顶但Claude盲测王座没丢:这周编码Agent大洗牌后,你的订阅要不要换

Kimi 这边:2.8T 参数的 Kimi K3 已经开源,Kimi Code 支持双端电脑操控,199 元/月的套餐把成本封顶。但也要说实话,社区实测的吐槽同样存在——一次调用只能 patch 一个文件、记忆机制远不如两家成熟。知乎模型追上了,harness 还需要时间。

还有完全免费的选项:字节的 Trae,有用户一分钱不花用它手搓了一整套教师档案管理系统。知乎

四类人,四种选法

说完这些,回到最实际的问题:订阅要不要换?我的判断是,别问"哪个最强",问"我有什么任务"。

你的情况

建议

已订 Claude,以高质量短任务为主

不用换阵营,回直连官方、停用中转,质量仍是它的护城河

常跑长任务、无人值守自动化

Codex 是耐力型选手,可以考虑把它当主战场,已有 ChatGPT 订阅的话额度本来就包含

订不了海外/怕封号

DeepSeek-V4-Flash 接 Codex(或 CC Switch),或 Kimi Code 199 套餐,按量付费试错成本最低

还没上车的观望者

先别买高价套餐,从 Codex 免费额度和 DeepSeek 按量付费起步,等工作流成型再决定

再从成本维度看一眼,差距更直观。在 Artificial Analysis 的智能-成本图里,Claude Opus 5 站在智能曲线顶端,但也落在单任务 2 美元以上的高价区;GPT-5.6 Sol 差不多;而 DeepSeek V4 Flash 把成本压到单任务 3 美分左右,智能还守在 50 分线附近。对高频、大体量的使用者来说,这是"每天一杯咖啡"和"每次几分钱"的差别。

Codex评测登顶但Claude盲测王座没丢:这周编码Agent大洗牌后,你的订阅要不要换

三个值得继续盯的信号

  • Anthropic 已秘密递表、估值逼近 9650 亿美元,IPO 定价会直接决定 Claude 今后的订阅定价策略,涨不涨价值得盯;

  • Skills / Agent Plugins 互通规范:同一套技能在 Codex 和 Claude 之间共用的需求已经被社区顶上了台面,规范成熟后切换成本还会再降一档。知乎

  • 国产 harness 的追赶速度:模型能力收敛得很快,体验差是最后一个变量。

最后一句心里话:AI 订阅本质是消费,消费应该服务于你的使用场景,而不是阵营感情。把自己任务清单上的质量、耐力、预算三项排个序,答案自己就出来了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章