Codex实测:修bug准确率74.5%比GPT-5还强,但这3类活它真接不住
源自60位全网作者
20:36
精选参考来源
1
我拿 Codex 干了三个月活,它的能力边界,我摸清楚了
2
别盲目Vibe Coding了。这几个月,ClaudeCode、Codex让很多OPC创业者心潮澎湃
连艺人都开始代言 Coding Agent 产品了,大家似乎相信,只要会描述需求,就能把产品“生成”出来
但 VibeCoding 的大热,也让程序员也开始在各平台频繁发声:别再制造垃圾了,根本用不了
最近,MIT 和 CMU 也发了两篇论文,分析“ VibeCoding 到底不靠谱在哪里?”
CMU 发现,模型非常擅长通过测试,却不擅长理解隐藏的安全约束。CMU 团队构建了一个名为 SusVibes 的基准测试,从真实开源项目中抽取 200 个历史上曾产生安全漏洞的软件任务
研究人员让 Claude Sonnet 驱动的 SWE-Agent 等主流 Coding Agent 完成这些任务,结果模型生成的代码有 61% 能通过功能测试,同时满足“功能正确”和“安全可靠”的比例只有 10.5%
换句话说,超过 80% 的可运行代码都存在安全漏洞
MIT 则对超过 10 万名 GitHub 开发者进行了追踪。结果是,Coding Agent 让代码提交量增长了 180%,文件修改量增长接近 300%,但真正进入生产环境的软件发布量,只增长了约 30%
Codex、ClaudeCode可以极大提升代码生产速度,但从代码到产品之间,还存在评审、测试、架构、上线、运维等一系列环节
MIT 的研究甚至发现,AI 与人类工作的替代弹性仅为 0.25,两者更接近互补关系
因此,“Vibe Coding 取代程序员”有点无稽之谈了,最有含金量的 review 仍然只有他们能做
接触的很多开发者也都表示,现在的工作流程就是 Agent 负责大段生成,人负责判断需求是否正确、实现是否可靠、架构是否合理,以及是否应该被部署到生产环境
很多人期待 Coding 的未来成为英国工业革命时期的自动化流水线,但开发是一套责任链,代码可以自动生成,责任没法自动转移,“信任”更是不可再生之物
#ai #AI #vibecoding #学术 #论文
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹