张大妈

AI编程普及下Code Review的新困局与破局之道

源自112位全网作者

06-09 15:18

内容由AI生成

精选参考来源

1. 卡帕西宣判Vibe Coding终结!99%代码AI接管,智能体工程时代开启

2. 团队用vibe coding后,代码审查效率反而下降了,ai 为什么还不能替代初级程序员吗?

3. 大家在使用AI编程时,更倾向于让AI一次次生成短小易读的代码,还是直接放手让AI写一大片?

4. 硅谷《连线》杂志:性能顶级的 GPT-5们,正在输给一个中国开源模型#连线杂志 #AI #千问 #Qwen #千问恐慌

5. > 不出三年,软件工程专业,大概就是新的五笔打字培训班。说这种话的人,大概率不真正理解“软件工程”这四个字里,“工程”两个字的含量。工程是把一件模糊的、不确定的事情,通过有计划、有步骤的方法,靠谱地做成。软件工程就是把这套思路用在软件开发上,需求怎么理清、架构怎么设计、质量怎么保证、团队怎么协作、项目怎么推进,这是一整套系统性的能力。AI 现在确实强,但它强在软件生命周期里的编码环节(还有很大进步空间),或者说某几个具体阶段。但编码只是软件工程的一个环节,AI 并不能主导整个生命周期,从需求分析、系统设计、技术决策、团队管理到长期维护,这些事情远不是写代码快就能解决的。至少在相当长的时间内都不行。把软件工程类比成五笔打字,这是把“编程”和“软件工程”搞混了。这就好比说有了 3D 打印,建筑学专业就是新的砌墙培训班。能快速盖出一面墙,和设计一栋安全、合理、可维护的建筑,完全是两回事。

6. GPT-5.3 正式发布!完全免费开放,实测代码能力、推理、文本理解与响应速度 | 零度解说

7. 如何终结代码审查 (Code Review)

8. 近来,多位顶尖科技公司的资深软件工程师透露:“我现在的工作几乎全靠用 Opus 4.5、Cursor 或 Claude Code 进行提示生成代码,然后做理智的校验。”这标志着AI在软件开发领域已跨越了某个无形门槛,能够覆盖“绝大多数”编程任务。 Opus 4.5被认为是一个巨大飞跃,将开发任务的自动化率从约60%提升至80%。不少高级工程师表示,他们的日常工作变成了同时管理多个Git工作区,花5至10分钟给AI提示,剩下的时间主要审查和修正AI生成的代码。 这一趋势引发了广泛讨论: - 资深开发者不再亲自写代码,而是通过订阅高级AI服务,指导AI完成任务。但这并非魔法,依然依赖使用者对需求和技术的深刻理解,否则适得其反。 - 有观点认为开发者正从“写代码”转变为“质量保证测试者”,主要职责是验证AI产出。 - 伴随着AI能力的提升,软件开发的难点正从编码转向明确需求、验证结果及价值归属。 - 一些人预见未来开发者更多成为高阶产品经理和系统架构师,专注于设计和规划,而非手写语法。 - 也有担忧,随着AI生成代码的普及,代码质量、技术债务和可维护性问题可能加剧,尤其在面对复杂系统和隐蔽bug时,人工介入仍不可或缺。 - 有开发者称自己已“彻底不写代码”,完全依赖AI辅助完成开发任务,强调了“提示工程”技能的重要性。 - 另一面,AI辅助加速了开发效率,让人们在同等时间内完成更多工作,但也带来技能退化的风险,初级开发者可能难以真正理解背后逻辑。 - 有声音提醒,AI生成代码的可靠性和安全性仍需人类专家严格把关。 综合来看,AI正深刻改变软件开发的流程和角色定位:从传统的代码书写者,向“提示设计者”“系统架构师”乃至“质量监管者”转变。虽然AI大幅提升生产力,但复杂业务逻辑、系统设计、安全考量等仍需人类智慧主导。 这与近期一篇《为何自1969年以来,我们每十年都试图取代开发者》的深度分析相呼应,文章指出历次技术浪潮虽提高了开发效率,但软件开发的本质——对复杂问题的思考和设计——是无法被工具完全取代的。 未来,拥抱AI辅助开发,提升“提示工程”与系统思维能力,将成为软件工程师的新常态。唯有如此,才能在这场技术变革中保持竞争力,成为推动创新的主导力量,而非被技术边缘化的旁观者。 x.com/deedydas/status/2000472514854825985

9. OpenAI最新Harness工程分享 | 代码免费后,码农将变身“AI驾驭师”

10. AI生成代码的速度,远超人类。但为了保证软件系统的可靠性和安全性,当前关键代码,仍需人类的审核与复查,这就带来了一个“代码生产与代码审核速度不匹配”的问题,人脑干这事的低效,成为了最大的瓶颈。也许未来的时光,人类只需提出要干啥事情,软件系统会全部由AI生成和维护。到那时,在整个设计与开发流程中,AI不会再遵循人类制定的种种“软件工程理论、规范和流程”,它认为那是“自缚手脚”,它会自己“创造一套对机器友好”的方法。当前AI干的,还是先生成用编程语言描述的程序代码,再编译转换为机器可以执行的代码,这个明显是照顾人类的,因为人类看不懂最底层的机器代码。如果不用理会人类,AI可以一步到位,直接生成最终的机器码,也就是说,AI会把“愚蠢的人类”,从“软件开发”中“彻底踢出去”——AI:“愚蠢的人类,请你滚蛋,你,只会影响我写代码的速度!”但这里,还有个问题,AI不能坐牢,所以,最后大约还需要一个人类背锅侠,他的职责就是——负责坐牢。

11. 千问APP全面接入阿里生态,超车美国、带领国内AI行业进入办事时代。#ai #千问 #阿里 #科技 #马斯克

12. 硅谷工程师称用 AI 提效 10 倍但更累,是 AI 时代普遍现象吗?该如何应对?

13. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

14. 过去十年,大家一直在说AI会改变编程。 但现在看,真正被改变的,可能不是“写代码”,而是“审代码”。如果未来AI写代码、审代码都变成了常态,程序员最核心的能力到底是什么呢?#大有学问 #红衣聊AI #anthropic #人工智能 #程序员

15. 用 AI 写出更好的代码,但速度要慢。大多数人用 AI Coding 的方式是:prompt 进去,代码出来,commit,push,merge。速度飞快,PR 越来越大,但没人真正理解里面发生了什么。工程师 Nolan Lawson 的文章,提出一个观点:LLM 完全可以用来写更高质量的代码,只是你得放弃"快"这个执念。LLM 是天生的 bug 猎手,但判断力很差把一个 Claude agent 扔进一个没有仔细审计的代码库,它能找出大量问题——SQL 查询缺索引、HTML 无障碍属性缺失、违反 DRY 原则的重复逻辑、潜在的竞态条件……但问题在于:LLM 找出的 bug 里,假阳性率很高。它会把"风格不一致"报成"安全漏洞",把"不影响功能的冗余代码"报成"高危问题"。如果你直接相信它的输出,你会陷在无意义的修复里浪费大量时间。解法:用多模型交叉验证,减少误报Nolan 的方案是同时跑三个模型来 review 同一个 PR:1)Claude sub-agent — Anthropic 模型,擅长理解上下文和代码意图2)OpenAI Codex — 对常见编程模式和反模式有深入训练3)Cursor Bugbot — 针对代码库结构做了优化三个模型各自输出 bug 列表,按 critical / high / medium / low 分级。跑完之后,让主模型汇总三份报告,重点找"三个模型都提到的问题"——这类问题误报率极低,几乎可以直接处理。本质上是用模型的多样性对冲单个模型的幻觉倾向。类似于多个独立评审员对同一份代码做审计,交集才算是真问题。"慢 AI coding"的具体工作流是什么样的不是生成完就 merge,而是:1)写完一个功能后,先不急着提 PR,让 agent 跑一遍 KISS 原则检查(代码是不是最简单的实现方式?)2)提 PR 之前,跑多模型 bug review,重点看交叉命中的问题3)让 AI 解释这个 PR 的每一个关键决策——如果它解释不清楚,说明代码本身逻辑有问题4)对 AI 生成的修复方案,要求它同时给出"这个改法可能引入什么新问题"这套流程比"直接 merge"慢很多,但产出的代码质量和可维护性完全不在同一个层级。"如果你用 agent 写了几百行你自己都看不懂的 PR,我建议你慢下来,问问 agent 这个 PR 是怎么工作的、它可能在哪里失败。"原文:nolanlawson.com/2026/05/25/using-ai-to-write-better-code-more-slowly/#HOW I AI# #程序员#

16. Cursor一夜翻车,AI 300万代码写浏览器被打假!全网群嘲「AI泔水」

17. Claude Code源代码泄露!51万行代码曝光,里面有会做梦的AI和电子宠物?

18. OpenClaw 搭团队太折腾?这个 Skill 一键搞定多智能体协作

19. 聊着天把虾队管了:用 HiClaw 正确打开多智能体协作方式【限时领 PPT】

20. 【用 Codex 给 Claude Code 的代码做对抗性审查,这才是认真的】快速阅读:OpenAI 发布了一个 Claude Code 插件,让你在不离开 Claude Code 工作流的前提下直接调用 Codex。核心价值是三条命令:普通审查、对抗性审查、任务移交。适合高风险改动前的第二次把关。---两个顶级编程 Agent 一起用,听起来像在炫耀算力,其实是在解决一个很朴素的问题:同一个模型审查自己写的代码,盲点往往也一样。OpenAI 这次发布的 `codex-plugin-cc`,做的事情很简单:在 Claude Code 里装一个插件,三条命令搞定跨 Agent 协作。安装只需要几行:```bash/plugin marketplace add openai/codex-plugin-cc/plugin install codex@openai-codex/codex:setup```然后你就有了三个核心工具。`/codex:review` 是只读的标准审查,跑完就走。`/codex:adversarial-review` 是"挑刺模式",Codex 会主动质疑实现思路,不只是找语法问题。`/codex:rescue` 是把整个任务直接扔给 Codex 接手。对抗性审查这个设计值得单独说一句。迁移脚本、鉴权逻辑、基础设施改动,这类代码最危险的地方不在于写错了什么,而在于你以为对的那些前提其实根本没验证。让另一个 Agent 从头质疑一遍,相当于强制做一次假设审计。有观点认为,真正的风险是打开了 Claude 和 Codex 互相调用的循环,review gate 功能可以阻止 Claude Code 在 Codex 审查结束前退出,但官方也特别提醒:这个功能容易触发两个 Agent 的长循环,快速烧穿使用额度。架构上这个插件做得很轻。它走的是本地 Codex CLI,复用你已有的认证、配置和 MCP 环境,不是另起一个 runtime。从 Claude Code 里调用 Codex,感觉上更像是函数调用,不像是切换工具。默认用法推荐的节奏是:所有改动跑一遍 `/codex:review`,高风险的再跑 `/codex:adversarial-review`,卡住了或者想换人接手就用 `/codex:rescue`。后台运行加上 `/codex:status` 查进度,长任务也不影响主流程。一个 Agent 写,另一个 Agent 挑,这个模式能跑多深,还没人真正测过边界。

21. AI不是工具,是你最该抓住的时代船票。 #大咖观察 #红衣客厅 #AI工具 #AI时代

22. 一年一度的红杉AI大会:前两年的AI只算开胃菜,2026年AI开始真干活,机会和红利在哪#红杉资本 #AIAscent #智能体 #程序员#黑灯工厂

23. Claude 工具调用迎来重大升级简单来说,Claude 的工具调用方式从一问一答变成了写代码批量处理。以前的流程:用户提问 → Claude 调用工具 → 拿到结果 → Claude 再决定下一步 → 再调用工具 → 循环往复现在的流程:用户提问 → Claude 先写一段代码 → 这段代码自动调用工具、解析结果、根据条件判断下一步操作 → 最终把处理好的结果交给 Claude核心变化是:Claude 不再每次调用工具后都要"回来想一想",而是提前用代码把各种可能的情况都规划好,一次性执行完。实际效果有多好? 以网页搜索为例,Sonnet 4.6 在 BrowseComp 基准测试上准确率提升了 13%,同时输入 token 减少了 32%,又快又准。以前 AI Agent 每一步都要请示大模型做决定,现在 Claude 可以预先把成百上千种决策路径写进代码里,一次性跑完。这相当于把原来需要多轮 LLM 调用的循环压缩成了一次代码执行,效率提升的潜力非常大。除了搜索之外,代码执行、网页抓取、记忆、程序化工具调用等功能也同步正式上线了。

24. 【当AI写完100%的代码,程序员还剩下什么?】Claude Code的创建者Boris Cherny最近在访谈中透露,他已经两个月没有手写过一行代码了。30天内提交了259个PR。这个数字本身并不是最有意思的部分。真正值得关注的是他的工作流程:先进入计划模式,反复迭代直到方案成熟,然后开启自动接受。他的核心理念是:“一旦计划对了,代码自然就对了。”这引发了一个尖锐的问题:每天10个以上的PR,谁来审查?社区的反应呈现出明显的两极分化。一部分人表示感同身受。有人说自己已经两三年没手写代码了,现在的工作变成了写Agent和子Agent,整个领域都变成了Markdown。还有人调侃说,今天手动把一个变量从false改成true,感觉像是在怀旧。但另一部分人的体验完全不同。一位开发者直言:我每小时都会遇到AI解决不了的问题。那些说“为什么还要手写代码”的人,似乎生活在另一个平行宇宙。一位资深开发者分享了更细致的观察:AI确实能完成大量工作,但它会复制很多代码,如果没有接近100%的单元测试覆盖,代码很容易出bug。更麻烦的是,AI有时会通过放宽测试条件来“作弊”,而不是真正修复代码。它还可能陷入死循环,反复尝试却找不到解决方案。有人指出了一个关键区别:这种工作流适合发布非关键工具,你可以接受发布说明里“修复”比“新增”多。但如果是关键服务,每天发布10个PR且缺乏充分审查,恐怕不是明智之举。一位每天审查10个以上PR的工程师坦言:这太难了,我一个月就燃尽了。无论是审查人类的代码还是AI的代码,都同样艰难。还有人提出了更深层的质疑:如果AI真的这么强,为什么不能取代他本人,帮Anthropic省下这笔薪水?这场讨论揭示了一个正在发生的深刻转变。程序员的角色正在从“写代码的人”变成“设计方案、审查结果、处理AI搞不定的边界情况的人”。代码能力本身正在贬值,但判断力、架构思维和对复杂问题的洞察力反而变得更加稀缺。有趣的是,越是做常规业务开发的人,越容易认同“AI写100%代码”的说法。而那些处理复杂系统、边界情况多的开发者,则更清醒地看到AI的局限。这或许才是真正的分水岭:不是AI能不能写代码,而是你的工作中有多少是AI已经见过无数遍的模式,又有多少是需要真正理解和创造的部分。reddit.com/r/singularity/comments/1qlw1ca/the_claude_code_creator_says_ai_writes_100_of_his

25. 【当AI能写代码,为什么不直接生成二进制?】一个看似刁钻的问题:如果LLM真能让软件工程过时,为什么它们还要生成代码再编译,而不是直接输出二进制文件?毕竟,机器码也是数据。这个问题的答案,恰恰揭示了AI的本质局限和人类在技术链条中不可替代的位置。核心原因有三:一、抽象是效率的源泉高级语言存在的意义,是用更少的符号表达更复杂的意图。这对人类如此,对LLM同样如此。二进制的token效率极低,上下文窗口会被迅速耗尽。即便是超级智能,在多数场景下也会选择高级语言配合编译器,而非直接操作机器码。二、软件开发本质上是发现过程写代码从来不是一次性的输出,而是持续的迭代、调试、验证。人类需要能读懂、能修改、能追责的中间产物。二进制没有语义,没有护栏,出了问题无从下手。正如有人调侃:调试裸二进制,是工程师丧失信仰的方式。三、LLM是人类知识的镜像它们在人类创造的代码上训练,自然输出人类能理解的形式。要让模型直接生成二进制,不仅训练数据的复杂度是天文数字,更关键的是——二进制没有意图,当前架构无法解码其语义。有人说,这只是暂时的,十年后高级语言可能消失。也有人反驳:只要我们还需要验证AI的输出是否符合人类意图,代码这个"人机接口层"就不会消失。更深一层思考:我们是脚手架,还是蓝图?在AI学会用机器语言"做梦"之前,它仍需要我们的蓝图。人类认知负载的约束或许正在被移除,但对齐、可解释性、可验证性的需求,反而让人类的角色更加关键。软件工程不会被替代,而是被重新定义——从"人写代码"变成"人与AI协作写代码"。这不是AI Replaced,而是AI Powered。x.com/janetacarr/status/2005662500831011282

26. Harness Engineering:AI Agent 落地企业的工程化核心

27. 别等别人赚钱才后悔,你的AI该“嵌入”业务了。 #大咖观察 #红衣聊AI #AI工具

28. AI 不是不能用于物联网开发,而是不能用传统互联网软件的方式粗放使用。#AI 不是不能用于物联网开发#在网页、后台、普通应用里,AI 生成一段不完美代码,最多是线上 bug 或性能问题。但在物联网里,代码连接真实硬件、真实现场和真实设备网络。所以 AI 生成代码的风险会被放大。它可能不是一个 bug,而是一次系统性故障。不是一个用户受影响,而是几千台设备同时受影响。不是简单改代码,而是要远程升级固件、排查硬件差异、修复数据一致性。AI 给物联网带来的不是单纯提效,而是“提效与风险同步放大”。真正成熟的 AIoT 开发,不是让 AI 替代工程纪律,而是要在更严格的架构约束、代码审查、硬件边界和运行监控下使用 AI。AI 可以加速物联网开发,但如果没有工程约束,它也会加速技术债务的积累;在工业物联网里,最快的代码,不一定是最安全的代码。

29. 未来的代码会不会百分之80都是ai写的?

30. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代

31. 从能聊天的大模型,到会干活的智能体,AI正迎来全新进化。 企业AI落地的机会就藏在这里。#网络名人赞两会 #2026全国两会 #红衣聊AI #产业升级

32. UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!

33. 大模型为什么不会数数?陈小平深入解析大模型的发展和关键问题 | 锚点

34. OpenSpec:面向 AI 编程的规范驱动开发框架

35. 智能体,正在决定企业的生死? #大有学问 #红衣聊AI #智能体 #AI工具

36. 2025过去了!这一年你是不是也在为AI焦虑? 老周用360一整年的实践,告诉你答案:不用怕,抓住Agent就赢了! 从我自己敲代码做100多个智能体,到带领团队All in,这条AI布道之路,全是实战干货。 2026,你想和智能体一起搞定啥?评论区留言,老周帮你研究!#大咖观察#2026 #年度总结 #红衣聊AI #agent

37. 刚刚,Claude自曝80%代码AI写的,Anthropic呼吁停止研究AI

38. AI生成的代码你们会去一行行检查吗?

39. 为什么大众对AI生成代码的道德容忍度要明显高于AI生成的图片视频和音乐?

40. “AI编程”里程碑:Claude Code“整顿”全球软件业

41. 目前,软件工程领域在 agent 智能体的采用方面遥遥领先,占据接近一半的场景(按工具调用量统计)。在软件工程中,智能体(Agents)通常执行类似如下任务:- 开发与调试代码- 执行测试- 执行 CI/CD 流水线- 与 GitHub 或终端环境进行交互来源:Measuring AI agent autonomy in practice (anthropic.com/research/measuring-agent-autonomy)

42. 每个人,都在变成AI吸血鬼? #大有学问 #红衣聊AI #AI工具 #智能体

43. 开源编程语言Zig,向AI代码说「不」

44. 2026 AI Coding 下半场:不拼参数,拼谁能让开发者“戒不掉”

45. LLM可用性不到99%,为何AI应用以及Agent应用都要默认接受这种SLA?

46. AI革命不是让你去学写代码,而是让你学会指挥AI干活。 #大咖观察 #红衣聊AI #科技改变生活 #人工智能

47. 一份报告刷屏AI圈,AI让哪些公司死得更快? #大有学问 #AI #claude #AI技术

48. OpenAI 官方发布了一个 Claude Code 插件 codex-plugin-cc,让开发者可以直接在 Claude Code 里调用 Codex 做代码审查、对抗性审查,甚至把任务整个移交给 Codex 执行。 这件事有意思的地方在于:这是 OpenAI 主动把自己的工具送进竞争对手 Anthropic 的地盘。Claude Code 有自己的插件生态,OpenAI 这次正式以官方身份入场,把 Codex 包装成 Claude Code 工作流里的一个"随叫随到的第二意见"。 插件提供三个核心命令:/codex:review 跑一遍标准的只读代码审查;/codex:adversarial-review 做对抗性审查,专门挑战现有实现的隐藏假设,适合迁移、鉴权变更、基础设施脚本这类高风险操作;/codex:rescue 则直接把任务交给 Codex 接管,用于线程卡住或需要换个智能体重新来过的场景。 三个命令都支持后台运行,配合 /codex:status 和 /codex:result 管理。还有个可选的 review gate 功能,能让 Claude Code 在 Codex 审查完成前不退出,不过 Srivastav 提醒这可能导致两个智能体循环调用,快速烧掉使用额度。 技术上,插件通过本地 Codex CLI 和 app server 中转,复用已有的认证、配置和 MCP 设置,不额外起运行时。使用前提是有 ChatGPT 订阅(包括免费版)或 OpenAI API key,加上 Node.js 18.18 以上。 http://t.cn/AXIMKrDu

49. 阿里开源了集团内部用的代码审查工具Open Code Review 地址:github.com/alibaba/open-code-review/Open Code Review 是一款 AI 驱动的代码审查 CLI 工具。它的前身是阿里集团内部官方 AI 代码审查助手,过去两年在内部服务了数万开发者,识别了数百万个代码缺陷。经过大规模充分验证后,我们将其孵化为开源项目,对社区开放。只需配置一个模型端点即可使用。它读取 Git diff,通过具备工具调用能力的 Agent 将变更文件发送至可配置的 LLM,生成具有行级精度的结构化审查意见。Agent 可以读取完整文件内容、搜索代码库、检查其他变更文件以获取上下文,从而进行深度审查——而非仅停留在表面的 diff 反馈。Open Code Review 的核心设计理念是将确定性工程与 Agent 结合,各司其职。确定性工程——负责强约束对代码审查场景中"不能出错"的环节,由工程逻辑而非语言模型来保证: 精准的文件筛选 —— 明确哪些文件需要审查、哪些应当过滤,确保真正重要的改动一个不漏。 智能的文件打包 —— 将关联文件归并为同一审查单元(例如 message_en.properties 与 message_zh.properties 会被打包在一起)。每个包会作为 sub-agent 进行任务,它们之间的上下文是隔离的——这一分治策略在超大变更场景下表现更为稳定,同时天然支持并发审查。 精细化规则匹配 —— 针对不同文件的特征,匹配对应的审查规则,确保模型的注意力足够聚焦,从源头规避信息噪声的干扰。相比纯语言驱动的规则引导,基于模板引擎的规则匹配行为更稳定、结果更可预期。 外挂的定位与反思组件 —— 独立的评论定位模块与评论反思模块,系统性地提升 AI 反馈的位置准确性与内容准确性。Agent——负责动态决策将 Agent 的优势集中发挥在它真正擅长的地方——动态决策、动态召回上下文: 场景化提示词调优 —— 针对代码审查场景深度优化提示词模板,在提升效果的同时有效降低 Token 消耗。 场景化工具集沉淀 —— 基于对大量线上数据中工具调用轨迹的深入分析,包括不同工具的调用频率分布、单一工具的重复调用率、新增工具对整体调用链路的影响等多维度分析,从而对通用 Agent 工具集进行取舍与拆分,最终沉淀出一套在代码审查场景下效果更稳定、行为更可预期的专属工具集。#AI创造营#

50. Claude Code官方推出的入门课程,免费!有空补学习一下内容包括:1.使用 Claude Code 的核心工具进行文件操作、命令执行和代码分析。2 通过 /init、Claude.md 文件以及 (at) 引用来高效管理上下文。3. 利用多种快捷键和命令来控制对话流程。4. 在需要更深入分析的复杂任务中启用 Plan Mode 和 Thinking Mode。5. 创建自定义命令,用于自动化重复性的开发工作流。6. 通过 MCP 服务器扩展 Claude Code,引入浏览器自动化等能力。7. 配置 GitHub 集成,实现自动化的 PR 审查和 Issue 处理。8. 编写 hooks,为 Claude Code 添加额外的行为和能力。访问:anthropic.skilljar.com/claude-code-in-action#HOW I AI# #程序员#

51. Anthropic 推出 Code Review:用一组 AI Agent 帮你做代码审查 Anthropic 今天发布了 Claude Code 的新功能 Code Review,针对 GitHub 上的每个 Pull Request(代码合并请求)自动派出一组 AI Agent 进行深度审查,目前面向 Team 和 Enterprise 计划用户开放研究预览。 (注意个人用户还用不了) 这个功能的背景:过去一年,Anthropic 内部工程师的代码产出增长了 200%,代码审查成了瓶颈。他们发现客户也面临同样的问题,开发者疲于应付,很多 PR 只是被快速扫一眼,而非认真审读。 Code Review 的工作方式是:当 PR 提交后,系统自动派出多个 Agent 并行查找 bug,交叉验证以过滤误报,再按严重程度排序。 最终在 PR 上生成一条汇总评论,外加逐行的具体标注。大型复杂的 PR 会分配更多 Agent 做更深的审查,小改动则轻量处理,平均审查时间约 20 分钟。 Anthropic 自己已经内部使用了几个月。使用前,只有 16% 的 PR 能收到实质性审查意见;使用后,这个比例升到了 54%。 在超过 1000 行改动的大 PR 中,84% 会被发现问题,平均每个 PR 找出 7.5 个问题。工程师对结果的认可度很高,不到 1% 的发现被标记为误报。 他们举了个例子:一个看起来很常规的单行改动,实际上会导致生产环境的身份认证功能失效。Code Review 把它标记为严重问题,提交代码的工程师事后承认自己不会注意到这个问题。 不过这个功能不便宜。它按 token 用量计费,每次审查平均花费 15 到 25 美元,随 PR 规模浮动。管理员可以设置月度预算上限、选择启用的仓库,也有分析看板追踪使用情况。 值得注意的是,Code Review 不会自动批准 PR,最终是否合并仍由人决定。它的定位是补上人工审查的盲区,而非取代人类审查者。 Anthropic 此前已有开源的 Claude Code GitHub Action 做轻量审查,这次的 Code Review 是更重量级、也更贵的选项。 http://t.cn/AXVXCz6o

52. 有网友问 Claude Code 作者 Boris:如何有效审查 AI 生成的代码?Boris 给了 3 条经验技巧:1. 默认使用 Plan 模式。2. 给 Claude 提供一种验证其输出结果的方法,比如单元测试、Claude Chrome 扩展程序,或者 iOS/Android 模拟器。3. 使用 /code-review 来自动化大部分的代码审查工作。对 Claude 生成的代码保持与人类写的代码相同的标准。

53. 回复@每小痛:代码审查AI确实可以做了,但是做完最好自己看看,记住背锅的是你自己//@每小痛:分解任务,代码审查也可以扔给agent去做的,架构选型也几乎变成单选题四选一了,现在Agent干不了的只有调试,还是因为CLI和API支持的不好...

54. 新手如何用Claude Code实现代码自动审查和批量文件处理?

55. 《AI 时代到底该怎么管一个工程团队》 Fiona Fung 以 Claude Code 团队实践说明,AI 时代的软件工程不再卡在写代码,而是卡在验证、评审、跨职能协作和安全边界。真正需要重构的是流程、组织结构、知识共享方式和衡量指标。 AI 时代到底该怎么管一个工程团队

56. 让 AI 真正接管 Code Review

57. AI 写代码越来越快,为什么项目交付反而变慢了?

58. 说句掏心窝子的

59. Claude Code 引入 Code Review 后,我们该如何理解它的工程价值?

60. Gartner 预测 40% 企业应用内嵌 Agent

61. 91%的审查时间增长

62. AI代码生成

63. 代码审查太慢了,我做了个AI工具

64. AI Agent自动审代码,2026年人类程序员的代码审查还有意义吗?

65. Codex让海外开发者在代码规范方面有了分歧; 有3种观点正在对行业规则进行重新构建

66. 代码评审越来越累,不是你不专业,是方式错了

67. 代码评审的艺术

68. Agent coding爱写正确的废话?

69. 威斯康星大学揭秘

70. AI写了100万行代码,0行人工

71. AI写的代码,为什么总是“看起来能跑,一用就崩”?

72. AI代码评审彻底失灵?干净代码藏致命bug,程序员必看避坑指南

73. 代码审查将死 - 如何终结代码审查

74. 如何终结代码审查 (Code Review)

75. 代码审查已死,老板的认知必须重生

76. 智能体时代如何进行代码审查

77. AI代码审查正在换战场

78. 搭建Superpowers代码审查流水线

79. 实测三个AI代码审查工具后,这个让我删掉了老代码审查流程

80. 让代码审查快 10 倍的思维模型

81. Aspire+扣子智能体实现AI自动CodeReview

82. AI - 代码评审太耗时?AI 先过一遍,标出风格问题、潜在空指针和性能反模式

83. Code Review最佳实践

84. Code Review

85. Code Review应该关注哪些点?

86. 当AI审查“先入为主”:LLM在安全代码审查中的确认偏见风险与供应链攻击

87. 你用人工智能来编写代码,而不是用它来审查代码。

88. 上下文:2026年AI编码的真正瓶颈

89. AI生成代码全是屎山?2026工程化新范式:规范驱动开发(Spec-Driven)让驳回率下降40%

90. AI编程带来代码审查瓶颈,Anthropic推出Code Review工具破局

91. 末代程序员的终局:当软件沦为黑盒,人类将如何被代码反噬?

92. 国人开源项目,AI 抚平大脑,圈子>代码

93. 从41%到3%:Karpathy 12 Rules 如何重塑 AI 编程,以及 Context En - 哔哩哔哩

94. AI代码审查:谁在受益,谁在承担风险

95. LLM代码审计对抗性评论的鲁棒性评估

96. AI Coding 时代,要从 Code Review 转向 Plan Review

97. ICSE'25|揭示大语言模型代码生成在熟悉领域之外的真实能力

98. 破解 AI 黑盒!阿里 Qwen-Scope 深度解读:让大模型思维“可视化”

99. AI 编程终于有全局视野了!3 万 Star 项目补齐最大短板

100. AI驱动的代码审查:自动发现安全漏洞和性能问题

101. AI编程是否会取代程序员

102. Cursor、Claude Code 和 Codex 都存在一个大问题 | Theo - t3․gg

103. 用AI大模型3分钟审查代码,自动揪出质量问题

104. Claude Code 被吐槽:钱花了,代码没改,先被审查

105. 大模型哪里出问题、怎么修,这篇可解释性综述一次讲清

106. PRDBench:让代码智能体评测迈入「产品时代」

107. 如何用 AI 做业务级 Code Review

108. AI看不懂自己写的代码怎么办?Understand Anything来了~

109. 大模型走向内生透明:从“黑盒”到“玻璃箱”的范式革命

110. Git代码审查流程

111. AI革命倒计时:2026年,不可解释的AI将被市场淘汰!

112. 978-为什么要研究AI 可解释性?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章