张大妈

AI编程工具不是救世主:用错场景只会让烂代码写得更快

源自47位全网作者

05-18 09:29

精选参考来源

1
高低得试试这个,突然火🔥得不行的开源项目,The Agency(agency-agents):144个专业AI智能体,你的从不下班的AI全明星团队!支持一键部署到 OpenClaw龙虾,Claude Code,Antigravity, Cursor 等工具中。1. 高度专业化这不是"act as a developer"这种通用提示词,而是真正的职业人设。比如:1)Frontend Developer — React/Vue/Angular专家,不只是写代码,还关心Web Vitals优化和性能2)Backend Architect — API设计、数据库架构、微服务设计的深度思考3)AI Engineer — ML模型部署、AI集成、数据管道的完整理解4)Security Engineer — 威胁建模、代码审计、安全架构5)Rapid Prototyper — 快速MVP开发,不追求完美,只追求快速迭代每个Agent都有:1)独特的性格和工作风格2)清晰的使命和工作流程3)具体的交付物(代码、文档、指标)成功衡量标准例子:Code Reviewer 的自我介绍是"我不仅仅审计代码——我默认每次能找到3-5个问题,并且所有发现都需要视觉证明。"2. 分类清晰,覆盖全面144个Agent分布在12个事业部:1)工程部(50个Agent)Frontend Developer、Backend Architect、Mobile App BuilderDevOps Automator、Security Engineer、Database OptimizerAI Engineer、Embedded Firmware Engineer、SRE甚至还有WeChat Mini Program Developer(针对中国市场)2) 设计部(8个Agent)UI Designer、UX Researcher、Brand GuardianWhimsy Injector("注入一点调皮"的角色,负责交互动画和细节惊喜)3)营销部(30+个Agent)Growth Hacker、Content Creator、Twitter Engager中国本地化专家:Xiaohongshu Specialist、Douyin Strategist、WeChat Official Account Manager、Zhihu Strategist4)销售部(9个Agent)Outbound Strategist、Discovery Coach、Deal Strategist、Sales Engineer5)产品部(5个Agent)Product Manager、Sprint Prioritizer、Trend Researcher6)游戏开发部(20+个Agent)Game Designer、Level Designer、Technical ArtistUnity Architect、Unreal Systems Engineer、Godot Gameplay Scripter7)测试部(8个Agent)Reality Checker、Evidence Collector、Performance Benchmarker、Accessibility Auditor还有 支持部、项目管理部、空间计算部、专项部 等。3. 一键部署到主流AI工具支持Claude Code(官方推荐)、GitHub Copilot、Google Gemini(Antigravity)、Cursor、Aider、Windsurf、OpenClaw、Qwen Code等。项目:github.com/msitarzewski/agency-agents#HOW I AI# #程序员#
2
本地跑大模型总觉得Ollama速度不够快?切换工具链又要重新适配API,体验不佳。 Rapid-MLX 专为 Apple Silicon 打造的最快本地AI引擎,把MLX框架潜力完全发挥,提供OpenAI兼容的本地LLM推理服务。 比Ollama快2-4倍,缓存TTFT仅0.08s,支持17种工具调用解析器自动适配Qwen、DeepSeek、Gemma等主流模型,还能智能修复量化损坏输出。 GitHub:github.com/raullenchai/Rapid-MLX 主要功能: - 4.2倍Ollama速度,Nemotron-Nano 30B达141 tok/s,Qwen3.5-4B 160 tok/s; - 17种工具解析器+自动恢复,100%工具调用成功率,完美适配Cursor、Claude Code、Aider; - KV缓存+DeltaNet状态快照,多轮对话首token延迟0.08s; - OpenAI API完全兼容,LangChain、PydanticAI等框架零改动接入; - 视觉/音频多模态支持,Qwen-VL、Gemma 4图像理解,TTS/STT; - 智能云路由,大上下文自动切云端LLM,推理链分离; - 支持16GB MacBook Air到256GB Mac Studio全系列,模型从4B到158B MoE。 一键安装:brew install raullenchai/rapid-mlx/rapid-mlx 然后 rapid-mlx serve qwen3.5-4b,localhost:8000/v1 即用,开发者必备。 #本地大模型##AppleMLX##AI推理引擎#
全部
来源
内容由AI生成

精选参考来源

1. 高低得试试这个,突然火🔥得不行的开源项目,The Agency(agency-agents):144个专业AI智能体,你的从不下班的AI全明星团队!支持一键部署到 OpenClaw龙虾,Claude Code,Antigravity, Cursor 等工具中。1. 高度专业化这不是"act as a developer"这种通用提示词,而是真正的职业人设。比如:1)Frontend Developer — React/Vue/Angular专家,不只是写代码,还关心Web Vitals优化和性能2)Backend Architect — API设计、数据库架构、微服务设计的深度思考3)AI Engineer — ML模型部署、AI集成、数据管道的完整理解4)Security Engineer — 威胁建模、代码审计、安全架构5)Rapid Prototyper — 快速MVP开发,不追求完美,只追求快速迭代每个Agent都有:1)独特的性格和工作风格2)清晰的使命和工作流程3)具体的交付物(代码、文档、指标)成功衡量标准例子:Code Reviewer 的自我介绍是"我不仅仅审计代码——我默认每次能找到3-5个问题,并且所有发现都需要视觉证明。"2. 分类清晰,覆盖全面144个Agent分布在12个事业部:1)工程部(50个Agent)Frontend Developer、Backend Architect、Mobile App BuilderDevOps Automator、Security Engineer、Database OptimizerAI Engineer、Embedded Firmware Engineer、SRE甚至还有WeChat Mini Program Developer(针对中国市场)2) 设计部(8个Agent)UI Designer、UX Researcher、Brand GuardianWhimsy Injector("注入一点调皮"的角色,负责交互动画和细节惊喜)3)营销部(30+个Agent)Growth Hacker、Content Creator、Twitter Engager中国本地化专家:Xiaohongshu Specialist、Douyin Strategist、WeChat Official Account Manager、Zhihu Strategist4)销售部(9个Agent)Outbound Strategist、Discovery Coach、Deal Strategist、Sales Engineer5)产品部(5个Agent)Product Manager、Sprint Prioritizer、Trend Researcher6)游戏开发部(20+个Agent)Game Designer、Level Designer、Technical ArtistUnity Architect、Unreal Systems Engineer、Godot Gameplay Scripter7)测试部(8个Agent)Reality Checker、Evidence Collector、Performance Benchmarker、Accessibility Auditor还有 支持部、项目管理部、空间计算部、专项部 等。3. 一键部署到主流AI工具支持Claude Code(官方推荐)、GitHub Copilot、Google Gemini(Antigravity)、Cursor、Aider、Windsurf、OpenClaw、Qwen Code等。项目:github.com/msitarzewski/agency-agents#HOW I AI# #程序员#

2. 本地跑大模型总觉得Ollama速度不够快?切换工具链又要重新适配API,体验不佳。 Rapid-MLX 专为 Apple Silicon 打造的最快本地AI引擎,把MLX框架潜力完全发挥,提供OpenAI兼容的本地LLM推理服务。 比Ollama快2-4倍,缓存TTFT仅0.08s,支持17种工具调用解析器自动适配Qwen、DeepSeek、Gemma等主流模型,还能智能修复量化损坏输出。 GitHub:github.com/raullenchai/Rapid-MLX 主要功能: - 4.2倍Ollama速度,Nemotron-Nano 30B达141 tok/s,Qwen3.5-4B 160 tok/s; - 17种工具解析器+自动恢复,100%工具调用成功率,完美适配Cursor、Claude Code、Aider; - KV缓存+DeltaNet状态快照,多轮对话首token延迟0.08s; - OpenAI API完全兼容,LangChain、PydanticAI等框架零改动接入; - 视觉/音频多模态支持,Qwen-VL、Gemma 4图像理解,TTS/STT; - 智能云路由,大上下文自动切云端LLM,推理链分离; - 支持16GB MacBook Air到256GB Mac Studio全系列,模型从4B到158B MoE。 一键安装:brew install raullenchai/rapid-mlx/rapid-mlx 然后 rapid-mlx serve qwen3.5-4b,localhost:8000/v1 即用,开发者必备。 #本地大模型##AppleMLX##AI推理引擎#

3. #AI创造营# Addy Osmani 是 Google 的工程师,目前担任 Google Cloud AI director。 他刚写了一篇博客《Agent Skills》来提醒开发者:AI 编码智能体虽然能快速生成代码,但默认会跳过高级工程师重视的“隐形工作”,比如写规格、拆任务、先测试、做评审、控制改动范围、留下验证证据。本文中Addy Osmani 试图把多年在 Google 级工程体系中沉淀出的工程纪律,迁移到 AI agent 时代,让模型不只是更快地产出代码,而是在规格、测试、评审、验证和发布约束下产出更可信的软件。文章配套有开源项目 addyosmani/agent-skills ,把里面这些高级工程实践封装成了 skills 。 下面是全文翻译,makedown排版,适合web端阅读,原文在:addyosmani.com/blog/agent-skills/# Agent Skills**2026 年 5 月 3 日**高级工程师的工作,大多是那些不会出现在 diff 里的部分:规格说明、测试、评审、范围控制、拒绝发布无法验证的东西。AI 编码智能体默认会跳过这些部分。**Agent Skills** 是我试图让这些环节不再变成“可选项”的尝试。任何 AI 编码智能体的默认行为,都是走向“完成”的最短路径。你要求它做一个功能,它就写这个功能。它不会问你是否有规格说明,不会在实现前先写测试,不会考虑这个改动是否跨越了信任边界,也不会检查这个 PR 在评审者眼中会是什么样子。它产出代码,宣布胜利,然后继续往前。这正是每个高级工程师在职业生涯中都在学习避免的失败模式。任何任务的高级版本,都包含那些不会出现在 diff 里的工作:揭示假设、撰写规格、把工作拆成可评审的小块、选择朴素可靠的设计、留下结果正确的证据、控制改动大小,让人类真的能够评审它。这些步骤,正是能在规模化场景下交付可靠软件的工程师,与那些提交会破坏系统的代码的人之间的主要区别。智能体跳过这些步骤,原因和初级工程师一样:这些步骤是不可见的。奖励信号指向的是“任务完成”,而不是“任务完成,并且设计文档也存在”。所以我们必须把高级工程师的脚手架重新加回去。**Agent Skills** 就是我对这种脚手架的尝试。它刚刚超过了 2.6 万颗星,所以显然不只我一个人想要这个东西。这篇文章讲的是 README 没有完全覆盖的部分:为什么每个设计选择存在,它如何映射到标准 SDLC 和 Google 公开的工程实践,以及即使你永远不安装任何一个 skill,也应该从这个项目里借鉴什么。---## “Skill”到底是什么在 Claude Code / Anthropic 的语境里,“skill”这个词承载了很多含义,所以有必要说精确一点。一个 skill 是一个带 frontmatter 的 markdown 文件,会在情况需要时注入到智能体的上下文中。它介于系统提示片段和运行手册之间。skill 不是参考文档。它不是“关于测试你应该知道的一切”。它是一个工作流:一系列智能体要遵循的步骤,带有能产出证据的检查点,并以明确的退出标准结束。这个区别就是整个问题的关键。如果你把一篇 2000 字的测试最佳实践文章放进智能体上下文里,智能体会读它,生成看起来合理的文本,然后跳过真正的测试。如果你把一个工作流放进去——先写失败的测试,运行它,确认它失败,写最小代码让它通过,确认它通过,再重构——智能体就有事可做,而你也有东西可验证。**流程优先于散文。工作流优先于参考资料。有退出标准的步骤,优先于没有退出标准的长篇文章。** 仅仅这一个区别,就能区分有用的 skill 和漂亮的 markdown 文件。它也解释了为什么很多“AI rules”仓库在实践中最终什么都没做到:那些规则只是文章。---## Skills 编码的 SDLC这个仓库里的 20 个 skills 围绕 6 个生命周期阶段组织,上面还有 7 个 slash commands:| 阶段 | 命令 | 作用 ||---|---|---|| Define | `/spec` | 决定你到底要构建什么 || Plan | `/plan` | 拆解工作 || Build | `/build` | 以垂直切片实现 || Verify | `/test` | 证明它能工作 || Review | `/review` | 捕捉漏掉的问题 || Ship | `/ship` | 把它安全地交到用户手中 || Cross-cutting | `/code-simplify` | 横跨整个流程的代码简化能力 |这不是巧合。这就是每个正常运转的工程组织都会运行的 SDLC,只是词汇不同。Google 称之为:> 设计文档 → 评审 → 实现 → 可读性评审 → 发布清单Amazon 称之为 working-backwards memo 和 bar raiser。每个健康的团队都有某种版本的这个循环。AI 编码智能体带来的新问题是,大多数智能体默认会跳过这些阶段里的大部分。你要求一个功能,你得到一个实现,而规格、计划、测试、评审和发布清单全都没有发生。Skills 会推动智能体经过同样的阶段,这些阶段也是高级工程师强迫自己走完的流程,因为没有这些环节就发布代码,正是事故产生的方式。一个复杂功能可能会按顺序激活 11 个 skills。一个小 bug 修复可能只用 3 个。路由器 `using-agent-skills` 会决定哪些适用。重点是,这个工作流会根据实际范围伸缩,而不是根据假定范围伸缩。---## 真正起作用的五个原则这个项目里有五个设计决策是承重结构。系统的其余部分都由它们推导而来。### 1. 流程优先于散文前面已经讲过。工作流可以被智能体执行;文章不行。人类团队也是如此。如果你的团队手册有 200 页,人在压力下没人会读。如果它是一小组带检查点的工作流,人们真的会运行它们。---### 2. 反合理化表格这是这个项目里最有辨识度的设计决策,也是我最希望其他团队偷走的一个。每个 skill 都包含一张表,列出智能体,或者疲惫的工程师,可能用来跳过工作流的常见借口,并配上预先写好的反驳。| 常见借口 | 反驳 ||---|---|| “这个任务太简单,不需要规格说明。” | 验收标准仍然适用。五行可以。零行不行。 || “我稍后再写测试。” | “稍后”是最危险的关键词。没有稍后。先写失败的测试。 || “测试通过了,发布吧。” | 通过的测试是证据,不是证明。你检查运行时了吗?你验证了用户可见行为了吗?有人类读过 diff 吗? |它之所以有效,是因为 LLM 极其擅长合理化。它们会生成一段听起来很合理的文字,解释为什么这个特定任务不需要规格,或者为什么这个特定改动可以不经评审就合并。反合理化表格,是对智能体还没来得及说出口的谎言提前写好的反驳。这个模式对人类团队同样有用。大多数工程退化,并不是因为有人选择做坏工作,而是因为人们接受了听起来合理的理由,跳过了他们不想做的部分。一个会写下自己反合理化清单的团队,会少很多这样的借口。---### 3. 验证不可协商每个 skill 都以具体证据结束:- 测试通过。- 构建输出干净。- 运行时 trace 展示了预期行为。- 评审者签字确认。“看起来对”永远不够。这也是让 Anthropic 的 harness 能够从失败中恢复的同一个原则,是让 Cursor 的 planner / worker / judge 拆分真正能抓住 bug 的原则,也是任何长期运行智能体可恢复的基础。智能体是生成器。你需要一个单独的信号来确认工作已经完成。Skills 把这个信号内置进了每个工作流。---### 4. 渐进式披露不要在会话开始时把全部 20 个 skills 都加载进上下文。应该根据阶段激活它们。一个小的 meta-skill,也就是 `using-agent-skills`,充当路由器,决定当前任务适用哪个 skill。这是把 harness engineering 的经验应用到 skill 粒度上。每一个加载进上下文的 token,都会在某个地方降低性能,所以你只加载相关内容,把其余内容留在磁盘上。渐进式披露就是你如何把一个 20 个 skills 的库塞进 5000-token 的槽位,同时不污染整个上下文。---### 5. 范围纪律meta-skill 编码了一个我愿意钉到每个智能体上的不可协商原则:> 只碰你被要求碰的东西。不要重构相邻系统。不要删除你没有完全理解的代码。不要看到一个 TODO 就决定重写整个文件。这听起来显而易见,直到你看到一个智能体决定,为了修一个 bug,必须现代化三个无关文件。范围纪律是智能体 PR 能否被合并,还是必须被撤回的最大决定因素。它也是最直接映射到 Google 代码评审规范的原则之一,因为评审者会因为一个 PR 做了不止一件事而阻止它合并。---## Google 的基因这些 skills 充满了来自《Software Engineering at Google》和 Google 公开工程文化的实践。这是有意为之。让 Google 规模的软件能运转起来的大部分东西都是公开记录下来的,而它们恰好也是智能体最可能跳过的部分。下面是部分 skill 与实践之间的对应关系:| Skill | 对应实践 ||---|---|| `api-and-interface-design` | Hyrum’s Law:你的 API 的每一个可观察行为,最终都会被某个人依赖,所以设计时必须考虑这一点。 || `test-driven-development` | 测试金字塔(约 80/15/5)和 Beyoncé Rule:“If you liked it, you should have put a test on it.” 基础设施改动不会抓 bug,测试才会。 || `test-driven-development` | 测试中 DAMP 优先于 DRY。测试代码应该像规格说明一样可读,即使代价是一些重复。过度抽象的测试是已知反模式。 || `code-review-and-quality` | 约 100 行 PR 大小,以及 Critical / Nit / Optional / FYI 严重性标签。大的 PR 不会被认真评审,只会被橡皮图章式通过。 || `code-simplification` | Chesterton’s Fence:在理解一个东西为什么被放在那里之前,不要移除它。 || `git-workflow-and-versioning` | trunk-based development 和 atomic commits。 || `ci-cd-and-automation` | Shift Left 和 feature flags:尽早捕捉问题,把部署和发布解耦。 || `deprecation-and-migration` | code-as-liability:你保留的每一行代码,都是你必须永远维护的一行,所以应该偏好更小的表面积。 |这些都不是新想法。重点是,它们默认并不存在于智能体里。一个前沿模型在训练数据里读过“Hyrum’s Law”这个短语,但它不会在凌晨 3 点为你设计 API 时自动应用 Hyrum’s Law。Skills 就是确保它会这样做的方法。---## 如何实际使用它有三种模式,承诺程度大致递增。### 模式 1:通过 marketplace 安装如果你使用 Claude Code:```text/plugin marketplace add addyosmani/agent-skills/plugin install agent-skills@addy-agent-skills```你会得到这些 slash commands:- `/spec`- `/plan`- `/build`- `/test`- `/review`- `/ship`- `/code-simplify`智能体会根据上下文自动激活相关 skills。这是我建议大多数人开始尝试的路径。---### 模式 2:把 markdown 放进你选择的工具里这些 skills 是带 frontmatter 的纯 markdown。Cursor 用户可以把它们放进:```text.cursor/rules/```Gemini CLI 有自己的安装路径。Codex、Aider、Windsurf、OpenCode,或者任何接受 system prompt 的工具,都能读取它们。工具本身不如底层工作流重要。---### 模式 3:把它们当成规格来读即使你什么都不安装,这些 skills 也是一份关于“如何用 AI 智能体做好工程工作”的文档化描述。你可以这样做:- 阅读 `code-review-and-quality.md`,把五轴框架应用到你团队的评审流程里。- 阅读 `test-driven-development.md`,下次和初级工程师争论“我们是否需要先写测试”时,用它来定论。- 阅读 meta-skill,把五条不可协商原则偷到你自己的 `AGENTS.md` 里。我实际上会从第三种模式开始。挑出最接近你当前痛点的四五个 skills。决定你想强制执行哪些工作流。然后再安装运行时,或者自己做一个,来执行这些流程。---## 即使你永远不安装,也应该偷走的东西不管你是否使用 AI 编码智能体,这个项目里有几个模式都值得借鉴。### 把反合理化变成团队实践写下你的团队经常对自己说的谎言:- “我们上线后再修测试。”- “这个改动太小,不需要设计文档。”- “没事,我们有监控。”给每个借口配上反驳。把它放进你的 `AGENTS.md` 或工程 wiki。它会帮你省掉争论,也会抓住下一个疲惫的周五下午捷径。---### 内部文档要流程优先于散文如果你发现自己正在写一篇 2000 字的文档,标题是“我们如何处理 X”,那你写的是参考材料。把它转换成带检查点的工作流。文档会缩短到 400 字,而且人们真的会运行它。这不仅适用于 agent skills,也同样适用于 onboarding 指南和 runbooks。---### 把验证作为硬性退出标准让“产出证据”成为每个任务的退出步骤。对智能体如此,对工程师如此,对你自己也如此。证据就是任何能证明工作完成的东西:- 一次绿色测试运行- 一张截图- 一段日志- 一个评审批准没有证据,任务就没完成。“看起来对”永远不能闭环。---### 为任何规则手册采用渐进式披露不要写一本 50 页的手册。写一个小路由器,让它根据情况指向正确的小章节。这对 `AGENTS.md`、runbooks、事故 playbooks,以及任何人在压力下需要阅读的东西都成立。---### 五条不可协商原则下面五条不可协商原则来自 meta-skill,我明天就会把它们放进任何 `AGENTS.md`:1. **构建之前先揭示假设。** 沉默持有的错误假设,是最常见的失败模式。2. **需求冲突时停下来并提问。** 不要猜。3. **有必要时要反驳。** 智能体,或者工程师,不是只会说“是”的机器。4. **偏好朴素、明显的解决方案。** 聪明技巧很昂贵。5. **只碰你被要求碰的东西。** 不要扩大范围。这五行就是一种值得拥有的工程文化,而且你不需要安装任何东西就能采用它。---## 它在 harness 中的位置从更大的图景看,skills 是 agent harness engineering 的一层。harness 是模型加上你围绕它构建的一切;skills 是可复用的工作流片段,会被渐进式披露到 system prompt 中。它们与以下层并列存在:| 层 | 作用 ||---|---|| `AGENTS.md` | 滚动规则手册 || hooks | 确定性的执行层 || tools | 智能体可以采取的动作 || session log | 持久记忆 || skills | 高级工程师流程 |每一层都有具体职责。Skills 负责高级工程师流程这部分工作。对于长期运行的智能体而言,skills 比对聊天式智能体更重要,因为长时间运行会放大每一个捷径。一个在 10 分钟会话中跳过测试的智能体,会制造一个 bug。一个在 30 小时会话中跳过测试的智能体,会在运行结束时制造一场调试考古项目,那时已经没人记得最初意图是什么了。运行时间越长,高级工程师的脚手架就越必须被强制执行,而不是被建议执行。skills 格式的可移植性也很重要。同一个 `SKILL.md` 文件可以用于:- Claude Code- Cursor(通过 rules)- Gemini CLI- Codex- 任何接受 system prompt 内容的 harness工作流写一次,运行时负责执行。这就是 markdown-with-frontmatter 格式能带来的东西,而定制化 prompt engineering 做不到这一点。---## 结语比起 skills 本身,我最希望人们从这个项目中带走的是这个框架。AI 编码智能体是能力极强的初级工程师,但它们对那些不会出现在 diff 里的工作没有本能。高级工程工作——揭示假设、控制改动大小、撰写规格、留下证据、拒绝合并无法评审的东西——正是智能体会跳过的内容,除非你让它无法跳过。越来越多时候,我们的工作是在把这种纪律编码成智能体无法自我说服而绕过的东西。Skills 是这种做法的一种形态:- 反合理化表格- 渐进式披露- 流程优先于散文- 把验证作为承重的退出标准- 已经证明有效的 Google 实践,被做成可移植的形式你可以安装我的版本。也可以自己做一套。不管怎样,这个教训都成立:> 高级工程师职责中的那些部分已经不再是可选项,即使这个工程师是一个模型。

4. Google Cloud AI 总监 Addy Osmani 写了一篇关于 Agent Harness Engineering 的长文,核心公式很简单:Agent = Model + Harness。模型只是系统的一个输入,真正决定 Agent 表现的,是围绕模型搭建的那一整套脚手架。过去两年,行业一直在争论哪个模型最聪明、哪个写代码最干净、哪个幻觉最少。这些当然重要,但它忽略了系统的另一半。一个普通模型配上精心设计的 harness,能稳定地打赢一个顶级模型配上粗糙 harness 的组合。越来越多最有意思的工程工作,已经不在模型选择上了,而在设计模型周围的那层脚手架上。Harness 具体包括什么?系统提示词、工具描述、文件系统、沙箱、子 Agent 编排、钩子和中间件、可观测性工具、记忆和搜索机制。Claude Code、Cursor、Codex、Aider,这些产品本质上都是 harness。底层模型可能一模一样,但你体验到的行为差异,绝大部分来自 harness 的不同。文章里最核心的一个理念是:把每次 Agent 的失败都当作永久性的信号来处理,而不是当成偶发事件重试一下就算了。Agent 提交了一个注释掉测试的 PR?那下一版 AGENTS.md 里就要写明"禁止注释测试",下一个 pre-commit hook 就要自动拦截,审核子 Agent 也要更新规则。每一条好的系统提示词,都应该能追溯到一次具体的历史失败。他还提到了几个关键的 harness 设计模式:用文件系统和 Git 做持久化状态管理;用 bash 做通用工具层;用沙箱保证安全执行;用记忆文件注入跨会话知识;用压缩、渐进式披露和工具调用卸载来对抗上下文腐烂;用循环、规划和拆分来支撑长时间自主执行。还有一个很有意思的观点:模型变强了,harness 的需求不会消失,只会转移。以前需要的那些"防止模型犯蠢"的脚手架可以拆掉了,但新的能力边界又会带来全新的失败模式,需要全新的脚手架来应对。所以 harness 是一个活的系统,永远在随着模型能力的变化而演化。最后他说,现在行业正在从"基于 LLM API 构建"转向"基于 Harness API 构建"。SDK 已经把循环、工具、上下文管理、钩子、沙箱这些东西开箱即用地提供了。你要做的,是选一个 harness 框架,配置核心支柱,然后把精力集中在你自己领域的 prompt 和工具设计上。说白了,当所有人都在追最新模型的时候,真正拉开差距的,是你围绕模型构建的那套系统有多扎实。模型是标准品,harness 才是你的竞争壁垒。原文地址:x.com/addyosmani/status/2053231239721885918#科技先锋官##How I AI#

5. 你有意识到要给 AI 写一份「灵魂文件」,让它每次都是同一个人格吗?我前两天补看了(确实是看了不是听了)一期今年 2 月的 Lex Fridman 播客第 491 期,嘉宾是龙虾(OpenClaw)的作者 Peter Steinberger。他更早还做过 PSPDFKit 那套 PDF 工具,被一堆 App 集成在里头。这期播客里他公开了一个用了大半年的私人做法:在项目根目录里写一份叫 soul.md 的文件,专门定义 AI 助手的「性格」「价值观」「说话方式」。每次新开对话第一句话就是「先读一下 soul.md」,AI 上来就带着同一套人格陪你干活。听着有点玄,但很多人都已经试过了(养虾),确实有用。先理解一个背景。这两年 AI 编程工具或者 Agent 智能体一茬接一茬:Claude Code、Cursor、Cline、Aider、OpenAI Codex、龙虾,每家都有自己的「项目说明文件」。Claude Code 是 CLAUDE.md,Cursor 是 .mdc 规则文件,行业里还在推一个叫 AGENTS.md 的跨工具规范。但这些文件绝大多数都在写「项目技术规范」:用什么框架、什么代码风格、跑什么测试。Peter 的想法不一样。他说那些技术规范固然重要,但每次新开对话,AI 的「人」是空白的——它的语气、幽默感、对你这个人的理解,全都从零开始。所以他单独抽出一份 soul.md,里面只写跟「人格」相关的内容。他在播客里念了自己 soul.md 的节选。第一段是 AI 助手的角色定位,原话是「你是一个有经验的合作者,不是一个仆人」。接着是说话风格:直接,可以反驳我,不要每句话都加『当然』『没问题』。然后是几条个人偏好:代码注释能少则少,commit message 要写「为什么」而不是「是什么」。再然后他做了一件挺野的事,他让 AI 自己改这份文件,让它给自己加一点幽默和温度。具体可落地的话,差不多就这四步。第一步,在项目根目录建一份 soul.md。开头写一段「你是谁」:是合作者不是助手;可以反驳我,但要给出理由;不知道就说不知道。第二步,写偏好。代码风格、语气、输出格式都列上,比如「函数式优先,能不用类就不用」「直接说结论,不铺垫」「先一句话总结再展开」。越具体越好,越具体 AI 越能照着做。第三步,让工具读到这份文件。Claude Code、Cursor 这一类会自动读项目根目录的指定文件;其他工具(包括 DeepSeek 网页版、Kimi、通义、豆包)就在新对话第一条手动贴一遍内容,效果一样。第四步,让 AI 自己改这份文件。跟它合作一阵之后,问它「你觉得我们的 soul.md 应该加点什么」。Peter 反复讲的是这一步——AI 给自己写的那些条,往往比你自己拍脑袋想的更准,因为它知道自己在哪些地方容易让你不满意。这个做法值得在今年这几个月单独拎出来讲。这几个月行业里出现了一个明显的转向:把功夫花在「上下文工程」上,简单说就是怎么给 AI 喂背景,比纠结一句提示词怎么写更管用。Anthropic、Cursor、Cline 最近的功能都在往这个方向加,AGENTS.md 这种跨工具规范也在反复被讨论。soul.md 就是上下文工程的一个特殊分支:别人在写技术上下文,他在写人格上下文。不需要把它做得很复杂。Peter 自己那份据他说也就几百字。值得一试是因为成本极低:写一次所有项目复用,改一次 AI 立刻换人格。回头听( 其实算是看,因为我就是快速过文字版,我可能有点浮躁^_^)这期播客,最让我留意的不是 soul.md 这一招本身,而是他那句话——他说做龙虾这个项目最大的收获,是发现自己花在「设计 AI 这个合作者长什么样」上的时间,比花在「让 AI 写代码」上的时间还多。这种关系有新启发。

6. 克隆网站通常需要手动分析设计、下载资源、编写代码,还要适配响应式布局和交互效果,来回折腾耗时费力。AI Website Cloner Template 用一条命令搞定一切,利用AI编码代理逆向工程任意网站,生成干净现代的Next.js代码库。只需指向目标URL,运行 /clone-website 命令,AI代理就会自动截图分析、提取设计令牌和资源、生成组件规格,并并行构建每个页面部分。GitHub:github.com/JCodesMore/ai-website-cloner-template主要功能:- 网站侦察:自动截图、设计令牌提取、交互扫描(滚动、点击、悬停、响应式);- 基础搭建:更新字体、颜色、全局样式,下载所有静态资源;- 组件规格生成:精确记录CSS值、状态、行为和内容的详细规范文档;- 并行构建:为每个组件/页面部分启动独立AI构建代理;- 自动组装与QA:合并代码、连接页面、与原站视觉对比验证;- 支持多种AI代理:Claude Code(推荐)、Cursor、Gemini CLI、Aider等。基于Next.js 16 + shadcn/ui + Tailwind CSS v4,支持Web部署,通过npm install即可本地运行,适合开发者快速迁移/重建网站。#AI工具##Nextjs# #网站克隆# #AI编码代理#

7. 关于放慢节奏的思考 -- { Mario Zechner }这篇文章写了作者对目前Agent编码的反思。原文题目:Thoughts on slowing the fuck down2026-03-25图中乌龟的表情就是我看待我们行业的样子自从可以真正构建完整项目的编码Agent出现,已经过去大约一年。之前也有一些前身,比如 Aider 和早期的 Cursor,但它们更像是助手而非Agent。新一代Agent非常诱人,我们很多人都花了大量空闲时间构建那些一直想做却没时间做的项目。我认为这没问题。用空闲时间创造东西非常享受,而且大多数情况下你无需过于关心代码质量和可维护性。这也为你提供了学习新技术栈的机会。在圣诞假期期间,Anthropic 和 OpenAI 都发放了一些免费资源,吸引人们体验他们的“上瘾式老虎机”。对很多人来说,这是第一次感受到Agent式编码的魔力。参与的人越来越多。编码Agent现在也被引入到生产代码库中。经过 12 个月,我们开始看到所有这些“进步”的效果。以下是我当前的看法。一切都坏掉了虽然这些都是轶事,但软件似乎已经变成了脆弱的混乱,98% 的正常运行时间成为常态而非例外,包括大型服务。用户界面出现的 bug 古怪至极,按理 QA 团队应该捕捉到。我承认这在Agent出现之前就存在,但现在似乎在加速。我们无法接触公司内部情况,但偶尔会有一些情况被新闻记者曝光,比如据称 AI 导致的 AWS 停机,AWS 立刻“修复”,随后内部进行 90 天重置。微软 CEO Satya Nadella 一直在谈论 AI 在微软写了多少代码。虽然没有直接证据,但确实有一种感觉:Windows 正在走下坡路。微软自己似乎也认同这一点,从这篇博客文章可见一斑。声称产品代码 100% 由 AI 编写的公司,总是产出最糟糕的垃圾。不是在指责,但内存泄漏动辄数 GB,UI 错误、功能损坏、崩溃:这不是他们想象的质量标志,也绝不是广告宣传的“Agent帮你完成一切”的好宣传。从行业内部传来消息,越来越多公司(无论大小)的人说他们通过Agent编码把自己逼入死角。没有代码审查,设计决策交给Agent,无数没人需要的功能。这就是原因。我们不该如何与Agent协作以及原因我们基本上放弃了所有纪律和自主性,沉迷于一种追求:在最短时间内产出最多代码。后果无所谓。你在构建一个用于指挥自主Agent军队的编排层。你安装了 Beads,却完全没意识到它几乎是无法卸载的恶意软件。网上告诉你要这么做,你就照做。你把自己套入了循环。Anthropic 用Agent群体构建了一个 C 编译器,有些破损,但下一代 LLM 一定能修复。Cursor 用Agent大军构建了浏览器,当然它不完全可用,需要人偶尔干预,但下一代 LLM 一定能解决问题。分发、拆分、自治、暗工厂、软件六个月内搞定。SaaS 死了,我奶奶让 Claw 自己建了 Shopify!对于几乎无人使用的个人项目,这种方式或许可行。如果有人能让这种方法适用于真正被人使用的软件产品,那更好。如果是你,那就尽管去做。但在我同行圈内,我尚未见到这种方法有效的证据。也许我们都有技能问题。错误叠加却没有学习、没有瓶颈、痛苦延迟Agent的问题在于它会犯错。这没关系,人类也会犯错。可能只是正确性错误,容易识别和修复。加上回归测试效果更佳。或者是代码气味,你的 linter 没发现的。单独看,这些都是无害的。人类也会犯这种错。但 Agent 不是人类。人类犯错几次后会学会不再犯,要么有人训斥,要么自身在学习路径上。Agent没有这种学习能力,至少开箱即用时没有。它会一遍又一遍地犯同样的错误,根据训练数据,甚至可能创造出新的错误组合。你可以尝试教Agent,在 AGENTS.md 里告诉它别再犯同样错误,或者设计复杂记忆系统查找历史错误和最佳实践。这对特定类别错误有效,但需要你观察Agent犯错。更重要的区别是,人类是瓶颈。人类不可能在几小时内输出两万行代码。即使频繁犯错,每天引入的错误有限。错误累积缓慢,如果痛苦太大,人类会花时间修复,或者被解雇由他人修复。痛苦就消失了。有了Agent军团,没有瓶颈、没有人类痛苦,这些小错误会以无法承受的速度累积。你脱离了循环,不知道这些无害的错误已经形成了庞大的代码怪物,痛苦只在为时已晚时显现。某天你想增加新功能,但架构大部分都是错误,Agent无法有效修改,或者用户因最新版本出问题丢失数据而尖叫。你意识到无法再信任代码库。更糟的是,你让 clanker 写的无数单元、快照和端到端测试同样不可靠。唯一可靠的方式就是手动测试。恭喜,你害了自己(和公司)。学到的复杂性的商人你完全不清楚发生了什么,因为把一切自主权交给了Agent。它们是复杂性的商人。它们在训练数据和 RL 训练中见过很多糟糕架构决策,你让它们来架构应用,结果就是:极其复杂的混合体,由可怕的“行业最佳实践”堆砌而成,你没来得及控制。更糟的是,你的Agent彼此看不到对方的执行,无法查看完整代码库或之前的决策。因此,Agent决策总是局部的,导致上述错误。大量代码重复,为抽象而抽象。这些累积成无法恢复的复杂混乱。就像人类企业代码库一样。人类企业代码库之所以如此,是因为痛苦分散在大量人身上,个体无法触发“必须修复”阈值。个体可能无力修复,而组织有极高痛苦耐受力。人类企业代码库需要多年才能达到这种状态,组织随着复杂性缓慢演化并学习应对。有了Agent和两名人类团队,你可能在几周内达到这种复杂度。Agent搜索的召回率低你希望Agent修复、重构代码,但它们应对不了。因为代码库和复杂度太大,Agent只能局部查看。不仅仅是上下文窗口或长序列注意力机制的问题。更微妙的是,在Agent尝试修复前,它必须找到所有需更改的代码和可复用代码,即所谓Agent搜索。工具不同,方法不同:Bash、可查询代码库索引、LSP 服务、向量数据库。最终,代码库越大,召回率越低。低召回意味着Agent不会找到所有需修改的代码。这也是代码气味错误产生的原因。Agent遗漏现有代码,重复、引入不一致,进而形成复杂的“糟糕花”。如何避免这些问题?我们该如何与Agent协作(至少目前我是这么认为的)编码Agent像海妖,以惊人的生成速度和不稳定智能诱你入网,完成简单任务时速度快且质量高。问题出在你想:“天哪,这太棒了,电脑帮我做吧!”显然,把任务交给Agent没问题。合适的任务特点:范围可控,不需理解完整系统;循环闭合,Agent能评估自己工作;输出非关键,仅是临时工具或内部软件,没人生命或收入依赖;或者仅是橡皮鸭讨论,让想法与网络与训练数据的压缩智慧碰撞。只要满足条件,你找到了完美任务,前提是你作为人类是最终质量把关。Karpathy 的自动研究用来加速应用启动?很好,只要你明白输出代码根本不适合生产。自动研究可行,因为你给它一个评价函数,让Agent根据指标(如启动时间或 loss)评估工作。但评价函数仅捕获狭隘指标,Agent会忽略其他指标,如代码质量、复杂性,甚至正确性。关键是:让Agent做枯燥、不会教你新知识的事情,或尝试你没时间尝试的方案。然后评估它的成果,取合理正确的想法,完成最终实现。最终步骤也可用Agent辅助。我建议,放慢节奏才是正道。给自己时间思考真正想做什么、为什么做。给自己机会说:“不,我们不需要这个。”限制每天让 clanker 生成的代码量,按你能审查的能力设定。系统的总体设计、架构、API 等核心部分,手写完成。可以用 tab 补全感受怀旧,或与Agent结对编程。亲自编码,逐步构建,增加摩擦,帮助你理解要构建什么以及系统“感觉”。这是经验和品味发挥作用的地方,是当前 SOTA 模型无法替代的。放慢节奏,经历摩擦,让你学习和成长。最终,你会得到可维护的系统和代码库,至少和Agent出现前的老系统一样可维护。用户会感谢你,产品带来愉悦而非垃圾。功能更少,但更恰当。学会说“不”本身就是一种能力。你可以安心,因为你仍然了解发生了什么,并掌握自主权。理解能力可解决Agent搜索的召回问题,生成更可靠输出,减少修改量。如果出问题,你能亲自修复;设计不佳,你知道原因并能重构改善。有或没有Agent,都无所谓。所有这一切需要纪律和自主权。所有这一切都需要人类。#How I AI#

8. 使用多个AI编程代理(Claude Code、Codex、Cursor、Aider等)时,历史对话分散在不同目录,JSONL、SQLite、Markdown格式各异,grep搜索费时费力,关键解决方案往往找不回来。coding-agent-search (cass) 把所有代理的历史对话统一索引搜索,提供高性能TUI和CLI工具。不仅支持19+代理的会话聚合(Claude Code、Codex、Gemini、Cursor、Aider等),还提供BM25精确搜索+可选语义搜索、毫秒级响应,支持多机同步搜索。GitHub:github.com/Dicklesworthstone/coding_agent_session_search主要功能:- 统一索引19+ AI编程代理的历史对话,支持JSONL、SQLite、Markdown等多种格式;- 高性能TUI界面,实时搜索+三栏布局,F12切换排序模式,支持模糊搜索;- 混合搜索模式(词法+语义),支持通配符、前缀匹配、自动模糊回退;- 多机搜索,通过SSH/rsync同步远程服务器的代理会话数据;- Robot模式CLI,JSON输出,专为AI代理设计,支持自动化工作流;- HTML导出带加密,支持密码保护和离线查看,语法高亮+可搜索。支持Linux、macOS、Windows,通过Homebrew、Scoop或安装脚本一键部署,本地运行完全离线,适合个人开发者及团队使用。#AI编程##Rust##开发者工具#

9. 大量开发者转投Codex 14年老工程师120小时实测告诉你原因

10. 攻城狮周刊#4:AI 编程助手市场竞争加剧

11. AI coding 工具横评:Codex、Cursor、Claude Code、Copilot 怎么选?

12. AI 编码成本攀升,GitHub Copilot 将转向基于用量的计费模式系统

13. AI编程工具的介入时机越早越好吗?

14. 我本想对比Claude和Codex,却发现它们联手更快

15. AI 编程订阅:$20→$200→$1000?

16. 2026年Claude Pro/Max/Code怎么选?订阅一年后的真实使用体验

17. GitHub Copilot按Token收费后,个人开发者一年要花多少钱?

18. OpenClaw 支持的大模型全攻略:配置、优缺点、费用一览

19. 使用claude code如何降低返工率?

20. 一人撑起 42K Star 项目:aider 如何用「编辑格式」重新定义 AI 编程

21. Claude Code + OpenSpec + Superpowers:AI协同开发实战详解与精通

22. 10分钟速成!24个ClaudeCode技巧,直接上手用

23. 企业想引入OpenClaw?先自我评估一下吧

24. Claude Code悄悄涨价,企业开发者与90%普通用户费用双双翻倍

25. GitHub 3.9 万星!这个免费开源神器,凭什么叫板 Claude Code?

26. ChatGPT 5.5 之后,Codex 不只是写代码,已经开始像“小型团队”

27. Claude Code越用越贵?33天花1.16万,15个隐藏技巧省80%成本

28. 3人团队4周打造开放世界游戏!开源Aider让AI"黑箱编程"成为现实

29. Code Interpreter技能实用价值分析与使用指南

30. Claude Code月费200刀太贵?这个免费开源平替一样能用

31. OpenClaw 8个模型我全测了一遍,烧了200块PU后总结出这份选模型指南

32. Claude Code 的收费标准到底怎么算的?用了两周账单看傻了

33. OpenClaws模型怎么选?让我来告诉你:省成本,少踩坑

34. Claude Code 好用吗?优缺点深度测评

35. GitHub 趋势榜第一!这个开源项目让 Coding 效率翻倍

36. GitHub Copilot 将按 token 收费

37. 如何给claudecode接入国产大模型(Windows教程)

38. 2026年Claude Pro/Max/Code怎么选?国内订阅一年后的真实使用体验

39. Claude Code 到底怎么收费的?感觉配额管理是个玄学

40. Aider 运行 DeepSeek R1

41. Ollama + Claude Code + Aider:零成本AI编程深度玩法

42. 帮本地商家清数据,Aider半天干完3天活,单笔净赚2000

43. Aider + Ollama 本地部署教程

44. Anthropic宣布提升Claude Code额度:每周限额叠加增长50%,持续至7月13日

45. Claude Code 订阅怎么选?100刀的完全够用

46. Claude Code 到底怎么收费的?感觉官方说得不太清楚

47. Claude code额度解析

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章