AI Agent越“全能”越烧钱?精简技能设计才是降本增效的关键
04-11 14:19
精选参考来源
新浪微博 2025-10-24
新浪微博 2026-03-14
来源
精选参考来源
1. Daniel San:Claude Code Skills 设计理念:采用三层上下文系统,分层如下- 第一层:项目主配置,始终加载。- 第二层:技能元数据,仅加载 YAML frontmatter(每个技能约 100-200 token)。- 第三层:按需加载技能文档(SKILL.md 与相关文档)。这种架构允许同时加载数十个技能而不超出上下文限制,同时将脚本和模板文件设计为直接调用(零 token 消耗),从而确保性能和灵活性。讨论中也有不同观点,比如关于各层职责划分、加载策略和多技能性能的问题,这些争议显示出设计细节的重要性和优化空间。原文链接:x.com/dani_avila7/status/1981394535155438029
新浪微博 2025-10-24 00:00:00
2. Claude Code subagent vs.Agent Teams vs. worktreeClaude Code支持多Agent协作,但里面的sugagent、Agent Teams、git worktree 概念容易混淆,好像都能并行协作开发。大多数开发者的错误做法是:把所有多Agent任务都用Agent Teams,或者把简单的工作也劲头十足地搞worktree,结果代码复杂度爆炸。1. Claude Code官方文档现在把它分成三个清晰的层级:层级1:Subagent(会话内辅助)适用场景:在当前编码会话内部创建临时任务特点:轻量级、快速、无需通信开销例子:「帮我写单元测试」「重构这个函数」「生成API文档」本质:一个主Agent指挥多个临时小助手,完成当前任务成本:低,通信延迟小层级2:Agent Teams(需要Agent间通信的并行任务)适用场景:多个Agent需要真正协作、信息交互特点:Agent有各自的记忆、上下文、角色定位例子:前端Agent + 后端Agent + DevOps Agent 协同开发一个微服务架构本质:真正的「团队」,每个Agent有独立决策权成本:高,需要复杂的通信协议和状态管理层级3:Git Worktree(轻量并行选项)适用场景:传统多分支开发,手动协调特点:完全依靠Git,不需要Agent间通信例子:同时开发feature1和feature2,用两个worktree分离代码树本质:操作系统级别的并行,Agent各自独立运行成本:中等,但需要手动协调merge2. 实战建议:1)刚开始用Claude Code?用Subagent。让一个主Agent指挥,足够了。2)小团队开发微服务?用Agent Teams,但不要超过3个Agent(通信成本会爆炸)。3)大型项目长期并行?用Worktree,保持简单,让人类开发者协调。大多数人的错误是高估了自己的需求,直接跳到Agent Teams。结果是Agent间通信变成性能瓶颈,不如一个聪明的Subagent快。3. 背后的工程思想这个三层设计反映了一个深层原则:越高级的能力,越要谨慎使用。Subagent看似简单(一个主Agent内部)但足以解决90%的任务。Agent Teams强大但需要精细的通信协议。Worktree原始但极其稳定。官方的建议其实是在说:从最简单的方案开始,只在确实需要的时候才升级。这叫做「渐进式能力提升」。很多开发者喜欢一上来就用最强的功能,结果代码难以维护、Agent间延迟高、调试成本爆表。明确边界后,选择变得简单了。官方文档:code.claude.com/docs/en/agent-teams#HOW I AI# #程序员#
新浪微博 2026-03-14 00:00:00
3. RAG、LangChain、Agent 到底有什么关系?
知乎 2025-11-25 00:00:00
4. 说句实话,罗福莉这个认知水平,真的是顶尖的!把大模型算力和Agent生态这盘大棋看得透透的!什么叫真正的远见?这就是!不比谁会无脑烧钱,比的是谁能把算力这种好钢用在刀刃上!看完她的话,我脑子里第一个蹦出来的就是小米!大家仔细想想,小米布局自研大模型,走的就是萝福莉说的这条高效率、重体验的路线别人在搞噱头疯狂浪费云端算力,小米直接端云结合,把大模型深度塞进澎湃OS,塞进SU7的车机和智驾系统里!通过极致的工程优化,让AI在手机和车端跑得又快又稳。不仅聪明,而且极度省资源!
新浪微博 2026-04-06 00:00:00
5. Agent狂烧Token?你要学会减少无效的Token消耗。
微信公众号 2026-03-25 00:00:00
6. 「Github一周热点103期」超轻量的clawdbot、编程智能体的记忆工具、聊天记录分析工具、视觉agent框架和键盘、鼠标统计工具
哔哩哔哩 2026-02-08 00:00:00
7. 这篇文章《Agent Design Is Still Hard》写的太好了,值得逐行细读!看完的6个感受:1. 如果你自己写 agent,建议尽量直接用底层 SDK(而不是高层抽象);2. 明确缓存策略 — 尤其是对大模型 + 多步骤任务,非常关键;3. 引入强化机制(reinforcement) 和 sub-agent / sub-inference,以提高 agent 的稳定性/可靠性;4. 如果你的 agent 会生成实际输出 (邮件、文件、报告等),考虑用专门的 output tool,而不是把 “输出内容” 混在 agent loop 的消息里;5. 在设计共享状态 (shared state) 时,引入类似“虚拟文件系统 (virtual file system)”的机制,会让系统更模块化,也更适合复杂任务 + 多工具调用;6. 最难也是最重要的一点 —— 测试与评估 (testing & evals) 是 agent 系统工程中最棘手的问题,目前还没有通用/优雅的解决方案。原文转译如下:Agent 设计依然很难我觉得现在是时候写写我新学到的一些东西了。大部分内容与构建 agent 有关,少部分与使用 agent 式编程工具有关。总结:构建 agent 依然混乱。只要真正开始用工具,SDK 抽象就会崩。缓存如果你自己管会更好,但不同模型间差异很大。强化(reinforcement)比预期承担更多“驱动”任务,而失败必须严格隔离以避免把循环带偏。通过类似文件系统的共享状态是非常重要的基石。输出工具比想象中更棘手,模型选择依然强依赖任务类型。一、选择哪个 Agent SDK?当你构建自己的 agent,你可以选择直接使用 OpenAI SDK、Anthropic SDK 等底层 SDK,也可以选择更高层的抽象,例如 Vercel AI SDK 或 Pydantic。我们之前做的选择是采用 Vercel AI SDK,但只用其 provider 抽象,然后基本上自己驱动 agent loop。现在来看,我们不会再做这个选择。Vercel AI SDK 本身没有问题,但当你要真正构建 agent,会发生两个我们没预料到的事:第一,不同模型之间的差异大到不得不自己构建 agent 抽象。我们没发现任何 SDK 提供的抽象能真正匹配 agent 的需求。部分原因是:虽然 agent 的基础设计就只是一个 loop,但工具集不同会带来微妙差异。这些差异会影响抽象是否容易找到(比如缓存控制、不同的强化需求、工具提示、provider 侧工具等)。因为“正确抽象”现在还不清晰,所以使用平台的原生 SDK 让你掌控更多。而很多高层 SDK 要你构建在它们的抽象之上,最后这些抽象可能并不是你真正需要的。第二,当涉及 provider 侧工具时,我们发现使用 Vercel SDK 非常困难。消息格式尝试统一,但并不真正奏效。例如 Anthropic 的网页搜索工具会频繁破坏 Vercel SDK 的消息历史,我们至今还没完全搞清原因。此外,在 Anthropic 的情况下,缓存管理在其原生 SDK 中比在 Vercel 中容易得多,而且错误信息也更清晰。也许未来会变化,但至少现在,我们不会在构建 agent 时使用抽象层,除非整个生态已经稳定。对我们来说,目前抽象层的收益远远不足以抵消其成本。也许别人已经解决这个问题了。如果你看了觉得我错了,欢迎发邮件,我非常愿意学习。二、关于缓存的经验不同平台对缓存的处理方式非常不同。大家已经讨论过很多,例如 Anthropic 的缓存是收费的,并且需要你显式管理缓存点,这会从 agent 工程角度完全改变你的交互方式。一开始我觉得手动管理缓存很蠢:为什么平台不自动管理?但现在我完全反过来了,非常喜欢显式管理缓存。它让成本与缓存利用率都更可预测。显式缓存能让你做一些否则很难做的事情。例如,你可以把会话分叉成两个不同方向并行执行。你也能进行上下文编辑。最佳策略尚不明确,但你确实有更多控制权,而且这种控制权非常宝贵,也让你更容易理解 agent 的成本结构。你可以更好地预测缓存命中率,而其他平台我们发现经常是碰运气。我们在 Anthropic 的 agent 中的缓存策略很直接:一个缓存点放在 system prompt 后;两个缓存点放在对话开头,并随对话尾部不断前移;除此之外还有一些小优化。因为 system prompt 和工具选择必须尽可能静态,我们会在之后的动态消息里提供时间等信息,否则会破坏缓存。我们在循环中也更多利用强化。三、Agent Loop 中的强化每次 agent 调用工具,你不仅可以返回工具的执行结果,还可以向循环中注入更多信息。例如,你可以提醒 agent 宏观目标、子任务状态,也可以在工具失败时提供如何让工具调用成功的提示。另一个用途是在后台状态发生变化时告知系统。如果 agent 会使用并行处理,你可以在每次工具调用后注入状态变化信息。有时 agent 自我强化就够了。例如在 Claude Code 中,todo write 工具本质上是个自我强化工具——它只是接收 agent 给出的一组任务,再原样返回。这基本就是个 echo 工具,但却足以让 agent 推进得比只在上下文开头给任务列表要好得多。我们也使用强化来告诉系统环境是否在执行过程中发生了问题。例如,如果 agent 在某一步失败并重试,但恢复基于损坏的数据,我们会注入消息告诉它应该回退几步重新来。四、 隔离失败如果你预计代码执行中会有很多失败,有机会把这些失败从上下文中隐藏。主要方式有两种。第一,把可能需要多次迭代的任务单独运行。你可以在子 agent 中运行任务直到成功,再只把成功结果(可能带一段失败策略摘要)回传。让 agent 看到一些失败尝试是有价值的,因为它可以在后续任务中利用这些信息避免重复错误。第二,并非所有模型都支持,但 Anthropic 支持上下文编辑。我们还没取得太多成功,但觉得非常值得继续探索。上下文编辑理论上可以保留更多 token 用于后续循环。例如你可以从上下文中删除对解决问题没有帮助的失败输出。但如前所述,让 agent 知道“什么没成功”有价值,只是不需要保留全面状态。唯一的问题是:上下文编辑会自动使缓存失效,这是无可避免的。因此是否值得这样做往往难以判断。五、子 Agent / 子推理(Sub Inference)如我之前提过,我们的 agent 多基于代码执行与代码生成。这要求 agent 有一个公共的数据存储位置。我们采用文件系统——在我们这里是虚拟文件系统。为了支持子 agent 或子推理,这要求所有工具都能访问这个文件系统。你应该尽量构建没有死路的 agent。所谓“死路”是指任务只能在某个特定工具内部继续。例如你做了一个图像生成工具,但它只能将图像交给另一个特定工具使用,那就会造成死路。如果你希望把生成的图像打包成 zip,需要代码执行工具能读取这些图像。因此必须让图像生成工具把文件写到虚拟文件系统,而代码执行工具也能读同一位置。反之亦然。你可能需要代码执行工具解压 zip 文件,然后让推理工具描述这些图片,之后再回到代码执行工具继续处理。文件系统就是实现这一点的机制。但这要求所有工具都支持从虚拟文件系统读取路径。因此“ExecuteCode” 工具和 “RunInference” 工具应该都能访问同一文件系统。六、输出工具的使用我们的 agent 不是一个聊天式系统。它最终会输出给用户或外部世界一些内容,但中间所有消息通常不会暴露出去。问题是:它如何生成最终输出?我们有一个专门的输出工具,agent 必须显式调用它来对人类输出。我们通过 prompt 告诉它何时使用该工具。在我们的场景中,输出工具负责发送邮件。但这反而带来很多意外问题。最难的是:相比直接在 agent loop 中输出文本,让输出工具生成“最终信息”时很难控制语气与措辞。我不知道为什么,但推测与模型训练方式有关。我们尝试过让输出工具再调用一个小模型(如 Gemini 2.5 Flash)进行文本润色。但这增加了延迟,而且反而降低输出质量。部分原因是小模型没完整上下文,无法正确措辞。而为了给它更多上下文又会变得昂贵,而且仍不能解决所有问题。有时还会泄露我们不想让最终用户看到的中间步骤。另一个问题是 agent 有时根本不调用输出工具。我们强制要求记录输出工具是否调用过。若循环结束前还没调用,我们会注入强化消息提醒它调用。七、模型选择总体上我们的模型选择最近没有太大变化。Haiku 和 Sonnet 依然是目前最好的工具调用模型,因此非常适合作为 agent loop 的主模型。它们对 RL 的行为也比较透明。另一个明显选择是 Gemini 模型。我们在主循环中并未在 GPT 系列上获得太多成功。对于子工具(例如需要额外推理的工具),我们目前主要用 Gemini 2.5——尤其是处理长文档、PDF、图像信息抽取等任务。特别是因为 Sonnet 系列容易被安全过滤器挡住,处理图像比较麻烦。另外一个显而易见的结论:token 价格并不能决定 agent 的整体成本。工具调用更强的模型能用更少 token 完成任务。有些模型 token 更便宜,但不一定在 loop 中更省钱。总的来说,过去几周变化不大。八、测试与 Evals测试与评估是我们认为最难的问题。这并不意外,但 agent 的特性让问题更棘手。与 prompt 不同,你无法在某个外部系统里轻松做 eval,因为需要提供太多上下文。这意味着 eval 必须基于观测数据或在真实测试运行中进行仪表化。目前我们试过的所有解决方案都没让我们满意。遗憾的是,现在我们还没有找到让人真正开心的 eval 方法。希望能尽快找到,因为这已经变成构建 agent 时最令人沮丧的问题之一。九、Coding Agent 的一些更新关于编码 agent,我的体验没有太多变化。主要的新点是我在试用 Amp。原因不是它一定比我现用的 agent 更强,而是我非常喜欢他们对 agent 的设计方式。从他们公开内容能看出,他们的子 agent(如 Oracle)与主循环交互方式非常优雅,而今天市面上很少有框架能做到这一点。这也是我用它来验证不同 agent 设计方式的原因。Amp 和 Claude Code 一样,让人感觉是“使用者自己做的产品”。行业里并非所有 agent 产品都有这种感觉。十、最近读的东西下面是一些我觉得值得分享的内容。1. 《What if you don't need MCP at all?》:Mario 认为很多 MCP 服务器过度工程化,工具过多占用上下文。他提出一种极简浏览器 agent 方案:只依赖简单 CLI 工具(start、navigate、evaluate JS、screenshot),不仅 token 使用小,而且流程更灵活。我据此做了一个 Claude/Amp 的 skill。2. 《The fate of "small" open source》:作者认为微型开源库时代正在结束,因为平台 API 与 AI 工具足以按需生成简单实用工具。对此我非常认同。3. 《Tmux is love》:没有文章,但结论是 Tmux 很棒。如果你的 agent 要与任何交互式系统工作,都应该考虑添加 Tmux 能力。4. 《LLM APIs are a Synchronization Problem》:这是我最近的一个发现,内容太长写成了另一篇文章。#ai创造营# #程序员# 黄建同学的微博视频
新浪微博 2025-11-28 00:00:00
8. 手把手彻底学会 Agent Skills!【小白教程】
哔哩哔哩 2026-02-02 00:00:00
9. 「Github一周热点107期」OpenAI收购的AI安全工具、AI代理事务所、OpenClaw技能库、claude code插件和上下文数据库
哔哩哔哩 2026-03-21 00:00:00
10. 「Github一周热点90期」规格驱动开发、AI记忆引擎、AI agent的docker、开源流媒体平台、开源电商平台和密钥管理平台
哔哩哔哩 2025-10-19 00:00:00
11. 18个月,中国Token消耗狂飙300倍!别乱烧钱了,清华系AI Infra帮你腰斩API成本
微信公众号 2026-02-02 00:00:00
12. 深度|暗壳AI Agent2.0:破局人居行业,链接“设计与交易”的一站式创作生态平台
微信公众号 2026-03-16 00:00:00
13. 罗福莉:龙虾成本黑洞显现,需要更高token效率的Agent框架
知乎 2026-04-06 00:00:00
14. Context 还不够,Harness 才是 Agent 工程优化的正解?
微信公众号 2026-03-22 00:00:00
15. LangChain Agent 年度报告:输出质量仍是 Agent 最大障碍,客服、研究是最快落地场景
微信公众号 2025-12-22 00:00:00
16. 一款产品,同时为人类和 Agent 设计,LibTV 是怎么做的?
微信公众号 2026-03-19 00:00:00
17. 构建 Claude Code 的经验:Anthropic 如何运用 Skills 技能
知乎 2026-03-18 00:00:00
18. Apache RocketMQ × AI:面向 Multi-Agent 的事件驱动架构
知乎 2025-10-27 00:00:00
19. 开发团队在构建智能体(AI Agent)应用、实现自主任务规划与执行时,常面临智能体决策逻辑复杂、工具调用能力弱、多任务协同难的问题,传统大模型应用难以适配自主化工作流需求。 AutoGPT 是一款开源的自主智能体框架,适配开发团队快速搭建具备自主思考、任务分解、工具调用能力的AI应用的核心场景。开源地址:github.com/Significant-Gravitas/AutoGPT 核心功能: 1. 内置任务自主分解与优先级排序机制,可将复杂目标拆分为可执行的子任务链,无需人工干预完成流程规划。2. 支持多类型工具集成,可对接搜索引擎、代码执行环境、API接口等外部资源,拓展智能体的实际应用能力。3. 提供记忆管理模块,包含短期上下文记忆与长期存储记忆,保障智能体在长周期任务中具备持续学习与状态追踪能力。4. 内置反馈迭代机制,可根据任务执行结果优化后续决策,提升复杂任务的完成质量。5. 兼容主流大模型,支持本地与云端部署模式,满足不同场景下的算力与安全需求。
新浪微博 2026-01-05 00:00:00
20. 爆肝10亿token,我给OpenClaw做了个龙虾管家!【一键安装龙虾】
哔哩哔哩 2026-03-10 00:00:00
21. 「Github一周热点99期」提升ClaudeCode效率10倍的工具?
哔哩哔哩 2026-01-02 00:00:00
22. ai agent的架构好像都差不多啊?有啥比较特别的吗?
知乎 2025-10-16 00:00:00
23. Agent Skills使用指南:让AI智能体拥有“即插即用”的超能力
知乎 2026-01-27 00:00:00
24. AgentRun 深度解析:阿里云函数计算 FC 如何构建企业级 Agent 的“生产力引擎”?
知乎 2025-12-15 00:00:00
25. 3天赚1200刀?纯聊天就能捏出个能搞钱的 AI Agent!【教程】
哔哩哔哩 2026-02-24 00:00:00
26. 实测Agent Skills,一次编写,全网通用
微信公众号 2026-01-15 00:00:00
27. 登顶搜索榜第一,Token消耗降低 24%: 解析Claude新功能 PTC
知乎 2026-03-03 00:00:00
28. 都有这么多 Agent SDK/框架了(我应该没列全吧)一、OpenAI Agents SDKOpenAI 推出的 Agents SDK 是目前最轻量、最直接的 Agent 开发方式。它原生支持 Python 和 TypeScript,语法简洁,几行代码就能让 LLM 调用外部函数、工具或执行任务。1. 与 OpenAI 模型的无缝集成,尤其是函数调用、上下文管理等特性。2. 支持 multi-agent handoff 与任务链式调用,便于扩展复杂逻辑。3. 具备生产友好的可观测性与追踪机制。它非常适合快速原型和中小规模生产项目,是“入门写 agent” 的理想起点。 二、LangChainLangChain 几乎是 LLM 应用开发的“标准库”。其 Agents 模块为 LLM 封装了链式推理、工具调用、上下文记忆等能力。1. 概念丰富——有 Chain、Tool、Memory、Agent、Retriever 等模块,适合构建复杂系统。2. 插件与生态极其庞大,几乎支持所有主流模型与数据源。3. 提供跨语言支持(Python 与 JavaScript/TypeScript)。LangChain 上手门槛略高,但生态完整,非常适合需要可扩展架构的项目。三、LangGraph用“流程图”思维管理 Agent 状态。LangGraph 是 LangChain 的“升级版本”,它将 Agent 系统抽象为状态机+有向图,可以显式地控制 Agent 间的消息流与执行路径。1. 天然适合多 agent 协作、任务编排和状态回溯。2. 支持持久化与可视化,能直观看到系统执行流程。3. 面向生产级场景,具备清晰的错误恢复与检查点机制。如果你想做一个“多 Agent 系统”,LangGraph 几乎是最强大的开源选择。四、Google ADKGoogle 的 ADK(Agent Development Kit) 主打可扩展性与安全性。它不是轻量原型工具,而是企业级 Agent 平台。1. 多语言支持,深度集成 Google 生态(Vertex AI、Gemini 等)。2. 工具调用能力极强,可直接对接云服务、API 与企业系统。3. 自带日志、监控、可观测性与治理能力。适合需要在企业内部署、具备高可靠性要求的 Agent 系统。五、SmolAgentsSmolAgents 是Hugging Face推出的一款轻量 Python 库,设计理念是“最小可行 Agent”。1. 安装简单、API 极少,几分钟即可跑通一个工具调用示例。2. 灵活支持 tool 注册与函数调用,但不追求完整框架。3. 适合快速原型、实验性项目或教育用途。如果你希望“几行代码让 LLM 动起来”,SmolAgents 是最轻便的起点。六、AutoGenAutoGen 最初由 Microsoft 研究团队推出,用于多 Agent 间的对话协作。它以“角色对话” 为核心,支持 LLM 代理之间互相交流、分工、调度任务。1. 多 agent 结构灵活,可模拟协作团队。2. 支持复杂任务分配与循环反馈。3. 对研究者和实验系统尤其友好。如果你的目标是研究 agent 交互机制或自动化工作流,AutoGen 是很好的基础。七、MetaGPT角色驱动的 Agent 系统。 MetaGPT 是一个以“AI 团队”为核心的框架,设计理念是让多个 agent 分别扮演项目经理、工程师、设计师等角色,共同产出结果。1. 多角色、结构化协作,任务拆解逻辑强。2. 擅长长链路流程(如产品需求分析→代码生成→测试)。3. 适合自动化软件工程类场景。如果你希望让 LLM 们“像一个团队一样协作”,MetaGPT 是不错的模板。八、Haystack AgentsRAG 与 Agent 的结合体。Haystack 原本是一套开源 RAG 框架,如今扩展出了 Agents 模块。它擅长将检索、知识库与 LLM 推理结合。1. 内置文档检索、索引、管道机制。2. 适合企业知识问答、文档助手类 agent。3. 与 LLM 、数据库和 vector store 的集成成熟。如果你的 agent 核心任务是“带知识的问答”,Haystack 是现成方案。九、Claude Agent SDKAnthropic 推出的开发包。它基于其先前产品 Claude Code 的 agent 引擎(agent harness)构建,目的在于为开发者提供“从模型调用 + 工具调用 +流程控制 +状态管理”这一整套能力。1. 上下文管理自动化:自带对话/会话上下文的压缩与管理机制,避免因上下文过长导致模型性能下降。 2. 丰富的工具生态:包含文件操作、代码执行、网络搜索等内置工具,并支持扩展自定义工具/插件。 3. 权限与安全机制:可以细粒度控制 agent 可使用的工具、权限模式(例如 allowedTools、disallowedTools)等。 4. 生产化准备特性:例如会话管理、错误处理、监控能力、模型优化/提示缓存机制。 5. 插件和扩展支持:通过插件机制(如自定义命令、子 agent、技能集、MCP 服务器)可创建复杂系统。#ai创造营# #程序员#
新浪微博 2025-11-10 00:00:00
29. 字节全球首发AI技能商店:一句话生成Coze Skills,你的经验直接卖钱
知乎 2026-01-19 00:00:00
30. Harness Engineering:AI Agent 落地企业的工程化核心
知乎 2026-04-09 00:00:00
31. 黄仁勋刚讲完AI「五层蛋糕」,他们就跑通了!算力、模型、Agent一次打穿
知乎 2026-04-09 00:00:00
32. Anthropic 内部分享:如何构建更高效的 AI Agent?
知乎 2025-10-19 00:00:00
33. 快抄作业!我用JoyAgent搞了个AI团队 2025年都快结束了,Agent是不是还没用上? 我找到了打工人用上智能体的最简单方法, 就是用JoyAgent把每天重复的SOP全做成Agent, 不懂代码也能零门槛搭建,而且效果很稳定。 看着AI团队全自动打工、出活,非常解压。 #AI #智能体 #JoyAgent #JoyCode #京东云
抖音 2025-11-05 00:00:00
34. AI编程代理经常缺乏生产级工程技能,容易跳过规格编写、测试验证、代码审查等关键步骤,导致代码质量低下、后期维护成本高。agent-skills 为AI编码代理提供生产级工程技能包,覆盖从需求定义到部署上线全开发生命周期的最佳实践。包含19个结构化技能工作流和7个斜杠命令,支持Claude、Cursor、Gemini CLI等多平台AI工具,让代理像资深工程师一样规范开发。GitHub:github.com/addyosmani/agent-skills主要功能:- 7个开发生命周期命令:`/spec`(规格先行)、`/plan`(任务分解)、`/build`(增量实现)、`/test`(测试验证)、`/review`(代码审查)、`/code-simplify`(代码简化)、`/ship`(安全部署);- 19个核心技能:从`idea-refine`(想法提炼)到`shipping-and-launch`(上线发布),每个技能包含步骤、工作流验证和反合理化表;- 专业代理角色:`code-reviewer`(资深工程师视角)、`test-engineer`(测试专家)、`security-auditor`(安全审计);- 参考清单:测试模式、安全检查、性能优化、无障碍标准等快速参考;- Google工程实践:集成Hyrum's Law、测试金字塔、Chesterton's Fence、Trunk-based Development等实战经验;- 多平台集成:Claude Code一键安装,Cursor规则文件,Gemini原生技能,支持任何Markdown提示的AI代理。通过`git clone`本地运行或Marketplace安装,适合开发团队、AI代理爱好者和工程实践训练。#AI编程# #工程技能# #AgentSkills#
新浪微博 2026-04-06 00:00:00
35. Antropic Claude 推出新概念 Agent Skills,让 Claude 从“通用模型”进化为“可编程的专用智能体”,它通过可加载的技能体系,将人类的知识和流程转化为可复用的智能模块。1. 核心概念:Agent Skills 是一种“技能包”,由说明文档、脚本和资源组成。Claude 可以在需要时动态加载这些技能,而不是一开始就加载全部上下文。2. 作用:让 Claude 能执行特定领域的任务,比如处理 PDF、填写表单、运行脚本、执行数据分析等,相当于给 Claude 增加“专业模块”。3. 结构:每个 Skill 是一个文件夹,核心文件是 SKILL.md,包含技能的元数据(名称、描述)和使用说明;也可包含其他资源文件或可执行代码。Claude 根据任务需要,分层加载这些内容。4. 原理:Claude 先读取每个技能的基本信息,当判断某个技能相关时,再逐步加载其详细内容或脚本执行逻辑,实现「渐进式上下文披露」。5. 优势:(1)增强 Claude 的专业性与上下文理解;(2)减少 token 占用,提高执行效率;(3)让组织可复用知识,把程序性经验打包成模块化能力。6. 安全与可扩展性:Skills 可以自由创建与共享,但要注意代码安全和上下文来源;未来 Claude 还将具备自动创建、评估和优化技能的能力。Blog:www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills#人工智能##程序员#
新浪微博 2025-10-17 00:00:00
36. Autoresearch是一种AI代理框架,能自主执行评估-优化循环,适用于任何可量化的技能、工作流或研究任务,帮助实现指数级改进,但需注意token消耗。token = 信息有序程度。更多的 token = 更高的内容质量,代码水平等等等等。。。网页链接
新浪微博 2026-03-20 00:00:00
37. 2026 最该学的AI技能:Skills
微信公众号 2026-01-15 00:00:00
38. 浅谈 Agent 开发工具链演进历程
知乎 2025-10-27 00:00:00
39. 手把手安装OpenClaw龙虾必备的技能Skills!
哔哩哔哩 2026-03-14 00:00:00
40. OpenClaw狂揽16万star,是时候聊聊Agent Tools的AB面了
微信公众号 2026-02-06 00:00:00
41. Skill 调用 Skill:Agent Skills 的乐高式组合写 Skill 的时候遇到一个问题:我的漫画生成 Skill 需要画图,但用户可能装了 Nano Banana Pro 的 Skill,也可能装了 Midjourney 的。我要在代码里写死调用哪个吗?不用。这正是 Agent Skills 设计的精妙之处。原理:启动即感知Claude 调用 Skill 时会加载 SKILL.md、注入指令、修改执行环境。但更关键的是启动阶段——Agent 启动时就预加载了所有已安装 Skill 的名称和描述。换句话说:Agent 一启动就知道自己有哪些能力。实践:松耦合调用我的漫画 Skill 里,画图环节是这样写的:> Check available image generation skills If multiple skills available, ask user preference> 检查可用的画图 Skill,如果有多个则提示用户选择好处是解耦。我不依赖任何特定的画图实现,用户装了什么画图 Skill,Claude 就调用什么。更妙的是 Claude 能动态适配目标 Skill 的能力:- 支持参考图 → 传角色设计图- 只支持文本 → 传文字描述所以我只需要说:“帮我画张图”,而不用:“用 Nano Banana Pro 的 API 帮我画张图”。为什么这样更好这种松耦合带来几个实际好处:1. 可替换:换画图引擎不用改上游 Skill2. 可扩展:新画图 Skill 自动可被调用3. 低维护:Skill 作者不用追踪下游依赖4. 用户自主:用户选自己喜欢的工具Skill 间相互调用是基于能力描述的松耦合。你只描述“需要什么能力”,Claude 在运行时自动匹配。这让 Skills 成了真正的乐高积木——独立模块,自由组合,构建复杂工作流。
新浪微博 2026-01-22 00:00:00
42. OpenClaw出事后开发者怒了,48小时造出省99%成本的AI技能共享系统-EvoMap
微信公众号 2026-02-21 00:00:00
43. 在线开发智能代理系统遇到上下文管理难题?推荐看看 muratcankoylan 的开源项目「Agent Skills for Context Engineering」,这是一个面向生产级 AI 代理系统的全面技能库。它提供了完整的上下文工程方案,涵盖基础理解、架构设计、多代理协作、工具开发、评估优化等多维度技能,帮助你科学管理语言模型的上下文窗,实现最高效的上下文利用和智能决策。主要亮点:- 深入讲解上下文衰减、压缩和优化,避免模型“迷失中间”;- 支持多代理架构设计,含监督者模式、图谱记忆、沙盒环境等;- 提供完善的评估框架,支持LLM作为裁判进行性能对比和偏差缓解;- 包含项目开发全流程指导,从概念设计到流水线部署;- 独家认知架构技能,形式化建模代理心智状态,实现理性推理与解释;- 跨平台、通用原则,适配Claude Code、Cursor等主流代理平台。GitHub:github.com/muratcankoylan/Agent-Skills-for-Context-Engineering无论你是搭建单一代理还是多智能体系统,这套技能库都能助你构建、优化和调试高效智能体,推荐 AI 开发者和研究者深入学习!#AI创造营##人工智能#
新浪微博 2026-03-02 00:00:00
44. 在使用Claude AI时,如何高效管理和扩展它的能力?Awesome Claude Skills 项目汇集了大量优质的Claude Skills、资源和工具,帮助你定制和优化Claude的工作流程。技能是一种可复用的任务执行“插件”,包含说明、脚本和资源,Claude能根据上下文智能加载,避免信息过载。这个项目不仅涵盖文档处理(Word、PDF、PPT、Excel),还包括设计创意、开发辅助、沟通写作等多个领域。无论是自动化办公,还是复杂的数据处理,甚至是生成算法艺术,都可以找到合适的技能支持。支持通过Claude.ai界面开启技能,也能用CLI和API方便集成。更有社区贡献的超强技能库和持续更新,适合开发者、数据科学家和AI爱好者使用。项目地址:github.com/travisvn/awesome-claude-skills主要特点:- 按需加载,节省模型上下文资源,提升效率 - 丰富的官方和社区技能,涵盖文档、设计、开发、沟通等领域 - 支持Web界面、命令行和API多种使用方式 - 易于扩展,支持自定义技能开发和分享 - 专业的文档和示例,帮助快速上手 适合想要利用Claude打造个性化AI助手或自动化工具的用户,显著提升工作和创作效率。
新浪微博 2025-12-01 00:00:00
45. OpenKG 首发 SkillNet:大规模智能体“技能图谱”知识库
知乎 2026-03-22 00:00:00
46. #马化腾说没想到养龙虾这么火# OpenClaw目前最大的问题,在于Token消耗太多了。但实际上大家真正需要的好用的东西,不是如此昂贵的。也有很多降低Token消耗的办法。那就是将任务程式化,规则化,以及提供更优质的需求服务。#OpenClaw#
新浪微博 2026-03-08 00:00:00
47. 从“工具过载”到“精准调用”:破解 Agent 工具管理难题
知乎 2026-01-28 00:00:00
48. AI Agent 很火,但 Agent Infra 准备好了吗?
微信公众号 2025-12-25 00:00:00
49. Antropic这个视频视频“Don't Build Agents, Build Skills Instead“,讨论了智能体的发展方向。Claude认为,尽管代理很智能,但它们缺乏领域专业知识和持续学习能力,因此提出了一种名为技能(Skills)的新范式。这些技能本质上是组织化的文件集合,包括脚本和程序知识,充当领域专家的角色,使智能体能够更一致和高效地执行任务。技能的设计理念是任何人都可以创建和使用,并正在形成一个迅速增长的生态系统。一、Anthropic 为什么“放弃”传统 AI Agent核心原因只有一句话:现在 AI 的问题不在“不够聪明”,而在“没有专业经验”。大模型像智商很高但没上过班的新人,面对真实业务场景(财务、法律、工程、运营),稳定性和可靠性都不够。继续堆“更强的 Agent”解决不了这个问题。二、真正的瓶颈是什么不是推理能力,而是可复用的领域专业知识。现实工作需要的是“熟练工”,不是“天才从零推导”。三、Anthropic 的第一个关键转向通往数字世界的通用接口不是复杂工具,而是代码。只要 Agent 能写、能读、能改代码,它就能:1) 访问 API2) 操作文件系统3) 数据分析4) 生成结果而且代码是可调试、可修改的,比固定工具强得多。四、真正的颠覆点:不用复杂系统,只用“文件夹”Anthropic 用一个极端简单的方案解决“经验沉淀”问题:把专业知识封装成技能(Skill)= 一个有结构的文件夹。技能本质是:1 可执行或可调用的程序性知识2 放在文件里,能被版本管理、共享、复用3 需要时才加载,避免上下文爆炸这比“智能 Agent 自动学习一切”要现实得多。五、他们真正构建的不是 Agent,而是三层结构1 模型 = 处理器(负责思考)2 Agent Runtime = 操作系统(负责任务与资源调度)3 技能 = 应用程序(真正的业务能力)价值不在模型本身,而在“技能生态”。六、为什么这比 Agent 更重要因为技能让 AI 第一次拥有了可积累、可迁移、可复利的记忆。今天学到的流程,可以变成技能;明天、下个月、下个版本的 Claude 都能直接用;团队内部、社区之间还能共享。AI 不再每天“从头做人”,而是像员工一样越干越熟。总之,不要再指望一个“无所不能的超级 Agent”。真正有价值的是:一个通用 Agent + 一个不断增长的技能库。AI 的未来不止是“更聪明”,更是“更有经验”。#科技先锋官# #ai创造营#
新浪微博 2025-12-19 00:00:00
50. 在线开发经常需要不同领域技能之间切换,选错工具导致效率大打折扣。Claude Skills 整合了 66 项专为全栈开发者设计的专业技能,涵盖前端、后端、测试、DevOps、安全、数据等多个领域。用它配合 Claude 代码助手,可以让 AI 变成你的全能资深编程搭档。不仅支持自动根据需求激活对应技能,还能组合多技能完成复杂任务,比如从需求到测试上线整个开发流程辅助;还有丰富参考资料和项目工作流命令,支持与 Jira、Confluence 等工具集成。GitHub:github.com/Jeffallan/claude-skills 主要优势:- 66 个细分技能,覆盖 12 大技术类别,资深专家级能力;- 自动根据上下文激活对应技能,极大提高代码生成精准度;- 多技能联动支持复杂业务开发、调试、测试和安全加固;- 丰富的参考文档和决策树,便于快速理解和应用;- 工作流集成 Atlassian 工具,支持项目从需求到回顾全链路管理;- 跨语言支持,涵盖 Python、JavaScript、DevOps 脚本等多种技术栈。适合全栈开发人员、技术负责人和敏捷团队打造高效协作开发环境。#AI创造营##人工智能#
新浪微博 2026-03-06 00:00:00
51. Claude Agent Skills 深度解析:基于第一性原理的提示工程架构leehanchung.github.io/blogs/2025/10/26/claude-skills-deep-dive/ Claude 的 Agent Skills 构建了一种优雅的、以提示为核心的能力扩展体系。它通过“元工具 + 提示注入 + 上下文控制”的方式,实现了安全、灵活且可组合的智能代理行为定制,代表了 LLM 应用从“功能调用”向“认知引导”演进的重要方向。#科技先锋官#
新浪微博 2025-11-24 00:00:00
52. #IT那些事儿# LobsterAI 与 CoPaw 在 SKILLS 上的区别一、网易有道出品的LobsterAI,底层系统是 Claude Agent SDK + 自研技能系统而阿里云开源社区维护的 CoPaw 底层是自研 Agent 框架。二、与 OpenClaw 有 ClawHub (lobehub.com) 作为技能注册中心相比,LobsterAI 没有公共注册中心,也不支持外部安装,没有技能动态安装机制。LobsterAI 的技能是预编译的,即 LobsterAI 打包时就把 SKILLs/ 目录的技能编译进应用。对比 OpenClaw 是开放生态,允许社区贡献技能(但也带来了投毒风险),LobsterAI 是封闭生态,技能由网易有道官方维护。三、CoPaw 则可以下载外部技能并判断是吸收还是安装如果给 CoPaw 一个具体的 OpenClaw 技能,它可以:下载并读取 SKILL.md;用 skill-vetter-lite 检查安全和兼容性;给出整合方案(自动吸收 or 手动安装);如果需要,才会实际执行安装;如果部分技能依赖 OpenClaw 专有工具(如使用 sessions_list、sessions_send 等),或依赖 Hook 系统的技能(需要 UserPromptSubmit/PostToolUse Hook)而 CoPaw 没有 Hook 系统,那么就不会安装。
新浪微博 2026-03-04 00:00:00
53. 企业专属 Agent 开发实践
知乎 2026-03-26 00:00:00
54. Claude Code装了LSP后,Token消耗直接降了40%
微信公众号 2025-12-20 00:00:00
55. AIAgent 被指「雷声大点雨点小」,其发展困境主要是什么?
知乎 2025-12-11 00:00:00
56. 理解 LangChain 智能体:create_react_agent 与 create_tool_calling_agent
知乎 2025-11-07 00:00:00
57. 9.3k星Skill Seekers:一键把文档变成Claude技能,文档党狂喜
微信公众号 2026-02-11 00:00:00
58. 在线开发自动化调试和迭代代码的朋友们注意了!autoagent(网页链接)致力于打造“自主引擎工程”。autoagent的核心思想是:你不再直接改动运行代码,而是通过编写一份program.md指令文件,让一个meta-agent自主读取、修改和优化agent.py中的代码,实现自动构建和迭代agent。它会根据benchmark任务的得分,自动调整策略,类似AI自动“打怪升级”的过程。项目亮点:- 单文件Python架构,注册驱动,结构清晰易改;- 任务基于Harbor格式,方便统一测试;- 整合Docker隔离环境,安全无风险地自动跑任务;- 自动根据测试得分保留更优改动,实现闭环优化;- 支持并行任务运行,提升效率。适合AI研发、智能agent工程师做自动化实验、自动调优agent的好帮手。只需写好benchmark任务和program.md,就能让meta-agent自主“熬夜”改进代码,效率爆棚!GitHub: github.com/kevinrgu/autoagent#自动化开发# #智能Agent# #开源项目#
新浪微博 2026-04-03 00:00:00
59. #邵艺辉说绝不浪费自己的才华# 导演邵艺辉上台领奖发言!今晚《好东西》荣誉太多啦,她笑着说以为自己会得最佳编剧,没想到会获得这么大的奖:“真的太幸运和太幸福。表示会提醒自己慎重对待自己的每一部作品、写的每一个字,绝不浪费资源、浪费钱、浪费才华,再为中国电影奋斗100年。 内娱公子哥的微博视频
新浪微博 2025-11-15 00:00:00
60. 【当AI也有了自己的“npm”,模块化智能时代正式开启】Vercel团队宣布推出skills——一个面向AI技能的开放生态系统,类似于前端开发者熟悉的npm包管理器。这个类比精准地点出了当前AI Agent开发的痛点:我们一直在手工编写“推理能力”,每个团队都在重复造轮子。如果技能可以像npm包一样安装、组合、复用,开发者就能把精力真正放在工作流设计和安全护栏上,而不是反复实现相同的连接器。从技术架构的角度看,这种“无关具体Agent”的设计理念很关键。就像OpenAPI为REST接口带来了标准化,技能注册中心有潜力终结当前各家厂商各自为政的混乱局面。当然,社区也有不同声音。有开发者指出OpenSkills项目早在skills之前就已经存在,目前已获得5000多个GitHub星标;也有团队在推进不那么依赖npm生态的类似方案。这种良性竞争恰恰说明,整个行业正在形成对“标准化AI技能生态”的共识。不过,熟悉npm历史的开发者难免会心一笑:当年的left-pad事件可是让整个前端圈停摆。如果AI技能也走上这条路,某个基础技能的故障是否会让一群Agent集体“宕机”?还有人打趣道:只要Agent的node_modules文件夹不要膨胀到40GB,什么都好说。开放、可组合、与具体实现解耦——这些“无聊的标准”,往往才是生态繁荣的真正基石。x.com/rauchg/status/2012345679721771474
新浪微博 2026-01-17 00:00:00
61. Claude Agent Skills:将 Workflow 打进技能包
知乎 2025-11-27 00:00:00
62. 别乱装!AI 小龙虾技能装太多 = 效率暴跌 + 钱包大出血(真实案例)
今日头条 2026-03-30 00:00:00
63. Anthropic揭秘Agent新范式
微信公众号 2026-01-28 00:00:00
64. AI Agent性能翻倍!技能工程实操指南,新手也能轻松上手
今日头条 2026-03-07 00:00:00
65. 不要重复造轮子
微信公众号 2025-12-14 00:00:00
66. AI Agent的隐性成本
微信公众号 2026-04-02 00:00:00
67. 你花大价钱跑的Agent,可能90%都在浪费Token
今日头条 2026-03-21 00:00:00
68. 小米MiMo大模型负责人罗福莉谈Token效率,Agent框架如何优化?
今日头条 2026-04-06 00:00:00
69. 小米Agent效率系统让算力成本直降71.2%
微信公众号 2026-04-01 00:00:00
70. AI Agent最新重磅综述
知乎 2026-02-03 00:00:00
71. OpenAI 和 Anthropic 官方经验
今日头条 2026-03-19 00:00:00
72. 别再装一堆技能了!Claude Code高手只用这几个
哔哩哔哩 2026-03-09 00:00:00
73. 你的AI Agent正在疯狂烧钱!只需这一招,Token成本直接砍掉75%
今日头条 2026-02-13 00:00:00
74. OpenClaw Token消耗优化实战指南
今日头条 2026-03-19 00:00:00
75. AI Token消耗
微信公众号 2026-04-03 00:00:00
76. Token 消耗与哪些因素相关?全面解析 AI 模型的成本构成
今日头条 2026-04-03 00:00:00
77. 面试官
知乎 2026-04-06 00:00:00
78. OpenClaw Token 优化实战
知乎 2026-03-06 00:00:00
79. 智能体的Token经济学(10个小技巧帮你降低Token消耗)
知乎 2025-10-24 00:00:00
80. Token烧钱太心疼?AI减负新思路来了,告别无脑耗量!
今日头条 2026-03-18 00:00:00
81. 如何才能减少 Token 的消耗?
微信公众号 2026-04-07 00:00:00
82. Agent狂烧Token?你要学会减少无效的Token消耗。
知乎 2026-03-27 00:00:00
83. 为什么 AI Agent 的成本,总是比你预期的高?
微信公众号 2025-12-17 00:00:00
84. 深度拆解
知乎 2026-04-08 00:00:00
85. 编程Agent的工作原理
微信公众号 2026-04-08 00:00:00
86. Token 消耗与哪些因素相关?全面解析 AI 模型的成本构成
今日头条
87. 生产级AI Agent设计9个最佳实践“第一性原理”
知乎 2025-12-16 00:00:00
88. 智能体工具调用策略
微信公众号 2026-03-20 00:00:00
89. 如何设计高效的Agent工具
今日头条 2026-03-03 00:00:00
90. 单次任务真的能测出智能体能力吗?SkillCraft 发布首个技能复用评估基准
微信公众号 2026-03-22 00:00:00
91. 走进 everything-claude-code
微信公众号 2026-01-26 00:00:00
92. Agent Skill开发实践(3)
今日头条 2026-04-03 00:00:00
93. 实测170个AI Agent技能后,致命误区
今日头条 2026-03-20 00:00:00
94. Agent Skills
微信公众号 2026-01-27 00:00:00
95. Skill0
知乎 2026-04-05 00:00:00
96. 给 AI Agent 装技能包(Skills),有时还会有副作用?
微信公众号 2026-03-08 00:00:00
97. 深入浅出 Agent Skills
微信公众号 2026-04-05 00:00:00
98. 🧠 给 AI 装上「技能包」
微信公众号 2026-03-29 00:00:00
99. AI Agent 两大能力架构深度对比
知乎 2026-03-10 00:00:00
100. Skills vs MCP
知乎 2026-01-26 00:00:00
101. MCP是手,Skill是技能书
微信公众号 2026-03-22 00:00:00
102. AI Agent技能自进化
微信公众号 2026-03-16 00:00:00
103. 如何评估 AI Skills
微信公众号 2026-03-31 00:00:00
104. Deep Agents技能系统。🚀 LangChain发布Deep Agents CLI技能支持,智能体现在可通过SKILL.md文件夹动态发现和加载功能!
抖音 2025-12-21 00:00:00
105. OpenClaw插件避坑指南
什么值得买 2026-04-01 00:00:00
106. 深度解析|AI Agent自动化工作流
知乎 2026-02-25 00:00:00
107. AI智能体的开发流程
微信公众号 2026-02-10 00:00:00
108. 23 个让效率翻倍的 AI Agent 实战技巧(2026 最新版)
知乎 2026-03-24 00:00:00
109. 2026年AI Agent实战
微信公众号 2026-04-06 00:00:00
110. 2026 年 AI Agent 发展趋势
知乎 2026-03-10 00:00:00
111. 如何统计Token 消耗?
微信公众号 2026-04-01 00:00:00
112. AI 新范式:从构建 Agent 到构建 Skills
微信公众号 2026-03-01 00:00:00
113. 程序员踩坑记:用Cherry Studio写软考高项文,1个对话花掉7美元?本地RAG救大命!
微信公众号 2026-03-04 00:00:00
114. AIagent技术指南| OpenAI Agent 构建指南:从设计到安全,一文讲透落地全流程(24页-文末附完整版下载)
微信公众号 2026-04-05 00:00:00
115. 告别培训“无效内耗”:AI陪练让资源浪费成为过去
知乎 2026-01-09 00:00:00
116. AI Agent核心概念与架构详解:十分钟速成Agent、A2A、MCP和Skills概念全解析!
知乎 2026-01-15 00:00:00
117. Skill技能增强强化学习。📚arXiv: 2602.08234 ✏️标题: SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning 📄一句话介绍:将历史轨迹蒸馏为层次化可复用技能库,通过技能与策略协同进化显著提升 LLM 智能体的推理效率与跨任务表现 🎯动机 LLM 智能体以情节式方式运行,无法从历史经验中持续学习。现有记忆增强方法直接存储原始轨迹,冗余度高、噪声重,既占用大量上下文 token,又难以提炼出可迁移的行动策略。核心问题在于:有效的经验迁移需要抽象化——将具体轨迹转化为结构化可复用技能,而非简单记忆原始对话历史,这一能力的缺失制约了智能体在复杂任务中的持续改进。 💡方法与创新 本文提出 SkillRL,通过三个核心模块实现技能驱动的智能体进化: 经验蒸馏:教师模型对成功轨迹提取策略规律,对失败轨迹提炼简洁错误教训,实现相较原始轨迹 10-20 倍的 token 压缩,同时保留关键知识。 层次化技能库(SkillBank):将技能分为通用技能(探索策略、状态管理等普适原则)与任务特定技能(按类别组织的领域知识),配合语义相似度检索实现精准的情境化技能调用。 递归技能进化:技能库与智能体策略在 RL 训练中协同演进——每轮验证后分析失败案例并生成新技能填补能力缺口,形成持续的自我改进循环。引入冷启动 SFT 桥接阶段,让基础模型在 RL 优化前先学会有效利用技能库。 📊实验设计 在 ALFWorld(6 类家务子任务)、WebShop(电商导航)和 7 个搜索增强问答数据集上进行全面评测。ALFWorld 达 89.9% 成功率,较 GRPO 提升 12.3%,超越 GPT-4o 41.9%、Gemini-2.5-Pro 29.6%;WebShop 达 72.7%,超越 Mem0+GRPO 35.2 个百分点;搜索问答平均 47.1%,超越 EvolveR 4.0%,整体超越所有基线超 15.3%。消融实验确认各模块贡献:去除层次结构 -13.1%,改用原始轨迹 -25%,去除冷启动 SFT -20%,去除动态进化 -5.5%。 #智能体 #AI #大模型 #科研 #知识前沿派对
抖音 2026-02-23 00:00:00
118. 深入理解LangChain记忆系统:短期记忆管理与上下文优化策略
知乎 2026-01-04 00:00:00
119. UIUC 等机构:Agentic AI 适应性框架全解析
小红书 2025-12-12 00:00:00
120. LlamaIndex技术深度解析:从数据框架到高级RAG实践
微信公众号 2026-04-07 00:00:00
121. Token消耗直降87%!OpenClaw 省钱神器上线,3步设置立刻省爆
今日头条 2026-04-06 00:00:00
122. 大模型应用:从问题到答案:LlamaIndex RAG系统工作流程详解.15
知乎 2026-02-15 00:00:00
123. 如何通过 Skills、MCP 和 Subagents 构建 AI Agent 能力操作系统?
今日头条 2026-01-26 00:00:00
124. “声控”运维、技能复用,合合信息Chaterm可多场景双端智能运维
今日头条 2026-02-05 00:00:00
125. AutoAgent|首个开源的 Agent 自我优化框架
小红书 2026-04-05 00:00:00
126. 教你正确使用AI设计类的Agent:一次创作不翻车的避坑指南
今日头条 2025-11-13 00:00:00
127. Agent Skills使用指南
今日头条 2025-11-22 00:00:00
128. 让AI自己设计UI!Agent Skills实战指南
小红书 2026-01-29 00:00:00
129. NUS:让机器人学会拆任务的技能复用架构
小红书 2026-03-07 00:00:00
130. Agent应用赋能——复杂任务自动化处理
微信公众号 2026-03-31 00:00:00
131. 3分钟大白话讲透AI Agent到底是什么? 传统AI,它的强项是回答问题。但AI Agent不同,它至少多出了四个核心能力:思考、记忆、使用工具、以及行动 。 当它接到一个任务时,它会“先规划,再执行”。 📕任务分解:它会把一个大目标拆解成无数个具体的执行步骤 。 📕智能决策:它会分析手里有哪些资源,哪种方案最优 。 📕调用工具:这是最酷的一点。它能像人一样上网查资料、用Excel处理数据,甚至操作浏览器 。 如果需要做一个登陆系统,AI Agent可以自主设计架构、编写前后端代码、建立数据库,甚至直接帮你把服务器都部署好 。我们从“写代码的人”变成了“Code Reviewer(代码审核员)”,只需要负责审核把关 。 对于自媒体创业者,AI Agent能帮你搞定账号定位、选题设计,甚至一口气写好30篇文案,自动生成配图,然后定时发布 。它一个人就是一支运营团队。 其实,AI Agent带来的是一场生产力的革命。 我们正在从“人操作工具”的时代,跨越到“人管理智能体”的时代 。 未来的工作逻辑变成了:人 -> AI Agent -> 世界 。 在这种模式下,你的“执行力”变得不那么重要了,但你的“判断力”变得至关重要 。 未来最稀缺的能力,不是你会写多少行代码,或者PPT做得多漂亮,而是你能不能给AI下达最正确的目标,以及你是否有管理智能体的能力 。 #AI工具 #ChatGPT #aiagent #AIAgent #生产力工具
抖音 2026-01-25 00:00:00
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!435 112 -
网龄十年,为何有人月领30GB,有人只有1GB?55 125 -
评论有奖|这几件夏季洗护小事全网愣是争了好几年,今天一次性说清楚148 376 -
罗永浩怒斥电视机厂商:不毁灭没天理!135 421
已收藏
去我的收藏夹