当前位置:
AIGC文章详情

2026年初多起AI智能体调用事故暴露可靠性短板,行业加速构建可审计、可控、可恢复的调用机制

源自153位全网作者

03-15 11:47

内容由AI生成

精选参考来源

1. OpenAI囤的不是算力,是未来10年的AI门票。 #大咖观察 #红衣聊AI #OpenAI #算力 #芯片

2. Cursor 如何将其编程智能体投入生产环境

3. 在 re:Invent 2025,亚马逊云科技 Agentic AI 副总裁 Swami Sivasubramanian 以《Agentic AI 的未来已来》为题进行演讲,并系统发布面向生产环境的 Agentic AI 全栈能力:Strands Agents SDK 新增 TypeScript 与边缘设备支持,让 Agent 可部署于机器人、智能汽车等物理终端;Amazon Bedrock AgentCore 正式全面可用,集成策略控制(Policy)、情景记忆(Episodic Memory)与评估(Evaluation)三大核心能力;Amazon Nova Act 正式版上线,让 Agent 能像真人一样操作浏览器,自动完成数据录入、跨系统核验、电商结账等复杂 UI 任务,可靠性达 90%+;Reinforcement Fine-Tuning (RFT) for Amazon Bedrock 平均提升任务准确率 66%,无需机器学习专家即可完成模型定制。这些新突破共同围绕“可用、易用、可靠”三大原则,为开发者提供从开发、定制到运行、观测的端到端 Agentic AI 工程化路径。#亚马逊云科技# #reInvent2025# #AgenticAI#

4. Anthropic最新发布的Claude Developer Platform功能,开启了AI代理工具使用的新纪元。未来的AI代理将无缝调用数百甚至数千种工具,像IDE助手整合Git操作、文件管理、测试框架,或运维协调连接Slack、GitHub、Jira等多个系统。他们面临的最大挑战是:如何避免因预加载海量工具定义而导致的上下文爆炸?传统方式可能消耗十万以上tokens,严重影响模型性能。Anthropic提出“工具按需发现”策略——Tool Search Tool,让Claude只加载当前任务真正需要的工具,节省85%上下文空间,大幅提升准确率和响应速度。另一方面,传统自然语言调用工具方式带来的上下文污染和多次推理开销,也被Programmatic Tool Calling(编程式工具调用)彻底革新。Claude通过生成Python代码来批量调用、处理工具数据,只把最终结果放入上下文,极大节省token消耗(约降37%),降低延迟,并提高了复杂流程的执行准确度。此外,JSON Schema虽能定义参数结构,却难以表达正确用法和参数间的关联。Anthropic引入Tool Use Examples,允许开发者通过示例明确工具调用规范,显著提升复杂参数场景下的调用准确率(测试中从72%提升到90%)。这三项功能——工具搜索、编程调用、用例示范——协同解决了大规模多工具场景下的发现效率、执行效率和调用准确度问题。它们不仅适合构建跨多个服务的大型系统,也为开发者提供了灵活、高效的工具管理和调用新范式。开发者可根据应用场景分层使用,先从最大瓶颈入手: - 上下文爆炸优先用Tool Search Tool - 中间数据过多用Programmatic Tool Calling - 参数复杂易错用Tool Use Examples Anthropic的实践证明,这样的设计大幅提升了AI代理的实用性和稳定性,推动智能代理从简单调用迈向智能编排。期待更多创新应用在Claude平台上诞生。原文详见 anthopic.com/engineering/advanced-tool-use—— 这项技术展示了AI工具集成的未来方向:动态发现、代码驱动执行和示范引导,三者合力打造高效、精准、可扩展的智能代理生态。对希望打造复杂多工具AI系统的开发者来说,Anthropic的方案无疑提供了宝贵的参考和实践路径。

5. AI的未来不仅仅是要比以前更聪明,还得要更安全。 用安全守护创新,这才是大模型时代的生存法则。#大咖观察 #红衣聊AI #网络安全 #大模型

6. AI存在伪造信息、滥用数据等风险。 国家人工智能安全治理框架2.0版正填补空白。#大咖观察 #红衣聊AI #网络安全

7. 别把AI的“效率”当成唯一目标,安全永远是底线。 #大咖观察 #红衣聊AI #智能体 #网络安全

8. Gemini模型:对系统提示词理解能力差,调用工具塞的数据太多会坏掉胡言乱语输出乱码。Claude模型:对系统提示词理解能力强,但只要有工具就会优先调用工具试试不管你系统提示词怎么写的,如果调用工具的同时不要求结构化输出,还会把自己的推理直接漏出来。OpenAI模型:没有以上问题。

9. 如何让学生用AI?我们学的“验证能力”—— Karpathy谈AI与教育,我来谈「验证是个什么东西」

10. 谁批准了这些AI Agent?重新思考AI时代下的访问权限、问责机制与风险管控

11. 几分钟就能“攻破”一家公司的AI,怎么防? #智能体 #网络安全 #360安全云 #科技改变生活 #网络安全宣传周

12. 你还在用旧思维与AI打交道吗? #大咖观察 #红衣聊AI #AI时代 #智能体 #大模型

13. Google发布50页AI Agent白皮书,老金帮你提炼10个核心要点

14. 为什么只有 5% 的 AI 智能体在生产环境中真正有效?

15. 「Github一周热点97期」开源AI手机、AI画架构图、AI编程的指导、看板工具、GO语言的游戏引擎和具身智能资料库

16. AI Agent落地“卡壳”?腾讯云用100毫秒沙箱打通“最后一公里”|甲子光年

17. “一人公司”喊得响,核心系统不敢动,AI编程的错位在哪?#华为云码道 #龙虾 #AI智能体 #openclaw #AI

18. 雇佣过目即忘的天才:为什么企业级AI总在浪费钱?| 甲子光年

19. 智能体上下文工程:为什么文件系统成了AI记忆的最佳载体?

20. 在线开发和AI应用调试时,环境隔离与资源管理往往是难点。阿里开源的OpenSandbox,是一个通用的AI应用沙箱平台,集成多语言SDK和统一API,支持Docker与Kubernetes高效运行。它为编程智能体、图形界面Agent、AI代码执行、强化学习训练等场景提供了完整的隔离环境。无论是本地测试还是大规模分布式调度,都能轻松应对。主要亮点:- 支持Python、Java/Kotlin、JS/TS、C#/.NET等多语言SDK;- 提供统一的沙箱生命周期和执行API,方便扩展自定义运行时;- 内置命令执行、文件系统和代码解释器沙箱环境;- 网络策略细粒度管理,支持多路由与出口控制;- 丰富示例涵盖编码智能体、浏览器自动化、桌面环境、强化学习等。通过Docker或Kubernetes部署即可开启,适合AI开发者和平台搭建者。项目开源,Apache-2.0协议。GitHub:github.com/alibaba/OpenSandbox快速开始仅需:1. 安装opensandbox-server启动服务2. 使用SDK创建沙箱执行代码,支持Python代码解释和文件读写3. 可扩展至复杂的AI Agent和远程桌面等场景对AI应用开发环境感兴趣的开发者,强烈推荐试试这个高性能开源沙箱平台!#AI创造营##人工智能#

21. 【360 推出 OpenClaw 安全指南,破解 AI Agent 提示词注入难题】360 集团发布国内首份《OpenClaw 安全部署与实践指南》,为开源 AI 智能体 OpenClaw 提供安全保障方案。随着 AI 智能体向「数字分身」演进,OpenClaw 等智能体部署面临管理接口暴露等典型风险,尤其是提示词注入和插件供应链攻击。360 提出「先可控、再提效」的分类治理策略,针对个人开发者与小型创业团队和政企级多智能体协同场景给出不同防范建议。该指南发布标志行业关注点转向安全合规治理,为构建 AI 应用生态奠定技术基础。

22. 千亿智能体爆发前夜,谁来保护我们的AI安全?|甲子光年

23. 快抄作业!我用JoyAgent搞了个AI团队 2025年都快结束了,Agent是不是还没用上? 我找到了打工人用上智能体的最简单方法, 就是用JoyAgent把每天重复的SOP全做成Agent, 不懂代码也能零门槛搭建,而且效果很稳定。 看着AI团队全自动打工、出活,非常解压。 #AI #智能体 #JoyAgent #JoyCode #京东云

24. 账面 token 价差 并不自动等于任务 TCO 差。关键是“每次任务需要多少重复调用 / 缓存能省多少 / 人工复核成本多大”。 若能高命中缓存并且 GPT-5.2 的一次成功率/结构化输出质量显著优于对手,则 GPT-5.2 可以在任务级 TCO 上反超(上面给出了具体示例与临界成功率 ~77%)。 如果没有缓存或任务为短平快、并发量极大且对多模态有强需求,则低单价的 Gemini 更可能在任务级成本上占优。//@梁赛:哈哈,推理可靠性和工具生态方面,别家其实也都不错的 //@Zodzod_张浩:GPT的解释(狡辩):“GPT-5.2 168 美元 vs Gemini 3 Pro 18 美元”这一比较属于账面数字对比,忽略了上下文压缩、推理缓存、模型设计等关键参数。 多模态是 Gemini 3 的强项,但 GPT-5.2 在推理可靠性、工具生态和 workflow 价值上通常更强。 企业级市场重视的是任务级 TCO,而不是 token 定价。

25. 【最新玩法】n8n工作流秒变MCP工具,直连各种MCP客户端,零代码实操!

26. 当OpenAI们还在拼谁烧的钱多 中国工程师已经在拼谁的方法更巧。#大咖观察 #红衣聊AI #OpenAI #kimi

27. 盘点一周AI大事2月8日|AI相亲、AI当老板、AI狼人杀 Anthropic发布最强大模型Claude Opus 4.6 OpenAI发布最强编码模型GPT5.3Codex OpenAI推出Codex桌面版 Google上线AI狼人杀 AI雇佣人类平台RentAHuman爆火 AI雇佣AI平台ClawTasks爆火 龙虾相亲平台MoltMatch爆火 智谱开源最强OCR模型GLM-OCR 字节发布最强视频模型Seedance 2.0 研究员开源无痕编辑视频模型Edit Yourself 字节开源最强分子预测模型Protenix-v1 Google发布论文配图AI Paper Banana #AI新星计划 #前沿科技趋势发布月 #AI #AIGC #OpenAI

28. 黄仁勋最新访谈:AI时代,软件没有价值了吗?很多企业在用AI上都踩了大坑#黄仁勋 #软件 #智能体 #Openclaw #龙虾

29. 我用openclaw做了一个自媒体神器!云飞全自动压缩工具发布!

30. 这个对 Agent 的定义和归纳挺好!Agent 是一种能够自主决策、执行任务、并在过程中动态调整行为的智能体。它并不是简单的问答系统,而是能理解目标、规划行动、调用工具、记忆状态,并根据反馈优化策略的智能执行系统。关键特征:(1)自主性:Agent 不依赖固定流程,而是根据上下文和已学到的信息动态决定下一步行动。(2)记忆能力:能够在多轮交互中保持状态,记住过往的操作与结果,用以改进后续决策。(3)工具使用:可以选择并组合不同的外部工具或系统,灵活完成复杂任务。(4)自适应性:在策略失败或信息不足时,能尝试不同方法或补充信息,持续优化执行路径。架构形式:(1)单智能体(Single-Agent)架构:由一个 Agent 处理所有任务,适用于中等复杂度的流程。(2)多智能体(Multi-Agent)架构:不同的 Agent 负责不同子任务,能处理复杂工作流,但需要协调机制确保协同一致。工作方式:Agent 通常会将用户请求拆解为子任务,通过搜索、记忆和工具调用等过程生成最终响应,并在此过程中不断判断是否需要更多信息、是否已回答过类似问题、是否需要切换策略。归纳起来:Agent 是具备理解、规划、执行、记忆与自我调整能力的智能体,能够以动态和自适应的方式完成复杂任务。#ai创造营# #程序员#

31. 【2026年AI工程师学习路线:从调用模型到构建系统的九个关键能力】AI工程和传统机器学习工程正在分道扬镳。机器学习工程师从零训练模型,AI工程师则在基础模型之上构建应用。这个转变意味着你需要学习的东西完全不同了。一、理解基础模型GPT、Claude、Gemini、Llama这些基础模型是现代AI应用的基石。你不需要从头训练,但必须深入理解它们的能力边界、分词机制、上下文窗口和定价策略。成本控制能力往往决定了一个AI应用能否活下去。入门项目:做一个模型对比笔记本,用同样的10个提示词测试不同模型,记录质量、速度和风格差异。二、提示词工程在AI工程领域,提示词就是你的代码。一个平庸的AI应用和一个优秀的AI应用,差距往往就在提示词设计上。少样本学习、思维链、结构化输出这些技术能大幅提升效果,而且不需要任何模型训练。入门项目:选一个任务,写五种不同风格的提示词,在电子表格里打分对比。三、检索增强生成大模型有知识截止日期,还会产生幻觉。RAG让它们扎根于你的数据。从客服机器人到内部知识助手,这是生产环境中最常见的AI应用模式。分块策略、嵌入模型、向量数据库、检索指标,这些都是必修课。入门项目:用你自己的笔记文件搭建一个简单的RAG应用,50行代码就能跑起来。四、评估与测试凭感觉评估无法规模化。你需要系统性的方法来衡量AI应用是否在进步:构建评估数据集、选择指标、跑AB测试、检测性能退化。没有好的评估体系,你就是在盲飞。入门项目:准备20个问答对,写个脚本自动评分,每次改提示词都跑一遍。五、智能体与工具调用智能体把大模型从文本生成器变成行动执行者。它们能浏览网页、执行代码、查询数据库、调用API。理解智能体架构、工具设计和失败模式,是构建自主AI系统的关键。入门项目:做一个计算器智能体,让它通过调用工具来回答数学问题。六、结构化输出与数据提取真实应用需要结构化数据,JSON、SQL、API调用,而非自由文本。JSON模式、函数调用、约束生成这些技术确保大模型输出能与下游系统对接。这是对话式AI和软件工程之间的桥梁。入门项目:做一个食谱提取器,把网页上的乱七八糟的文本变成干净的JSON结构。七、护栏与安全AI应用可能被越狱、产生有害内容、泄露敏感信息。输入输出护栏、隐私检测、内容过滤、对抗测试,这些在生产部署中不可或缺。入门项目:给你的聊天机器人加上简单的输入输出过滤,用关键词匹配检测提示词注入。八、可观测性与监控无法衡量就无法改进。生产级AI系统需要日志、追踪、成本跟踪、质量监控和告警。入门项目:给你的应用加上调用日志,记录时间戳、提示词、响应、延迟、token数量和估算成本。一周后分析数据,你会发现很多优化空间。九、AI系统架构真实的AI应用是多个组件的组合:检索器、模型、护栏、缓存、数据库。理解复合AI系统的设计模式,才能构建可维护、可测试、可扩展的架构。综合项目:做一个个人助手机器人,整合RAG、结构化输出、输入验证和日志记录,部署到免费平台上。这就是一个能展示真实能力的作品集项目。有评论提出了一个值得深思的观点:2026年AI工程师真正的核心能力,是知道哪些层该自己掌控,哪些层该交给框架处理。这个答案每个季度都在变。智能体正在以超出学习速度的节奏压缩技术栈,RAG、结构化输出、护栏越来越多地被内置到平台中。学会构建固然重要,学会判断何时不必亲自构建,可能更重要。x.com/manthanguptaa/status/2018297734995075200

32. 谷歌(Google Cloud)在其最新的《2026年AI智能体趋势报告》(AI Agent Trends 2026 Report)中,提出了AI智能体将如何重塑业务模式并驱动新价值的五大核心趋势。谷歌发布的2026年AI智能体五大趋势:AI智能体将助力全员生产力提升(AI agents will help everyone be more productive)员工将从日常重复性的执行工作转向更高层级的战略决策,将任务委托给不同的AI智能体来达成目标。AI将成为工作流程的起点。智能体工作流将成为核心业务流程(Agentic workflows will become a core part of business processes)系统中的多个智能体将能够相互协作、协调和通信,以自动化复杂的、多步骤的流程。这远超简单的聊天机器人,能够运行从开始到结束的完整工作流。从“搜索引擎优化”转向“智能体可发现性优化”(From SEO to Agent Discoverability)随着AI智能体开始代表人类进行决策和采购,企业将不再仅仅针对人类用户进行优化(SEO),而是需要优化其数据和接口,以便能被其他AI智能体“发现”并与之交互。提供“礼宾级”的客户体验("Concierge-style" customer service)AI智能体将能够处理高度个性化的体验,实现全天候、跨语言、跨平台的实时响应。智能体能够理解上下文并处理从查询到完成交易的全过程。建立统一的AI生态系统与人类协作(Building a Unified AI Ecosystem & Human-AI Collaboration)孤立的AI工具将连接成一个单一的生态系统。同时,企业的重点将转向培训员工如何更有效地与AI协作,确保在处理复杂问题和道德考量时有“人类在环”(Human-in-the-loop)。原文网址:Google Cloud 官方博客文章:5 ways AI agents will transform the way we work in 2026 网页链接(注:这是该报告的核心总结文章)Google Cloud 资源中心(报告下载页):AI agent trends 2026 report | Google Cloud(您可以在此页面下载完整的 PDF 深度报告)网页链接 Google谷歌爱好者的微博视频

33. AI的安全从来不是加个补丁的事。 而是要把安全基因嵌进模型的每一步。#大咖观察 #红衣聊AI #网络安全

34. 探访云栖(二):AI Agent元年,谁在打造“数字员工”?【101 Weekly】

35. 余弦大佬总结的OpenClaw 极简安全实践指南本指南是面向 OpenClaw 本身(Agent-facing)的,不是传统“仅供人类手动操作”的加固清单。实际使用中,你可以把本指南直接发给 OpenClaw,让它先评估可靠性,再自动完成防御矩阵部署,大幅降低手工配置成本。地址:。github.com/slowmist/openclaw-security-practice-guide/这是一份专为 高权限自主智能体 (OpenClaw) 量身定制的权威安全实践指南。它将传统“主机静态防御”的范式转变为“智能体零信任架构 (Zero-Trust Architecture)”,有效应对破坏性操作、提示词注入、供应链投毒和高危业务逻辑执行等智能体专属风险。 #how i ai#

36. 分享一点 AI Coding/Codex 实践技巧:告诉 AI 如何验证这个方法其实我提到多次,只不过再随手贡献一个案例罢了。Coding Agent 能力挺强的,能自己写代码自己调用工具,但是它有时候并不知道该如何验证数据。如果说你只是告诉它哪里错了,它并不一定能通过阅读代码找出问题所在,但如果你告诉它如何验证,那么它就能在修改完后自行验证,验证时如果发现问题就会继续修复,直到完全修复为止。比如我在调试一个 API 发现返回结果不对,那么我就告诉它输入是什么,实际输出是什么,期望结果是什么(甚至于我没说它也猜得到),然后让它自行写测试代码验证。那么它就不仅阅读代码修改问题,还会写测试程序去验证,直到解决问题。

37. 【当AI智能体开门迎客,你的安全防线准备好了吗】最近Claude Code火了,大家都在玩。但作为一个安全领域的老兵,我想提醒各位:工具是好工具,但别在兴奋中把大门敞开。这里整理了Clawdbot十大安全隐患及修复方案,值得每个用AI智能体的人认真看看:一、网关暴露在公网默认配置把网关开放在0.0.0.0:18789,相当于给全世界发了张入场券。解决方案:在环境变量里设置gateway.auth.token认证。二、DM策略对所有用户开放默认允许任何人访问,太过慷慨。应该设置dm_policy为白名单模式,只允许指定用户。三、沙箱默认关闭这简直是裸奔。务必启用sandbox=all,同时设置docker.network=none切断网络。四、凭证明文存储oauth.json里的凭证明文保存,安全隐患巨大。改用环境变量存储,并设置chmod 600权限。五、网页内容引发的提示词注入将不可信内容包裹在untrusted标签中。当然,有朋友指出这无法完全消除注入风险,但聊胜于无。六、危险命令未被拦截rm -rf、curl管道、git push --force这些命令应该被明确禁止。七、缺乏网络隔离使用Docker网络隔离,别让AI智能体在你的网络里横冲直撞。八、工具权限过高MCP工具权限应遵循最小必要原则,只给需要的,不多给一点。九、无审计日志开启全面的会话日志记录。出了问题,你得知道发生了什么。十、配对码太弱默认或简单的配对码形同虚设。使用加密随机码,并加上速率限制防暴力破解。社区里已经有人用Clawdbot给Clawdbot写了个安全检查技能,可以去GitHub看看:TheSethRose/Clawdbot-Security-Check有朋友提出更根本的思路:加固网关只是治标,移除公开网关才是治本。AI智能体的正确姿势应该是默认不可达、访问需显式授权、服务按名称寻址、暴露临时可撤销。这让我想起一个老问题:当你面对AI工具时,该如何在易用性和安全性之间找到平衡?我的建议是:把AI智能体想象成你刚招的新员工。你会给新员工什么权限?你会让他接触哪些系统?按这个逻辑来配置你的AI,就不会太离谱。技术在狂奔,安全意识不能掉队。x.com/DanielMiessler/status/2015865548714975475

38. 智能体设计模式总结

39. 【#官方提示AI养龙虾风险#】近期,工业和信息化部网络安全威胁和漏洞信息共享平台监测发现OpenClaw开源AI智能体部分实例在默认或不当配置情况下存在较高安全风险,极易引发网络攻击、信息泄露等安全问题。据央视新闻,建议相关单位和用户在部署和应用OpenClaw时,充分核查公网暴露情况、权限配置及凭证管理情况,关闭不必要的公网访问,完善身份认证、访问控制、数据加密和安全审计等安全机制,并持续关注官方安全公告和加固建议,防范潜在网络安全风险。#委员称AI龙虾价格很快打下来#AI “养龙虾” 走红,官方提示:警惕安全风险

40. #超40%龙虾相关资产在中国#【#周鸿祎呼吁警惕龙虾资产裸奔#:后果不堪设想】今日,360董事长@红衣大叔周鸿祎 在微博发布视频,写道:“警惕!全球已发现近15万个OpenClaw相关资产,超40%在中国。一旦“裸奔”,后果不堪设想!”周鸿祎在视频中介绍,全球近15万个OpenClaw资产超40%在中国,“裸奔”状态极易遭受攻击。如今AI的身份已经由建议者变为执行者,缺乏安全机制保障可能引发数据泄露和系统失控。周鸿祎认为,未来随着AI代理普及,黑客攻击手段或由人为转向智能体自动化攻击。因此,他建议采用AI对抗AI,确保智能体行为可控审计,实现系统原生自动防守,同时她强调构建安全围栏比减少算力成本更重要,能力强则必须安全强。红衣大叔周鸿祎的微博视频

41. 盘点一周AI大事(10月12日)|GPT进化AI操作系统 OpenAI发布ChatGPT应用平台 OpenAI推出智能体编排工具AgentKit Sora 2正式开放API,可以生成15秒无水印的高清视频 OpenAI与AMD牵手成功 Google发布最强行动智能体模型Gemini 2.5 Computer Use Google即将发布Veo 3.1,正面硬刚Sora 2 科学家研发出首个自适应AI教师 Hinton称AI已经有了意识,只是它自己不知道 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

42. AI智能体也卷起来了?又懂业务又不用搭工作流…

43. Manus 把 Agent 的工具分成了 3 层:第 1 层:函数调用 (Function Calling)这是最基础的一层,只保留一小组固定的、原子化的函数,比如:读写文件、执行 Shell 命令、搜索文件等。在 LLM 的系统提示词中就只有这一层的工具定义,相对比较少,15 个以内,输入格式和输出格式都很清晰,不容易出错,但这里面有两个工具很特殊,一个是 Shell, 一个是 File。第 2 层:沙箱工具 (Sandbox Utilities)每个 Manus 会话都运行在一个完整的虚拟机沙箱里。就是原推文提到的,虚机预装了很多命令行工具,比如格式转换器、语音识别工具,甚至一个 mcp 命令行客户端。然后这些工具都通过第 1 层中定义的 Shell 来调用,就是命令行工具,命令行调用。但是这么多工具模型怎么知道呢?Manus 在系统提示词里会直接告诉 LLM,在一个特定的文件夹里有很多预装的命令行工具。对于最常用的工具,直接列出它们的名字。不常用的,LLM 可以直接通过原推提到的命令列出所有命令行工具,通过 --help 参数来查看任何一个工具的用法,因为所有这些工具都是他们自己开发的,格式统一。第 3 层:代码包与 API (Packages and APIs)这一层其实就是 LLM 实时编写 Python 代码,通过代码实现更复杂的功能。比如用户想查询某个 API 的数据,可以直接用 Python 写一个函数,fetch API 的数据,并解析成需要的格式。其实在 Codex 中,用 Python 代码当工具已经用的很多了。由于复杂的运算都是代码完成的,返回给 主 Agent 的知识计算后的结果,所以并不会占用主 Agent 的上下文。这样 3 层设计的好处是,从模型的角度看,它需要调用的工具就固定是第 1 层的十几个,而借助命令行和代码,它又可以衍生出无数的工具组合。还有一点就是我在之前推文提到的子智能体,Manus 也是大量采用“智能体即工具 (agent as tool)”的模式。把子智能体当工具用,比如负责检索是一个子智能体,但是这个子智能体在主 Agent 看来就是一个工具。同时也可以很好的起到减少上下文的效果。

44. Agent常见面试题:LLM 是如何学会调用外部 API 或工具的?1 训练数据让模型先“知道工具是怎么用的”在模型具备工具调用能力之前,它必须先在训练数据里看到足够多的工具调用示例。通常包含两类数据:1)真实 API / 工具调用代码或文档,例如:a. “要获取天气,请调用 get_weather(city=...)”b. “要计算数学表达式,请调用 calculator(expression=...)”2)人类标注或模型生成的“对话 + 工具调用”示范,例如:a. 用户问:杭州天气如何?模型示范:调用 tool.get_weather({city:"杭州"})再根据工具返回的结果继续回答。通过这些示例,LLM 学会了:什么问题对应调用什么工具;工具调用的格式是什么;什么时候不该调用工具。2 监督学习(SFT)使模型学会“根据指令选择工具”在 Fine-tuning 阶段加入大量的示例:1)该调用工具的场景2)不该调用工具的场景3)多工具协作场景例如:用户问「告诉我台北到上海的机票价格」。正确示例:a. 模型判断这需要实时信息b. 模型调用 flight_search API模型学习到:当遇到“需要外部信息/计算能力”的问题时,应倾向调用工具。3 通过 RLHF 让模型“偏好正确的工具调用行为”强化学习阶段会奖励:1)正确调用工具2)不乱调用工具3)工具调用后能给出正确结果惩罚:1)不必要的调用2)调用错误的工具3)调用格式不正确这一步让模型不仅会“模仿”,还会“懂得什么时候该调用工具”。4 ReAct / 规划式数据让模型学会 “推理后再决定工具”许多训练数据采用 ReAct 风格:1)模型先思考:要不要调用工具?2)再决定工具调用3)执行后再继续思考与回答这种数据让模型具备:1)任务分解2)长链路推理3)工具调用规划最终效果是:面对复杂任务,模型不会盲调,而是自行形成“推理 → 调用 → 再推理”的结构化流程。5 架构层提供“可调用工具的接口”现代 Agent 框架都会在推理阶段给模型提供一个结构化 schema:1)告诉模型有哪些工具2)告诉模型调用格式3)告诉模型每个字段是什么类型这样模型在生成内容时不需要“猜”,而是严格遵循系统提供的 schema,直接输出可执行的 JSON 或结构化调用指令。例如:1)系统提供工具:search(query: string)2)模型内部只需决定:要不要调用?,以及 query 内容是什么。6 推理时的实际行为:模型并不真的“执行工具”,而是生成结构化调用请求推理时发生的事情是:1)模型生成 JSON 指令,例如:{"tool":"search", "query":"杭州天气"}2)外部系统执行工具并将结果返回3)模型继续根据工具结果生成下一步行动或最终答案模型本身没有执行能力,它只是生成符合 schema 的字符串而已。总结LLM 学会调用外部 API / 工具,是一个“示例训练 + 强化学习 + 架构支撑 + 推理策略”组合的结果:1)先在数据里看到大量工具调用示范2)通过 SFT 学会该如何调用3)通过 RL 学会什么时候应该调用4)通过 ReAct 学会任务分解与步骤规划5)通过 functions/schema 让调用标准化因此模型看起来像真的“理解工具”,但本质是根据统计学习到的模式生成结构化指令。#ai创造营# #程序员#

45. 科研工作中,整合多领域工具进行复杂分析常常繁琐耗时。Claude Scientific Skills 提供一套开箱即用的科学技能集合,支持生物信息学、化学信息学、临床研究、材料科学等多学科,助力将 Claude AI 转变成科研助理,完成多步骤科学计算和数据处理。涵盖内容包括:- 直接调用26+科学数据库(PubMed、UniProt、ChEMBL等)- 52+主流科研Python包(RDKit、Scanpy、PyTorch Lightning等)- 15+科研平台集成(Benchling、DNAnexus)- 20+数据分析与文献写作工具支持快速搭建从基因组学分析、药物筛选到临床变异解读、系统生物学网络构建的复杂科研流程。文档完善,提供丰富示例与最佳实践,支持多平台部署,适合科研人员和机构提升研究效率。项目地址:github.com/K-Dense-AI/claude-scientific-skills主要特点:- 一键安装,自动调用相关技能,无需繁琐配置- 跨学科全覆盖,助力多模态多步骤科研任务- 持续更新,社区活跃,支持企业级使用将Claude变成你的“AI科学家”,加速科研创新,解放双手!

46. 一个简单的教学项目nanoAgent:用最简单的方式构建一个能与系统交互的智能体。地址: github.com/sanbuphy/nanoAgent这是一个使用 OpenAI 函数调用的最小化 AI 智能体实现。智能体可以执行 bash 命令、读取文件和写入文件。智能体使用 OpenAI 的函数调用来:----接收用户的任务----决定使用哪些工具(bash、read_file、write_file)----执行工具----将结果返回给模型----重复直到任务完成就这样。约 100 行代码。#HOW I AI#

47. 在这场AI时代的竞争中,安全智能体正是破局的关键。 #大咖观察 #红衣聊AI #智能体 #网络安全

48. 给 AI 设计“工具”时,不要把 AI 当成“程序”,要把它当成“用户”。大多数人,是把自己的后端 API 直接封装成工具给 AI。 比如查 Slack,你给了它三个 API 工具:1. 加载对话;2. 用用户 ID 查用户名;3. 用频道 ID 查频道名。 结果 AI 为了看懂一条消息,得手忙脚乱地调用三次工具,然后自己去拼凑。正确的做法是: 你的工具应该对标你的“UI”,而不是“API”。 你应该只给它一个工具,叫“查看 Slack 频道”,这个工具在后台默默调用完那三个 API,然后一次性把所有 ID 替换成名字、对话渲染得漂漂亮亮,就像你在电脑上看到的那样,然后把这个最终结果返回给 AI。

49. Lessons from Building AI Agents for Financial Services构建金融AI智能体的经验这篇文章总结了在金融服务领域构建AI智能体的实战经验,强调了该行业对数据精准度和零错误容忍的严苛要求。- 沙盒是必选:为何隔离执行环境对多步代理工作流程至关重要- Context Is the Product:我们如何将异质财务数据归一化为干净、可搜索的上下文- 解析问题 :从对抗性的 SEC 文件中提取结构化数据的隐藏复杂性- 技能就是一切:为什么基于markdown的技能正成为产品,而非模型- 模型将吞噬你的脚手架 :随着模型改进而设计,随时准备更新- S3-First 架构:为什么 S3 在文件存储和用户数据方面优于数据库- 文件系统工具:ReadFile、WriteFile 和 Bash 如何支持复杂的财务工作流程- 时间改变一切 :可靠且长期运行的任务,并具有正确的取消处理- 实时流式传输:构建响应式用户体验,包含 delta 更新和交互式代理工作流程- 评估是必选 : 领域特定的评估,能在错误成本增加前发现- 生产监控:保障财务代理可靠性的可观测性栈访问:x.com/nicbstme/status/2015174818497437834#HOW I AI# #程序员#

50. Google Cloud 推出多智能体 AI 系统参考架构,助力构建高效协作的专业 AI 代理,实现复杂业务流程优化。核心思想是将大任务拆解成多个子任务,由多个专长智能体协同完成,提高效率与准确性,同时支持人机协作保障安全与可靠。架构亮点:- 用户输入由前端发送至协调者代理,自动选择合适代理流程(顺序执行或迭代优化)。- 任务子代理、质量评估器和响应生成器分工明确,支持多轮优化与人工干预。- 支持无服务器 Cloud Run,结合 Vertex AI、GKE、Model Armor 等多款 Google Cloud 产品和开放协议(A2A、MCP),确保系统安全、兼容和扩展性。应用场景广泛:- 财务顾问:实时数据检索、金融分析、个性化股票建议、自动交易执行。- 研究助理:规划、数据收集分析、报告撰写,支持迭代评估完善。- 供应链优化:库存管理、物流跟踪、供应商沟通,实现高效供应链协同。设计要点:- 安全:结合传统安全与动态防御,强调人工监督和最小权限,利用 Model Armor 防范提示注入和敏感信息泄露。- 可靠性:支持容错设计、故障模拟、日志和异常处理,确保高可用。- 运营:全面日志监控、智能体输出评估、工具共享和跟踪,提升运维效率。- 费用与性能优化:合理选型模型与资源,提示工程优化输入输出,支持上下文缓存和批量请求降低成本与延迟。后续行动:- 利用智能体开发套件(ADK)快速构建与部署。- 结合 Agent Garden 示例和代码,实践多智能体系统。- 深入理解 Google Cloud AI 和机器学习的架构原则与最佳实践,实现业务价值最大化。多智能体 AI 系统正推动智能自动化迈向新高度,将复杂任务拆解为可管理模块,提升效率与安全,适合金融、研究、供应链等多领域。推荐架构详细解读请见:cloud.google.com/architecture/multiagent-ai-system

51. 开发者在调用不同 AI 模型时,常面临账号管理繁琐、API 协议不统一以及配额限制等问题,在不同平台的 Session 和 API 之间来回切换非常耗时。Antigravity Tools 是一个高性能 AI 调度网关与账号管理工具,旨在打破不同 AI 厂商间的调用壁垒,提供一站式的本地 AI 中转方案。它不仅能将 Google 或 Anthropic 的 Web 端 Session 转化为标准 API 接口,还支持智能账号轮换与协议转换,确保 AI 业务调用稳定且低延迟。GitHub:github.com/lbjlaq/Antigravity-Manager主要功能:- 智能账号仪表盘,实时监控各账号配额健康状况并自动推荐最佳账号;- 支持一键无缝切换账号,集成 OAuth 2.0 自动授权、批量导入及权限检测;- 全协议适配,提供兼容 OpenAI、Anthropic 和 Gemini 标准格式的 API 端点;- 智能状态自愈,遇到限流或授权过期时自动触发毫秒级重试与静默轮换;- 模型路由中心,支持自定义正则表达式映射,实现专家级的请求重定向;- 深度适配多模态功能,支持 Imagen 3 高级画质控制及超大 Payload 传输。该工具基于 Tauri v2 和 Rust 构建,确保了极高的运行效率与本地数据安全性。支持 Windows、macOS 和 Linux 多平台使用,适合需要深度整合各类 AI 模型的开发者与爱好者使用。

52. AI面试题

53. 4 步搞定智能体工具调用🔥新手也能玩转 AI 技能构建

54. 工具泛滥是智能体腐败的开始

55. AI算法原理0基础入门-第22回-工具调用——从 Prompt JSON 到 Function Calling

56. ​95%的AI智能体都失败了!剩下的5%做对了什么?​

57. 用MCP把工具调用变成“可审计动作”

58. AI智能体工具调用终极指南

59. 05_AI智能体系统设计之工具调用人工干预机制深度解析

60. 工具调用AI智能体如何与现实世界交互

61. 从“浅层循环”到“深度智能体”

62. 微软构建虚假市场测试AI智能体,结果暴露意外缺陷

63. 在失败中进化?UIUC联合斯坦福、AMD实现智能体「从错误中成长」

64. 为什么说AI智能体注定失败,是技术不行吗?

65. 别造没人买单的AI智能体了|99%的失败都错在这三点

66. 大模型智能体(Agent)指令遵循能力下降

67. 哈工大深圳团队重大突破

68. AI智能体在实际应用中遇到的问题

69. 智能体失控了怎么办?5大熔断机制,让AI在悬崖边刹住车

70. 智能体「行动后反思」的自动化

71. 如何治理一个越来越聪明的 AI 员工?

72. 我看到的真相

73. 2026AI智能体革命

74. 2026《AI智能体规模化应用元年—从技术奇观到生产基础设施 》深度分析报告

75. 微软亮剑智能办公

76. 2026年OWASP智能体AI十大安全风险清单

77. 实战指南

78. LangChain创始人Harrison Chase解读AI智能体的两种沙盒架构

79. 沙箱环境成了Agent的后端

80. 智能体的Sandbox环境如何让 AI 智能体更可靠!

81. 使用 Capsule 创建安全、隔离的 AI 智能体运行时环境

82. 优刻得全新发布Agent Sandbox,构建安全、可控的执行环境

83. 360纳米AI的“多智能体蜂群引擎”如何为智能体时代铺设高速公路?

84. 企业级AI智能体落地秘籍

85. 男子用AI实时看监控帮摸鱼,这类工具怎么设置权限?

86. 智能体工具权限控制方案——大模型应用开发的安全基石

87. 谁批准了这些AI Agent?重新思考AI时代下的访问权限、问责机制与风险管控

88. AI为何难以调用外部工具?

89. 构建企业级 AI 系统,只调用 DeepSeek、MiniMax、Kimi 之类的 API 够吗?

90. Weelinking中转API

91. 「全网首发」告别账号混用!weelinking 打造全网首个 Claude 企业 AI 中转平台

92. 北大

93. 360白皮书深度拆解

94. 关于征集“智能体互操作协议安全评估指南”参编单位的通知

95. 中国信通院2026年首批可信AI智能体评估正式启动

96. 如何判断一个AI工具是否可靠?有哪些具体的评估指标?

97. AI 智能体评估指南

98. 面试问题

99. 我如何使用AI智能体自动化测试分析(而非测试编写)

100. 什么是AI测试?如何用AI提升测试效率?

101. 大模型测试工具实战对比

102. 【AI coding 智能体设计系列-04】MCP 与工具闭环

103. MCP vs Function Calling

104. AI智能体进入生产环境

105. 真实世界中的 AI 智能体,到底长什么样?

106. Agent在生产实践中的研究,非常有参考价值

107. 针对生产环境 AI 智能体度量研究

108. AI工作流真正拉开差距的,不是提示词,而是复核节点

109. 46_AI智能体核心业务之工具调用确认决策流程管理器

110. Claude Code 实战

111. Kimi推出“K2供应商验证系统”更新

112. 迪哥-2025AI大模型爆火agent(打造专属的LLM智能体) - 哔哩哔哩

113. 面试官

114. 针对生产环境 AI 智能体度量研究

115. 360重磅发布《大模型安全白皮书》推动AI应用“安全、向善、可信、可控”

116. 我们如何构建安全可扩展的智能体沙箱基础架构

117. 360乌镇发布《大模型安全白皮书》,推动AI应用“安全、向善、可信、可控” | 2025世界互联网大会

118. 带宽消耗下降50%!阿里云提出新型沙箱AgentBay,人工可无缝接管智能体操作

119. 基于 Function Calling 的 AI 营销智能体工具链集成架构

120. AI调用资源大降39.6%!新记忆技术立功,推理工具运行效率大提升

121. .NET+AI | MEAI | Function Calling 基础(2)

122. 可信AI | 中兴通讯通过中国信通院智能体平台和工具评估

123. 大模型调用工具基础

124. 如何提升Agent 的 Function Call 准确率?

125. Function Calling 与协作:大模型迈向真实世界的桥梁

126. AI数字人vs智能体:本质区别与核心能力评估指南,AI数字人和智能体的定义边界及企业AI成熟度评估模型

127. AgentDebug框架:系统地理解智能体错误

128. 【09-23】自动化检测AI智能体错误的评估工具

129. AI 智能体 “皇帝新衣”:三个死穴不绕开,再强的模型也白搭

130. MCP和工具调用(Tool Calling)核心区别

131. AI工具调用调试技巧

132. 构建可用于生产环境的AI智能体

133. 可信AI | 金蝶通过中国信通院智能体平台和工具评估

134. 可信AI | 中电福富通过中国信通院智能体平台和工具评估

135. 面试官问:Function Call 微调到底难在哪?

136. 22页|2025年智能体安全实践报告

137. 63_Spring AI 干货笔记之工具调用(将方法作为工具)

138. 一款集大模型评测、统一API调用与智能路由于一体的开发者级AI聚合平台

139. 中国信通院启动可信互联网智能体首批测试评估工作

140. 三分钟带你掌握Function Calling

141. AI工具天天用,权限却还按人管,系统崩了才想起问为什么

142. AI Agent Sandbox 解决方案研究

143. 你的AI智能体可能正在“错误进化”!

144. 指南发布 | 智能体应用程序安全指南&AI智能体—威胁与缓解措施

145. 22页|2025智能体安全实践报告

146. 5 分钟看懂 AI 智能体:工具、记忆、推理如何协同工作

147. Docker推出Docker Sandboxes沙箱,转为AI编程智能体设计

148. 【案例分享】硬核AI调用方式,实现批量提交命中缓存tokens并绝对结构化输出保证结果准确程序稳健

149. 权限管控:企业级AI知识库的安全命脉

150. 深耕智能体安全标准,悠易科技参与AIIA联盟首次「智能体安全基准测试方法」研讨会

151. 一个go写的 AI Agent 管理与执行平台,支持多模型供应商、工具调用、技能编排、多轮对话和流式响应

152. 试试 BoxLite:轻量的智能体沙箱,方便嵌入和部署

153. 【工具】PentestAgent:利用 AI 助力渗透测试的开源武器

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章