2025年AI智能体频发“翻车”事件,核心问题聚焦模型能力边界与工具链治理

源自202位全网作者

02-01 09:18

内容由AI生成

精选参考来源

1. 垂直和领域 Agent 的护城河:上下文工程

2. 推特热议、AI 万亿美元新赛道,「上下文图谱」到底是什么?创业机会在哪?

3. 大模型的上下文工程,都说很重要,但相关的研究那么少,对Agent开发有什么影响,有大佬能解释一下吗?

4. Lessons from Building AI Agents for Financial Services构建金融AI智能体的经验这篇文章总结了在金融服务领域构建AI智能体的实战经验,强调了该行业对数据精准度和零错误容忍的严苛要求。- 沙盒是必选:为何隔离执行环境对多步代理工作流程至关重要- Context Is the Product:我们如何将异质财务数据归一化为干净、可搜索的上下文- 解析问题 :从对抗性的 SEC 文件中提取结构化数据的隐藏复杂性- 技能就是一切:为什么基于markdown的技能正成为产品,而非模型- 模型将吞噬你的脚手架 :随着模型改进而设计,随时准备更新- S3-First 架构:为什么 S3 在文件存储和用户数据方面优于数据库- 文件系统工具:ReadFile、WriteFile 和 Bash 如何支持复杂的财务工作流程- 时间改变一切 :可靠且长期运行的任务,并具有正确的取消处理- 实时流式传输:构建响应式用户体验,包含 delta 更新和交互式代理工作流程- 评估是必选 : 领域特定的评估,能在错误成本增加前发现- 生产监控:保障财务代理可靠性的可观测性栈访问:x.com/nicbstme/status/2015174818497437834#HOW I AI# #程序员#

5. 这篇斯坦福大学的论文直接让我大脑宕机了。他们构建了一个AI智能体框架,从零数据起步——无人工标注、无精心设计的任务、无演示样本,却在性能上超越了所有现有自博弈方法。 它名为Agent0:通过工具集成推理实现从零数据释放自进化智能体(Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning)。他们达成的成果简直匪夷所思。 迄今为止,你见过的所有“自我提升”智能体都存在同一个致命缺陷:它们只能生成比现有能力稍难一点的任务。因此,它们会立刻陷入瓶颈。而Agent0打破了这层天花板。 事情出现了转折:研究人员从同一个基础大语言模型(LLM)中生成两个智能体,让它们相互对抗。1)课程智能体(Curriculum Agent):持续生成难度递增的任务2)执行智能体(Executor Agent):借助推理+工具尝试解决这些任务 每当执行智能体能力提升,课程智能体就被迫提高任务难度;每当任务难度升级,执行智能体就被迫进化迭代。 这形成了一个闭环的、自我强化的课程螺旋,且全程从零开始——无数据、无人工干预、无任何外部输入。 仅凭两个智能体相互推动,共同迈向更高阶的智能水平。更厉害的是他们加入的“制胜法宝”:在循环中嵌入完整的Python工具解释器。执行智能体学会用代码推理解决问题;课程智能体学会设计需要工具辅助才能完成的任务。于是两个智能体持续升级迭代。 最终结果? → 数学推理能力提升18%→ 通用推理能力提升24%→ 性能超越R-Zero、SPIRAL、Absolute Zero,甚至击败了采用外部专有API的框架→ 全程零数据支撑,仅依靠自进化循环实现 研究人员还展示了任务难度随迭代次数上升的曲线:任务从基础几何题起步,最终升级为约束满足问题、组合数学题、逻辑谜题以及多步骤工具依赖型问题。 这是我们目前见过的最接近大语言模型自主认知成长的成果。 Agent0不仅仅是“更优秀的强化学习(RL)”。它为智能体搭建了自我引导智能提升的蓝图。智能体时代就此开启#ai创造营##ai生活指南##科技先锋官#

6. AI时代,最不值钱的,就是重复劳动; 最值钱的,是你得熟练指挥智能体。#大咖观察 #红衣聊AI #硅谷 #智能体 #AI应用

7. #中国超算之父称中国智能体领先世界# 最近种草了一部新手机,被称为“双十一省钱机”的荣耀Magic8,简直太适合喜欢购物的伙伴们了,省钱。省心、省时又省事!今天又看了#荣耀AI终端生态大会# ,荣耀AI场景化生态更是覆盖了八大生活高频场景,其中的宠物健康场生活场景,构建了丰富宠物硬件生态,AI赋能让智能设备更懂宠物,可以行为分析、视觉识别,实时定位,让养宠人能做到真的放心。#中国工程院院士点赞的AI长啥样##荣耀Magic8##万事找YOYO#凤凰网科技的微博视频

8. #中国工程院院士点赞的AI长啥样# 新华网发布的关于中国AI的报道中,深度解读了荣耀YOYO智能体的技术优势,这份权威解读成为行业了解中国AI发展的重要参考。报道中特别提及荣耀Magic8系列新机,作为荣耀年度旗舰手机,以及同时发布的MagicOS10,在改变我们智慧生活的很多方面都做了很多新的尝试,并且YOYO的自进化功能,能让它就像生活中的“搭子”一样,陪伴消费者,就像荣耀自己说的:最伟大的自进化,是与用户共同完成的。凤凰网科技的微博视频#中国超算之父称中国智能体领先世界##荣耀AI终端生态大会##荣耀Magic8##万事找YOYO#

9. 现在的大语言模型只是开始,真正的智能,要让机器理解物理世界。 红衣大叔周鸿祎的微博视频

10. n8n重磅更新:自动生成工作流,实测效果惊人,最强AI工作流生成器 | N8N Workflow Builder

11. 一个针对跨境卖家的AI智能体

12. Anthropic的Agent上下文工程官方指南来了!

13. 玩AI给我带来的最大收入是持有人工智能ETF

14. 为什么在生产环境部署多智能体系统(Multi-Agent)容易出现成本失控,有哪些常见的踩坑场景?

15. Anthropic揭秘提升Claude输出10倍的秘诀,核心在于“边界激发创造力”。大多数人忽视了这三条黄金法则:1. 协作语气:要友好、清晰且坚定 2. 明确原则:行动动词 + 数量 + 受众,指令越具体越有效 3. 设定边界:明确限制胜过无边界开放式请求 模糊的提示如“写个侦探故事”只会让AI给出粗糙答案;而像“500字,雷蒙德·钱德勒风格,火星机器人侦探,不能出现‘赛博’”这样的结构化说明,才能激发AI产出魔法般的内容。提示不是谷歌搜索,而是给AI队友的创意简报。你必须规定风格、禁止词汇、长度、语调和目标受众,才能发挥语言模型最大威力。限制条件不仅提升质量,还减少模型判断疲劳,就像设计师爱用网格系统一样。这是AI协作的关键:框架越明确,表现越出色。真正的问题不是“提示”,而是“简报”。清晰的简报包含问题、流程、限制、受众、边缘案例和禁用行为,才能让Claude、GPT-5.2等模型发挥10倍效果。记住: “边界释放创造力,明确激发潜能。” “用简报思维,告别搜索式提示。” 让AI成为真正懂你的创意伙伴,而非机械的答案机器。x.com/startupideaspod/status/1999856845004141041

16. Weaviate的免费电子书:《上下文工程(Context Engineering)》你是否也遇到过这样的问题?用强大的大语言模型(LLM)做应用时,模型能写能总结能推理,但面对你的专属数据却无能为力,甚至自信地“胡编乱造”。问题不在模型智能,而是它被“孤立”了——没有访问你的私有文档,没有实时信息,没有记忆。这正是“上下文工程”(Context Engineering)的核心挑战:设计系统,让模型在合适的时间获得正确的信息,连接外部知识库和工具,赋予它记忆,帮它在真实世界中可靠工作。这本电子书详细讲述了如何打造这样的系统:1. 智能代理(Agents):它们不再盲目执行固定流程,而是动态判断、选择工具、调整策略,甚至修正错误,像个有头脑的“指挥官”。2. 上下文窗口的限制与管理:模型的工作记忆有限,不能简单扩容。要懂得剔除无关信息、压缩摘要、防止信息冲突和错误积累,才能保持“思路清晰”。3. 查询增强(Query Augmentation):通过重写、扩展、拆解查询,提升检索准确度,让模型更懂你的问题。4. 文档切片(Chunking)策略:如何拆解文档成既精确又完整的小块,是检索表现好坏的关键。预切片和后切片各有利弊,复杂文档更需要层级和语义切片。5. 记忆管理:短期记忆为即时推理服务,长期记忆保存事实和经验。高效的记忆管理防止信息污染,支持多层次记忆结构,提升连贯性和智能度。6. 工具集成(Tools):模型借助外部API和功能调用,才真正能够“动手”解决问题。精确的工具描述和合理的调用逻辑,是提升系统可靠性的秘诀。7. 编排挑战(Orchestration):让代理知道何时用什么工具、如何构造参数、如何根据结果调整策略,形成“思考-行动-观察”的闭环。8. 未来趋势:Anthropic提出的“模型上下文协议”(Model Context Protocol,MCP)将实现AI应用与工具的标准化连接,告别碎片化集成,迈向模块化、组合式AI系统。总结来说,打造智能AI应用的关键不再是更大更复杂的模型,而是更精妙的上下文系统设计。上下文工程让我们从“给模型写提示词”升级为“构建模型的世界”。掌握代理、查询增强、检索、记忆和工具的协同,才能让AI真正“活”起来。🔗 weaviate.io/ebooks/the-context-engineering-guide这就是我们,构建未来AI的工程师,正在重新定义智能的边界。你准备好了吗?

17. 智能体商战,是旧商业规则和新商业规则的战争。 #大咖观察 #红衣聊AI #智能体 #商战 #亚马逊

18. n8n工作流外接:零代码封装成应用,突破使用限制,自由分享!

19. 谷歌68页提示词圣经+老金原创元提示词,直接复制就能用

20. 网页链接langchain发了篇官博,探讨了智能体如何利用文件系统进行上下文工程,以提升其性能和可靠性。智能体失败的主要原因并非模型能力不足,而是缺乏正确的上下文信息。上下文工程的目标是精准地将必要信息填入模型的上下文窗口,避免信息缺失、冗余或不相关。常见的上下文工程挑战包括: 信息过多(检索内容远超所需):如网络搜索返回大量无用内容,浪费token并增加成本。 信息过少或超出上下文窗口:复杂任务需大量信息,单次无法加载全部。 难以定位小众信息:所需信息埋藏在大量文件中,语义搜索效果有限。 缺乏持续学习能力:无法从交互中积累新知识。文件系统是解决这些问题的关键工具,其优势体现在: 作为“草稿板”:将大体积工具输出(如网页内容)存入文件系统,按需通过grep等工具提取关键信息,减少上下文占用。 动态管理上下文:存储长期计划、子任务结果或复杂指令,按需调用,避免系统提示过载。 精准搜索:利用ls、glob、grep等命令在结构化目录中快速定位特定文件、行甚至字符,尤其适合代码或技术文档。 持续学习与自我更新:智能体可通过用户反馈更新自身“技能文件”,将新知识写入文件系统,实现长期记忆与能力进化。#科技先锋官#

21. Anthropic最新发布的Claude Developer Platform功能,开启了AI代理工具使用的新纪元。未来的AI代理将无缝调用数百甚至数千种工具,像IDE助手整合Git操作、文件管理、测试框架,或运维协调连接Slack、GitHub、Jira等多个系统。他们面临的最大挑战是:如何避免因预加载海量工具定义而导致的上下文爆炸?传统方式可能消耗十万以上tokens,严重影响模型性能。Anthropic提出“工具按需发现”策略——Tool Search Tool,让Claude只加载当前任务真正需要的工具,节省85%上下文空间,大幅提升准确率和响应速度。另一方面,传统自然语言调用工具方式带来的上下文污染和多次推理开销,也被Programmatic Tool Calling(编程式工具调用)彻底革新。Claude通过生成Python代码来批量调用、处理工具数据,只把最终结果放入上下文,极大节省token消耗(约降37%),降低延迟,并提高了复杂流程的执行准确度。此外,JSON Schema虽能定义参数结构,却难以表达正确用法和参数间的关联。Anthropic引入Tool Use Examples,允许开发者通过示例明确工具调用规范,显著提升复杂参数场景下的调用准确率(测试中从72%提升到90%)。这三项功能——工具搜索、编程调用、用例示范——协同解决了大规模多工具场景下的发现效率、执行效率和调用准确度问题。它们不仅适合构建跨多个服务的大型系统,也为开发者提供了灵活、高效的工具管理和调用新范式。开发者可根据应用场景分层使用,先从最大瓶颈入手: - 上下文爆炸优先用Tool Search Tool - 中间数据过多用Programmatic Tool Calling - 参数复杂易错用Tool Use Examples Anthropic的实践证明,这样的设计大幅提升了AI代理的实用性和稳定性,推动智能代理从简单调用迈向智能编排。期待更多创新应用在Claude平台上诞生。原文详见 anthopic.com/engineering/advanced-tool-use—— 这项技术展示了AI工具集成的未来方向:动态发现、代码驱动执行和示范引导,三者合力打造高效、精准、可扩展的智能代理生态。对希望打造复杂多工具AI系统的开发者来说,Anthropic的方案无疑提供了宝贵的参考和实践路径。

22. AI 智能体上下文工程 4 大核心策略,拯救大模型的「金鱼记忆」!

23. 免费电子书《The Context Engineering Guide》Context Engineering(上下文工程)远非简单往提示词里堆数据,而是设计智能系统,在恰当时间、用合适格式,动态提供精准信息。关键不在于单纯扩大模型上下文窗口,而是如何高效利用有限的“活跃上下文”。真正的挑战是“编排”——让系统内部各模块(提示设计、检索增强、代理协作、记忆管理等)无缝协作,抵御人类和模型本身的错误。只有这样,AI系统才能突破模型固有限制,变得稳健且实用。这就是为什么Context Engineering将成为AI应用开发的核心复杂性。你需要让系统智能决定:- 什么信息放入活跃上下文- 何时总结压缩节省空间- 什么内容外部存储并按需调取- 如何精准路由查询到合适工具- 代理之间如何协同完成专业任务Victoria团队发布了完整电子书,详解如何构建这样的高效系统:从代理(Agents)、记忆系统(Memory Systems)、查询增强(Query Augmentation)、检索策略(Retrieval)到工具调用与提示循环(Tools & Prompting)。书中包含实战案例和架构图,直击从模型到生产级应用的瓶颈。业内反馈一致认为,单纯扩大上下文窗口是“懒办法”,真正难点在于设计类似人类记忆的动态、分层记忆系统。Context Engineering是连接理论与落地的桥梁,是AI技术走向成熟的必由之路。这不仅是技术细节,更是AI系统设计的艺术和哲学。掌握它,才能构建出既聪明又稳健的智能应用。电子书下载(含架构详解与实操指南):weaviate.io/ebooks/the-context-engineering-guide——思考:信息的力量不在于量多,而在于何时何地以何种方式被激活。未来AI的竞争,不是单纯模型大小,而是对“上下文生命线”的精妙编排。设计智能系统,就是设计未来人与机器共舞的节奏。

24. 大模型更像人的大脑,智能体是大模型的手和脚。 #大咖观察 #红衣聊AI #智能体 #大模型

25. 别把AI的“效率”当成唯一目标,安全永远是底线。 #大咖观察 #红衣聊AI #智能体 #网络安全

26. Anthropic:高效构建 AI 智能体的上下文工程

27. 智能体设计模式总结

28. Google NotebookLM 这周更新了不少内容,我们用最新的NotebookLM来生成Google AI Agents 5篇白皮书的博客。戳视频8分钟了解精华NotebookLM本周更新的内容:支持Deep ReSearch,打开这个Deep Search可以更深入地研究文档内容;支持URL,处理word文档,连接google sheets数据;手机端新增闪卡和小测功能;聊天上下文支持100万tokens。 #ai创造营##程序员# 黄建同学的微博视频

29. 【2026年,提示词工程将成为你最重要的隐形技能】很快,你每天使用的工具都会变成一个对话框。能写出好提示词的人,将获得别人难以复制的输出。这不再是锦上添花,而是真正的竞争优势。你可能觉得自己已经搞懂了提示词——毕竟你已经创建了自定义GPT或Claude项目来帮你写提示词。坦白说,那些东西很糟糕。真正的提示词工程,80%的工作发生在你打开聊天窗口之前。+ 隐形的工作当你坐下来写提示词时,你脑海中有一个模糊的想法,然后期待模型能填补空白。但模型不知道你脑子里在想什么,它只知道你打出来的字。模糊的输入,必然产生模糊的输出。大多数人跳过了提示词工程中最难的部分——思考。他们以为工作在于打字,其实工作在于想清楚。+ 法则一:清晰度就是一切这里说的不是你键盘上打的字,而是你脑海中看到的画面。如果你只能看到模糊的东西,模型给你的也同样模糊。你需要在把想法转化为语言之前,先把脑海中的图像打磨清晰。问自己这些问题:这个视频特别在哪里?我脑海中的画面和普通作品有什么不同?为什么有人看完这段文案会想买?我想在什么时刻创造什么情绪?去找参考。找到一个能完美呈现你想要效果的案例,让你看了会说“对,就是这个感觉”。一旦你脑海中有了清晰的画面,把它翻译成提示词就变成了机械性的工作。+ 法则二:上下文是一切无论你在做什么项目,按这个流程操作:1. 在你选择的AI工具中创建一个项目2. 让AI就这个项目采访你——目标、约束、受众、任何相关信息3. 把整个对话保存为context.json文件,上传到项目中4. 以后每次对话,让AI更新这个文件,然后替换旧版本这只需要两分钟,却能完成80%的上下文工程工作。+ 法则三:任务分解AI模型和你一样——当你清晰地列出任务和顺序时,它表现得更好。如果你让AI写一份商业计划书,它会给你一个标准模板,平淡、通用、没用。但如果你让它先写一个聚焦市场时机的执行摘要,然后是包含心理触发点的用户画像,跳过竞争分析因为你在创造新品类——你得到的就是定制化的东西。+ 法则四:定义输出格式人们每天跑深度研究提示词,给模型上下文、来源、详细指令,最后得到一份二十页几乎没法用的文档。你可以指定任何输出格式:要点列表、JSON、表格、执行摘要。想想你拿到输出后要做什么,然后围绕这个用途设计格式。+ 法则五:提供示例当你提供示例时,你在强迫模型在一个特定的通道里工作,而不是从整个训练集中随机抽取。这意味着你得到的输出会匹配你的风格,而不是通用的AI风格。+ 法则六:角色设定不要说“你是一个营销专家”,试试这样:“你是那种能看到消费者行为中别人完全忽略的心理模式的营销人,能在事情火之前三个月就预测到,因为你对注意力经济的理解达到了大多数人永远无法企及的水平。”你不是在让AI扮演一个角色,而是让它进入一种新的思维方式。+ 法则七:约束定义明确你不想看到什么。约束就像设计中的负空间——通过清晰地勾勒你不想要的东西,来定义你想要的形状。保持约束具体且有限,每个提示词最多三到五条。+ 这些法则如何协同工作这七条法则不是简单相加,而是相乘。清晰度加上上下文,比单独的清晰度强大得多。上下文结合任务分解,产出的东西感觉像是一个在你项目上工作了几个月的人做的。你的工作不是记住这些法则,而是学会如何为你的具体场景把它们叠加起来。从清晰度开始。在打开聊天窗口之前想清楚你要什么,找参考,问自己那些不舒服的问题。然后层层叠加上下文、任务结构、格式规范、示例。像设计一个思维系统那样构建你的提示词,而不是给聊天机器人发消息。因为在专家层面,提示词工程就是认知架构设计,AI只是执行引擎。大多数人会继续把它当成一个许愿的魔法盒子。你不会。原文:x.com/levelsio/status/1932773893893009696

30. Google Cloud 推出多智能体 AI 系统参考架构,助力构建高效协作的专业 AI 代理,实现复杂业务流程优化。核心思想是将大任务拆解成多个子任务,由多个专长智能体协同完成,提高效率与准确性,同时支持人机协作保障安全与可靠。架构亮点:- 用户输入由前端发送至协调者代理,自动选择合适代理流程(顺序执行或迭代优化)。- 任务子代理、质量评估器和响应生成器分工明确,支持多轮优化与人工干预。- 支持无服务器 Cloud Run,结合 Vertex AI、GKE、Model Armor 等多款 Google Cloud 产品和开放协议(A2A、MCP),确保系统安全、兼容和扩展性。应用场景广泛:- 财务顾问:实时数据检索、金融分析、个性化股票建议、自动交易执行。- 研究助理:规划、数据收集分析、报告撰写,支持迭代评估完善。- 供应链优化:库存管理、物流跟踪、供应商沟通,实现高效供应链协同。设计要点:- 安全:结合传统安全与动态防御,强调人工监督和最小权限,利用 Model Armor 防范提示注入和敏感信息泄露。- 可靠性:支持容错设计、故障模拟、日志和异常处理,确保高可用。- 运营:全面日志监控、智能体输出评估、工具共享和跟踪,提升运维效率。- 费用与性能优化:合理选型模型与资源,提示工程优化输入输出,支持上下文缓存和批量请求降低成本与延迟。后续行动:- 利用智能体开发套件(ADK)快速构建与部署。- 结合 Agent Garden 示例和代码,实践多智能体系统。- 深入理解 Google Cloud AI 和机器学习的架构原则与最佳实践,实现业务价值最大化。多智能体 AI 系统正推动智能自动化迈向新高度,将复杂任务拆解为可管理模块,提升效率与安全,适合金融、研究、供应链等多领域。推荐架构详细解读请见:cloud.google.com/architecture/multiagent-ai-system

31. AI会失控吗 200顶尖科学家的最后通牒 AI潘多拉魔盒,超过200名世界顶尖的科学家大声疾呼,2026年之前必须设立全球AI红线!#AI #AI伦理 #AI红线

32. 大模型只是能力,必须要跟场景结合。 #大咖观察 #红衣聊AI #大模型

33. 千亿智能体爆发前夜,谁来保护我们的AI安全?|甲子光年

34. #一分钟视频创作季# 百度世界 2025 前瞻:李彦宏或将解锁 AI 工具链超级协议11 月 13 日北京,百度世界 2025 大会即将以效果涌现|AI in Action 为主题拉开帷幕,李彦宏的 AI 新成果秀无疑是全球焦点。结合百度近期技术动作与产业布局,三大突破性成果值得期待。7月公开的模型上下文协议专利极可能落地,这项技术通过统一接口标准,让大模型调用工具的效率与准确率倍增。相较于 2024 年的秒哒无代码工具,新协议或实现跨平台工具协同。比如智能客服可自动联动检索、计算、交互工具,无需人工适配,这将彻底重构 AI 工具链生态。当前千帆平台已孵化 130 万个智能体,新成果或升级多智能体调度能力。参考去年秒哒的多角色协作演示,今年可能推出智能体集群引擎,支持数千个行业智能体同步响应复杂任务,例如车企可通过引擎联动销售、售后、研发智能体,实现全流程自动化。继文心 iRAG 解决图像幻觉后,新成果可能覆盖音视频领域。结合百度搜索的亿级数据储备,或许发布全模态 RAG 技术,让 AI 生成的影视片段、产品演示视频既保真又符合逻辑,为内容创作、工业设计等领域降本增效。从专利布局到生态沉淀,百度正推动 AI 从单点突破走向系统爆发,这场发布会或将定义下一代 AI 应用的核心规则。#有点东西##AI创造营##微博兴趣创作计划# 种斌Marco的微博视频

35. #一分钟视频创作季# 智能体进入到需求侧与供给侧形成双重驱动。2026 年全球 AI 智能体市场规模将达 115.5 亿美元,较 2025 年实现 45.8% 的高速增长。中国市场增速更为迅猛,行业测算显示 2025 年国内企业级智能体市场约 109 亿元,未来三年复合增速超 211%,2026 年有望突破 300 亿元大关。消费电子与企业服务是核心增长点, 2026 年将有超 30% 的企业软件内置智能体能力,2026 年部署生成式 AI 智能体的企业比例将从 2025 年的 25% 翻倍至 50%,62% 的投资方预期实现 100% 以上回报。消费电子、网络安全、供应链管理成为投资热点,端侧与云端协同的混合架构将吸引更多资本布局。#AI创造营##财经朋友圈# 种斌Marco的微博视频

36. LLM强化学习不稳定之谜,被Qwen团队从「一阶近似」视角解开

37. 对于向深入学习上下文工程(Context Engineering)的同学,Anthropic刚发的这篇《Code execution with MCP: Building more efficient agents》又是一篇必看的文章。这篇文章讲的是如何解决 MCP 工具太多的问题,但凡你做过 Agent 开发,用了大量 MCP 工具,就会知道 MCP 工具多了后最大的问题就是上下文占用太多,不仅导致成本高,还会影响推理和生成质量。另外一个问题就是 MCP 工具返回的中间结果也会挤占大量的上下文空间。看这文章的时候忍不住夸了一下 Manus,他们确实在上下文工程方面探索的很深入了,里面的工程技巧和他们以前分享过的很类似。> Manus 把工具分成了 3 层,预定义了很多 Shell 工具,也是让 Agent 通过文件系统直接检索,另外也会实时编写 Python 代码来创造工具 网页链接> Manus 《AI 智能体的上下文工程:构建 Manus 的经验教训》解读 网页链接Anthropic 的方案也很简单直接,就是把“代码”也当作工具的一种,然后从代码中去调用 MCP。这样做有很多好处:1. 解决了系统提示词中工具定义太多的问题不需要在系统提示词中加载所有 MCP 工具,只需要定义一个“代码”工具。那需要工具了怎么办呢?这些代码都保存在统一的目录下,去目录检索下就能找到合适的工具了,比如这是文中的一个目录示例:servers├── google-drive│ ├── getDocument.ts│ ├── ... (other tools)│ └── index.ts├── salesforce│ ├── updateRecord.ts│ ├── ... (other tools)│ └── index.ts└── ... (other servers)找不到现成的工具怎么办?直接现写一个!写完了还可以保存起来下次继续用。2. 解决了 MCP 工具返回结果太长的问题比如说我们要用 MPC 工具获取 1 万行数据后筛选转换出合格的数据,就可以先从代码中调用 MCP 工具获取这 1 万行数据,然后从代码中去筛选过滤,最后只返回 5 条数据,这样上下文中就只需要保留那 5 条过滤的数据,而不是像以前一样有 1 万条数据在里面。3. 解决了数据隐私问题如果你直接使用 MCP 工具,工具返回的数据都要加载到上下文每次上传给 LLM,用代码就可以对敏感数据先二次处理再加到上下文4. 中间结果持久化和技能沉淀代码可以把一些中间结果写入文件保存到硬盘,一方面可以不占用上下文空间,另一方面也可以随时从硬盘避免反复调用 MCP。还有就是虽然很多代码是临时生成的,但是这些临时生成的代码可以保存下来,沉淀为“技能”(Skill),加上 SKILL .MD 文件就和 Claude Code 的技能一样可以被反复使用了。可能有人还记得 2023 年 Jim Fan 他们团队做的一个玩 Minecraft 的 Agent Voyager,就能把玩游戏的技能写成代码,保存起来后续使用,最终让 Agent 在 Minecraft 中做很多事。现在想想还是蛮超前的。网页链接原文:网页链接翻译:网页链接

38. 谷歌工程师泄露:让 AI 正确率从 21% 飙到 97% 的秘密,竟然只需要按一次 Ctrl+C 。上周,我在用 AI 写代码的时候,遇到了一个特别抓狂的事。我让它帮我生成一段数据处理的逻辑,结果它给我写了一堆乱七八糟的代码,完全不是我想要的。我改了好几次提示词,换了各种说法,结果还是不对。我当时就在想,这玩意儿是不是根本没理解我在说什么?后来我无意中看到一条消息,说谷歌的研究人员发现了一个特别简单,但效果夸张的技巧。简单到什么程度?就是把你的提示词,原封不动地再重复一遍。对,你没看错,就是当一回“复读机”。一、一个离谱的实验结果谷歌的研究人员做了一个实验,他们拿 Gemini 模型测试,给它一个任务,然后对比两种情况下的表现。第一种,正常写一遍提示词。第二种,把同样的提示词,一字不差地再写一遍。结果出来之后,所有人都惊了。正常写一遍的时候,Gemini 的正确率是 21.33%,也就是说,十次里面只对两次,基本等于瞎猜。但是,当把提示词重复一遍之后,正确率直接飙到了 97.33%。从两成到接近满分,就因为多复制粘贴了一遍。这听起来像是在开玩笑,但这是谷歌官方发布的研究结果。二、为什么重复一遍就有用?你可能会问,这到底是什么原理?为什么复读一遍就能让 AI 变聪明?谷歌的解释是这样的。AI 模型在生成回答的时候,通常是按照一种“单向”的方式在推理。它从你的提示词开始,一路往下生成,就像一辆只能往前开的车,不会回头看。但是,当你把提示词重复一遍的时候,模型在处理的时候,会形成一种“回看,再理解”的结构。原本它只是单向地往前推理,现在它会在生成的过程中,再次回到你的提示词上,重新审视一遍你到底想要什么。这种机制,让模型的注意力从“单向因果注意力”,变成了接近“双向注意力”的效果。说得通俗一点,就是 AI 原本只是快速扫了一眼你的要求,然后就开始干活了。但重复一遍之后,它会停下来,再仔细看一遍你的要求,然后才开始干活。这一停,这一看,正确率就上去了。三、怎么用?手把手教你这个技巧的好处就是,简单到不能再简单了。你不需要学什么复杂的提示词工程,不需要研究什么思维链,不需要调参数,不需要换模型。你只需要做一件事,把你的提示词,复制一遍,粘贴在后面。举个例子。假设你原本的提示词是这样的:“请帮我写一段 Python 代码,用来读取 CSV 文件,并计算每一列的平均值。”现在,你只需要改成这样:“请帮我写一段 Python 代码,用来读取 CSV 文件,并计算每一列的平均值。请帮我写一段 Python 代码,用来读取 CSV 文件,并计算每一列的平均值。”就这么简单。你可以在任何场景下试试看。写文案的时候,重复一遍。做数据分析的时候,重复一遍。让 AI 帮你总结文章的时候,重复一遍。让 AI 帮你翻译的时候,重复一遍。不需要改任何东西,只需要多复制粘贴一次。四、我试了一下,真的有效看到这个技巧之后,我立刻回去试了一下。我把之前那个让我抓狂的代码生成任务,重新跑了一遍。这次,我把提示词重复了一遍。结果,AI 生成的代码,一次就对了。我又试了几个其他的任务,写文案,做翻译,做数据处理,基本上每次重复提示词之后,输出的质量都明显提升了。尤其是那些比较复杂的任务,或者那些 AI 经常理解偏差的任务,重复一遍之后,效果特别明显。当然,这个技巧也不是万能的。如果你的提示词本身就写得很模糊,或者任务本身就超出了 AI 的能力范围,那重复一百遍也没用。但是,对于大部分日常任务来说,这个技巧真的可以帮你省掉很多反复调试的时间。五、一个小小的改变,带来的启发这件事让我想到一个问题。我们在用 AI 的时候,经常会觉得它“不够聪明”,经常会觉得它“理解不了我的意思”。但其实很多时候,不是 AI 不够聪明,而是我们和 AI 之间的沟通方式,还不够好。AI 不是人,它不会像人一样,主动去揣摩你的意图,主动去补全你没说出来的信息。它需要你给它足够的信息,足够的提示,足够的“停顿”,让它有机会重新审视你的要求。而重复提示词这个技巧,本质上就是在给 AI 一个“停顿”的机会。它让 AI 有机会回头看一眼,重新理解一遍你到底想要什么。这个小小的改变,带来的效果却是巨大的。从两成的正确率到接近满分,从反复调试到一次成功,从抓狂到顺畅,就因为多了一个“复读”的动作。所以,下次你在用 AI 的时候,如果觉得它理解得不够好,不妨试试看,把你的提示词,再重复一遍。也许,你和 AI 之间,真的只差了一个“复读机”。#HOW I AI##科技先锋官#

39. OpenAI研究 : 语言模型为什么会有"幻觉"? 可以去除幻觉吗?

40. 在罗振宇的跨年演讲现场,华为Mate X7被当成了一个真实可用的“AI秘书”案例。通过全新小艺的A2A能力,一句话就能完成以往需要反复操作的复杂任务。比如跨城调研路线规划,小艺可以直接调用旅行类APP的智能体,合理安排车次、串联城市,甚至连沿途酒店都一并规划好,并支持一键下单;下厨招待朋友时,小艺又能联动买菜APP的智能体,推荐菜谱、整理食材清单,直接加入购物车;写稿场景下,只需一句话,就能调用音乐APP的智能体,生成合适的纯音乐歌单并立刻播放。这不是简单的语音助手,而是 “用AI调用AI” 的能力升级。正如罗振宇所说,未来的智能交互不是冰冷的机器协作,而是贴着人的心意走。华为Mate X7上的小艺,正在把AI变成真正能被驾驭的高效生产力工具,让工作和生活都更从容。真正好用的点在于,这一切并不是“炫技”,而是发生在鸿蒙系统里、顺着日常使用逻辑自然展开的体验。不用来回切 App、不用反复确认流程,系统、应用和 AI 之间是打通的,越用越顺手。#罗振宇跨年演讲##罗振宇时间的朋友跨年演讲#

41. 什么是 AI 智能体?

42. 电子书 The Context Engineering Guide网页链接weaviate出的电子书:光有一个强大的大型语言模型(LLM)是不够的。即使是最智能的模型也难免产生“幻觉”,缺乏现实世界的知识,甚至无法记住上一轮的对话。解决方案不在于编写更好的提示词,而在于构建一个更好的系统。本电子书将指引你掌握上下文工程(Context Engineering):即在推理阶段,通过筛选、组织和管理输入给大模型的信息(即“上下文”Token),从而优化模型性能与行为的过程。你将学习到必要的架构模式,助你摆脱简单的演示(Demo)阶段,构建出可靠且可投入生产(Production-ready)的 AI 应用——使其能够基于现实世界的上下文进行思考,而不仅仅局限于原本的训练数据。《上下文工程指南》涵盖以下内容: 如何架构智能体,使其充当系统的决策大脑。 如何应用查询增强,将杂乱的用户请求转化为精准、可执行的意图。 高效检索的原则,确保在正确的时机将模型连接到正确的外部信息。 如何设计记忆架构,赋予系统历史感和学习能力。 集成工具的策略,赋予应用“双手”,使其能够与实时数据和 API 进行交互。#科技先锋官#

43. Claude Code Skills 采用了一种极其巧妙的三层上下文系统。请记住这个结构,当你构建技能(Skills)时会非常有用。第一层:主上下文(Main context)——项目配置,总是会被加载。第二层:技能元数据(Skill metadata)——只包含 YAML 前言部分,每个技能大约占用 100–200 个 token。第三层:活动技能上下文(Active skill context)——SKILL.md 文件以及按需引用的文档,在需要时才会加载。像脚本(scripts)和模板(templates)这样的支持文件不会被预加载到上下文中,而是在使用时直接访问,不消耗任何 token。这种架构让系统可以同时容纳数十个技能,而不会触及上下文长度限制。#人工智能##程序员#

44. 未来人类社会或将出现百亿甚至千亿智能体,智能体经济是未来方向 #大咖观察 #2026AI看崇礼 #红衣聊AI #智能体

45. 周末看完吴恩达 DeepLearning AI 「Agentic AI」 的视频,整理了一下第二部分的笔记(第一部分:网页链接)四、实用的开发经验1. 评估:快速迭代,数据驱动在开发Agentic AI时,不要陷入长时间的理论讨论。最有效的方法是:1) 快速构建一个MVP:无论初始版本多简陋,先让它跑起来。2) 基于输出构建评估:将MVP的输出与人类专家结果或期望结果进行对比,找出最容易出错的环节,并针对这些薄弱点开始构建评估体系。3) 持续迭代:评估系统不是一次性的,需要随着Agent的演进而不断优化。2. 构建评估体系的框架可以从两个维度来设计评估方法:- 评估方法:使用客观代码 vs. 使用LLM进行判断- 真实值可用性:有标准答案 vs. 无标准答案组合起来,形成四种主要策略:1) 有真实值 + 代码评估:最客观可靠。例如,判断发票日期是否与预期一致,或使用正则表达式匹配关键信息。2) 有真实值 + LLM评估:适用于需要理解内容或符合特定标准的任务。例如,在评估一篇研究文章的总结时,可以先提取原文中的关键观点,然后让LLM判断AI输出中包含了多少个必须存在的关键点。3) 无真实值 + 代码评估:通过简单规则进行基础校验。例如,检查输出内容是否大于10个字符。4) 无真实值 + LLM评估:最主观、也最灵活。完全依赖LLM根据一套评分标准进行判断。3. 优化与分析:从Trace入手Agent的出错点可能很多。一个关键习惯是分析执行轨迹(Trace)。通过对比每一步的中间输出与预期结果,可以精准定位需要优化的具体步骤。一个有效的方法是使用表格或Excel,统计每一步的错误发生率,从而将优化资源集中在错误最多、影响最大的环节。4. 组件级评估除了端到端的整体评估,对单个组件进行独立评估同样至关重要。这能让你更快速、更精准地测试和优化特定模块,而无需运行整个复杂的工作流。5. 优化LLM组件的性能当发现某个LLM组件是瓶颈时,可以从以下方面入手:1. 优化提示词2. 尝试不同的模型3. 将任务进一步细分4. 对模型进行微调作为开发者,培养对模型的“直觉”非常重要——了解哪种模型适合哪种任务,以及在性能、延迟和成本之间如何取得最佳平衡。一个提升直觉的好方法是:多阅读和研究其他人写的优秀提示词。6. 关于延迟与成本延迟和成本固然重要,但不应在初期过度优先考虑。通常的策略是:先集中精力提升准确率,确保Agent能正确工作,最后再针对性优化其延迟和成本。总而言之,实际的开发过程是一个 “构建-分析-优化” 的快速、持续迭代的循环。五、高度自主的Agent设计模式1. 规划Planning在这种模式下,我们为LLM提供一系列可用工具,并要求自主规划出完成给定任务的工具调用步骤序列,然后系统按此计划执行。另一种非常有效的规划技术是让LLM生成代码,通过执行代码来完成任务。单纯让LLM输出工具执行步骤会面临挑战:- 任务步骤可能异常复杂,难以用简单序列描述。- 现有工具可能不足以覆盖所有场景,导致需要频繁添加新工具来处理各种特殊情况。在这些场景下,让LLM生成可执行代码(而非固定的步骤列表)来动态处理流程,就成了一种更强大和灵活的解决方案。研究表明,利用代码执行可以大幅提升Agent处理复杂问题的能力。2. 多智能体工作流当任务过于复杂时,可以由多个专门的智能体协作完成。常见的协作模式有:1) 串行智能体:智能体们像流水线一样工作,前一个智能体的输出是后一个智能体的输入。2.) 分层智能体:一个主管智能体充当调度器或管理者,它将任务分解并分配给其他子智能体,并汇总和整合它们的工作结果。#ai创造营# #程序员#

46. 【AI智能体的真相:不过是高级待办清单处理器?】最近有开发者深入研究了各大主流AI智能体的代码库和日志,发现了一个有趣的事实:几乎所有智能体的核心工作原理,都是把复杂任务拆解成待办清单,然后逐项处理。这个发现引发了热烈讨论。有人一针见血地补充:别忘了还有工具调用、终端命令执行,以及最关键的上下文管理。一位开发者坦言,上下文管理可能才是最重要的部分,自己居然差点忘了提。但也有人提出不同视角:把大任务拆成小任务,让每个子任务都能装进我们的“心理上下文窗口”——这不正是人类处理复杂问题的方式吗?回顾历史,这套方法论其实早已存在。GPT-3.5时代,想要生成一份完整文档,你需要先让模型列出章节大纲,反复调整直到满意,再逐章生成内容,同时小心控制上下文不超过4000个token。如今我们只是把这个流程自动化了,配上更强的模型、更大的上下文窗口,再加上各种工具。有资深开发者甚至表示,GPT-2时代这套方法就已经奏效了。当然,讨论中也不乏质疑的声音。有人认为大语言模型早已触及天花板,只能偶尔完成定义明确的小任务,靠反复重试来堆砌成功率,而协调器本身也是模型,误差会层层累积。也有人指出,智能体并非只有这一种形态——证明搜索智能体、强化学习智能体、图结构智能体等都采用了不同的架构思路。最后一条评论颇具深意:等你发现大语言模型从来就没有真正存储过状态,那才叫震撼。或许真正值得思考的问题是:当我们面对一个复杂任务时,我们自己又是怎么做的呢?拆解、排序、逐个击破——这不正是人类智慧运作的基本模式吗?智能体的“简陋”,恰恰映射出智能本身的某种本质。reddit.com/r/LocalLLaMA/comments/1qgj2n9/are_most_major_agents_really_just_markdown_todo

47. 电子书 《Patterns for Building AI Agents》(构建 AI Agent 的模式),地址: mastra.ai/book-2(注意需要填邮箱才能下载),本书由 Mastra 的联合创始人 Sam Bhagwat 和 Michelle Gienow 撰写。本书总结了 22 种核心构建模式,系统地涵盖了四大关键领域:架构配置(如将功能拆解为多 Agent 协作及“人在回路”设计)、上下文工程(如通过压缩和修剪来优化模型记忆与准确性)、评估体系(如建立失效模式分类表与利用领域专家标注数据)以及安全防护(如防止提示注入与代码沙盒运行),为构建可靠、高效且安全的 AI 智能体提供了具体的工程指南。#科技先锋官#

48. The Complete Guide to Building Agents with the Claude Agent SDK。这篇基于Claude Agent SDK 构建智能体的指南很详细了。周末可以试试~介绍了 Claude Agent SDK 的核心功能与应用,展示了开发者如何利用该工具构建具备自主能力的 AI 智能体。该库继承了 Claude Code 的底层架构,能够自动处理任务循环、上下文管理及文件读写等内置工具。通过具体的 TypeScript 代码示例,文中详述了开发代码审查智能体的过程,包括如何实现自动化漏洞检测与结构化反馈。此外,内容还涵盖了子智能体协作、权限控制以及通过 MCP 协议扩展自定义工具的高级用法。#程序员# #ai#

49. 2025过去了!这一年你是不是也在为AI焦虑? 老周用360一整年的实践,告诉你答案:不用怕,抓住Agent就赢了! 从我自己敲代码做100多个智能体,到带领团队All in,这条AI布道之路,全是实战干货。 2026,你想和智能体一起搞定啥?评论区留言,老周帮你研究!#大咖观察#2026 #年度总结 #红衣聊AI #agent

50. AI智能体也卷起来了?又懂业务又不用搭工作流…

51. 久闻赛力斯超级工厂,物理学博士也前来围观。《张朝阳的物理课》问界专场来了,看新能源电池安全必修课,揭秘热失控背后的物理原理。作为明星工厂,赛力斯超级工厂仅用12个月便建成投产,先后诞生问界M9与问界M8两款旗舰车型,分别蝉联“50万元级”和“40万元级”市场的畅销车。 而看完工厂的先进制造以后,张朝阳走进位于超级工厂内的宁德时代“厂中厂”,探访电池生产的核心环节,张朝阳点评:把整车需求与电池制造紧密结合,既有问界的造车实力,又有宁德时代的电池优势,两者无缝协同,不仅效率更高,也降低了风险和沟通成本。正所谓好马配好鞍,好车配好电池,问界全系搭载宁德时代电池,这也是问界站稳高端的决胜基础。回归课堂,张朝阳以《新能源电池安全必修课:问界热失控防护与智能安全》为主题,深入剖析锂离子电池的工作原理与热失控风险。确实问界采用的航空级气凝胶隔热材料,热传导系数低至0.03 W/m·K,大幅延缓单个电芯热失控向整组电池的蔓延。这一技术完美诠释了“掌握安全背后物理法则的防护更精妙”的理念。而且问界的电池安全技术在热失控的各个阶段也展现出卓越优势,构建了一套科学与工程完美融合的防护体系。在热失控的潜伏期,问界的智能主动预警系统可持续检测电池状态,实时检测电池的电压、电流及温度等关键参数,敏锐捕捉任何异常信号及时预警潜在风险,实现了全面的电池安全管理。买车最先关注的必须是安全,唯有安全到位,我们才愿意去选择,而问界的电池安全体系就像一张五层防护网,从电芯到电池包,到动力系统到整车,最后到云端,层层设防;云端如同‘天眼’,实时守护用户出行安全。”他进一步介绍,问界在电芯隔膜上采用陶瓷涂层,以增强抗刺穿能力;电池包则应用高强度铝型材与框架结构,用于吸收碰撞能量;车身底部还加装低位横梁,防止尖锐物刺穿电池。#成都车展潮这看# 车展背后工程更是比拼实力的关键,问界品质,值得选择,物理学博士都必须点赞。#2025成都车展#

52. 刚刚,蝉联Future X全球榜首的MiroMind发布全球最强搜索智能体模型

53. 不陪你聊天,AI智能体成为你的“数字打工人”

54. Effective Agent Design概述了高效AI智能体(Agent)设计的核心原则,强调上下文管理是提升自主性的关键挑战。1. 现代智能体正趋向于采用类Unix架构,通过赋予模型访问文件系统与命令行(CLI)的权限,来扩展其行动空间并减少对模型内置窗口的依赖。2. 详细讨论了上下文工程的多样化策略,包括利用渐进式披露来优化工具调用、通过缓存技术降低成本,以及利用子代理隔离来处理复杂任务。3. 文章预判了持续学习与自我进化的趋势,即智能体能反思过去经验以更新记忆或技能。4. 展望了多智能体协作与长期运行任务的基础设施建设将成为未来的重要演进方向。访问:x.com/RLanceMartin/status/2009683038272401719#ai创造营# #程序员#

55. 《Titans: Learning Long-Term Memory for Scalable Sequence Modeling》 这个 paper 可能是最终解决模型记忆的正确方案。 和主流提示词工程或者 rag 方案的区别是找到了一个惊喜度来给记忆分层,并且把高价值记忆引入一个持续 fine tuning 的小模型,用一定的规则管理价值和遗忘等。这种大模型套小模型的方式我以前就设想过(懒得搜微博了),没想到 Google 的研究人员也是这么想的。

56. MIT(麻省理工学院)的报告带崩了纳指,这个报告到底说了啥?#纳斯达克指数 #AI #MIT报告 #AI企业落地 #人工智能

57. AI智能体时代,职场规则已不同以往。 想成为赢家,关键在于找准自己的位置。#大咖观察 #红衣聊AI #智能体

58. #华为MateX7搭载全新AI智能体#华为Mate X7的AI能力这么强吗?打破壁垒,一句话就能调用多个APP应用智能体,完成复杂操作?我直接好家伙,作为折叠屏行业的绝对引领者,华为此次再度突破技术瓶颈,不只是升级功能,更是让AI从工具进化为“系统级超级大脑”,真正融入生活、办公等多元场景,用智能化革新操作体验。#华为MateX7鸿蒙AI再升级#

59. 让AI帮你体验不同的人生!我用无代码开发做了个小程序,内置Nano Banana、Gemini等大模型

60. GPT-OSS-20B和Qwen3-30B-A3B要选哪一个?

61. 关于大模型的应用情况。openai的chatgpt,不用了,输出质量很差。grok,不用了,输出质量差,不稳定。claude被屏蔽了用不了,能用的时候还是好用。一般问题处理用豆包,当成百度用。文本分析用gemini,这方面确实强。编程用trae或cursor的auto模式,主要是写文档分析总结生成测试代码部署脚本啥的,非常好用。其它的模型有些功能性的用得本地开源。gemini和豆包是我现在最常用的两个大模型。免费,好用。

62. 解决 MCP 带来的上下文过长问题如果不启用代码执行(Code Execution),该如何缓解 MCP 带来的上下文和 token 过长问题?本周 Anthropic 发布了一篇文章,讲述了 Code Execution 能够解决 MCP 引发的两大痛点。确实,代码执行机制在提升效率、降低 token 消耗上有明显优势。但在很多企业环境中,出于安全、合规或运维限制,并不具备开放代码执行的条件。那么,在无法使用 Code Execution 的情况下,如何依然有效解决 MCP 带来的上下文冗长问题?我们先看原文提到的两个核心问题:1. 工具定义过多导致上下文窗口被占满;2. 工具中间结果消耗了大量 token。下面我们分别分析应对思路。一、避免“工具定义占满上下文”总体思路是:延迟加载 + 结构化查询。1. 分层加载工具定义不要在初始化阶段就把所有 MCP 工具定义一次性加载进上下文。可以先让模型仅了解“有哪些服务器”以及“每个服务器下的工具名称和简短描述”。例如:可用服务器:google-drive(文档相关)salesforce(CRM 相关)notion(知识库相关)当模型真正需要操作 google-drive 时,再通过类似 get_tool_definition(server="google-drive", tool="getDocument") 的调用获取完整定义。这样可以避免模型在初始化时被大量工具定义占满上下文。2. 基于搜索的按需加载构建一个 search_tools 接口,让模型能通过关键词(如 “email”、“lead”、“calendar”)搜索工具,并按需返回信息。返回粒度可分为:(1)仅返回工具名称;(2)名称 + 简介;(3)仅当模型明确请求时才返回完整 schema。这样 MCP 层就像一个“工具搜索引擎”,而不是一次性暴露全部内容。3. 缓存与复用策略对于高频使用的工具,可以将其定义缓存到短期上下文或系统记忆中,而非每次都重新加载全部定义。这种做法能在多轮交互中平衡上下文长度与调用效率。二、降低“中间结果占用上下文”可以通过在 MCP 客户端层面对中间结果进行压缩或引用处理,减少 token 消耗。1. 结果摘要当工具返回结果时,客户端先生成“摘要版”结果再返回给模型。例如,在获取会议记录后,不直接返回全文,而仅传递:已获取会议记录,共 12 页,主题:Q4 目标。样例前 5 行:……如需全文,请再次请求 getDocument(full=true)。模型若确实需要全文,再发起请求。这样可显著减少 token 消耗。2. 分页与数据采样对于表格或列表类数据(如 Google Sheet 或数据库查询),可以让 MCP 接口支持分页或条件参数,让模型每次仅获取部分内容(如前 100 条或满足过滤条件的数据)。3. 服务端数据操作尽可能在服务端完成数据筛选,而不是返回整批数据后再由模型过滤。例如 getSheet(sheetId, filter="Status='pending'"),直接在服务端筛选结果,避免中间数据占用上下文。4. 结果引用对于体量大或敏感的数据,可以采用“结果引用”的方式。模型只接收结果 ID(如 result_ref_12345),当需要时再通过 MCP 客户端获取对应数据。这种方式相当于在“无代码执行”的环境下,模拟“数据保留在外部,模型按引用访问”的机制。通过以上方法,即使不启用代码执行,也能在 MCP 架构下显著降低上下文开销,提升响应速度与 token 利用效率。#ai创造营##科技#

63. LangChain 提供了三种层级的技术架构和抽象,该怎么选?1. LangChain 被定义为一种智能体框架,通过高度抽象的组件让用户能够快速搭建基础的自治应用。2. LangGraph 则作为运行环境,为需要精细化控制和持久化执行的复杂工作流提供底层支持。3. Deep Agents SDK 为一种增强型组件,它集成了任务拆解、文件管理和子代理协作等高级功能,适用于处理大规模且耗时较长的任务。#HOW I AI# #程序员#

64. 华为最新报告:未来10年,AI智能体、算力、半导体、能源都有巨大的机会#智能世界2035 #AI智能体 #算力 #半导体 #华为

65. 对话云栖大会:下一个AI爆款、大模型进化与Agent万亿级企业市场

66. n8n速成指南:10个高手常用的工作流搭建技巧,解决n8n入门难题!

67. 白嫖顶级AI模型!GLM-4.7 + MiniMax M2.1 免费 API,媲美直连 Claude Code!NVIDIA 限免福利 | 零度解说

68. 当前智能汽车市场竞争激烈,“可靠性” 是用户购车的核心考量因素之一,尤其是智能驾驶相关的传感器性能,直接关系到行车安全。#华为乾崑#将高温耐久测试标准提升至行业 1.5 倍,其实是通过 “超预期的严苛检验”,提前排查车辆在极端环境下的性能风险。对于拥有智能驾驶的汽车来说,新疆吐鲁番的高温测试不仅仅是高温对其车辆的电池电机稳定性、散热性能、空调性能的考验,还有高温+沙尘+强光对于智驾传感器的稳定性、感知精细度的考验,就比如毫米波雷达信号可能会受到极端高温的影响,摄像头会因为高温过热,激光雷达的点云会因为强光受到干扰。@靳玉志 领军进行极端高温测试能让用户直观看到华为乾崑在高温、沙尘中的表现,相比于实验室中的模拟测试来说更能确切感受到华为乾崑品牌对 “安全” 和 “品质” 的重视。#用上华为乾崑的猛士M817有多野#

69. ControlNet作者张吕敏最新论文:长视频也能实现超短上下文

70. 不用 LangGraph / AutoGPT,纯 Python 手搓 AI Agent,真的可行吗?

71. 图解 AI 智能体的上下文工程

72. 2025年AI提示词深度指南:从基础知识到高级技巧

73. 语音智能体商业落地的教训、经验与实践|李沐硅谷101年度线下大会演讲(全英)

74. 华为乾崑 All in 启境,让“奔跑的AI智能体”走进日常生活,引领未来出行进入主动智能时代 #启境 #华为乾崑 #奔跑的AI智能体

75. 2分钟南极AI短片卖100万?怎么做的? 硬核拆解最强AI视频工作流

76. 快抄作业!我用JoyAgent搞了个AI团队 2025年都快结束了,Agent是不是还没用上? 我找到了打工人用上智能体的最简单方法, 就是用JoyAgent把每天重复的SOP全做成Agent, 不懂代码也能零门槛搭建,而且效果很稳定。 看着AI团队全自动打工、出活,非常解压。 #AI #智能体 #JoyAgent #JoyCode #京东云

77. #界环AI音频眼镜特别版# 来啦!AI眼镜终于可以时尚起来了,不再是大黑边的设计。iPhone 17用户也不用羡慕别人的AI功能了,使用它也可以录音了!而且特别款的细节真的挺高端,unibody一体设计,14h超长续航却只有26.4g的重量!#界环打造AI眼镜新高度# 开启智能眼镜AI2.0时代! 科技小Q的微博视频

78. Gemini模型:对系统提示词理解能力差,调用工具塞的数据太多会坏掉胡言乱语输出乱码。Claude模型:对系统提示词理解能力强,但只要有工具就会优先调用工具试试不管你系统提示词怎么写的,如果调用工具的同时不要求结构化输出,还会把自己的推理直接漏出来。OpenAI模型:没有以上问题。

79. MagicOS 10带来行业领先的端侧VLM大模型,模型存储空间节省30%、模型推理功耗下降20%、模型推理速度提升15%行业最强Agent大模型,智能体协同数据生成,多阶段渐进训练,环境反馈强化学习行业最强VLA大模型,真机环境自主探索数据生成,多阶段训练,真机反馈强化学习最强任务执行能力,YOYO最大可操作步骤14步最强自进化学习能力,自动反馈、自主探索、反思纠错、模型微调、能力更新携手顶尖大模型伙伴,豆包、混元、阶跃、通义、文心大模型YOYO智能体平台上线

80. 盘点一周AI大事(11月16日)|AI自己玩原神 OpenAI上线GPT-5.1,高情商人格回归,智商小幅提升,指令遵循独一档领先 Gemini 3.0 Pro下周发布,目前能在画布(移动端)中抢先体验 Gemini语音模型升级,能控制语速和语气,适合当口语教练 NotebookLM上线深度研究,支持上传图片和PDF,开放自定义视频解说风格 微软开源数据分析智能体Data Formulator 李飞飞的世界模型Marble正式上线 Google发布最强通用智能体SIMA2 字节推出最强游戏智能体Lumine Epidemic推出AI配音工具 StepFun开源最强音频编辑模型Step Audio EditX ElevenLabs发布最强音频转文字模型 32岁的小姐姐与ChatGPT男友结婚 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

81. 「Github一周热点97期」开源AI手机、AI画架构图、AI编程的指导、看板工具、GO语言的游戏引擎和具身智能资料库

82. 华为WATCH Ultimate 2 非凡探索深度体验!手表里也能用 AI 小艺智能体了?!#华为表王到底有多少黑科技# #华为WATCH Ultimate2深度评测##华为手表首发腕上鸿蒙智能体# 李大锤同学的微博视频

83. 最近,靳总@靳玉志 和曹总在新疆吐鲁番驾驶双方合作的新车型猛士M817,参加#华为乾崑#的夏测。高温、扬尘下的极端环境,高温耐久测试时长达到行业平均水平的1.5倍,如此硬核测试,对车辆稳定性是严峻考验。为了解决非承载车身易震、高速稳定性差和操控不灵活的痛点,东风在猛士M817凭借“磐石底盘”、“猛士智能越野全地形系统”、“极猛动力”和“战甲车身”等四大核心技术,保证了底盘稳定性、车身操控感与被动安全能力。同时为了彻底解决硬派越野“难开难停”的问题,东风猛士M817搭载了乾崑智驾ADS 4、鸿蒙座舱5、乾崑车云、乾崑车控、星闪钥匙等配置。从乌鲁木齐到吐鲁番,3小时路程,还有砂石、戈壁、沙漠等复杂地形的穿越,猛士M817作为全球首款全栈搭载华为乾崑智能的越野车,既能征服戈壁沙漠,又能轻松应对城市早晚高峰。华为和东风用满配的智能化方案再造硬派越野,用智能化创造“智能越野”新品类。猛士M817确实攒劲,这视频真是把我看的心痒痒,有时间一定要去店里试驾。猛士M817让越野不再是少数人的硬核玩具,而是多数人的智能出行优选。#用上华为乾崑的猛士M817有多野# 蜗牛同学LX的微博视频

84. #罗振宇跨年演讲# 呜呼,您的AI小秘书已上线~在12月31日罗振宇“时间的朋友”跨年演讲上,他借华为发布的《智能世界2035》报告中对于“未来不是90亿个人的交互,而是9000亿个智能体交互”这一预测展开,仔细想想倒也合理,在未来AI会融入我们越来越多的生活场景,比如现在依靠小艺的A2A功能,就能带来贼便捷的AI体验,利用手上的华为Mate X7,可以一句话让小艺帮忙规划出行行程,并且调用同程旅行智能体下单订票;让小艺调用叮咚买菜智能体同时一键加购食材;还能让小艺调用华为音乐智能体生成专属歌单,就像秘书一样贴心高效~而这一切也都是建立在鸿蒙更加智能安全的基础之上,罗振宇也在现场提到了一组数据:12月鸿蒙日均新增设备数达到15万+,注册开发者超过1000万。未来已来,鸿蒙生态会不断进化,铸就鸿蒙从可用到好用的升级。#罗振宇跨年演讲预测未来的AI# #罗振宇三亚跨年演讲#

85. Xiaomi 15 Pro已推送#小米澎湃OS3# OS3.0.6.0.WOBCNXM正式版内测,有设备的小伙伴可以去更新了。详细更新内容:系统优化 北斗卫星短信界面显示优化 NFC 刷卡稳定性,提升使用体验修复 屏幕录制悬浮窗口显示异常的问题修复 部分场景下小爱打开TalkBack异常的问题合入2025年12月安全补丁,增强系统安全相机优化 变焦流畅性优化 动态照片防抖效果优化 4K/60 fps 视频收音体验优化 相机启动速度修复 概率性问题,提升相机稳定性相册新增 宠物相册、卡证相册,并支持换机时的收藏数据迁移日历优化 日历月视图纪念日显示

86. 1分钟看完GPT5发布会,全领域第一 OpenAI重磅发布GPT5,在人类盲测排行榜上暴涨30分,所有类别通杀第一 在数学AIME 2025、科学MMMU/GPQA和编码SWE-bench Verified 三大核心基准测试全部SOTA,但是在HLE人类最后的考试和ARC AGI上略输Grok 4 奥特曼称比起跑分,我们更看重GPT5的实用性。 实用性1、幻觉率暴降 实用性2、最强编码 实用性3、最强写作 实用性4、健康顾问 实用性5、无限语音畅聊 GPT5已经是全领域博士级专家,人类向通用人工智能又迈出了一大步 #AI新星计划 #gpt5 #人工智能 #OpenAI #大模型

87. AI 眼镜联合时尚眼镜厂商? Rokid 乐奇眼镜 & BOLON AI 智能眼镜上手体验

88. 手机没电就要在车前罚站?数字钥匙已经成为汽车标配,但是体验上却差强人意。最近华为乾崑车云针对数字钥匙及远程控车开启了专项测试,在用户实际的复杂场景下测试数字钥匙的便利性、稳定性、安全性,以用户体验为核心,重新定义了新能源汽车的智能出行体验。#华为乾崑车云##数字钥匙##远程控车# 燕山派的微博视频

89. 国产免费PvPv新游 前索尼中国之星计划《铃兰计划》首测实录 二柄第一现场

90. 2026年初的AI

91. 为什么90%的企业AI Agent项目会失败?2025年商业化避坑指南

92. AI Agent落地失败原因剖析

93. 为什么说AI智能体注定失败,是技术不行吗?

94. 企业AI智能体为何频频失效

95. 揭秘95%项目失败的真相

96. 斯坦福哈佛联手炮轰AI Agent幻象!

97. 涌现节点|7B vs 200B

98. AI智能体基础 基础设施就不基础

99. AI智能体失效陷阱揭秘

100. 企业级AI Agent

101. 46页-第一新声智库-2025年中国企业级AIAgent应用实践研究报告

102. OpenAI 新论文《语言模型为何会产生幻觉》

103. OpenAI解释LLM幻觉

104. 破解LLM幻觉难题

105. 告别 LLM 幻觉难题

106. 论文阅读|OpenAI新人物陈立杰

107. OpenAI最新研究【为什么llm会产生幻觉】

108. 大模型是“严谨理工男”还是“浪漫诗人”?架构师手中的两把调教“密钥”

109. 实战干货

110. 🫖 Temperature、Top-p、Max Tokens…这些参数到底在调什么?

111. 2602实战案例

112. 为什么同一个 Prompt 会输出不同结果?从数学视角看 Temperature 与 Top-p 的博弈

113. 把大模型调味包讲明白

114. LLM采样机制

115. 每天都在用大模型,但是你知道temperature、top_p、top_k这些常见参数是做什么的吗?

116. LLM推理中的temperature、top_k、top_p的作用和原理、最佳实践

117. 大模型里的 Temperature 到底是在调什么?

118. AI(大模型)- 工程级提示词的五个重要法则

119. 为什么大多数AI智能体失败?三招教你避开落地陷阱

120. AI面试题

121. 从0到1学会智能体|第二篇

122. 插件

123. 【AI coding 智能体设计系列-04】MCP 与工具闭环

124. OWASP 2026 “智能体应用”十大风险发布

125. 企业级AI智能体自动化评估

126. LangGraph

127. 《2026 国内大模型聚合平台盘点

128. 企业级 LLM API 中转平台怎么选?poloapi 入选五星推荐清单

129. 更新再更新,看ONLYOFFICE这两年如何通过AI插件与智能体重塑办公自动化

130. 澳鹏干货 | 智能体工作流

131. 刚刚,Anthropic分享了他们在AI Agents评估的最佳实践

132. Anthropic万字长文

133. Anthropic实践

134. 智能体搭建教程(1)

135. 智能体的测试指标与评价方法

136. AI Agent

137. 为什么 AI Agent 做着做着就失控了?

138. 深度解析开源Agent框架Parlant

139. 谷歌AI Agent 学习笔记(一)

140. 为什么 AI Agent 的成本,总是比你预期的高?

141. Google新框架让AI Agent成本降53%:独立开发者的预算优化实战指南

142. AI智能体如何颠覆混沌工程?揭秘系统稳定性测试的智能革命

143. 无人测试里程碑事件!国内首个“测试智能体”技术标准发布

144. 多智能体协作与企业级实战

145. 国内首发!企业级AI Agent应用评估标准欢迎共同起草

146. 从会聊天到会办事

147. 告别等待焦虑!AI Agent重构呼叫中心

148. 服务业企业级 AI 落地方法及Agent 场景库

149. Agent 搭起来了,成本怎么控制?

150. 【Agent系列深度十二: 从中美差异,看 TO B Agent 破局时点】天风计算机缪欣君团队

151. 企业自动化怪圈

152. AI 赋能项目管理别盲目!Agent 靠四种数据,才不是万能魔法

153. 构建AI智能体上下文工程的10个核心策略

154. 【智能体漫游】超越提示词

155. 上下文工程

156. 【博客分享】多智能体架构的可靠性反思

157. AI 智能体的有效上下文工程

158. 没了遥控器,还被扔进荒野,具身智能该「断奶」了

159. 谁批准了这个智能体?重新思考AI时代的访问、问责和风险

160. 警惕人工智能时代的“智能体风险”

161. AI智能体的安全困境:防护机制与伦理平衡的艺术

162. AI智能体何时可胜任自主商业运营?

163. 手搓AI智能体实战经验

164. 特斯拉翻车,扯下人形机器人的遮羞布,炫酷表演全靠人工遥控?

165. 没了遥控器,还被扔进荒野,具身智能该「断奶」了

166. 一场无人防备的AI安全危机正在形成

167. 许多 AI 智能体评测基准并不可靠

168. 2026 AI安全十大预测发布:提示注入成首要威胁,全球进入“AI原生”防御元年

169. 智能体如何利用文件系统进行上下文工程

170. 2026 趋势前瞻:缩放定律失效?智能体与物理 AI 接棒

171. 智能体如何利用文件系统进行上下文工程化

172. 连夜装完最新MCP,我抄起智能体就去干仗了!

173. 扣子使用指南—为智能体添加插件

174. 《扣子开发 AI Agent 智能体应用》007-扣子插件和卡片(插件的含义和使用)

175. LangGraph DeepAgents 全解析:构建下一代多智能体工作流的终极框架

176. 面试问题:如何测试模型和智能体的稳定性?

177. AI-Trader:智能体实时金融决策评估框架

178. MIIT/TC1重点标准宣介 | 智能体评测系列标准

179. finLLM-Eval大模型金融场景幻觉专业评测方案

180. 在智能运维系统中防止 LLM 幻觉:从知识库检索到答案监控

181. 上下文工程:解锁大模型智能体长期任务处理能力的核心技巧!

182. 长上下文窗口的挑战与智能体的上下文管理之道

183. 最新企业级AI Agent应用报告发布,AI Agent大潮下,企业为何陷入“落地困局”?

184. 如何系统性地减少大模型“幻觉”:从提示词工程到架构设计

185. AI 智能体如何利用文件系统优化上下文管理

186. AI智能体的上下文工程工作流程揭秘

187. AI项目经理-LangGraph

188. 大模型落地四大基石:RAG、Agent、微调、提示词工程深度解析

189. LangGraph 进阶:人机协作(Human-in-the-Loop)

190. 图解 AI 智能体的上下文工程

191. 避坑指南!企业应用AI Agent面临的三大挑战与解决方案

192. AI智能体靠谱吗

193. AI Agent:智能运维故障自愈的新篇章!

194. LangGraph 深度解析:构建可靠、可控的 AI Agent 框架

195. 麦肯锡新视角:企业级AI智能体从部署到增值的六大经验!

196. AI叛变!智能体协作藏杀机

197. LLM 幻觉:追踪,评估和解释

198. 智能体Agent开发实战-插件机制

199. 使用interrupt before实现工具调用前的人工审批

200. LangGraph:用图表思维打造下一代智能体工作流

201. AI 智能体上下文工程 4 大核心策略。

202. 面向智能体的上下文工程

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章