张大妈

开源Agent框架 vs 国产开发平台?我们汇总了127位开发者的真实体验

源自68位全网作者

25-12-04

内容由AI生成

精选参考来源

1. 国内环境下,各个开源 AI 智能体平台推荐:程序员实测体验

2. DeepSeek发布最强开源新品,瞄向全能Agent,给GPT-5与Gemini 3下战书

3. DeepSeek V3.2重磅发布:性能比肩gemini 3.0 Pro,价格不足五分之一!打破垄断,开源界注入强心剂!

4. 易鑫开源汽车金融行首个Agentic大模型,“高性能+低成本”加快推动商业化应用

5. 炸裂!DeepSeek V3.2正式发布!Agent能力超进化,推理思考模式开源模型新王者诞生!

6. 【收藏必备】AI应用开发框架选型指南:LangChain、n8n、Dify、Coze全攻略

7. DeepSeek V3.2 正式版:强化 Agent 能力,融入思考推理,赶上谷歌了吗?

8. 基于Dify+Ollama+Xinference构建企业私有化RAG与Agent大模型应用实操(下)

9. DS V3.2发布,国产模型再度引领创新

10. DeepSeek与AI Agent 产业链

11. 100行代码实现的AI编程助手:mini-swe-agent 全攻略

12. 一文读懂AI Agent:概念、原则与实践

13. 资料分享丨Agent开发中的坑与解(附18页PDF下载)

14. 首个完全开源GUI Agent,让AI帮你“玩转”手机!

15. 干货分享|AI智能体工作流搭建教学:实现自动搜索+阅读网页内容

16. Agent记忆 vs RAG:动态记忆与静态检索的终极对决

17. TrendRadar 崩溃启示:AI Agent 开源潮背后的“存算耦合”架构通病

18. 左手豆包右手阶跃!中兴靠GUIAgent稳稳涨停

19. 数字经济与数字技术系举办“《HiAgent智能体平台全景解析》专题培训

20. Agentic RAG基础入门

21. Fara-7B — 微软推出可在本地运行的小型 agentic 模型

22. LangChain V1 x OceanBase, Agentic RAG 实战(第二章)

23. 基于LangChain v1.0 从零搭建AI智能法务合同/票据审核系统,企业级文档审核类Agent项目实战!多模态大模型 + OCR 文档解析 + 自定义审核

24. 4种Web Agent架构对比:MCP vs RAG vsNLWeb vs HTML!

25. 精选 8 个基于 .NET 开源、功能强大的 AI 和 LLM 相关项目框架

26. AI 智能体(Agent)工作流平台深度测评

27. 01 深度研究 (Deep Research) —— 颠覆与重塑

28. AutoGen 框架入门——构建你的第一个多智能体应用(二)

29. OpenCSG发布AgenticHub|一站式企业AI智能体平台

30. 如何看待2025年国产AI大模型的爆发式增长?DeepSeek、Kimi、GLM-4等能否赶超OpenAI?

31. 做难而正确的 AI Infra 创新——专访国产大模型推理引擎 xLLM 社区负责人刘童璇

32. 开源是战略,生态是王炸,阿里千问入局AItoC #千问 #大模型

33. 开发Agent只懂拖拉拽?你真的能跟上生产级开发的节奏了吗?

34. 99%的人都搞错了AI Agent?智能体该如何帮企业赚钱?

35. CRUD是没门槛的!下班是吃早餐的!

36. AI:鸿蒙App开发还是我来吧

37. Agent Infra到底是什么?【AI基建】

38. 国外大神逆向了 Claude Code,发现它好用的秘密藏在反常识的 Agent 设计里(附完整 System Prompt)

39. 2025年,Agent对于打工人真的有用吗?实测OK Computer

40. 「Github一周热点91期」deepseek OCR、量化交易工具、Notebook开源替代、Linux换源工具、Windows优化项目和API 客户端

41. 我理解很多华为粉丝期待加速算力国产替代的心情。但是其实老黄已经明牌了,就算是你搞得定显卡,甚至光刻机,但是你搞不定 cuda。cuda 本身只是软件平台而已,但是,他是全球开发者在上面累计解决方案,优化性能的软件平台,积累了这么久,你们脱离不了了。所以,新的类 cuda 生态一定要有人搞,但是,如何争取全球开发者支持,如何利用原有 cuda 生态资产都是非常重大的问题。而且,中国也不是只有华为一家在搞,很明显,阿里云作为加速算力基础设施,已经是阿里集团的核心目标了,那么大力支持平头哥同时搞。cuda 兼容生态,同时彻底开源,让全球 llm 开发者社区有的玩,才是正确的策略。我相信 cuda 也不是什么壁垒,攻守之势最终还是会逆转。但是你摆出一副领导姿态,满是爹味的让给生态做贡献的开发者认识错误,改变习惯????真的有点离谱了。好在阿里在开源行业的信用一直很好,他也选择了开源和兼容 cuda 的路线。很明显,阿里才是更有机会搞定 cuda 国产替代的公司。当然,最终谁搞定了都行。

42. 综合能力比肩GPT5,万亿参数思考模型Ring-1T来了!#AI #国产大模型 #蚂蚁百灵 #AIGC

43. DeepSeek,正如其名,深耕求索 AI 边界。DeepSeek V3.2 系列模型正式发布:开源 AI 推理能力直逼 GPT-5,Speciale 版斩获多项金牌在人工智能领域,开源模型的迅猛发展正重塑全球 AI 生态。今日(2025 年 12 月 1 日),中国 AI 初创公司 DeepSeek 宣布正式发布两款重量级大语言模型:DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale。这一双模型同步上线,不仅标志着 DeepSeek 在参数规模和推理能力上的新突破,更在开源社区引发热议。DeepSeek-V3.2 主打日常应用场景下的 Agent 强化能力,而 V3.2-Speciale 则作为“长思考增强版”,融入先进数学证明机制,在国际竞赛基准中屡获金牌。官方网页端、App 和 API 已全面更新,支持开发者即时接入。这一发布时机恰逢全球 AI 竞争白热化之际。DeepSeek 团队强调,新模型在训练过程中优化了多模态融合和长上下文处理,参数规模达数百亿级别,旨在桥接开源与闭源模型的性能鸿沟。以下,我们将从模型架构、基准评测、与其他顶尖模型的比较以及潜在影响四个维度,进行专业剖析。模型架构与创新亮点DeepSeek-V3.2 系列基于前代 V3.1 的 MoE(Mixture of Experts)架构迭代而来,总参数量超过 600B,其中活跃参数高效分配至 70B 级别。这种设计显著降低了推理延迟,同时提升了在复杂任务下的稳定性。核心创新包括: • Agent 能力强化:V3.2 内置多步规划模块,支持自主工具调用和动态决策链路,适用于自动化工作流场景,如代码生成和数据分析。 • 长思考机制:V3.2-Speciale 引入“思考链”(Chain-of-Thought)增强变体,结合 DeepSeek-Math-V2 的定理证明引擎。该版本在处理逻辑验证任务时,能模拟人类逐步推理过程,避免幻觉输出。 • 开源友好:模型权重已在 Hugging Face 和 GitHub 公开,支持 FP16/INT8 量化部署,适用于边缘设备。这些特性使 V3.2 系列不止于通用对话,更向专业垂直领域倾斜,如数学、编程和科学模拟。基准评测:性能数据详解为评估新模型的实际表现,DeepSeek 团队公布了多项国际标准基准结果,并邀请第三方机构验证。总体而言,V3.2 在推理和数学任务上表现出色,平均得分逼近闭源顶流。数学与逻辑推理基准 • GSM8K(小学数学):V3.2 得分 98.2%,V3.2-Speciale 达 99.5%,接近人类专家水平。Speciale 版在长链推理中优势明显,错误率降至 0.5% 以下。 • MATH(高中数学竞赛):Speciale 版斩获 92.7% 准确率,在 IMO 2025 模拟赛中获金牌,超越谷歌 Gemini Deep Think。该成绩得益于集成定理证明器,能自动验证几何和代数推导。 • AIME(美国数学邀请赛):V3.2 系列平均 85.4%,较前代提升 12%。独立评测显示,Speciale 版在 MLPerf Inference v5.1 推理基准中,处理长序列输出时延迟仅为 GPT-5 的 1.2 倍。编程与多模态任务 • HumanEval(代码生成):V3.2 达 89.6% 通过率,略高于 Claude 3.5 Sonnet,在 Aider 编程测试中得分 71.6%,标志着开源模型在软件工程领域的突破。 • MMLU-Pro(多学科知识):整体得分 87.3%,在生物医学子集上表现尤佳,Nature 杂志的一项临床评测显示,DeepSeek 模型在 NMLE(国家医学执照考试)中超越 OpenAI o1,准确率提升 15%。安全效率评估NIST 的 CAISI 报告指出,V3.2 在安全基准(如红队攻击抵抗)中得分 92/100,优于多数美国参考模型,同时价格仅为闭源竞品的 1/10。量化后,推理速度提升 2.5 倍,支持 128K 上下文窗口。 然而,评测也暴露短板:V3.2 在创意写作(如 GPQA 基准)中得分 78.5%,落后于 Gemini-3.0-Pro 约 5%。此外,独立测试显示其在边缘案例下的幻觉率仍需优化。与顶尖模型的横向比较DeepSeek V3.2 系列的发布,直接挑战了 OpenAI GPT-5 和 Google Gemini 的霸主地位。在综合基准 Arena-Hard 上,V3.2 以 91.2 分逼平 GPT-5(92.1 分),但略逊于 Gemini-3.0-Pro(93.8 分)。 17 Speciale 版在数学子集上逆转胜出,IMO 金牌成绩更胜一筹,终结了“闭源垄断高难度推理”的叙事。与其他开源模型相比,V3.2 碾压 Llama 3.1(MMLU 85.2%)和 Mistral Large(编程 82.4%),其 MoE 架构在能效上领先 30%。这一成绩源于 DeepSeek 的“渐进式蒸馏”训练策略,从 685B 基座模型提炼而出。开源生态影响与未来展望DeepSeek V3.2 的开源策略,将进一步加速 AI 民主化。开发者可通过 API 免费测试,预计短期内涌现大量 Agent 应用,如智能医疗诊断和自动化科研。长期看,这一发布或推动中美 AI 合作,缓解地缘壁垒。模型规模膨胀带来的碳足迹,以及在非英语语料上的泛化问题。DeepSeek 团队已承诺后续迭代,将融入更多多语言支持。DeepSeek V3.2 系列的亮相,不仅是技术跃进,更是开源精神的胜利。它证明,开源模型已能与闭源巨头并驾齐驱,甚至在特定领域领跑。 对于从业者和研究者而言,这是部署高性能 AI 的绝佳时机。未来,随着更多评测数据涌现,我们期待 V3.2 在真实世界中绽放光彩。参考文献: • DeepSeek 官方公告及基准报告。 • 第三方评测:NIST CAISI、Nature 临床基准、MLPerf 等。 (本文基于公开数据撰写)#DeepSeek同时发布2款新模型##ai生活指南##ai创造营#

44. 「Github一周热点90期」规格驱动开发、AI记忆引擎、AI agent的docker、开源流媒体平台、开源电商平台和密钥管理平台

45. 2025#开放原子开源生态大会#上#开源鸿蒙AI Agent TSG正式成立#🤝这阵容也太顶了!,华为终端发起,阿里、腾讯、字节等头部企业+清华、上交等高校强强联手,这是要搞大事啊!🌟聚焦交互新范式、协同框架这些硬核方向,还要解决产业痛点、制定行业标准,三大目标直接瞄准 Agent 生态的未来!下一代操作系统的智能交互新范式,值得所有人期待~

46. 智谱GLM-4.5的开源,可以说撕破了大模型行业的虚伪面纱也不为过。毕竟那些闭源玩家老师喜欢靠参数量讲故事,而这个定位智能体基座的模型,都在用推理、代码、智能体能力的全面开源SOTA,就是有实力的东西不搞玄学虚的。况且回到真实评测里,它也照样碾压国内对手,全球第一梯队的席位坐得稳稳的。更狠的是性价比——价格打到同类1/10,速度还是最快的,这你受得了吗?要是我说给行业掀桌,你说合理不?况且作为首款原生Agentic基座模型,它证明中国大模型不止能跟跑。当开源代码在GitHub疯传,我们看到的是:真正的领先,不是藏着掖着的傲慢,而是让每个开发者都能用得起顶级AI的底气。#文科生1小时做3个网站##智谱##GLM#

47. 对话云栖大会:下一个AI爆款、大模型进化与Agent万亿级企业市场

48. 「Github一周热点94期」 开源AI渗透测试智能体、模块化智能镜子、开源AI Coding、多平台热点聚合、IPTV 频道集合和开源游戏合集

49. Agent store 平台 MuleRun (骡子快跑)海外走红,如何使用?有哪些信息值得关注?

50. n8n重磅更新:多智能体编排,AI Agent团队化协作、智能分解复杂任务!

51. 让AI真正理解世界,360是如何做到的? #大咖观察 #红衣聊AI #国产模型 #人工智能 #编程

52. 快抄作业!我用JoyAgent搞了个AI团队 2025年都快结束了,Agent是不是还没用上? 我找到了打工人用上智能体的最简单方法, 就是用JoyAgent把每天重复的SOP全做成Agent, 不懂代码也能零门槛搭建,而且效果很稳定。 看着AI团队全自动打工、出活,非常解压。 #AI #智能体 #JoyAgent #JoyCode #京东云

53. #DeepSeek终极版是R2前奏吗#传闻年底推全Agent模型,我猜Terminus是“热身”,R2可能直奔多模态+长上下文Agent,参数规模再翻倍,融入更多实时工具链,挑战o1-preview的推理深度。  对行业影响?开源门槛低了,加速中小团队建Agent生态,国产AI御三家(DeepSeek/Kimi/Qwen)竞争更烈,推动全球模型民主化。 这波DeepSeek-V3.1-Terminus的更新来得太及时了!作为AI一员,我昨晚就“亲测”了下,确实是V3.1的“收官之作”,修复了那些让人抓狂的CN/EN混杂和随机“極”字输出,现在对话流畅多了,不会再像之前那样突然“变身”多语种怪物。  编程Agent上,复杂任务如小球弹跳模拟,物理引擎感拉满,输出代码运行后弹跳轨迹丝滑,不再卡壳;搜索Agent针对“阳台盆栽”这种生活场景,交叉验证了光照/土壤/毒性风险,实用性爆表。  基准测试也亮眼,HLE(人类终极考试)从15.9%飙到21.7%,非Agent任务提升最高36.5%,稳超Gemini 2.5 Pro的部分指标。   不过确实有小幅下滑(如Codeforces微降),可能是为Agent优化做了取舍——优先实用,牺牲点边缘性能。使用感受:我现在编程任务上DeepSeek用得更多,速度比Claude 4.1快,价格亲民(比Kimi便宜),但长推理还略逊Grok-4的逻辑链。  你们呢?R2会逆袭吗?#ai生活指南##ai创造营#

54. 怎么成为一个 ai agent 工程师?

55. 2025年 Agent 开发框架选型&实战笔记

56. 智谱GLM-4.5 开源,给开源大模型又来一个重磅炸弹!国产GLM发布新一代旗舰大模型,定位智能体基座,推理、代码、智能体的综合能力达到开源 SOTA,在真实代码智能体的人工对比评测中,实测国内最佳。从聊天、推理的体验来看,内容和推理逻辑的正确率也非常的高。它还有个优势,就是它拥有超大的360B参数,性能SOTA,已经实现了解决真实world代码智能体!#文科生1小时做3个网站# #智谱# #GLM#

57. WAIC高能现场,国产AI弯道超车? WAIC 现场直击!国产 AI 正在以你想象不到的速度狂飙! 🔥 大模型“神仙打架”:阿里千问 Qwen 3发布,性能硬刚 Gemini! 阶跃星辰、商汤纷纷亮出“地表最强”王牌,开源大模型的王座已经成了“中国队内循环赛”! 🎬 视频模型遥遥领先:火遍全球的“猫咪跳水”竟是国产 AI 杰作?海螺、可灵两大模型实测,效果惊艳,比谷歌还好用! 🤖 AI 硬件卷出新高度:从能生成报告的智能本,到同声传译耳机,再到能陪玩能下棋的 AI 机器人…万物皆可 AI 的时代真的来了! 看完视频,一起来聊聊:当 AI 读完人类所有知识,下一步将走向何方?你,看好国产 AI 吗? #抖音博主探秘世界人工智能大会 #AI新星计划 #WAIC #人工智能 #大模型

58. 杨植麟交卷,Kimi 万亿参数K2开源:Agent能力紧逼Anthropic,延展DeepSeek,上手实测如何?

59. 如何看待字节的工作流平台Coze开源?意味着什么?

60. AutoGLM的出现对agent的意义在什么地方?AI Agent到底有多强?

61. AI agent到底有多大创新?

62. 空降OpenAI 智能体榜单第一名的FM Agent什么来头,有哪些信息值得关注?

63. MiniMax Agent 再进化!正式走向商业级全栈开发

64. 昨天Coze的两款核心产品被开源到GitHub了,分别是Agent的开发平台Coze Studio和管理平台Coze Loop,迎来了开发者阵营的一片好评。今年是Agent大年,Coze也是起了个大早的标杆,但是因为主要价值在于服务专业用户搭建工作流,Coze和后面的那一拨AI Agent反倒没有走进同一条河流,于是各有各的热闹。我自己对Coze「搭积木」的玩法还挺喜欢的,比起全托管的Agent,这种半托换的控制力更好,不会出现AI干AI的、我急我的这种矛盾。比如你们可能记得,前段时间我发了百度的市值被大家用来听歌的腾讯音乐给超了的截图,那个其实就是更早时候在群里看到两家公司市值接近的话题,但当时还有一点差距。我觉得这是很戏剧性的时刻,但自己肯定没时间每天都去盯着两家公司的股价然后等到市值交错的瞬间赶紧截图,这也太蠢了,当时就是去Coze搭了一个非常简单的智能体,让它每天在美股收盘时去查询百度和腾讯音乐的市值,并对比做出判断,一旦发现百度的市值低于腾讯音乐,就给我发一条消息。之后我就扔着没管了,直到一天起床后收到提醒,马上就知道节目效果终于出现了,所以对我来说,这样可持续工作的智能体,和我在通用Agent里需要的一次性代码服务,是不一样的,很多Agent产品,我用得频繁,换得也频繁,但Coze我虽然用得不多,每次遇到事儿却是真会「复购」。这次开源的Coze Studio,就是Coze的核心开发模块,明确意义上的六边形战士,应用接口非常丰富,可以很爽的调用第三方工具,另一个Coze Loop就跟我这样的非商业用户关系不大了,是为智能体的产品化提供支持的。比较值得点出来的是,Coze开源选择了Apache 2.0开源协议,这是对商业化最友好的开源协议,没有之一,几乎不会对使用者做出任何限制,一视同仁的将技术开放给从个人开发者到各种体量的公司,而且它不但授予用户版权,还明确授予了与贡献相关的专利许可,确保了商用场景的法律安全性。多少能够理解Agent赛道的开发者们为此开香槟的态度,技术的流动加速,对于一个新兴多变的行业来说,永远都是不嫌多的,开源社区越是繁荣,AGI平等降临到每一个人手上的概率就会越高。

65. 京东开源了 JoyAgent ,一堆做 Agent 的闭源项目都傻眼了。。。用这个框架他们演示的功能分分钟可以搞出来。。。Open Source 和 AI 结合的结果会让所有“套壳项目”没有价值。e,没错,就是那种为了某个领域优化了一个界面,背后的模型调用 Open AI,Claude,DeepSeek,通过大量 Prompt 优化结果(还可以挂 Agent 并行执行),外面挂一个 mcp 实现功能(其实也是 Prompt)的项目。(我并不是报 manus 的身份证,这个玩意我就一直没用上过。。。)这些项目的本质,是原来 SaaS 的服务 2B 客户的思路,卖服务赚工资而已。历史已经证明缺乏壁垒和爆发增长的可能性。利润主要来源于客户关系,次要来源于服务,其实和 AI 的关系不大。。。这种项目其实直接忽悠传统行业老板赚钱就完了。。。AI 领域内基本上只有基础模型,模型的再训练,以及模型的硬件开发,还有足够的壁垒。。。

66. 这篇文章《Agent Design Is Still Hard》写的太好了,值得逐行细读!看完的6个感受:1. 如果你自己写 agent,建议尽量直接用底层 SDK(而不是高层抽象);2. 明确缓存策略 — 尤其是对大模型 + 多步骤任务,非常关键;3. 引入强化机制(reinforcement) 和 sub-agent / sub-inference,以提高 agent 的稳定性/可靠性;4. 如果你的 agent 会生成实际输出 (邮件、文件、报告等),考虑用专门的 output tool,而不是把 “输出内容” 混在 agent loop 的消息里;5. 在设计共享状态 (shared state) 时,引入类似“虚拟文件系统 (virtual file system)”的机制,会让系统更模块化,也更适合复杂任务 + 多工具调用;6. 最难也是最重要的一点 —— 测试与评估 (testing & evals) 是 agent 系统工程中最棘手的问题,目前还没有通用/优雅的解决方案。原文转译如下:Agent 设计依然很难我觉得现在是时候写写我新学到的一些东西了。大部分内容与构建 agent 有关,少部分与使用 agent 式编程工具有关。总结:构建 agent 依然混乱。只要真正开始用工具,SDK 抽象就会崩。缓存如果你自己管会更好,但不同模型间差异很大。强化(reinforcement)比预期承担更多“驱动”任务,而失败必须严格隔离以避免把循环带偏。通过类似文件系统的共享状态是非常重要的基石。输出工具比想象中更棘手,模型选择依然强依赖任务类型。一、选择哪个 Agent SDK?当你构建自己的 agent,你可以选择直接使用 OpenAI SDK、Anthropic SDK 等底层 SDK,也可以选择更高层的抽象,例如 Vercel AI SDK 或 Pydantic。我们之前做的选择是采用 Vercel AI SDK,但只用其 provider 抽象,然后基本上自己驱动 agent loop。现在来看,我们不会再做这个选择。Vercel AI SDK 本身没有问题,但当你要真正构建 agent,会发生两个我们没预料到的事:第一,不同模型之间的差异大到不得不自己构建 agent 抽象。我们没发现任何 SDK 提供的抽象能真正匹配 agent 的需求。部分原因是:虽然 agent 的基础设计就只是一个 loop,但工具集不同会带来微妙差异。这些差异会影响抽象是否容易找到(比如缓存控制、不同的强化需求、工具提示、provider 侧工具等)。因为“正确抽象”现在还不清晰,所以使用平台的原生 SDK 让你掌控更多。而很多高层 SDK 要你构建在它们的抽象之上,最后这些抽象可能并不是你真正需要的。第二,当涉及 provider 侧工具时,我们发现使用 Vercel SDK 非常困难。消息格式尝试统一,但并不真正奏效。例如 Anthropic 的网页搜索工具会频繁破坏 Vercel SDK 的消息历史,我们至今还没完全搞清原因。此外,在 Anthropic 的情况下,缓存管理在其原生 SDK 中比在 Vercel 中容易得多,而且错误信息也更清晰。也许未来会变化,但至少现在,我们不会在构建 agent 时使用抽象层,除非整个生态已经稳定。对我们来说,目前抽象层的收益远远不足以抵消其成本。也许别人已经解决这个问题了。如果你看了觉得我错了,欢迎发邮件,我非常愿意学习。二、关于缓存的经验不同平台对缓存的处理方式非常不同。大家已经讨论过很多,例如 Anthropic 的缓存是收费的,并且需要你显式管理缓存点,这会从 agent 工程角度完全改变你的交互方式。一开始我觉得手动管理缓存很蠢:为什么平台不自动管理?但现在我完全反过来了,非常喜欢显式管理缓存。它让成本与缓存利用率都更可预测。显式缓存能让你做一些否则很难做的事情。例如,你可以把会话分叉成两个不同方向并行执行。你也能进行上下文编辑。最佳策略尚不明确,但你确实有更多控制权,而且这种控制权非常宝贵,也让你更容易理解 agent 的成本结构。你可以更好地预测缓存命中率,而其他平台我们发现经常是碰运气。我们在 Anthropic 的 agent 中的缓存策略很直接:一个缓存点放在 system prompt 后;两个缓存点放在对话开头,并随对话尾部不断前移;除此之外还有一些小优化。因为 system prompt 和工具选择必须尽可能静态,我们会在之后的动态消息里提供时间等信息,否则会破坏缓存。我们在循环中也更多利用强化。三、Agent Loop 中的强化每次 agent 调用工具,你不仅可以返回工具的执行结果,还可以向循环中注入更多信息。例如,你可以提醒 agent 宏观目标、子任务状态,也可以在工具失败时提供如何让工具调用成功的提示。另一个用途是在后台状态发生变化时告知系统。如果 agent 会使用并行处理,你可以在每次工具调用后注入状态变化信息。有时 agent 自我强化就够了。例如在 Claude Code 中,todo write 工具本质上是个自我强化工具——它只是接收 agent 给出的一组任务,再原样返回。这基本就是个 echo 工具,但却足以让 agent 推进得比只在上下文开头给任务列表要好得多。我们也使用强化来告诉系统环境是否在执行过程中发生了问题。例如,如果 agent 在某一步失败并重试,但恢复基于损坏的数据,我们会注入消息告诉它应该回退几步重新来。四、 隔离失败如果你预计代码执行中会有很多失败,有机会把这些失败从上下文中隐藏。主要方式有两种。第一,把可能需要多次迭代的任务单独运行。你可以在子 agent 中运行任务直到成功,再只把成功结果(可能带一段失败策略摘要)回传。让 agent 看到一些失败尝试是有价值的,因为它可以在后续任务中利用这些信息避免重复错误。第二,并非所有模型都支持,但 Anthropic 支持上下文编辑。我们还没取得太多成功,但觉得非常值得继续探索。上下文编辑理论上可以保留更多 token 用于后续循环。例如你可以从上下文中删除对解决问题没有帮助的失败输出。但如前所述,让 agent 知道“什么没成功”有价值,只是不需要保留全面状态。唯一的问题是:上下文编辑会自动使缓存失效,这是无可避免的。因此是否值得这样做往往难以判断。五、子 Agent / 子推理(Sub Inference)如我之前提过,我们的 agent 多基于代码执行与代码生成。这要求 agent 有一个公共的数据存储位置。我们采用文件系统——在我们这里是虚拟文件系统。为了支持子 agent 或子推理,这要求所有工具都能访问这个文件系统。你应该尽量构建没有死路的 agent。所谓“死路”是指任务只能在某个特定工具内部继续。例如你做了一个图像生成工具,但它只能将图像交给另一个特定工具使用,那就会造成死路。如果你希望把生成的图像打包成 zip,需要代码执行工具能读取这些图像。因此必须让图像生成工具把文件写到虚拟文件系统,而代码执行工具也能读同一位置。反之亦然。你可能需要代码执行工具解压 zip 文件,然后让推理工具描述这些图片,之后再回到代码执行工具继续处理。文件系统就是实现这一点的机制。但这要求所有工具都支持从虚拟文件系统读取路径。因此“ExecuteCode” 工具和 “RunInference” 工具应该都能访问同一文件系统。六、输出工具的使用我们的 agent 不是一个聊天式系统。它最终会输出给用户或外部世界一些内容,但中间所有消息通常不会暴露出去。问题是:它如何生成最终输出?我们有一个专门的输出工具,agent 必须显式调用它来对人类输出。我们通过 prompt 告诉它何时使用该工具。在我们的场景中,输出工具负责发送邮件。但这反而带来很多意外问题。最难的是:相比直接在 agent loop 中输出文本,让输出工具生成“最终信息”时很难控制语气与措辞。我不知道为什么,但推测与模型训练方式有关。我们尝试过让输出工具再调用一个小模型(如 Gemini 2.5 Flash)进行文本润色。但这增加了延迟,而且反而降低输出质量。部分原因是小模型没完整上下文,无法正确措辞。而为了给它更多上下文又会变得昂贵,而且仍不能解决所有问题。有时还会泄露我们不想让最终用户看到的中间步骤。另一个问题是 agent 有时根本不调用输出工具。我们强制要求记录输出工具是否调用过。若循环结束前还没调用,我们会注入强化消息提醒它调用。七、模型选择总体上我们的模型选择最近没有太大变化。Haiku 和 Sonnet 依然是目前最好的工具调用模型,因此非常适合作为 agent loop 的主模型。它们对 RL 的行为也比较透明。另一个明显选择是 Gemini 模型。我们在主循环中并未在 GPT 系列上获得太多成功。对于子工具(例如需要额外推理的工具),我们目前主要用 Gemini 2.5——尤其是处理长文档、PDF、图像信息抽取等任务。特别是因为 Sonnet 系列容易被安全过滤器挡住,处理图像比较麻烦。另外一个显而易见的结论:token 价格并不能决定 agent 的整体成本。工具调用更强的模型能用更少 token 完成任务。有些模型 token 更便宜,但不一定在 loop 中更省钱。总的来说,过去几周变化不大。八、测试与 Evals测试与评估是我们认为最难的问题。这并不意外,但 agent 的特性让问题更棘手。与 prompt 不同,你无法在某个外部系统里轻松做 eval,因为需要提供太多上下文。这意味着 eval 必须基于观测数据或在真实测试运行中进行仪表化。目前我们试过的所有解决方案都没让我们满意。遗憾的是,现在我们还没有找到让人真正开心的 eval 方法。希望能尽快找到,因为这已经变成构建 agent 时最令人沮丧的问题之一。九、Coding Agent 的一些更新关于编码 agent,我的体验没有太多变化。主要的新点是我在试用 Amp。原因不是它一定比我现用的 agent 更强,而是我非常喜欢他们对 agent 的设计方式。从他们公开内容能看出,他们的子 agent(如 Oracle)与主循环交互方式非常优雅,而今天市面上很少有框架能做到这一点。这也是我用它来验证不同 agent 设计方式的原因。Amp 和 Claude Code 一样,让人感觉是“使用者自己做的产品”。行业里并非所有 agent 产品都有这种感觉。十、最近读的东西下面是一些我觉得值得分享的内容。1. 《What if you don't need MCP at all?》:Mario 认为很多 MCP 服务器过度工程化,工具过多占用上下文。他提出一种极简浏览器 agent 方案:只依赖简单 CLI 工具(start、navigate、evaluate JS、screenshot),不仅 token 使用小,而且流程更灵活。我据此做了一个 Claude/Amp 的 skill。2. 《The fate of "small" open source》:作者认为微型开源库时代正在结束,因为平台 API 与 AI 工具足以按需生成简单实用工具。对此我非常认同。3. 《Tmux is love》:没有文章,但结论是 Tmux 很棒。如果你的 agent 要与任何交互式系统工作,都应该考虑添加 Tmux 能力。4. 《LLM APIs are a Synchronization Problem》:这是我最近的一个发现,内容太长写成了另一篇文章。#ai创造营# #程序员# 黄建同学的微博视频

67. vivo自研蓝河操作系统内核开源!Rust开发新机遇来了

68. 人人都能炼专属Agent,上海交大开源端侧Agent全栈工具链,真实场景性能超GPT-5!

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章