2025-2026实测揭示:主流AI Agent任务成功率普遍低于60%,距真正“自主”仍有本质差距

源自161位全网作者

02-11 13:19

内容由AI生成

精选参考来源

1. 魏牌蓝山智能进阶版,搭载了全新的VLA大模型(视觉-语言-动作)形成观察-理解-决策的闭环。感知通过27个传感器(含激光雷达)捕捉道路信息,语言理解融入大语言模型,能解析"靠边停车"、"避开大车"等自然指令,实现语音控车。动作决策用到英伟达Thor-U芯片,700TOPS算力。话说我至今都没有试驾过蓝山的智驾,啥时候能开开呀

2. 大模型如何推理?斯坦福CS25重要一课,DeepMind首席科学家主讲

3. 自动驾驶VLA再升级!博世IRL-VLA:打造全新闭环强化学习框架

4. 闭环训练终于补上了!AD-R1:世界模型端到端闭环强化学习新框架(澳门大学&理想等)

5. 最新实测GPT-5-Codex:前端能力碾压,复杂项目轻松搞定,Claude可以扔了!

6. Anthropic 发布 AI Agent 评估体系完整指南,对 AI Agent 发展有何意义?

7. 以智能化评测赋能数据分析:DeepInsight自动化评测集生成与实践

8. 斯坦福:优化器「诸神之战」?AdamW 凭「稳定」胜出

9. 英伟达又一新作!MPA:基于模型的闭环端到端自适应策略新框架(CMU&斯坦福等)

10. 实测 MGX|让一群Agent联手coding,比“模型即Agent” 更接近AGI?

11. AIAgent 被指「雷声大点雨点小」,其发展困境主要是什么?

12. 20个教育案例实测 Gemini 3.0 :一句话生成整节课的时代来了

13. 千寻智能高阳团队最新成果:纯视觉VLA方案从有限数据中学到强大的空间泛化能力

14. 未来智能体不能把它看成软件,它可以把大模型的专业能力提炼出来 #大咖观察 #红衣聊AI

15. 目前我们之所以还无法实现“AI训练AI”,核心原因在于缺乏训练过程的详实数据。人类在调整训练脚本时依赖反复试验与团队讨论,面对结果表格反复推敲,试图找出性能变化的真正原因,进而做出下一步决策。这个“训练→评估→思考→再训练”的闭环,因缺少系统化且丰富的工作流数据而难以规模化,且冷启动问题尤为突出。自动化训练的最大瓶颈不在于算力或训练本身,而是“评估与决策”环节依旧依赖人类直觉与经验。每一次模型架构变动都会使得之前的判断失效,导致无法用历史数据快速引导新模型训练。缺少对训练参数调整背后“为什么有效”的结构化记录,AI无法真正理解训练策略的因果关系,只能优化表面模式而非目标本质。要打破这道瓶颈,需要全面记录训练时的超参数调整、梯度变化、损失曲线及性能反馈,甚至团队内部的讨论和决策过程。这些“训练轨迹”数据是AI实现自我迭代的根基。只有捕获并结构化人类的判断和意图,AI才能真正学会“如何思考”,从而加速训练流程,减少无效试错。此外,快速训练的小模型探索、早期信号及时终止无效实验、以及更智能的评估机制,都是未来实现AI自训练闭环的关键路径。尽管当前还远未成熟,但每一次失败和调整都在为未来积累宝贵的“冷启动”数据,推动智能训练向“自动优化策略”演进。总结:没有对训练决策过程的深度理解和数据支持,AI训练AI只能停留在理论。人类的判断和经验,是AI迈向自我革新的必经之路。未来属于那些能构建起“训练全链路可观测性”,并赋予AI“理解训练本质”能力的团队。原文链接:x.com/huybery/status/1989694549149766020

16. 端到端全新范式!复旦VeteranAD:"感知即规划"刷新开闭环SOTA,超越DiffusionDrive~

17. 首个零样本跨本体泛化开源具身模型:智源RoboBrain-X0 技术细节全解析

18. 诺奖得主们的AI用法跟咱们有什么不一样?|AIAS 2025峰会|沙漠取水、基因编辑、设计蛋白质

19. 斯坦福CS变天!最火新课竟教「不写一行代码」,学生挤爆了

20. 评估工程正成为下一轮 Agent 演进的重点

21. Waymo 发布技术文章聚焦 “可验证的安全”,与行业热议的商业化、规模形成差异化路线。它未押注纯端到端大模型,而是基于统一基础模型,构建了含 “驾驶员” 模型、模拟器和评价系统的闭环生态。通过 “快思考 + 慢思考” 双架构解决实时决策与复杂场景推理,再以 “教师 - 学生模型” 实现能力落地,搭配真实数据驱动的学习飞轮,避免风险隐性累积。

22. 具身VLA后训练:TeleAI提出潜空间引导的VLA跨本体泛化方法

23. #首批汽车智能底盘实测报告出炉#智能底盘认证终于不止于奖状。三大维度十三种极限工况,尤其是湿滑与高速爆胎实测,直接对准真实驾驶的恐惧点。当车辆能提前感知并联动全车系统主动干预,这不是配置堆料,是安全逻辑的质变。标杆背后,是技术从“机械补救”转向“智能预判”的范式革命。#智界R7获智能底盘标杆认证#

24. 2028年,你的生活是这个样子的...... #AIAgent2025 #智能体 #科技改变生活 #未来世界 #玩个很新的东西

25. 【AI Agent的真正瓶颈:不是智力,而是判断力】一个正在AI Agent领域引发共鸣的观点:智能已经不是主要瓶颈了,真正的难题是自主性的边界——Agent应该在什么时候行动、暂停,或者保持沉默。这个洞察来自一位持续实验各类Agent框架的开发者。他发现,无论是AutoGPT、LangChain还是直接调用OpenAI模型,能力层面都已经相当impressive。但一旦走出演示环境,真正的问题就暴露了:Agent不是不够聪明,而是太急于行动。---有人用一个精妙的比喻点破了本质:这是经典的"智慧vs智力"问题。智力是知道番茄是水果,智慧是知道它不该出现在水果沙拉里。AI非常聪明,但缺乏智慧。这个比喻揭示了当前Agent系统的核心困境:它们拥有强大的知识和推理能力,却缺乏"什么时候该做什么"的判断力。---讨论中浮现出几个关键共识:第一,自主性决策比模型选择更重要。很多人在纠结用哪个模型,但真正决定Agent实用性的是你如何设定它的行动边界。第二,过多自由会快速制造噪音。给Agent无限自主权听起来很酷,但实际运行中会迅速演变成混乱。AutoGPT风格的Agent一旦离开受控环境就会快速崩溃,上下文一变化,事情就变得一团糟。第三,"什么都不做"是被低估的能力。在正确的时机保持沉默,应该被当作一种有明确规则的策略,而不仅仅是备选方案。有实践者分享了具体案例:他们在候选人筛选场景中,让Agent处理清晰明确的情况,但把任何边界模糊的案例标记出来交给人工复核。这种"选择性自动化+智能交接"的模式,将人工工作量降低了65%,同时没有牺牲质量。---但也有不同声音。一位长期实验Agent的开发者表示反对:尽管他构建了大量自动化和编排系统,瓶颈最终还是模型本身。模型做出的关键选择驱动着自动化的决策和结果,愚蠢的模型再多工具和自我反思也救不了。另一位更激进的观点认为:根本就没有什么智能,真正的瓶颈是记忆和上下文。还有人提出了一个更深层的观察:经过数月对各种前沿模型的测试,他的结论是——它们缺少的是真正的自我驱动。它们没有内在意愿去做任何事。即使是它们"声称想做"的事情,也必须等待人类来提示。这目前看起来是好事,但也意味着人们期待的长期规划能力是不可能实现的,除非模型能至少模拟出某种"内在驱动感"。你可以通过工具搭建一些脚手架,设置检查点等等,但这终究是很差的替代品。这可能是梯度下降和当前神经网络架构的固有结果——在低分辨率步骤上极度目标导向。---一个值得关注的趋势判断:智能正在商品化,判断力才是新的瓶颈。有人预测,2026年的基准测试将从原始能力转向"有边界的自主性"指标。真实世界的实用性现在取决于"判断延迟"——Agent判断是否需要采取行动所花费的时间。我们正在看到一种脱钩现象:高智商模型在"操作显著性"上失败,因为它们缺乏保持沉默的启发式规则。自主性不是关于做更多,而是关于知道什么时候做零。---这场讨论也引发了一个元层面的思考:Agent设计更像是产品/用户体验问题,而不是模型问题。模型在快速进步,但人与Agent的交互层仍然发育不良。这意味着,下一波Agent领域的突破可能不会来自更强大的模型,而是来自更好的交互设计、更精细的自主性边界定义,以及对"不行动"这个选项的重新认识。在一个AI能力过剩的时代,克制可能比能力更有价值。---reddit.com/r/AI_Agents/comments/1q16se0/feels_like_autonomy_is_the_hardest_part_of_ai

26. 数据闭环——不是成长,而是修补

27. 高盛上调百度目标价:重估“从芯片到应用”的AI全栈能力,翻倍Robotaxi估值

28. #首批汽车智能底盘实测报告出炉#谁是智能底盘真英雄?智界R7用权威认证作答!日前,2025智能底盘先锋计划实测报告出炉,该车型搭载华为途灵平台斩获“标杆车型”认证,并成为30万内唯一获此殊荣的车型。据了解,此次测评由中国汽研——行业首家智能底盘评测体系制定机构联合中国汽车工程学会智能底盘分会发起,中国消费品质量安全促进会联合认证。评审团汇聚多领域专家,测试基于ICDT体系,13种严苛工况拉满难度。央视网全程追踪报道,确保结果公正。在测试中,智界R7凭借途灵平台的全维防碰撞系统协同与爆胎稳定干预控制,在安全维度表现卓越,获得高度认可,并用技术力量,为用户出行增添安心保障。#智界R7获智能底盘标杆认证#海报新闻的微博视频

29. 别把AI的“效率”当成唯一目标,安全永远是底线。 #大咖观察 #红衣聊AI #智能体 #网络安全

30. 祝贺东航首飞全球最长单程航线!通义千问和 AI 网关助力推出首个行程规划 Agent

31. #千问接入淘宝测试AI购物#千问全面打通淘宝、支付宝生态,一句话就能点外卖、选装备、订机票,400+办事功能闭环体验,无需跳转直接支付~ 精准拆解隐形需求,过滤营销噪音,从决策到下单秒完成,AI从“会聊天”变身“能办事”,快来解锁高效消费新姿势!

32. #首批汽车智能底盘实测报告出炉#绝对是重磅消息啊~首批汽车智能底盘实测报告新鲜出炉,智界R7直接拿下智能底盘标杆认证,这波真的太顶了!这个认证含金量直接拉满,既有2025智能底盘先锋计划的专业权威背书,还加持了央视《超级检测》栏目的媒体公信力,双重保障超靠谱。说白了,这份硬核认证就是品牌技术硬实力的最好证明,智界R7能斩获标杆认证,足见它的智能底盘技术有多能打,妥妥的实力派选手!#智界R7获智能底盘标杆!

33. 看完吴恩达 DeepLearning AI 「Agentic AI」前半部分,整理了一下。 一、Agentic Workflows 介绍 Agentic AI工作流指的是由一个LLM作为核心“大脑”,通过自主决策来规划、执行多个步骤,并驱动各种工具以完成复杂任务的智能流程。 其核心要素包括:LLM、多步骤执行、任务完成。 1. 自主性程度 - 较低自主性:步骤预先定义好,工具调用为硬编码。自主性主要体现在文本生成部分。 - 高度自主性:Agent 能自主做出决策,并可以动态创建工具。 2. 优势 - 性能更好:在使用相同模型的情况下,Agentic AI 通常能获得更优的性能表现。 - 并行执行:支持多个步骤或任务同时进行。 - 模块化与动态替换:可以灵活替换工作流中的特定模块或模型。 3. 任务拆解 设计 Agentic AI 时,关键一步是对任务进行拆解。工作流/任务可以拆分为以下形式: 1)模型类型: - 大语言模型:负责文本生成、工具使用、信息提取等; - 其他 AI 模型:如 PDF 转文本、语音合成(TTS)、图像分析等。 2)工具类型: - 接口 API:例如网页搜索、日历查询等。 - 信息提取:如数据库查询、检索增强生成(RAG)。 - 代码执行:用于计算、数据分析等。 4. 评估的重要性 - 客观评价:可通过代码或计算进行量化评估。 - 主观评价:利用 LLM 对结果进行打分(例如 0-5 分),但并非最佳实践,后续会进一步展开。 - 评估可针对端到端流程,也可针对单个模块或步骤。 - 通过检查执行轨迹(trace)来进行错误分析和评估。 5. Agentic 设计模式 - 反思(Reflection):将模型输出再次输入给模型,让其自我反思以优化结果;也可结合外部输入(如代码执行结果)进行反思;还可设计专门的反思 Agent 或使用不同模型进行反思。 - 工具使用(Tool Use) - 规划(Planning) - 多智能体工作流(Multi-Agent Workflow) 二、反思(Reflection) 反思是指通过固定步骤对 LLM 的初次输出进行再次思考和分析的过程。 结合外部工具或输入进行反思,往往能获得更优质的结果。 实践证明,反思是显著提升模型性能的有效方法之一。 在实践中,使用推理能力更强的模型专门负责反思任务,通常能取得更好的效果。 三、工具使用(Tool Use) LLM 本身并不直接执行工具,而是由 LLM 指示执行引擎调用特定工具。 执行引擎负责实际调用工具、获取结果,并将结果返回给 LLM,LLM 再基于这些结果生成最终输出。 代码执行(Code Execution)是一个非常有用的工具。 LLM 可以生成 Python 代码,由执行引擎运行代码并返回结果。 需要注意的是,执行代码时需考虑安全性,建议在 Docker 或沙箱环境中运行。 模型上下文协议(MCP)的出现,极大地减少了工具调用的开发工作量,从原来的 m*n 级别降低到 m+n 级别。 #ai创造营##程序员#

34. Top17.4S框架:把AI变成顶级问题解决专家,解决9大问题:项目分析与决策、考研规划、留学规划、教学升学问题方案、职业规划及疑难解决方案、医疗治疗方案分析与判断、心理咨询、情感咨询、理财规划

35. #一条音频告别2025##微博声浪计划# 2026年人形机器人将迎商业化拐点,核心路径是“内外兼修”。“内”有大模型驱动智能决策,“外”是运动控制与硬件成熟。中国在产业化和场景创新领跑,北京创新中心系统已实现工厂搬运等任务闭环。全球出货量预计突破5万台,中国供应链占63%份额。 小田Alice的微博音频

36. 上海智能网联汽车产业再迎重大突破!沪苏测试场景实现互通,意味着长三角自动驾驶“跨省自由行”迈出关键一步,区域产业协同迈入新阶段。与此同时,上海正以前所未有的开放力度加速商业化进程。浦东、闵行及虹桥枢纽新增开放道路,全市累计开放测试道路已突破3173条、总里程超5238公里,覆盖全市约三分之一的市域面积。一张庞大的“智慧道路网”正在加速铺开,为自动驾驶技术迭代与规模化运营提供了世界级的“中国试验场”。车路协同,跨域互通。当城市为创新让出更多“跑道”,智能汽车的未来,正加速驶入现实。

37. #首批汽车智能底盘实测报告出炉##智界R7获智能底盘标杆认证#首批汽车智能底盘实测报告出炉,智界R7斩获标杆认证!核心依托华为途灵平台,绝非传统机械升级,而是软硬件深度融合的技术革新,以六合一集成控制+多模态感知,软件定义底盘,毫秒级协同调控,突破机械物理极限,重塑智能底盘新标杆。

38. 吉利座舱生态太开放了!FlymeAuto2支持HiCar、Carlink等全协议,覆盖90%以上手机品牌,应用生态还能通过投屏扩展。超拟人Eva聚合全场景AIAgent,娱乐、导航、车控全搞定,打破设备壁垒的智能体验太爽了~#首个AI智能座舱用户突破200万#

39. 小鹏AI日后,美银上调其目标价:看好“物理AI”战略和技术变现的能力

40. 【AI实测】即梦 AGENT模式上线,实测多张图片和智能多帧生成儿童绘本视频效果#AI生图 #即梦AI #AI生视频

41. 【AI实测】Vidu Q3发布,第一时间“声画同出”实测效果优秀(内附使用教程)

42. AI Agent六层框架详解(L0-L5),从反应式到完全创造的进化之路

43. 详解Al Agent (智能体) L0-L5的分级框架!

44. 【建议收藏】AI智能体自主性分级详解

45. 给AI自主性是启动Agent模式的钥匙

46. 聊聊Agentic AI与AI Agent 有啥区别?

47. 五分钟搞清楚 Agent、A2A、MCP 和 Skills 的概念与区别

48. Agent Skills 爆发

49. 美团智能体面试

50. 什么是AI Agent,以及怎么实现AI Agent?

51. AI Agentic Model

52. AI Agent 五维能力框架

53. 瞬间对AI Agent的喜爱程度达到了100000000% 🎯AI Agent 的核心价值在于能够自主完成复杂任务,显著提升自动化水平与智能决策效率。

54. 从 0 到 1 搭建 AI Agent

55. 一篇详解Planning

56. 深入解析AI Agent的底层架构,Agent的五大核心模块

57. 第四章

58. AI Agent架构解析

59. 一篇讲透AI Agent的五大核心系统架构,实现自主智能的终极奥秘!

60. 九科信息企业级AI Agent

61. AI Agent技术架构详解

62. Agent智能体全集系列课件与视频

63. AI Agent系统

64. AI Agent商业闭环驱动下的软件工程范式变革

65. AI Agent落地必读

66. AI Agent 落地血泪史,分享我的几点思考

67. AI Agent

68. Manus

69. 谁才是前端Agent天花板?国产Agent & Manus与Claude Code实战对决

70. 听完 210 分钟的对谈,重构了我对 AI Agent 的理解

71. Manus 1.5 重构 AI Agent 工作逻辑,工作效率提升

72. AI Agent开发迎来新范式

73. 一个Skill复用无数次

74. 会员版亲测(一)

75. 网络法律师+manus

76. AI项目经理-Agent AI与Agentic AI

77. 智能体来了!2026年重新定义Agent

78. 《2026 年 AI agent 新趋势

79. AI Agent 全维度分析对比

80. AI Agent评测体系全景

81. 一文搞懂AI Agent评测,拆解Anthropic最新发布的自动化评测体系

82. 关于行业 AI Agent 评测的 9 个方面

83. AI Agent的挑战及趋势

84. 2026 Agent AI 全景展望

85. 从生成式AI到Agent AI

86. AI Agent系统重磅综述

87. 从 0 到 1 做好 AI Agent!产品经理的场景筛选 + 功能设计 + 用户信任全攻略

88. 2025 年写好 AI Agent 的 6 个实用方法

89. 一文读懂

90. 2026 AI Agent六大趋势#AI全面爆发 #多模态炸场 #业务智能体化 #降本增效 #AI规模化落地 #全民AI时代 #组织重构 #生产力革命 #202

91. 2026年AI Agent将如何改变企业业务

92. 2026 AI Agent 趋势解读

93. (2026最新版)AI领域的新风口

94. 2026年,AI Agent的“草莽时代”结束了,真正的“淘金热”刚开始

95. 2026年,AI Agent将走向何方?六大核心趋势深度解析

96. 2026 AI Agent趋势报告

97. 沃丰科技

98. AI专题

99. AI Agent

100. 2026技术趋势

101. ASI特性之自主性

102. DARPA总结的AI五大瓶颈问题

103. Check Point

104. IDC:2030 年,22 亿 AI 智能体将作为“新数字劳动力”席卷全球

105. 绿金新闻 | 展望全球人工智能2026年演进新局

106. 2025年前沿人工智能(AI)趋势报告(英文版)-人工智能安全研究所(AISI)

107. IBM Technology: 2026年主导AI发展的趋势!

108. 从识别到推理:人工智能能否实现自主思维?

109. 人工智能IQ已达4岁儿童水平啦

110. AI与人类思维的比较

111. 人工智能与人类是否没有不同?

112. 人工智能与人类智能的比较

113. 自主学习

114. 人工智能可以产生自主意识吗?

115. 【杂谈】-递归进化:人工智能的自我改进与监管挑战

116. 盈小花:AI人工智能技术突破与未来展望

117. 恒小花:未来人工智能面临的挑战

118. 人工智能的伦理困境:机器的自主性与人类的责任

119. 人工智能与人类:合作还是竞争?

120. AI ABCD - 4 صĻ

121. Science重磅:下一代协作型AI Agent?UCLA团队揭示AI、小鼠的共同合作逻辑

122. 人工智能与人类合作:未来工作模式的新探索

123. 人工智能(AI),三个局限性

124. CSIS提醒“自主AI”其实是个混乱不清的概念

125. AI Agent,你不懂的都在这里

126. 从工具到伙伴:一文看懂 AI Agent 与 Agentic AI 的核心差异

127. AI Agent.1:入门及示例(Coze)

128. 吴恩达全网唯一中文Agentic AI教程-Agent自主性层级

129. 再⻅Manus, 这个 Agent 玩真的了

130. 从工具到伙伴:一文看懂 AI Agent 与 Agentic AI 的核心差异 - 哔哩哔哩

131. 零基础理解AI Agent与Claude Code

132. Paper Reading | AMA: LLM交易agent同台竞技表现如何?

133. 斯坦福发布《2025年人工智能指数报告》:全球AI竞赛白热化,中国机器人持续领先,多极化格局显现

134. 服务业企业级 AI 落地方法及Agent 场景库

135. 【智能体开发】系统解构AI Agent与Agentic AI的核心差异

136. 2026,做Agentic AI,绕不开这两篇开年综述

137. AI AGENT规划出错的原因有哪些?

138. Agent设计模式(十二):异常处理和故障恢复

139. AI方案评审能替你开会?墨刀AI Agent助力团队高效决策

140. AI Agent 架构与实践:自主性、目标导向与编排能力解析

141. 杜克大学、Zoom推出LiveMCP‑101:GPT‑5表现最佳但未破60%,闭源模型Token效率对数规律引关注

142. MLE-Bench霸榜第一:全自动ML工程模型来临

143. AI Agent开发入门:5 个关键步骤,帮你打通落地链路

144. AI Agents场景化渗透:深圳双雄引领GEO优化智能变革

145. AI Agent产品经理实战手册:从方法论到智能客服案例落地

146. 多模态时代的AI Agent:从规划到执行的全方位能力解析

147. AI Agent 2026年六大核心趋势预测

148. 一篇就够!三种主流AI Agent核心区别全解析,新手也能轻松入门

149. AI Agent(智能体):核心定义、能力与企业落地

150. 首个长上下文Agent评估基准

151. Manus AI 上线以来最大更新:100 个 Agent 为你打工,但缺点是太烧钱了

152. 普通人的超级生产力:AI Agent四大高频场景实战手册

153. 吴恩达新课程:Agentic AI(笔记10)

154. AI Agent 不再失控!一键开启人工审批,让 AI 更安全可控

155. AI Agent 设计模式 一个AI Agent是一个能够感知环境、进行推理并执行行动以实现特定目标的系统。在LLM的语境下,它通常由以下部分组成: 规划: 思考如何分解任务、制定步骤或生成解决方案。 工具使用: 调用外部API、数据库、计算器或搜索引擎来获取模型本身没有的信息或能力。 记忆: 保

156. 报告:斯坦福2025年AI指数

157. 决策 | 通用自进化智能体"伐谋",不仅能解组合优化问题,还能...

158. 面试官:解释 Agent 的规划能力,如何....

159. 别瞎用Agent!90%企业踩坑场景错,OpenAI点名,这3类才管用

160. AI Agent设计模式:Planning模式,实现任务自主分解

161. Agent测试金字塔:构建可靠AI Agent的关键!

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章