AI智能体真伪鉴别指南:四大可验证行为特征成判断核心
02-15 12:05
精选参考来源
新浪微博 2025-10-23
知乎 2025-09-28
来源
精选参考来源
1. #中国超算之父称中国智能体领先世界# 最近种草了一部新手机,被称为“双十一省钱机”的荣耀Magic8,简直太适合喜欢购物的伙伴们了,省钱。省心、省时又省事!今天又看了#荣耀AI终端生态大会# ,荣耀AI场景化生态更是覆盖了八大生活高频场景,其中的宠物健康场生活场景,构建了丰富宠物硬件生态,AI赋能让智能设备更懂宠物,可以行为分析、视觉识别,实时定位,让养宠人能做到真的放心。#中国工程院院士点赞的AI长啥样##荣耀Magic8##万事找YOYO#凤凰网科技的微博视频
新浪微博 2025-10-23 00:00:00
2. 在 AI Agent 的开发中,交互设计(壳)和底层模型能力哪个更重要?未来哪一方会成为竞争核心?
知乎 2025-09-28 00:00:00
3. 这个对 Agent 的定义和归纳挺好!Agent 是一种能够自主决策、执行任务、并在过程中动态调整行为的智能体。它并不是简单的问答系统,而是能理解目标、规划行动、调用工具、记忆状态,并根据反馈优化策略的智能执行系统。关键特征:(1)自主性:Agent 不依赖固定流程,而是根据上下文和已学到的信息动态决定下一步行动。(2)记忆能力:能够在多轮交互中保持状态,记住过往的操作与结果,用以改进后续决策。(3)工具使用:可以选择并组合不同的外部工具或系统,灵活完成复杂任务。(4)自适应性:在策略失败或信息不足时,能尝试不同方法或补充信息,持续优化执行路径。架构形式:(1)单智能体(Single-Agent)架构:由一个 Agent 处理所有任务,适用于中等复杂度的流程。(2)多智能体(Multi-Agent)架构:不同的 Agent 负责不同子任务,能处理复杂工作流,但需要协调机制确保协同一致。工作方式:Agent 通常会将用户请求拆解为子任务,通过搜索、记忆和工具调用等过程生成最终响应,并在此过程中不断判断是否需要更多信息、是否已回答过类似问题、是否需要切换策略。归纳起来:Agent 是具备理解、规划、执行、记忆与自我调整能力的智能体,能够以动态和自适应的方式完成复杂任务。#ai创造营# #程序员#
新浪微博 2025-11-10 00:00:00
4. 谷歌DeepMind掌门人,诺奖得主哈萨比斯1月信息量最大的访谈 #ai #AGI #谷歌 #哈萨比斯 #agent
抖音 2026-01-28 00:00:00
5. 你还在用旧思维与AI打交道吗? #大咖观察 #红衣聊AI #AI时代 #智能体 #大模型
抖音 2026-01-22 00:00:00
6. 什么是 AI 智能体?
知乎 2025-10-31 00:00:00
7. 大模型更像人的大脑,智能体是大模型的手和脚。 #大咖观察 #红衣聊AI #智能体 #大模型
抖音 2025-10-17 00:00:00
8. 华为乾崑 All in 启境,让“奔跑的AI智能体”走进日常生活,引领未来出行进入主动智能时代 #启境 #华为乾崑 #奔跑的AI智能体
抖音 2025-11-29 00:00:00
9. 微表情测谎、极速赔付、AI打败AI,深聊“AI in All”下的保险革命与增长飞轮【硅谷101】
哔哩哔哩 2025-11-28 00:00:00
10. 探访云栖(二):AI Agent元年,谁在打造“数字员工”?【101 Weekly】
哔哩哔哩 2025-10-29 00:00:00
11. 千亿智能体爆发前夜,谁来保护我们的AI安全?|甲子光年
微信公众号 2025-12-23 00:00:00
12. #DeepSeek推出新模型#DeepSeekMath-V2的发布,为AI数学推理开辟了“严谨性优先”的新赛道。摒弃单纯追求答案正确率的传统思路,其创新的自我验证框架,通过LLM验证器审查推理链条、生成高难度样本迭代优化,精准破解了数学推导“重结果轻过程”的行业痛点。在IMO、CMO等顶级赛事中斩获金牌,普特南竞赛近乎满分的成绩,印证了这一路径的可行性。对定理证明等需严密推导的任务而言,这种“自我纠错”能力让AI不再是“黑箱解题”,而是具备了可追溯、可验证的理性思维。AI数学智能的核心价值,不仅在于攻克难题,更在于建立可靠的推理逻辑。DeepSeekMath-V2的突破,为构建更强大的数学智能系统提供了关键支撑,也为AI在科研、工程等精密领域的应用打开了更广阔的空间。#秒懂热点就用智搜# deepseek推出新模型
新浪微博 2025-11-28 00:00:00
13. 全球双榜SOTA!明略科技专有大模型 Mano开启GUI智能操作新时代
微信公众号 2025-09-21 00:00:00
14. Agent 真正的护城河,正在从工具转向记忆资产
微信公众号 2026-01-27 00:00:00
15. 不用 LangGraph / AutoGPT,纯 Python 手搓 AI Agent,真的可行吗?
知乎 2026-01-17 00:00:00
16. 如何构建一个 AI 智能体构建 AI 智能体的核心,是打造一个能够感知、推理、行动并从环境中学习的智能系统。整个过程遵循一个有机的结构化流程,如下所示:1. 明确目标与环境首先要确定智能体的目标,以及它将运行的环境。示例:一个个人 AI 助手的目标可能是管理用户的日程,而它的运行环境则包括用户输入、日历系统和外部 API。2. 智能体核心(AI Agent Core)AI 智能体的核心由三个关键模块组成,这三部分共同驱动智能体的理解与决策能力。a. 感知模块(Perception Module)收集并解释来自各种传感器的数据,如摄像头、麦克风或 API 输入。将原始感知数据转化为可理解的有意义信息,例如文字识别、声音检测或物体识别。b. 认知与推理模块(Cognition & Reasoning Module)这是智能体的大脑所在,负责逻辑推理、模型分析和基于目标的决策。通过算法和 AI 模型分析环境状况,规划行动路径,并根据数据和目标做出判断。c. 行动模块(Action Module)执行已选定的行动,可通过机械臂、软件命令或 API 调用等方式实现。将决策转化为对现实世界或数字环境的具体操作。3. 传感器与执行器传感器用于从环境中采集数据(视觉、听觉或上下文信息)。执行器根据智能体的决策执行任务或响应。二者形成一个持续的“感知—行动”循环,使智能体能动态地与环境交互。4. 环境交互(观察 + 行动)智能体通过观察行动结果并从环境中收集反馈,来评估自身表现。这种反馈帮助智能体调整策略,优化未来的行动。5. 记忆与学习记忆与学习模块用于存储经验并不断优化模型。它维护一个可随观察与反馈而更新的知识库,使智能体能够具备自适应学习能力。随着时间推移,智能体会变得更聪明、更准确、更高效。6. 反馈与改进循环最后阶段是持续改进环节。智能体评估自身表现,更新内部模型,并优化决策机制以取得最佳结果。这种“感知—学习—改进”的循环构成了自我进化型 AI 系统的基础。★ 总结明确目标 → 感知 → 理解 → 推理 → 行动 → 学习 → 改进 → 重复这个循环使 AI 智能体能够从最初的简单自动化,不断成长为具有自主智能的系统。#人工智能##程序员#
新浪微博 2025-10-18 00:00:00
17. 当模型具备以下原子能力,管它叫什么VLA、第二代VLA、WA、NWM或者其他什么,这些都不重要了,1. 响应快、低时延,2. 具备场景理解的“泛化性”,模型不仅“见过能认识”,还可以通过“理解本质再类比”,处理之前没见过的场景,3. 能听懂“人需要怎么开车”,把语言瞬间变成驾驶策略,4. 模型的可解释性+可验证性,5. 能持续挖掘和回传 corner case,6. 可在车端部署,7. 参数增长后,训练能持续增量演进,而不是重来一遍,(欢迎讨论补充)
新浪微博 2025-11-05 00:00:00
18. 给AI一个“身体”:3D数字人或是具身智能的解法?【硅谷101】
哔哩哔哩 2025-11-07 00:00:00
19. 一方面我不喜欢 Andrej Karpathy 总是发明新的概念,一方面又不得不承认他确实很多想法是很有价值的。比如这里对 Software 1.0/2.0 的定义就挺好的:1). 软件1.0时代,容易自动化的是你能明确告诉计算机怎么做的事情。2). 软件2.0时代,容易自动化的是你能自动验证结果好坏的事情。那这里的自动化都什么意思呢?1. 软件1.0:靠指定规则(Specify Rule)自动化过去的几十年,我们用的所有传统软件(比如Excel、Word、会计系统),都是“软件1.0”。它的核心逻辑是“指定”(Specify)。你必须像个事无巨细的监工,把每一个规则都用代码写得清清楚楚。比如做个会计软件,你必须告诉它:“如果A栏的数字大于B栏,那么C栏就显示红色。”“月末,把所有D栏的数字加起来,放到Z栏。”软件1.0擅长什么? 自动化那些规则固定、逻辑清晰的任务。软件1.0解决的是什么问题呢? 是人类的“机械性重复劳动”。比如打字员、记账员、算账员。只要一个任务的全部流程能被清晰描述出来,软件1.0就能接管它。2. 软件2.0:靠指定目标(Specify Objective)自动化现在,AI 来了,升级到了软件2.0。它的逻辑完全变了。我们不再是指定规则,而是设定目标。我们不再像监工一样告诉AI每一步怎么做,而是像个教练,只告诉它验收的标准是什么。比如训练AI下棋。我们不告诉它“当对方出这一招,你就必须走那一步”。我们只给它一个目标:“想办法赢棋”。然后,AI 就开始自己搜索那个能赢棋的步骤。它通过海量的自我对弈(也就是梯度下降)来寻找最佳策略。这就是 AK 的核心观点:软件1.0是我们手动写程序,软件2.0是AI自动搜索生成程序。3. 软件 1.0 时代看“可指定性”(Specifiability),2.0 时代看“可验证性”(Verifiability)。如果说软件 1.0 自动化任务的标准是我们能不能指定清晰的规则,比如说你要写个自动抓取的爬虫,只要指定清晰饿抓取规则和解析规则就可以了。那么软件 2.0 自动化任务的标准则是结果是不是能自动被验证。“可验证性”就是AI能不能在一个任务上进行高效的“刻意练习”。AK 给出了“可验证”的三个关键条件:1). 可重置 (Resettable)AI必须能够无限次地重新开始尝试。比如下棋,这局输了,没关系,棋盘一清,马上开下一局。2). 高效率 (Efficient)AI的练习速度必须远超人类。它可以在一小时内“看”完人类一辈子都看不完的视频,一天内下几百万盘棋。3). 可奖励 (Rewardable)这是最关键的一点。必须有一个自动化的、即时的、没有争议的奖惩机制。自动化至关重要。如果AI每次做完一件事,都需要一个人类专家来看半天,然后给个模棱两可的评价(比如“嗯,这个创意还行”),那AI就没法高效学习。像在编程、数学领域就很容易符合上面的三个条件,但是像写作这种非标准化的就很难验证。但对于软件来说,稍微复杂一点的软件系统,其实很难达到可验证的标准。比如说我在实现 UI 时,会尝试把 UI 设计稿扔给 AI,然后给 AI 一个截图工具,让它反复截图对比设计稿,然后找出差异优化,但是以目前的 AI 能力,还不足以修复这些差异,所以无论你运行多久,也不会真的得到一个理想的结果。这可能就是我不太喜欢 AK 发明的这些新概念的原因,总是提出一个个概念,但是并没有解决多少问题。
新浪微博 2025-11-18 00:00:00
20. Bash Is All Agent Need:Anthropic 重新定义智能体开发
知乎 2026-01-06 00:00:00
21. Cursor 如何将其编程智能体投入生产环境
知乎 2026-01-29 00:00:00
22. 华为最新报告:未来10年,AI智能体、算力、半导体、能源都有巨大的机会#智能世界2035 #AI智能体 #算力 #半导体 #华为
抖音 2025-09-19 00:00:00
23. AI智能体时代,职场规则已不同以往。 想成为赢家,关键在于找准自己的位置。#大咖观察 #红衣聊AI #智能体
抖音 2025-11-06 00:00:00
24. OpenAI 如何打造AI原生工程团队的最佳实践 《Building an AI-native engineering team》,归纳如下。文档介绍了团队应该如何真正把 AI 智能体嵌入工程体系,从计划、设计、开发、测试到上线运维形成闭环,加速整个 SDLC(软件开发生命周期)。1. 规划(Plan)规划往往需要大量代码语境理解,过去必须依赖资深工程师反复澄清。文档强调可以先让智能体读取需求、遍历代码库、标记模糊点、拆分工作项,把早期对齐成本显著降低。团队应该做的是专注决策、风险判断与优先级。因此,智能体不止是“辅助写代码”,而是可以提前介入需求—代码映射,用它来减少来回沟通。2. 设计(Design)设计通常被大量样板工作拖慢,例如项目结构初始化、组件框架搭建、样式规范套入。文档强调应让代理完成“从设计 → 组件 → 代码”的流水线式生成,再由工程师审阅架构一致性和 UX 合理性。设计阶段不是用 AI 画原型,而是让智能体直接产出“可运行验证的版本”,显著减少返工。3. 构建(Build)这是 AI 代理提升最明显的阶段。文档给出的最佳姿势,是让智能体负责端到端的初稿实现,包括模型、API、UI、测试和文档,工程师则把精力转向性能、架构、长期可维护性。构建阶段应把 AI 视为“第一实施者”。工程师不再负责逐行写,而负责判断生成方案是否符合系统演进方向。4. 测试(Test)随着智能体承担更多实施工作,测试反而成为工程师控制质量的主轴。最佳实践是让智能体生成测试用例、补全边界场景,并在代码变更后更新测试。不要只让智能体写代码,要让它写测试、跑测试、基于失败结果迭代;测试越强,智能体越可靠。5. 代码审查(Review)智能体可以持续、稳定地进行第一遍代码审查,尤其擅长发现逻辑漏洞、竞态、错误的数据库访问方式等。工程师则聚焦架构一致性与复杂变更的判断。AI 审查不是为了“更快合并”,而是为了“减少重大缺陷进入主干分支”。工程师的关注点应从细节检查转为整体正确性。6. 文档与知识沉淀(Document)智能体非常擅长根据代码生成结构化说明、依赖图和变化总结。最佳做法是把文档维护接入流水线,例如在发布流程中让智能体自动产出变更摘要,并由工程师确认关键部分。把文档写作视为“可自动化的持续任务”,而不是阶段性集中补齐。7. 部署与运维(Deploy & Maintain)让智能体读取日志、Trace、部署记录,再结合代码自动定位可能问题,并给出可行修复。工程师负责判断、确认和实施关键决策。在运维中使用智能体的关键不是预测故障,而是让其整合多源上下文,减少人工排查时间。重点:团队角色的重定义文档贯穿始终的主题是三个动词:Delegate、Review、Own。1 工程师应把重复性、结构化的工作交给智能体。2 工程师需要对智能体产出进行审阅,但专注关键决策点。3 工程师必须对系统的长期演进负责,对所有上线内容最终背书。AI-native 团队不是“工程师被取代”,而是“工程师从执行者变成决策者与架构塑造者”。#微博兴趣创作计划##人工智能#
新浪微博 2025-11-22 00:00:00
25. 【从规则系统到智能体】在"State of Agentic AI: Founder’s edition"文章里看到的这句话,很准确地讲述了AI 智能体的优势「AI 智能体更擅长处理需要认知能力、推理和适应性的复杂、动态和非结构化任务。与遵循僵化、预定义规则的 RPA 不同,AI 智能体可以朝着一个目标进行推理,动态地即时决策,并随着时间的推移学习或改进——这使它们能够处理边缘情况 (edge cases) (也就是意料之外的特殊情况) 和环境变化而不会“罢工”」最近在设计一个系统来尝试从日志和其他各种输入条件中,推断问题根本原因,也需要在规则还是智能体之间决策,最终决定还是走智能体的路线,最主要的思考点也是如何处理长期可能存在edge case,虽然短期内用规则可以稳定地跑个小半年,但是随着人员和系统的演进,规则会需要不断地调整和优化,以适应系统的变化。但智能体"可能"不需要。这其实也是规则系统和智能体之间的不同之处↓1. 从规则到目标:认知能力的引入RPA 的核心在于“规则执行”,而 AI 智能体的核心在于“目标导向”。前者关心的是如何执行,后者思考的是为什么执行。这种差异的根本在于:AI 智能体具备了“认知能力”——它能够理解任务上下文、评估环境状态、权衡路径,并根据目标进行推理与规划。我们给智能体设计的是一个目标和约束规则,智能体可以在我们设定的目标和框架内"有意识"地,对各种情况进行灵活处理。比如一个客服智能体,设计的目标如果是让客户满意,智能体可能会自己判断用户说话的语气和心情,进行灵活的应答。2. 从静态到动态:应对不确定性的能力传统自动化的假设前提是环境稳定、流程可预测。但现实世界往往恰恰相反:数据缺失、输入异常、系统变化、边缘案例频出。RPA 在这种情况下就像在固定轨道上运行的火车,一旦轨道错位,便无法前行。AI 智能体的关键特性在于适应性。通过持续学习与动态推理,它能够在面对不确定性时,仍然“保持行动”。比如,一个采购智能体在遇到新供应商流程时,不会立刻失败,而是通过知识库与反馈机制自行更新策略。这意味着系统不再“被动执行”,而是具备“自我修正”的能力。3. 从执行到进化:持续学习的闭环AI 智能体的强大之处不止在于智能决策,更在于长期的自我演化。RPA 的生命周期是线性的:开发 → 测试 → 部署 → 维护。而 AI 智能体的生命周期是循环的:感知 → 推理 → 行动 → 学习。这种循环形成了“认知闭环”,让系统能够随着时间推移而变得更强。例如,在销售预测场景中,智能体会根据过去的判断误差,动态调整模型;在运营优化中,它能自动发现流程瓶颈,提出改进建议。这种能力的积累,意味着 AI 智能体不仅能“做任务”,还能“改进自己”。为了让智能体能够进化,我们在一开始设计系统的时候就要考虑如何让智能体从过去的经验中学习。比如可能设计一个RAG系统,让智能体可以从历史处理的过程和结果数据检索相关经验,从而指导新的问题的处理。也可能是一个迭代的微调系统,用历史数据微调新的模型,用微调后的模型来处理新的问题,就代表了智能体的进化过程。RPA 让企业“自动化地做事”,AI 智能体让企业“智能地思考如何做事”。前者提升了效率,后者改变了决策。真正的智能化,不在于让机器代替人执行,而在于让系统具备理解和适应复杂世界的能力。#ai创造营##科技#
新浪微博 2025-11-06 00:00:00
26. Leonie Monigatti深入剖析了AI代理中的记忆演进,从最初的RAG(检索增强生成)到Agentic RAG,再到具备读写能力的Agent Memory,厘清了这一系列技术的核心逻辑与突破。RAG诞生于2020年,其核心是将离线存储的外部知识检索进LLM上下文,解决模型记忆有限带来的问题。但其“单次检索”与“只读”限制导致复杂场景下仍有误导风险。Agentic RAG引入了“工具调用”机制,允许智能体主动判断是否需要检索、选择检索工具,并评估检索结果相关性,显著提升了灵活性和准确性,但仍无法动态学习和更新信息。Agent Memory则迈出关键一步:支持智能体不仅读取,还能写入和管理外部记忆,实现基于历史交互的持续学习和个性化体验。它将记忆从“静态”转变为“动态”,但也带来了记忆管理和遗忘机制的新挑战。这三者共同体现了信息“存储-检索-编辑-删除”的完整闭环,也反映了AI系统从单点知识调用向复杂记忆体系演进的趋势。未来,如何设计高效的多源、多类型记忆管理策略,将是提升AI智能和人机交互体验的关键。详细内容及代码示例请见原文:leoniemonigatti.com/blog/from-rag-to-agent-memory.html
新浪微博 2025-11-04 00:00:00
27. 收手吧GPT-5-Codex,外面全是AI编程智能体!
知乎 2025-09-16 00:00:00
28. 「Github一周热点103期」超轻量的clawdbot、编程智能体的记忆工具、聊天记录分析工具、视觉agent框架和键盘、鼠标统计工具
哔哩哔哩 2026-02-08 00:00:00
29. #汽车科技#中国新能源汽车的智能化已迈入全新高度。#新能源汽车##大V聊车# 据 J.D.power 调研,即便入门级自主新能源车型,其智能化得分也已比肩甚至超越传统豪华燃油车,这与大众对中国汽车崛起的直观感受不谋而合。然而,随着座舱智能化全面渗透控车场景,功能堆砌的乱象渐生,行业亟需一套清晰的发展指引。 锐车小叔的微博视频
新浪微博 2025-11-27 00:00:00
30. 智能体设计模式总结
知乎 2026-01-12 00:00:00
31. 2026年春节AI红包大战预计烧掉45亿,这真的能让用户接受AI智能体成为日常生活的标配吗?
知乎 2026-02-10 00:00:00
32. Agent Skills使用指南:让AI智能体拥有“即插即用”的超能力
知乎 2026-01-27 00:00:00
33. 奥特曼点名「AGI最后一块拼图」!记忆,才是硅谷2026新共识
知乎 2026-01-09 00:00:00
34. 登顶Hugging Face GAIA全球榜首!中兴超级智能体终结「AI黑盒」时代
知乎 2025-10-14 00:00:00
35. AI Agent最新重磅综述:迈向高效智能体,记忆、工具学习和规划
知乎 2026-02-03 00:00:00
36. 逛展实测!自进化AI有什么不一样?丨2025荣耀开发者大会李姐来打卡荣耀全球开发者大会2025啦!来看看这次的主角荣耀AI智能体YOYO,到底有多好玩~ Eva的科技生活的微博视频
新浪微博 2025-10-28 00:00:00
37. AI 智能体上下文工程 4 大核心策略,拯救大模型的「金鱼记忆」!
知乎 2025-09-13 00:00:00
38. Firecrawl团队开源的Open Agent Builder在这↓一个可视化工作流构建工具,主要用于生成、测试与部署 AI agent流程。它支持拖拽式的节点编辑器,能将网页抓取、数据提取、AI 推理、人机交互等多步流程串联起来。访问:github.com/firecrawl/open-agent-builder#人工智能##ai创造营#
新浪微博 2025-10-24 00:00:00
39. LangSmith 如何构建 Agent Builder 的记忆系统
知乎 2026-01-19 00:00:00
40. EMNLP 2025 | AgentThink:小模型大超GPT4o! 首个融合推理与工具调用的自动驾驶 VLM 框架
知乎 2025-09-08 00:00:00
41. 为什么只有 5% 的 AI 智能体在生产环境中真正有效?
知乎 2025-10-15 00:00:00
42. AgentScope Java 1.0 发布:当领先的 Agentic 框架遇上 Java 生态,企业级智能体开发新篇章
知乎 2025-12-15 00:00:00
43. #吉利发布行业首个真AI座舱# 2025年,吉利宣布正式进入AI座舱时代。在“一个吉利,一个座舱”的战略下,吉利将全域AI技术全面落地,以五层原生AI架构,重构新一代座舱标准。从今天起,吉利不再开发不具备AI能力的传统座舱。全新AI智能体Eva同步发布。作为全球首个大规模上车的超拟人智能体,Eva不仅能理解和思考,还能记忆、进化,甚至感知情绪。她像一位贴心的伙伴,提供主动服务与陪伴,让汽车成为具身智能的新起点。从动力到底盘,再到座舱,吉利已经完成全域AI的全面落地。未来,每一台吉利、领克、极氪车型,都将共享同一套AI OS、同一位智能体Eva、同一个用户ID,实现真正的AI平权。无AI,不座舱。吉利,正在用全域AI,重新定义智能汽车的未来。#大V聊车##新能源汽车#
新浪微博 2025-08-20 00:00:00
44. 看完吴恩达 DeepLearning AI 「Agentic AI」前半部分,整理了一下。 一、Agentic Workflows 介绍 Agentic AI工作流指的是由一个LLM作为核心“大脑”,通过自主决策来规划、执行多个步骤,并驱动各种工具以完成复杂任务的智能流程。 其核心要素包括:LLM、多步骤执行、任务完成。 1. 自主性程度 - 较低自主性:步骤预先定义好,工具调用为硬编码。自主性主要体现在文本生成部分。 - 高度自主性:Agent 能自主做出决策,并可以动态创建工具。 2. 优势 - 性能更好:在使用相同模型的情况下,Agentic AI 通常能获得更优的性能表现。 - 并行执行:支持多个步骤或任务同时进行。 - 模块化与动态替换:可以灵活替换工作流中的特定模块或模型。 3. 任务拆解 设计 Agentic AI 时,关键一步是对任务进行拆解。工作流/任务可以拆分为以下形式: 1)模型类型: - 大语言模型:负责文本生成、工具使用、信息提取等; - 其他 AI 模型:如 PDF 转文本、语音合成(TTS)、图像分析等。 2)工具类型: - 接口 API:例如网页搜索、日历查询等。 - 信息提取:如数据库查询、检索增强生成(RAG)。 - 代码执行:用于计算、数据分析等。 4. 评估的重要性 - 客观评价:可通过代码或计算进行量化评估。 - 主观评价:利用 LLM 对结果进行打分(例如 0-5 分),但并非最佳实践,后续会进一步展开。 - 评估可针对端到端流程,也可针对单个模块或步骤。 - 通过检查执行轨迹(trace)来进行错误分析和评估。 5. Agentic 设计模式 - 反思(Reflection):将模型输出再次输入给模型,让其自我反思以优化结果;也可结合外部输入(如代码执行结果)进行反思;还可设计专门的反思 Agent 或使用不同模型进行反思。 - 工具使用(Tool Use) - 规划(Planning) - 多智能体工作流(Multi-Agent Workflow) 二、反思(Reflection) 反思是指通过固定步骤对 LLM 的初次输出进行再次思考和分析的过程。 结合外部工具或输入进行反思,往往能获得更优质的结果。 实践证明,反思是显著提升模型性能的有效方法之一。 在实践中,使用推理能力更强的模型专门负责反思任务,通常能取得更好的效果。 三、工具使用(Tool Use) LLM 本身并不直接执行工具,而是由 LLM 指示执行引擎调用特定工具。 执行引擎负责实际调用工具、获取结果,并将结果返回给 LLM,LLM 再基于这些结果生成最终输出。 代码执行(Code Execution)是一个非常有用的工具。 LLM 可以生成 Python 代码,由执行引擎运行代码并返回结果。 需要注意的是,执行代码时需考虑安全性,建议在 Docker 或沙箱环境中运行。 模型上下文协议(MCP)的出现,极大地减少了工具调用的开发工作量,从原来的 m*n 级别降低到 m+n 级别。 #ai创造营##程序员#
新浪微博 2025-11-02 00:00:00
45. 如何评价DeepSeek发布梁文锋署名论文,提出「条件记忆」及Engram记忆检索架构?有哪些亮点?
知乎 2026-01-13 00:00:00
46. 2026年春节AI红包大战预计烧掉45亿,这真的能让用户接受AI智能体成为日常生活的标配吗?
知乎 2026-02-10 00:00:00
47. 「Github一周热点97期」开源AI手机、AI画架构图、AI编程的指导、看板工具、GO语言的游戏引擎和具身智能资料库
哔哩哔哩 2025-12-14 00:00:00
48. #AI手机没用明白机器人手机已经来了# 这几年手机圈内卷,大家都在卷影像、卷性能,没想到真正的变量在这里。当AI不再局限于一块屏幕,而是通过机械结构与现实世界交互,手机的定义就被彻底改写了。它不再仅仅是信息终端,而是一个能主动感知、执行任务的智能体。这不仅是国产手机的胜利,更是“中国智造”为全球科技描绘的新蓝图。 #国产手机开启逆袭剧本# 封面新闻的微博视频
新浪微博 2025-10-20 00:00:00
49. 华为WATCH Ultimate 2 非凡探索深度体验!手表里也能用 AI 小艺智能体了?!#华为表王到底有多少黑科技# #华为WATCH Ultimate2深度评测##华为手表首发腕上鸿蒙智能体# 李大锤同学的微博视频
新浪微博 2025-11-25 00:00:00
50. MiroFlow是由MiroMind AI团队推出的一款开源高性能研究智能体框架,专注于多步互联网调研,尤其擅长未来事件预测等复杂任务。它集成了四大核心组件:MiroFlow框架本身、支持工具辅助推理的开源基础模型MiroThinker、拥有14.7万条优质训练数据的MiroVerse,以及保障训练稳定高效的MiroTrain/MiroRL训练基础设施。这一框架以模块化设计和多层次子代理协同著称,支持包括GPT、Claude、Gemini、Qwen等多种模型和丰富工具(如语音转写、Python执行、文件读取、Google搜索等),实现复杂任务的高效执行。MiroFlow在多个权威基准测试中均名列前茅:如FutureX(未来事件预测)提升了GPT-5预测准确率11%,并在GAIA、HLE、BrowserComp及xBench-DeepSearch等测试中夺冠,彰显其领先的智能推理能力和稳定的并发处理性能。值得一提的是,MiroFlow采用完全免费开源的技术栈,仅需一块RTX 4090显卡即可部署高效的研究智能体服务,极大降低了使用门槛和运营成本。同时,项目配备详细文档和快速入门指南,支持社区贡献,推动开放生态建设。MiroFlow不仅是技术创新的典范,也为未来智能体的发展提供了可复制、可扩展的实践范式,展示了开放源代码在AI研究领域的巨大潜力和价值。🔗 github.com/MiroMindAI/MiroFlow/
新浪微博 2025-11-22 00:00:00
51. 全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%
知乎 2025-12-02 00:00:00
52. 能辉科技:光伏老炮牵手蚂蚁数科,打造能源AI智能体!
哔哩哔哩 2025-10-17 00:00:00
53. 从RAG到记忆工程:AI长期记忆系统的架构范式与落地瓶颈
知乎 2026-02-04 00:00:00
54. 一杯咖啡,3亿美金!斯坦福天才少女退学创业,Meta AI大牛排队加入
知乎 2025-10-03 00:00:00
55. 什么是AI智能体?
今日头条 2025-12-29 00:00:00
56. 智能体设计模式——是什么让一个AI系统成为智能体?
今日头条 2025-10-14 00:00:00
57. 2026 Agent智能体
今日头条 2026-01-20 00:00:00
58. Google
微信公众号 2026-01-08 00:00:00
59. 为何“2026 智能体”成为新风口?揭秘其超越传统AI的核心价值
今日头条 2026-02-05 00:00:00
60. 智能体元年
微信公众号 2026-01-28 00:00:00
61. 2026可信智能体技术趋势深度解析
今日头条 2026-01-21 00:00:00
62. 2026 AI 元年
今日头条 2026-01-29 00:00:00
63. 2026年,AI智能体开始走向真正的规模化应用!
今日头条 2026-02-03 00:00:00
64. 2026年,智能体(AI Agent)是风口还是泡沫?深度解析
今日头条 2026-02-05 00:00:00
65. 智能体来了——企业负责人决策复杂化,是否需智能体辅助判断?
知乎 2026-02-05 00:00:00
66. 下一代生产力革命的核心引擎 AI智能体 十家核心公司及概念股梳理(后附表格)
微信公众号 2025-10-31 00:00:00
67. 探索大模型智能体
知乎 2025-10-24 00:00:00
68. 2025-2030年智能体产业运行深度分析及投资前景预测报告
知乎 2025-11-24 00:00:00
69. 2026企业级生产力革命
今日头条 2026-02-05 00:00:00
70. AI智能体技术发展报告
微信公众号 2026-01-23 00:00:00
71. AI智能体
微信公众号 2026-01-01 00:00:00
72. 理解AI智能体
小红书 2026-01-18 00:00:00
73. 大模型笔记
知乎 2025-12-22 00:00:00
74. AI 智能体的开发
微信公众号 2026-01-30 00:00:00
75. AI智能体/工程落地/如何设计和构建一个高效可靠且可扩展的先进AI智能体系统
微信公众号 2026-01-29 00:00:00
76. 从谷歌2025年发布《AI智能体上手指南》,分析AI智能体的发展前景
知乎 2026-01-17 00:00:00
77. 大模型狂飙2025
哔哩哔哩 2026-02-06 00:00:00
78. 国家级标准发布:智能体4大核心能力+11项技术指标全解析
哔哩哔哩 2026-01-31 00:00:00
79. 20个AI智能体概念
知乎 2025-09-09 00:00:00
80. 关于AI Agent智能体
微信公众号 2025-11-21 00:00:00
81. 智能体开发平台全景综述及面向网络场景的思考
微信公众号 2025-11-26 00:00:00
82. AI-Trader
知乎 2025-12-25 00:00:00
83. AI智能体自主运营商业可期?新基准测试赋能无人值守安全验证
微信公众号 2026-02-04 00:00:00
84. 8个AI智能体性能测试基准
知乎 2025-12-26 00:00:00
85. AI智能体
微信公众号 2025-11-08 00:00:00
86. 如何评估智能体测评结果的准确性?
知乎 2025-11-26 00:00:00
87. 智能体的测试指标与评价方法
微信公众号 2025-12-18 00:00:00
88. AI 智能体入门
知乎 2025-12-22 00:00:00
89. 收藏必看
知乎 2025-10-20 00:00:00
90. AI Agents with Google 第四天学习笔记
小红书 2025-11-14 00:00:00
91. 智能体支付需要信任
微信公众号 2025-12-16 00:00:00
92. 每日GitHub精选
今日头条 2025-11-22 00:00:00
93. 17.9w 星炸场!AutoGPT 凭啥这么顶?一句话给指令,任务自动拆、流程自己跑!
微信公众号 2025-11-04 00:00:00
94. AutoGPT
今日头条 2025-12-31 00:00:00
95. IDC
微信公众号 2026-02-01 00:00:00
96. AI 智能体技术全景洞察(55页报告)
微信公众号 2025-12-15 00:00:00
97. 智能体概述与产品形态
微信公众号 2025-12-22 00:00:00
98. 第209期 深入循环内部,理解人工智能智能体(AI Agents)工作流程
知乎 2025-11-23 00:00:00
99. 网警
今日头条 2025-10-27 00:00:00
100. 警惕生产力倒退, IDC FutureScape 2026 智能体十大预测发布
微信公众号 2026-01-21 00:00:00
101. 红杉资本称2026为AGI元年
今日头条 2026-01-22 00:00:00
102. 人工智能智能体白皮书
今日头条 2025-11-03 00:00:00
103. 从“会说”到“会做”
微信公众号 2025-09-17 00:00:00
104. AI 智能体框架 vs. 运行时vs. 测试线束,它们是什么以及何时选择使用?
微信公众号 2025-12-12 00:00:00
105. 【C#程序员入门AI系列教程】AI Agent入门
微信公众号 2026-02-10 00:00:00
106. AI Agent
微信公众号 2025-09-07 00:00:00
107. AI竞争转向智能体时代,自主执行任务成新趋势
今日头条 2026-02-03 00:00:00
108. 冰洋老师
微信公众号 2025-11-09 00:00:00
109. 智能体的使用效果评估指南
微信公众号 2026-02-06 00:00:00
110. 《构建智能体的实用指南》
微信公众号 2025-11-16 00:00:00
111. 如何构建 AI 智能体(2025 完全指南)
知乎 2025-11-05 00:00:00
112. 智能体来了从 0 到 1
今日头条 2026-01-30 00:00:00
113. 三步辨别真AI智能体
今日头条 2025-08-23 00:00:00
114. 看透智能体本质
微信公众号 2025-11-18 00:00:00
115. 我看到的真相:绝大多数智能体是精致包装下的镜中花、水中月,不会带来任何商业价值,纯讲故事
微信公众号 2025-12-18 00:00:00
116. 全国首部AI智能体应用评估标准,现公开征集起草单位和个人!
微信公众号 2025-12-30 00:00:00
117. 低Token+长记忆+强工具调用,下一代AI编程框架来了
今日头条 2026-02-09 00:00:00
118. AutoGPT:开源自主智能体工具
今日头条 2025-09-01 00:00:00
119. 全国首部AI智能体应用评估标准,现公开征集起草单位和个人
微信公众号 2025-12-10 00:00:00
120. AI Agent,产品经理的“新战场”!一文带你搞懂AI智能体,收藏这一篇就够了!!
知乎 2025-08-20 00:00:00
121. AI+应用(企业级AI智能体)
微信公众号 2025-12-16 00:00:00
122. 2026市场报告:代理式人工智能(Agentic AI)企业级AI智能体排行榜
今日头条 2026-01-31 00:00:00
123. 从一夜爆红到低代码智能体平台,我们该如何重新理解AutoGPT?
今日头条 2025-09-12 00:00:00
124. AI智能体搭建平台全景指南:从入门到选型的全面解析!
知乎 2025-08-30 00:00:00
125. 指南发布 | 智能体应用程序安全指南&AI智能体—威胁与缓解措施
微信公众号 2025-12-26 00:00:00
126. 首次公开!重构智能体生产!无问芯穹推出基础设施智能体蜂群
今日头条 2025-09-23 00:00:00
127. 全面战胜ReAct,斯坦福全新智能体推理框架,性能提升112.5%
今日头条 2025-12-03 00:00:00
128. 智能体怎么选?评估好这3个维度就够了
知乎 2025-09-15 00:00:00
129. Dify Agent开发核心技术实战:从多轮记忆到工具调用的全栈指南
微信公众号 2025-09-25 00:00:00
130. 斥资4万刀,普林斯顿发布Agent评测基准HAL
小红书 2025-10-17 00:00:00
131. Meta新方法火了,大模型少用近半推理token,准确率还稳
今日头条 2025-10-06 00:00:00
132. 【AI前沿】Meta 揭示AI推理核心痛点:“行为记忆”让小模型也能高效解题,颠覆现有范式
微信公众号 2025-09-29 00:00:00
133. AI智能体的上下文工程工作流程揭秘
今日头条 2025-09-27 00:00:00
134. 经验记忆黑科技:LightSearcher让AI工具调用减39.6%推理快48.6%
今日头条 2025-12-17 00:00:00
135. 从感知到行动:AI智能体的构建与评估
知乎 2025-10-06 00:00:00
136. 全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%
今日头条 2025-12-02 00:00:00
137. AI 智能体发展面临‘性能质量、成本控制及伦理与法律问题’挑战
微信公众号 2025-12-02 00:00:00
138. 经验记忆黑科技:LightSearcher让AI工具调用减39.6%、推理快48.6%
知乎 2025-12-17 00:00:00
139. 2025年值得关注的五大AI智能体:从康健互联到融富信泰的行业实践
知乎 2025-08-22 00:00:00
140. AI调用资源大降39.6%!新记忆技术立功,推理工具运行效率大提升
今日头条 2025-12-18 00:00:00
141. 什么样的智能体才能称为具身智能?
今日头条 2025-11-19 00:00:00
142. 搭建AI智能体的两大基石:可编程调用与记忆管理(1)—— 可编程调用
知乎 2025-12-28 00:00:00
143. 别等被骗才看!AI智能体身份全追踪,真人验证机制正在刷新认知
今日头条 2026-01-11 00:00:00
144. 可信机器人操作评估与AutoEval
小红书 2026-01-27 00:00:00
145. MIT最新VirtualEnv:新一代具身AI仿真平台,高保真环境交互
知乎 2026-01-15 00:00:00
146. 机器人遇“意外”不再慌!RESample框架靠“探索式学习”训练机器人应急能力
知乎 2025-10-22 00:00:00
147. 中国信通院“方升”智测——智能体测试研讨会即将召开
微信公众号 2026-01-31 00:00:00
148. 多Agent新框架:MERMAID
小红书 2026-02-07 00:00:00
149. 解决“环境匮乏”:自动化合成与拓展LLM Agent的交互环境
微信公众号 2026-01-16 00:00:00
150. [论文速记] Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
知乎 2025-12-02 00:00:00
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!295 88 -
不听劝自己在卫生间砌了个浴缸!夏天泡着真舒服~成本仅需400198 365 -
iPhone 16 Pro 只要 2550 元,太离谱了!110 302
已收藏
去我的收藏夹