主流AI系统频现重复性错误,智能体纠错机制成落地关键瓶颈
03-07 13:56
精选参考来源
抖音 2025-12-11
新浪微博 2025-12-13
来源
精选参考来源
1. 与其追求成为一个从不犯错的人, 不如打造一个就算犯错也能被纠正的流程。#大咖观察 #红衣聊AI #人工智能 #大模型
抖音 2025-12-11 00:00:00
2. 构建真正有效智能体,90%靠的是“记忆”,而非模型本身、框架或MCP。关键在于智能体对以下内容的理解和记忆:- 自身能力范围 - 目标与需求 - 过去失败经验 这段“上下文”决定了智能体是像六岁小孩般无知,还是像严谨工程师般高效。核心是“领域记忆”——既包含专业化知识,也包含任务专属的长期记忆。这不是简单的会话记忆,而是对未来至关重要的关键洞察的持续保存。可以称之为“工作流记忆”,它虽设置不复杂,但设计精妙且价值巨大。即便内部已有智能体架构,实现持久记忆也不难,且无需依赖外部API(当然也有选择)。让智能体把最终回答摘要存入持久存储,下次运行时回顾过去决策,大大提升了连续性与理性表现。失败尝试的历史比成功经验更宝贵,避免重复踩坑,节省时间和计算资源。通过保存失败日志,课减少70%的重复错误,证明记忆架构是生产级智能体的核心,而非模型升级的噱头。将记忆细分为“动态工作流记忆”(从失败中学习)和“静态目标记忆”(明确要求与验收标准),结合使用能让智能体拥有既稳固又灵活的执行力。记忆提供连续性,但“控制”才是智能体真正的主动性源泉。只有当系统能自主调节自身动态,才能实现真正的“代理行为”,而非被动反应。记忆塑造认知,控制塑造行为,两者合力才能造就真正有自主决策能力的智能体。产品角度看,模型是天花板,记忆系统是地板。没有强大且专注的长期记忆,再好的模型也难以落地应用。当大家热衷于追求更聪明的模型时,真正提升智能体智商的,是持续不断的记忆和上下文管理。只有打好记忆基础,智能体才能从随机猜测进化为可靠执行者,实现真正的智能与成长。x.com/Hesamation/status/1999255592242737658
新浪微博 2025-12-13 00:00:00
3. 如何为LLM智能体编写工具?Anthropic官方教程来了
微信公众号 2025-09-12 00:00:00
4. #IT技术# #微博兴趣创作计划# 现在AI开发别盲目用框架!资深工程师深度解析:框架过度抽象化让系统僵硬,黑盒操作难调试追踪,性能瓶颈难定位,升级还可能引发架构不稳定。生产环境中,主流框架复杂度高、扩展性差,反而添乱。更优方案是直接调用API做透明化编排,用Python原生数据结构管理状态,靠传统日志系统实现全链路追踪,聚焦业务逻辑而非框架概念。从零搭建AI系统优势明显:代码完全可维护,错误处理精准,性能优化路径清晰,扩展能力灵活。需注意Dify等工具适合demo,生产环境存在链路修改难、扩展受限问题。适合AI开发者、技术架构师及对AI工程化感兴趣的从业者。 搞机工程师的微博视频
新浪微博 2025-11-21 00:00:00
5. 《Making Sense of Memory in AI Agents》 AI智能体的“记忆”其实是指它们跨多轮对话,记住并调用重要信息的能力。这让智能体能从反馈中学习,适应用户喜好,提升体验和效果。但目前驱动这些智能体的语言模型(LLM)本身是无状态的,每次交互都是“重头开始”,没有内置记忆功能。要实现记忆,必须借助外部存储或上下文管理,帮它们回顾之前的对话内容。“记忆”既是信息的存储位置(如数据库、Markdown文件),也是一种信息管理机制。研究中区分了“智能体记忆”(agent memory)和“自主记忆”(agentic memory)——前者是赋予智能体访问记忆的能力,后者是智能体主动写入和管理记忆的系统。智能体记忆大致分为短期和长期两类: - 短期记忆存在于模型的上下文窗口里,保存当前对话内容; - 长期记忆储存在外部系统,如向量数据库,保存更稳定、广泛的信息。模仿人类记忆结构,有四种记忆类型:工作记忆(当前对话)、语义记忆(事实)、情景记忆(经历)、程序记忆(指令)。另一种设计思路则划分为消息缓存、核心记忆、回顾记忆和档案记忆,分别对应不同存储和管理策略。智能体记忆管理的关键,是如何在上下文窗口和外部存储间高效传递信息,着重解决以下难题: - 如何避免上下文过长导致响应变慢和成本飙升; - 如何判断哪些信息需要被记住、更新或者删除,防止记忆膨胀和信息质量下降。这里涉及“显式记忆”(智能体主动识别和保存重要信息)与“隐式记忆”(系统自动定时更新或批处理记忆)的区分。实现时,当前对话通常用列表形式保存,指令用文本文件,其他信息则根据检索需求存数据库。技术挑战主要集中在延迟控制和“忘记机制”的设计:如何精准判断哪些信息该被遗忘,防止系统负担过重,保持记忆的相关性和有效性。目前,围绕智能体记忆管理的开发框架快速涌现,如mem0、Letta、Cognee、zep,以及LangChain、LlamaIndex等通用智能体开发工具,都在积极推动技术成熟。总结来看,AI智能体记忆设计是连接短期对话和长期知识存储的桥梁。它不仅关乎记忆的保存,更涉及记忆的更新和遗忘,是打造更智能、更贴心AI的核心难题和发展方向。原文:leoniemonigatti.com/blog/memory-in-ai-agents.html
新浪微博 2025-11-22 00:00:00
6. AI时代,最不值钱的,就是重复劳动; 最值钱的,是你得熟练指挥智能体。#大咖观察 #红衣聊AI #硅谷 #智能体 #AI应用
抖音 2026-01-30 00:00:00
7. #一分钟视频创作季# Andrej Karpathy:高质量交互环境才是AI发展的沃土Andrej Karpathy 指出“当前 AI只是统计专家而非真正的思考者。”脱离真实交互的 AI 终将局限于模仿人类已知知识,而构建多样化高质量交互环境,才是突破这一困局的关键。Karpathy 强调的,AI需在类真实场景中试错学习。例如虚拟物理实验室需精准还原力学定律,分子模拟环境要符合化学反应规律,就像 AlphaGo Zero 的围棋环境虽为虚拟,却严格遵循真实棋规,才能孕育出超越人类的策略。若环境与现实脱节,AI 习得的能力将无法迁移到实际任务中。环境需覆盖多领域场景与难度层级,从基础操作到复杂决策形成完整训练链条。PrimeIntellect 的环境中心理念给出了绝佳范例:将教科书习题重构为可交互环境,既包含基础数学演算,也涵盖高阶物理实验。这种设计能让 AI 像人类一样循序渐进学习,避免因场景单一导致的能力固化。环境必须提供清晰、及时的结果反馈,这是 AI 调整策略的核心依据。AlphaProof 在数学环境中通过证明有效性即时判断行动价值,生成数百万条新证明,正是得益于明确的反馈机制。Karpathy 特别提醒,模糊的奖励函数会误导学习,因此反馈需如科学实验结果般可验证、可量化。环境能精准模拟现实、覆盖多元任务、提供明确反馈时,通用智能体的诞生才真正具备了土壤。#有点东西##AI创造营##微博兴趣创作计划# 种斌Marco的微博视频
新浪微博 2025-10-21 00:00:00
8. 发现一个调试LLM系统提示词的妙招,很简单但是很有用,不管你把LLM设计成工具调用还是结构化输出的Agent,当它输出不符合预期的时候,直接基于当前的历史记录问它:你为什么要这么做?它对于自己错误给出的分析是最准确的。
新浪微博 2026-01-20 00:00:00
9. 谷歌68页提示词圣经+老金原创元提示词,直接复制就能用
微信公众号 2025-12-07 00:00:00
10. 【告别Few-shot,自我验证才是AI准确性的未来】Meta AI研究人员发现了一种让大模型准确率提升94%的技术,而且完全不需要任何示例。这就是"验证链"(Chain-of-Verification,CoVe)。传统提示词的困境在于:大模型会产生幻觉,自信满满地给出完全错误的答案。Few-shot示例虽有帮助,但受限于示例选择、token预算,且依然无法根治幻觉问题。我们一直在治标,而非治本。CoVe的核心逻辑是让模型自己检验自己,分四步走:1. 生成初始回答2. 规划验证问题3. 独立回答这些验证问题4. 基于验证结果生成最终答案关键在于"独立"二字。模型单独回答每个验证问题,避免了循环论证——不再是为自己的第一个答案辩护,而是客观地核查它。生成与验证分离,这才是破局之道。实测数据:复杂问答准确率从68%跃升至94%,适用于GPT-4、Claude、Gemini等主流模型,无需微调,零样本即可生效。可以直接使用的提示词模板:[你的问题]请按以下步骤执行:1. 提供你的初始答案2. 生成3-5个能暴露答案错误的验证问题3. 独立回答每个验证问题4. 基于验证结果提供修正后的最终答案有人质疑这项技术早在2023年9月就已存在,为何现在才火。技术的价值不在于发明时间,而在于被真正理解和应用的时刻。也有人指出,说Few-shot已死有些夸张——在教模型语气和结构方面,示例仍有用武之地。这是进化,不是替代。更深一层看,这揭示了一个范式转移:从"给更好的示例"到"让模型更好地思考",再到"让模型学会自我怀疑"。真正的技能变成了:清晰描述任务,让模型思考,然后让模型质疑自己。AI准确性的未来,在于验证,而非生成。原文:x.com/godofprompt/status/2008125436774215722
新浪微博 2026-01-06 00:00:00
11. 什么是 AI 智能体?
知乎 2025-10-31 00:00:00
12. Cursor 如何将其编程智能体投入生产环境
知乎 2026-01-29 00:00:00
13. 登顶Hugging Face GAIA全球榜首!中兴超级智能体终结「AI黑盒」时代
知乎 2025-10-14 00:00:00
14. 继 Nano Banana 2 之后,国产 AI 生图又杀出「一致性标杆」,Vidu 生图限时无限免费
微信公众号 2025-12-01 00:00:00
15. 多智能体(multi-agent system)完整入门学习资料分享
知乎 2025-11-17 00:00:00
16. 论文 Fundamentals of Building Autonomous LLM Agents,系统性地梳理 “如何构建一个真正具备自主性的 LLM 智能体”,也就是从「语言模型」走向「智能体」(而不仅仅是增强的聊天机器人/工具调用系统)。论文提出希望解答以下几个研究问题(RQs): (1)设计空间(Design space):核心子系统(感知/推理/记忆/执行)有哪些可选方案?如何系统化组织? (2)子系统整合(Integration):在现实软件环境(比如 GUI、web 任务)中,这些子系统如何闭环协作? (3)推理效能(Reasoning efficacy):不同推理策略(如 Chain-of-Thought、Tree-of-Thought、并行规划等)对任务成功率、效率、成本有什么影响? (4)记忆影响(Memory impact):短期/长期记忆机制(例如 RAG、上下文管理)怎样提升模型在长时程任务或大上下文任务中的表现? (5)失败模式与缓解(Failures & mitigation):代理在哪些方面容易失败(如幻觉、GUI误定位、重复循环、工具误用)?有哪些缓解技术? (6)评估与泛化(Evaluation & generalization):有哪些基准/指标适用于评估此类代理?代理能在多任务、多界面条件下泛化吗?★ 核心架构论文将一个具备自主能力的 LLM 智能体拆解为以下四大模块:1. 感知(Perception)系统2. 推理/规划(Reasoning/Planning)系统3. 记忆(Memory)系统4. 执行(Execution)系 统★ 感知系统感知系统是智能体“看/听/感知环境”的部分。论文提及四种主要方式:文本感知、多模态感知、结构化数据/信息树感知、工具辅助感知。- 文本感知(Text-Based):环境以纯文本形式输入,LLM 直接处理。这种方式代价最低,但只适用于文本驱动的场景。- 多模态感知(Multimodal):环境包含图像/视频+文字,使用视觉‐语言模型(VLM)或多模态 LLM(MM-LLM)将视觉输入编码为与文本兼容的向量。- 结构化数据/信息树(Information Tree / Structured Data):例如 GUI 的 Accessibility Tree、HTML DOM 树,将界面元素结构化地输入模型。- 工具辅助感知(Tool-based):智能体调用外部 API/工具获取环境信息(如网页检索、数据库查询、传感器数据等)然后将结果反馈给 LLM。论文还指出感知系统的关键挑战:例如图像识别中模型可能“幻觉”对象、上下文窗口受限、高计算/延迟成本、数据收集困难等。★ 推理系统推理系统是智能体“思考/规划/决策”那部分。论文讨论了多种方法:- 任务分解(Task decomposition):把大任务拆成子任务。包括“先分解再规划”(Decomposition first)和“交错分解”(Interleaved decomposition)两类。- 多方案生成与选择(Multi-plan generation & selection):代理生成多个可能方案(如通过 Tree-of-Thought, Graph-of-Thought, LLM-MCTS 等)然后选择最优一个。- 反思(Reflection):智能体在执行后或执行途中反思自己的决策/行动,识别错误并改进。甚至“预反思”(anticipatory reflection)在执行前预测失败。- 多智能体系统(Multi-agent systems):将推理分为多个“专家”模块(Planning Expert、Memory Expert、Error Handling Expert 等),各司其职、协同完成。★ 记忆系统记忆系统使智能体不仅“即时反应”,还能“记住过去、用过去指导未来”。论文区分短期记忆与长期记忆。- 长期记忆(Long-term memory):如将经验固化、使用 Retrieval-Augmented Generation(RAG)从外部知识库检索、将结构化数据(如 SQL 数据库)用于查询。- 短期记忆(Short-term memory):通常是 LLM 的上下文窗口中的“当前任务状态”。- 应存储的数据类型:成功经验、失败经验、动作轨迹、环境反馈等。将“失败”经验也显式记录有助于避免重复错误。- 记忆系统的挑战包括:上下文窗口限制、检索噪声、长期记忆如何更新与维护、如何避免“记忆漂移”等。★ 执行系统执行系统是智能体“将内部决策落实为环境动作”的部分。论文谈到执行系统要支持工具调用、API/代码生成、物理操作、GUI 控制等。具体维度包括:- 工具与 API 集成(Tool and API Integration)- 多模态行动空间(Multimodal Action Spaces)——例如 GUI 控制、视觉界面操作、机器人控制、代码执行等。- 整合挑战(Integration Challenges)——例如如何让决策结果真正映射到动作、如何反馈结果、如何监控执行失败/成功。论文:arxiv.org/abs/2510.09244#ai创造营##程序员#
新浪微博 2025-10-27 00:00:00
17. 大模型能生成连贯文本,却出现与事实不符的“幻觉”或逻辑错误,是训练数据有偏差,还是架构无法真懂语义?
知乎 2025-10-17 00:00:00
18. 盘点一周AI大事(11月2日)|OpenAI放出AGI时间表 OpenAI公布AGI路线图,202626年上岗AI研究员,能独立研究大型科研项目,2028年发布重大科研成果达成AGI,10年内冲刺超级智能 OpenAI正式重组为营利实体,估值1万亿 MiniMax推出最强开源大模型M2 字节发布最强通用游戏智能体Game-TARS Anthropic推出Excel分析师 Gemini上线一键做PPT Odyssey发布能实时交互的视频模型Odyssey-2 Adobe推出一键P视频Frame Forward 科学家研发出热力学采样芯片架构TSU,能效提升1万倍 奥特曼押注非侵入脑机接口,用超声波直接读取意念 马斯克的脑机接口Neuralink即将开启人脑增强实验 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人
抖音 2025-11-02 00:00:00
19. Anthropic:高效构建 AI 智能体的上下文工程
知乎 2025-10-02 00:00:00
20. Gemini模型:对系统提示词理解能力差,调用工具塞的数据太多会坏掉胡言乱语输出乱码。Claude模型:对系统提示词理解能力强,但只要有工具就会优先调用工具试试不管你系统提示词怎么写的,如果调用工具的同时不要求结构化输出,还会把自己的推理直接漏出来。OpenAI模型:没有以上问题。
新浪微博 2025-12-17 00:00:00
21. 如何构建一个 AI 智能体构建 AI 智能体的核心,是打造一个能够感知、推理、行动并从环境中学习的智能系统。整个过程遵循一个有机的结构化流程,如下所示:1. 明确目标与环境首先要确定智能体的目标,以及它将运行的环境。示例:一个个人 AI 助手的目标可能是管理用户的日程,而它的运行环境则包括用户输入、日历系统和外部 API。2. 智能体核心(AI Agent Core)AI 智能体的核心由三个关键模块组成,这三部分共同驱动智能体的理解与决策能力。a. 感知模块(Perception Module)收集并解释来自各种传感器的数据,如摄像头、麦克风或 API 输入。将原始感知数据转化为可理解的有意义信息,例如文字识别、声音检测或物体识别。b. 认知与推理模块(Cognition & Reasoning Module)这是智能体的大脑所在,负责逻辑推理、模型分析和基于目标的决策。通过算法和 AI 模型分析环境状况,规划行动路径,并根据数据和目标做出判断。c. 行动模块(Action Module)执行已选定的行动,可通过机械臂、软件命令或 API 调用等方式实现。将决策转化为对现实世界或数字环境的具体操作。3. 传感器与执行器传感器用于从环境中采集数据(视觉、听觉或上下文信息)。执行器根据智能体的决策执行任务或响应。二者形成一个持续的“感知—行动”循环,使智能体能动态地与环境交互。4. 环境交互(观察 + 行动)智能体通过观察行动结果并从环境中收集反馈,来评估自身表现。这种反馈帮助智能体调整策略,优化未来的行动。5. 记忆与学习记忆与学习模块用于存储经验并不断优化模型。它维护一个可随观察与反馈而更新的知识库,使智能体能够具备自适应学习能力。随着时间推移,智能体会变得更聪明、更准确、更高效。6. 反馈与改进循环最后阶段是持续改进环节。智能体评估自身表现,更新内部模型,并优化决策机制以取得最佳结果。这种“感知—学习—改进”的循环构成了自我进化型 AI 系统的基础。★ 总结明确目标 → 感知 → 理解 → 推理 → 行动 → 学习 → 改进 → 重复这个循环使 AI 智能体能够从最初的简单自动化,不断成长为具有自主智能的系统。#人工智能##程序员#
新浪微博 2025-10-18 00:00:00
22. 如何为Agent编写高效的工具?
知乎 2025-09-13 00:00:00
23. Agent Skills使用指南:让AI智能体拥有“即插即用”的超能力
知乎 2026-01-27 00:00:00
24. PettingLLMs: 在verl的基础上支持通用的多智能体强化学习训练
知乎 2025-11-06 00:00:00
25. EMNLP 2025 | AgentThink:小模型大超GPT4o! 首个融合推理与工具调用的自动驾驶 VLM 框架
知乎 2025-09-08 00:00:00
26. Aivis 揭秘:从领域知识到自主智能,智能体 Agent 驱动下的阿里云服务新范式
知乎 2025-11-12 00:00:00
27. 豆包图像创作模型4.0:4个简单实操案例!主体一致素材轻松做
微信公众号 2025-09-14 00:00:00
28. 你最想让智能体机器人先帮你搞定生活,还是提升工作效率? #大咖观察 #ai新星计划 #红衣聊AI #机器人
抖音 2025-10-04 00:00:00
29. 泰山先进发布新一代具身智能体平台 重构城市数字与物理世界连接2025年12月,泰山先进技术团队正式推出具身智能体融合平台,通过“叙事-实体-融合”技术,将物理世界中的设备、人员、场景转化为可自主交互、协同的智能体,实现数字世界与现实场景的深度耦合。该平台核心特性包括三大创新:一是虚实融合的智能体模型,通过本体(物理实体)、实体(数字映射)、虚体(AI能力载体)三层架构,让路灯、环卫车、垃圾桶等设备具备拟人化对话与自主决策能力——例如灌溉设备可结合天气预报自动调整作业计划,智能厕所能实时反馈使用状态;二是生产关系约束机制,严格遵循现实场景中的组织规则(如环卫班组分工),确保智能体通信与协同符合业务逻辑;三是跨平台协同协议,突破现有MCD、API等协议限制,实现多行业智能体的无缝对接。目前平台已在智慧环卫领域落地验证,并快速扩展至农业(蔬菜大棚智能设备管理)、文旅(苏州平江路街区游客服务)等场景。其产品架构采用“双引擎”模式,在不改造客户现有业务系统的前提下,通过“智能体中间层”实现快速部署,支持SaaS与私有化两种模式。据团队透露,该技术与国务院《人工智能行动意见》中“设备与智能体融合”方向高度契合,未来将推动城市向“全要素智能体互联”的下一代互联网形态演进。相关技术细节可通过泰山先进公众号查询。
新浪微博 2025-12-16 00:00:00
30. 昨天这篇文章提到了强化机制(网页链接),此强化非彼强化,正好详细了解了一下。这里的强化机制并非机器学习领域的强化学习,而是一种为大模型注入额外提示、补全上下文、修正轨迹的工程技巧。它的核心目标是让 Agent 在多步任务中保持方向稳定、决策一致。1. 解决什么问题?当 Agent 需要处理复杂的多步骤任务,模型常常出现以下问题:1) 工具报错后无法正确恢复当错误信息过长或过几轮后被遗忘时,模型会继续产生无效输出。2) 忘记初始目标在长上下文中,模型会偏向于处理眼前的文本,而不是任务本身。3) 被工具输出的噪声误导许多系统的工具输出不够结构化,模型难以正确解析。4) 循环行为模型可能重复调用相同工具,或重复生成相同解释。2. 什么是强化机制?为了让 Agent 能够顺畅执行任务,工程实践中逐渐形成了一种关键方法,即“强化机制(reinforcement)”。强化机制通常包含三类信息:1) 原始工具输出2) 对工具输出的解释、总结或结构化处理3) 针对任务目标的提醒、下一步行动建议或错误纠正提示这种方式让模型在下一轮推理时,不仅知道发生了什么,还知道应该如何继续。3 强化机制是如何运作的?为了说明强化机制如何发挥作用,可以将 Agent 的通用循环简化为四个阶段:1) 用户或系统提出任务2) 模型给出行动(如调用工具或生成内容)3) 工具返回结果4) 系统将结果整理后重新注入模型,让模型继续强化机制作用在第四阶段,它通过人工设计“强化后的上下文”结构,让模型更理解状态,也更容易走上正确路径。一个典型的强化注入可能包含:1) 工具原始输出2) 提炼后的关键点3) 关于失败原因的简要解释4) 明确提示模型下一步应该做什么5) 任务目标的提醒4 强化机制的常见形式在实际系统中,强化机制可以通过多种形式实现:1) 结果总结将工具输出的关键部分提炼为简短段落,让模型更容易解析。2) 错误解释遇到报错时,用自然语言告诉模型:错误原因是什么,应该如何修复。3) 结构化状态把工具状态包装成 JSON 或结构化文本,让模型减少解析错误。4) 目标重申在任务进行多轮之后,重新提醒模型最终目标是什么。5) 自我检查(Self-Check)让模型根据当前状态生成“我下一步应该做什么”的列表,并在下一步回显给自己。6) 路径规划在关键步骤加入“你已完成哪些步骤,还剩哪些步骤”的信息。这些设计本质上都是为了让模型更容易维持任务链路。5 如何设计一个高质量强化机制?如果你正在构建自己的 Agent,可以遵循以下设计原则:1) 状态必须清晰不让模型自己推理上下文,而是直接告诉它关键点。2) 信息必须简短强化信息越长,越容易被淹没在上下文中。3 )错误必须显式解释模型在理解错误时的鲁棒性很差,需要手工解释。4) 目标必须持续提醒尤其是超过三轮的任务,不提醒必偏航。5) 工具结果必须被结构化能 JSON 就不要纯文本。通过这些工程技巧,可以显著提升 Agent 的稳定性。#微博兴趣创作计划# #人工智能#
新浪微博 2025-11-29 00:00:00
31. 是什么原因让某知名AI大模型向我跪着道歉?正在听罗振宇的年度演讲,今年主题是吹AI,于是我顺便让某头部大模型“复盘一下今日股市”,怎么说呢?AI每次回答都有低级错误,简单的统计会算错,日期会搞错(竟然包含2024年12月31日的数据),已经退市的股票AI告诉我今天是涨停,今天没有涨停的股票它说连板……我已弃疗……
新浪微博 2025-12-31 00:00:00
32. 从“工具过载”到“精准调用”:破解 Agent 工具管理难题
知乎 2026-01-28 00:00:00
33. 关注 | Cell子刊系列综述:医疗AI智能体,从临床应用,到建立AI智能体医院
微信公众号 2025-09-29 00:00:00
34. 锁死一致性!Vidu Q2「参考生」可算来了,新功能强到离谱,APP全面进化
知乎 2025-10-21 00:00:00
35. AIED101|教师如何训练教育智能体
微信公众号 2025-10-01 00:00:00
36. AI智能体也卷起来了?又懂业务又不用搭工作流…
哔哩哔哩 2025-12-31 00:00:00
37. #DeepSeek新模型有多猛#大模型的优秀与否,重点的看的是推理的过程中是死记硬背还是举一反三,DeepSeekMath-V2通过验证器与生成器的协同循环和元验证机制,实现了举一反三的的能力,通过逐步检查证明过程,确保推理的严谨性和完整性。改变了过去大模型只能通过强化学习和调用结果这个死记硬背的方式。DeepSeekMath-V2生成器通过高质量证明和有缺陷的证明来推理一个定理的严谨性,并利用这种自我认知系统地改进DeepSeekMath-V2的数学推理能力,提高定理的推理能力,让模型可以做到知其然知其所以然。大模型的幻觉问题一直都是大模型无法避免的问题,减少大模型的幻觉也就成了衡量大模型的一个重要指标,因为解决了幻觉问题就可以在推理领域能够提供更准确、更可靠的结果。DeepSeekMath-V2大幅减少了大模型幻觉,就避免了通用大模型可能出现的错误推理和不准确答案,提高了模型在实际应用中的可信度和可用性。#科技先锋官##AI创造营#
新浪微博 2025-11-28 00:00:00
38. #科技先锋官# OpenClaw 智能体重磅突破!无需编程,靠自然语言就能像人一样操控电脑,办公文档处理、跨工具协同、定制化操作甚至代码开发都能搞定,彻底打破 AI 只懂对话的局限,直接从对话工具升级成自主执行体!有人慌了:客服、数据录入等基础岗要被全面取代?打工人真的要失业了?但真相没那么简单!它淘汰重复性工作的同时,也催生了 AI 训练师、智能体管理者等新职业,把人从繁琐事务中解放,转向更有价值的创造性工作。AI 到底是抢饭碗的 “对手”,还是解放双手的 “帮手”?办公模式即将被颠覆,你的岗位会受影响吗?评论区聊聊你的看法!#微博超有用视频大赛##上微博涨知识##AI生活指南# 种斌Marco的微博视频
新浪微博 2026-02-05 00:00:00
39. Shopify:构建生产级智能体系统的经验
知乎 2025-09-16 00:00:00
40. 图解 AI 智能体的上下文工程
知乎 2025-09-24 00:00:00
41. AI 智能体上下文工程 4 大核心策略,拯救大模型的「金鱼记忆」!
知乎 2025-09-13 00:00:00
42. 同一个prompt重复多次输入进 LLM,为啥得到的输出都不一样?
知乎 2025-12-13 00:00:00
43. AgentRun 深度解析:阿里云函数计算 FC 如何构建企业级 Agent 的“生产力引擎”?
知乎 2025-12-15 00:00:00
44. “见人下菜”!AI大模型的“分裂难题”
知乎 2025-12-04 00:00:00
45. 智能体即开发者:论AI如何重塑编程边界与人机协同未来
知乎 2026-01-06 00:00:00
46. 2025 智能体工程现状
知乎 2025-12-23 00:00:00
47. AI智能体时代,职场规则已不同以往。 想成为赢家,关键在于找准自己的位置。#大咖观察 #红衣聊AI #智能体
抖音 2025-11-06 00:00:00
48. 通俗易懂的解释 LLM,RAG 和 AI Agent 的差别,以下内容为原推的翻译:我终于明白了LLM、RAG和AI智能体的区别过去两年里,我一直在搭建真正落地的AI系统。现在,我终于清楚了:LLM(大语言模型)、RAG(检索增强生成)和AI智能体(AI Agents),根本不是互相竞争的技术,而是构成同一个AI智能系统的三个层次。很多人用错了方法,把它们当成互斥的工具。---> 大语言模型是“大脑” <LLM 就像AI的脑子,它会思考,会写作,也懂语言。但问题来了:它是冻结在某个时间点的。比如 GPT-4,它的知识截止到训练结束的那一天。你问它昨天的新闻发生了什么?那可就瞎编了。大语言模型很聪明,但却不了解“现在”正在发生的事。---> RAG是AI的“记忆” <这时候就需要 RAG(Retrieval-Augmented Generation,检索增强生成)了,它相当于给大脑接入了“外置内存”。当你提问时,RAG会先去外部数据库或文档里搜索,把相关资料抓出来,再丢给大语言模型作为上下文。这样一来,原本静态的模型一下子就“活”了:- 有最新的数据- 有真实的事实- 完全不需要重新训练模型最关键的是,准确率立刻就提高了。大语言模型不用再靠记忆乱猜,而是真正地在实时检索到的信息上进行推理。你甚至还能追溯每个答案到底用了哪些文档。---## > AI智能体是AI的“行动力” <尽管LLM能思考,RAG能提供新鲜的数据,但它们都缺乏真正的行动能力。这时,AI智能体(AI Agents)出场了。它在大语言模型的外面套上了一个控制循环:- 设定目标- 规划步骤- 执行行动- 回顾反思AI智能体并不仅仅是回答问题那么简单,它能自主地去研究一个话题、收集数据、撰写报告,甚至帮你发邮件,全程自动化。---> 真正的生产级AI,要同时用好这三者 <很多酷炫的AI展示,其实只是单纯用了LLM再配上花里胡哨的提示词。但真正能落地的AI系统,往往同时结合了这三个要素:- LLM 提供推理和思考能力- RAG 确保知识准确而新鲜- AI智能体 则提供行动和决策能力---> 如何选用这三者? <- 只用LLM 如果你需要纯语言的任务,比如写作、摘要、解释。- LLM + RAG 如果你需要回答涉及特定文档、技术手册、专业领域知识的问题,并确保答案准确无误。- LLM + RAG + AI 智能体 如果你需要真正的自主行动,比如系统自己决策、执行任务、管理复杂流程。---> AI的未来,不是选哪一种,而是如何把这三层架构起来 <记住这个公式:- LLM负责思考- RAG负责知识- AI智能体负责行动真正的AI智能系统,就是这三者协同起来,形成一个完整的智能架构。来源:x.com/connordavis_ai/status/1985663551697273216
新浪微博 2025-11-06 00:00:00
49. #小米发布国内第一个手机版龙虾##小米miclaw开启封测#养龙虾的风还是吹到了手机上,小米的下场算是打了开门红。 小米Xiaomi miclaw封测可以说是国内手机厂商在AI系统级执行能力上的重要突破。它基于MiMo大模型,探索大模型在“人车家全生态”下的系统级执行,这就意味着AI从对话交互向主动执行的智能体迈进。小米选择小规模灰度测试,既保障技术迭代,又保证了用户体验,为全场景智能生态奠定了基础。
新浪微博 2026-03-06 00:00:00
50. Anthropic的Agent上下文工程官方指南来了!
知乎 2025-10-02 00:00:00
51. Agent常见面试题:LLM 是如何学会调用外部 API 或工具的?1 训练数据让模型先“知道工具是怎么用的”在模型具备工具调用能力之前,它必须先在训练数据里看到足够多的工具调用示例。通常包含两类数据:1)真实 API / 工具调用代码或文档,例如:a. “要获取天气,请调用 get_weather(city=...)”b. “要计算数学表达式,请调用 calculator(expression=...)”2)人类标注或模型生成的“对话 + 工具调用”示范,例如:a. 用户问:杭州天气如何?模型示范:调用 tool.get_weather({city:"杭州"})再根据工具返回的结果继续回答。通过这些示例,LLM 学会了:什么问题对应调用什么工具;工具调用的格式是什么;什么时候不该调用工具。2 监督学习(SFT)使模型学会“根据指令选择工具”在 Fine-tuning 阶段加入大量的示例:1)该调用工具的场景2)不该调用工具的场景3)多工具协作场景例如:用户问「告诉我台北到上海的机票价格」。正确示例:a. 模型判断这需要实时信息b. 模型调用 flight_search API模型学习到:当遇到“需要外部信息/计算能力”的问题时,应倾向调用工具。3 通过 RLHF 让模型“偏好正确的工具调用行为”强化学习阶段会奖励:1)正确调用工具2)不乱调用工具3)工具调用后能给出正确结果惩罚:1)不必要的调用2)调用错误的工具3)调用格式不正确这一步让模型不仅会“模仿”,还会“懂得什么时候该调用工具”。4 ReAct / 规划式数据让模型学会 “推理后再决定工具”许多训练数据采用 ReAct 风格:1)模型先思考:要不要调用工具?2)再决定工具调用3)执行后再继续思考与回答这种数据让模型具备:1)任务分解2)长链路推理3)工具调用规划最终效果是:面对复杂任务,模型不会盲调,而是自行形成“推理 → 调用 → 再推理”的结构化流程。5 架构层提供“可调用工具的接口”现代 Agent 框架都会在推理阶段给模型提供一个结构化 schema:1)告诉模型有哪些工具2)告诉模型调用格式3)告诉模型每个字段是什么类型这样模型在生成内容时不需要“猜”,而是严格遵循系统提供的 schema,直接输出可执行的 JSON 或结构化调用指令。例如:1)系统提供工具:search(query: string)2)模型内部只需决定:要不要调用?,以及 query 内容是什么。6 推理时的实际行为:模型并不真的“执行工具”,而是生成结构化调用请求推理时发生的事情是:1)模型生成 JSON 指令,例如:{"tool":"search", "query":"杭州天气"}2)外部系统执行工具并将结果返回3)模型继续根据工具结果生成下一步行动或最终答案模型本身没有执行能力,它只是生成符合 schema 的字符串而已。总结LLM 学会调用外部 API / 工具,是一个“示例训练 + 强化学习 + 架构支撑 + 推理策略”组合的结果:1)先在数据里看到大量工具调用示范2)通过 SFT 学会该如何调用3)通过 RL 学会什么时候应该调用4)通过 ReAct 学会任务分解与步骤规划5)通过 functions/schema 让调用标准化因此模型看起来像真的“理解工具”,但本质是根据统计学习到的模式生成结构化指令。#ai创造营# #程序员#
新浪微博 2025-12-10 00:00:00
52. 智能体设计模式总结
知乎 2026-01-12 00:00:00
53. AI Agent最新重磅综述:迈向高效智能体,记忆、工具学习和规划
知乎 2026-02-03 00:00:00
54. 360纳米AI的“多智能体蜂群引擎”如何为智能体时代铺设高速公路?
微信公众号 2025-09-28 00:00:00
55. 快抄作业!我用JoyAgent搞了个AI团队 2025年都快结束了,Agent是不是还没用上? 我找到了打工人用上智能体的最简单方法, 就是用JoyAgent把每天重复的SOP全做成Agent, 不懂代码也能零门槛搭建,而且效果很稳定。 看着AI团队全自动打工、出活,非常解压。 #AI #智能体 #JoyAgent #JoyCode #京东云
抖音 2025-11-05 00:00:00
56. #天禧AI从助手到队友#今日,以“聚力智能体,共启新生态”为主题的2025联想天禧AI生态伙伴大会在京召开。大会聚焦智能体驱动下的个人AI未来,与生态伙伴共探体验升级与商业落地。大会核心揭示了天禧AI从“助手”到“队友”的关键跃迁。当前的天禧AI 3.5,凭借全时空主动记忆与全域个人知识库,首次构建了统一的个人知识图谱,实现了真正的个性化。更引人注目的是其行动力的飞跃:通过MCP技术及智能体协同架构,它能像“总指挥”一样安全调度多个领域智能体,协同完成复杂任务闭环。本次大会前瞻性勾勒了天禧AI 4.0的演进方向,朝着“思你所想,行你所愿”的认知与行动智能迈进。联想正携手生态伙伴,加速将更懂用户、更能执行的“个人AI双胞胎”带入现实。
新浪微博 2025-12-26 00:00:00
57. #DeepSeek推出新模型#DeepSeekMath-V2的发布,为AI数学推理开辟了“严谨性优先”的新赛道。摒弃单纯追求答案正确率的传统思路,其创新的自我验证框架,通过LLM验证器审查推理链条、生成高难度样本迭代优化,精准破解了数学推导“重结果轻过程”的行业痛点。在IMO、CMO等顶级赛事中斩获金牌,普特南竞赛近乎满分的成绩,印证了这一路径的可行性。对定理证明等需严密推导的任务而言,这种“自我纠错”能力让AI不再是“黑箱解题”,而是具备了可追溯、可验证的理性思维。AI数学智能的核心价值,不仅在于攻克难题,更在于建立可靠的推理逻辑。DeepSeekMath-V2的突破,为构建更强大的数学智能系统提供了关键支撑,也为AI在科研、工程等精密领域的应用打开了更广阔的空间。#秒懂热点就用智搜# deepseek推出新模型
新浪微博 2025-11-28 00:00:00
58. Anthropic 官方教程:为 Agent 设计高效工具的最佳实践
知乎 2025-09-12 00:00:00
59. 构建专业智能体:从通用 AI 到企业级应用的工程化实践
知乎 2026-02-15 00:00:00
60. 真·AI新物种诞生 智能体超级影音机器人颠覆式登场 传统视听设备要过时了?!#BUTTONS##智能奢品##BUTTONSSOLEMATE##TERMINUS特斯联##超级影音机器人##AI智能体##ai##INTELLIGENTLUXURY##HALI# 科技最前线的微博视频
新浪微博 2025-10-23 00:00:00
61. 你还在用旧思维与AI打交道吗? #大咖观察 #红衣聊AI #AI时代 #智能体 #大模型
抖音 2026-01-22 00:00:00
62. #AI手机被豆包带火了吗# 其实最近各家厂商发布的新手机都加入了AI功能,都宣称是AI手机。豆包AI手机的发布,核心卖点是AI Agent系统级操作,是系统级AI嵌入,成为了更智能的手机AI助手,能实现了系统级权限调用,能模拟真人操作屏幕、跨应用完成复杂任务,这应该是豆包AI手机的爆火的关键。但是由于豆包AI需要深度调用手机应用权限,这就会引发隐私安全问题,上线后迅速遭遇微信、阿里系等应用的限制,热度更多停留在“尝鲜”与“话题”,未能形成规模化普及,豆包AI手机只能说方向是对的,但路还长,还需时间沉淀与迭代,你们觉得呢?
新浪微博 2025-12-10 00:00:00
63. 厉害了, 这个作者用 10 个 Clawdbot (OpenClaw) 搭建了一个 Mission Control 的 AI 智能体团队。该系统通过在服务器上运行多个独立的 AI 会话,为每个智能体赋予了独特的性格和专业职能,使其能够像真实团队一样协作。为了解决 AI 缺乏长期记忆的问题,作者设计了基于文件的持久化存储机制和每 15 分钟一次的心跳任务循环,确保智能体能自动检查工作进度。核心架构还包括一个基于 Convex 开发的共享协作平台,让不同智能体能通过任务板、评论区和 at 功能进行跨角色沟通。这种模式将 AI 从简单的问答工具转变为能够自主处理研究、写作和开发任务的高效生产力集群。最后,作者还总结了从规模化管理到成本控制的实战经验,强调了明确角色分工与共享上下文在多智能体系统中的重要性。访问:x.com/pbteja1998/status/2017662163540971756#HOW I AI# #程序员#
新浪微博 2026-02-02 00:00:00
64. 让AI智能体拥有像人类的持久记忆:基于LangGraph的长短期记忆管理实践指南网页链接 如何让AI智能体(Agent)像人类一样拥有持久的记忆,从而在复杂的连续任务中保持上下文感知和深度理解?这已成为构建高级智能体的核心挑战。本文将深入探讨Agent Memory的核心概念,并聚焦于LangGraph框架下的长短期记忆实现,详解短期会话与长期知识的存储、管理、语义检索等技巧。更进一步地,我们将通过一个引入MCP协议的实战案例,手把手带你构建一个真实的融合长记忆机制的Multi-Agent系统,直观展示中断、记忆与协作的融合。
新浪微博 2025-12-12 00:00:00
65. 如何高效的长时间运行智能体
知乎 2026-02-03 00:00:00
66. 在失败中进化?UIUC联合斯坦福、AMD实现智能体「从错误中成长」
知乎 2025-11-07 00:00:00
67. Memp框架让AI智能体的“肌肉记忆”觉醒
小红书 2025-09-24 00:00:00
68. AI智能体的“记忆管理”艺术
今日头条 2026-01-12 00:00:00
69. 智能体「行动后反思」的自动化
微信公众号 2025-12-18 00:00:00
70. Day 12|智能体的“自主纠错系统”
知乎 2025-12-08 00:00:00
71. 如何评价智能体的“悔改机制”?这是否是将其发展为可信长期服务的关键?
知乎 2025-12-28 00:00:00
72. AI智能体获得"记忆"
今日头条 2025-10-10 00:00:00
73. 智能体搭建中的常见工程问题与纠正路径
知乎 2026-02-05 00:00:00
74. 调试智能体比调试分布式系统还难
知乎 2025-12-13 00:00:00
75. 哈工大深圳团队重大突破
哔哩哔哩 2026-02-28 00:00:00
76. 为什么你的 AI Agent 总是半途而废?Anthropic 给出了工程解法
知乎 2026-01-01 00:00:00
77. 百度打败谷歌!开源智能体LoongFlow
小红书 2026-01-02 00:00:00
78. 循环反馈机制
微信公众号 2026-01-03 00:00:00
79. 通向新世界大门(二) 大语言模型的核心缺陷
知乎 2025-11-07 00:00:00
80. 🔥谷歌AI竟能从失败中学习,性能持续提升
小红书 2025-10-02 00:00:00
81. 我们分析了谷歌和斯坦福的前沿AI研究,发现了5个颠覆你认知的智能体学习秘诀
哔哩哔哩 2025-10-13 00:00:00
82. MIT&微软
小红书 2025-12-27 00:00:00
83. 自我进化 LLM Agent 的 “误进化” 风险
小红书 2025-10-06 00:00:00
84. 新发现!你的AI智能体可能正在“错误进化”
小红书 2025-10-07 00:00:00
85. 分享前沿技术
小红书 2025-11-05 00:00:00
86. 循环制胜
知乎 2026-01-17 00:00:00
87. AI智能体在实际应用中遇到的问题
微信公众号 2025-11-17 00:00:00
88. 如何让小模型推理100万步都不出错?Idea很简单,单步投票即可! (论文总结|Insights)
知乎 2025-11-17 00:00:00
89. 大模型训练-推理不一致问题的本质与解决之道
知乎 2026-01-22 00:00:00
90. AI面试题
微信公众号 2025-12-08 00:00:00
91. 日志易产品VP饶琛琳
知乎 2025-09-12 00:00:00
92. AI 智能体高可靠设计模式
知乎 2026-01-12 00:00:00
93. 智能体的测试指标与评价方法
微信公众号 2025-12-18 00:00:00
94. 从会聊天到会办事
知乎 2025-10-02 00:00:00
95. 智能体偷懒怎么办?Dr. MAMR框架解决多智能体推理中的“懒惰智能体”问题!
微信公众号 2025-11-08 00:00:00
96. Google研究
微信公众号 2026-01-21 00:00:00
97. 补齐OpenClaw进化拼图!AReaL v1.0开源,智能体强化学习一键接入
今日头条
98. 大模型知道自己在瞎说,但是无法停下来!
今日头条 2025-11-07 00:00:00
99. 全球巨头官宣!大模型运维网络准确率不足50%,地狱级挑战开启!
今日头条 2026-01-28 00:00:00
100. Clawdbot一直显示初始化怎么解决 Clawdbot故障排除指南【最新】
101. AI大模型集体失智回答错误的一些问题
知乎 2025-10-10 00:00:00
102. (最全)32个AI提示词技巧
微信公众号 2025-11-14 00:00:00
103. 【OpenAI中文文档】自我演进的智能体一自主式重训练#1
知乎 2025-11-11 00:00:00
104. AI智能体:从“工具”到“大脑”,你的AI助手正在升级!
微信公众号 2025-11-08 00:00:00
105. 【09-23】自动化检测AI智能体错误的评估工具
微信公众号 2025-09-25 00:00:00
106. 初识智能体(Agent)
知乎 2026-02-28 00:00:00
107. Gemini 3 大面积“复读机”Bug
小红书 2025-11-22 00:00:00
108. 关于在智能体开发中工具节点的返回值处理
知乎 2025-09-20 00:00:00
109. AI智能体面临挑战及适用场景
今日头条 2025-09-28 00:00:00
-
罗永浩怒斥电视机厂商:不毁灭没天理!170 539 -
评论有奖|这几件夏季洗护小事全网愣是争了好几年,今天一次性说清楚150 378 -
快把随手买的套套扔掉!赤尾这三款王炸,解锁情侣完美亲密体验226 143 -
韩路谈携程被罚51.79亿:家里三个手机 自己级别最高价格却最贵108 265
已收藏
去我的收藏夹