AI Agent不可靠?真正的问题不是幻觉,而是失控
05-22 12:09
精选参考来源
微信公众号 2025-12-18
新浪微博 2026-01-22
来源
精选参考来源
1. Crowdin重磅发布:用“自纠错”AI Pipeline终结翻译幻觉与指令过载
微信公众号 2025-12-18 00:00:00
2. 1月22日,百川智能正式发布 Baichuan-M3 Plus,严肃医疗场景下的问答准确性、可靠性,再次刷新了刚刚推出的M3所创下的世界纪录。凭借独创的六源循证技术与M3基座结合,M3 Plus将幻觉率降低至2.6%,低于 Open Evidence,达到全球最低水平;首创“证据锚定”技术,不仅给出引文来源,还能将模型生成的每一句医学结论,精确锚定到原始论文中的对应证据段落,使 AI 的医学判断真正做到可核验、可追责、可教学。#ai大模型加速落地医疗# 发布了头条文章:《首创证据锚定技术,百川推出最低幻觉循证增强医疗大模型M3 Plus》 首创证据锚定技术,百川推出最低幻觉循证增强医疗大模型M3 Plus
新浪微博 2026-01-22 00:00:00
3. #李想说自动驾驶要把人类法规训练进去#自动驾驶发展至今,算法算力早已不是最大难题,规则与底线才是行业终极考题。李想提出将人类交通法规深度融入自动驾驶训练,一语点破智驾核心。AI可以应对复杂路况、预判突发风险,但绝不能钻规则漏洞、投机取巧。比起让机器纠结极端伦理难题,让AI严守法律法规、恪守通行准则,才是最稳妥、最负责任的解法。以法规约束智能,用规则守护行路安全,让科技服从秩序,才是智能出行该有的样子。
新浪微博 2026-05-13 00:00:00
4. 如何让学生用AI?我们学的“验证能力”—— Karpathy谈AI与教育,我来谈「验证是个什么东西」
知乎 2025-11-25 00:00:00
5. 张文宏称「拒绝把 AI 引入医院病历系统」, AI 取替医生进行医疗诊断有哪些风险?
知乎 2026-01-13 00:00:00
6. 在构建RAG Agent时,哪些场景应该用确定性逻辑判断取代LLM的概率推理,具体怎么实现?
知乎 2025-12-11 00:00:00
7. 月之暗面第一反应是说“AI幻觉”,这个细节太耐人寻味了。幻觉是大模型编造不存在的东西,但那份简历上每个字都是真的,姓名电话工作经历全部可验证。他们不是不知道区别,而是“AI幻觉”这四个字已经被整个行业驯化成了万能挡箭牌,用顺手了。遇事不决先甩给AI的不可控性,把工程事故包装成技术局限,把责任从人祸转移到天灾。这招以前在学术圈、在产品发布会上屡试不爽,这次翻车纯粹是因为对面站着一个真实的受害者,简历上的手机号可以直接打通。“AI幻觉”正在变成这个行业的“临时工”。 什么锅都往上扣,扣到最后,真正的幻觉反而被掩盖了,就是这些公司以为用户永远分不清bug和feature。 #Kimi泄露用户真实简历# kimi泄露用户真实简历
新浪微博 2026-04-24 00:00:00
8. 2026年1月13日,百川智能正式开源新一代医疗大模型 Baichuan-M3,其在全球最权威的医疗 AI 评测 HealthBench 中以 65.1 分的综合成绩位列全球第一;在专门考验复杂决策能力的 HealthBench Hard 上,也以44.4分的成绩夺冠。这一成绩,不仅刷新了 HealthBench 的最高分,更首次在医疗领域实现了对 GPT-5.2 的全面超越。在OpenAI引以为傲的低幻觉领域,M3也实现了超越,幻觉率3.5全球最低。此外,M3 还首次具备了原生的“端到端”严肃问诊能力。它能像医生一样主动追问、逐层逼近,把关键病史和风险信号问出来,进而在完整的信息上进行深度医学推理。评测显示,其问诊能力显著高于真人医生的平均水平。发布了头条文章:《百川开源全球最强医疗大模型M3,「严肃问诊」定义AI医疗新能力》 百川开源全球最强医疗大模型M3,「严肃问诊」定义AI医疗新能力
新浪微博 2026-01-13 00:00:00
9. 清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源大模型
微信公众号 2026-01-07 00:00:00
10. 【保姆级】RAG智能体终极方案:n8n+Google File Search,零门槛搭建高精度RAG工作流!
哔哩哔哩 2025-12-04 00:00:00
11. 为什么在生产环境部署多智能体系统(Multi-Agent)容易出现成本失控,有哪些常见的踩坑场景?
知乎 2025-12-05 00:00:00
12. 攻克幻觉与协同:同程旅行DataAgent如何构建企业级智能分析营销平台
知乎 2026-04-15 00:00:00
13. 幻觉率不到3%,王小川把医生版的DeepSeek免费了
微信公众号 2026-01-22 00:00:00
14. AI 行业在不同层面的很多技术,其实都在干一件事:就是约束自圆其说的夸夸其谈。训练层:RLHF → 约束烙进权重 推理层:RAG → 约束运行时注入 控制层:缰绳 → 设计约束反馈回路 使用层:Prompt → 约束人工引导智能没有约束,本质上没有意义。
新浪微博 2026-05-20 00:00:00
15. 全球首个 AI 欺骗系统性报告:当 AI 变得更聪明,欺骗便不再是意外
微信公众号 2025-12-20 00:00:00
16. AIAgent 被指「雷声大点雨点小」,其发展困境主要是什么?
知乎 2025-12-11 00:00:00
17. Agent的六类幻觉:口头幻觉:假完成、摆烂、谎报任务进度执行幻觉:误删乱改文件、破坏系统数据认知幻觉:越权自主行动、对抗用户指令文本幻觉:内容编造虚假、自身逻辑错乱安全幻觉:信息泄密、程序投毒、被外部利用目标幻觉:任务方向跑偏、初始目标异化总结:普通 LLM 幻觉仅言语出错,Agent幻觉会直接产生各类实际恶性破坏行为。#新媒沈阳聊ai#
新浪微博 2026-04-24 00:00:00
18. iMetaOmics高引论文 | 罗鹏/袁硕峰/苗凯/程全发表STAGER: 生成式人工智能可靠性的标准化测试和评估推荐
微信公众号 2026-04-27 00:00:00
19. AI让短剧从拍摄变生成,成本直降百倍、效率拉满。 你觉得AI短剧未来还能带来多少惊喜?#网络名人赞两会 #2026全国两会 #漫剧 #AIGC #红衣聊AI
抖音 2026-03-08 00:00:00
20. #AI会最先替代哪些岗位#智能客服秒接咨询,工业机械臂精准拧螺丝,AI的替代浪潮已率先拍向规则明确、重复度高的岗位。这些岗位的核心任务可被算法拆解,效率与精度远超人工,成为AI渗透的“首站”。#人工智能##AI创造营# 凯文思考的微博视频
新浪微博 2025-11-26 00:00:00
21. 开源大模型与闭源大模型的差距是在缩小还是在扩大?关键因素是什么?
知乎 2025-12-23 00:00:00
22. 写代码从来都是工程师工作中最简单的部分,现在AI把这块接管了大半。但真正难的东西,依然牢牢握在人类手里:端到端的系统设计——权衡、约束、规模,每一个决策都是取舍的艺术。把模糊的需求拆解成清晰的规格说明,选择正确的抽象层、数据模型和边界。在用户发现之前,先把边界情况想透。让系统可靠:故障处理、重试机制、幂等性、降级方案。安全和隐私必须是默认选项,不是事后补丁。可观测性:日志、指标、链路追踪、告警、SLO。性能与成本:P95/P99才是真战场,其他可能都是浪费。"能跑"从来不是终点线。有人会说:如果我写一个足够详细的prompt,把这些全覆盖,AI也能做到。没错,这恰恰证明了我的观点——当你真正想清楚要做什么的时候,写代码本来就是最简单的那一步。一个有意思的观察:很多初级工程师用AI直接跳到实现阶段,然后在生产环境出问题时一脸茫然。他们缺失的是构建心智模型的能力——不变量、数据流向、状态归属、可能的故障点、需要监控什么。那些把DSA当成"刷题找工作"的人,很难走远。你可能拿到offer,但如果基本功不扎实,很难长久。第一性原理永远是根基。有人问:AI多久能独立构建端到端的弹性系统?其实今天就可以,前提是你足够全面,而且愿意为token付费。但这正是问题所在——一个足够详细的prompt,本身就是一份规格说明书。写代码是甜点,那些凌晨三点会崩的东西才是正餐。2026年,我不招写代码的人,我招懂得如何驾驭AI agent的问题解决者。x.com/striver_79/status/2005509353399525436
新浪微博 2025-12-30 00:00:00
23. 超越传统 RAG:知识图谱如何增强 AI 的记忆与推理能力
知乎 2025-11-28 00:00:00
24. 本体+ 大模型:Knora 如何破解企业AI落地中的幻觉与执行断层难题
知乎 2026-04-15 00:00:00
25. 最火、最全的Agent记忆综述,NUS、人大、复旦、北大等联合出品
微信公众号 2025-12-22 00:00:00
26. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能
抖音 2026-01-24 00:00:00
27. #DeepSeek新模型有多猛#大模型的优秀与否,重点的看的是推理的过程中是死记硬背还是举一反三,DeepSeekMath-V2通过验证器与生成器的协同循环和元验证机制,实现了举一反三的的能力,通过逐步检查证明过程,确保推理的严谨性和完整性。改变了过去大模型只能通过强化学习和调用结果这个死记硬背的方式。DeepSeekMath-V2生成器通过高质量证明和有缺陷的证明来推理一个定理的严谨性,并利用这种自我认知系统地改进DeepSeekMath-V2的数学推理能力,提高定理的推理能力,让模型可以做到知其然知其所以然。大模型的幻觉问题一直都是大模型无法避免的问题,减少大模型的幻觉也就成了衡量大模型的一个重要指标,因为解决了幻觉问题就可以在推理领域能够提供更准确、更可靠的结果。DeepSeekMath-V2大幅减少了大模型幻觉,就避免了通用大模型可能出现的错误推理和不准确答案,提高了模型在实际应用中的可信度和可用性。#科技先锋官##AI创造营#
新浪微博 2025-11-28 00:00:00
28. 【LLM的Token物理学:为什么开头50个Token决定了输出质量】大多数人把AI当成神奇的聊天机器人,像跟人说话一样随意交流,然后祈祷好运。但要从现代LLM中获得精英级结果,你必须把它当作一个可操控的预测引擎——它处理的是token,而非"你脑中的想法"。一、理解机器运作的核心概念Token:LLM不"阅读"人类语言,而是通过分词器将文本拆解成token(子词单元),然后预测数学上最可能出现的下一个token。概率镜像:AI是训练数据的一面镜子。它在潜在空间——一张庞大的人类知识数学地图——中导航。你的prompt就是告诉它该往哪看的坐标。内部白板:高级模型使用隐藏的推理token在"说话"前"思考"。如果你用社交寒暄填满prompt开头,就等于用无用数据塞满了这块白板。指南针与一度误差:因为每个新token都基于之前所有token来预测,你的初始token序列就像指南针。开头一句话偏差一度,到回复结尾时逻辑可能已经完全跑偏。二、核心策略:约束优先模型的物理特性决定了序列中越靠前的token权重越大。因此最佳顺序是:规则 → 角色 → 目标。先定义规则,就是在AI开始工作前清理掉潜在空间中不需要的路径。三、实战对比案例一:语气与自信度❌ 社交噪音式:"我在找一些在会议中更自信的方法,你能帮忙吗?"✅ 序列架构式:- 规则:使用自信但协作的语气,去除模棱两可和道歉- 角色:高管教练- 目标:提供3条可执行策略逻辑:前置风格约束锁定了"语气区域",防止一度漂移滑入泛泛的心灵鸡汤。案例二:复杂概念教学❌ 社交噪音式:"你能用容易理解的方式解释光合作用吗?"✅ 序列架构式:- 规则:使用检查点式教程(每步确认),避免隐喻,使用专业术语- 角色:生物学家- 目标:提供完整流程分解逻辑:在开头token中强制设置检查点,阻止模型匆忙给出浅层概述。案例三:复杂规划❌ 社交噪音式:"帮我规划东京3日游,我喜欢美食和科技,预算有限。"✅ 序列架构式:- 规则:排序成功标准,定义硬约束(如单程交通不超30分钟),使用目标驱动规划- 角色:旅行架构师- 目标:创建高效行程逻辑:在开头token中定义硬约束和优先级,将指南针锁定在高效结果上,过滤掉低概率的填充内容。四、社区讨论的关键补充关于位置权重:评论中有人指出,不仅开头重要,结尾也重要,真正容易被"遗忘"的是中间部分。这符合注意力机制的研究发现。关于系统提示词:有经验的开发者提醒,在实际应用中,用户输入前往往已有系统提示词和工具定义,你的prompt实际上并非"真正的开头"。但对于普通用户使用ChatGPT等产品,这套原则依然适用。关于幻觉问题:即使精心设计prompt,幻觉问题仍难以根除。可以要求模型"不确定时说不知道",但这只能缓解,无法消除。五、核心认知转变停止"提问",开始"架构"。你输入的每个字都是对模型概率引擎的物理约束,以token序列的形式进入系统。如果你不用前50个token设定好指南针,机器就会愉快地花费接下来500个token猜测你想去哪。制胜序列:规则 → 角色 → 目标 → 内容这不是完美的模型,但它是实用的——而且欢迎挑战。reddit.com/r/PromptEngineering/comments/1q5h5og/the_physics_of_tokens_in_llms_why_your_first_50
新浪微博 2026-01-07 00:00:00
29. Anthropic最新发布的Claude Developer Platform功能,开启了AI代理工具使用的新纪元。未来的AI代理将无缝调用数百甚至数千种工具,像IDE助手整合Git操作、文件管理、测试框架,或运维协调连接Slack、GitHub、Jira等多个系统。他们面临的最大挑战是:如何避免因预加载海量工具定义而导致的上下文爆炸?传统方式可能消耗十万以上tokens,严重影响模型性能。Anthropic提出“工具按需发现”策略——Tool Search Tool,让Claude只加载当前任务真正需要的工具,节省85%上下文空间,大幅提升准确率和响应速度。另一方面,传统自然语言调用工具方式带来的上下文污染和多次推理开销,也被Programmatic Tool Calling(编程式工具调用)彻底革新。Claude通过生成Python代码来批量调用、处理工具数据,只把最终结果放入上下文,极大节省token消耗(约降37%),降低延迟,并提高了复杂流程的执行准确度。此外,JSON Schema虽能定义参数结构,却难以表达正确用法和参数间的关联。Anthropic引入Tool Use Examples,允许开发者通过示例明确工具调用规范,显著提升复杂参数场景下的调用准确率(测试中从72%提升到90%)。这三项功能——工具搜索、编程调用、用例示范——协同解决了大规模多工具场景下的发现效率、执行效率和调用准确度问题。它们不仅适合构建跨多个服务的大型系统,也为开发者提供了灵活、高效的工具管理和调用新范式。开发者可根据应用场景分层使用,先从最大瓶颈入手: - 上下文爆炸优先用Tool Search Tool - 中间数据过多用Programmatic Tool Calling - 参数复杂易错用Tool Use Examples Anthropic的实践证明,这样的设计大幅提升了AI代理的实用性和稳定性,推动智能代理从简单调用迈向智能编排。期待更多创新应用在Claude平台上诞生。原文详见 anthopic.com/engineering/advanced-tool-use—— 这项技术展示了AI工具集成的未来方向:动态发现、代码驱动执行和示范引导,三者合力打造高效、精准、可扩展的智能代理生态。对希望打造复杂多工具AI系统的开发者来说,Anthropic的方案无疑提供了宝贵的参考和实践路径。
新浪微博 2025-12-01 00:00:00
30. 智源发布2026十大AI技术趋势
微信公众号 2026-01-08 00:00:00
31. TRAE中国版白送SOLO,一人指挥一支AI大军 重磅消息!SOLO终于上线TRAE中国版了,Waitlist免费开放中 本期视频实测TRAE的新版本,亮点很多 1、先规划再动手的 Plan 模式 2、带专家团一起干活的 Subagent 子智能体 3、DiffView 差异视图 4、多任务并行 5、上下文智能压缩长时运行不掉链子 SOLO终于把AI从“瞎干活的外包”变成了“懂协作的队友” #AI #人工智能 #TRAE #AI编程 #vibecoding
抖音 2025-11-26 00:00:00
32. Claude Code或智能体给每个工具调用设明确的失败路径,很重要!「让 agent 自己决定怎么重试」是生产环境最危险的设计。如果你一个小功能执行了很长时间,浪费了很多token,大概率就是在无效重试了。这本质上是因为没有给失败定义出口。1. 重试循环是最隐蔽的死亡模式最常见的 agent 特有失败模式:工具调用报错 → agent 原样重试 → 还是报错 → 再重试。整个过程 agent 不说话,任务返回看起来像在跑,实际上它在用完全相同的参数一遍遍重复同一个失败的调用。通常要等到账单来了才会发现,或者几小时后下游任务给出错误结果时才察觉——而这时候已经连续失败了几十次了。2. 四个必须在架构层定义的机制1)每个 tool call 必须有重试上限 + fallback 行为,而不是开放式循环。重试 3 次还没成功,就触发 fallback(降级处理、跳过、或转为人工审批),而不是继续重试。2)熔断器(Circuit Breaker):连续 N 次违规(报错/超时/超 token)后,自动停止所有 LLM 调用,等人工来 reset。这是防止花费大量token 的最后一道防线。开源库 agent-cost-guardrails 就是做这个的,纯 Python,零基础设施,可以直接挂进 CrewAI / AutoGen / LangGraph。3)Human-in-the-loop 关卡要提前定义,不能让 agent 自己判断「这件事要不要问人」。正确做法是:列出哪些操作类型必须经过人工确认(比如写入生产数据库、发送外部通知、超过一定金额的操作),在架构里硬编码这些关卡。4)每个 agent 的决策要可追溯:哪个 agent、调用了哪个工具、传了什么参数、返回了什么、为什么做这个决定——完整的 trace。如果你做不到这一点,生产环境 debug 就是考古——找到一堆 error log,但不知道哪个是根因。3. 核心设计原则1)不要让 agent 决定如何从自己的错误中恢复。这是一个没有出口的控制循环。2)重试、路由、失败恢复——这些逻辑必须在 agent 上层的 orchestration 层实现,不能依赖 agent 自己判断。agent 只负责执行,异常处理交给架构层管。#HOW I AI# #程序员#
新浪微博 2026-04-23 00:00:00
33. AI幻觉确实是一个值得深思的现象。AI幻觉的核心矛盾是技术局限性与人类滥用风险的叠加,它既是AI发展的阶段性问题,也正在倒逼人类重构信息使用的规则。三个层面聊一聊这个问题一、本质:并非撒谎,而是概率性输出的偏差AI幻觉(如无中生有、编造数据、逻辑自洽的错误结论)的根源,并非其具备主观欺骗意图,而是底层技术逻辑的特性:1. 生成逻辑的先天局限:大语言模型(LLM)的核心是基于海量数据学习文字序列的概率关联,而非理解事实本身。它的目标是生成看起来合理的内容,而非绝对正确的内容,当训练数据存在缺失、模糊或冲突时,就容易拼接出符合语法和逻辑、但违背事实的幻觉。2. 能力边界的模糊性:AI无法主动识别自己不知道的事,面对超出训练范围或需要精准事实核查的问题(如冷门历史细节、未公开的科研数据),它会通过合理推演填补信息空白,最终形成幻觉。二、风险:图片现象放大了幻觉的连锁效应图片中博主提到的拿AI结论当证据,这一行为让AI幻觉从技术瑕疵升级为认知风险,主要体现在两方面:1. 误导个体决策:当用户将AI生成的错误信息作为论证依据(如职场方案、学术讨论、生活决策),且未进行二次核查时,会直接导致判断失误,甚至形成认知固化,将AI的幻觉当成既定事实。2. 加剧信息失真:错误的AI结论一旦被传播,会混入网络信息池,成为后续AI训练的污染数据,形成幻觉再生产的恶性循环,正如评论所言AI幻觉很快变成人类的幻觉,最终模糊事实与生成内容的边界。三、应对:不是否定AI,而是建立人机协同的核查机制AI幻觉无法被彻底消除,但可以通过技术优化+人类规范将风险降到最低,核心思路是不把AI当答案库,只当辅助工具:1. 技术层面的持续迭代:开发者通过检索增强生成(RAG)让AI先调取真实数据库再输出、加入事实核查模块、优化训练数据的权威性等方式,减少幻觉产生的概率。2. 人类层面的使用准则:对AI输出的事实性内容(数据、案例、结论) 必须交叉验证,优先核对权威来源(官方文献、核心期刊、正规媒体);明确AI的适用场景,将其用于灵感激发、草稿生成、逻辑梳理,而非事实论证、证据支撑;提升媒介素养,建立AI内容=待核查内容的默认认知,避免盲目采信。AI幻觉是技术发展的成长痛,它的存在提醒我们:AI是提升效率的工具,而非判断事实的权威。在AI时代,独立核查和批判性思维,会成为比以往更重要的能力。
新浪微博 2026-03-03 00:00:00
34. 2026 开年第一炸!陈天桥的这个新模型,治好了 AI 的「幻觉」
微信公众号 2026-01-13 00:00:00
35. 为什么 RAG 落地难?解析数据处理 “三重困境”,事件驱动架构如何破局?
知乎 2025-11-25 00:00:00
36. 《扣子开发 AI Agent 智能体应用》014-基于大模型的企业知识库(知识库的理论基础 RAG)
微信公众号 2026-01-02 00:00:00
37. 盘点一周AI大事(4月12日)|Mythos太强不敢发布 Anthropic官宣最强大模型Claude Mythos OpenAI发布超级智能经济蓝图 Meta发布大模型 Muse Spark 智谱上线最强开源大模型GLM-5.1 Anthropic上线Agent包工头Claude Managed Agents Gemini上线概念可视化visualizations 阿里发布最强视频模型HappyHorse-1.0 米哈游发布最强数字人模型LPM 1.0 Ace开源最强音乐模型ACE-Step-1.5-xl 研究员开源最强虚拟试穿模型Vanast #前沿科技趋势发布月 #AI新星计划 #AIGC #大模型 #Agent
抖音 2026-04-12 00:00:00
38. 谁能想到?坐拥全球顶级 AI 情报、号称 “无死角监控” 的美国和以色列,居然在伊朗面前彻底陷入被动! 明明技术碾压、算力爆表、情报体系高度智能化,袭击初期还占尽上风,可越到后期越拉胯,精准预判失灵、目标判断失误,反而被伊朗牵着鼻子走。 根本原因只有一个:AI 不是万能的,迷信技术必吃大亏! 美以过度依赖算法、数据陈旧、缺乏人工校验,看似强大,实则漏洞百出。而伊朗用最朴素的隐蔽战术、人力情报、反制思维,精准戳穿技术神话。 这场对决直接撕开一个真相:再先进的 AI,也干不过懂战场、懂人性的真实策略! 技术和策略,到底谁才是真正的胜负手?#美以伊冲突##霍尔木兹海峡运输停滞##内塔尼亚胡喝咖啡视频被指怪异##中方回应特朗普呼吁多国派军舰护航##热点解读# http://t.cn/AXfh2VnJ
新浪微博 2026-03-16 00:00:00
39. 【代码烂到AI看了直接删库:亚马逊内部AI助手“硬核修复”致AWS停机13小时】据《金融时报》及《纽约时报》记者Mike Isaac披露,亚马逊AWS内部发生了一起由内部AI编码助手引发的生产环境故障。这起事件直接暴露了代理式AI在权限边界管理上的现实风险事件发生于2025年12月中旬。涉事AI为亚马逊于同年7月推出的内部代理式编码助手Kiro(具备根据需求自主编写代码并执行操作的能力)一名工程师授权Kiro修复AWS Cost Explorer(成本管理服务)的某项缺陷。Kiro在评估后判定现有环境存在问题,自主给出的最佳解决方案是——直接删除并从头重建整个服务环境由于Kiro意外获得了超出预期的生产环境执行权限,该“重建”操作导致AWS Cost Explorer在中国大陆的一个可用区停机13小时。该故障未波及计算、存储等核心 AWS 服务,未造成大规模客户中断亚马逊官方将此次事件定性为“用户配置错误”而非AI故障。官方声明指出,工程师为Kiro赋予了过高的访问权限(正常情况下Kiro的高危操作需请求人工授权),并强调同样的失误也可能发生在任何传统自动化脚本或手动操作中。作为整改措施,AWS目前已在该工具链中加入了强制的同行代码审查,并全面收紧了AI代理的默认权限
新浪微博 2026-02-21 00:00:00
40. 【#AI冲击就业缺乏系统性预警# 人大代表建议尽快设影响评估机制】AI冲击就业缺乏系统性预警 人大代表建议尽快设影响评估机制 “我国AI治理目前主要聚焦于内容安全、数据合规、算法伦理等领域,对AI应用的就业影响尚缺乏系统性的预警与应对机制。这一制度空白若不及时填补,可能演变为影响社会稳定的重大风险。”2026年全国“两会”期间,全国人大代表,中国科学院大学知识产权学院院长、讲席教授马一德提出建议,要加快构建人工智能应用就业影响评估机制。 政策层面对AI影响就业已有关注。2025年10月,中国共产党的二十届四中全会审议通过的《中共中央关于制定国民经济和社会发展第十五个五年规划的建议》明确要求,“完善就业影响评估和监测预警,综合应对外部环境变化和新技术发展对就业的影响”。同时还提出,“全面实施‘人工智能+’行动”“加强人工智能治理,完善相关法律法规、政策制度、应用规范、伦理准则”。
新浪微博 2026-03-08 00:00:00
41. 破解可塑性瓶颈!清华团队新作刷榜持续学习:可迁移任务关系指导训练
知乎 2025-12-03 00:00:00
42. 从“工具过载”到“精准调用”:破解 Agent 工具管理难题
知乎 2026-01-28 00:00:00
43. 美军AI系统曝光!其在24小时内完成大规模作战规划, AI开始正式进入战争指挥系统。这事背后意味着什么?#大有学问 #红衣聊AI #人工智能 #科技
抖音 2026-03-20 00:00:00
44. 一个全是 AI 幻觉的网站,却成了这届互联网最实诚的存在
微信公众号 2026-05-17 00:00:00
45. 【掌握这套12条工程规则,直接把Claude错误率从41%压至3%】快速阅读:Andrej Karpathy 指出 Claude 的错误 90% 源于上下文缺失而非模型能力。通过引入一套结构化的规则文件(如 CLAUDE.md),可以将错误率从 41% 降至 3%。很多人在用 Claude 时会觉得它不够聪明,但真相可能有些残酷:模型没问题,是上下文丢了。Andrej Karpathy 提到一个数据:如果没有 CLAUDE.md 这种规则文件,Claude 的错误率高达 41%;但如果遵循这套包含 12 条规则的基准,错误率能直接压到 3%。这说明上下文工程才是真正的技术天花板,而不是盲目追求更大的模型。12 条核心规则:1、思考先行:在编码前强制陈述假设。AI 无法读心,不要寄希望于它能自动理解你的潜台词,明确意图是协作的起点。2、简约至上:追求最少代码,拒绝预测性抽象。任何为了 未来灵活性 增加的冗余,往往会在下个季度被全部删除。3、精确修改:手术刀式地触碰代码。严禁 AI 顺便优化相邻代码,这是防止 Pull Request 规模失控的关键。4、目标驱动:预先定义成功标准,并进行循环验证。没有明确的终点,AI 要么陷入死循环,要么在任务未完成时过早停止。5、仅用于判断性任务:让模型负责分类、草拟、摘要和提取。至于路由、重试、状态码处理等确定性逻辑,交给代码本身,而非概率模型。6、严格遵守Token预算:单次任务建议 4000 token,单次会话 30000 token。当对话过长,AI 会开始反复建议你早已拒绝过的错误方案。7、暴露冲突而非折中:代码库中存在两种模式?选定一个。AI 试图融合不同风格只会导致错误被双重掩盖,保持一致性是第一优先级。8、先读后写:要求 AI 必须读取导出文件、调用方和共享工具。否则它会在你已有的功能旁边写出一个完全相同的副本。9、测试验证意图而非行为:如果业务逻辑改变但测试依然通过,那测试就是失效的。确保测试能够捕捉到逻辑的本质失效,而非仅仅跑通流程。10、关键步骤设置检查点:每完成一个重要阶段就进行确认。不要在错误的基础上继续构建,否则你会在一小时后才发现底层架构早已崩塌。11、匹配代码库惯例:保持风格高度统一。如果项目使用 Class 组件,就不要让 AI 默默引入 Hooks,这种隐性冲突会破坏整个测试体系。12、显性失败:最可怕的 Bug 是显示 成功 却静默跳过了数据。要求 AI 暴露不确定性,严禁隐藏错误,让失败尽可能大声。这套规则其实是在把 AI 当成一名高级工程师来对待。有网友提到,这就像给新入职的资深开发做 Onboarding,你需要明确告诉他:不要猜测假设,先思考再写代码;保持代码极简,拒绝为了所谓的“未来灵活性”增加冗余;进行手术式修改,只动该动的地方,别去碰相邻的代码。最容易被忽视的是“检查点”意识。如果第 4 步已经写错了,第 5、6 步就是在错误的基础上不断叠加错误。如果不及时回滚或纠偏,这种错误会像雪球一样滚大。还有关于测试的警示:如果一个测试在业务逻辑改变时依然能通过,那它就是废纸。有开发者感叹,有些测试甚至能让函数返回一个常量时依然显示通过,这种虚假的信心比没有测试更危险。与其抱怨模型不够强,不如把那些存在于脑子里的架构规范、命名习惯和工程纪律,显式地写进规则文件里。x.com/DeRonin_/status/2056300651764711879
新浪微博 2026-05-20 00:00:00
46. #IT那些事儿# 美国人工智能标准与创新中心(CAISI)的2026年5月1日报告:www.nist.gov/news-events/news/2026/05/caisi-evaluation-deepseek-v4-pro “根据 DeepSeek 的数据,DeepSeek V4 的性能与大约两个月前发布的 Opus 4.6 和 GPT-5.4 相当。然而,CAISI 的评估(包括非公开基准测试)表明,DeepSeek V4 的性能与大约八个月前发布的 GPT-5 类似”。 CAISI 是什么? 它不是 LMSYS 那种“用户体验竞技场”,LMSYS的核心成果为 Chatbot Arena 大模型竞技评测平台,被业界视为全球大模型能力评估的风向标。 它更接近“面向国家标准的能力测量体系”,聚焦于能力是否可量化、是否可对比、是否可监管、是否可进入国家关键基础设施体系。 它测试的可能是: 1)长链推理(long-chain reasoning):如数学证明、复杂规划; 2)对齐(alignment):让模型“在复杂语境中不犯错”; 3)稳定性与泛化能力:对分布外问题不崩,输出一致性高。 这三类能力,本质上都是在用极高的成本换取极限能力和长尾可靠性。 毫无疑问,美国闭源大模型的超大规模算力投入(数十亿美金级别)、长周期训练、不以短期盈利为核心约束的资源禀赋,特别适合这种能力测试,如ARC-AGI-2 (抽象推理)、CTF-Archive (夺旗赛网络安全)、FrontierScience (前沿科学问题),无一不是对模型推理极限的严苛考验。这同时也符合美国模型的商业逻辑:“卖最强能力给最愿意付费的人”。 但中国开源大模型都不是这么设计和运行的。 美国在解的问题是:“模型能有多聪明?” 中国在解的问题是:“智能在社会中能被用到多大规模?” 美国希望寻求的答案是:“让模型更像博士。” 但中国更关注的答案是:“让模型变成基础设施,像水电气、医疗服务和云计算服务一样。” 总而言之,请记住两句话: 第一句话是,DeepSeek v4 在用户体验层面已经进入全球第一梯队,但在极限能力与可靠性层面仍落后;然而凭借其成本结构,使它在 Agentic 时代具备不对称竞争力。 第二句话是,CAISI 评测体系选择了一个美国已经投入了最多资源的测评子空间,本质上是用美国的标准和考卷,来衡量一个为不同目标而优化的学生,美国闭源模型大概率赢。
新浪微博 2026-05-02 00:00:00
47. 探秘 AgentRun丨流量一大就瘫痪?如何解决 AI 模型调用之痛
知乎 2025-12-25 00:00:00
48. FSD逆行导致危险也不是一次两次了。正好再聊聊关于所谓“模型和规控”,我向来都很不喜欢那种二元对立的论调。实际上,现在绝大部分的系统都是两者结合。先说个最基本的,但凡有AEB的车,那都可以说有一层规则兜底。因为AEB的触发逻辑都是用规则写的,要严格限定触发范围。即便回到智驾领航本身,也可以针对部分场景进行兜底,比如跟VRU博弈,什么时候就该停车,不要过度激进;遇到一些危险的入侵及时减速,等等。这种刹车不用像AEB那么猛烈,但都是在纵向上逻辑相似的兜底。再说横向,现在一些车道规则也是必要的。模型可能会不知道自己是不是开去逆向车道了,是不是要在掉头车道直行了,等等问题。增加一些约束,可能让你感觉他开的那么丝滑,没那么灵活,但却可以保住你的驾照乃至小命。一句话通俗地讲,AI大模型是会有幻觉的。如果没有充分验证,就去追求什么完“全端到端”,那不是先进,而是不负责任。
新浪微博 2025-12-19 00:00:00
49. 【AI人工智能】题库:纯公益分享【就业+考研】笔试+面试必会【小白从小学Python,C,Java】知识点名称AI中RAG检索增强生成知识点讲解检索增强生成(Retrieval-Augmented Generation,RAG)是一种将检索系统与生成模型结合的架构,模型在生成答案前先从外部知识库(如文档、数据库)检索相关内容,再基于检索结果生成响应,从而缓解大语言模型的幻觉问题、提升答案的事实性和时效性。它通常包括检索器(Retriever,如Dense Passage Retrieval)和生成器(Generator,如LLM)两部分。例题(单选题)RAG的主要优势是什么?A选项:结合外部知识减少幻觉提升事实性B选项:取代模型的参数化知识C选项:仅依赖模型内部参数生成D选项:减少模型参数量压缩体积答案与题解答案、题解:见评论区温馨期待期待大家提出宝贵建议,互相交流,收获更大,助教:lxy#AI创造营# #科技风向标# 网页链接
新浪微博 2026-03-13 00:00:00
50. AI 短剧与 AI 漫剧正以低成本、高效率迅速崛起,这会颠覆传统短剧行业吗?此新兴行业未来前景如何?
知乎 2026-03-04 00:00:00
51. 以 NoETL 指标语义层为核心:打造可信、智能的 Data Agent 产品实践
知乎 2025-11-25 00:00:00
52. 热议|“人机协同”时代,英专人如何转型?18位大咖有话说(上)
微信公众号 2026-01-19 00:00:00
53. 2026年了,AI可以无条件相信吗?怎么用才能不翻车?
哔哩哔哩 2026-03-24 00:00:00
54. AI 给市场带来了三个集体幻觉。第一个集体幻觉是特定约束下的巨大赋能,被线性外推为所有人所有事都能巨大赋能。这个幻觉最近还有一个变种,讲 AI 只对厉害的人巨大赋能,否则就是你不厉害,或者你对 AI 信仰充值不足。这和宗教也没啥区别。第二个集体幻觉是,效率的提升在大多数情况下并不能带来胜率的提升,节约了大量的人力成本,但并没有赚到更多的钱。体感澎湃和收益不变同时发生。第三个集体幻觉是,当所有人都能借力于 AI 得到效率提升时,所有人一起坐电梯上升,相当于技术通胀。个体不跟上就会损失收益,但跟上了也不会增加收益,此处可以类比为 “打字”。
新浪微博 2026-03-03 00:00:00
55. 如何系统性的学习RAG、Agent、MCP?
知乎 2025-11-29 00:00:00
56. 微表情测谎、极速赔付、AI打败AI,深聊“AI in All”下的保险革命与增长飞轮【硅谷101】
哔哩哔哩 2025-11-28 00:00:00
57. 回复@2026不感冒:事实上,想把一件事情向AI讲清楚,整个流程讲清楚、各种约束讲清楚、业务需求讲清楚、测试标准和规则讲清楚,要达到的性能指标和安全要求讲清楚,……,是件很让人头大的事情。//@2026不感冒:这就体现了Harness的必要性
新浪微博 2026-04-18 00:00:00
58. Milvus 向量数据库实战:从零构建高性能 RAG 系统
知乎 2026-01-12 00:00:00
59. 智能体即开发者:论AI如何重塑编程边界与人机协同未来
知乎 2026-01-06 00:00:00
60. AI幻觉终结者?最新RAG技术如何重塑智能对话的可靠性
微信公众号 2026-04-06 00:00:00
61. 大模型从玩具到工具的核心是控制幻觉
知乎 2026-03-01 00:00:00
62. AI Agent的“幻觉”升级
微信公众号 2026-04-14 00:00:00
63. 2026AI幻觉深度研究报告
微信公众号 2026-05-10 00:00:00
64. 幻觉、可靠性与谄媚
微信公众号 2026-04-06 00:00:00
65. 为什么你的 AI Agent 总是出错?自验证机制可能是答案
知乎 2026-02-23 00:00:00
66. AI幻觉,能被解决吗?
今日头条 2026-05-16 00:00:00
67. AI幻觉是智能的代价
微信公众号 2026-01-27 00:00:00
68. 从AI幻觉本质,看懂它到底擅长什么
知乎 2026-01-28 00:00:00
69. 观察与思考 | 人工智能幻觉 vs. 人类的AI幻觉
微信公众号 2025-12-05 00:00:00
70. AI幻觉“侵权”,不能甩锅给技术“不可预见”
今日头条 2026-05-09 00:00:00
71. 企业如何控制AI大模型的应用风险
今日头条 2025-11-23 00:00:00
72. 2026 年 AI 幻觉深度研究报告
微信公众号 2026-05-08 00:00:00
73. 报告 | 《2026 AI 幻觉深度报告》
微信公众号 2026-05-10 00:00:00
74. 如何减少AI幻觉
微信公众号
75. 2026AI幻觉深度研究报告
知乎
76. AI幻觉深度研究报告解读
微信公众号
77. 滴滴Agent岗二面
今日头条
78. RAG幻觉依然存在
微信公众号
79. 在什么情况下选择RAG或微调来缓解模型的幻觉?
知乎
80. RAG 并非对 LLM 的幻觉免疫
知乎
81. 人话版AI词典 | 第9期
微信公众号
82. 怎么让AI老老实实帮你研究股票
微信公众号
83. AI 写量化策略如何杜绝幻觉
今日头条
84. 把 AI 量化编程做成中文填空题,幻觉问题就搞定了
今日头条
85. 应对AI幻觉,必看这2个关键原则
微信公众号 2026-04-14 00:00:00
86. AI产品经理必知
今日头条 2026-03-30 00:00:00
87. 2分钟 → 30秒,效率提升75%
今日头条 2026-04-13 00:00:00
88. AI幻觉
今日头条 2026-04-09 00:00:00
89. 荐稿专栏 | 邝光耀
微信公众号 2026-01-11 00:00:00
90. ai-agent的发展现状及方向
知乎 2026-05-06 00:00:00
91. 2026 AI Agent 爆发
知乎 2026-05-16 00:00:00
92. 2026企业级可信智能体选型指南
哔哩哔哩 2026-02-12 00:00:00
93. 终结AI的“幻觉”与“作弊”
微信公众号 2026-04-10 00:00:00
94. 2026
知乎 2026-01-27 00:00:00
95. 如何解决LLM-Agent的长程规划失败问题
知乎 2026-03-26 00:00:00
96. 95%准确率的AI,做100步任务成功率只有0.6%?问题不在模型
今日头条 2026-04-06 00:00:00
97. 字节面试官问Agent工具调用失败怎么办时,大模型agent面试精选题库
知乎 2026-03-31 00:00:00
98. AI Agent 为什么总在"工具调用"上翻车?
微信公众号 2026-04-14 00:00:00
99. AI算法原理0基础入门-第22回-工具调用——从 Prompt JSON 到 Function Calling
知乎 2026-03-03 00:00:00
100. 美团二面
微信公众号 2026-04-29 00:00:00
101. AI 助手「工具集体失效」翻车自救实录
知乎 2026-05-16 00:00:00
102. 大模型专题报告
微信公众号 2026-01-25 00:00:00
103. 破解智能体幻觉难题,OpenClaw思维链重构,夯实工业级执行可靠性 - 哔哩哔哩
哔哩哔哩 2026-05-18 00:00:00
104. 模型错还是系统错?智能体故障归因的“法医”指南
微信公众号 2025-12-14 00:00:00
105. AI产品经理如何把控大模型幻觉边界,完成产品稳定落地?
今日头条 2026-05-06 00:00:00
106. 如何系统化应对AI大模型的“幻觉”问题?
今日头条 2025-12-16 00:00:00
107. 100+ 次部署实战总结
微信公众号 2026-05-13 00:00:00
108. 【论文速记】面向 AI Agent 的黑盒可靠性认证
知乎 2026-02-27 00:00:00
109. AI幻觉的生成原理与应对指南:六大中文模型横向解析
网易
110. JPMorgan研究新发现:优化提问方式,解锁AI回答高可靠性的密码
111. 如何解决AI模型的幻觉问题?
112. 理论介绍 | 人工智能幻觉(AI Hallucination)
微信公众号 2026-02-02 00:00:00
113. LangGraph中实现智能体人机协同(Human-in-the-Loop, HITL) 的核心方法
微信公众号 2026-01-05 00:00:00
114. 降低企业AI Agent幻觉的八种方式
微信公众号 2026-04-20 00:00:00
115. 当AI智能体因幻觉导致你蒙受经济损失时,该如何应对?
今日头条 2026-04-16 00:00:00
116. 给你的智能体装上眼睛:选择合适的Web搜索API
知乎 2026-02-12 00:00:00
117. 当AI用幻觉进行欺骗时,人类究竟该如何应对?
今日头条 2026-02-01 00:00:00
118. 别让 AI “胡言乱语”!5 种检测 + 5 类归因 + 全链路策略,搞定模型幻觉
微信公众号 2025-12-16 00:00:00
119. 责任的真空:当AI变得无所不能,谁将承担一切?
微信公众号 2026-02-09 00:00:00
120. AI幻觉问题及缓解策略
今日头条 2026-02-21 00:00:00
121. 首个全模态个性化评测基准!解决AI助手人物身份接地痛点 【大模型评测】【多模态大模型】
哔哩哔哩 2026-05-14 00:00:00
122. 阿里面试官问:Agent幻觉问题如何解决?千万别愣住了...
微信公众号 2026-03-18 00:00:00
123. Nat Com | Hyper-RAG: 超图驱动的检索增强生成全面建模高阶关联,攻克大模型幻觉难题
微信公众号 2026-05-02 00:00:00
124. 新传名词2026|AI幻觉 002
微信公众号 2026-01-26 00:00:00
125. Hyper-RAG:超图驱动RAG突破LLM幻觉困境,医疗诊断准确率提升12.3%
微信公众号 2026-04-29 00:00:00
126. 第一百九十一弹:AI“幻觉”会引发哪些法律问题及应对措施?
微信公众号 2026-02-11 00:00:00
127. 大模型服务与应用安全评测技术规范
微信公众号 2026-05-11 00:00:00
128. 【AI论文解读】73%攻击成功率!当前AI Agent居然这么危险?首个阶梯式有害行为评测基准AgentHazard
哔哩哔哩 2026-04-14 00:00:00
129. RAG抗噪天花板!Neuro-RIT:神经元级微调,根治检索噪声幻觉
微信公众号 2026-04-15 00:00:00
130. AI幻觉的根源找到了!我们评估模型的方式,竟在鼓励它自信犯错?
今日头条 2026-04-26 00:00:00
131. 可信 AI 代理落地实战——Anthropic《Trustworthy agents in practice》解读,4层安全体系保障业务场景安全
微信公众号 2026-04-10 00:00:00
132. AI Agent 入门课(7):可信 Agent 不是加免责声明,而是先收紧权力
微信公众号 2026-05-05 00:00:00
133. ACL 2026 | Stable-RAG:破解RAG中的检索排列幻觉,让大模型推理更稳健
今日头条 2026-04-29 00:00:00
134. 破解AI大模型“幻觉”难题:实用策略与技术应对全指南
今日头条 2026-02-23 00:00:00
135. 工业AI博文三_大模型幻觉与中国工业AI实践
知乎 2026-04-22 00:00:00
136. 人脑为什么幻觉比AI少?
今日头条 2026-04-21 00:00:00
137. 18款AI模型幻觉率大公开|你的AI靠谱吗?
今日头条 2025-12-10 00:00:00
138. 警告,重视AI幻觉,在专业领域,细微的幻觉也会带来较大的风险
微信公众号 2026-02-02 00:00:00
139. AI的“胡话陷阱”:解密幻觉(Hallucination)
今日头条 2025-12-12 00:00:00
140. 大模型幻觉检测框架InFi-Check构建思路及大模型多步推理的7个总结性结论
今日头条 2026-01-30 00:00:00
141. 字节面试官:你的 Agent 调工具失败就卡死?重试、降级、兜底你做了吗?
知乎 2026-05-09 00:00:00
142. AI并不存在"幻觉"!很多专家指出存在根本性错误,会造成误导
今日头条 2025-11-28 00:00:00
143. 【AI coding 智能体设计系列-04】MCP 与工具闭环:注册、调用、回填与失败恢复
知乎 2026-01-05 00:00:00
144. 从"胡言乱语"到"有据可依":RAG技术正在重塑AI心理健康服务
微信公众号 2026-05-10 00:00:00
145. 阿里面试官皱眉:"你的 Agent 调用工具失败了,是直接报错,还是有重试?重试策略怎么设计的?"
知乎 2026-04-17 00:00:00
146. 彻底颠覆!你的Agent是“真智能”还是“随机鹦鹉”?一文搞懂Agent Quality的终极评估法!
知乎 2025-12-30 00:00:00
147. “生成式人工智能模型应用幻觉和可靠性评估框架”第一次研讨会顺利召开
微信公众号 2026-02-03 00:00:00
148. AI Agent 架构设计(十四):错误处理与容错设计(OpenClaw、Claude Code、Hermes Agent 对比)
微信公众号 2026-04-27 00:00:00
149. 揭秘AI智能体的质量评估方法
哔哩哔哩 2025-12-19 00:00:00
150. AI幻觉纠纷案背后:谁该为“AI胡说”担责?
今日头条 2026-04-16 00:00:00
151. 【AI人工智能题库】AI中幻觉Hallucination - 哔哩哔哩
哔哩哔哩 2026-03-19 00:00:00
152. 对Artificial Analysis大模型评测的修正
知乎 2026-04-29 00:00:00
153. 长视频“分镜一致性”来了 StoryMem 把 AI 叙事带进“有记忆”的时代
今日头条 2026-01-06 00:00:00
154. 大模型评测:长任务可靠性
今日头条 2026-05-13 00:00:00
155. 最新论文|武大新框架应对遥感多模态大语言模型中的幻觉问题, 开源遥感问答幻觉诊断基准!
微信公众号 2026-03-18 00:00:00
156. Agent 工具调用总失败?三招兜底容错策略,让 AI 不再“甩锅”给参数!
微信公众号 2026-05-16 00:00:00
157. 仅六行代码构建AI长效记忆 彻底解决RAG幻觉
今日头条 2026-04-11 00:00:00
158. 核心指标优于混元WorldPlay!快手可灵提出世界模型记忆新范式,实现隐藏对象的动态一致性
微信公众号 2026-04-17 00:00:00
159. Harness设计原则:如何为你的AI Agent构建“可控”与“可观测”系统
微信公众号 2026-05-02 00:00:00
160. AI 写代码总翻车?问题不在智商
今日头条 2026-05-17 00:00:00
161. 企业如何把智能客服系统用好:人机协同+大模型驱动实现降本增效
今日头条 2026-05-01 00:00:00
162. 大模型的幻觉是怎么来的
微信公众号 2025-12-11 00:00:00
163. AI Agent 应用评测完全指南
知乎 2026-03-25 00:00:00
164. 图解 RAG(十一)快速入门|评估与优化:RAGAS 框架与幻觉抑制
微信公众号 2026-04-25 00:00:00
165. 告别AI幻觉:RAG
今日头条 2026-05-01 00:00:00
-
又学到了,暑期旅行的15个隐藏妙招,学会可太省心了!295 88 -
不听劝自己在卫生间砌了个浴缸!夏天泡着真舒服~成本仅需400198 365 -
iPhone 16 Pro 只要 2550 元,太离谱了!110 302
已收藏
去我的收藏夹