张大妈

别再死磕提示词了,先问清业务要什么

源自142位全网作者

06-07 14:57

精选参考来源

1
问:上下文(Context)和上下文窗口(Context Window)什么差别?这两个概念经常被混用,但其实指的是不同层面的东西:上下文是指 AI Agent 在执行任务时实际拥有的所有信息,包括系统提示词、用户的对话历史、检索到的文档、工具调用的结果、记忆模块注入的内容等等。你可以把它理解为“Agent 此刻脑子里装的所有东西”。上下文是一个动态的、可以被工程化管理的概念——哪些信息该放进来、什么时候放、怎么组织,这就是现在越来越多人说的 Context Engineering。上下文窗口则是模型层面的一个硬性限制,指的是模型单次推理能处理的最大 token 数量。比如 128K、200K、1M 这些数字,说的就是上下文窗口的大小。它本质上是一个“容器的容量”。打个比方:上下文窗口是你厨房操作台的面积,上下文是你实际摆在台面上的食材、调料、菜谱和工具。台面就那么大(上下文窗口有上限),但你放什么上去、怎么摆放(上下文的管理)决定了你能不能高效做菜。在 Agent 开发中,一个核心挑战就是:Agent 需要的上下文往往远超上下文窗口的容量。对话越来越长、工具调用结果越来越多、检索的文档越来越大——这些都在消耗上下文窗口的空间。所以才需要各种策略来管理:摘要压缩历史对话、选择性检索而不是全量灌入、及时清理不再需要的中间结果等等。简单总结就是:上下文(Context)是“内容”,上下文窗口(Context Window)是“装内容的容器”。做 Agent 工程的核心功夫之一,就是在有限的“上下文窗口”里塞进最有价值的“上下文”。
2
现代医学发展史上,有从“系统论”或”整体观“视角出发,探索破局的人吗?
全部
来源
内容由AI生成

精选参考来源

1. 问:上下文(Context)和上下文窗口(Context Window)什么差别?这两个概念经常被混用,但其实指的是不同层面的东西:上下文是指 AI Agent 在执行任务时实际拥有的所有信息,包括系统提示词、用户的对话历史、检索到的文档、工具调用的结果、记忆模块注入的内容等等。你可以把它理解为“Agent 此刻脑子里装的所有东西”。上下文是一个动态的、可以被工程化管理的概念——哪些信息该放进来、什么时候放、怎么组织,这就是现在越来越多人说的 Context Engineering。上下文窗口则是模型层面的一个硬性限制,指的是模型单次推理能处理的最大 token 数量。比如 128K、200K、1M 这些数字,说的就是上下文窗口的大小。它本质上是一个“容器的容量”。打个比方:上下文窗口是你厨房操作台的面积,上下文是你实际摆在台面上的食材、调料、菜谱和工具。台面就那么大(上下文窗口有上限),但你放什么上去、怎么摆放(上下文的管理)决定了你能不能高效做菜。在 Agent 开发中,一个核心挑战就是:Agent 需要的上下文往往远超上下文窗口的容量。对话越来越长、工具调用结果越来越多、检索的文档越来越大——这些都在消耗上下文窗口的空间。所以才需要各种策略来管理:摘要压缩历史对话、选择性检索而不是全量灌入、及时清理不再需要的中间结果等等。简单总结就是:上下文(Context)是“内容”,上下文窗口(Context Window)是“装内容的容器”。做 Agent 工程的核心功夫之一,就是在有限的“上下文窗口”里塞进最有价值的“上下文”。

2. 现代医学发展史上,有从“系统论”或”整体观“视角出发,探索破局的人吗?

3. 元宝向用户道歉,此前生成拜年海报中出现脏话,AI 为何会输出侮辱性内容?此事带来哪些警示?

4. 文字输出的品味其实可以靠做减法来维持下限,只要废话够少,基本面就不至于太差。反直觉的是,没品味的人往往对 AI 吐出来的那些华丽辞藻沾沾自喜,却不知废话越少,翻车的概率反而越低。但在图、视频、代码或者 agent 逻辑里,平庸通常是结构性的,没有这种一删了之的低成本捷径。(2/2)

5. 【看懂 Claude Code 提示词:验证智能体、反过度工程、记忆压缩才是核心】快速阅读: Claude Code的npm源码包因人为失误意外泄露,有人从中逆向整理出26个提示词,覆盖系统指令、工具调用、智能体协作、记忆管理等全部模块,随后以MIT协议重新授权开源。这份材料本质上是一份提示词工程的实战教材。---有个细节值得注意:Anthropic事后将这次泄露定性为“人为失误”。200美元一个月的工具,整个提示词架构就这样从npm包里被人拆了出来。这26个提示词按功能分得很清晰:1个系统提示词负责身份定义和工具路由,11个工具提示词处理文件读写、shell执行、搜索等操作,5个智能体提示词分别对应探索、架构、验证、文档等角色,4个记忆提示词管理上下文压缩,1个协调提示词处理多智能体编排,还有4个工具提示词生成标题、摘要、建议。读完这些提示词,有几个设计决策让人印象深刻。其一是专门设置了一个“验证专家智能体”,它的职责就是在代码上线前想办法把它搞坏。这不是可选项,是写进架构里的。其二是反过度工程规则被明确写入系统提示词,“不要做用户没有要求的功能”。听起来像废话,但显然Anthropic认为有必要把它钉进去。其三是记忆压缩分9个章节,且保证每一条用户消息都被保留。有观点认为,大家都盯着系统提示词,真正值得研究的反而是那4个记忆提示词。多数AI编程工具在请求之间会忘掉一切,而Claude Code能记住项目结构和之前的编辑操作,这才是它用起来像同事而不像聊天机器人的原因。有网友提到,这个开源仓库引起广泛讨论,也有人认为被过度渲染了,从npm包里逆向提示词并不算什么技术壁垒,真正的护城河是模型质量和训练数据。这个说法大概70%是对的,提示词工程本身不是秘密,但好的提示词架构要花多少时间踩坑才能收敛到这个形态,那是另一回事。每个提示词都从零重写以符合法律要求,意图相同,没有逐字引用。MIT协议,可以直接用。所有内容在这里:github.com/repowise-dev/claude-code-prompts如果你在自己搭智能体,有一个问题可能值得先想清楚:你的系统里有没有一个专门负责破坏自己输出的角色?

6. 你见过最离谱的人工智能AI大语言模型的幻觉,有哪些?

7. 幻觉减少52.5%,废话少30%,ChatGPT默认模型正式升级为GPT-5.5 Instant

8. //@张小北:AI的特点就说话超好听但仔细一看全特么是废话//@潘海天:你非常精准地捕捉到了一个正在发生的、微妙而普遍的文化现象,它像一面镜子,照出了问题的本质:我们怀疑的不是文本,而是我们身处的这个“被AI浸染后的当下”。或许,破局的方法不是抛弃那个句式,而是在看到或使用它时,给自己一个新的心理暗示:这不是AI的指纹,而是人类思想中,那个最古老、最经典动作的痕迹。最终,让我们与AI区别开来的,不是某个句式的有无,而是我们敢于不为了“安全”而自我审查的那份坦荡。

9. 文科生史诗级加强!外网AI视频的天塌了!seedance加image2的核心技术被发现,完整提示词分享|中国爱死机|AIGC

10. AI技术用来辅助创作没什么问题,偶尔看个AI演的剧图个新鲜也无所谓。#爱奇艺 观众要看真人# 但如果整个行业都往这个方向走——批量生产、快速复制,内容越来越空洞,观众早晚会厌倦。#不尊重观众#现在的观众其实很清醒:好故事、好表演,大家都看得出来。工业流水线出来的东西,新鲜感过了就腻了。所以还是希望能回归内容本身。毕竟真正打动人的,从来都不是技术,是人。#热点观点##微博跨域计划#

11. Meta 捕捉员工鼠标与击键操作用于 AI 训练,会带来哪些影响?

12. 【为什么你天天改提示词,AI依然在疯狂产出垃圾】很多人用AI陷入了一个死循环:换更好的模型、写大几千字的提示词、拼命塞背景资料,结果生成的依然是一股浓浓的“AI味”废话。醒醒吧,AI产出垃圾不是输入端的问题,而是系统问题。这就好比一家工厂天天出次品,你不想着去建立质量检测线,却天天指责流水线上的工人衣服没穿对。提示词写得再完美,AI本质上也是个概率模型,这就意味着它每一次输出都是一次概率投掷,总有翻车的时候。如果你直接把这些没经过过滤的结果扔给用户或读者,那你就是在把翻车的风险直接转嫁出去。真正拉开差距的不是谁更会写提示词,而是谁拥有“评估循环”(Eval Loop)。也就是在输出端加一道闸门,把你的好作品当成标准锚点,让AI充当裁判给自己打分,不达标的直接拦截并重新迭代。别再沉迷于寻找“5个神级提示词”了,把质量变成可量化的数字,在输出端装上质检线,才是彻底杀掉AI垃圾的唯一解。x.com/EXM7777/status/2060736517564477901

13. Zimage模型深度评测:当东方美学遇上AI创造力

14. 主流大模型关于内容生成有幻觉的提示。千问:内容由千问AI生成,仅供参考。腾讯元宝:内容由AI生成,仅供参考DeepSeek:内容由AI生成,请仔细甄别。百度文心:内容由AI生成,仅供参考。讯飞星火:内容由AI生成。天工:内容由AI生成,不能保证真实。Gemini:Gemini的回答未必正确无误,请注意核查。ChatGPT:ChatGPT也可能会犯错。请核查重要信息。

15. 幻觉减半,废话砍三成!被骂一年,OpenAI 终于把 ChatGPT 改对了

16. 不知道大家想过这个问题没有,大家都感觉现在大模型的记忆存储受限,200万的上下文记忆其实也不够用。但我想说,其实即使大模型能够记住海量的上下文,也未必有用,它依然需要上下文的管理。也就是说,在AI时代,一个人非常重要的能力就是如何去管理上下文,去领导Agent。为什么这么讲呢?大家可以想想,如果记忆不受限,大模型可以无限存储,你和它聊的内容越多,它大脑里塞的东西就越满。在执行任务的过程中,它不知道到底应该怎么去执行,因为塞的东西太多了,哪个是核心的?是不是太多了?如果记忆太多,就容易导致错乱和模糊,因为你塞得太满,它不知道怎么执行,很多东西在里面很乱。所以,上下文管理是必须的。第二,即使大模型的记忆非常多,人和人之间沟通,一句话的理解都可能不同,何况大模型和人之间的沟通呢?这里面肯定也会存在交流的摩擦。所以,人需要及时干预和介入到大模型的工作流程当中,去管理上下文、管理整个流程,这是非常必要的。所以大家不要期待说,大模型的上下文越来越长就越好,不一定,有利有弊。即使大模型不会丢掉记忆,记忆永存,它依然不会精准地按照人类的要求去执行。我之前看过一个调查或研究,就是说大模型里,你上下文塞得越多越满,它的执行就会越混乱、越模糊,就是因为东西太多了,它不知道怎么执行了。所以,管理上下文这个事情,依然需要有人去管理、去做。#科技先锋官##How I AI#

17. 透过阿里MuleRun上线的Messages能力,可以看到「人机协同」的哪些趋势?

18. 独立游戏奖撤销《光与影》年度头衔,称「AI 惹的祸」,AI 创作在游戏领域面临哪些争议?

19. 昨天我刷 X (推特)的时候,看到智谱官方发布并开源了 GLM-4.7 大模型,而且面向 Coding 场景强化了编码能力、长程任务规划与工具协同。根据官方的介绍, GLM-4.7 在编程、推理与智能体三个维度实现突破:1、更强的编程能力;2、前端审美提升:GLM-4.7 在前端生成质量方面明显进步,能够生成观感更佳的网页、PPT 、海报3、更强的工具调用能力;4、推理能力提升;5、通用能力增强:GLM-4.7 对话更简洁智能且富有人情味,写作与角色扮演更具文采与沉浸感。我昨天测试了一下,给我最大的感受就是速度,写的可快了,而且很多复杂的需求,一次性就能完成,确实挺棒的。大家可以去试试 GLM-4.7 这个编码大模型。具体评测文章,大家可以看这里:网页链接#科技先锋官##微博年度新知博主##AI创造营#

20. 【有挑战性的反驳论点互动,能产生更准确的判断和更深的理解。微软2026年的后续实验也发现,在接受AI输出之前被要求先做结构化反思的人,推理质量远超直接采纳AI结果的人。 所以普通人用大模型的正确姿势,不是"有问题找AI",而是"有答案找AI吵架"。前者让你越来越懒,后者让你越来越锐利。】

21. “Skill 不就是长一点的提示词吗?” 上篇文章《别把整个 GitHub 装进 Skills,Skills 的正确用法 http://t.cn/AXqLcGP0 》发出去后,收到一些质疑: > "说 skill 能做配图 prompt 不行。本来 skill 就是加载 md,没 skill 之前我们用 prompt 模板照样也是能做流程编排。" > > "现在大部分 skill 不就是长一点的提示词吗?为什么说'单纯靠提示词做不了'?" 这些批评是对的。 我原文确实表达有问题。写"提示词"的时候,我下意识拿 Gem、Project、GPTs 里的那种提示词当例子。那些确实做不到一次性生成配图。 但"提示词"是个很宽泛的概念。如果我把 SKILL.md 的内容复制出来发给 Claude Code,再给它一个生成图片的脚本,它一样能完成配图任务。 这里的差异不在于提示词能不能复用,Gem 和 GPTs 里的提示词也能复用。差异在于:提示词配套的是 ChatBot,还是 Agent? 【1】ChatBot 和 Agent 的核心区别 Skills 的完整名称叫 Agent Skills。注意这个"Agent",它不是装饰词。Skills 利用 Agent 的虚拟机环境,提供单纯提示词无法实现的能力。 一句话总结:ChatBot 只能对话,Agent 能动手干活。 具体来说: ChatBot 不能调用工具。你给它一段配图提示词,它能帮你分析文章、生成画图 prompt,但真要生成图片?它只能说"请把这段提示词复制到 Gemini"。剩下的活还是你干。 Agent 能调用工具。同样的配图任务,它能像个经验丰富的编辑一样自己完成: 1. 读取你的文件 2. 分析需要几张图、放哪里 3. 为每张图设计内容和风格 4. 调用画图模型生成图片 5. 把图片插入正确位置 6. 输出成品交到你手上 全程自动化,你只需要验收。 【2】那 Skill 到底是什么? 很多人把 Skill 理解成"一段很长的提示词",这个理解对了一半。 SKILL.md 的核心确实是指令文本。但 Skill 不止于此。 一个 Skill 可以包含三层内容: 第一层:元数据。就是 name 和 description,告诉 Agent 这个 Skill 是干嘛的、什么时候该用。这部分在启动时就加载,但只占几十个 token。 第二层:指令。SKILL.md 的主体内容,工作流程、最佳实践、注意事项。只有 Agent 判断需要用这个 Skill 时,才会读取这部分。 第三层:资源和代码。附带的脚本、模板、参考文档。Agent 按需读取,用的时候才加载。 这就是官方说的"渐进式加载":不是一股脑把所有内容塞进上下文,而是用到什么加载什么。 所以你可以给一个 Skill 附带几十份参考文档,只要这次任务用不上,它们就不占用上下文窗口。传统提示词做不到这一点。 【3】为什么说配图"单纯靠提示词做不了"? 回到原来的争议。 如果你说的"提示词"是指发给像 Claude Code 这样的 Agent 的指令,那配图当然能做到。因为这时候提示词是发给 Agent 的,Agent 能调用工具。 但如果你说的是发给普通 ChatBot 的提示词,比如 ChatGPT 的自定义指令、Gemini 的 Gem、Claude 的 Project 指令,那确实做不到。因为 ChatBot 没有工具调用能力,它只能输出文字。 我原文的问题在于:默认读者理解的"提示词"是 ChatBot 场景下的提示词,但没有明确说出来。 更准确的表达应该是:Skill 必须配合 Agent 使用。发给 ChatBot 的提示词,无论写多长多详细,都只能完成对话能完成的事。要让 AI 真正"动手",需要的是 Agent + 工具调用能力。 【4】那我直接给 Claude Code 发长提示词不行吗? 行。 把 SKILL.md 内容复制出来当提示词发,Agent 一样能执行。这也是为什么有人觉得"Skill 就是长一点的提示词"。 但 Skill 的价值不在于"能不能做到",而在于: 可复用。写一次,以后每次相关任务自动触发,不用每次复制粘贴。 可组合。分析 Skill + 提纲 Skill + 写作 Skill,像乐高一样拼起来。单独的提示词模板做不到这种模块化组合。 可迭代。用着用着发现问题,直接让 Agent 帮你改进 Skill。下次自动生效。传统提示词模板改了之后,你得记得每次都用新版本。 可渐进加载。Skill 附带的资源文件不会一开始就占用上下文。你的提示词模板再怎么组织,发出去就是全量加载。 简单说:Skill 是提示词的工程化封装。能做的事差不多,但管理成本、复用成本、迭代成本完全不同。 【5】最后 上篇文章的核心没变:因需而建、可组合、可迭代。 Skill 就是长一点的提示词吗? 是的。但光有提示词不够。 关键是执行这段提示词的系统,到底是只会说的 ChatBot,还是能真正动手的 Agent。 Skill 是给 Agent 用的。没有 Agent 的工具调用能力,Skill 就只是一段躺在文件夹里的 Markdown。

22. 让 AI 少废话,token 直降 75%。这个插件🔥了。比如AI 帮你 debug,说了 1200 个 token,但是有用的是最后三行代码。开发者 Julius Brussee 做了个叫 caveman 的插件,让 AI 像穴居人一样说话:删冠词、删客套、删填充词。代码和报错信息原样保留,废话全部清零。效果:之前:「The reason your component re-renders is because you're creating a new object reference each render cycle...」之后:「Inline obj prop → new ref → re-render. useMemo.」这个插件先做的三件事:删冠词(a / an / the)、删填充词(just / basically / really / simply)、删礼貌话(Sure! / I'd be happy to / Let me explain)。具备四档压缩强度1)Lite——只删废话,语法完整2)Full(默认)——碎片句,穴居人模式3)Ultra——电报体,极限压缩4)文言文模式——用古汉语的信息密度压英文输出,「此非戏言,确实有效」实测数据React debug:69 → 19 tokens,省 87%Auth bug 修复:704 → 121 tokens,省 83%PostgreSQL 项目:1200 → 232 tokens,省 81%意外收获:更简短,模型更准arxiv 论文测了 31 个模型、1485 道题,发现加了简洁约束后,准确率在某些任务上反而提升了 26 个百分点。大模型的问题是「想太多」——它会把自己说进死胡同。强制简洁,直接截断这个过程。支持 Claude Code / Codex / Cursor / Copilot,一行命令装好。访问:github.com/JuliusBrussee/caveman#HOW I AI# #程序员#

23. 【告别Few-shot,自我验证才是AI准确性的未来】Meta AI研究人员发现了一种让大模型准确率提升94%的技术,而且完全不需要任何示例。这就是"验证链"(Chain-of-Verification,CoVe)。传统提示词的困境在于:大模型会产生幻觉,自信满满地给出完全错误的答案。Few-shot示例虽有帮助,但受限于示例选择、token预算,且依然无法根治幻觉问题。我们一直在治标,而非治本。CoVe的核心逻辑是让模型自己检验自己,分四步走:1. 生成初始回答2. 规划验证问题3. 独立回答这些验证问题4. 基于验证结果生成最终答案关键在于"独立"二字。模型单独回答每个验证问题,避免了循环论证——不再是为自己的第一个答案辩护,而是客观地核查它。生成与验证分离,这才是破局之道。实测数据:复杂问答准确率从68%跃升至94%,适用于GPT-4、Claude、Gemini等主流模型,无需微调,零样本即可生效。可以直接使用的提示词模板:[你的问题]请按以下步骤执行:1. 提供你的初始答案2. 生成3-5个能暴露答案错误的验证问题3. 独立回答每个验证问题4. 基于验证结果提供修正后的最终答案有人质疑这项技术早在2023年9月就已存在,为何现在才火。技术的价值不在于发明时间,而在于被真正理解和应用的时刻。也有人指出,说Few-shot已死有些夸张——在教模型语气和结构方面,示例仍有用武之地。这是进化,不是替代。更深一层看,这揭示了一个范式转移:从"给更好的示例"到"让模型更好地思考",再到"让模型学会自我怀疑"。真正的技能变成了:清晰描述任务,让模型思考,然后让模型质疑自己。AI准确性的未来,在于验证,而非生成。原文:x.com/godofprompt/status/2008125436774215722

24. 【当AI学会管理自己的记忆:递归语言模型如何终结"上下文腐烂"难题】Prime Intellect发布了递归语言模型(RLM),一种全新的推理策略,让AI不再被动接受冗长的提示词,而是主动将其视为可操作的动态环境。传统大模型有个致命软肋:上下文窗口越长,信息丢失越严重,业内称之为"上下文腐烂"。你给模型塞进去100页文档,它可能只记得开头和结尾,中间的关键信息早已模糊。RLM的解法很巧妙——它把输入数据当作Python变量来处理,模型自己决定检查哪些片段、拆分哪些任务、递归调用哪些子模块,整个过程在一个持久化的Python REPL环境中完成。几个核心突破值得关注:第一是"上下文折叠"。不同于传统RAG那种先总结再检索的套路(总结必然丢信息),RLM让模型主动把特定任务委派给子模型和Python脚本处理,信息完整性得以保留。第二是效率惊人。测试显示,用RLM包装的GPT-5-mini在长上下文任务上击败了标准GPT-5,而主上下文token消耗不到后者的五分之一。这意味着什么?小模型加上好策略,可以干掉大模型的暴力堆参数。第三是长程任务的连贯性。通过强化学习让模型端到端管理自己的上下文,系统能在跨越数周甚至数月的任务中保持思路清晰。这对真正的AI Agent至关重要——你不可能指望一个每隔几分钟就"失忆"的助手帮你完成复杂项目。同步发布的INTELLECT-3是一个1060亿参数的MoE模型(120亿激活参数),在Prime Intellect的完整强化学习栈上训练,性能对标闭源前沿模型,但完全开源开放权重。社区讨论中有个问题很尖锐:这和OpenAI、Anthropic现有的上下文管理方案有什么本质区别?答案在于层级不同。现有方案大多是外部编排,是"绕过"问题;RLM则把上下文管理内化为模型推理循环和训练目标的一部分,是"解决"问题。当任务需要持续运行数天甚至数周时,这个区别就会显现出来。有人评论说这个思路"显而易见到奇怪为什么不是默认做法"。确实,人脑处理短期记忆和规划任务时,本质上就是这么运作的——选择性关注、分块处理、递归调用。但"显而易见"和"能做好"之间往往隔着五年的工程积累,就像推理能力的研究2019年就有了,真正爆发要等到o1。更深一层看,这触及了一个根本问题:如果你想造出超越人类的智能,或许应该从无限递归上下文开始,因为这正是人类认知的运作方式。一个被冻结在时间中的大脑不可能真正学习或理解任何东西。迄今为止发布的每一个大模型,要么被冻结在时间中,要么在上线后不久就因为上下文问题而崩溃。当模型能够程序化地"窥视和检索"自己的提示词时,暴力扩展上下文窗口的路线是否已经过时?这个问题的答案,可能决定着下一代AI架构的走向。reddit.com/r/singularity/comments/1q1vcvf/prime_intellect_unveils_recursive_language_models

25. 如果写论文时大量使用AI将自己写的中文内容翻译成英文,那么会不会被认为是AI代笔?

26. AI提示词技巧!一文学会高效地对AI进行提问

27. 彻底摆脱AI味儿!用这3个邪修指令,强到离谱了…【旁门左道PPT】

28. 普通人做什么容易成功逆袭?建议大家多去练写作,谁掌握了写作的精髓,谁就多一门傍身的手艺!#写作#读书#好书分享

29. 鹏说:AI Trading Agent时代下的思考

30. AI反向影响人类话语的习惯。我现在看到博主们说“这不是空洞的xxx,而是有扎实数据支持”这种话就很警惕。你咋知道这博主是真的懂,还是纯让AI现写的。再说AI确实会分析资料,但会分析就算懂?看到评论留言说“请详细分析xxx”就很反胃,这是拿真人当AI问了。

31. 大模型上下文工程指南

32. 发现一个AI的新用法,再也不用担心不会写提示词了!

33. AI 术语通俗词典:提示词(Prompt)

34. 全球大模型第一股,为啥是家中国公司? #智谱 #智谱上市 #智谱IPO #GLM大模型 #全球大模型第一股诞生

35. #2月DeepSeek还会发新模型吗#AI圈2月模型的发布和迭代处于一个高峰期!头部厂商扎堆上新大模型,DeepSeek的新模型动态目前其新模型已完成灰度测试,技术储备到位,大概率会在2月正式亮相。根据目前媒体的爆料来看,DeepSeek的新模型主要亮点应该在:1M Token超长上下文,可轻松处理完整长篇文档;Engram条件记忆架构,大幅降低推理成本;强化数学与代码能力三个方面。巩固开源领域优势,同时更新知识库,提升多模态文档理解能力。也是DeepSeek稳稳抓住关注的关键。因为“长上下文+低成本”的差异化优势,精准匹配法律、金融等专业场景,开源属性也贴合开发者与企业需求。#过个有AI年# #HOW I AI#

36. 让任何 LLM 说人话。不废话, 不客套, 直接给答案。地址:github.com/hexiecs/talk-normal/一段 system prompt, 把 LLM 啰嗦的、客服腔的输出变成直接、有信息量的回答。适用于任何模型 (GPT, Gemini, LLaMA 等)。在 GPT-4o-mini 上测试 减少 73% 输出长度, GPT-5.4 上 减少 72%, 同时保留所有有用信息。#How I AI#

37. LangChain Agent 年度报告:输出质量仍是 Agent 最大障碍,客服、研究是最快落地场景

38. RL后训练LLM是否等同于收集更多正reward的数据SFT后训练?

39. AI幻觉确实是一个值得深思的现象。AI幻觉的核心矛盾是技术局限性与人类滥用风险的叠加,它既是AI发展的阶段性问题,也正在倒逼人类重构信息使用的规则。三个层面聊一聊这个问题一、本质:并非撒谎,而是概率性输出的偏差AI幻觉(如无中生有、编造数据、逻辑自洽的错误结论)的根源,并非其具备主观欺骗意图,而是底层技术逻辑的特性:1. 生成逻辑的先天局限:大语言模型(LLM)的核心是基于海量数据学习文字序列的概率关联,而非理解事实本身。它的目标是生成看起来合理的内容,而非绝对正确的内容,当训练数据存在缺失、模糊或冲突时,就容易拼接出符合语法和逻辑、但违背事实的幻觉。2. 能力边界的模糊性:AI无法主动识别自己不知道的事,面对超出训练范围或需要精准事实核查的问题(如冷门历史细节、未公开的科研数据),它会通过合理推演填补信息空白,最终形成幻觉。二、风险:图片现象放大了幻觉的连锁效应图片中博主提到的拿AI结论当证据,这一行为让AI幻觉从技术瑕疵升级为认知风险,主要体现在两方面:1. 误导个体决策:当用户将AI生成的错误信息作为论证依据(如职场方案、学术讨论、生活决策),且未进行二次核查时,会直接导致判断失误,甚至形成认知固化,将AI的幻觉当成既定事实。2. 加剧信息失真:错误的AI结论一旦被传播,会混入网络信息池,成为后续AI训练的污染数据,形成幻觉再生产的恶性循环,正如评论所言AI幻觉很快变成人类的幻觉,最终模糊事实与生成内容的边界。三、应对:不是否定AI,而是建立人机协同的核查机制AI幻觉无法被彻底消除,但可以通过技术优化+人类规范将风险降到最低,核心思路是不把AI当答案库,只当辅助工具:1. 技术层面的持续迭代:开发者通过检索增强生成(RAG)让AI先调取真实数据库再输出、加入事实核查模块、优化训练数据的权威性等方式,减少幻觉产生的概率。2. 人类层面的使用准则:对AI输出的事实性内容(数据、案例、结论) 必须交叉验证,优先核对权威来源(官方文献、核心期刊、正规媒体);明确AI的适用场景,将其用于灵感激发、草稿生成、逻辑梳理,而非事实论证、证据支撑;提升媒介素养,建立AI内容=待核查内容的默认认知,避免盲目采信。AI幻觉是技术发展的成长痛,它的存在提醒我们:AI是提升效率的工具,而非判断事实的权威。在AI时代,独立核查和批判性思维,会成为比以往更重要的能力。

40. 《扣子开发 AI Agent 智能体应用》018-提示词编写和优化(扣子平台设置提示词案例)

41. 蚂蚁数科王磊:垂直大模型训练成本呈百倍级下降,金融AI落地需构建“可信智能体”三大基石 | Alpha峰会

42. #清朗行动整治数字泔水等垃圾信息# 整治的内容,完全是针对现实问题。比如: 宣扬鼓吹不婚不育、反婚反育等不良价值观,挑动男女性别对立,渲染“婚姻恐惧”“生育焦虑”。比如:通过“同城交友”“过年搭子”等话题发布暗示性图文信息,进行色情引流。比如:利用AI等新技术新应用批量生成逻辑混乱、信息空洞、高度雷同的低质内容。

43. 在设计Agent系统提示词的时候,与其对一份系统提示词进行反复修改,不如让这个Agent使用的LLM模型自己生成系统提示词,你要修改的其实是LLM生成系统提示词的用户提示词,而不是直接修改系统提示词,应当对Agent进行版本控制的是用来生成系统提示词的用户提示词。

44. 大模型的记忆能力现在完全靠内存的大小决定,也就是上下文的大小决定了当前大模型的智能水平。这与去年我们玩小模型硬吃显存的逻辑是不一样的。现在经过量化的小模型已经能稳定地高效产出tokens。我在本地的gemma4上下文测试时一直对话,上下文的用量除着对话不断抬升内存用量,直到拉满然后爆炸了。从内存用量一半到爆炸,GPU显存几乎纹丝不动。也就是说对显存的需求被量化的压缩给控制住了。硬件从GPU的算力,发展到了存储容量的记忆力比拼。所以各大厂商都在无限堆推理上下文内存。但对内存的依赖应该在算法上可以优化,将上下文进行关键压缩和向SSD固化,需要时再对内存激活。不过内存厂家也是SSD厂家。这就是为什么最近半年多,内存被拉冒烟的根本原因。当LLM的算法遇到scaling law的天花板,内存大小决定了智能化程度。注意算法扰动,如果真出现数倍级压缩算法,那么内存的预期就会被暴击。因为现在认为内存决定能力还看不到天花板。我们迫切需要内存上下文量化技术和内存版MOE的出现。

45. 元宝向用户道歉,此前生成拜年海报中出现脏话,AI 为何会输出侮辱性内容?此事带来哪些警示?

46. 模型一换 帧率减半!2026年零售机性能大横评【新评科技】

47. 刚刚问了claude,它说中文语料中某些专业领域(金融、法律、医学、技术文档)的高质量文本偏少,模型更容易在这些区域"编"。如果是写system prompt、定义角色、设定输出格式,英文表达的精确度和模型的遵从度会更高。想降低幻觉的一大关键不是切换语言,而是让它去搜索(英语资料来源),不要只凭记忆/生成回答。

48. 网传元宝 AI 辱骂用户,腾讯称是模型异常输出,非人工回复,技术上如何分析?其他 AI 也可能这样吗?

49. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

50. 盘点一周AI大事(4月12日)|Mythos太强不敢发布 Anthropic官宣最强大模型Claude Mythos OpenAI发布超级智能经济蓝图 Meta发布大模型 Muse Spark 智谱上线最强开源大模型GLM-5.1 Anthropic上线Agent包工头Claude Managed Agents Gemini上线概念可视化visualizations 阿里发布最强视频模型HappyHorse-1.0 米哈游发布最强数字人模型LPM 1.0 Ace开源最强音乐模型ACE-Step-1.5-xl 研究员开源最强虚拟试穿模型Vanast #前沿科技趋势发布月 #AI新星计划 #AIGC #大模型 #Agent

51. 数据比模型更值钱,国内最大的「端侧」训练数据开源了!600B 预训练+千万级 SFT 核心数据配方公开

52. 高效提示词(prompt)工程指南

53. 起点百分之十的新书使用AI润色,起点会因为AI文而完蛋吗?

54. 为什么你的AI只会输出废话?少了数据库!

55. 为什么你的AI回答像废话?这3个Prompt技巧让AI开窍

56. AI写作两极分化

57. AI工具的个人化改造

58. 为什么你用AI,总觉得它在说废话?真相很扎心,附方法论

59. AI 写得像废话,往往是没理解素材

60. 嫌AI写得像废话?是你的提示词太蠢

61. 为什么AI写出来的东西总是很空?我后来才发现问题不在AI

62. 怎样用AI写出没有“AI腔”的文章

63. AI不缺内容,缺判断丨塔迪GEO判断工程

64. 为什么 AI的回答总是又浅又空?因为背后有个更大的局

65. 新人类访谈录——越用 AI,我反而越不会创作了

66. AI越强,你的在线社群越无聊

67. 当AI内容“支离破碎”

68. 为什么你发的作品,永远只有几百播放?很大概率是,你的作品被算法判定为低质内容了。

69. 小白学 AI,别背提示词模板

70. 10个让AI智商翻倍的万能提示词

71. 2026提示词测试实战

72. AI提示词万能用法

73. 让AI变聪明|提示词到底怎么用

74. 提示词写得好,AI效率翻倍

75. 分享一份”万能”提示词

76. “完美”的提示词,也会闯祸?

77. AI 上下文质量决定论

78. 别再随机 prompt 了,Agentic Skills 才是让 AI 稳定输出的正确姿势

79. 真正限制大模型的,不是上下文大小,而是“上下文腐烂”

80. 大模型的能力边界

81. AI和大模型——上下文腐坏

82. 大模型上下文注意力衰减边界

83. 当AI生成内容开始说谎,我们如何为大模型驱散“幻觉”的迷雾?

84. 大模型幻觉问题,产品经理该怎么兜底?

85. LLM 幻觉的架构级修复

86. 如何系统性地减少大模型“幻觉”

87. 让AI写材料出彩的七个润色法则

88. 5分钟学AI

89. AI润色

90. 怎么把AI文章去掉机器味?12个傻瓜润色公式,小白直接照搬!

91. 英语论文润色只是改语法吗?从 AI 润色到人工润色的差异解析

92. 10条润色指令,让文章看不出“机器味”,AI痕迹从60%到0%!

93. 2026年AI写作横评

94. 清北学霸都在用的40个通用提示词,一小时内完成学术写作初稿

95. AI原创写作 让算法生出灵魂

96. 用AI辅助写论文后,常出现的问题及解决方法!

97. AI的出现,使得真实经验与判断能力更具穿透力

98. AI 生成内容正在淹没互联网?新论文揭示内容生态的隐形危机

99. 为什么你用的AI总说废话?因为你没写够2000字的提示词。

100. “别让AI废话了!一条命令省75% Token” AI写代码最烦的不是不会写,而是太爱“自作主张”。 你让它修一个 bug,它顺手重构半个项目; 你让它优化函数,它开始改架构; 你只想要答案,它先输出一大堆废话,Token 哗哗烧。 Matt Pocock 最近开源了一套 AI 编程技能工具, 里面的 /grill-me、/caveman、/tdd 等技能, 专门用来约束 AI 写代码:先问清楚、少说废话、先测再写。 尤其是 /caveman,主打让 AI 只说人话,减少无效输出, 对经常用 Claude Code、Codex、Cursor 写代码的人很实用。#AI工具 #AI编程 #ClaudeCode #开发效率 #省Token

101. 为什么AI视频总像抽盲盒?别傻写提示词了,一文看懂底层逻辑

102. AI提供的信息不靠谱 开发者要担责吗

103. AI时代,废话要花钱了!快来看看自己中招没有

104. 为什么你的AI总说废话?手把手教你写出“高智商”Prompt

105. 苹果论文:AI不会真推理,加句废话准确率暴跌65%

106. 大模型幻觉:分类、成因与检测方法

107. 为什么Bert的三个Embedding可以进行相加?大模型是参数量越大越好吗?如何高效提升大模型的RAG效果?数据挖掘中的特征工程应该怎么做?

108. 3. 学习Claude八大提示词框架!只会说“请帮我”?这才是让AI变聪明的“编程级”姿势引言:不只会聊天

109. 终于搞懂了!大模型上下文到底是什么?还在迷信“上下文越长,AI越聪明”? 这两个概念,90%的人都搞反了! 上下文=大模型的“工作记忆窗口” • 模型没有长期记忆,每次只能读取窗口里的内容 • 窗口里装着:系统指令+历史对话+当前输入+生成内容 • Token是上下文的“货币”:中文1字≈1-2Token,128K≈10万汉字 • 窗口有上限,本质是算力和内存的限制,不是设计缺陷 3个致命误区,你中了几个? 1. 长上下文≠全部理解:关键信息放中间,模型容易“Lost in the Middle” 2. 上下文≠记忆:Claude“记得”对话,只是每次都重新传了历史 3. 塞满窗口≠高效:截断会失忆、压缩会失真,RAG才是精准方案 💡 正确使用姿势: 重要指令放开头/结尾,别埋中间;长文档分段处理;跨对话靠数据库记忆。 用好窗口,比买更大的窗口更重要! 收藏起来,下次用AI别再踩坑! #AI #大模型 #ChatGPT #Claude #上下文窗口

110. 大模型如何避免“幻觉”(编造事实)?

111. AI大模型与Agent工具实战:从全局架构思维到人机协同

112. AI产品经理必知:大模型幻觉边界,该怎么牢牢守住?

113. 从文本助手到生产力智能体——2025大模型年度测评:多模态、强推理与真交付

114. 你的 AI 编程助手,可能有一半的 token 都花在了废话上

115. 为什么大模型要限制上下文长度?不是故意卡你,是你没找对记忆方法

116. 投 SCI 必看:AI 润色和人工润色差别在哪?教你精准选 - 哔哩哔哩

117. SCI润色别踩雷!AI工具vs人工润色,这篇教你精准选

118. 20+零废话AI提示词公式!豆包Kimi这样用,输出全是硬核干货

119. 研究范式转变——智能体式推理。📚arXiv: 2601.12538 (Section 2) ✏️标题: Agentic Reasoning for Large Language Models - Introduction 📄一句话介绍:从封闭推理到开放交互,重新定义LLM作为自主智能体的推理范式 🎯核心主张 传统大语言模型在封闭环境中表现优异,但面对开放、动态的真实世界场景时能力受限。本文提出"智能体推理"(Agentic Reasoning)这一新范式,将LLM重新定义为能够规划、行动并通过持续交互学习的自主智能体。这标志着从静态问答向动态决策的根本转变。 论文基于约800篇相关研究的系统分析,构建了三维度框架:基础能力、自我演进、多智能体协作。同时区分两种优化路径:上下文推理(测试时扩展)与后训练推理(RL/SFT优化)。 🔬代表性研究方向 1. 环境动态性分层 - 稳定环境:单智能体基础能力(规划、工具、搜索) - 动态环境:反馈驱动的自适应学习 - 复杂环境:多智能体协调与知识共享 2. 优化范式划分 - In-context Reasoning:通过结构化提示扩展推理深度 - Post-training Reasoning:通过强化学习优化行为策略 3. 应用领域覆盖 数学发现、代码生成、科学研究、机器人、医疗健康、自主研究、网络探索等七大领域 📊研究规模 本综述长达135页,系统梳理智能体推理领域的核心设计与训练范式,并明确指出个性化、长视野交互、世界建模、可扩展多智能体训练等开放挑战。 作者单位:伊利诺伊大学厄巴纳-香槟分校、Meta、Amazon(亚马逊)、谷歌DeepMind、加州大学圣地亚哥分校、Yale University(耶鲁大学) #智能体 #AI #大模型 #Agent #知识前沿派对

120. 大模型幻觉治理:8 个可落地的企业级缓解策略

121. 破解AI大模型“幻觉”难题:实用策略与技术应对全指南

122. ProGRPO怎样提升AI推理路径多样性?

123. 大模型应用开发-2 上下文工程

124. AI和人工润色特点大盘点:效率与深度的博弈

125. Agentic RAG失败的检索也能榨出学习信号?Search-P1 做到了

126. AI提示词指令提示词合集(含教程)

127. Prompt工程实战:我用这5个技巧让AI输出质量提升了40%

128. AI 写代码越来越快,但谁来保证质量?

129. AI Agent推理链可视化全链路实现解析

130. AI决策的新路径!强化学习+符号推理,准确率提升19%! AI推理研究中,传统强化学习模型常陷入“决策短视”困境:虽能通过试错优化即时收益,可面对逻辑链复杂的推理任务时,不仅易忽略前提条件与结论的关联,还难应对多步推理中的不确定性,导致推理结果逻辑性薄弱。而近期NeurIPS、ICLR的重磅成果,以强化学习+符号推理模块的融合架构打破了这一僵局,该方向正成为AI逻辑能力升级的核心趋势。符号推理模块为智能体搭建逻辑规则框架,引导强化学习聚焦关键推理节点,在数学定理证明任务中,融合模型较纯强化学习推理准确率提升23%,复杂步骤的逻辑连贯性提高30%;在多轮问答场景下,它成功解决“答非所问”问题,推理响应的准确率提升19% #强化学习 #符号推理 #强化学习算法 #顶会论文 #sci论文

131. AI是否真的懂我们,许多人心存疑虑,特别是当大模型一本正经地输出似是而非的答案时。

132. 别给 AI 废话买单!Caveman 一键狂省 75% Token,爆火 2 万 Star 的省钱神器来了

133. AI决策的新路径!强化学习+符号推理,准确率提升19%! AI推理研究中,传统强化学习模型常陷入“决策短视”困境:虽能通过试错优化即时收益,可面对逻辑链复杂的推理任务时,不仅易忽略前提条件与结论的关联,还难应对多步推理中的不确定性,导致推理结果逻辑性薄弱。而近期NeurIPS、ICLR的重磅成果,以强化学习+符号推理模块的融合架构打破了这一僵局,该方向正成为AI逻辑能力升级的核心趋势。符号推理模块为智能体搭建逻辑规则框架,引导强化学习聚焦关键推理节点,在数学定理证明任务中,融合模型较纯强化学习推理准确率提升23%,复杂步骤的逻辑连贯性提高30%;在多轮问答场景下,它成功解决“答非所问”问题,推理响应的准确率提升19% #强化学习 #符号推理 #顶会论文 #sci论文 #抖音热点记忆2025

134. 姚顺雨署名:大模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench

135. #上头条 聊热点##我们应该如何正确使用AI工具# 正确使用AI工具的三重准则 1. 阶段化辅助,拒绝一键生成 AI工具的核心价值是“协作”而非“替代”。论文写作时,先通过AI生成带创新点的选题和大纲,经导师审核后再推进,接着让AI梳理核心文献、补充权威数据,最终分段扩写完成初稿。这种分阶段介入,既能规避“内容空洞”“杜撰参考文献”的风险,又能保证成果符合个人需求。 2. 场景化选择,匹配专属工具 根据应用场景挑选精准工具,效率提升更显著。撰写宝鸡本地美食推广文案,可选用GPT-4这类文本生成工具,突出岐山臊子面、凤翔豆花泡馍的地域特色;制作文旅宣传海报,则用DALL-E、Midjourney生成适配视觉需求的插图。 3. 个性化定制,植入个人风格 要避免AI创作的同质化,需将个人特色融入过程。可上传过往宝鸡方言短视频作为训练样本,让AI学习独特的表达习惯,后续生成的内容会更贴合个人风格。生成后还要人工审核、修改,检查逻辑结构、语法错误,确保最终作品兼具效率和个性。

136. 为什么你让AI写的东西总像废话? 学会这个框架,输出翻10倍 为什么你让AI写的东西总是很水? 不是AI不行,是你提示词没写对。 今天分享一个提示词框架,叫CRISPE 学会它之后,不管写文案、做内容、方案策划 AI输出质量真的提升一个档次 6个维度,看完你就会用 建议收藏起来慢慢练 #ai提示词 #AI教程 #抖音干货 #AI学习 #提示词框架

137. 带你读姚顺雨最新论文 | 别只卷长文本,AI的“上下文学习”能力才是关键!

138. SCI润色别踩雷!AI工具vs人工润色,这篇教你精准选择

139. 大语言模型为何会“说谎”?幻觉现象的识别与检测

140. 人工润色 vs AI润色——科研作者应如何审慎选择

141. 人工润色 vs AI润色:科研作者到底该怎么选?

142. 2026年专业AI论文写作工具与通用大模型的学术内容生成质量对比研究

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章