张大妈

AI变“迟钝”了?别急着怪算力,先看它忘了什么

源自111位全网作者

06-04 16:18

内容由AI生成

精选参考来源

1. 伯克利神作背刺OpenAI:持续学习才是真神!

2. 2026年AI全景预测:迈向百亿智能体时代的20个发展趋势。 #大咖观察 #人工智能 #红衣聊AI #智能体 #AI时代

3. OpenAI 翁家翌的新博文:Learning Beyond Gradients 地址:trinkle23897.github.io/learning-beyond-gradients/ 翁家翌提出一个想法:未来的“学习”不一定只发生在神经网络权重里,也可以发生在一个不断被 AI 编程代理维护、修改和改进的软件系统里。文章称这种方式为 Heuristic Learning,启发式学习。 “Continual Learning 一直难以被解决,主要卡在神经网络的灾难性遗忘:学了新东西,旧能力就容易被冲掉。那如果不把目光只放在神经网络权重上,还有没有其他解决方案? 随着 LLM agent 变强,coding 的速度和质量都在提升。但我最近更在意的是另一个现象:coding agent 不训练新网络、不更新权重,只是持续看失败、改代码、加测试、看回放,也能把一套程序系统越养越强。 这让我重新看待 heuristic,也就是手写规则和程序策略。过去很多 heuristic 不是没用,而是没人养得起;coding agent 改变的是这条维护成本曲线。于是,过去只能当一次性补丁的规则,开始变成值得长期拥有的代码。 凡是可以被持续迭代的,都开始能被解决。这也是 Continual Learning 一直想要解决的问题。它会是既 Pretrain、RLHF、Large-scale RL/RLVR 之后的下一个范式吗?” #AI创造营#

4. 反直觉:前沿模型虽然贵,但反而更好卖#AI #大模型 #芯片 #ChatGPT #Token

5. VLA 在微调之后,能遗忘到什么程度?上交CVPR'26的工作给出了答案

6. 大模型上下文工程指南

7. DeepSeek v4全面支持百万上下文 token,这意味着什么?到底有多厉害?

8. 人类很容易跟踪可疑目标,智驾却很难只有更长的上下文,才能让智驾系统持续、稳定、不丢失地跟踪动态危险目标(横穿行人、加塞车辆、逆行非机动车等),减少“突然消失、突然出现、ID 切换”的跟踪错误,显著提升极端路况下的安全性特斯拉模型架构迭代的方向,在不断增加上下文长度特斯拉terafab不但要造逻辑芯片,还要造存储因为延长上下文长度,主要依赖更大的存储来支撑 KV Cache#特斯拉fsd##人工智能 # 刘智驾的微博视频

9. 都在问泡沫何时破,老黄直接下了更大的赌注 #英伟达#黄仁勋#ces2026#GPU#AI新星计划

10. 提示词工程、上下文工程都过时了,现在是 Harness Engineering 的时代

11. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

12. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】

13. 告别KV Cache枷锁,将长上下文压入权重,持续学习大模型有希望了?

14. 18个月,中国Token消耗狂飙300倍!别乱烧钱了,清华系AI Infra帮你腰斩API成本

15. DeepSeek V4 网页端《原神×我的世界》融合小游戏代码测试:拳打 ChatGPT,脚踢 Gemini,硬刚 Claude

16. 【8GB显存也能训大模型?Unsloth重新定义个人AI硬件边界】快速阅读:Unsloth AI 发布了针对 Gemma 4 的免费训练笔记本,通过优化算法,让仅需 8GB 显存的家用显卡也能实现比以往快 1.5 倍、显存占用降低 50% 的微调任务。这标志着大模型训练正从昂贵的云端集群向个人本地硬件转移。---训练大模型似乎一直是个重型工程,像是在试图用一辆家用轿车去拉动一列货运火车。但 Unsloth AI 现在的做法,更像是给这辆小车换了个超高效的变速箱和轻量化底盘。只要 8GB VRAM,就能在本地跑起 Gemma 4 的微调。这意味着那些躺在抽屉里的 RTX 2070S 甚至老旧的显卡,突然也有了参与这场智能革命的机会。有网友开玩笑说,这听起来像是在客厅里制造 Skynet 的前奏。这种效率的提升不仅仅是数字上的变动。当指令集和内存管理变得如此精简,本地运行大模型的工作负载将变得不可避免。硬件能力的边界正在被重新定义。不过,这种轻量化也有代价。有观点认为,在 8GB 显存的极端约束下,微调出的模型输出能力可能会受到显著限制。这就像是在内存极小的系统上跑精简版操作系统,虽然能动,但指令集总归是残缺的。大家讨论的热点也散落在细节里:LoRA 还是全量参数微调?如何避免灾难性遗忘?甚至有人在尝试将任务分流到 CPU 上。这种技术的演进更像是一个编译器的优化过程。当原本需要昂贵算力支撑的计算图,通过重构和压缩,能够塞进消费级硬件的缓存层时,真正的个人 AI 时代才算真正落了地。现在的疑问是,当我们能用如此廉价的成本去定制模型时,我们究竟会训练出什么?是更懂特定领域的专家,还是仅仅又多了一个堆在硬盘里吃灰的数字标本?GitHub: github.com/unslothai/unslothGuide: unsloth.ai/docs/models/gemma-4/train

17. 【大模型持续学习的真相:很多方法,从一开始就找错了方向】我们从不缺少实现持续学习的尝试——从自蒸馏、实时强化学习到内存脚手架、重放方法或梯度投影。但遗憾的是,许多方法甚至没有在试图解决正确的问题。基于经典机器学习文献与前沿对话,我尝试为大语言模型(LLM)的持续学习勾勒一个兼具原则性与野心的定义。+ 核心愿景:我们追求的是让 LLM 在顺序接触到分布迥异的新数据时,能够高效且具组合性地习得新能力,同时至少完整保留其通用能力。以下是这一定义的五个核心维度:1. 通用能力的保留持续学习的基石挑战是“灾难性遗忘”。当模型接触稀疏新数据时,必须确保其原有的语言能力、指令遵循和逻辑推理不发生退化。2. 顺序学习而非多任务并行目前我们通过混合大规模数据来规避分布偏移,但这并非真正的学习。真正的持续学习应当像现实世界一样,能够从依次出现的数据流中提取表征。3. 应对分布偏移如果新旧数据分布几乎一致,持续学习将变得毫无挑战。真正的考验在于,当模型遇到与其训练分布完全不同的任务时,是否依然能稳健地吸收知识。4. 极致的效率如果拥有无限的计算资源和数据,内化新知识是平庸的。持续学习的本质在于效率——我们不能为了记住昨天与用户的一段对话,就去重新训练数万亿个 Token。5. 跨阶段的技能组合这是最高级的要求:模型不仅要记住 A 和 B,还要能将在不同时间点习得的技能进行“化学反应”。例如,先学编程,后学逻辑,模型应能自发组合出更强的代码推理能力。+ 为什么必须是“参数化”的持续学习?很多人认为,通过 RAG(检索增强生成)或外部脚手架(如 Markdown 文件、向量库)就能解决记忆问题,何必非要动模型的权重?但我认为,权重内的参数化学习有两大不可替代的优势:- 规模化增长(Scaling):外部挂载的知识库会遭遇“上下文腐烂”和检索瓶颈。随着技能树的增长,外部方案往往边际递减。而参数化知识能从底层改变每一跳推理的“智力密度”,让模型越学越聪明,而非越学越臃肿。- 自动化组合(Automaticity):神经记忆允许知识进行超高效的自动重组。这种“直觉式”的跨领域联想是检索无法企及的。就像学习编程能自动增强非代码领域的逻辑感一样,这种深层表征的进化才是真正的进化。+ 未竟的思考实现这一目标仍面临重重迷雾:- 知识覆写:当新旧知识冲突时(如软件库版本更新),模型该如何权衡?- 数据效率:参数化学习目前的样本效率远低于上下文学习,合成数据的质量将成为关键瓶颈。- 认知核心:我们是否应该剥离百科全书式的记忆,只训练一个极其擅长使用外部工具的“认知核心”?持续学习不仅是技术挑战,更是通往通用人工智能(AGI)的必经之路。我们正在与 Prime Intellect 合作开发一套全新的评估方法,试图真正量化这些理想特性。x.com/carnot_cyclist/status/2041479655035679163ref: arxiv.org/abs/2511.00318

18. 腾讯、阿里都开始给员工发Token,鼓励使用 AI 工具工作,Token 以后会成为大厂福利标配吗?

19. 2026年AI主线换了!这5大趋势必须看清。 #大咖观察 #红衣聊AI #趋势风口 #人工智能

20. 17000 token/s,比B200快48倍!Taalas AI 芯片能否颠覆英伟达GPU?

21. LLM强化学习不稳定之谜,被Qwen团队从「一阶近似」视角解开

22. 姚顺雨在腾讯首个研究:在“上下文”这事上,在座的各位都不及格

23. 说实话,我认为记忆力是目前持续学习的最大障碍。让我夜不能寐的问题是:我们如何利用记忆避免重蹈覆辙?我们如何教会模型有选择地记忆和遗忘?何时呈现正确的背景信息?人类通过记忆巩固、干扰管理和情境绑定自然而然地做到这一点,然而,我们尚未找到复制这种机制的方法。人类海马系统与当前LLM记忆架构之间的差距揭示了一个根本性的挑战:我们基本上构建了两个极端:要么是将所有信息都硬编码到参数中的模型(刚性模型),要么是使用RAG(随机数生成器)机械地检索信息(模糊模型)。真正的持续学习要求我们破解智能检索的密码;不仅要知道存储什么,还要知道抑制什么、何时强化,以及如何让旧知识优雅地消退而不造成灾难性的干扰。非常喜欢这篇调查,因为它从宏观角度展现了 LLM 和多模态模型中的记忆架构(也很喜欢其中受大脑启发的分类法,很棒!)。我会尽我所能系统地绘制出它的图谱。三部分框架:他们围绕新皮层-海马体-前额叶皮层的类比来构建记忆:内隐记忆/新皮层涵盖了嵌入模型权重中的参数知识,包括记忆编辑技术(如 ROME 和 MEMIT,它们通过精确修改权重来更新事实)、通过 LoRA 等适配器注入知识,以及通过记忆遗忘来删除有害内容。显性记忆/海马体研究外部检索系统;RAG架构、向量数据库、知识图谱。它们详细阐述了如何在不同的粒度(文档、组块、句子、图结构)和优化时间(无训练、联合预训练、SFT等)下组织记忆。智能体记忆/前额皮层探索自主智能体如何维持短期记忆(CoT++)与长期记忆(外部事实数据库、历史轨迹、用户反馈等)。我非常喜欢这个关于记忆的思考框架,但我认为除了分类之外,这项调查最大的贡献在于指出了尚未解决的问题:记忆污染/幻觉、大规模检索的计算负担、何时应该检索信息而不是依赖参数化知识,以及长时间交互过程中记忆一致性的挑战#科技先锋官##ai生活指南##ai创造营#

24. 【大模型遗忘之谜:SFT、RL 与 OPD 的本质差异解析】快速阅读:本文通过分布视角重新审视了 SFT、RL 与 On-Policy Distillation (OPD) 的本质区别。核心观点认为,决定模型性能与泛化能力、抗遗忘能力的,并非算法本身,而是数据的 On-Policy 特性。如果我们把语言模型看作一个概率分布,后训练的过程本质上是在重塑这个分布。SFT 就像是一个强力的外部拉力。它拿着一份现成的、固定的数据集,强迫模型去拟合。因为它是基于交叉熵的,模型并不关心自己原本的分布是什么,只要目标在那里,它就会拼命往那边靠。这种“直接拉拽”虽然效率高,但代价很大:一旦目标分布与原分布偏差过大,模型就会发生灾难性遗忘,因为它失去了对原有知识的保护。RL 则完全不同。它没有预设的外部目标,而是让模型在自己的分布里采样,根据奖励函数的方向进行优化。这种方式更像是寻找“期望奖励最大的方向”。有意思的地方在于 OPD。它处于两者之间:既有老师提供的信号,数据又是学生自己生成的。实验发现一个反直觉的现象:即便老师是用 SFT 练出来的、带有遗忘倾向的模型,通过 OPD 训练出来的学生,竟然比老师本身表现得更好,且遗忘程度更轻。这说明老师的分布并不是决定性的,数据的来源——即 On-Policy 采样——才是核心。SFT 的梯度是均匀且密集的,它不分青红皂白地推高每一个 token 的概率,哪怕是那些没意义的语气词。而 RL 或 OPD 具有某种天然的“数据依赖正则化”。当模型面对不确定的状态时,更新幅度会自然减小。目前业界正趋向于将专家能力通过 OPD 融合进最终模型。如果我们要寻找超越 RL 的更优算法,关键不在于复杂的 KL 约束,而在于如何同时获得蒸馏的密度、RL 的无偏性以及 On-Policy 的稳定性。目前的难题依然存在:奖励信号要么太稀疏(RL),要么带有太强的偏差(蒸馏)。x.com/nrehiew_/status/2053482349300797526

25. AI 是否有 Token 预算意识,能养成「花小钱办大事」的习惯吗?

26. #互联网技术[超话]##个重磅信号!#黄仁勋 #AI #人工智能#机器人 #自动驾驶 #CES2026 #英伟达#新年演讲# 黄仁勋在2026年CES展会上的新年首场演讲,以"物理AI"为核心主题,宣告人工智能正式迈入从理解数字世界到改造物理世界的新阶段。以下是演讲的核心内容整理: 一、时代定调:双重平台转移开启AI新纪元 黄仁勋指出,计算机行业正经历十年一遇的"平台重置",同时发生两大平台转移:一是应用程序全面构建于AI之上,软件开发从"编程"转向"训练",运行载体从CPU迁移至GPU;二是软件的开发与运行逻辑彻底革新,AI应用不再是预编译的固定程序,而是能理解上下文、实时生成内容的智能系统。这一变革正驱动全球价值约十万亿美元的计算机基础设施进行现代化改造。 二、物理AI的ChatGPT时刻已至 物理AI成为演讲的核心焦点。黄仁勋认为,AI的演进可以分为四步:感知AI、生成AI、代理AI、物理AI。当模型能够理解重力、摩擦、惯性、动量守恒等物理定律,AI才能真正走出屏幕,进入物理世界执行任务。 支撑物理AI战略的三大技术支柱已全面成型: Newton物理引擎:实现低于0.01秒的实时物理计算响应 Cosmos基础模型平台:以1000亿参数达成1毫秒级推理延迟,支持多模态物理世界理解 GPU+LPU混合架构:算力效率提升100倍,成本降低90% 三、Rubin计算架构全面量产 英伟达推出新一代Vera Rubin计算架构(简称Rubin架构),该平台已进入全面量产阶段。Rubin架构通过CPU与GPU协同设计,AI训练性能较前代Blackwell提升3.5倍,推理性能提升5倍,token生成成本最高降低10倍。该架构包含六款全新芯片:Vera CPU、Rubin GPU、NVLink 6 Switch、ConnectX-9 SuperNIC、BlueField-4 DPU和Spectrum-X以太网交换机。 四、自动驾驶与机器人突破 自动驾驶领域:英伟达发布全球首个开源端到端AI系统Alpamayo,这是业界首个具备思考推理能力的自动驾驶AI模型。2025款梅赛德斯-奔驰CLA将首发搭载该技术,计划2026年第一季度在美国上路,随后推广至欧洲和亚洲市场。 机器人领域:黄仁勋宣布"机器人领域的ChatGPT时刻已经到来"。英伟达发布了专为人形机器人设计的Isaac GR00T N1.6视觉语言行动模型等开源工具,同时推出Cosmos Reason 2推理型视觉语言模型。特斯拉Optimus人形机器人已通过Omniverse数字孪生平台完成90%以上的训练,自主运行比例达85%,2026年第一季度将实现5万台量产,成本降至2万美元以下。 五、开源生态战略加速 黄仁勋强调,开源模型与前沿闭源模型的差距已缩短至约6个月,且仍在持续缩小。英伟达不仅开源模型,还开源用于训练这些模型的数据,以建立真正的"系统信任"。现场展示的多款开源模型包括三家中国开源模型:Kimi K2、Qwen和DeepSeek V3.2。黄仁勋特别提到,DeepSeek R1的出现意外推动了整个行业的变革进程。 六、全栈AI体系构建 英伟达的角色已从芯片供应商转变为"全栈AI体系"的构建者。通过"三台计算机"的架构——训练(DGX超级计算机)、仿真(Omniverse与RTX)、推理(AGX系列边缘设备),英伟达构建了从云端训练到现实部署的完整闭环系统。同时,通过开源模型、数据及NeMo开发库,英伟达正推动技术民主化,让更多开发者和企业能够参与到物理AI的创新浪潮中。 黄仁勋在演讲结尾强调,物理AI的落地将重塑全球千万家工厂与数十万个仓库的运作逻辑,开启AI与实体经济深度融合的新时代。 http://t.cn/AXb9Z9MM

27. 别光问AI了,反向操作才是王炸,这是我10倍速阅读的三大心法和提示词~当会用AI不再稀缺,AI时代真正拉开差距的是什么?#ai #阅读 #读书 #学习 #世界读书日

28. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能

29. AI模型烧掉的Token,对应多少GDP?AI的经济贡献现在有数了

30. 多Agent协作反而让模型变蠢,AI也有「旁观者效应」

31. 网传一些公司因为token太贵开始限额了,会重返「古法编程」吗?AI全栈可行性如何,只适合大公司吗?

32. 【#腾讯云涨价#】3月11日,据财联社,腾讯云智能体开发平台宣布,将对部分模型的计费策略进行优化调整。 根据公告,本次调整主要涉及两类变更,一类是公测模型结束免费,GLM 5、MiniMax 2.5、Kimi 2.5模型将于3月13日结束免费公测,转为正式商用服务,根据模型调用按量计费。另一类变更为对混元系列模型Tencent HY2.0 Instruct与Tencent HY2.0 Think服务进行涨价。 不论是输入价格或输出价格,此次涨价幅度普遍在4倍以上。以Tencent HY2.0 Instruct为例,输入价格由原先的0.0008元/千tokens调整为0.004505元/千tokens,涨幅高达463%;输出价格也从0.002元拉升至0.01113元,涨幅超过456% 。 腾讯云表示,套餐用户可通过套餐抵扣部分费用。各位网友,您怎么看?(财联社)@东方财经

33. Agent 开发范式演进:从环境工程出发,“简化”多源实时上下文

34. 港股大模型公司股价闪崩,市场担忧 DeepSeek-V4 低价策略,这对行业发展意味着什么?

35. Token中文名确认为词元,到底是啥意思?#一个视频彻底搞懂Token #词元 #AI

36. #科技先锋官# 别再被 GPT-5.4、DeepSeek V4 的超长上下文洗脑了!很多人以为上下文越长,AI 就越厉害,这完全是误区!真正决定 AI 实力的,从来不是能记住多少字,而是能不能思考、推理、落地做事。超长上下文只是锦上添花,强推理和多模态融合,才是下一代 AI 的核心杀招!只会读文档、背内容的 AI,再长的上下文也只是 “复读机”;能拆解难题、看懂图像、自主执行任务,才是真进化。为什么很多大模型参数再高、上下文再长,依然不好用?答案就在视频里。看完你会彻底明白:AI 的未来,拼的不是记忆,而是真正的专业能力。#过个有AI年##HOW I AI##微博超有用视频大赛##上微博涨知识##MWC2026# 种斌Marco的微博视频

37. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文

38. 想起来了!还在手动找直播源?NAS+IPTV-API帮你自动化!

39. 【5万亿!"电力变算力,中国靠绿电和AI技术,正在全球‘隐形’收割数字红利" 】2026年2月,全球AI行业迎来历史性转折——中国AI模型的周调用量首次超越美国,三周内增长127%,单日调用量超过5万亿Token,占比登顶全球。更惊人的是,全球Top 5模型中,中国独占4席,包揽85%的调用量。而这一切的根基,竟是中国将“电力”转化为“算力”的超级能力。 成本碾压:0.3美元 vs 欧美3美元 中国AI模型的百万Token成本仅0.3美元,是欧美价格的1/10。核心优势来自三大支柱: 1. 绿电革命:西部清洁电价低至欧美1/5,数据中心电费占比从70%压降至40% 2. 技术爆破:混合专家架构让显存需求降60%,推理速度提升20倍 3. 生态协同:国产芯片自给率突破+开源社区激进迭代,Hugging Face下载量反超美国 Token出海=电力出口 每生成1个Token,本质是消耗0.0003度电(以中国能效标准)。当海外开发者调用中国API时: • 相当于间接购买中国绿电 • 边际成本趋近于零(1次训练后,推理电费近乎忽略) • 打破物理电网限制,溢价率超300%(电力成本0.1元,服务售价0.3美元) 千亿赛道与硬仗 尽管中国厂商已占据全球70%的AI推理市场,但挑战同样尖锐: • 合规雷区:GDPR罚款可达全球营收4% • 芯片围堵:英伟达H100性能仍领先国产3倍 • 生态博弈:开源模型被快速复刻,价格战持续恶化 这场“电力-算力-数据”的三角战争,正让中国从资源输出国蜕变为规则制定者。当全球每天消耗越来越多多token时,西部的每一度绿电,都在重构数字时代的权力版图。 (以上内容综合自网络)#人工智能##算力##新能源#

40. 顶尖大模型“能力突变”,算力需求“系统性超越供给”--大摩:“市场乐观的程度可能还不够”

41. Anthropic的CFO:收入有望在2027年超越美国科技7巨头,我们是怎么做到的,我们在焦虑什么#Anthropic #AI大模型 #算力 #AGI #AI基础设施

42. #为什么AI大厂开始卖token#这样子类似于手机流量费。 Token可以理解为AI世界的流量 收费对象变了,手机流量费是向人收的,用于上网浏览、看视频。而Token费是向开发者或企业收的,用于让AI处理、生成信息。 Token是什么,可以理解为AI认识的字词碎片。大模型不认识文字,只认识Token。比如“你好”可能被拆成1个Token,而一篇万字小说可能包含上万个Token。 怎么计费的,这就更接近“流量费”的逻辑了。每调用一次AI,费用 = (输入Token数 + 输出Token数)× 单价。就像发短信按字数计费,你问的问题越长、AI写的回答越长,花的Token就越多。 大厂为什么都开始卖Token,而不是直接卖软件? 按需付费门槛低,如果AI模型是辆超跑,卖软件就像卖车(一次付几十万)。卖Token则像做出租车(按里程付费)。对用户来说,起步价很低,用多少付多少;对大厂来说,则能把生意做成源源不断的“订阅服务”。 成本决定的,大厂运行这些超大型AI,每次推理(也就是你提问它回答)都要消耗巨大的算力(GPU电力)。按Token收费,能直接把算力成本转嫁出去,用户问得越多,收费就越高。 用计费规范用法。有些场景需要AI读几十页合同(输入贵),有些需要AI写长篇报告(输出贵)。按Token计费,能精确地区分不同任务的成本。 Token就是AI世界的数据流量包,手机流量让你获取信息,而Token则让你获取AI的思考和创作能力。

43. AI大神的焦虑:自己是研究工作的瓶颈,Token用得不够多#AI #人工智能 #卡帕西 #Agent #算力

44. LLM4OR 会是下一个应用热点吗?

45. Luma Uni-1.1 API开放,图像模型榜单第三,文字渲染直逼GPT image 2

46. 如何看谷歌DeepMind的预测2026年将成为持续学习之年?

47. 大模型服务集体涨价,DeepSeek 却永久降价,AI 商业化将走向何方?

48. DeepSeek V4 预览版本上线并同步开源,哪些亮点值得关注?

49. #DeepSeek下个王炸是什么# DeepSeek2026年的王炸大概率聚焦长上下文与效率优化的深度融合,继2026年初灰度测试百万token上下文模型后,DeepSeek将完善相关技术,依托mHC流形约束超连接与Engram条件记忆模块,解决长序列计算的内存开销问题,实现100万token下的高准确率推理。DeepSeekV4完整版模型的发布应该也是DeepSeek的一个重要的更新,新模型将结合混合专家架构优化,延续DeepSeek低成本高性能的优势,让中小企业也能便捷接入顶尖AI能力。推动开发者共建垂直场景应用;贴合2026年AI从会生成向会行动的进化趋势。#HOW I AI#

50. AI算法面试

51. 从灾难性遗忘想起

52. 大模型挑战深潜系列

53. Transformer模型微调

54. AI相互强化的 "三元悖论"

55. 灾难性遗忘

56. 从Context Rot到灾难性遗忘

57. 不是模型不行,是算力不够

58. 订阅用户流失背后

59. 大语言模型持续学习

60. 什么才算「真正的」持续学习

61. 告别灾难性遗忘

62. 持续学习的“遗忘定律”被发现了...

63. 告别“学新忘旧”

64. 如何防止RL训练导致LLM语言能力退化

65. 打破持续学习魔咒!MIT提出SDFT

66. 解决大模型知识注入的灾难性遗忘!无需外部教师的自蒸馏新方法 【大语言模型】【AI论文解读】

67. 为什么100万Token也救不了AI?| 灾难性遗忘的真实物理瓶颈 - 哔哩哔哩

68. 为什么监督微调(SFT) 容易「前学后忘」?

69. RL特训出「押题大师」?破解模型微调中的多样性危机与灾难性遗忘

70. [ICLR 2026]ADEPT: Continual Pretraining via Adaptive Expansion and Dynamic Decoupled Tuning

71. 大模型微调心得

72. Spring AI 2.0 实现模型降级和失败重试

73. Gemini Web 高峰期自动降级模型

74. AI API 高频问题第二弹

75. 别让AI在部署后停滞

76. 你的提示词又失效了?Claude和ChatGPT变了,旧套路正在“背叛”你!

77. 提示词价值在下降,决定你 AI 产出的,是这四个底层能力

78. 2026年3月

79. API限流策略专为大模型服务

80. AI 强大到让人担心,但它有 6 个死穴

81. 一文讲清

82. LLM推理加速

83. GPU太贵跑不起?这6个优化技巧让LLM推理成本直降

84. LLM 推理与优化实战深度解析!

85. MIT再出王炸成果!力证强化学习才是未来实现持续学习的大方向

86. 知名AI模型被曝性能骤降,遭用户抵制

87. 破解AI模型“记忆缺失”困境:Dataify以高质量数据重塑LLM长文

88. 被大模型微调过拟合、灾难性遗忘折磨的宝子们有福了!

89. AI 不是记得越多越聪明:真正可靠的智能体,必须先学会“遗忘”

90. MIT 提出 SDFT:作为逆强化学习(Inverse RL)的在线自蒸馏

91. 推理算力爆发:你的AI助手为什么越来越快?

92. 缓存时效从1小时骤降至5分钟,AI应用架构迎成本重构

93. 2026年AI能力边界全景图:我们走到了哪里,又卡在何处

94. 大模型规则一变,你的 AI 流量就暴跌?3 道保命防线,决定 2026 谁被率先出局!

95. AI持续学习研究进展如何:近6个月持续学习相关的部分论文

96. 解决大模型灾难性遗忘!快慢双系统框架实现大语言模型持续学习 【大语言模型】【AI论文解读】

97. 🚨你的机器人得“失忆症”了?学了烤肉忘了扫地?带你解锁终身学习AI黑科技 SkillsCrafter!

98. 模型记忆力的显著突破 大模型最大的bug,可能要被修复了。 你有没有发现,跟AI聊天聊久了它就开始忘事?这其实不是幻觉,是因为现在所有大模型本质上都是"金鱼脑",上下文窗口就那么大,超了就丢。 最近有个团队发了篇论文叫MSA,做了件狠事:不靠外挂数据库,不靠暴力扩窗口,直接让模型自己学会"挑重点记"。 结果一个40亿参数的小模型,记忆力吊打2350亿参数的大系统。而且跑1亿token的推理用两张卡就够。 虽然代码还没放出来,但如果这东西能落地,AI助手、AI角色扮演、企业知识库这些场景全部会被重写。 #大模型 #ai #知识分享

99. ICLR 26 | 终身具身导航学习:Uni-Walker让AI像人类一样终身学习,遗忘率降低70%,开启具身导航终身学习新纪元

100. CVPR 2025|LoRASculpt:给 LoRA 做“雕刻”,让多模态大模型微调后少遗忘

101. 破解大模型灾难性遗忘!从几何视角解释并控制LLM持续后训练遗忘 【大语言模型】【AI论文解读】

102. DualCD|如何解决域增量学习场景下时序分类模型灾难性遗忘问题

103. 解决SFT灾难性遗忘!全新大模型微调范式GFT,比GRPO效果更好 【大语言模型微调】【AI论文解读】

104. 如何避免多模态模型中的灾难性遗忘?

105. 一分钟搞懂上下文长度😎

106. 大模型推理慢了?这个开源方案让你提速 10 倍

107. 为什么AI看起来很厉害,用起来总差点意思 AI如此强大,为什么用起来却总像在和一个“失忆”的天才对话?本期视频用一个深刻的比喻——顺行性遗忘症,来拆解大语言模型的根本困境:它并非不够聪明,只是每次“醒来”都需重新认识你。我们探讨了为何演示惊艳而日常使用别扭,以及当前所有的“记忆”工具为何本质都是“便条”。理解这一点,是正确使用AI、判断其未来的关键。 #LLM#大语言模型#AI记忆#上下文窗口#人机协作

108. 大模型终身学习突破中科大双顶会 9422样本解构知识注入两大困境 你还在让模型死记硬背?新框架来了 小牛说:大模型终身学习一直是个难题,学新知识就忘旧能力,中科大团队连发两篇顶会论文,给出了解决方案。他们先做了一个包含9422个样本的评测基准MMEVOKE,发现现有方法不管是微调还是检索增强,效果都不行。更关键的是,他们解构了遗忘机制,发现指令跟随能力先崩溃,然后像多米诺骨牌一样影响其他能力。在此基础上,他们提出了KORE框架,通过知识树自动增强和零空间约束微调,实现了新知识学得准、旧能力保得住。你觉得大模型真的需要终身学习吗? #MMEVOKE #多模态持续学习 #灾难性遗忘 #顶会论文 #知识注入

109. 破解AI模型“记忆缺失”困境:从灾难性遗忘到长效记忆,Dataify以高质量数据重塑LLM长上下文能力

110. Fine-Tune 踩坑全录:灾难性遗忘怎么治

111. AI大模型调优工程:突破显存墙与灾难性遗忘的双重挑战

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章