张大妈

Claude 4.8 Opus是否用了模型蒸馏?争议背后的真相与实用建议

源自27位全网作者

05-29 18:16

内容由AI生成

精选参考来源

1. Anthropic三张底牌全翻了!Mythos 1首次现身,Opus 4.8曝光

2. 我去!!!深夜突袭,Opus4.8上了!!洗完澡回来,一打开手机,发现社群刷屏了。。。根据官方介绍,这次更新了一个全新的功能:动态工作流(研究预览版)。主要针对对于最棘手的任务,Claude会制定计划,运行数百个并行子代理,并在报告结果前验证其工作。 此外,Anthropic还提到,他们正在开发以更低成本提供 Opus 同等能力的模型,并计划推出比 Opus 智能更高的新一类模型——目前作为 Project Glasswing 的一部分。 少数机构正在用 Claude Mythos Preview 做网络安全工作,会预计在未来几周内向所有客户开放 Mythos 级模型。 熬夜测评去了。。。AI#ai创造营##how i ai#

3. Claude疑似蒸馏Qwen和DeepSeek 新模型引发争议

4. Claude Opus 4.8发布:最大的升级是终于不吹牛了

5. Claude Opus 4.8 发布|Mythos 即将上线

6. 实测Claude Opus 4.8,这可能是第一个不会偷懒的模型。

7. Claude 4.8炸场!部分能力超过Mythos,支持数百子智能体并行

8. Claude 4.8炸场!部分能力超过Mythos,支持数百子智能体并行

9. Claude Opus 4.8实测:强到离谱,也贵到肉痛

10. 刚刚,Claude Opus 4.8来了!两个史上首次改写历史

11. 刚刚!Claude Opus 4.8 炸场,一夜升级成工作流AI

12. Anthropic装糊涂,全球AI圈看笑了

13. On-Policy Self-Distillation

14. 热点关注丨2026开年关键词:Self-Distillation,大模型真正走向「持续学习」

15. Distillation 还是 Imitation?LLM 时代被滥用的术语

16. 2026开年新风向:上下文即Teacher,三文详解Self-Distillation新范式

17. 什么是大模型蒸馏?看看那GPT怎么说

18. 自蒸馏总结论文的相关总结

19. GKD: On-Policy Distillation of Language Models

20. 【AI速探·说明书】第22期|知识蒸馏(Distillation)

21. 大模型蒸馏-EasyDistill 深度分析报告

22. ms-swift-day11。今天学习了GKD(广义知识蒸馏),传统知识蒸馏用固定数据集的序列训练学生,但推理时学生是自己逐步生成的——训练和推理的输入分布不一样,一旦生成了一个错误 token,后续所有 token 都会被污染。这叫 Exposure Bias,是 off-policy 蒸馏的根本缺陷。On-Policy 蒸馏的解决思路是让学生在自己生成的序列上学习,教师对这些序列的每个 token 位置打分,提供纠错信号。GKD 的核心贡献是两个设计的组合,不是单独的 on-policy 蒸馏。 第一个是 λ 混合策略:λ=1 全用学生自己生成的序列,λ=0 全用数据集序列,中间值混合两者,用一个参数统一了所有变体。第二个是引入广义 JSD(β):Forward KL 是均值覆盖,Reverse KL 是众数寻求,JSD(β) 在两者之间连续插值,β 从 0 到 1 可以根据任务调节,比固定用 Forward KL 更灵活,而且 JSD 有界,训练稳定。on-policy GKD 用 5% 的数据就能超过 Supervised KD 用 100% 数据的效果,原因是每步都在训练学生当前最薄弱的路径,不浪费训练信号。GKD 还能和 RLHF/RLAIF 结合,通过 α 参数平衡奖励目标和蒸馏目标,缓解对齐税。主包把个人理解通过claude做成了一个html网页,包含Exposure Bias的解释,GKD算法的核心,损失函数的推导和直觉意义,以及ms-swift提供的实战脚本指南,如果有需要可以私信主包获取。另外主包还读了一篇很有意思的论文,来自人大高瓴,腾讯的Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation,这篇论文将On-policy distillation为什么有效解释为强化学习,也就是说把标准On-policy distillation目标函数等价于 一个特殊的 KL 约束 RL 目标,那个公式推导出每个 token 都有密集奖励,而非一般使用 RLVR 的GRPO中只有稀疏奖励(广播为序列形状),也让我对在线蒸馏和在线强化学习有了新的认识!! #广义知识蒸馏 #蒸馏

23. 大模型在线蒸馏 | Notes 📒

24. 模型蒸馏路线图

25. 【AI论文解读】无需验证器\u002F教师模型!超简单自蒸馏提升大模型代码生成能力 | 最高涨13个点pass

26. 大模型蒸馏:技术原理与侵权风险

27. 论文分享丨ICCV2023丨面向 2D 图像和 3D 点云持续语义分割的标签引导知识蒸馏

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章