张大妈

图解DeepSeek最新论文,GLM-Image的认知型生成太牛了!!!

源自公众号:饼干哥哥AGI

01-20 20:50

最近AI圈有两件大事:DeepSeek发布了颠覆性的模型架构论文,提出用“查表”替代“硬算”;智谱AI则推出了GLM-Image,一个擅长精准文字渲染和逻辑图表生成的图像模型。前者揭示了AI效率提升的新方向,后者则让复杂知识的可视化变得前所未有的简单。这两项技术进步,共同指向了一个AI发展的新范式。

图解DeepSeek最新论文,GLM-Image的认知型生成太牛了!!!智能速览

  • DeepSeek提出“Engram”机制,通过查算分离提升模型效率。

  • GLM-Image采用混合架构,能精准生成包含中文的复杂图表。

  • DeepSeek发现记忆与计算的最佳参数配比为75%:25%。

  • 加入Engram机制后,模型的数学和代码能力意外暴涨。

  • GLM-Image是首个在国产昇腾芯片上完成全流程训练的SOTA模型。

图解DeepSeek最新论文,GLM-Image的认知型生成太牛了!!!精华内容

这两项技术看似独立,却都触及了AI发展的核心命题——效率与实用性。DeepSeek从算法底层探索思考与记忆的平衡,而GLM-Image则在应用层面实现了复杂认知任务的精准呈现。

DeepSeek的记忆术

当前主流的大模型(Transformer架构)存在一个根本缺陷:缺乏原生的查字典能力。当模型需要回答“水的化学式是什么”这类静态知识时,它并非直接调取,而是像一位天才一样从第一性原理开始“计算”,这造成了巨大的算力浪费。研究显示,模型识别“戴安娜王妃”需消耗6层网络深度。

DeepSeek提出的Engram机制旨在解决此问题。其核心是“查算分离”,给模型外挂一个巨大的N-gram嵌入表。当模型识别到特定实体时,不再需要复杂的神经网络推理,而是触发O(1)的查表操作,直接将预存的知识向量注入网络。这就像给爱因斯坦发了一本字典,让他从繁杂的计算中解放出来。

75%的黄金比例

那么,是否可以无限扩大“字典”容量,让模型纯靠记忆?答案是否定的。博尔赫斯小说中的富内斯因过目不忘而失去了思考能力,这揭示了完美记忆会扼杀抽象思考。

DeepSeek通过实验绘制出一条U型曲线,揭示了模型在固定参数预算下的最优分配策略。纯靠计算的MoE模型效果不佳,而纯靠记忆的Engram模型则逻辑能力下降。实验发现,约75%的参数分配给负责计算的MoE专家,25%左右分配给负责记忆的Engram表,才能达到最佳效果。这个“上帝配方”证明了记忆与计算必须在架构层面实现精妙平衡。

理科能力与硬件解耦

一个反直觉的发现是,加入Engram后,模型的理科能力大幅提升。在MATH(数学)、HumanEval(代码)等基准测试中,得分分别提升了2.4分和3.0分。这是因为“记忆外挂”让前几层网络从“名词解释”中解放出来,后续网络可以专注于更复杂的逻辑推理。Engram模型在第5层达到的思考深度,相当于普通模型第12层。

更关键的是,DeepSeek通过异步预取机制解决了硬件瓶颈。Engram的查表操作是确定性的,系统可以提前预测所需数据。因此,巨大的参数表可存于廉价的CPU内存,在GPU计算前一层时,数据已通过PCIe通道传输至显存。实验表明,即使外挂1000亿参数的字典,推理速度也仅慢不到3%。

精准的图文生成

如果说DeepSeek在探索AI的“智商”,那么GLM-Image则在打磨AI的“表达能力”。它专为“认知型生成”而生,能够理解复杂指令,并生成包含精确文字和逻辑关系的图表。

这得益于其“自回归+扩散解码器”的混合架构。9B的自回归模型如同产品经理,负责理解复杂需求、规划全局构图;7B的扩散解码器则像资深美工,负责细节渲染,尤其是AI以往最头疼的汉字。在CVTG-2K和LongText-Bench等专业评测中,GLM-Image取得了开源模型第一的成绩,意味着生成海报、PPT配图或科普长图时,再也不用担心AI画出的文字是“鬼画符”。

开源落地的意义

DeepSeek和GLM-Image的共同点在于,它们都是国产开源力量的杰出代表。GLM-Image更是首个在国产昇腾芯片上完成全流程训练的SOTA模型,证明了国产芯片在底层算力上的潜力。

开源的价值远不止于此。对于企业而言,本地部署GLM-Image能确保内部数据不出云端,保障安全。对于需要大规模生成内容的应用场景,自建服务器跑开源模型,长期成本远低于调用API。更重要的是,开源权重提供了定制化的自由,可以微调出专属风格和字体库,这是闭源模型无法给予的。在AI发展的浪潮中,开源不仅是技术选择,更是一种推动创新普惠的生态策略。

DeepSeek的“作弊术”和GLM-Image的“认知生成”,共同勾勒出AI进化的新路径:不再盲目堆砌算力,而是追求效率与实用性的精妙结合。它们展示了国产AI在算法创新和工程落地上的双重突破。当AI学会取舍,懂得何时记忆、何时计算,真正的智能时代或许才刚刚拉开序幕。未来的AI,会走向何方?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章