独家|扩散语言模型杀进端侧:Agent跑快5倍,GPT的“下一代替代者”出现了?

2026-09-01 13:00:43 0点赞 0收藏 0评论

扩散语言模型(dLLM)正在从论文走向产业。

笔者独家获悉,中国扩散语言模型团队DiffuSpace已与亚洲智能体计算平台公司Acrab达成战略合作协议,双方将共同推进dLLM在AI PC、智能汽车、机器人、智能家居等端侧AI场景中的落地。

DiffuSpace是全球最早投入dLLM范式研究的团队,其核心成员自2022年以来,陆续推出DiffuSeq、RDM、DiffuLLaMA等研究成果,并研发出全球代表性dLLM之一Dream 7B,是全球唯一在“条件生成、离散信号建模、Scaling”的三大dLLM核心问题上均有全球领先突破的团队。

Acrab则是亚洲一家致力于突破智能体在性能、能效与部署效率上的瓶颈,为端侧场景提供高效、灵活且可规模化落地底座的计算平台公司,已进入产业量产。

双方适配测试显示,dLLM可将端侧Agent的运行速度提升5倍。

这意味着,长期以来主要依赖云端大模型的Agent,正在出现另一条技术路线:不再单纯追求更大的模型,而是通过改变语言模型的生成方式,再叠加端侧芯片的并行算力,压缩Agent执行任务所需的时间。

这也是此次合作最值得关注的地方。

传统GPT类自回归模型采用“从左至右、逐个Token”的方式生成内容,一个Token接一个Token地产生结果。而dLLM借鉴图像生成领域的扩散机制,采用“全局生成”,能够结合上下文持续调整生成结果。

简单来说,前者更像“一个字一个字写”,后者则试图“先整体生成,再不断修正”。

笔者从DiffuSpace方面获悉,在部分场景中,dLLM的推理速度甚至可以达到GPT式自回归模型的10倍。此次DiffuSpace与Acrab则进一步把这种并行生成能力搬到了端侧Agent上,并进行系统级适配。

在Acrab的参考设计中,Coding Agent已经成为测试场景之一:dLLM可以并行处理多个代码位置,从而提升代码生成和修改效率。

另一个测试场景是视频剪辑智能体。由于需要同时处理图像、语音和文字等信息,dLLM的全局建模能力被用于多模态任务的协同处理。

笔者独家获悉,这也是目前这次合作释放出的一个关键信号——dLLM与端侧计算平台的结合,并不是简单地把一个模型“塞进芯片”,而是围绕Agent工作负载进行模型、算力和应用场景的协同适配。

这背后对应的是端侧Agent正在面对的一组现实问题:实时响应、计算效率,以及有限端侧算力下的模型运行速度。

Acrab提供计算底座,它已经推出第一代端侧AI芯片GΞLIX 1以及Agent Box智能终端。其中,GΞLIX 1提供超过700 TOPS的AI算力和273GB/s统一内存带宽,Agent Box可以在消费、工业等场景离线部署智能体。目前Acrab累计融资超过4.8亿美元,并已进入产业量产阶段。

与此同时,dLLM本身也正在成为大模型领域的新变量。

今年以来,Google、Inception、蚂蚁集团等科技公司陆续推出相关模型。随着越来越多企业开始进入这一赛道,行业内近期已经出现一种更激进的判断:扩散语言模型可能在未来两年内替代GPT类自回归模型。

DiffuSpace作为国内较早投入扩散语言模型研究的团队,见证了行业对这一技术路线从“非共识”逐步走向更多认可。该团队认为,扩散语言模型已经展现出成为下一代基础模型范式的潜力,而接下来需要做的,是继续完成更多技术突破与产业验证,加速这一新范式走向成熟。

从此次合作来看,dLLM正在尝试解决一个越来越现实的问题:当AI Agent真正进入PC、汽车、机器人和家庭设备后,用户需要的可能不只是“更聪明的模型”,还需要一个能够在本地更快行动的Agent。

如果5倍速、10倍速在更多实际任务中被验证,扩散语言模型或许会成为下一轮模型竞争中,一个不可忽视的新变量。(本文首发于钛媒体,文|钱微镜,作者|钱玉娟,编辑|杨林)

作者:钱微镜

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松