大语言模型的发展陷入“越大越好”的怪圈,带来了高昂的成本与部署难题,尤其在涉及隐私的端侧场景。腾讯优图实验室推出的Youtu-LLM模型,仅用约20亿参数,通过创新的原生训练范式,专门培养推理与规划等核心智能体能力,为资源有限的设备端部署提供了高性能的解决方案,打开了AI普惠化新路径。
智能速览
腾讯优图推出2B参数模型Youtu-LLM,专为端侧智能体任务设计。
模型不依赖蒸馏,通过原生训练解锁推理与规划等核心能力。
创新Dense MLA架构支持128K长上下文,平衡性能与资源消耗。
构建超200B token高质量智能体轨迹数据,系统化训练模型能力。
在多项基准测试中,性能超越同规模模型,媲美甚至超越4B模型。
精华内容
大模型“参数竞赛”带来了高昂的成本与部署门槛,轻量级模型又常因能力不足而受限。Youtu-LLM的出现,为打破这一僵局提供了新思路,探索了一条不靠蒸馏、直接在训练阶段就赋予模型原生智能体能力的路径。
模型架构创新
Youtu-LLM采用了名为密集多潜在注意力(Dense MLA)的创新架构。与传统的GQA相比,该架构通过对KV缓存进行低秩压缩并扩大中间投影矩阵,在有限参数下显著提升了注意力的表达能力和推理性能。此外,模型支持128K的超长上下文窗口,并针对STEM领域设计了专用分词器,分词效率提升了5%至10%,为高效处理数理逻辑内容奠定了基础。
原生智能体训练
为解决轻量级模型依赖蒸馏、缺乏底层认知能力的问题,Youtu-LLM采用了多阶段预训练策略。训练过程遵循“常识 → STEM → 智能体”的螺旋上升路径,确保模型能力的深度与稳固性。这种在预训练阶段就系统性注入智能体能力的方法,不同于简单的指令微调,让模型从根本上理解任务逻辑,而非仅仅模仿输出。
高质量数据合成
模型能力上限由训练数据决定。团队构建了超过200B token的高质量智能体轨迹数据,涵盖五大领域。例如,将冗长的思考过程重构为“分析→计划→行动→反思→总结”的结构化智能体思维链;或将数学推理解构为11种原子能力进行组合训练。这些精心合成的数据,是Youtu-LLM获得强大认知能力的关键。
性能实测超越
实验证明,Youtu-LLM 2B基础模型在常识、数学、代码等通用基准测试中,全面超越同规模模型,并与参数翻倍的Qwen3-4B基础模型表现相当。在代码工程、深度研究等端到端智能体任务评测中,其2B指令模型不仅大幅领先同规模模型,甚至在多个任务上超越了Qwen3-4B。消融实验也证实,智能体中训练阶段为模型带来了超过40%的性能提升。
Youtu-LLM的成功,为AI的普惠化部署打开了新的想象空间,证明了“小而美”的模型同样可以拥有强大的智能代理能力。随着模型与代码的开源,未来在手机、车载等设备上看到更聪明、更私密的AI助手将成为可能。这是否预示着AI应用将真正迎来无处不在的端侧时代?