在Transformer架构主导大模型的背景下,Liquid AI推出了一款基于液态神经网络的新型推理模型LFM2.5-1.2B-Thinking。它以仅900MB的内存占用实现了端侧高效运行,并在多项推理任务上超越更大参数的主流模型,为端侧AI的发展提供了全新且强大的技术路径。
智能速览
Liquid AI发布基于液态神经网络的新型推理模型LFM2.5-1.2B-Thinking。
该模型仅需900MB内存,可在手机等端侧设备高效运行。
在数学、工具使用等推理任务上,表现优于更大参数的Qwen3-1.7B模型。
模型会生成内部思考轨迹,增强问题求解的系统性。
采用课程强化学习等创新训练方法,有效解决了“死循环”问题。
模型已开源,并兼容主流推理框架与多种硬件平台。
精华内容
当Transformer架构一统江湖时,一种源自线虫神经结构的液态神经网络正悄然发力,旨在用更小的体积实现更强的端侧推理能力,并已取得实质性突破。
端侧推理新标杆
Liquid AI发布的LFM2.5-1.2B-Thinking模型,专为端侧设备设计,运行内存仅需900MB,使其能够在手机等移动设备上离线完成复杂推理任务。
尽管参数量比Qwen3-1.7B少约40%,但其在多项基准测试中表现更优。数学推理能力在MATH-500基准上从63分提升至88分;指令遵循能力在Multi-IF上从61分提升至69分;工具使用能力在BFCLv3上从49分提升至57分。
在推理速度和内存效率方面,该模型也显著优于纯Transformer架构模型(如Qwen3-1.7B)和混合架构模型(如Granite-4.0-H-1B),成为同等规模模型中的性能翘楚。
思考轨迹的奥秘
该模型的核心特点之一是其“思考”能力。在生成最终答案前,模型会先生成内部的思考轨迹,模拟人类逐步分析问题的过程。
这种机制使得模型在需要多步规划、工具调用和动态调整策略的智能体任务中表现尤为突出。当面对数学、编程等高推理强度任务时,这种结构化的思考过程能显著提升解题的准确性和系统性。
不过,在创意写作或日常对话等场景下,更适合使用其姊妹模型LFM2.5-1.2B-Instruct,后者在交互体验上可能更具优势。
驯服死循环
训练小型推理模型的一大挑战是避免陷入“死循环式生成”(doom looping),即模型不断重复内容而无法给出结论。
Liquid AI通过一套组合拳解决了这个问题。首先,在监督微调(SFT)阶段,让模型学习生成思维链。随后,在偏好对齐阶段,引入了严格的筛选机制:只要候选答案出现循环,无论其得分如何,都直接作为负样本。
最后,在RLVR(强化学习)训练中加入了基于n-gram的重复惩罚。这一系列操作将模型死循环生成的比例从15.74%有效降低至0.36%,保证了推理过程的流畅和高效。
并行训练与合并
为打造能力全面的模型,Liquid AI采用了一种创新的Curriculum RL训练框架。它并非用单一模型学习所有任务,而是并行训练多个针对不同领域(如推理、数学、工具使用)的专项模型。
每个分支模型拥有独立的奖励机制和优化策略,避免了多任务训练中的能力干扰。随后,通过迭代式模型合并技术,将不同专项模型的优点融合到一个均衡的checkpoint中。
这种“分而治之,再合而为一”的策略,最终发布的checkpoint融合了25个不同子模型的能力,实现了在多项技能上的优秀平衡。
生态与未来
为了推动模型的广泛应用,LFM2.5-1.2B-Thinking已实现开源,并兼容llama.cpp、MLX、vLLM和ONNX Runtime等主流推理框架,全面支持CPU与GPU加速。
其软硬件生态系统正在快速扩展,已获得高通、Ollama等合作伙伴的支持,覆盖了Apple、AMD、Nvidia等多种硬件平台。
LFM2.5-1.2B-Thinking的出现证明了Transformer并非AI发展的唯一路径,小而强的端侧模型拥有巨大的潜力和更优解,预示着一个更普惠、更高效的AI未来。
LFM2.5-1.2B-Thinking不仅是一次技术突破,更是一种方向性的启示。它证明了非Transformer架构在特定领域,尤其是端侧推理上,拥有巨大潜力,让强大的AI能力不再局限于云端。当复杂推理的门槛被大幅降低,更多设备将被唤醒,这会为我们的日常生活带来怎样的智能变革?