多模态大模型推理慢是瓶颈,投机推理技术正从文本领域向多模态拓展。本文系统梳理了该领域的核心挑战与最新进展,依据草稿模型对视觉信息的依赖程度,划分出四种主流技术范式,并深入解读了各范式的代表性工作,为高效加速多模态模型提供了清晰的思路。
智能速览
多模态投机推理面临视觉语义差、图像计算昂贵和长视觉序列依赖三大挑战。
现有方法可依据草稿模型对视觉信息的依赖程度,分为全、关键、无视觉及动态适配四种范式。
无视觉输入范式是重要突破,草稿模型可复用目标模型已编码的视觉语义。
长视频场景因视觉Token海量,对稀疏注意力、剪枝策略和并行架构提出更高要求。
动态适配范式能根据任务场景,实时选择最优视觉处理策略以平衡精度与速度。
精华内容
投机推理在多模态领域的落地并非易事,但一系列创新研究正逐一攻克难关。以下将从四种主流技术范式出发,深入剖析其核心思想与代表性方案。
强化视觉感知
为解决草稿与目标模型视觉感知不一致导致的接受率低问题,全视觉输入范式主张草稿模型接入完整视觉输入。以 MSD 为例,该方法解耦处理文本与视觉 token,保护视觉语义完整性,并通过二阶段渐进式训练,让草稿模型逐步习得视觉感知能力。
另一代表性工作 Spec-LLaVA 则通过轻量化草稿模型与目标模型共享视觉编码器,并辅以知识蒸馏,最小化表征差异。其引入的动态树基验证方案能根据置信度自适应调整推测分支,有效提升了复杂场景下的加速效果。
精选关键信息
该范式旨在降低视觉计算开销,主张草稿模型仅处理关键视觉信息。DREAM 方法提出基于注意力熵的自适应特征选择,仅保留高信息密度的视觉 token,在几乎不损失精度的前提下大幅削减计算量。
ViSpec 则更进一步,指出图像信息存在大量冗余,其受 Q-Former 启发的轻量级适配器能将上千个图像 token 压缩至 1-4 个,并将全局特征向量持续注入后续文本生成中,确保了草稿模型对视觉上下文的完整访问。
视觉语义内隐化
这是当前最激进的范式,其核心发现是:目标模型在深层推理时,核心视觉语义已隐式编码至文本隐藏状态中,原始视觉输入变为结构性冗余。因此,草稿模型可完全不处理视觉 token。
SPD 的早期研究验证了纯文本草稿模型的可行性。HiViS 则利用目标模型预填充阶段融合了视觉信息的文本特征作为草稿模型输入,配合残差对齐训练,实现了精准预测。Sparrow 则更进一步,通过复用目标模型深层融合后的文本隐藏状态,并设计递归训练策略,攻克了超长视频序列的投机难题。
策略动态协同
针对单一视觉策略难以适配多变场景的痛点,动态适配范式主张根据输入特征或任务需求,实时调整视觉信息处理策略。
IbED 提出批内集成机制,并行执行多模态、纯文本等多种草稿策略,并融合其概率分布,自适应地平衡单图与多图场景下的性能。另一项 SpecVLM 工作则集成了剪枝、池化等多种压缩原语,结合在线蒸馏协议,能依据问题难度和图文相关性,动态选择最优的视觉压缩策略。
从全视觉到无视觉,多模态投机推理的研究路径清晰地展现了技术演进的思路。这些创新方案有效缓解了计算瓶颈,为多模态大模型的广泛应用铺平了道路。未来,如何实现更高效率的视觉语义复用与更智能的自适应策略,将是持续探索的方向。