阶跃星辰开源了其最新的视觉语言模型Step3-VL-10B。这款仅10B参数的“小模型”在多项基准测试中展现出惊人实力,性能超越了许多规模数十倍大的闭源模型。这一突破不仅标志着开源社区的又一次进步,也为未来在终端设备上实现复杂多模态推理铺平了道路。
智能速览
Step3-VL-10B在多项基准测试中达到同规模SOTA水平。
在AIME 2024/2025数学竞赛中取得接近满分的成绩。
在真实动态编程环境LiveCodeBench中表现优异。
采用1.2T多模态数据全参数端到端联合预训练。
通过1400+次多模态强化学习迭代提升核心能力。
自研PaCoRe机制实现推理阶段动态算力分配。
精华内容
一个小模型如何爆发出超越巨头的能量?其背后是训练策略和技术创新的精妙结合,让我们深入一探究竟。
性能全面领先
Step3-VL-10B在多项核心能力上均达到同规模SOTA水准。在MathVision、MathVerse等STEM与多模态基准测试中,其得分超越了GLM-4.6V和Qwen3-VL等知名模型。
数学推理方面,表现尤为突出。在AIME 2024和2025数学竞赛测试中,模型分别取得了93.33%和94.43%的惊人准确率,接近满分,稳居世界第一梯队。
代码能力同样不俗,在LiveCodeBench真实动态编程环境中,该模型取得了76.43分,超越了众多世界一流的多模态模型。
训练策略革新
其强大性能源于三大核心技术。首先是全参数端到端多模态联合预训练,模型在1.2T高质量多模态数据集上进行全量训练,使得视觉特征与语言逻辑实现了深度对齐。
其次是大规模多模态强化学习演进,通过1400余次的迭代,模型在视觉感知和数理逻辑等维度的能力实现了质的飞跃。
动态推理加速
为了在资源有限的环境中高效运行,阶跃星辰自研了PaCoRe机制。该机制能够在推理阶段根据任务的复杂程度,动态、智能地分配计算资源。这意味着模型在面对简单问题时更快速,在处理复杂逻辑时更精准,显著提升了推理效率和准确性。
终端AI新可能
Step3-VL-10B的成功开源,意味着原本需要依赖云端强大算力才能执行的复杂多模态任务,未来有望下沉到手机、电脑、智能汽车等各类终端设备上。这将催生出更多响应迅速、保护隐私的本地化AI应用,为端侧AI的发展开辟了新的想象空间。
Step3-VL-10B的发布不仅是阶跃星辰技术实力的体现,更是开源社区的一次重要贡献。它证明了精巧的模型设计和高效的训练方法,其开源模式又将如何激发下一波端侧AI应用的创新浪潮?