这是一份来自一线研发团队的深度技术复盘,聚焦于Step 3.5 Flash小模型的设计逻辑与实测表现。它不讲参数堆叠,而系统揭示了MoE结构优化、滑动窗口注意力、MIS-PO强化学习等关键技术如何协同提升推理质量与速度,并在AIME、Codeforces等硬核基准上达到97%+准确率。
智能速览
Step 3.5 Flash激活参数仅2.78%(8/288),显著降低显存与计算开销
AIME 2025测试准确率达97.3%,Codeforces Div2/Div3实战错题仅1道
推理速度超100 tokens/s,在128K长序列下推理成本仅为同类模型的1/4至1/8
采用GQA-8+SWA混合注意力架构,兼顾硬件负载均衡与投机采样效率
MIS-PO算法替代传统PPO,提升RL训练稳定性与收敛速度
支持在128GB Mac及单消费级显卡上部署4-bit 256K上下文版本
精华内容
当大模型竞赛陷入算力军备困局,一支团队选择回归工程本质:用精巧结构唤醒小模型沉睡的推理能力。Step 3.5 Flash不是参数膨胀的产物,而是对后训练范式、系统协同与评估严谨性的集中验证。
结构减法
Step 3.5 Flash主动放弃全量注意力与高激活MoE路径,转而采用超稀疏MoE架构,仅激活8个专家中的1个,激活参数占比压缩至2.78%(8/288)。该设计使KV Cache显存占用大幅下降,在DGX/HGX等8卡服务器上,GQA-8分组设置实现KV分发与计算的完美负载均衡。
同时引入滑动窗口注意力(SWA),将注意力范围锁定在固定窗口内,避免长上下文导致的线性显存膨胀。模型配置为3层SWA+1层全注意力交替,既保障关键位置全局建模能力,又为投机采样提供轻量验证环境。
实测表明,该结构组合使128K序列推理成本降至同类尺寸模型的1/4–1/8,平均推理吞吐突破100 tokens/s,肉眼难以跟上输出节奏。
推理跃迁
在AIME 2025数学竞赛测试中,Step 3.5 Flash取得97.3%准确率;HMMT 2025 Feb.达98.4%,IMO-AnswerBench达86.3%,LiveCodeBench-v6达86.4%。
更关键的是实战表现:作者连续参与两场Codeforces Div2与Div3比赛,每场仅错1题;AIME 2026新题前15题Math Arena测试准确率为96.67%,仅最后一题4分中得2分,其余全对。
这些结果并非孤立指标——模型在数学、编程、逻辑推理等多领域呈现强泛化性,验证了Kaiming所言‘未来是真正测试集’的判断:它在未见过的新题型上稳定输出高质量解题链。
后训练进化
团队摒弃‘大力出奇迹’思路,转向以RL驱动思考模式重塑。MIS-PO算法取代传统PPO,取消连续重要性采样权重项,改用离散分布过滤机制,解决off-policy更新中策略差异不稳定问题。
训练中采用GPT-OSS-120B作为奖励模型,配合提示词工程,相较math_verify匹配方式鲁棒性显著提升。实验显示,MIS-PO在收敛速度、奖励峰值、梯度稳定性及熵衰减速率上全面优于PPO。
强化学习不再只是微调手段,而成为唤醒预训练模型潜在能力的关键开关——数千题训练即可触发质变,尤其在长链推理与工具调用任务中自然泛化。
Step 3.5 Flash的价值不在刷新SOTA数字,而在于证明一条可行路径:小模型通过结构精简、系统协同与后训练范式升级,同样能承载前沿推理能力。它降低了AI开发门槛,让128GB Mac或单卡设备也能运行256K上下文智能体。当算力不再是唯一护城河,下一步该追问的是:哪些任务真正需要百亿参数?哪些场景反而被大模型拖慢?