面对AI模型在复杂任务中普遍存在的性能与速度难以兼得的瓶颈,阶跃星辰开源的Step 3.5 Flash模型给出了新答案。它通过创新的稀疏MoE架构与工程优化,实现了在1960亿参数规模下的高效推理,既保证了智能水准,又带来近乎实时的响应体验,为AI的实际落地应用扫清了关键障碍。

智能速览
Step 3.5 Flash上线两天即登顶全球热度趋势榜。
采用稀疏MoE架构,仅激活11B参数处理任务,大幅提升效率。
在NVIDIA Hopper GPU上,最高推理速度可达每秒350个Token。
结合滑动窗口与全局注意力,高效处理256K长文本。
其技术路径证明了,通过架构创新可以兼顾AI模型的智能与速度。
精华内容
传统认知中,AI模型的“快”与“强”似乎是一对矛盾体,但Step 3.5 Flash的出现,正在打破这一技术预设。
以巧见大的架构
Step 3.5 Flash的核心突破在于其采用的稀疏混合专家架构。与动辄调动全部参数的传统千亿模型不同,它被组织成一个庞大的“专家团”。当接到任务时,智能路由会精准唤醒最相关的几个“专家小组”协同工作。
该模型总参数量高达1960亿,但每次推理仅需激活约110亿参数。这种设计如同一个专业顾问团,既保证了处理复杂问题的深度和广度,又大幅降低了单次计算的成本与时间,实现了计算资源的高效利用。
工程优化的巧思
在工程实现上,Step 3.5 Flash也进行了多项优化以追求极致的流畅体验。针对长文本处理,它采用了3:1的滑动窗口与全局注意力混合机制,让模型在处理256K长上下文时能“一目十行”,有效避免了计算量的平方级增长。
此外,模型应用了多Token预测技术(MTP-3),将文本生成从“单车道”提升至“多车道”,一次可预测多个Token,显著提升了信息输出的吞吐效率,让交互体验更加连贯。
实测性能与价值
跑分测试和实际应用场景都验证了Step 3.5 Flash的卓越性能。在τ²-Bench、AIME 2025数学竞赛等多项评测中表现出色,尤其擅长Agent场景和数学任务。在NVIDIA Hopper GPU上,其最高推理速度可达每秒350个Token。
这意味着,在代码生成、长文档分析、后端自动化等需要长时间运行和多步推理的企业级任务中,AI的“迟滞感”被有效抹平,为AI深度集成到实际工作流中提供了可行的技术基础。
Step 3.5 Flash的亮相,不仅是模型技术的迭代,更验证了通往AGI的一条务实路径:通过架构创新而非仅靠参数堆叠。当开发者能以更低门槛获取既快又强的智能基座,构建行业应用的想象力将被彻底释放,AGI的实现进程或许就此加速。