上线两天登顶全球榜单,阶跃星辰怎么让 AI 又「聪明」又「快」?

源自公众号:AI科技评论

02-07 10:51

面对AI模型在复杂任务中普遍存在的性能与速度难以兼得的瓶颈,阶跃星辰开源的Step 3.5 Flash模型给出了新答案。它通过创新的稀疏MoE架构与工程优化,实现了在1960亿参数规模下的高效推理,既保证了智能水准,又带来近乎实时的响应体验,为AI的实际落地应用扫清了关键障碍。

上线两天登顶全球榜单,阶跃星辰怎么让 AI 又「聪明」又「快」?

上线两天登顶全球榜单,阶跃星辰怎么让 AI 又「聪明」又「快」?智能速览

  • Step 3.5 Flash上线两天即登顶全球热度趋势榜。

  • 采用稀疏MoE架构,仅激活11B参数处理任务,大幅提升效率。

  • 在NVIDIA Hopper GPU上,最高推理速度可达每秒350个Token。

  • 结合滑动窗口与全局注意力,高效处理256K长文本。

  • 其技术路径证明了,通过架构创新可以兼顾AI模型的智能与速度。

上线两天登顶全球榜单,阶跃星辰怎么让 AI 又「聪明」又「快」?精华内容

传统认知中,AI模型的“快”与“强”似乎是一对矛盾体,但Step 3.5 Flash的出现,正在打破这一技术预设。

以巧见大的架构

Step 3.5 Flash的核心突破在于其采用的稀疏混合专家架构。与动辄调动全部参数的传统千亿模型不同,它被组织成一个庞大的“专家团”。当接到任务时,智能路由会精准唤醒最相关的几个“专家小组”协同工作。

该模型总参数量高达1960亿,但每次推理仅需激活约110亿参数。这种设计如同一个专业顾问团,既保证了处理复杂问题的深度和广度,又大幅降低了单次计算的成本与时间,实现了计算资源的高效利用。

工程优化的巧思

在工程实现上,Step 3.5 Flash也进行了多项优化以追求极致的流畅体验。针对长文本处理,它采用了3:1的滑动窗口与全局注意力混合机制,让模型在处理256K长上下文时能“一目十行”,有效避免了计算量的平方级增长。

此外,模型应用了多Token预测技术(MTP-3),将文本生成从“单车道”提升至“多车道”,一次可预测多个Token,显著提升了信息输出的吞吐效率,让交互体验更加连贯。

实测性能与价值

跑分测试和实际应用场景都验证了Step 3.5 Flash的卓越性能。在τ²-Bench、AIME 2025数学竞赛等多项评测中表现出色,尤其擅长Agent场景和数学任务。在NVIDIA Hopper GPU上,其最高推理速度可达每秒350个Token。

这意味着,在代码生成、长文档分析、后端自动化等需要长时间运行和多步推理的企业级任务中,AI的“迟滞感”被有效抹平,为AI深度集成到实际工作流中提供了可行的技术基础。

Step 3.5 Flash的亮相,不仅是模型技术的迭代,更验证了通往AGI的一条务实路径:通过架构创新而非仅靠参数堆叠。当开发者能以更低门槛获取既快又强的智能基座,构建行业应用的想象力将被彻底释放,AGI的实现进程或许就此加速。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章