张大妈

阶跃星辰Step-3.5-Flash模型团队分享实录

源自公众号:Datawhale

02-11 21:49

在Agent时代,推理速度就是生产力。阶跃星辰发布的Step-3.5-Flash模型以196B总参数量和11B激活参数的极致稀疏架构,实现了350 TPS的超高推理速度。这款面向实时Agent工作流的开源基座模型,通过独特的智能密度设计和创新训练方法,为开发者提供了真正"用得起、等得起"的Agent开发解决方案。

阶跃星辰Step-3.5-Flash模型团队分享实录智能速览

  • Step-3.5-Flash采用20:1稀疏度架构,总参数196B但仅激活11B

  • 推理速度高达350 TPS,支持256K混合上下文

  • 独创Midi-train训练阶段,为模型注入原子能力

  • 支持Test-Time Scaling技术,通过并行推理提升准确率

  • 全面开源,兼容OpenAI格式和Claude Code的MCP协议

  • 实测显示模型能自主理解文档并编写代码,展现Agentic Coding能力

阶跃星辰Step-3.5-Flash模型团队分享实录精华内容

当行业还在卷参数规模时,Step-3.5-Flash选择了一条"高智能密度+极速推理"的非典型路径,用技术创新重新定义了Agent时代的生产力标准。

架构设计

Step-3.5-Flash的参数配置充满矛盾:总参数量高达196B,但激活参数却仅有11B。这是一个极致稀疏的MoE架构,稀疏度达到了20:1。这种设计让模型在保持高智能密度的同时,大幅降低了推理成本。

在注意力机制上,团队在Sliding Window Attention (SWA)和Full Attention之间做了3:1的混合比例,平衡了因果关系保留和推理速度。Full Attention能保证Agent的状态存储需求,而SWA则提供了速度优势。

Midi-train创新

团队引入了被称为Midi-train的中间训练阶段,这不同于传统的预训练或后训练。这一阶段专门为解决Coding Agent"懂代码但不懂框架"的痛点。

在Midi-train阶段,模型被灌输大量的原子能力数据。例如在编程场景中,不只是教Python语法,还针对前端场景,把Three.js的语法、GPU科学计算能力、页面渲染美观度等都拆解成原子能力。这种训练方式让模型在面对复杂任务时展现出近乎直觉的组合能力。

实测表现

在实际演示中,Step-3.5-Flash展现了强大的Agentic Coding能力。模型能够自主探索并编写Deep Research的Wrapper,在输入10K tokens后几乎瞬间开始输出。

模型展现了精准的Markdown解析和信息提取能力,完全符合人类开发者的编码习惯。另一个案例是端云协同架构:Step-3.5-Flash在云端作为"大脑"规划任务,Step GUI模型在端侧作为"手"执行操作,实现了高效的分工协作。

技术挑战

追求极致速度也带来了工程挑战。Multi-Token Prediction (MTP)技术让模型生成速度过快,导致下游传统的Stream Parser逻辑无法适应,上线第一天就出现了解析崩溃问题。

另一个挑战是模型有时思维链(CoT)过长,虽然生成速度快但Token效率还不够高。团队表示缩短CoT同时保持智能水平是下一版优化的首要目标。

应用场景

Step-3.5-Flash的核心定位是面向实时Agent工作流的开源基座。开发者可以利用其高速度构建各种Agent应用,从代码编写到办公自动化。

模型支持复杂的业务系统开发协作:先让模型生成初版框架(0到1),然后通过不断的Prompt指令进行细节更新(1到100)。对于需要操作办公软件的场景,可以配置MCP工具,让模型理解并编排使用这些工具。

Step-3.5-Flash不仅是一款追求速度的模型,更是对Agent时代生产力的一次重新思考。通过极致的稀疏架构、创新的Midi-train训练和实时的推理能力,它为开发者打开了构建高效Agent的新可能。随着开源生态的完善和应用场景的拓展,这种"智能密度+极速推理"的路径或将成为Agent发展的新范式。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章