阶跃Step5 Preview发布当天:“开源前三”是刚收紧过的榜——44分、$0.71、1/8是三把尺,先对完账再决定要不要薅这75天

源自182位全网作者

04:17

9月20日,阶跃星辰把攒了一年多的一张牌全摊在桌上:Step5 Preview,稀疏MoE,总参数600B、激活仅27B,1M上下文,原生文本+视觉输入。API和Studio当天全量开放,完整权重定档10月15日开源。发布几小时内,“全球开源前三”“单任务成本约为Claude Opus 5的1/8"刷屏,知乎B站同时被"免费鸡蛋”(StepPlan最长送75天)的教程帖占领。新智元AI前线日报新京报贝壳财经

阶跃Step5 Preview发布当天:“开源前三”是刚收紧过的榜——44分、$0.71、1/8是三把尺,先对完账再决定要不要薅这75天

对于天天用AI写代码、正纠结下一站换哪个模型的开发者,这场发布值得花五分钟把账对完再上车——发布当天最容易带节奏的就是那几个数字,而且社区今天本来就没达成一致。

第一把尺:44分是真的,但打分用的尺子这个月刚换过

Artificial Analysis智能指数给Step5 Preview的分数是44,官方口径是"全球开源模型前三"。横向对照:Claude Fable 5.1以53分居首,GPT-6 Astra 52.8,开源阵营里此前只有Kimi K3杀进全球前五被当里程碑,Step5 Preview是第二个挤进核心竞争区的开源选手。新智元

阶跃Step5 Preview发布当天:“开源前三”是刚收紧过的榜——44分、$0.71、1/8是三把尺,先对完账再决定要不要薅这75天

细节在榜单自己身上:AA指数月初刚升级到v4.2,新增两项评测、淘汰了"太容易"的GPQA Diamond、私有测试集权重翻倍到40%。也就是说,44分这个位置比旧榜时期更难拿,但也别拿去和上个月的成绩直接换算。新智元

社区对这块榜的分歧是真实的。知乎那篇被看了十三万遍的回答直接开嘲:“再次证明了AA榜是纯野榜,前有muse spark力压Astra,现有600B模型硬刚2.7T的K3”。B站测评侧则分成两拨:实测UP主"AI产品狙击手"拉满思考模式跑完SVG、看板、太空游戏后给了"整体综合表现相当出彩";阶跃赞助过token的UP主"阿早"说"今天真的拿来干活了,真的可以开始跑长任务了";而另一位昨天刚测过预览版的UP主看到官方跑分和定价,只回了句"祝福"。合理用法:榜是一把尺,今天的第三方实测是另一把尺——而且注意,所有实测跑的都是Preview API,这就是10月15日前你唯一能摸到的东西。知乎哔哩哔哩哔哩哔哩

第二把尺:600B是体量尺,27B是算力尺,两把都不能直接进显存账单

600B总参/27B激活,激活比例约4.5%。有个反直觉的事实:这比阶跃自家两条效率线的激活比例还低——Step 3.5 Flash是196B总参/11B激活、Step 3.7 Flash约198B/11B,都在5.6%上下,3.7 Flash当年还拿过HuggingFace多模态热榜和ClawEval多模态榜的全球第一。旗舰用比效率线更"薄"的激活比例,这是"效率优先"路线从Flash一路贯到旗舰的实际含义。官方披露的实现细节也对得上:Transformer加深到92层做"Narrow but Deep",让长Prefill里的多跳依赖传得动;Sparse GQA用稀疏索引在百万token里"只看该看的地方";Block-wise Token Merging把Indexer和Top-k选择成本降了8倍。新智元

但今天就把"600B/27B"往部署成本里代还为时过早——权重没发,激活参数27B说的是单token计算量,不是显存需求。之前我们给MiniMax H3开源对账时就见过"0.1元一秒和0.8元一秒都是真的"这种多尺混用,本地部署党的账,等10月15日权重落地再开算。

第三把尺:$1/$2.7、$0.71、1/8,是三条口径不同的账,别互相换算

API定价为每百万token输入1美元、输出2.7美元;“跑完一道AA智能指数任务平均0.71美元"来自AA官方"智能指数vs单任务成本"图,Step5 Preview被画成了新的帕累托前沿;新京报贝壳财经报道里的"1/8”,比的同样是单任务成本,不是单价。三个数字口径各异:单价是牌价,0.71是"典型任务"的实测均值,1/8是相对Opus 5的比值——谁都没说谎,但拿第一个去除以第二个得出结论,就错了。新智元新京报贝壳财经

阶跃Step5 Preview发布当天:“开源前三”是刚收紧过的榜——44分、$0.71、1/8是三把尺,先对完账再决定要不要薅这75天

再加上"Preview"三个字的分量:正式版是否维持这个价格,是行业保留节目,进生产的账要等正式价签。

第四把尺:官方演示全部押在"长程执行",金融是主考场

和很多发布晒聊天截图不同,这次的官方案例清一色是专业工作流:单文件Three.js 3D飞行游戏20多分钟写完上线;12份合同、120个判断、26处违规全中,三份交付文件互相咬合。金融尽调里把银行流水、供应商名录、创始人deck三份材料连起来,揪出材料里"没埋"的关联交易。爱范儿的实测给了个更扎心的横向参照:同一个网页操作系统任务,此前用DeepSeek V4 Pro和V4.1 Flash测过,Step5 Preview这次完成度更高。新智元

阶跃Step5 Preview发布当天:“开源前三”是刚收紧过的榜——44分、$0.71、1/8是三把尺,先对完账再决定要不要薅这75天

金融方向官方自设了FinStepBench三项加外部FrontierFinance(220道专家题、11543项评分标准),"接近Claude Opus 5"是官方口径,读的时候记得打个折。对准备拿它审合同、跑数据室的人,判断标准很实际:别复跑它的Demo,用你自己的第八份合同去测——官方自己都说,长任务最容易死在第8份之后。爱范儿

第五把尺:75天免费期,什么人先上、什么人等

StepPlan的领取规则:注册送15天,完成首次API调用再送15天,每邀一位新用户续15天、最多45天,叠满约75天。分人群给结论——知乎

  • 偶尔写代码、做页面的:现在就上,免费期足够验证合不合手,试错成本约等于零;

  • 考虑换API的团队:用免费窗口跑自己的任务做A/B,但生产切换等10月15日正式权重和价签,Preview的积分和限流条款要先看,客户代码库和内部文档在"白嫖"阶段尤其别乱喂;

  • 想本地部署的:等权重落地,那天才是把600B/27B写进显卡账单的第一天;

  • 看榜的:盯两个后续信号——10月15日权重放出后第三方复测的分数有没有漂移,以及视频输入按什么尺计费。前者决定44分的成色,后者决定你剪片子、看录屏的活儿它能不能真接。

最后补一句当天现场:这不是阶跃一家在刷屏——同一天,通义开源了Qwen-Image-2.1(7B统一图像模型,文生图和图像编辑合一,最多喂10张参考图做局部编辑),另有AI日报称智谱发布了GLM-5.3-Flash。九月确实是周周洗牌的修罗场,而阶跃是少数"不小步快跑、直接攒大的"的那个。这张600B的牌值不值它让人等了这一年,五把尺对完,各人有各人的读数——但至少今天,"换哪个模型"这个问题,值得重新打开一次。微博哔哩哔哩新智元

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章