当前位置:
AIGC文章详情

宣称比GPU快30倍,股价却在发布当天跌了13%:Cerebras CS-4的三笔账

源自41位全网作者

08-23 14:25

上周,Cerebras给自己投了一次"分裂票"。要知道,这可是今年5月完成年内最大IPO的明星公司:募资55.5亿美元,上市首日股价大涨68%,市值一度接近千亿美元。界面新闻36氪可上周的两件事,市场一件面子都没给。

8月12日周三,它发布二季度财报:营收1.801亿美元,同比增长74%。知乎数字不算难看,但硬件收入同比下滑23%,财报未达预期,股价盘后重挫超16%。知乎这是第一棒。

六天后的8月18日,Cerebras在Supernova发布会上推出CS-4机架级推理系统:3颗超频版WSE-3 Turbo晶圆级芯片装进一个机架,官方宣称单用户每秒可输出4400多个token,最高比领先GPU方案快30倍。知乎结果发布当天,股价反跌13%。哔哩哔哩技术叙事拉满,市场反应却是一盆冷水。到底哪边错了?其实都没错——只是读的不是同一本账。今天把"30倍"背后的三笔账算清楚。

一、4400 token/s:数字是真的,但口径很讲究

先纠正一个被广泛传错的说法:CS-4不是一颗芯片,而是一个机架级系统,里面装的也不是"新一代WSE-4",是超频版的WSE-3。知乎不少转述写成"Cerebras发布新一代芯片CS-4",是把系统代号当成了芯片代号——这两件事的含义差得很远。

宣称比GPU快30倍,股价却在发布当天跌了13%:Cerebras CS-4的三笔账

Cerebras官方对"30倍"的表述其实很克制,原文是"up to 30x more tokens-per-second-per-user than leading GPU-based solutions"。知乎三个限定条件必须一起读:

  • 指标是tokens-per-second-per-user,即"一个人用起来多快",不是"一台机器能同时服务多少人";

  • 基准模型只有一个:OpenAI开源的GPT-OSS-120B,实测单用户超4400 token/s;

  • 对比对象"领先GPU方案"没有点名,官方脚注还写明:实际吞吐随模型架构、上下文长度、精度和部署配置而变化。

倒推一下:4400÷30≈147 token/s,对一套多卡分片的GPU推理服务来说是合理量级——也就是说"30倍"大概率是真的,但只在"单用户+这个特定模型"的条件下成立。知乎

宣称比GPU快30倍,股价却在发布当天跌了13%:Cerebras CS-4的三笔账

那它凭什么这么快?答案不是算力,是带宽。大模型生成文字时,每吐一个字都要把整个模型权重完整读一遍,卡脖子的不是算力而是内存带宽。WSE-3 Turbo片上SRAM带宽43200 TB/s,单张B200的HBM带宽8 TB/s,差5400倍。知乎这就是晶圆级芯片的全部魔法:不让权重离开这块硅,就不用跨芯片搬运。

二、132GB vs 120GB:速度是拿什么换的

带宽不是白来的。片上SRAM又快又贵,一颗WSE-3 Turbo只有44GB;对比之下,单张B200有192GB HBM,容量是它的4.4倍。知乎

宣称比GPU快30倍,股价却在发布当天跌了13%:Cerebras CS-4的三笔账

把这笔账算清楚,你就看懂了这场发布会最深的地方:

  • CS-4三颗芯片总SRAM:132GB

  • GPT-OSS-120B权重按8bit:约120GB

  • 余量:只剩12GB,9%

官方选的基准模型,恰好就是CS-4能装下的最大号模型。换成FP16精度,132GB只装得下约66B参数的模型——再大就跑不了,不是慢,是根本装不下。知乎这不是欺骗,公开信息里全写着,只是没人把两个数字并排摆给你看。知道换走的是容量,"30倍"的适用范围就清楚了。

顺带说另一个流传很广的数字:“每瓦吞吐提升10倍”,对比对象是Cerebras自家上一代CS-3,不是GPU。知乎

三、一周两次下跌:市场在担心什么

再看CS-4的"提速"到底改了什么:芯片没换代,制程没前进。把WSE系列的演进拉出来看:16nm到7nm,核心数从40万涨到85万,翻了一倍多;7nm到5nm,85万涨到90万,只提升5.9%。知乎到了WSE-3 Turbo,制程干脆停在5nm,改成提频加堆片。

宣称比GPU快30倍,股价却在发布当天跌了13%:Cerebras CS-4的三笔账

超频的手法很硬:按媒体拆解,供电模块从距芯片约50mm直接贴到0.5mm,用更大电流换更高频率。哔哩哔哩代价是功耗跳涨——媒体推测整机功耗从约27kW升到约54kW,这个数字Cerebras没有官方确认。知乎换句话说,CS-4换速度,靠的是频率和功耗。

说句公道话,"拼三片而不打折"本身是很硬的工程:晶圆间延迟压到了2微秒。知乎真正的看点不是这三片,而是以后还能不能是六片、十二片。

市场的担心更直接,全写在财报里:二季度硬件收入只有5410万美元,同比下滑23%;云计算及其他服务收入达到1.26亿美元,同比增长281%。知乎云服务已占总营收七成,公司手里还压着254亿美元订单。哔哩哔哩“市场在担心什么”,答案就写在这组数字里。

翻译一下:Cerebras正在从"卖芯片"转向"卖算力"。问题在于,卖芯片有需求波动——这季硬件下滑就是证据;卖算力有客户集中——254亿美元订单的大头绑在OpenAI身上:多年期协议,最高750兆瓦,价值超200亿美元,分批交付到2028年,体量约等于公司全年营收指引(8.55亿—8.65亿美元)的23倍。知乎订单这么大,是门票也是枷锁:当一个客户的份量大到这个程度,"客户"和"老板"之间的界线就模糊了。

再叠加"超频当新品、30倍没公开对标"的观感,市场用脚投票不是没道理。

四、别急着下结论:多头这边的牌也是真的

多头的牌第一张,是需求侧的表态。财报电话会上,CEO说快速推理的需求是无限的,并宣布明年一季度上线AWS Bedrock。知乎8月8日,AMD与Cerebras宣布"解耦推理"合作,宣称每瓦token吞吐最高提升5倍——晶圆级芯片开始进入通用推理供应链,而不是单打独斗。哔哩哔哩资本端,老虎环球基金Q2新进Cerebras。知乎需求、供应链、资本,都投了票。

第二张牌,是产品本身的落地证据。OpenAI的GPT-5.6 Sol Ultrafast(最高提速14倍、750 token/s)已经跑在Cerebras基础设施上,目前只向部分客户开放。哔哩哔哩卖方也分裂:摩根士丹利基于已锁定的600多兆瓦数据中心容量上调目标价,另一派则盯着硬件需求波动不放。哔哩哔哩至于是不是市场期待的那座"大规模token工厂",等独立基准和第一批出货出来,自然见分晓。

五、这事和你有什么关系

如果你是API/开发者用户:最直接的体验入口是OpenAI上的GPT-5.6 Sol Ultrafast(750 token/s,有限预览)。"实时Agent、秒出代码"会不会变成标配体验,就看这类推理的成本能不能打到地板价。

如果你是算力/芯片观察者:CS-4证明了一件事——推理的瓶颈早就不在算力,而在带宽,而且HBM涨价的大背景下"逃离HBM"正在变成真实趋势。盯两个信号:堆片能不能规模化(六片、十二片),以及电费会不会成为新瓶颈。

如果你关注CBRS这只股票(不构成投资建议):盯信号比在评论区吵架有用——独立第三方基准何时出炉、CS-4首批交付、Q3硬件收入是否回升、AWS Bedrock上线兑现、客户集中度变化。等独立拆解和真实出货出来,"里程碑还是PPT"自然有答案。

最后说两句

30倍是真的,但它有边界。边界是:单用户、特定模型,以及拿容量换的。

Cerebras把整个公司押在"快推理"上,254亿美元订单是这场豪赌的凭证。它是眼下最值得盯的"GPU破局"样本,但现在是观察期,不是结论期。

下次再看到"快N倍",先问一句拿什么换的。这句话不只用在看芯片上。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章