『美国版DeepSeek』和『显卡先别急着买』都是真的:Beam 5010亿只激活230亿,我把V4.1、125B、Bonsai2三组实测换算率摆进同一张表——丐帮要不要等月底,先对完这三本账

源自18位全网作者

12:00

昨天刚把 125B 塞进游戏机的朋友,今天刷到 Beam 发布会大概率已经在查内存价格了。

先给赶时间的人一句话:截至 10 月 6 日上午,Beam 的权重根本下不到——官方开放的是早期访问候补申请,全量权重要等本月晚些时候才以 Apache 2.0 放出。 所以这篇不是装机教程,是一张"要不要等、等的话 cash 怎么花"的账本。小红书

先把公告事实钉死

10 月 5 日,Reflection AI 发布旗下首款开放权重大模型 Beam:总参数量 5010 亿、每个 token 激活参数量仅 230 亿,主打代码与智能体任务,对标 GLM-5.2,逼近千问 3.8-Max。 这家公司此前拿到了英伟达的 8 亿美元战略投资。IT之家微博

官方口径是,在部分高级推理评测中 Beam 可以达到接近 GLM-5.2 的性能,同时使用约 3–4 倍更少的 generation FLOPs。 成绩单报了 SWE-bench Verified 80.9、Terminal Bench v2.1 80.1——自家数据,还没经过第三方实测。知乎小红书

训练侧确实硬:Beam Base 的预训练吞下 23.8 万亿 token,整个训练在 6,144 块 GB300 NVL72 上跑完,不到四周。 RL 阶段调了约 1.05 万块 GB300,整整跑 4 周,生成超 1 亿次 rollout、动用约 13 亿个沙箱。知乎小红书

社区两派这两天已经吵起来了:一派喊"美国版 DeepSeek 来了,开源前沿中美同场竞技";另一派的笔记标题直接把冷水泼在装机单上:“5010 亿新模型,显卡先别急着买”。 两边都不算错,错的是把"激活 230 亿"听成"按 23B 预算部署"。下面三本账,一笔一笔对。小红书

账一·权重账:5010 亿要占多大地方,社区换算率已经够用

激活量管的是"每次叫多少人干活",部署看的是"所有人的工位都要安排"。MoE 的工位就是权重,权重就要进内存——这笔账不用等官方,今年社区已经用真金白银的机器标定了换算率。第一个锚点:V4.1 Flash 的参数量已经做到 552B。 第二个锚点:125B 的 IQ2_XS 塞进 48G 内存机实测能跑;第三个锚点:Bonsai2 量化后只占 5.9GB。知乎

量化档位

换算率(GB/十亿参数)

锚点(均为社区实测)

Beam 501B 估算

FP8

≈1.02

V4.1 Flash 552B 的 FP8 档约 510-560GB 量级

≈510GB,服务器门票

Q4

≈0.56

—

≈280GB,工作站档

IQ3_XS

≈0.30

125B 跑在 48G 内存机(勉强)

≈150GB,256G 机才稳

IQ2_XS

≈0.22~0.24

125B≈30GB;Bonsai2 27B=5.9GB

≈110~120GB,128G 机装得下但很挤

IQ1 及以下

<0.15

—

≈70GB,"装得下"但参考 Bonsai2 前车之鉴

这张表每一行都有出处,但 Beam 那一列要提前声明:是我按同类 MoE 实测换算率外推的估算,不是官方数字,量化版出来当天就会被校准或打脸。

两个扎心的推论:第一,32G~64G 内存的口粮机这轮基本没有门票——501B 就算砍到 IQ1 也要 70GB 起;第二,就算砍到 IQ2 的 110GB,你也会一脚踩进 Bonsai2 踩过的坑:27B 量化到 5.9GB 时号称保留 98.2% 智商,结果六个 agent 任务无一可用。80.9 的 SWE-bench 是满血模型跑的分,不是你 128G 机上 IQ2 版的分。证据覆盖到量化这一层,结论就只能说到这一层。

账二·速度账:23B 激活只承诺算力,不承诺带宽

“只激活 230 亿"确实意味着每次 forward 的计算量小,但本地推理真正卡脖子的是"每秒要过多少 GB 数据”。Beam 用的是 interleaved local/global attention + 细粒度路由专家,官方还专门做了负载均衡、宣称最忙专家也只有平均负载的 1.04 倍——这个特性对卸载引擎算利好(专家命中均匀,缓存策略更好写),但 1M 上下文是训练侧声明,本地能不能开到、KV 要吃多少,和 V4.1 Flash 那次一样,要等实测。

参照系同样摆好了:一张 RTX 4060Ti,16GB 显存、32GB 内存,跑通 125B 的 Qwen3.8-Flash-Next 实测输出 30.1 token/s。 而 Strata 这套"专家常驻显存+CPU兜底"的路子,本质就是给这种"计算量小、工作集大"的模型安排工位——125B 已经要靠内存硬抗,权重再翻四倍,内存通道和读盘压力也是翻着倍涨的。同一张 Strata,社区里有人跑出 130 t/s、有人只有 5 t/s 的先例就在眼前,别拿 125B 的体感去想象 501B。想拿 501B 跑出能干活的速度,门票大概率是"16G 显存 + 256G 高频内存"这个量级起,而这还是引擎适配成功的前提下。哔哩哔哩

账三·钱和窗口账:为什么"先别急着买"这次站得住

权重月底放,GGUF 转换、llama.cpp/Strata/vLLM 适配都得排在权重后面——vLLM 刚发 v0.31.0,架构适配要从大版本节奏里重新排队,这一版塞进了 717 次提交、307 名贡献者。 参考今年节奏:Qwen3.8-Flash-Next 从有 GGUF 到 Strata 教程刷屏大约一周,Bonsai2 上线 11 天全网 21 个实测点。按这个速度,501B 的第一批真实"能不能跑、多少 t/s"数据,最快 10 月中下旬才能出现。小红书

而现在是买东西最差的时点:内存连涨数月、显卡同样在高位,社区里已经有人晒项目没上线、靠倒卖 GPU 先挣了几千刀。在价格顶部、为一个没实测过 IQ2 的模型现金加装机,是确定性亏损换不确定性期待。

三种人,三种动作

  1. 64G 及以下内存的口粮党:不用动。你的生态位还是 Qwen3.8-Flash-Next/27B 这一档,Beam 短期不会改变任何人的 48G 桌面现实。

  2. 正在犹豫要不要内存升级到 128/256G 的:别看 Beam 做决定,看你自己的 KV 水位线——Strata+IQ3 已经把你的 64G 吃到边了吗?是的话为口粮模型升也值;不是的话,"等 501B"是这次最不该买的理由。

  3. 256G+ 工作站 / Spark 128G×2 / M5 Ultra 级用户:可以等,但等的是放权后的第一批实测,不是发布会。先盯三个信号:① 权重与完整技术报告落地时间(模型还在红队测试收尾);② llama.cpp 转换 PR 和 Strata/vLLM 适配公告;③ 第三方 SWE-bench / agent 任务复测——80.9 自报分和"Kimi K3 原始能力仍领先"这两句话都还挂着,别提前站队。

V4.1 Flash 那一轮,门票写的是"显存降到四分之一",卡住本地党的是那几百 GB 权重和那块查表。这次 Beam 把剧本原样重演:喊的是"5010 亿只激活 230 亿",卡你的还是那 110~120GB 起步的权重。权重没落地之前的所有热情,都不如一张换算表值钱。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章