昨天刚把 125B 塞进游戏机的朋友,今天刷到 Beam 发布会大概率已经在查内存价格了。
先给赶时间的人一句话:截至 10 月 6 日上午,Beam 的权重根本下不到——官方开放的是早期访问候补申请,全量权重要等本月晚些时候才以 Apache 2.0 放出。 所以这篇不是装机教程,是一张"要不要等、等的话 cash 怎么花"的账本。小红书
先把公告事实钉死
10 月 5 日,Reflection AI 发布旗下首款开放权重大模型 Beam:总参数量 5010 亿、每个 token 激活参数量仅 230 亿,主打代码与智能体任务,对标 GLM-5.2,逼近千问 3.8-Max。 这家公司此前拿到了英伟达的 8 亿美元战略投资。IT之家微博
官方口径是,在部分高级推理评测中 Beam 可以达到接近 GLM-5.2 的性能,同时使用约 3–4 倍更少的 generation FLOPs。 成绩单报了 SWE-bench Verified 80.9、Terminal Bench v2.1 80.1——自家数据,还没经过第三方实测。知乎小红书
训练侧确实硬:Beam Base 的预训练吞下 23.8 万亿 token,整个训练在 6,144 块 GB300 NVL72 上跑完,不到四周。 RL 阶段调了约 1.05 万块 GB300,整整跑 4 周,生成超 1 亿次 rollout、动用约 13 亿个沙箱。知乎小红书
社区两派这两天已经吵起来了:一派喊"美国版 DeepSeek 来了,开源前沿中美同场竞技";另一派的笔记标题直接把冷水泼在装机单上:“5010 亿新模型,显卡先别急着买”。 两边都不算错,错的是把"激活 230 亿"听成"按 23B 预算部署"。下面三本账,一笔一笔对。小红书
账一·权重账:5010 亿要占多大地方,社区换算率已经够用
激活量管的是"每次叫多少人干活",部署看的是"所有人的工位都要安排"。MoE 的工位就是权重,权重就要进内存——这笔账不用等官方,今年社区已经用真金白银的机器标定了换算率。第一个锚点:V4.1 Flash 的参数量已经做到 552B。 第二个锚点:125B 的 IQ2_XS 塞进 48G 内存机实测能跑;第三个锚点:Bonsai2 量化后只占 5.9GB。知乎
量化档位 | 换算率(GB/十亿参数) | 锚点(均为社区实测) | Beam 501B 估算 |
|---|---|---|---|
FP8 | ≈1.02 | V4.1 Flash 552B 的 FP8 档约 510-560GB 量级 | ≈510GB,服务器门票 |
Q4 | ≈0.56 | — | ≈280GB,工作站档 |
IQ3_XS | ≈0.30 | 125B 跑在 48G 内存机(勉强) | ≈150GB,256G 机才稳 |
IQ2_XS | ≈0.22~0.24 | 125B≈30GB;Bonsai2 27B=5.9GB | ≈110~120GB,128G 机装得下但很挤 |
IQ1 及以下 | <0.15 | — | ≈70GB,"装得下"但参考 Bonsai2 前车之鉴 |
这张表每一行都有出处,但 Beam 那一列要提前声明:是我按同类 MoE 实测换算率外推的估算,不是官方数字,量化版出来当天就会被校准或打脸。
两个扎心的推论:第一,32G~64G 内存的口粮机这轮基本没有门票——501B 就算砍到 IQ1 也要 70GB 起;第二,就算砍到 IQ2 的 110GB,你也会一脚踩进 Bonsai2 踩过的坑:27B 量化到 5.9GB 时号称保留 98.2% 智商,结果六个 agent 任务无一可用。80.9 的 SWE-bench 是满血模型跑的分,不是你 128G 机上 IQ2 版的分。证据覆盖到量化这一层,结论就只能说到这一层。
账二·速度账:23B 激活只承诺算力,不承诺带宽
“只激活 230 亿"确实意味着每次 forward 的计算量小,但本地推理真正卡脖子的是"每秒要过多少 GB 数据”。Beam 用的是 interleaved local/global attention + 细粒度路由专家,官方还专门做了负载均衡、宣称最忙专家也只有平均负载的 1.04 倍——这个特性对卸载引擎算利好(专家命中均匀,缓存策略更好写),但 1M 上下文是训练侧声明,本地能不能开到、KV 要吃多少,和 V4.1 Flash 那次一样,要等实测。
参照系同样摆好了:一张 RTX 4060Ti,16GB 显存、32GB 内存,跑通 125B 的 Qwen3.8-Flash-Next 实测输出 30.1 token/s。 而 Strata 这套"专家常驻显存+CPU兜底"的路子,本质就是给这种"计算量小、工作集大"的模型安排工位——125B 已经要靠内存硬抗,权重再翻四倍,内存通道和读盘压力也是翻着倍涨的。同一张 Strata,社区里有人跑出 130 t/s、有人只有 5 t/s 的先例就在眼前,别拿 125B 的体感去想象 501B。想拿 501B 跑出能干活的速度,门票大概率是"16G 显存 + 256G 高频内存"这个量级起,而这还是引擎适配成功的前提下。哔哩哔哩
账三·钱和窗口账:为什么"先别急着买"这次站得住
权重月底放,GGUF 转换、llama.cpp/Strata/vLLM 适配都得排在权重后面——vLLM 刚发 v0.31.0,架构适配要从大版本节奏里重新排队,这一版塞进了 717 次提交、307 名贡献者。 参考今年节奏:Qwen3.8-Flash-Next 从有 GGUF 到 Strata 教程刷屏大约一周,Bonsai2 上线 11 天全网 21 个实测点。按这个速度,501B 的第一批真实"能不能跑、多少 t/s"数据,最快 10 月中下旬才能出现。小红书
而现在是买东西最差的时点:内存连涨数月、显卡同样在高位,社区里已经有人晒项目没上线、靠倒卖 GPU 先挣了几千刀。在价格顶部、为一个没实测过 IQ2 的模型现金加装机,是确定性亏损换不确定性期待。
三种人,三种动作
64G 及以下内存的口粮党:不用动。你的生态位还是 Qwen3.8-Flash-Next/27B 这一档,Beam 短期不会改变任何人的 48G 桌面现实。
正在犹豫要不要内存升级到 128/256G 的:别看 Beam 做决定,看你自己的 KV 水位线——Strata+IQ3 已经把你的 64G 吃到边了吗?是的话为口粮模型升也值;不是的话,"等 501B"是这次最不该买的理由。
256G+ 工作站 / Spark 128G×2 / M5 Ultra 级用户:可以等,但等的是放权后的第一批实测,不是发布会。先盯三个信号:① 权重与完整技术报告落地时间(模型还在红队测试收尾);② llama.cpp 转换 PR 和 Strata/vLLM 适配公告;③ 第三方 SWE-bench / agent 任务复测——80.9 自报分和"Kimi K3 原始能力仍领先"这两句话都还挂着,别提前站队。
V4.1 Flash 那一轮,门票写的是"显存降到四分之一",卡住本地党的是那几百 GB 权重和那块查表。这次 Beam 把剧本原样重演:喊的是"5010 亿只激活 230 亿",卡你的还是那 110~120GB 起步的权重。权重没落地之前的所有热情,都不如一张换算表值钱。