张大妈

JetBrains Mellum2.1接入IDE实测:高负载下代码生成效率翻倍?

源自192位全网作者

12:46

JetBrains 在 10 月 8 日发布博文,宣布上线编程 AI 模型 Mellum2.1,重点增强智能体编程能力,延续 12B 混合专家架构与 Apache 2.0 许可。 至于标题里那个问号,先钉死翻倍的是什么:官方口径接近两倍的,是高负载下的推理吞吐,而不是代码生成质量——全量权重经 vLLM 或 SGLang 部署、单张 H200 上的重载吞吐接近 Qwen3.5-9B 的两倍,多 token 预测另让单次请求快约 1.6 倍。IT之家前沿在线
"接入 IDE 实测"这一环,目前的传播还停在发布转述和自测数据转述层面:截至 10 月 10 日,检索不到第三方接入 IDE 的实测内容,JetBrains 也没有公布 2.1 是否替换 IDE 内的服务。开发者真正关心的其实是三件事:这个"翻倍"具体指哪个指标、质量涨幅到底多少、它什么时候进编辑器。

最有分量的变化不是速度,是它能进仓库改文件

上一代 Mellum2 在 SWE-bench Verified——衡量"在真实 GitHub 仓库里修 bug"的基准——自评只有 2.0 分,这次跳到 47.0,SWE-bench Pro 从 0.0 到 28.0,Terminal-Bench 2.1 从 0.6 到 17.4,同套流程对比 17 项里 15 项赢了自家上一代。前沿在线
涨分的路线比分数本身值得注意:架构和参数一个没动,升级的工作量几乎全部花在预训练之后,强化学习从收尾的一小段变成训练主体。 训练做法是把模型扔进真实环境:带着 shell 和改文件工具进真实仓库,找失败测试的根因、动手改、再跑一遍,测试通过才给奖励,期间启动数百万个沙箱、覆盖数千个环境。小红书CSDN

换个对照组,故事就变了:三大修 bug 基准全输给 Qwen3.5-9B

但上面这套跃升是跟自己比,换成跨品牌对照组,画面完全不同:与 Qwen3.5-9B 同场评测,Mellum2.1 在三个最像"真实仓库修 bug"的基准上全部落后(47.0 对 50.0、28.0 对 38.0、17.4 对 21.7),17 项里只赢 5 项,拿到的是 LiveCodeBench v6(82.0 对 75.4)、HumanEval+ 和两项工具调用。
也就是说,它换来的不是"最强",而是每 token 只激活 2.5B 参数的推理成本,和"能装进自己机器"的体量。
这张胜负表对评测流程还相当敏感:同一个 Qwen3.5-9B,官方模型卡报 LiveCodeBench v6 65.6、GPQA Diamond 81.7,JetBrains 用自家流程测同一个模型得到的是 75.4 和 77.8——这 17 项全是厂商自测,尚无第三方复现,评测一换流程结论就可能变化,现阶段跨榜单比数字并不可靠。

"翻倍"的正确读法:高并发吞吐,不是单次请求速度

高负载吞吐说的是高并发下整体每秒能产出多少 token,跟你在编辑器里等一次补全返回快多少,是两个不相干的指标。
JetBrains 自家的定位口径里,Mellum 系列本来就是为软件工程系统的高频环节准备的:从零训练、专为实际部署设计,用来做路由、问答、子智能体和私有 AI,而不是和前沿大模型抢"最强大脑"的位置。JetBrains
能吃到吞吐红利的,是智能体编排、CI 流水线、企业内网私有化这类高频调用场景,而 Apache 2.0 可商用许可是这类玩法的前提。
本地跑的门槛确实降了:GGUF 仓库已列出 5 个量化版本,最小约 7.0GB、推荐的 Q4_K_M 为 8.1GB。 但要留意,官方口径里 GGUF 与 vLLM 的 MTP 头仍是"即将推出"——兑现之前,单次 1.6 倍提速还只是实验室数据,本地体验也还停在初版量化这一步。

"接入 IDE"的现状:模型还在编辑器外面,实测文章也还没出现

用户侧的体验参照还是上一代的:一位 IDEA 用户在 7 月的实测帖(个人体验向)记录,AI Assistant 已切成混合架构——基础补全用自研 Mellum 主打低延迟,复杂多步任务和 Agent 模式才调用 Claude 4.5 或 GPT-5。码农老王
而 2.1 的发布形态与前代相同:Thinking 版权重挂在 Hugging Face,官方口径是面向编码智能体的开源编程模型,等开发者自行部署。 标题里"接入 IDE 实测"的那一步,目前还没真正发生,想尝鲜的开发者可以走 vLLM 或 SGLang 自建,但要避开命名坑:Hugging Face 上不带".1"的 mellum2 是 6 月的旧版,mellum-4b 是 2025 年的补全模型,拉错仓库名实测出来会完全是另一回事。哔哩哔哩
所以这个"翻倍"别按"效率翻倍"消费:接近两倍的是单张 H200 上的高并发吞吐,且出自厂商自测;最有分量的变化是智能体编程分从 2.0 跳到 47.0,让这个模型从"干不了真实仓库的活"进步到"能当低成本智能体位来试",但质量上它依然输掉了三大修 bug 基准。对没有自建推理资源的开发者,值得盯的是三件事:MTP 头和官方量化何时完整交付、第三方复现何时出现、2.1 何时进入 IDE 官方服务。这三件坐实任何一件之前,"翻倍"只是发布页上的数字,还不是你编辑器里可感知的提升。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章