JetBrains 在 10 月 8 日放出编程模型 Mellum2.1,距离 Mellum2 开源只隔了四个月。热榜词条说它"性能超 Qwen3.5 两倍",但官方口径里的两倍是:高负载推理吞吐量接近 Qwen3.5-9B 的两倍,重点增强的是智能体编程能力,对标对象也只是 Qwen3.5 系列里的 9B 同类模型,而非整个系列。前沿在线IT之家
架构一个没动,四个月全押在强化学习上
Mellum2.1 的架构完全没动:还是 12B 混合专家、每次只激活 2.5B 参数、131072 token 上下文,继续用 Apache 2.0 许可发布,权重挂在 Hugging Face 上。这条产品线的定位从一开始就不是和旗舰模型拼智商——Mellum2 发布时就被 JetBrains 描述为从零训练、专为实际部署设计,用在软件工程系统的路由、问答、子智能体和私有 AI 场景里。前沿在线知乎
涨幅的来路是训练重心的转移:这一版几乎全部工作量花在预训练之后,强化学习从收尾环节变成训练主体——模型带着 shell 和改文件工具被扔进真实仓库,找失败测试的根因、动手修改、重跑一遍,测试通过才给奖励,训练期间开了数百万个沙箱、覆盖数千个环境。回报集中在智能体编程一项:SWE-bench Verified 从 2.0 拉到 47.0,SWE-bench Pro 从 0.0 拉到 28.0,Terminal-Bench 2.1 从 0.6 拉到 17.4,按同一套 pipeline 比,17 项里赢了上一代的 15 项。前沿在线
"两倍"的另一面:最像修 bug 的三个基准,Qwen3.5-9B 反而全赢
“登顶"有个容易被省略的前提:同速级横评的分组里同时有 Qwen3.5-9B 和 Gemma 4 E4B,这组评测的结论是编码智能体能力提升最突出,代码、竞赛题、数学、工具调用、通用知识全面变强。10 月 9 日的 AI 日报里,它的表述也是"JetBrains 发布编程模型 Mellum 2.1,同速级智能体基准居首”,定语从头到尾都是同速级。小红书知乎
换个对照组,故事就会反转。与 Qwen3.5-9B 同场对比时,三个最接近真实仓库修 bug 的基准——SWE-bench Verified 的 50.0、SWE-bench Pro 的 38.0、Terminal-Bench 的 21.7——全部由 Qwen3.5-9B 拿下;Mellum2.1 赢下的只有 LiveCodeBench v6(82.0 对 75.4)、HumanEval+ 和两项工具调用,十七项里只赢五项。前沿在线
还有一层证据边界必须看:这 17 项全部是 JetBrains 自测,没有第三方复现,而评测 pipeline 本身就会改写数字——同一个 Qwen3.5-9B,官方卡片记 LiveCodeBench v6 65.6、GPQA Diamond 81.7,JetBrains 用自家流程测同一个模型得到的是 75.4 和 77.8。跨榜单直接比大小,很容易比出假结论。前沿在线
真正给到你的:单卡吞吐、8GB 本地权重,和别拿错版本
对个人开发者来说,这件事的兴奋点不在跑分,而在"代码不出内网,Mellum2.1 能本地跑"这句概括。落地路径:全量推理走 vLLM 或 SGLang;官方口径里 GGUF 和 vLLM 的 MTP 头还标注"即将推出",不过已有报道称 GGUF 仓库列出 5 个量化版本,最小 7.0GB、推荐的 Q4_K_M 8.1GB。下载时也别拿错版本:Hugging Face 上不带 .1 的 mellum2 是 6 月旧版,SWE-bench Verified 只有 2.0,代际差距就藏在这几个字符里。小红书前沿在线
把这层热榜标题还原完整:Mellum2.1 给到的是单张 H200 高负载下接近对手两倍的吞吐(官方自测口径)、多 token 预测带来的约 1.6 倍单请求提速,和 8.1GB 级量化权重提供的本地运行可能;"性能全面超 Qwen3.5 两倍"并不成立,最像实际编码的三个基准它反而落后。真正值得记录的信号是:不动架构、不加参数,只靠四个月的强化学习,就把一个每 token 只激活 2.5B 的小模型从上一代 SWE-bench Verified 2.0 的"不可用"拉到 47.0。对 IDE 路由、子智能体这类高并发、代码不出内网的部署位置,这笔"用吞吐换能力"的买卖已经值得进评测清单;而对需要直接修复杂仓库缺陷的场景,按现有自测数据,Qwen3.5-9B 仍是更稳的一档。