10 月 8 日,JetBrains 通过博文发布 Mellum2.1,重点增强智能体编程能力,该模型延续 Mellum2 的 12B 混合专家架构、拥有 2.5B 活跃参数,并继续以 Apache 2.0 许可证发布。权重公布在 Hugging Face 上,这个为编程智能体打造的“思考模型”,升级几乎完全来自真实软件环境中的强化学习。官方自评口径里,它的 SWE-bench Verified 分数从 2.0 升到了 47.0。IT之家知乎知乎
这场发布真正值得关注的,是架构没变、放大发生在后训练:一张消费级显卡跑得动的模型,拿到了能干活级多步任务的编码能力。JetBrains 下场的不是“最强模型”竞赛,而是 AI 编程的成本与隐私层。
架构不变、分数跳了一个量级:强化学习后训练走到哪了
训练环节,官方口径提到启动了数百万个沙箱,评测则是在统一设置下与前代及同级开放模型比较。同期 AI 日报给这项更新的定位,是同速级智能体基准居首。知乎知乎知乎
海外科技媒体援引的数字是:LiveCodeBench v6 得分 82.0,超过 Qwen3.5-9B 的 75.4,并可通过 vLLM 或 SGLang 在自有 GPU 上运行。这一代模型的目标客户就是能探索仓库、修改文件并检查结果的编码智能体,也适合当本地跑的快速子智能体。知乎知乎
2.0 到 47.0 的含义,要放回 Mellum2 本身来读:一个从未针对仓库级任务训练的编排与路由模型。同一自评口径、同一架构、分数提升一个量级,说明专用小模型的能力增量正在从预训练转向真实环境后训练——这正是算力储备不及前沿实验室的厂商能够放大的地方。知乎
两倍吞吐、2.5B 激活:改写智能体的成本账
智能体编程的花费在高频、多步调用,吞吐决定同一预算下能同时跑多少个智能体。官方评测口径下,Mellum2.1 的高负载推理吞吐量接近 Qwen3.5-9B 的两倍。部署侧,这条产品线从 6 月那一代起就支持 128K 上下文,适合把高频子任务放在自有 GPU 上常驻。面向 Ollama 一类工具的 GGUF 版本,社区还在等。IT之家哔哩哔哩知乎
JetBrains 自家的开发者生态调查(经知乎专栏转述)里:1.5 万名开发者中,Claude Code 使用率从 18% 涨到 39%、美国接近一半,Copilot 从 29% 掉到 21%,九成开发者每周都在用智能体。甚至有开发者说自己已经一年多没碰 JetBrains 的 IDE,入口换成了 Codex 和 Claude Code。知乎知乎
把时间线拉出来,JetBrains 的三步棋很清楚。2024 年 10 月,初代 Mellum 是面向 IDE 内补全、主打低延迟的专用模型。2026 年 6 月,Mellum2 作为现代 AI 工作流的 MoE 模型开源,卖点是推理速度最高达同规模模型的两倍。如今 Mellum2.1 转向编码智能体。补全、编排、执行,JetBrains 把模型握在自己手里,智能体的高频环节就不必完全依赖外部厂商的 API 与定价。微博微博
结论能走到哪:边界与发布之后的三件事
上述分数目前主要是官方自评与媒体转述口径,尚未见独立第三方实测;LiveCodeBench 考代码生成、SWE-bench Verified 考仓库级多步任务,两者不能互相换算;47.0 只说明“能处理”,与前沿闭源模型的差距没有可核验公开数据。发布之后真正影响生态形态的是三件事:第三方评测是否确认自评数字,量化与 GGUF 生态是否补齐,以及它是否会完整接入 JetBrains 的智能体产品线。若实测站得住,被重塑的编程生态未必是“多了一个最强模型”,而是 AI 编码开始分层:前沿模型管复杂判断,专用小模型管高频、延迟敏感、私有化的执行——正如 JetBrains 自己的说法,未来属于协同系统,而非单一模型。知乎