张大妈

吞吐量近Qwen两倍?JetBrains Mellum2.1高负载推理压力测试拆解:近2倍在高负载,单请求约1.6倍

源自17位全网作者

12:44

JetBrains 在 2026 年 10 月 8 日发布了开源编程模型 Mellum 2.1,延续 Mellum 2 的 12B 混合专家架构、2.5B 活跃参数和 Apache 2.0 许可证,这次的重点是把智能体编程能力练了上去。 让这条热点上榜的是它的压测结论:高负载下 Mellum 2.1 服务出的 token 接近 Qwen3.5-9B 的两倍,是对比组里最快的模型——但这个"近两倍"只对高负载批量服务成立,换成单条请求,官方口径是约 1.6 倍提速,且整组数据出自 JetBrains 自家评测,尚无第三方复测。IT之家JetBrains 博客

压测测的是高负载单卡吞吐,不是打字等回复的速度

先说清比较对象:JetBrains 没有拿 Mellum 2.1 去对"整个 Qwen",而是挑了两款它认为同类的开源模型——Qwen3.5-9B 和 Gemma 4 E4B——加上自家上一代 Mellum 2,四者用同一套评测设置跑。 官方博客的吞吐量图表口径也很具体:在一张 H200 显卡上测每秒输出 token 数,“高负载”(heavy load)指的是服务器同时承接大量并发请求、跑满负荷时的服务吞吐,不是一个对话框里一问一答的即时体感。知乎

在这个前提下,“近两倍"的含义是:同一张卡高负载批量服务时,Mellum 2.1 能比 Qwen3.5-9B 多吐出接近一倍的输出。落到单条请求上,提速来源变成了 MTP(多 token 预测:模型一次猜出多个后续 token 来加快生成),官方数字约 1.6 倍。 换句话说,对普通用户,这条热点兑现的是"单次生成快一半多”;真正吃满"两倍"的,是在同一批卡上高频并行跑多个编码 Agent、子 Agent 的场景——同样的硬件预算,能塞下的并发任务接近翻倍。JetBrains 博客

架构一点没变,升级全部发生在后训练

吞吐量优势不是这代"调"出来的新东西。官方明确说架构自 Mellum 2 起没有变化:12B 总参数、2.5B 活跃参数、Apache 2.0,快是出厂设定;每个 token 只激活约 2.5B 参数、再配上 MTP 头,才让它在批量服务时容易拉开吞吐差距。 MoE(混合专家架构)可以简单理解成:模型账面参数量大,但每生成一段内容只动用其中一小部分专家网络,算得少、发得快。JetBrains 博客

这版真正的大头工作是后训练,强化学习从一个简短的收尾阶段升级成了训练的主体。 JetBrains 整个夏天在数千套真实环境里启动了数百万个沙箱来跑训练。 新增的强化学习任务覆盖数学、竞技编程、科学、工具调用和软件工程,开源数据因为常带坏测试、无法核验的答案,进入训练前全部先过筛。JetBrains 博客知乎

能力结果上,官方评测里提升最大的一块是 agentic coding:上一代 Mellum 2 虽然快,但"没法在代码仓库里干活干到官方想要的水平",现在它会探库、改文件、自己验证改动,编码、竞技编程、数学和工具调用也全面进步。JetBrains 博客

卖点落在自托管和跑 Agent,但本地格式还没放完

JetBrains 给 Mellum 2.1 的定位很直白:给编码 Agent 和跑在自家硬件上的快速子 Agent 用的"能干活"的模型,适合私有化自托管,代码和数据完全留在自己手里。 社区讨论的热度也确实聚在这里:知乎的两个官方话题直接问"编码与本地部署上有哪些提升"“性能与吞吐表现究竟如何”,也有博主把它总结成 12B 参数、2.5B 活跃、Apache 2.0 全开源、速度约为同级模型近两倍。 对把代码出公网视为红线的团队,这套组合才有继续评估的价值。JetBrains 博客知乎

想马上在 Ollama 里跑起来的用户可以再等一下:模型本体已经放上 Hugging Face,但面向 llama.cpp、Ollama、LM Studio 的 GGUF 版本,以及 vLLM 做投机解码用的 MTP 头,官方都标着"即将推出"。 前面说的高负载吞吐差距是在一张 H200 加官方服务栈上测出来的,换消费级显卡、换推理引擎后数字大概率会变。JetBrains 博客

所以拿这条热点做选型判断时,边界要记牢:性能结论全部出自厂商自评,对照组只是它选的四个模型,第三方复测还没有出现。真要认真评估,最省错的办法是拿自己业务的并发量、输入输出长度复刻一轮压测——"近两倍"能不能在你的环境里重现,才是它值不值得换的决定性证据。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章