2.5B活跃参数,吞吐近Qwen3.5-9B两倍

2.5B活跃参数,吞吐近Qwen3.5-9B两倍

2026-10-10 18:58:57 0点赞 0收藏 0评论

10月8日,JetBrains 把新模型 Mellum2.1 挂上了 Hugging Face。12B 的参数规模,每次推理只叫醒其中 2.5B,许可证还是 Apache 2.0。

架构和上一代 Mellum2 一样,JetBrains 动的是训练流程:强化学习从收尾环节被挪成了训练主体。剩下两个数字更值得记:高负载推理吞吐接近 Qwen3.5-9B 的两倍​,单请求速度提升约 1.6 倍。翻译成日常一点的话,同一张显卡能同时喂饱的编程助手变多了。

2.5B活跃参数,吞吐近Qwen3.5-9B两倍

升级动在了训练阶段

Mellum2.1 延续 Mellum2 的 12B 混合专家架构,活跃参数 2.5B,许可证仍是 Apache 2.0。架构没变,变的是训练。

JetBrains 把强化学习从原来的短期收尾扩展成了训练主体,并在数学、算法竞赛、科学、工具调用和软件工程几个方向补了训练数据。撑起这套训练的是内部搭的强化学习环境,训练期间启动过数百万个沙盒,覆盖数千个环境​。

数据在进炉子之前也被筛过一遍。测试本身有缺陷的、答案没法验证的、难度明显不对的任务,都被剔掉了。

能力上的变化是具体的:升级后的模型会自己翻代码库、改文件、回头检查自己的改动,也能找到失败测试的根因,起草修复方案,再跑一遍验证结果。JetBrains 说最大的改进就落在这类智能体编程任务上。

2.5B 干活,12B 兜底

混合专家的做法是让模型带着 12B 的知识量,但在处理一个 token 时只叫醒 2.5B 去算。

算力账单按 2.5B 付,不按 12B 付,同一张显卡因此能塞进更大的批量。JetBrains 把 Mellum2.1 和 Mellum2、Qwen3.5-9B、Gemma 4 E4B 放在同一套评测设置下比,高负载推理时 Mellum2.1 的吞吐 token 数接近 Qwen3.5-9B 的两倍​。

另一个细节是多了个多 Token 预测,也就是 MTP,模型一次往下猜多个 token,单请求场景下速度提升约 1.6 倍​。

这两个数落在不同的地方。1.6 倍是手感,你在编辑器里等补全的时候能感觉出来;两倍是账面上的,同一张卡能同时接几个活,一排就多几个。手感跟回答质量无关,排队的人多了,账单反而更值得看。

智能体干一件事,要调用几十次

这一点现在特别要紧,是因为智能体干活的方式和聊天完全不同。你问一句话它答一段,这是一次请求;你让它修一个跑挂的测试,它要读文件、跑命令、看报错、改代码、再跑一遍,中间可能有几十次模型调用。

token 消耗跟着翻几十倍,模型单价和推理吞吐就直接写进了月末账单。

JetBrains 说编程、算法竞赛、数学、工具调用和通用知识这些维度都有提升,但没给出一张能直接读出谁第一的总分表,对比图上标的是相对自己上一代和同场选手的位置。

一个容易看歪的地方

看到"两倍",第一反应多半是 Mellum2.1 比 Qwen3.5-9B 聪明两倍。

两者确实是一个量级,都是百亿参数以下的开源模型,都能塞进一张卡,摆在一起比很自然。但吞吐说的是单位时间吐出多少 token,跟答对多少题没有必然关系,一个吞吐接近对手两倍的模型,完全可能在某个具体基准上落后。那份逐个任务的评测分,JetBrains 这次没放出来。

谁能真用上

权重已经放在 Hugging Face 上,可以直接下。本地部署和自有基础设施都行,代码和数据留在自己环境里。

Apache 2.0 意味着可以改、可以商用。还没到的是两样:面向 llama.cpp、Ollama 和 LM Studio 的 GGUF 版本,以及给 vLLM 用的 MTP 推测解码组件。GGUF 一落地,量化版才有机会跑进消费级显卡。

想现在就试的,原始权重够了;想一键跑起来的,再等等那两样。

要在这几个模型里挑一个塞进内网,Mellum2.1 的卖点是账单,不是分数。

作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松