10月8日,JetBrains放出Mellum 2.1,第二天知乎挂上两个新问题,标签直接写着"本地部署大模型"“代码大模型”。B站AI日报那条5547播放的视频把它抬成"同速级智能体基准居首"。新闻稿的说法都很硬:SWE-bench Verified从2.0干到47.0,高负载吞吐量接近Qwen3.5-9B的两倍。但8-16G显存、天天在本地跑agent写代码的这拨人,第一反应不是欢呼——是想起6月Mellum 2发布那波,评论区留下的那句"快,但没用"。这个模型官方和评论区说的到底哪句真、门票怎么算,我把17项官方自测、Qwen对照、6月实测记录和刚出现的GGUF量化账,全摆进同一张表。知乎哔哩哔哩
第一本账:这版到底改了什么
架构一点没动:12B总参数MoE、每token只激活2.5B、131072上下文、Apache 2.0、权重放HuggingFace。JetBrains自己说得直白——这一版几乎全部工作量花在预训练之后,强化学习从收尾的一小段变成训练主体:把模型扔进真环境,带着shell和改文件工具进真实仓库,找失败测试的根因、动手改、再跑一遍,测试通过才给奖励,训练期间开了数百万个沙箱、覆盖数千个环境。微博
涨得最多的恰好是6月被骂得最惨的那块——智能体执行:SWE-bench Verified从2.0到47.0,SWE-bench Pro从0.0到28.0,Terminal-Bench 2.1从0.6到17.4,按同一套pipeline比,17项里赢自己上一代15项。微博

第二本账:换个对照组,故事就变了
"同速级登顶"成立,但"最能修bug"不成立。把官方表里跟Qwen3.5-9B的对照单拎出来:
基准项 | Mellum2.1 | Qwen3.5-9B | 谁赢 |
|---|---|---|---|
SWE-bench Verified | 47.0 | 50.0 | Qwen |
SWE-bench Pro | 28.0 | 38.0 | Qwen |
Terminal-Bench 2.1 | 17.4 | 21.7 | Qwen |
LiveCodeBench v6 | 82.0 | 75.4 | Mellum |
HumanEval+ 及两项工具调用 | — | — | Mellum |
17项合计 | 赢5项 | 赢12项 | — |
三个最像"进真仓库修bug"的项目——SWE-bench双榜加Terminal-Bench——Mellum 2.1全输。而这三项,恰恰就是本地coding党买agent模型时最在乎的三项。它赢下的5项集中在刷题型代码生成和工具调用。微博

第三本账:哪些数字能信,哪些一跨表就作废
17项全是JetBrains自测,没有第三方复现。更麻烦的是pipeline会改写结论:Qwen官方模型卡上LiveCodeBench v6是65.6、GPQA Diamond 81.7,JetBrains用自家流程测同一个模型得到75.4和77.8——同一个模型、同一张卷,两套流程差出10分。所以"82.0对75.4"只能在JetBrains那套pipeline内部读;拿82去对比Qwen官方卡的65.6,比出来的就是假结论。跨榜单比大小,是这轮传播里最容易踩的坑。微博
第四本账:你家的卡付哪本账
先泼冷水:“单张H200重载吞吐近Qwen3.5-9B两倍"和"多token预测让单次请求快约1.6倍”,都是vLLM/SGLang跑全量权重、数据中心硬件上的数字,而官方口径里GGUF和vLLM的MTP头还写着"即将推出"。IT之家
消费级卡吃到的不是这两行,是2.5B激活参数本身的速度——6月社区Q4_K_M的实测至今挂在评论区:150~170 t/s,同场对比Qwen9B只有40~50 t/s。现在GGUF仓库已经列出5个量化版本,最小7.0GB,推荐的Q4_K_M约8.1GB。8G卡是"刚好塞下、别开长上下文"的档位(6月就有5050 8G的学生党说"适合我"),12-16G才是舒服区。哔哩哔哩微博
还有一个下载层面的坑:HuggingFace上不带".1"的mellum2是6月版——SWE-bench Verified只有2.0分的那位;mellum-4b则是2025年的补全模型。想拿47分这个版本,先核对repo名里有没有".1"。
第五本账:6月的账,哪些还没还
翻回Mellum 2那条3540播放、27条评论的视频,社区骂的从来不是跑分:中文能力"肯定垃完了"、读题读不明白、格式遵循差、写文0分、翻译干不了,代码只是"至少页面不炸"。有人抱怨"专门为AI开发,结果和Claude不兼容",真把harness卡掉的是工具调用格式,不是智商。哔哩哔哩
同一楼里对手阵营也在漏气——“35B-A3B经常性卡住死循环,重试60次失败退出”。2.1的RL后训练正面补的是"进仓库干活"这一项,但中文输出、格式遵循这两本账,发布第3天还没有任何第三方实测数字。所以既别拿6月的体验判2.1的死缓,也别拿2.1的跑分替6月的坑平反——两头的证据都不够。哔哩哔哩

分人群怎么动
显存8G及以下、英文任务为主、就图一个快的本地agent工具:可以现在下Q4_K_M自己测,别替别人把47分当真数,也别用6月印象一票否决。
12-16G、中文提示词、强格式或长文本输出:建议等一等。等的不是永远,是第一波第三方复现,窗口大概率就在这几天。
16G以上、已经跑着27B/35B MoE的:没必要为它腾硬盘——这不是智商赛,是速度赛;它真正撬动的,是被dense 9B的速度劝退过、又嫌35B-A3B死循环的那批人。
准备塞进Claude式agent链的:先验证工具调用格式接得上再接得上,再评模型能力,别学6月评论区把harness不兼容记在模型头上。
继续盯三个信号:官方GGUF与MTP头从"即将推出"变可下载、第三方按同pipeline复现SWE-bench三项(尤其Qwen赢的那三个)、中文遵循与格式能力的第一批实测。JetBrains这次不是把"本地编程新王"送到门口,它送的是:一个跑得最快、看起来刚刚学会干活的候选人——47分自测是入场券,毕业证还压在第三方手里。