本地模型圈这一周,全在刷 Ornith-1.5。
8 月 19 日开源,一口气发了三个型号,MIT 协议,官方数据直接对标 Claude Opus 4.8——这几天从知乎、B 站到 HuggingFace,几乎人人在聊。但有意思的是,HuggingFace 讨论区里赞数最高的一条评论,是泼冷水的:「别信模型卡里的跑分」。
作为这个月最值得塞进 LM Studio 的开源模型,在你动手下载这十几二十 GB 之前,我把官方模型卡、多个平台的真机实测和 HF 讨论区的争论都翻了一遍,给你捋清楚:它到底是什么、跑分能信几分、你的机器能跑哪一档、下载之后怎么调。
先说清楚,Ornith-1.5 是个什么东西
Ornith AI 团队(前身 DeepReinforce)在 8 月 19 日一天之内放出了三个型号。知乎它们分别是:
9B Dense:小钢炮,还有面向手机的量化版
35B-A3B MoE:总参数 35B,每个 token 只激活约 3B,这次的主角
397B MoE:旗舰,对标 Opus 的跑分就是它跑出来的
定位很明确:专攻 agentic coding。它是 reasoning 模型,回复默认带 think 思维链,原生 256K 上下文,原生支持工具调用,MIT 协议随便商用,基座是基于 Qwen3.5 和 Gemma4 做的后训练。
最有话题度的是它的训练方式「端到端自我改进」:模型自己出题、自己搭验证脚手架、自己写解题轨迹,再用强化学习把这一整套策略联合优化,形成闭环。但这里要先澄清一个误会——这个「自我进化」发生在训练阶段,发布之后权重就是固定的,本地跑不会越用越强,别把它想象成电子宠物养成。

跑分确实猛,但先看条件
官方流出来的几个数字:
35B-A3B 的 SWE-bench Verified 79.0,超过 Qwen3.5-397B 的 76.4——「小身板干翻大块头」说的就是这个
9B 的 SWE-bench Verified 70.6,同尺寸的 Qwen3.5-9B 只有 53.2,差了近 18 个点
397B 在 Terminal-Bench 2.1 拿 86.1,Claude Opus 4.8 是 85.0——「对标 Opus」的出处

但这组数字有三个前提:BF16 全精度权重、五次独立运行取平均、官方自己的评测口径。模型 8 月 19 日才发布,第三方还没来得及独立复现;而且官方复现基准用的参数是 temperature=1.0——这跟你在家用 Q4 量化、temp 0.6 跑出来的,压根不是同一种体验。HuggingFace79.0 这个数,建议先在心里打个折,具体打几折,等社区复现说话。
硬币另一面:HF 讨论区的五种质疑
这部分是单篇新闻里看不到的。HuggingFace 讨论区这几天很热闹,赞数最高的评论(21 赞)直接开大:「别信模型卡里的 benchmark——它在各种设置下,连最基础的读写文件 tool call 都反复失败」。知乎
多位用户报告模型会陷进 thinking loop 出不来,矛头指向 chat_template.jinja——这个文件,也是本周 Claude Code 接入求助帖里的头号嫌疑。还有人指出 MTP 张量看起来像随机初始化,不像训练好的权重。也有 1.0 时代的老用户觉得「1.5 好像还不如 1.0」。
再补一个背景:Ornith 团队本身非常低调,公开信息很少,这也是部分研究者保持观望的原因之一。综合下来我的结论是:官方跑分有参考价值,但不能全信,早期版本必须自己测过才知道适不适合你的场景。
你的电脑能跑哪个,算笔账
这是跟钱包最相关的部分。三个型号,三档门槛:
9B 的 GGUF 约 6.5GB。8GB 显存紧一点能跑,16GB 很舒服,主流笔记本和入门独显都在这个区间。它 SWE-bench 能跑 70.6,已经大幅超过同尺寸的 Qwen3.5-9B,是试水成本最低的选择。
35B-A3B 的 Q4 GGUF 约 22GB,加上 0.9GB 的视觉投影组件,一共约 23GB。官方给它的 bf16 全精度部署建议是两张 80GB 显卡,所以本地玩家基本只有量化 GGUF 这一条路。HuggingFace3090、4090 这类 24GB 显存的卡能装下,但模型进去之后留给上下文的空间很有限,上下文得压低或者把部分层挪到内存;真正舒服的是 32GB 以上统一内存的 Mac 或更大显存的平台。速度是真香:Mac M 系 64GB 统一内存实测 Q4_K_M 能跑 57.6 tok/s,Ryzen AI MAX+ 395 64GB 平台开 MTP 测出 77.6 t/s。知乎知乎

MoE 快是有道理的——decode 阶段真正要搬的只有 3B 激活参数的权重,比同级稠密 27B、31B 都快;但 prefill 省不了,长输入的首字速度照样吃硬件。
397B 就一句话:bf16 权重接近 800GB,就算 Q4 量化也要 200GB 往上,消费级不用惦记了。
还有一个 Mac 专属的坑:官方 MLX 版把视觉塔剥离了,是纯文本版,而且有实测报告 4bit 量化权重输出乱码(单机结论,官方权重还在更新)。知乎所以现阶段不管 PC 还是 Mac,都优先 GGUF。
真打算上手,六条设置建议
实测帖踩完坑,观点基本一致,浓缩成六条:
先用 9B 试,确认工具调用、中文输出都正常,再考虑 35B,别上来就下 23GB;
优先 GGUF:LM Studio 的 Discover 里直接搜「ornith」,或者从魔搭下载后导入模型目录;Ollama 用户可以直接 `ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF`;
官方推荐采样参数:temperature 0.6、top_p 0.95、top_k 20,其他不用动;
上下文从 8K-16K 起步,别一上来拉满 256K——prefill 会很惨,内存也吃得多;官方说 YaRN 能扩到 1M 左右,但普通长度开着反而轻微掉质量,真需要长窗口再开;
跑 Agent 记得设 max_tokens 兜底,防 thinking loop;遇到工具调用失败,先检查 chat template 是不是最新;
HuggingFace 直连慢的,走魔搭(ModelScope),同款 GGUF,实测 16 路并发下载能到 214MB/s,25GB 两分钟下完。

Bionic 是 LM Studio 团队今年 7 月发布的独立 Agent 应用,用它的还有个隐藏福利:它和经典 LM Studio 共用同一个模型目录,ollama 下载过的模型建个软链就能复用,一份模型三处通用,不用重复下载。知乎
谁现在该下,谁该等
翻完一圈,我的判断是:
折腾党、想做本地 agentic coding 实验的,现在就可以下——35B-A3B 大概是眼下消费级硬件上,跑 Agent 速度收益比最高的开源模型:MoE 给了速度,SWE-bench 给了牌面,MIT 给了自由度。但路径上先 9B 后 35B,确认对你的场景有效再升级。
想直接上生产的,建议等。这版本的毛病不少:工具调用失败、thinking loop、MTP 争议,都摆在明面上,官方还在修补。社区老玩家的建议是观察一到两个月。知乎
想持续跟踪的,盯四个信号就行:官方 chat_template 的修复版本、MTP 权重质疑的回应、第三方独立复现的跑分,以及它在 LM Studio、Bionic 这类环境里真实工具调用的稳定性。这四个落地了,再决定主力迁不迁,不迟。