Ornith-1.5开源刷屏,Mac用户先别急着下官方MLX权重:首日实测乱码,三条路线怎么选

源自269位全网作者

05:10

昨天(8月19日),DeepReinforce 一口气开源了 Ornith-1.5 系列三个档位:9B 稠密、35B-A3B MoE、397B MoE,全系 MIT 协议,另外还有一个 9B 量化版 Ornith-1.5-9B-Mobile,宣称可在安卓和 iPhone 17 上运行。知乎官宣推文一天内拿下 5600+ 赞、300 万+浏览,知乎当天冒出两个相关热问,B站一夜之间多了好几条播放破千的解读视频。哔哩哔哩

Ornith-1.5开源刷屏,Mac用户先别急着下官方MLX权重:首日实测乱码,三条路线怎么选

这次发布最大的噱头是"自我进化":训练阶段模型自己出更难的题、自己搭评测环境、再用强化学习迭代自己,不再依赖人工固定的题库。效果上从 1.0 到 1.5 是代际提升而不是微调:397B 的 Terminal-Bench 从 77.5 涨到 86.1,35B 的 DeepSWE 从 0 跳到 22。知乎

Ornith-1.5开源刷屏,Mac用户先别急着下官方MLX权重:首日实测乱码,三条路线怎么选

不过,对打算在 Mac 上本地跑的玩家,我想先说两件事:跑分要打八折看;官方 MLX 量化版,今天先别急着下。

“比肩 Opus 4.8”,是挑着赢面说的

官方完整成绩单里,397B 和 Opus 4.8 互有胜负:Terminal-Bench 2.1 是 86.1 对 85.0,领先;但 DeepSWE 56.0 对 59.0、HLE 44.6 对 49.8、SWE-bench Pro 65.1 对 68,全部落后。知乎海外测评站 ic.work 的评价更直接:所谓打平,是挑了赢面最大的题目打平。

Ornith-1.5开源刷屏,Mac用户先别急着下官方MLX权重:首日实测乱码,三条路线怎么选

这组数字还要再打一层折扣:全是官方 BF16 成绩、5 次运行取平均,模型 8 月 19 日才发布,第三方还没独立复现过,只能先当厂商口径看。知乎B站评论区已经开始泼冷水,点赞最高的一条就四个字:“别乱堪比”。哔哩哔哩

但有两个数字,对 Mac 用户是真的有参考价值:35B-A3B 的 SWE-bench Verified 79.0,甚至超过了 Qwen3.5-397B 的 76.4;9B 的 70.6,比同尺寸的 Qwen3.5-9B 高出近 18 个点。知乎方向是对的——这是认真做 agentic coding 的模型——但本地 Q4 量化的实际表现,别直接对标这些跑分。

核心避坑:官方 MLX 4bit 权重,Mac 首日翻车

官方发布时的姿态是很足的:FP8、GGUF、NVFP4、MLX 四种量化版当天同步上线,Ollama、LM Studio 直接能跑,Unsloth 支持微调。哔哩哔哩

但知乎博主邵奈一发布当天做了真机实测:M 系列芯片、64GB 统一内存的 Mac 加载官方 MLX 4bit 权重,9B 稠密和 35B MoE 双双翻车,输出的是一堆多语言碎片乱码,中文英文韩文混在一起。知乎

他做了四步排查,把"是不是我姿势不对"彻底排除:绕过 chat 模板用原始 completion,还是乱码;9B 和 35B 两个都坏,不是 MoE 专属问题;mlx-lm 升到最新的 0.31.3,照样乱码;最后判断根因在量化权重本身——safetensors 格式合法、加载器能读,疑似 4-bit 的 scales 转换出了问题。知乎

他的结论是:想省事直接跳过 MLX 走 Ollama,这是第一个坑。知乎这里再补三点背景:

  • 这是单机实测结论,官方 MLX 权重近期仍在持续更新,随时可能修复,追求极限速度的玩家可以蹲一下再下;

  • MLX 这条路在 1.0 时代也有人遇到过乱码,但也有小红书用户表示自己的 M1 Max 64G 跑 Ornith-1.0-35B-MLX-4bit 一切正常,个体差异确实存在;

  • 还有个隐藏坑:官方给 Apple Silicon 的 MLX 版是纯文本(视觉塔被剥离),GGUF 的 35b tag 才自带 mmproj 视觉投影。知乎想让模型看图,只能走 GGUF。

三条路线,先算内存和磁盘账

  • 32GB 及以上统一内存、主力写代码跑 agent:Ollama + ornith-1.5:35b(GGUF Q4_K_M),模型约 22GB + 视觉投影 0.9GB ≈ 23GB 磁盘占用,是目前最稳的一条路;

  • 16GB 档机器:9B GGUF(约 6.5GB),定位是"够用",官方"越级打更大模型"的宣传是挑口径的,别抱 Opus 级期待;

  • 64GB+ 且追求极限速度:可以等官方 MLX 权重修复,MoE + MLX 的统一内存带宽优势是真的,但今天先用 GGUF 跑起来,修复了再迁移;

  • 397B:直接跳过,那是多机、大内存玩家的事,消费级 Mac 不是它的目标用户。

Ornith-1.5开源刷屏,Mac用户先别急着下官方MLX权重:首日实测乱码,三条路线怎么选

邵奈一的实测里,35b 的 Q4_K_M 在 64GB 的 Mac 上能轻松跑出 50+ tok/s,聊天、写代码、跑 agent 都顺滑。知乎另外两个实操小技巧:下载用 aria2c 多连接,单连接通常只有个位数 MB/s,开 16 路并发能飙到约 214MB/s,35B+9B 共约 25GB 两分钟就能下完。还有就是 Ollama 默认闲置 5 分钟自动卸载模型,冷启动首字会慢,想全天常驻记得加 --keepalive(比如 ollama run --keepalive 1h ornith-1.5:35b)。

值得盯的三个信号

一是跑分的独立复现:目前全是厂商口径,等 DeepSWE 这类独立榜单把数据收进去再下结论不迟。二是 9B-Mobile 的真机表现:官方说 9B 的量化版被压到约 1.5GB,可部署到智能手机和平板。知乎B站评论区有人调侃"手机可以当暖宝宝",功耗和发热还是未知数,等 iPhone 真机实测出来再看。哔哩哔哩

三是小内存 Mac 可以关注"小激活参数 MoE + SSD 流式加载"的方向:开源引擎 vates 昨天发布了 v2,一年前没人会相信,一台消费级 Mac 就能本地运行 80B 参数的 MoE 大模型,还能达到日常可用的速度,现在它的 decode 速度已经从 13 tok/s 一路拉到 31 tok/s。知乎vates 本身就是一个基于 MLX 的 out-of-core 流式 MoE 推理引擎,支持 Qwen3-Next 的 MTP 自投机解码。GitHub端侧推理的天花板,比很多人想象的高得多。

一句话收尾:Ornith-1.5 值得作为本地 agentic coding 模型切换——MIT 协议、MoE 速度快、跑分方向也对;但今天在 Mac 上跑,先走 GGUF,官方 MLX 版等修复,跑分打八折,独立复现出来再加仓。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章