当前位置:
AIGC文章详情

Ornith-1.5被吹成「Opus 4.8级」,一派说它是16G显卡最好用的,一派说它是刷分大王:换不换先算清三笔账

源自158位全网作者

01:00

这周本地部署圈被一个开源模型刷屏了:Ornith-1.5。

8月19日,Ornith AI团队开源Ornith-1.5,一次放出397B MoE旗舰、35B-A3B MoE和9B Dense三个规格,全部MIT协议,FP8、GGUF、MLX、NVFP4全套量化版当天同步上线,Ollama、llama.cpp、vLLM第一天就能直接接入。知乎官宣推文一天内5600+赞、300万+浏览。哔哩哔哩知乎上标题为「ornith-1.5系列开源模型达到opus4.8级性能,这意味着什么?」的问题收获了超过4.6万浏览。知乎

于是这几天社区里问得最多的就一个问题:我家里已经在跑Qwen3.8-27B,要不要换?我把知乎、B站、微博这几天的实测帖都翻了一遍。先说结论:模型是真的,热度也是真的,但大家转的「Opus 4.8」和你电脑上真正能装的那个,不是同一个东西。社区里两派吵得很凶,而且两边其实都有证据。换之前,先算清三笔账。

第一笔账:「Opus 4.8级」到底指谁

流传最广的那组数字:Ornith-1.5在Terminal-Bench 2.1上跑分86.1,高于Claude Opus 4.8的85.0分。知乎但注意,这是397B旗舰MoE的成绩,这个大块头bf16权重约70GB,官方推荐用2张80GB显卡部署,和单卡消费级用户没什么关系。普通人真正能下载能跑的,只有35B-A3B和9B两个。

35B的官方口径是「仅激活3B参数,在全部编码与智能体基准上超越稠密架构的Gemma-4-31B和同参数量级的Qwen3.6-35B-A3B」。知乎注意对比对象:Gemma-4-31B和Qwen3.6-35B-A3B,不是很多人家里那个Qwen3.8-27B。在DeepSWE这类高难度基准上,35B级别模型里只有Ornith-1.5得分非零,同级领先是真的,但绝对分数并不高。

B站发布视频的评论区,有人一句话捅破了这层窗户纸:「你讲的跑分是 397b 的,35b 好像是 deepswe 22 分,看这一个分数就行了」。哔哩哔哩也就是说,这波热度之所以出圈,恰恰是把「数据中心旗舰的跑分」和「你能下载到的消费级模型」混在一起说了。

Ornith-1.5被吹成「Opus 4.8级」,一派说它是16G显卡最好用的,一派说它是刷分大王:换不换先算清三笔账

第二笔账:实测两派到底在吵什么

换机派是真有干货。

最有代表性的是RTX 3060(12G显存)上的一组测试:Ornith-1.5-35B-A3B量化版能做到约53 tok/s解码、约900 tok/s预填充,还能吃下170K上下文。知乎这组数字意味着什么?Qwen3.8-27B的dense 27B在12G显存里根本装不下,而只激活3B的A3B装得下、跑得动。这正是MoE对低显存用户的核心卖点:跑分总分是差一些,但12G卡能跑这件事本身就赢了。

微博上有用户实测12G 3060+32G内存的组合:Q5_K/Q4_K混合量化照样跑出21 t/s,而且多轮对话不降速。微博还有用户问,29G多的Q6量化是怎么在12G 3060+32G内存上做到18 t/s稳定多轮不掉速的?关键就是MoE的激活量小,加内存卸载。

玩得更深的是流水线用户:有人拿35B做翻译流水线,测了100部电影、50万条字幕,称指令遵循、词库遵循、结构化输出都非常强,成功率接近99.7%。哔哩哔哩也有用户觉得它比Qwen 3.6 35B好用得多,截断思考、工具调用失败、死循环这些老毛病都改善了,称之为继gemma4 26b a4b之后12G以下显卡能本地部署的最好模型。

Ornith-1.5被吹成「Opus 4.8级」,一派说它是16G显卡最好用的,一派说它是刷分大王:换不换先算清三笔账

不换派的证据同样扎实。

微博上有用户实测后直接泼冷水:让它写个简单的c# socks5测试项目,结果它一个人自言自语了32767 token,达到最大长度才停下来。微博

B站评论区的差评更集中。112赞的置顶评论只有四个字:「别乱堪比」。哔哩哔哩79赞的评论更直接:「实测过了,评价为刷分大王。」还有人直言「跑分不错,实际被Qwen3.8 27B吊着打」,说输出质量跟Qwen3.8完全没有可比性;甚至有用户实测35B的Q4_K_M不如qwen3.8-27b的q2量化版(个例测试,仅供参考)。

新坑也暴露了两个。一个是代码场景,有用户发现APEX版所有量化版本都有个怪问题:输出完代码后,自己说自己发现了bug、要重写一遍,结果重写的那一遍bug更多。微博另一个是它同样是「思考狂魔」,评论区有人吐槽一个问题能思考30分钟,任务追求响应速度的话记得限制思考长度。

两派吵的其实不是「好不好」,而是「拿什么尺子量」。当执行者——高频对话、批量任务、工具调用、翻译流水线——它快、听话、省显存,这是赢面;当思考者——复杂推理、一次成型的质量输出——它暂时打不过Qwen3.8-27B。

还有一层背景要知道:Ornith-1.5不是全新底座。从权重上看,Ornith-1.5基本就是一条Qwen3.5深度后训练路线。知乎

Ornith-1.5被吹成「Opus 4.8级」,一派说它是16G显卡最好用的,一派说它是刷分大王:换不换先算清三笔账

团队的力气花在「自我改进」训练循环上:模型自己出题、自己造评测脚手架、自己rollout、自己筛选、自己做强化学习,然后再出更难的题。知乎但这套训练基础设施并没有公开,外界无法复现它的训练质量与对齐细节。所以如果你期待的是「新王登基」,大概率会失望;把它当成一个站在Qwen底座上、主打Agent执行的快枪手,反而挺香。MIT协议还意味着商用接入没有授权顾虑,这是它相对Qwen系的一个实打实的优势。

第三笔账:三种人,三种操作

第一类:显存只有12~16G,主要需求是跑Agent、批量任务、翻译流水线。换,而且是越级换。你的dense 27B本来就塞不进显存,A3B就是为这个显存段造的,直接上35B-A3B量化版。

第二类:想一个模型包办一切,写文案、做方案、要质量输出。别换,Qwen3.8-27B留守主力,别被跑分数字撩到。社区里已经流传一种更稳的组合:用Ornith 9B负责日常对话和初稿,微博用户实测它77 t/s、193K上下文,「更实用一些」。微博需要质量输出时再交给Qwen3.8-27B,用B站用户的话说:「9b真的好用,用来做对话,执行时候交给3.8 27b」。哔哩哔哩

Ornith-1.5被吹成「Opus 4.8级」,一派说它是16G显卡最好用的,一派说它是刷分大王:换不换先算清三笔账

第三类:不着急,只想多囤一个模型。那就盯紧Qwen3.8-35B-A3B。这周微博上不断有用户问「qwen3.8还会不会出35b啊」,理由很实在:「moe模型对单机更友好啊」。微博B站评论区也有两条回复接连说「有传闻说要发」,但截至目前没有官方时间表。可以等,但别先删掉手里的模型。哔哩哔哩

决定要换,这4个避坑细节可以直接抄

  1. MTP(多token预测)开不开,看架构。dense模型开MTP白赚30%速度;而MoE模型(Ornith这种35B总参/3B活跃的A3B架构)开MTP反而倒亏23%。知乎但AMD Ryzen AI MAX+ 395平台上另一份实测给出相反结果:Ornith-1.5-35B-A3B加了MTP速度能到77.6 t/s。知乎保守玩法:默认关,再花十分钟自己实测,网上「开MTP就有提升」的通用教程不能全信。

  2. MoE用llama.cpp,明显强于LM Studio。同一个35B MoE,换到llama.cpp直接提速43%,首字延迟从1.5~3秒压到0.1秒。知乎LM Studio胜在省心,但大MoE上速度会差一个档次。

  3. 追速度直接上Q4量化。实测短输入下Q4快于Q6快于Q8,单调下降,Q4全场景最快。知乎但质量预期要管理好,参考前文不换派的证据。

  4. 官方推荐推理参数可以直接抄:temperature=0.6、top_p=0.95、top_k=20。知乎原生支持256K上下文,YaRN可扩展到约1M token。默认思考偏长,不想它动辄想半小时,记得约束思考预算。

三个值得盯的信号

一,Qwen3.8-35B-A3B的官方发布时间。它是最直接的竞品,一旦落地会直接改写这个显存段的格局。二,Ornith-1.5的后续补丁,尤其是APEX版代码重写问题和超长思考问题。三,DeepSWE这类高难度基准的第三方复现。现在流传的数据多为官方自报和个别实测,样本还太小。

一句话:Ornith-1.5不是把Qwen3.8-27B拉下马的「新王」,而是给低显存用户多递了一个真实选项的「执行特化快枪手」。换不换,只看一件事:你把AI当执行者,还是当思考者。

内容由AI生成

精选参考来源

1. Ornith-1.5开源:端到端自改进训练,35BMoE激活3B即超越同级稠密模型Gemma-4-31B

2. Ornith-1.5重磅发布堪比Qwen3.827B

3. ornith-1.5系列开源模型达到opus4.8级性能,这意味着什么?

4. ornith-1.5系列开源模型达到opus4.8级性能,这意味着什么?

5. 换了RTX3090之后,我把15个本地大模型全测了一遍:速度排行+三个反直觉发现

6. Ornith-1.5-35B-A3B(MoE)调优报告

7. 今天测试Ornith-1.5-35B-A3B-AD-Q5_K-Q4_K,在12G显存+32G内存也跑的飞快21t/s,且多轮对话不降速。而且最大的惊喜是创造出测试以来最漂亮的一个界面。

8. ornith1.5不行,徒有虚名。今天让它写个测试项目,就是个c#socks5,多次测试过其它ai。结果它写到后来,开始编译之后出错,它居然一个人自言自语了32767token,达到最大长度了才停下来

9. Ornith-1.5-35B-A3B的APEX版,所有量化版本都有一个很奇怪的问题,在llama-server自带的webui里在代码第一轮的时候,输出完代码后,自己说自己发现了bug,要重写一遍,然后重写的这一遍有更多的bug,不知道这种版本还有啥意义

10. 我感觉比起什么qwen3.827b跑个40tk/s但是ctx只有60k,跑Ornith-1.5-9b,77tk/s,ctx有193k更实用一些

11. qwen3.8还会不会出35b啊moe模型对单机更友好啊

12. 不仅仅是补全代码!Ornith1.5

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章