94.7%对94.7%:本地27B追平云端Jev,最小812MB老电脑也有份——“不写字的AI”爆火这周,上车前对准五档显存、躲开三个坑

源自27位全网作者

10:21

这周本地AI圈最热闹的新物种,是一个"不写字"的AI。

它叫决策模型(System One)。不生成文本、不聊天、不写代码,你给它一段状态加几个事先定义好的问题——选择题、是非题、打分题——它直接返回选项和概率,一次调用几十毫秒。10月5日,IT之家报道TypeSafe家的Jev日处理token量已达1万亿,约25%的世界500强企业在用。IT之家

而对本地部署党来说,真正的大新闻是另一条线:这个品类正在以离谱的速度涌进你自己的电脑。10月1日Ollama v0.35原生加了`/v1/systemone`接口,随包上架了Nimble和Tev1一共三个决策模型。10月2日llama.cpp的SystemOne接口合入主分支,Cloudflare也开源了27B和9B的Clef与Clef Flash。微博知乎微博

10月4日,亚马逊跟进开源Strands Decider 2B。TypeSafe九月开的头,不到一个月,跟进的已经有Cloudflare、亚马逊、TogetherAI、Bespoke Labs,OpenAI也在云端出了Decisions API。哔哩哔哩

先说结论:这可能是今年硬件门槛最低的AI新品类——最小812MB的模型文件、4GB内存的老电脑都有份,实测24G显存的本地27B已经能和云端Jev打平。但它的坑和聊天模型完全是两回事,上车前值得把入场券和坑位都数清楚。微博小红书

94.7%对94.7%:本地27B追平云端Jev,最小812MB老电脑也有份——“不写字的AI”爆火这周,上车前对准五档显存、躲开三个坑

749道题实测:本地和云端打平,小模型的中文露了底

目前这个品类最扎实的一份实测,来自B站UP主麻仓月轩:7个SystemOne式模型同场抢答749道真实判断题——飞书消息分诊、扫地机器人语音指令、语音助手意图识别、英文客服短文本,还有几千字的保险条款。9月30日发布,单卡本地部署(vLLM/NInfer环境),每题的答案和延迟都是真实跑出来的。结果(逐题准确率/中位延迟):哔哩哔哩

  • Jev 1.13(OpenRouter API):94.7%,332ms,跑完全程约0.018美元

  • Qwen3.8 27B(本地NVFP4):94.7%,328ms,显存24GB

  • DiffusionGemma 26B-A4B:93.6%,119ms,中文98.8%、英文83.3%

  • JevK5 0.2(4B+LoRA):90.7%,47ms,显存14GB

  • SemIf 4B:84.4%,53ms;reflex 4B:83.2%,88ms

  • Laya(encoder小模型):51.1%,21ms,中文只有47.7%、英文短题95.8%

这张表能读出三件事。

第一,本地党已经追平云端。24G显存跑Qwen3.8 27B的NVFP4量化,准确率和Jev API一模一样,延迟还略低。手里有3090/4090这个级别卡的,这项能力不用再给云端付钱。

第二,4B微调档才是自托管的甜点位。JevK5(4B+LoRA)90.7%,只比27B低4个点,显存省10GB、延迟快7倍。决策模型不是"越大越强"的游戏,这个性价比排序和聊天模型完全不同——它的快,来自架构上根本不走逐token生成那条路,而是一次前向直接给候选项打分。

94.7%对94.7%:本地27B追平云端Jev,最小812MB老电脑也有份——“不写字的AI”爆火这周,上车前对准五档显存、躲开三个坑

第三,小模型的语言偏科比想象中严重。Laya总分51.1%看着像翻车,拆开看:英文短题95.8%,中文只有47.7%——基本是抛硬币。而DiffusionGemma正好反过来,中文98.8%、英文83.3%。这说明一件事:中文场景下选决策模型,别看总榜,看训练数据里有没有你的语言。英文榜单不能折算成你中文工单上的表现。哔哩哔哩

顺带一提评论区的氛围也很真实。最高赞评论(8赞)是给Laya泼冷水的:Laya必须做微调训练,开箱即用没一点价值,官方没有微调数据就不推荐用。还有一条被反复追问的是"Qwen 27B怎么改成决策模型"——回答是架构上不天然支持,但改transformer文件、走jevspawn这类infra方案有戏。另一条高共鸣评论只有一句话:“本地部署看着什么都好,就是没钱买卡。”哔哩哔哩

入场券五档:按你手里的机器数

决策模型和聊天模型入场券的最大区别:低档位真的能跑,但"能跑"和"能用"之间隔着语言和微调两道坎。只数有实测或官方依据的档位:

  • 4GB内存、无独显:两条路。Laya多语言版678MB,Unsloth Desktop已接入。Ollama库里的Tev1 0.8B(TogetherAI实验模型),文件最小仅812MB。但这一档是给愿意微调的人准备的,纯开箱的中文垂直任务,参考上面47.7%那个数字。小红书

  • 单卡3090级:国产StartLux-Decision(上海原点星辉)宣称0.8B本地12毫秒出判断、38项基准31项反超Jev、五档全免费。先按住钱包——这些数字目前只出现在厂商侧视频里,那条视频本身就带着"广告"标签,等独立实测再信。哔哩哔哩

  • 14GB显存:JevK5 4B+LoRA,90.7%,上面那份独立实测里的"自托管综合最佳"。

  • 24GB显存:Qwen3.8 27B走NVFP4改造成决策格式,94.7%追平云端;或者Ollama直接拉Nimble(Bespoke Labs出品,9B,基于Qwen3.5)。

  • Ollama党(含Mac):升级到v0.35.1以上,`ollama pull nimble`一键拉取,Tev1 4B/0.8B、Cloudflare的Clef(27B)和Clef Flash(9B)都已上架。官方演示用Nimble实时打游戏做决策,M5 Max上每次调用91毫秒——这个延迟做Agent的"高速小脑"够用了。知乎

另外TogetherAI贴了教程:花17美元自己训一个0.8B决策模型。想动手训模型的,门槛已经低到这个数了。微博

三个坑,都有文档或实测背书

坑一:置信度不是正确率。 Ollama文档明确提醒:confidence表达的是模型对某个答案的偏向程度,高值不保证答案正确。更根本的反证来自知乎一位把Jev、Kev、Laya挨个跑了一遍的作者:三个模型在诗歌域的零样本测试全部约等于随机。决策模型默认不具备你的领域知识,所以选型的核心问题不是"谁零样本强",而是"谁的微调管线能让我把领域知识灌进去"。知乎知乎

94.7%对94.7%:本地27B追平云端Jev,最小812MB老电脑也有份——“不写字的AI”爆火这周,上车前对准五档显存、躲开三个坑

坑二:工具链支持比想象中崭新,也比想象中窄。 说"ollama run一下就能用"的教程已经过时了:Ollama的决策推理目前只走API或TypeSafe SDK,原生CLI和Python/JS库还没跟上。llama.cpp的SystemOne接口10月2日才合入master,Clef的后续PR只支持文本、不含图片;Ollama一次请求里的多个问题共用输入、互相之间不传上下文,第二步依赖第一步的判断就得在应用层自己编排。这些都是这两天的新变化,教程的半衰期以小时计。知乎

坑三:"零幻觉"是话术,选错格子还是错。 决策模型的输出被限定在你给的选项里,不会编造内容——听起来像零幻觉,但它会以91%的置信度选错。而且错得越自信越危险,因为程序会直接拿去执行。上车前先想好退路:置信度低于阈值、信息不足、模型不可用时,回到规则或人工。会发消息、改数据、付款的操作,判断结果必须再过一层权限和业务规则检查。知乎Grivn那篇实操分析里还提了一个容易忽略的点:中文简称、错别字、夹杂英文的产品名,都应该进你自己的测试集——英文榜单救不了你的中文工单。哔哩哔哩知乎

谁该上车,谁该再等等

现在就值得试的三种人:

  • 在搭Agent或自动化工作流的:工单分诊、模型路由、内容审核,官方场景全踩在真实痛点上。B站已经有独立开发者把Jev决策模型接进自建CMS做评论审核了。哔哩哔哩

  • 手里有24G显存闲着的:实测追平云端Jev,电费比API费便宜,数据还不出门。

  • 想训自己决策模型的折腾党:17美元的教程已经躺在TogetherAI博客里,比训LoRA还便宜。

94.7%对94.7%:本地27B追平云端Jev,最小812MB老电脑也有份——“不写字的AI”爆火这周,上车前对准五档显存、躲开三个坑

建议再等等的三种人:

  • 只拿本地模型聊天写文的:决策模型不写字,这个品类和你的需求无关,别被刷屏带节奏。

  • 中文垂直场景、又不打算微调的:零样本在垂直域约等于随机,这是实测不是谦辞。

  • 等生态成熟的:等Ollama把systemone做进CLI和原生库,等Strands Decider 2B(10月4日刚开源)的独立实测出来再动手,最多晚两周。

后面值得盯的观测信号,按重要性排:Ollama原生库支持的进度;Strands Decider 2B和StartLux-Decision的第三方实测(尤其是中文);上海AI实验室书生系的多模态决策模型Intern-Decision会不会开源——已经有博主专门拆解过它的实现思路,评论区也有人催UP主测"书生明决"。还有Jev的融资到底有没有落地:IT之家原文写到"新一轮融资估值或超100"就断了,连单位都没放全,这个数字在实锤前别当真。微博IT之家

最后说回那个"没钱买卡"的评论。决策模型恰好是这两年少见的、对旧机器友好的品类:678MB的入场券、树莓派级的延迟需求、不吃KV缓存不吃长上下文——你那台跑不动27B的老机器,这次可能真有活干。你的Agent一天要做多少次选择题?跑在什么卡上?评论区聊聊,下次把大家的实测凑一桌。哔哩哔哩

内容由AI生成

精选参考来源

1. 【TypeSafe AI决策模型Jev日处理量达1万亿Token,硅谷巨头火速跟进复刻】

2. Ollama v0.35 更新,原生支持本地 Jev 式决策模型!新增 /v1/systemone API

3. Ollama 接入决策模型:AI 做选择,为什么不必先写一段话?

4. 【Cloudflare发布Clef:AI Agent需要的不只是“大模型”,还要“决策模型”】

5. 亚马逊推出StrandsDecider2B开源决策模型,支持本地部署|2026.10.04AI简报

6. 4GB 内存的电脑,也能在本地跑一个「秒出结论」的决策模型了!

7. JEV快速决策模型 本地部署各大开源方案实测 System One

8. 工单分流,不必让大模型写小作文。Unsloth Desktop 现可本地跑 Laya

9. 国产决策模型开源把Jev请下王座:38项基准31项反超,36局国际象棋赢35

10. Ollama推出三个类Jev决策模型,本地跑完全免费

11. 赛博茶馆:GitHub 这周最热闹的不是哪个大模型,是「决策模型」成了品类

12. 类Jev项目Kev从入门到实战(6):Jev / Kev / Laya 对比

13. Jev决策模型深度解析

14. sAkura-IOCMSv2.0第二周新增jev决策模型审核评论等AI功能

15. 【又一个多模态版本Jev决策模型?再看Clef的实现思路及训练机制】

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章