这周本地AI圈最热闹的新物种,是一个"不写字"的AI。
它叫决策模型(System One)。不生成文本、不聊天、不写代码,你给它一段状态加几个事先定义好的问题——选择题、是非题、打分题——它直接返回选项和概率,一次调用几十毫秒。10月5日,IT之家报道TypeSafe家的Jev日处理token量已达1万亿,约25%的世界500强企业在用。IT之家
而对本地部署党来说,真正的大新闻是另一条线:这个品类正在以离谱的速度涌进你自己的电脑。10月1日Ollama v0.35原生加了`/v1/systemone`接口,随包上架了Nimble和Tev1一共三个决策模型。10月2日llama.cpp的SystemOne接口合入主分支,Cloudflare也开源了27B和9B的Clef与Clef Flash。微博知乎微博
10月4日,亚马逊跟进开源Strands Decider 2B。TypeSafe九月开的头,不到一个月,跟进的已经有Cloudflare、亚马逊、TogetherAI、Bespoke Labs,OpenAI也在云端出了Decisions API。哔哩哔哩
先说结论:这可能是今年硬件门槛最低的AI新品类——最小812MB的模型文件、4GB内存的老电脑都有份,实测24G显存的本地27B已经能和云端Jev打平。但它的坑和聊天模型完全是两回事,上车前值得把入场券和坑位都数清楚。微博小红书

749道题实测:本地和云端打平,小模型的中文露了底
目前这个品类最扎实的一份实测,来自B站UP主麻仓月轩:7个SystemOne式模型同场抢答749道真实判断题——飞书消息分诊、扫地机器人语音指令、语音助手意图识别、英文客服短文本,还有几千字的保险条款。9月30日发布,单卡本地部署(vLLM/NInfer环境),每题的答案和延迟都是真实跑出来的。结果(逐题准确率/中位延迟):哔哩哔哩
Jev 1.13(OpenRouter API):94.7%,332ms,跑完全程约0.018美元
Qwen3.8 27B(本地NVFP4):94.7%,328ms,显存24GB
DiffusionGemma 26B-A4B:93.6%,119ms,中文98.8%、英文83.3%
JevK5 0.2(4B+LoRA):90.7%,47ms,显存14GB
SemIf 4B:84.4%,53ms;reflex 4B:83.2%,88ms
Laya(encoder小模型):51.1%,21ms,中文只有47.7%、英文短题95.8%
这张表能读出三件事。
第一,本地党已经追平云端。24G显存跑Qwen3.8 27B的NVFP4量化,准确率和Jev API一模一样,延迟还略低。手里有3090/4090这个级别卡的,这项能力不用再给云端付钱。
第二,4B微调档才是自托管的甜点位。JevK5(4B+LoRA)90.7%,只比27B低4个点,显存省10GB、延迟快7倍。决策模型不是"越大越强"的游戏,这个性价比排序和聊天模型完全不同——它的快,来自架构上根本不走逐token生成那条路,而是一次前向直接给候选项打分。

第三,小模型的语言偏科比想象中严重。Laya总分51.1%看着像翻车,拆开看:英文短题95.8%,中文只有47.7%——基本是抛硬币。而DiffusionGemma正好反过来,中文98.8%、英文83.3%。这说明一件事:中文场景下选决策模型,别看总榜,看训练数据里有没有你的语言。英文榜单不能折算成你中文工单上的表现。哔哩哔哩
顺带一提评论区的氛围也很真实。最高赞评论(8赞)是给Laya泼冷水的:Laya必须做微调训练,开箱即用没一点价值,官方没有微调数据就不推荐用。还有一条被反复追问的是"Qwen 27B怎么改成决策模型"——回答是架构上不天然支持,但改transformer文件、走jevspawn这类infra方案有戏。另一条高共鸣评论只有一句话:“本地部署看着什么都好,就是没钱买卡。”哔哩哔哩
入场券五档:按你手里的机器数
决策模型和聊天模型入场券的最大区别:低档位真的能跑,但"能跑"和"能用"之间隔着语言和微调两道坎。只数有实测或官方依据的档位:
4GB内存、无独显:两条路。Laya多语言版678MB,Unsloth Desktop已接入。Ollama库里的Tev1 0.8B(TogetherAI实验模型),文件最小仅812MB。但这一档是给愿意微调的人准备的,纯开箱的中文垂直任务,参考上面47.7%那个数字。小红书
单卡3090级:国产StartLux-Decision(上海原点星辉)宣称0.8B本地12毫秒出判断、38项基准31项反超Jev、五档全免费。先按住钱包——这些数字目前只出现在厂商侧视频里,那条视频本身就带着"广告"标签,等独立实测再信。哔哩哔哩
14GB显存:JevK5 4B+LoRA,90.7%,上面那份独立实测里的"自托管综合最佳"。
24GB显存:Qwen3.8 27B走NVFP4改造成决策格式,94.7%追平云端;或者Ollama直接拉Nimble(Bespoke Labs出品,9B,基于Qwen3.5)。
Ollama党(含Mac):升级到v0.35.1以上,`ollama pull nimble`一键拉取,Tev1 4B/0.8B、Cloudflare的Clef(27B)和Clef Flash(9B)都已上架。官方演示用Nimble实时打游戏做决策,M5 Max上每次调用91毫秒——这个延迟做Agent的"高速小脑"够用了。知乎
另外TogetherAI贴了教程:花17美元自己训一个0.8B决策模型。想动手训模型的,门槛已经低到这个数了。微博
三个坑,都有文档或实测背书
坑一:置信度不是正确率。 Ollama文档明确提醒:confidence表达的是模型对某个答案的偏向程度,高值不保证答案正确。更根本的反证来自知乎一位把Jev、Kev、Laya挨个跑了一遍的作者:三个模型在诗歌域的零样本测试全部约等于随机。决策模型默认不具备你的领域知识,所以选型的核心问题不是"谁零样本强",而是"谁的微调管线能让我把领域知识灌进去"。知乎知乎

坑二:工具链支持比想象中崭新,也比想象中窄。 说"ollama run一下就能用"的教程已经过时了:Ollama的决策推理目前只走API或TypeSafe SDK,原生CLI和Python/JS库还没跟上。llama.cpp的SystemOne接口10月2日才合入master,Clef的后续PR只支持文本、不含图片;Ollama一次请求里的多个问题共用输入、互相之间不传上下文,第二步依赖第一步的判断就得在应用层自己编排。这些都是这两天的新变化,教程的半衰期以小时计。知乎
坑三:"零幻觉"是话术,选错格子还是错。 决策模型的输出被限定在你给的选项里,不会编造内容——听起来像零幻觉,但它会以91%的置信度选错。而且错得越自信越危险,因为程序会直接拿去执行。上车前先想好退路:置信度低于阈值、信息不足、模型不可用时,回到规则或人工。会发消息、改数据、付款的操作,判断结果必须再过一层权限和业务规则检查。知乎Grivn那篇实操分析里还提了一个容易忽略的点:中文简称、错别字、夹杂英文的产品名,都应该进你自己的测试集——英文榜单救不了你的中文工单。哔哩哔哩知乎
谁该上车,谁该再等等
现在就值得试的三种人:
在搭Agent或自动化工作流的:工单分诊、模型路由、内容审核,官方场景全踩在真实痛点上。B站已经有独立开发者把Jev决策模型接进自建CMS做评论审核了。哔哩哔哩
手里有24G显存闲着的:实测追平云端Jev,电费比API费便宜,数据还不出门。
想训自己决策模型的折腾党:17美元的教程已经躺在TogetherAI博客里,比训LoRA还便宜。

建议再等等的三种人:
只拿本地模型聊天写文的:决策模型不写字,这个品类和你的需求无关,别被刷屏带节奏。
中文垂直场景、又不打算微调的:零样本在垂直域约等于随机,这是实测不是谦辞。
等生态成熟的:等Ollama把systemone做进CLI和原生库,等Strands Decider 2B(10月4日刚开源)的独立实测出来再动手,最多晚两周。
后面值得盯的观测信号,按重要性排:Ollama原生库支持的进度;Strands Decider 2B和StartLux-Decision的第三方实测(尤其是中文);上海AI实验室书生系的多模态决策模型Intern-Decision会不会开源——已经有博主专门拆解过它的实现思路,评论区也有人催UP主测"书生明决"。还有Jev的融资到底有没有落地:IT之家原文写到"新一轮融资估值或超100"就断了,连单位都没放全,这个数字在实锤前别当真。微博IT之家
最后说回那个"没钱买卡"的评论。决策模型恰好是这两年少见的、对旧机器友好的品类:678MB的入场券、树莓派级的延迟需求、不吃KV缓存不吃长上下文——你那台跑不动27B的老机器,这次可能真有活干。你的Agent一天要做多少次选择题?跑在什么卡上?评论区聊聊,下次把大家的实测凑一桌。哔哩哔哩