让本地大模型做判断题,你大概率经历过这一幕:你只想问"这单工单归哪个组",它先回你一段"好的,我来分析一下",JSON外面包着寒暄,你的解析脚本天天祈祷它别即兴发挥。更别扭的是,这类活你还不愿意丢云端——按token计费不说,工单、内部数据这些恰恰是最不想出门的。小红书那条979赞的"不是哥们这token金子做的?",骂的就是这种"用旗舰模型干分拣活"的冤枉钱。
上一轮我们讲过Jev和"不写字的AI"这个概念本身。这篇只讲它这十天发生的变化:一个原本要调云端API的新物种,被四家塞进了你机箱里——llama.cpp三天合并接口、Ollama直接发自研模型、StartLux和Cloudflare把权重开源到GGUF管够,连OpenAI都在10月9日的播客里坦承,自家的DecisionsAPI是受Jev启发启动、不在原计划里,团队先验证原型约一周完成,而且没重训模型,只是沿用Luna权重加输出约束和并行批处理。36氪
"能不能装"这关基本关了。剩下的三关,才是真正的账:跑不跑得动、量化掉不掉、概率信不信得过。
第一笔账:装机账——"6GB能跑"是真的,但要看是谁的版本
先把这两周软件侧的时间线钉住,每一条都可回查:
9月30日,上海团队StartLux(原点星辉)开源StartLux-Decision,0.8B/2B/4B/9B/27B五档一次放齐,每档都提供BF16、Q8_0、Q4_K_M三种GGUF,合集里共15个文件;代码Apache-2.0,权重CC-BY-NC-4.0——想商用得另外拿授权,这点官方写得明白。钛媒体
10月2日,llama.cpp官方合并PR #29818,llama-server原生提供/v1/systemone端点,首批支持laya、openjev、kev等五个决策模型;次日PR #29831又加入Clef。任何按Jev协议写的客户端,改一行base_url就能指向本地,对数据不出内网的场景这是关键一步。知乎
同一天,Ollama端出nimble 9B、tev 4B、0.8B三个类Jev决策模型,本地跑完全免费。知乎
10月3日,Cloudflare带着自研Clef/Clef-Flash(27B/9B)入场,Apache-2.0开源;上海AI实验室的Intern-Decision也在同一梯队被反复对照。
门槛具体到什么程度?知乎那篇Clef实测给的答案是:Clef-Flash Q4KM量化版,6GB显存的老笔记本就能跑起来。 StartLux官方给的文件大小是4B档Q8_0为4.48GB、Q4_K_M压到2.71GB。也就是说,你手里那台当年"跑不动27B"的卡,现在跑一个专职做选择题的小模型是够的。知乎
顺带把速度口径也对清楚:StartLux宣传"4B一次回答三个问题平均26毫秒",但那是单卡H200、BF16、短请求的数字,且同文自己披露:不开CUDAGraph时是90.3毫秒,开了才降到26.0——毫秒数一半是引擎给的,不是你的笔记本给的。Intern-Decision对照的是RTX 4090(0.8B约34毫秒),Jev官方报的是API网关服务端耗时(三问题64毫秒),三组数字硬件和服务栈全都不同,不能拿来互相折倍数。钛媒体

第二笔账:量化账——98.3%是赠品,0.09才是惊出冷汗的那个数
"决策模型只做选择题"这件事有个隐藏福利:它有标准答案可以回测。StartLux官方做了量化复测——4B Q8_0与原始权重在231题公开JevBench上决策一致率100%(同对204题);压到2.71GB的Q4_K_M后一致率98.3%、答对201题。 对写作模型来说掉一分智商你未必看得出,对路由模型来说,这1.7个百分点就是231单里约4单分错组。钛媒体

但官方复测是在H200上做的,民间在6GB卡上的一个通宵记录完全是另一个故事。知乎用户"花一晚上把两个决策模型装进6GB显存",笔记本是GTX 1660 Ti Mobile,试的是llama.cpp合并端点之前的两个开源实现,翻车姿势值得逐条抄下来对照:
kev完全没接量化:代码里搜不到load_in_4bit和BitsAndBytesConfig,只认bf16/fp16/fp32。 0.8B用bf16进卡,实测占显存3847MiB——还没开始干活,半张卡已经没了。知乎
改代码做CPU offload倒是走通了(依赖的accelerate本来就支持device_map=“auto”),但offload模式必须关掉fused内核和cuda_graphs,速度优势当场清零。
最阴的坑是"静静失败":LoRA权重加载进了meta空壳,torch只警告了一句"which is a no-op",不报错;232个LoRA参数没数据,前向一算全是NaN。
laya是另一套坑:pypi直连0.4MB/s,一个3.5GB的torch CUDA栈要按两小时,换清华镜像26.8MB/s两分钟装完;HuggingFace要走hf-mirror且必须清掉代理环境变量;机器上装了TensorFlow就得加USE_TF=0,不然laya.load()死锁。
最后的判决不在显存,在概率:0.8B能答对题,但给出"它有多确定"时,简单判断题只报0.09的置信度,而路由阈值设在0.6。 “能做出判断,但不为判断给出可信概率”——两个实现病根相同,全都只能弃用。
同一家官方资料里还有一组值得截图保存的对照:111道JevBench-Hard难题,旗舰版错23题、比Jev 1.13的31题少错8道;七套测试平均错误率8.2%对11.3%——差距不在"会不会做选择题",在难题和稳健性上。钛媒体

这笔账的结论:在llama.cpp原生端点合入之后,"装起来"确实变简单了;但下载清单时先查两样东西——量化复测一致率,和概率校准记录。都没有的,别派真活,让它先在日志里陪跑。
第三笔账:信任账——63.88是自测的,"90%把握"不等于成功率
StartLux这篇官方发布在国产开源里算罕见的诚实,几个口径它自己全写了,反而值得转给所有准备抄作业的人:
DecisionIndex 0.2.1上27B得分63.88、38项基准31项高于Jev 1.13(57.91)、9B的58.63也过线——但这是团队自测、未获官方上榜认证,对照用的是9月28日的公开榜单快照,这个指数还是随机基线校正后加权汇总的,不是直接准确率。钛媒体
分域拆开看不是全面碾压:语言理解74.5对62.0、检索与分类66.8对55.4、工具与自动化82.2对75.1,全面领先Jev;但知识与推理44.3对51.4被反超,API-Bank也没领先。 单项拆到基准层是同样的两面性:官方单项表里,ContractNLI一项可以拉开80.3对59.1的领先,API-Bank那行却是83.8对88.0输4.2分。官方原话值得抄在显示器边:“综合得分领先不等于所有能力都更强。”

概率输出不自动等于真实成功率:分流阈值要拿你自己的业务数据校准,支付、删除、权限修改这类操作,该走的人工确认一步不能省。钛媒体
10月9日B站那条20赞44藏的视频标题就是这关的核心问题——AI说"90%有把握",你敢让Agent自动执行吗? 而OpenAI在同一天播客里给的路线是另一半答案:不重训、只做约束和并行的DecisionsAPI,本质是个极快的分类层,用途明说就是客服工单分类、评估打分这种。 云端和开源在同一个星期指向同一件事:高频小判断正在从"生成"里独立出来,变成一个单独岗位。哔哩哔哩36氪
抄作业之前:谁现在装,谁再等,谁干脆别装
现在就装:已经在跑本地Agent/工作流,手里有分类、路由、RAG重排、注入筛查这类高频小活。设计哲学直接抄——问题要原子化,组合逻辑放在代码里,别问"给这个项目打分",拆开问市场规模、技术可行性,优先级变了改一个系数就行。 6~12GB显存按Q4_K_M起步,Jev客户端改base_url指过来,数据不出内网。知乎
再等等:指望它兼做复杂推理(知识与推理被反超44.3对51.4就是提醒);指望多模态决策(JEV-27B-VL前天刚开源,还没人交实测作业);以及工作流本身还没跑通的——没有活派给它,装了也不会省钱。
干脆别装:判断量小到不值得24小时开机的,"本地免费"只有量大才免费,这笔账国庆前那期算过,这里不重复;月底Mistral Large 4(1.05T总参/52B激活)和Reflection Beam的权重还要来抢你的显存预算和注意力。
继续盯的信号:StartLux、Clef什么时候拿到DecisionIndex官方上榜成绩(现在全是自测/自说);llama.cpp的SystemOne支持清单会不会接着扩容;Clef-Flash在6~8GB卡上的本地实测毫秒数何时补齐——上面所有"快",目前都还长在别人的硬件上。
一句话收口:这十天,决策模型从"云上的新物种"变成了"显卡里的新岗位"。岗位是真的,招聘门槛也是真的——装机账看GGUF,量化账看一致率,信任账看校准。三笔账对完再发工牌,你的2.71GB小分拣员才不至于变成那台"警报响了、插头没拔"的夜班同事。