如果你这半个月也被"又一个Jev开源替代""比llama.cpp快92%“刷屏,先别急着装机——这批新东西不是一条赛道上的"更快聊天”,它们想把决策这个活从大模型手里拆走。 这篇只写给已经把9B/27B跑起来、正琢磨让本地模型接管分类、路由、审核的人:我把17天里的数字和翻车摆进同一张表,装之前对一遍。微博
一、一句话看懂:"决策模型"不是用来聊天的
TypeSafe的Jev(9月15日发布)不生成文本:输入state+预先声明的选项空间,直接输出带校准概率的选择,定位路由、审核、分类这类高频小决策,社区口径是"毫秒级直出概率"。知乎36氪
对本地党的意义很直白:让27B跑一个工单分类,是在用整张显卡为一件"选择题"支付生成成本。决策赛道想干的事,是让一个占用极小的模型专管"选哪个",大模型只在需要时被叫醒。

这17天的时间线:
日期 | 事件 | 关键口径 |
|---|---|---|
09-15 | TypeSafe发布Jev(闭源API) | 零文本生成、输出类型化概率 |
09-21/23 | 社区教程演示llama.cpp"Jev模式" | 约束选择+并行预填充 |
09-22 | 量子位报道"本地版Jev"开源平替Laya | 1G内存就能本地跑 |
09-29 | 斯坦福×NVIDIA开源CLM(GitHub仓库已2735星、Apache 2.0) | 单次决策16.5ms vs Jev 149.8ms(RTX 4090、T-Rex测试) |
09-30 | OpenAI推出类Jev的DecisionsAPI | 同赛道对标,“选选项所以快” |
10-01 | 喵呜岛发布自称首个Jev类AI原生游戏 | 响应延迟降到100ms |
10-02 | Ollama上架nimble 9B/tev1 4B/0.8B三款类Jev模型 | /v1/systemone端点,官网可直连核对 |
10-02 | 亚马逊开源Strands Decider 2B | 称登顶Jevbench、可本地运行(媒体快讯,未见独立实测) |
二、先把"宣称"和"实测"切开
这张表是本篇最该收藏的部分——同一个赛道里,数字的可信度差着一个量级:
数字 | 出处 | 性质 |
|---|---|---|
91ms调用延迟 | Ollama官方demo转述 | 宣称,无第三方复测 |
Metal解码比llama.cpp快92%、显存-27% | Magnitude引擎(magnitude.dev) | 厂商宣称经博主转述,无测试配置 |
Vercel接入24小时内近13%付费团队使用 | 知乎"没有护城河"一文引用 | 单一来源 |
选项顺序调整,概率0.43漂到0.63 | 同上,作者复测 | 实测——校准是老毛病没解的直接证据 |
Banking77对比Opus:差3.3pp、延迟1/13、费用1/22 | 同上转引 | 第三方对比转述 |
CLM 16.5ms、1000候选快约13倍 | CLM项目团队自报 | 自测有口径(4090);0.6ms需缓存前提,作者自己都警告"别当常规延迟宣传" |
Ollama决策准确率图:Jev 1.13 76.0%、nimble 9B 75.7%、tev1 4B 73.3%、0.8B 63.5% | Ollama官方博客内嵌图 | 官方口径,基准是Bespoke Labs公开集——仍是"厂商测厂商的赛道",无独立复测 |
Laya微调0.766反超Jev 0.727 | B站UP主自测 | 单源自报 |
nimble/tev1全系列参数、命令、端点 | Ollama官网与博客实测可直连 | `ollama pull nimble`、`ollama pull tev1:4b`、`ollama pull tev1:0.8b` 已从官方页面核实(nimble出自Bespoke Labs、tev1出自Together AI);但91ms仍是官方demo宣称,中文圈暂无第三方复测 |
三、2170个项目和3次翻车之后,只剩一条规律
B站论文解读转述:Jev发布一周,公开项目2170个、涨星4万+。把这些项目按场景排一遍,能留下的边界只有一条:选项空间可预先声明、候选集可控——能用;开放式生成、多步规划、选项一多一复杂——会翻车。
翻车不是猜的,是真实用户在B站那条llama.cpp演示视频的评论区里砸出来的:有用户说模型虽然能给出置信度,可任务一复杂,这个置信度就不可信了。 另一位按教程实跑qwen3.8-2B decision模式的用户补充:"选项一多加上场景复杂的话,正确率有点低。"评测向文章也在提醒:置信度和正确性是两回事,别指望决策模型替代通用大模型干活。B站
连游戏这个最像"天然适配"的场景都有分歧:知乎那篇讨论OpenAI DecisionsAPI的回答把态度说得很直接——拿它打游戏并不合适。 36氪编辑的玩法更直接:开了个Minecraft服务器,让Jev进去当玩家,自己全程旁观。 B站团队喵呜岛则宣称做了"世界首个基于Jev的AI原生游戏",把猫猫们的响应延迟降低到100ms。 只是这个100ms,恰好落在官方70–500ms的口径区间之内——它证明的是"能用",不是"神速"。知乎36氪B站

按任务分三档,直接对表:
任务 | 建议 |
|---|---|
固定集合分类、工单路由、内容审核预筛、简单二选一gate | 现在就换:0.8B/4B这个量级足够,把27B的显存和时间还给"写" |
拿不准就升级大模型的置信度门控 | 谨慎试:CMU"JEV-as-a-Judge"路线自称比GPT-6准、费用降到41%——单源自报,等复测再上生产 |
开放问答、写代码、多步规划 | 别换:这不是决策赛道的活,换上去就是当场的翻车贴 |
一个必须说的反证:小红书最热的本地Agent选型帖(617赞、45评)里,评论区聊的全是"跑通27B要什么配置"这类装机问题,最直给的一句是"本地还是太笨了,不如网页端"。 没有人在问"快不快"。决策赛道解决的是慢和占卡,不解决笨——它省下来的显存和秒数,不会让你的27B变聪明。看到"本地AI员工又便宜又快"的叙事时,先分清哪个词在骗你。小红书
四、三种机器,怎么换
Ollama装机党:官方页面已可直连核对——`ollama pull nimble`(Bespoke Labs,9B)或 `ollama pull tev1:4b` / `ollama pull tev1:0.8b`(Together AI),调用走 `/v1/systemone` 端点,是最省事的一条路。注意官方基准图里 0.8B 只有 63.5%:别拿最小档去接正经任务,4B起步更稳。Ollama官网
llama.cpp折腾党:“Jev模式"目前来自社区教程与fork演示,B站该视频最高赞评论预判"迟早合并进主分支”。想尝鲜就自己挂实验分支,不想折腾崩溃就等正式合入——这本身就是一个观察信号。
大内存/小内存两头都有开源路:24G+/4090/Mac 大内存党走 CLM(Apache 2.0、代码权重全开源,CLM-8B=冻结 Qwen3-8B 编码器+轻量投影头,一张 4090 可自托管,是目前证据链最完整的一条本地路线);只有核显小机器/老办公本的,可以盯 Laya 这类本地平替——报道标题干脆写着"本地版Jev 1G内存就能跑",但它刚起步,准确率数据多为作者自报。36氪

顺带澄清一个容易串线的点:MTPLX把27B拉到87.6t/s、MTP开多并发213t/s,这些属于"把生成跑快"的旧赛道,和"把决策拆出去"是两回事,评估时别拿两条赛道的数字互相打。
五、接下来盯四个信号
llama.cpp是否把Jev类特性合进主分支(决定折腾党能不能上车);
Ollama三款新模型:名称和命令已被官方页面证实,但91ms和准确率图仍是官方口径——会不会出现第三方独立实测,决定这条路能不能上生产;
Laya/CLM这类开源替代的准确率有没有第三方复测跟上;
OpenAI DecisionsAPI的定价——云端毫秒决策要是击穿底价,"自建决策层"这笔本地账就得重算。
一句话收口:17天里,"毫秒级决策"从闭源API走到了ollama pull即用;它对本地党的真实收益,是让大模型终于只干"写"的活。但在数字变成可复测的证据之前,只换分类、路由、审核这三样换了也不心疼的活,开放式的先别硬换。
你最想把流水线里哪一环换成决策赛道?评论区报个任务类型,下期我拿真实项目去复测。