别让27B去"决策":Jev刷屏17天,我把7组毫秒级数字和3次实测翻车摆进同一张表——本地党先换哪类活

源自91位全网作者

07:48

如果你这半个月也被"又一个Jev开源替代""比llama.cpp快92%“刷屏,先别急着装机——这批新东西不是一条赛道上的"更快聊天”,它们想把决策这个活从大模型手里拆走。 这篇只写给已经把9B/27B跑起来、正琢磨让本地模型接管分类、路由、审核的人:我把17天里的数字和翻车摆进同一张表,装之前对一遍。微博

一、一句话看懂:"决策模型"不是用来聊天的

TypeSafe的Jev(9月15日发布)不生成文本:输入state+预先声明的选项空间,直接输出带校准概率的选择,定位路由、审核、分类这类高频小决策,社区口径是"毫秒级直出概率"。知乎36氪

对本地党的意义很直白:让27B跑一个工单分类,是在用整张显卡为一件"选择题"支付生成成本。决策赛道想干的事,是让一个占用极小的模型专管"选哪个",大模型只在需要时被叫醒。

别让27B去

这17天的时间线:

日期

事件

关键口径

09-15

TypeSafe发布Jev(闭源API)

零文本生成、输出类型化概率

09-21/23

社区教程演示llama.cpp"Jev模式"

约束选择+并行预填充

09-22

量子位报道"本地版Jev"开源平替Laya

1G内存就能本地跑

09-29

斯坦福×NVIDIA开源CLM(GitHub仓库已2735星、Apache 2.0)

单次决策16.5ms vs Jev 149.8ms(RTX 4090、T-Rex测试)

09-30

OpenAI推出类Jev的DecisionsAPI

同赛道对标,“选选项所以快”

10-01

喵呜岛发布自称首个Jev类AI原生游戏

响应延迟降到100ms

10-02

Ollama上架nimble 9B/tev1 4B/0.8B三款类Jev模型

/v1/systemone端点,官网可直连核对

10-02

亚马逊开源Strands Decider 2B

称登顶Jevbench、可本地运行(媒体快讯,未见独立实测)

二、先把"宣称"和"实测"切开

这张表是本篇最该收藏的部分——同一个赛道里,数字的可信度差着一个量级:

数字

出处

性质

91ms调用延迟

Ollama官方demo转述

宣称,无第三方复测

Metal解码比llama.cpp快92%、显存-27%

Magnitude引擎(magnitude.dev)

厂商宣称经博主转述,无测试配置

Vercel接入24小时内近13%付费团队使用

知乎"没有护城河"一文引用

单一来源

选项顺序调整,概率0.43漂到0.63

同上,作者复测

实测——校准是老毛病没解的直接证据

Banking77对比Opus:差3.3pp、延迟1/13、费用1/22

同上转引

第三方对比转述

CLM 16.5ms、1000候选快约13倍

CLM项目团队自报

自测有口径(4090);0.6ms需缓存前提,作者自己都警告"别当常规延迟宣传"

Ollama决策准确率图:Jev 1.13 76.0%、nimble 9B 75.7%、tev1 4B 73.3%、0.8B 63.5%

Ollama官方博客内嵌图

官方口径,基准是Bespoke Labs公开集——仍是"厂商测厂商的赛道",无独立复测

Laya微调0.766反超Jev 0.727

B站UP主自测

单源自报

nimble/tev1全系列参数、命令、端点

Ollama官网与博客实测可直连

`ollama pull nimble`、`ollama pull tev1:4b`、`ollama pull tev1:0.8b` 已从官方页面核实(nimble出自Bespoke Labs、tev1出自Together AI);但91ms仍是官方demo宣称,中文圈暂无第三方复测

三、2170个项目和3次翻车之后,只剩一条规律

B站论文解读转述:Jev发布一周,公开项目2170个、涨星4万+。把这些项目按场景排一遍,能留下的边界只有一条:选项空间可预先声明、候选集可控——能用;开放式生成、多步规划、选项一多一复杂——会翻车。

翻车不是猜的,是真实用户在B站那条llama.cpp演示视频的评论区里砸出来的:有用户说模型虽然能给出置信度,可任务一复杂,这个置信度就不可信了。 另一位按教程实跑qwen3.8-2B decision模式的用户补充:"选项一多加上场景复杂的话,正确率有点低。"评测向文章也在提醒:置信度和正确性是两回事,别指望决策模型替代通用大模型干活。B站

连游戏这个最像"天然适配"的场景都有分歧:知乎那篇讨论OpenAI DecisionsAPI的回答把态度说得很直接——拿它打游戏并不合适。 36氪编辑的玩法更直接:开了个Minecraft服务器,让Jev进去当玩家,自己全程旁观。 B站团队喵呜岛则宣称做了"世界首个基于Jev的AI原生游戏",把猫猫们的响应延迟降低到100ms。 只是这个100ms,恰好落在官方70–500ms的口径区间之内——它证明的是"能用",不是"神速"。知乎36氪B站

别让27B去

按任务分三档,直接对表:

任务

建议

固定集合分类、工单路由、内容审核预筛、简单二选一gate

现在就换:0.8B/4B这个量级足够,把27B的显存和时间还给"写"

拿不准就升级大模型的置信度门控

谨慎试:CMU"JEV-as-a-Judge"路线自称比GPT-6准、费用降到41%——单源自报,等复测再上生产

开放问答、写代码、多步规划

别换:这不是决策赛道的活,换上去就是当场的翻车贴

一个必须说的反证:小红书最热的本地Agent选型帖(617赞、45评)里,评论区聊的全是"跑通27B要什么配置"这类装机问题,最直给的一句是"本地还是太笨了,不如网页端"。 没有人在问"快不快"。决策赛道解决的是慢和占卡,不解决笨——它省下来的显存和秒数,不会让你的27B变聪明。看到"本地AI员工又便宜又快"的叙事时,先分清哪个词在骗你。小红书

四、三种机器,怎么换

  • Ollama装机党:官方页面已可直连核对——`ollama pull nimble`(Bespoke Labs,9B)或 `ollama pull tev1:4b` / `ollama pull tev1:0.8b`(Together AI),调用走 `/v1/systemone` 端点,是最省事的一条路。注意官方基准图里 0.8B 只有 63.5%:别拿最小档去接正经任务,4B起步更稳。Ollama官网

  • llama.cpp折腾党:“Jev模式"目前来自社区教程与fork演示,B站该视频最高赞评论预判"迟早合并进主分支”。想尝鲜就自己挂实验分支,不想折腾崩溃就等正式合入——这本身就是一个观察信号。

  • 大内存/小内存两头都有开源路:24G+/4090/Mac 大内存党走 CLM(Apache 2.0、代码权重全开源,CLM-8B=冻结 Qwen3-8B 编码器+轻量投影头,一张 4090 可自托管,是目前证据链最完整的一条本地路线);只有核显小机器/老办公本的,可以盯 Laya 这类本地平替——报道标题干脆写着"本地版Jev 1G内存就能跑",但它刚起步,准确率数据多为作者自报。36氪

别让27B去

顺带澄清一个容易串线的点:MTPLX把27B拉到87.6t/s、MTP开多并发213t/s,这些属于"把生成跑快"的旧赛道,和"把决策拆出去"是两回事,评估时别拿两条赛道的数字互相打。

五、接下来盯四个信号

  1. llama.cpp是否把Jev类特性合进主分支(决定折腾党能不能上车);

  2. Ollama三款新模型:名称和命令已被官方页面证实,但91ms和准确率图仍是官方口径——会不会出现第三方独立实测,决定这条路能不能上生产;

  3. Laya/CLM这类开源替代的准确率有没有第三方复测跟上;

  4. OpenAI DecisionsAPI的定价——云端毫秒决策要是击穿底价,"自建决策层"这笔本地账就得重算。

一句话收口:17天里,"毫秒级决策"从闭源API走到了ollama pull即用;它对本地党的真实收益,是让大模型终于只干"写"的活。但在数字变成可复测的证据之前,只换分类、路由、审核这三样换了也不心疼的活,开放式的先别硬换。

你最想把流水线里哪一环换成决策赛道?评论区报个任务类型,下期我拿真实项目去复测。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章