Jev爆火却不开源,社区10天搓出6个本地平替:95%正确率要等4秒,25毫秒但只对65%,你的机器该不该装一个?

源自23位全网作者

14:04

9月15日,TypeSafeAI发布了Jev。这个模型的亮相方式很怪:它不会写文章、不会聊天、不会规划,只会做三种事——选择题、打分、判断是否,每道题再附带一个概率值。创始人是前OpenAI研究员Diogo Almeida,RLHF和InstructGPT的核心成员;名字取自经济学里的"杰文斯悖论":当单次决策便宜上百倍,系统里原本写死的if-else都会开始想请模型帮忙。

官方的说法相当激进:自动化工作流任务比现有大模型快193.6倍、成本低444.6倍;输入每百万Token收$0.042,输出永久免费,端到端延迟70到500毫秒。社区看到毫秒级操控DOOM游戏的录屏后,技术圈认真了——官宣推文近4000万人围观,知乎主问题一个多月冲到64万阅读,程序员鱼皮的B站教程5天16万播放、5310人收藏,开发商估值9天飙进百亿美元。知乎知乎今日头条

Jev爆火却不开源,社区10天搓出6个本地平替:95%正确率要等4秒,25毫秒但只对65%,你的机器该不该装一个?

而折腾本地部署的人看完第一反应高度一致:这种"只判断、不写字"的小任务,简直是为本地而生——快、便宜、数据还不用出机器。兴奋完就撞上现实:Jev本体是闭源的。知乎

这十天最大的误会:三种"开源Jev"根本不是一回事

截至9月26日社区的逐源核对,在TypeSafe官方发布页、文档和代码仓库里,没有找到模型权重和完整训练配方的下载入口。官方开源的是适配器、SDK、示例代码——“代码能下载"不等于"整套能力能离线跑”。

被各路文章混着叫"开源版Jev"的东西,实际分三条路线:

第一条:重新训练的开放权重模型。 Laya,多语言权重加Router路由,还公开了微调入口;Kev,0.8B/4B/9B/27B一家族,Qwen3.5/3.8底座,提供训练、评测、本地服务全套代码,甚至能把TypeSafe的Python SDK直接指向它;Bespoke Labs的Nimble 9B,公开了"改事实造反例"的数据配方——让正确答案跟着证据变,而不是逼模型背表面词汇;Mapika的decider-2b也在这一类。9月26日,这条路线又挤进来一个国产选手:基元律动(华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办)发布NeoHorse-Jev-4B,六组基准综合77.70分,在成绩完整的开源参评模型里排第一,比参数更大的Open-Jev-9B还高2.03分,权重、推理源码、部署样例一并开源,32并发下服务端平均一次判断74.3毫秒。今日头条

Jev爆火却不开源,社区10天搓出6个本地平替:95%正确率要等4秒,25毫秒但只对65%,你的机器该不该装一个?

第二条:不换模型、只换推理方式。 社区在Jev发布两小时内就跑通两条复刻路径:一条是harshatheg的Qwen-2.5-1B-RLCD,单次前向后直接抠末位logits、只对候选标签做局部softmax;一条是AlexWortega的openjev,拿NLI交叉编码器做蕴含判断。最新的SemIf(早期叫OpenJev)用4B开源模型在本地把语义判断做成typed if。X上的整活速度更夸张:有人的421M小版本在自己机器上训不到两小时;有人公布微调Qwen3.5-4B复刻分类服务的费用——17美元。

第三条:只是调用云端API的应用壳。 Jev聊天助手(安卓上帮你判断聊天意图、起草候选回复,只填不发)、jev-mcp、雪踏乌云整理的AwesomeJev 20个项目清单——这些开源的是工作流,底层判断仍在云端。

Jev爆火却不开源,社区10天搓出6个本地平替:95%正确率要等4秒,25毫秒但只对65%,你的机器该不该装一个?

一张记分牌看本地成色。9月24日,开发者wquguru把Jev和三个可本地部署的平替(Laya、djev、anyjev)放一起做20道不同难度的题。 四个方案的成绩如下:知乎

方案

正确率

单次延迟

一句话点评

官方Jev(云端API)

20题全对

测试口径1.3秒(官方标称70-500毫秒)

生产最稳,但闭源收费

anyjev(本地,Qwen3-4B)

95%

约4秒

本地正确率天花板,速度还没优化

Laya(本地)

65%

25毫秒

毫秒级里最能打的,但三分之一的题会错

djev(本地)

35%

509毫秒

又慢又差,先别碰

Richard Bäcker的jev-on-a-laptop从另一个角度量了差距:同一批工作流题目,本地Qwen2.5-7B裸logits与前沿模型共识的一致率是73.8%,Jev是86.6%。Kev的跑分表也埋着坑:新来源数据上Kev-27B的0.896是测试集数字,Jev的0.857是开发集数字,不同口径不能拿来喊"开源反超"。样本只有20道题,这些数字只够当线索,不够当结论。知乎知乎

Jev爆火却不开源,社区10天搓出6个本地平替:95%正确率要等4秒,25毫秒但只对65%,你的机器该不该装一个?

本地真正缺的不是速度,是"校准"

单论快,本地小模型反而占优——Laya的25毫秒比官方云端往返还快一个数量级。Jev真正的护城河是RLCD(面向校准决策的强化学习)训出来的那个概率:未经校准的softmax是出了名的虚假自信,模型错得离谱时照样敢亮0.99。云端服务卖的不是答案,是"这个0.8在统计上真有八成把握"。想在本地复刻这条自动化链路,温度缩放和领域数据后校准得自己做——这是绝大多数平替教程不会替你做的事。知乎

Jev爆火却不开源,社区10天搓出6个本地平替:95%正确率要等4秒,25毫秒但只对65%,你的机器该不该装一个?

第三方上万次压力测试还给出两个细节:Archer Hume把输入从360个token灌到近3万个,中位耗时只从57.5毫秒涨到218毫秒,1500个并发问题端到端也只涨到610毫秒。这种一次性读分的快是结构性的——没有逐字解码的累加;但候选项之间存在注意力干扰,在四个有效选项后面加一个无关的"天气"选项,原有最优项的得分会被拉低,选项顺序也会晃结果。接口相似,不等于行为一致。知乎

连随机数发生器都赢过它一次

本地化之前,先把边界想清楚。Karminski-牙医搭了对抗测试:给Jev塞满曼哈顿距离启发、上一步动作、邻居访问计数,它在迷宫拐角(7,4)的3个格子里原地打转2295步直到超时;换成一个API格式完全一致的随机数server,892步通关,总耗时不到300毫秒。这是有数学撑腰的:有限网格里的随机游走以概率1到达终点。知乎

结论不丢人但很关键:Jev是极速的单步判断器,绝不是规划器。 他整理的使用红线:需要绕路回溯多步规划的(装箱、调度)、一步踏错当场结束的(贪吃蛇、驾驶)、不可逆高代价动作(删库、事务、要审计的操作)——都别交给决策模型。加密圈也有实测,Jev相对买入不动的超额收益是惊人的-60.2%,还有人晒出用Jev做的实时交易机器人亏了31680美元的账单。今日头条

9月27日差评的三局游戏实测把这层边界又撕开一点:网传"8分43秒速通Minecraft杀末影龙",翻开日志是274个决策里250个只有一个选项的"送分题";斗地主残局同一手牌让它重打六次,四次王炸两次改对K,概率咬得一样紧时它真的会反悔。今日头条

杀戮尖塔里更直观:16血3费、手里三张防御牌,本该集中的防御概率被拆成17、20、18三份,被"结束回合"的21分反超,一枪不开倒在原地。 哪些动作算"一个选项"、选项要不要合并,全是harness(宿主程序)说了算——决策模型的表现一半归模型,另一半归写调度代码的你。 Google这时携DiffusionGemma下场,转发对比称在工单处理上全面反超;"决策模型值不值"的争论,本身就说明这波还在半程。今日头条

四类人四张答案

  1. 纯好奇、想看懂概念:SemIf加任意一个开源4B底座,本地跑20道题找感觉,一分钱不用花。这类判断器的心智模型,半小时能建立。

  2. 已经跑Agent、被API账单硌到的:高频小判断(工具路由、垃圾过滤、失败重试、证据够不够)走官方API反而划算——$0.042每百万输入、输出免费,BrowserUse接Jev后网页点击这类"离散多选题"的速度提升是社区公认最惊艳的场景。灰度一两周,低置信度回落到规则和人工。

  3. 数据敏感或必须离线的:Laya和Kev是目前最值得测的两个(一个有微调入口,一个能SDK无缝换后端),但先用自有工单/审核标签做回归测试、再补温度校准;锁死权重和推理包版本,别追latest——decider v11就明确披露了新版本在日常和游戏任务上的回退。

  4. 想用决策模型替掉大模型的:不行。System 1做判断、System 2做规划,这是这一轮从刷屏到翻车所有实测共同指回的结论。

接下来盯三个信号:官方会不会开放权重或完整训练配方;中文长文档、否定关系、专业术语上的评测什么时候有人补齐;Kev这类家族会不会放出和Jev同一测试集的同步对比。答案出来之前,先别让"开源Jev"四个字替你按下部署键。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章