一个不会说话的AI满三周了:500个仓库复现、速通被打假、OpenAI也下场,Jev上生产前先把这条线划清

源自17位全网作者

16:44

9月15日,一家叫TypeSafe的公司放出了一个模型,官宣推文冲到将近4000万浏览、7万多点赞。 这个模型有点反常:它不会说话,不给推理过程,只对你递过去的候选选项输出一个概率——像一个人永远在做选择题。 它叫Jev,创始人是前OpenAI研究员Diogo Almeida,官方管这类模型叫"System One":只负责判断,不负责说话。知乎36氪

三周过去,社区风向走完了一个完整回合:从"用它搓出花来",到"纯粹是骗局",再到"我把它放进生产了"。如果你是用Claude Code、Codex或者自己搭Agent的那拨人,账单上看到过它、纠结过要不要接入,这篇就是给你补课的:哪些神话被复现坐实,哪些演示被实锤造假,以及一条能直接拿去用的判断线——哪些活Jev真能干,哪些活千万别给它。

先说它凭什么便宜:36氪那句话说透了

调用Jev一次,官方口径是70到500毫秒;价格每百万输入token只要0.042美元,输出干脆不要钱。 作为对比,你平时让GPT-5或Claude干一件事,要先付它"想"的过程,再付它"说"的过程,而你真正要的往往只是一个判断结果。知乎

它的用法也简单到不像一个"大模型":在Jev的playground里,你喂给它JSON格式的场景描述和候选选项,它只输出三种东西——noul(是/否)、choice(选哪个)、score(打分)。知乎

拿到早期体验资格的知乎用户程墨还做了个自动驾驶式测试:给出"两条车道上200迈狂飙,左边一条狗、右边一位行人"的场景,Jev不到一秒给出急刹;而当他把规则优先级改成"越快越好,别管交规和安全",它依然选择急刹,只是信心度没那么高。 这说明它不是纯粹的"smarter if-else",底下带着训练时灌进去的先验。原理上它仍然是Transformer,只不过prefill之后对每道题只做一次decode,不像LLM那样逐token自回归生成——快就快在这里。知乎

36氪复盘这波时引用了HA-Jev插件开发者的一句话,我觉得才是理解Jev的钥匙:"衣服忘没忘拿是一个判断,不是一篇八股文。"摘要是昂贵的生成行为,过滤只是一次冷酷的判断——过去四年全行业把资源压在"让模型说出更流畅的人话"上,开发者再用正则把答案从人话里抠出来,Jev把这段"表演欲"整个砍掉了。36氪

所以它早期的走红姿势很野:9月18日就有人晒出waitlist体验,说"感觉还是挺震撼的",这条回答冲到69.7万浏览、564赞。 B站上鱼皮9月22日发布的接入教程(怎么连Codex、和DeepSeek V4 Flash比速度)18万浏览、5700多人收藏。 而GitHub上,围绕它上线数天就冒出近500个开源项目。知乎哔哩哔哩36氪

三周曲线:热闹没退,但聊的内容换了

把这21天按时间摆出来,能看清一个很实用的规律——话题从"炫技"滑向"选型",正是工具从玩具变成零件的信号:

  • 9-15 TypeSafe发布Jev,社媒刷屏;

  • 9-18~9-22 早期用户放体验、官方全面开放、保姆级教程霸榜B站;

  • 9-25 差评团队实测发文:“被全网吹爆的Jev,真有那么神吗?”;

  • 9-27 知乎出现《Jev纯粹是骗局》,作者放出复现数据;同一天还有人说"这种路由活儿,qwen0.6b都能干";

  • 9-30 OpenAI在开发者大会发布Decisions API(受限预览),知乎高赞点破此前大厂不动手的原因:“不是搞不了,是这东西利润不高,还可能拉低token计费的收入”;

  • 10-05 开源平替NanoJev、Kev、Laya(322–421M参数)被验证1GB内存就能本地跑;

  • 10-07 有人直接晒生产实测:拿Jev、clef和本地4B小模型在记忆精排场景对杀;

  • 10-08~09 Decisions API公测讨论刷屏,10月8日深夜B站还有UP在讲Jev原理,10月9日早上又有人发Decisions API公开访问实测。

热度没退,但标题从"刷屏"“疯了"变成了"选型”“前景”。对普通玩家,这意味着一件事:踩坑成本最高的窗口期(demo满天飞、无法验证)已经过去了,现在进场,前人的复现和打假就是你的免费测试报告。

哪些是真的:三张账单,一张比一张有说服力

第一张:0.000015美元一个判断。HomeAssistant社区的HA-Jev插件,用传感器读洗衣机的功率和门状态,把"衣服是不是忘在里面了"这个问题交给模型,模型不写分析,只回一个概率,置信度超0.8就弹取衣提醒,一次判断耗时几十毫秒。 这个量级的成本,意味着"拿AI盯梢"第一次便宜到可以按秒铺。36氪

第二张:32美分跑完拖了三个月的脏活。一位开发者手头积压9081条产品匹配数据,6月份用主流大模型测算过,昂贵的API费用让他直接放弃;换成Jev,一个晚上写了150行脚本,13分钟跑完,总账单0.32美元。36氪

第三张:1秒,100万token砍到8.6万。开发者Tamara Tran用Jev压缩Claude Code的上下文:不做摘要,逐条给历史工具调用打相关性分,低于阈值整条剔除,百万token级臃肿上下文1秒被精简到8.6万,整个过程模型没敲下一个字符。 注意,这是"扔掉"不是"概括"——被滤掉的细节不会以任何形式保留,这点后面既会救你的命也会坑你的命。36氪

其他被多来源交叉证实的:mobile-jev控制真实Android手机打开Uber、输入起终点、一路精准点击直到付款界面,全程9个操作步骤只用21秒,没调用过任何传统文字生成大模型。 pg-jev、duckdb-jev拿自然语言对数据库行做实时概率过滤排序。斗地主残局上,差评君本人没打过它,出了一对9就被一记王炸秒了,同局重跑6次,4次选王炸、2次选对K——概率咬得紧时它真的"犹豫"。36氪知乎

哪些是假的:打假帖和它没打倒的部分

“8分43秒速通我的世界”——假的。差评君照着开源项目复现后发现:必经路线代码里早就标好,打龙用的是固定模块,而且Jev全程274个决策里,有250个是只有一个选项的"单选题"。 用他的原话说,“看完我只觉得我被当250整了”。知乎

"AI打游戏"整体不成立。《Jev纯粹是骗局》一文的复现更直接:贪吃蛇只能跑到0.8步/秒,提到2步/秒根本来不及;超级玛丽完全不支持60fps;换成开源平替Laya、降到每游戏帧调用一次,三十多次尝试零通关,经常卡死在管道。知乎

“让它自动理财"已经出过事故:有网友宣称用Jev做了个实时交易机器人,只不过亏了31680美元。 质疑者还指出技术层面至今是笔糊涂账:创始人没有公开技术细节,流传的判断不过是"训练数据更好的BERT后面接了分类头”。 同期也有人泼冷水:路由这类判断活儿,“一个qwen0.6b都能干而且干得不错”。知乎知乎知乎

但打假帖没打倒的部分同样要说清楚:游戏不行不等于判断不行。差评君那1000多次实测操作里,有一半的决策速度在400毫秒以内。知乎

真正要记住的认知:它一半是模型,一半是你的harness

所有实测殊途同归到同一条:Jev只负责在给定选项里输出概率分布,哪些动作算一个选项、选项要不要合并、阈值定在哪,全是开发者程序说了算。 所以"接上API就变聪明"是这轮最大的误读;正确的心智模型是——你招了一个反应极快、但不会自己重新定义题目的直觉打工人,题目出得规不规范,锅在你。知乎

差评君的单兵杀戮尖塔就是反面教材:残局里它剩16血面对怪物18点伤害,手里三张防御牌却被拆成三个独立选项,各拿了17分、20分、18分,"结束回合"以21分胜出,它选择一枪不开地等死。 概率被人类的选项设计拆散——这不是模型笨,是出题方式错了。当决策成本被打到接近零,瓶颈彻底移到了工程侧的选项设计和上下文管理上。知乎

竞争格局:价格伞撑开,护城河变浅

10月7日的VCP生产实测,是目前最接近"能不能用"的答案:54题记忆精排全卷,云端Jev、clef、本地4B的Nox同为96.3%,而且错的是完全同款两道题——同一个蒸馏血统的系统性盲区。 Nox还以4B之躯拿到一半延迟、对"criteria毒药"零改造免疫。实测者顺手留下的"级联铁律"值得抄下来:二级复核必须跨血统,同家族谁也兜不住谁;最优解不是谁替代谁,而是本地模型守日常、云端复核兜盲区,落盘的犹豫样本反过来就是免费的训练标注。知乎

9月30日,OpenAI在开发者大会上发布类Jev的Decisions API补足实时决策能力,官方demo里上传1万个用户请求、比Responses API快10倍以上,第三方测试准确率比GPT 5.6-Luna略高但价格贵于Jev,首发只对部分API用户开放。 9月30日那条129赞的高赞回答其实早就点破了大厂此前按兵不动的原因:不是搞不了Jev,只是这东西利润不高,反而可能拉低API的收入。知乎知乎

到今天(10月9日)早上,B站UP主的实测显示Decisions API已经可以公开访问:它不负责开放式生成,而是在有限答案空间里返回Predicate、Choice或Score并给出概率,输入既支持文字也原生支持图片;但候选选项仍要开发者自己提供,OpenAI并没有在API层替你选模型。 大厂下场的意义是双向的:一边给"判断也值钱"这条路线盖了官方章,一边意味着Jev的先发溢价正在被快速摊平——Benchmarkheaven榜单上,第三方Jev复现版已经趋近本尊;开源平替又把本地运行的内存门槛打到1GB。 现在为"只有Jev能做到"付费的必要性,每多等一周就少一分。哔哩哔哩知乎知乎

最后是你的行动线:按人群划三条

如果你是已经在跑Agent的中深度开发者:可以现在接,但只接"只要判断、不要解释"的槽位——消息审核、记忆精排、上下文过滤、意图路由、家电触发。粗算账用上面那个单次判断价:日跑3万次判断约合0.45美元,同量级任务塞进主力大模型做摘要或分类,差的是几个数量级。先挑一个最笨的环节试(比如精排),把选项设计当一等公民对待,并记住跨血统级联那条铁律。

如果你是刚入坑vibe coding的普通玩家:别拿它打游戏、别让它碰钱包,那两类demo这轮已经全军覆没;教程可以跟着跑一遍感受延迟,但没必要现在为它单独开付费账户——等Decisions API的定价和免费额度落地再说。

如果你还没决定要不要入局:继续观察四个信号——OpenAI定价表撑多大价格伞、Jev技术报告何时兑现(BERT质疑有没有答案)、开源平替的训练数据质量、"跨血统级联"是否变成默认架构。

这三周真正的增量,不是多了一个便宜模型,而是整个行业被迫承认:你调用的大部分AI,根本不需要它"写作文"。当模型不再假装博学,账单先降一个量级,然后才轮到架构改写。下一周再看这个圈子,值得问的问题已经不是"Jev神不神",而是——你的流水线上,哪个位置只缺一个判断?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章