“哑巴AI”Jev刷屏:打通关《毁灭战士》、0.7秒做完777个判断,却在自家评测表里准确率只排第五、被网友两小时复现——排waitlist前,先看清三盆冷水和一条今天就能用的结论

源自192位全网作者

09-19 00:47

今天打开任何一个平台,你大概都躲不开一个名字:Jev。

这个一句话都不会说的AI,流畅玩起了《毁灭战士》,击败了《泰拉瑞亚》大师模式肉山前的全部Boss,还同时开着50局《地铁跑酷》——总成本不到一分钱。发布推文冲上数千万浏览量,B站一天之内冒出二十多条解读视频,最火的入门教程播放超过8000、点赞319。微博上有人分享排队攻略,小红书上有人喊"神乎其神",也有人泼冷水"并没有什么卵用"。微博

“哑巴AI”Jev刷屏:打通关《毁灭战士》、0.7秒做完777个判断,却在自家评测表里准确率只排第五、被网友两小时复现——排waitlist前,先看清三盆冷水和一条今天就能用的结论

更戏剧的是做它的人:Diogo Almeida,InstructGPT论文的共同作者之一。当年教会ChatGPT"说人话"的人,隐身两年后,端出来一个彻底不说话的模型。

赶去排waitlist之前,我把官方评测表、外部实测和两轮最大的争议都翻了一遍。先说结论:方向是真的,数字大半是营销,普通聊天用户完全不用排队——但那张公开评测表里,藏着一条你今天在任何AI上都能用的省钱技巧。

Jev到底是个啥:只会做选择题的AI

Jev由TypeSafe AI在9月15日发布,官方叫它第一个"System One模型"。看过《思考,快与慢》的会秒懂:系统一是直觉,不过脑子就出答案;系统二是深思熟虑,一步步推理。市面上的GPT-6、Claude、Gemini都是系统二路线——Jev只做系统一。哔哩哔哩

具体来说,它不生成任何自由文本。你不能跟它聊天,不能让它写文章、写代码,甚至不能问它"1+1等于几"——因为回答需要写字。它只干一件事:你提前定好选项,它读完输入后直接返回带概率的判断。

比如客服系统收到一封愤怒的邮件。大模型会分析情绪、解释原因、洋洋洒洒一段话,最后告诉你"该转给账单部门";Jev则一个字都不写,直接从"账单、技术、售后"三个预设选项里返回选择,还给判断附上概率。官方数据:端到端响应70到500毫秒,每秒能做约10次决策;输入价每百万token 0.042美元,输出干脆免费。知乎

“哑巴AI”Jev刷屏:打通关《毁灭战士》、0.7秒做完777个判断,却在自家评测表里准确率只排第五、被网友两小时复现——排waitlist前,先看清三盆冷水和一条今天就能用的结论

为什么快?普通大模型一个字一个字往外蹦,每个字都依赖前一个字;Jev根本不需要"写"答案,所有选项并行算完。官方的概括是"非结构化状态进去,带概率的判断出来"。Almeida的出发点很扎心:很多软件找大模型帮忙时,压根没打算跟它聊天——系统只想知道"这封邮件归谁管",不需要八百字的分析。

热度是真的高。Every的评测负责人Mike Taylor拿Jev检查了37篇文档,一口气完成777次独立判断,总耗时不到0.7秒;其中一个写作质量判断任务,Jev用了约0.35秒,Fable 5.1用了8.83秒,快了约25倍、便宜了约580倍。拥有38万粉丝的开发者博主ThePrimeagen表示想马上把它接进自己的服务器自动化工具;Dan Shipper团队测了大约一周,预测再过6到12个月,人们会觉得这东西不可或缺。知乎

第一盆冷水:官方评测表里,它自己只排第五

Jev的首页用巨字喊着"快193倍、便宜444倍"。但TypeSafe干了一件少见的事:把完整评测数据公开挂在官网上,还专门写了一页自曝毛病——评测在自家笔记本上跑的、不能证明定价里没有补贴、评测由自家团队做可能有偏见,头一句就是"并不完美"。哔哩哔哩

那张评测表说明了三件事。

第一,193.6倍速度、444.6倍成本,是内部workflow评测的高位数字,官方自己承认"可能已经接近现实工作流收益的高位"。知乎

“哑巴AI”Jev刷屏:打通关《毁灭战士》、0.7秒做完777个判断,却在自家评测表里准确率只排第五、被网友两小时复现——排waitlist前,先看清三盆冷水和一条今天就能用的结论

第二,准确率那一栏,Jev排第五,最准的前两名都是别人家的旗舰模型。公开对比里Jev准确率67.8%,对照模型74.1%——它便宜、它快,但它不更准。小红书

“哑巴AI”Jev刷屏:打通关《毁灭战士》、0.7秒做完777个判断,却在自家评测表里准确率只排第五、被网友两小时复现——排waitlist前,先看清三盆冷水和一条今天就能用的结论

第三,刷屏的"0%幻觉"是个文字游戏。官方指的是schema保证:答案一定落在你预设的选项里,永远不会临时编出第四种分类。这对自动化系统确实是大事——传统大模型哪怕被要求按固定格式回答,也可能突然回一个选项里不存在的"严重投诉",让下游程序当场宕机。但"答案不出格"不等于"判断永远对",67.8%就摆在那儿。哔哩哔哩

一句话:那两个倍数是真的,只是讲的是速度和价格,不是谁更聪明。

第二盆冷水:隐身两年的成果,被网友两小时复现

发布不到一天,开发者Harsha Gundala就开源了一个基于Qwen2.5-1B的相似实现,说法相当挑衅:"他们隐身开发了两年,我隐身开发了两个小时……"原理并不玄乎:既然JSON的字段名和候选集都是预先定死的,就不必让模型逐token"写"出来,把它们改造成一批共享同一段上下文的选择题并行跑就行——本质是推理工程的优化(并行约束解码)。他在M4 MacBook上实测确实有几倍速度提升,输出同样带概率。知乎

Hugging Face研究员Niels Rogge的吐槽传得更广:“一个JSON分类器竟然有1200万次浏览?是啊,我们正处于泡沫中。”知乎

国内用户还补了一刀。小红书有人算账:Qwen3.7-flash输入价每百万token 0.03美元,比Jev还便宜三成,而且能顺手把标题、摘要、翻译都写了——Jev一个字都写不出来,同一篇文章还得再喂一遍别的模型。微博上还有个更损的段子:把所有可能的选项都输入给Jev,问它自己是什么模型,它的回答60%是Qwen。小红书微博

第三盆冷水:你想让AI干的事,它一件都干不了

别忘了,Jev不会生成文本。聊天陪写?不行。写周报?不行。写代码?不行。做PPT?更不行。那些刷屏的打《毁灭战士》、玩《地铁跑酷》的视频,本质都是同一件事:在每一帧里从"往哪走、开不开枪、跳不跳"里做选择——选项集合固定,恰好是它的完美场景。

所以对绝大多数刷到这篇文章的人,Jev没有直接用处。它瞄准的是另一批人:写Agent的、做自动化的、被token账单折磨的。

那到底谁该去排waitlist?

Agent和自动化开发者:值得排,但别神化。 Jev真正的卖点不是"快和便宜",而是校准置信度:你可以设定规则——置信度超过90%直接执行,70%到90%之间摇一个更大的模型来复核,连70%都不到就交给真人。这相当于给程序插进一个"有自知之明的模糊if语句"。B站已经有人做了国内首测:通过AgentOS接入,在真实电商页面上连续操作,结论是速度和官方价格有吸引力,但成功率仍不稳定,“分工、观察、执行和验证架构完善后,这条路线才可以进入生产”。建议先在高频、选项固定的小判断场景试水(工单路由、内容过滤、风控初筛),创意类任务别碰。知乎哔哩哔哩

“哑巴AI”Jev刷屏:打通关《毁灭战士》、0.7秒做完777个判断,却在自家评测表里准确率只排第五、被网友两小时复现——排waitlist前,先看清三盆冷水和一条今天就能用的结论

编程工具重度用户(Codex、Claude Code党):关注路线,别急着换产品。 微博有用户称Jev能让Codex操作速度提高10倍、省下大量token。单一说法先存个疑,但方向是真的:编程流程里大量重复的小判断(改哪个文件、跑哪个测试、这步要不要放行),本来就不需要旗舰模型每次都深度思考。快慢双系统早晚成为每个Agent的标配,你要盯的是自己常用的工具什么时候跟进,而不是现在换工具。<#&!53#&!>微博

普通聊天用户:不用动,等它被吸收。 你未来用到的不会是Jev本身,而是各大模型厂商把这个"判断层"吸收成功能之后的结构化输出。小红书已经有人开始押注"等国内第一批System One公司",Qwen、豆包、Kimi们会不会出类似的判断型API、什么价格,比Jev本身更值得等。小红书

被订阅费和token消耗折磨的人:拿走今天就能用的那一条。 那张官方评测表里其实藏着一条对所有模型都成立的结论:四类任务平均下来,不管哪家的模型,把规则拆成几个小选择题分别问,都比把同样的规则写成一大段提示词更准、更便宜、也更快。这不需要任何新工具,今天在任何AI聊天框里就能做:下次让AI批量判断东西(比如"读这20条评论,每条只从正面/负面/中性里选一个,并给出把握程度"),把大问题拆成带选项的小问题,自己感受一下差别。哔哩哔哩

接下来盯什么

三个信号,比热度更值得追:

  1. 补贴结束后的价格。 官方自己承认"不能证明定价里没有补贴",0.042美元/百万token未必是长期价,盯它什么时候涨、涨多少。

  2. 准确率和flash档的差距。 目前公开数字是67.8%对74.1%落后。如果RLCD训练追不平这个差距,"便宜快"的故事在0.03美元的Qwen-flash面前讲不下去。

  3. 大厂跟进的速度。 并行约束解码、带置信度的结构化输出,都不是护城河,两小时复现已经证明了这一点。Jev的窗口期,可能远短于Dan Shipper预测的6到12个月。

最后说一句:Jev值得围观,因为它把"AI的判断力"第一次当成独立商品摆上了货架;但不值得急着为它花钱,因为在它自己公布的评测表里,它都没敢把自己排成最聪明的那个。抢购潮里最诚实的数据,往往是官方自己不得不公布的那一张——这次,TypeSafe恰好是这么家公司。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章