这几天刷AI新闻的人,大概率都躲不开一个三个字母的词:Jev。
一个不会聊天、不会写代码、连一句完整的话都不输出的AI模型,9月15日发布,几天之内在X上收割3700万围观,Hacker News那条发布帖拿了1920分、504条评论,官方接口一度被挤到宕机。36氪知乎
知乎和B站的教程一夜之间铺满屏幕,“保姆级教程”“国内首测”“10个神奇玩法”,标题一个比一个急,好像今晚不学,明天就要被甩下车。哔哩哔哩
但先别急着打开教程。我把官方发布文、机器之心的报道、知乎的正反方长文和B站的实测视频都翻了一遍,这件事比"新模型刷屏"有意思得多,也比大多数速成教程说的复杂得多。这篇文章帮你把真数、宣传口径和反方证据拆开,再决定要不要花时间。
一、它到底是什么:一个被故意拿掉嘴的模型
一句话:Jev是一个只做判断、不写字的模型。你给它一段材料,再给它一张你已经写好选项的问卷,它不写一个字,只在你的选项里勾一个,顺手告诉你它有几成把握。
做它的公司叫TypeSafe AI,潜行了两年,带着4000万美元种子轮一起亮相。知乎
创始人Diogo Almeida是前OpenAI研究员,GPT-4、ChatGPT和InstructGPT/RLHF的共同作者——说白了,就是当年教会ChatGPT像人一样说话的那套训练方法的共建者之一。他现在的个人简介只有一句,大意是:我在OpenAI参与造出了ChatGPT,现在正试着把这个错纠回来。知乎
Jev目前只会三种题:是非题(返回概率)、选择题(最多255个选项)、打分题(2到10档)。速度70到500毫秒出结果,每次判断约0.0004美元,格式出错率为0%——注意,这个0%是结构保证,不是实测出来的。知乎
看不懂技术细节没关系,记一个类比就行:ChatGPT是请了一个能说会道的顾问,你问它"这封邮件是不是销售线索",它先给你写一段"综合来看",你还得写正则去把那个"是"抠出来;Jev是把这套流程砍掉,直接回你一个数字:销售线索0.91,需要人工介入0.12,技术问题0.83。程序拿到数字就能走下一步。
二、为什么疯的是Agent开发者
真正为它疯狂的,不是普通用户,是把AI接到业务里的开发者。因为今天的AI Agent,本质上是在循环做几十上百步的小决定:该点哪个按钮、该调用哪个工具、这条信息还相不相关、任务到底做完没有。36氪
几个已经跑通的真实案例,能看出它火得有没有道理。
有开发者用Jev分析了37个品牌的724条实时广告,对钩子、形式、报价、行动号召、认知阶段做分类,总共8724次判断,大约40秒跑完,token成本约9美分,单条广告中位处理时间约216毫秒。36氪
有人做了个Claude Code插件fast-jev-compaction,把大量工具调用和终端输出交给Jev打分,判断哪些内容还和当前任务相关,再据此压缩上下文——项目上线后迅速获得大量关注,还出现了多个移植版本。36氪
浏览器Agent这边,已经有开源项目采用"读页面—生成候选动作—Jev选动作—执行"的循环,一个公开的航班搜索Demo全程约7秒、成本约0.004美元。
LangChain在9月20日发布了Jev-as-a-Judge实验,让它和GPT-5.6 Luna、GPT-5.6 Terra、Claude Sonnet 4.6对固定的Agent输出反复评分。这组小规模实验里,Jev平均每次调用约0.44秒、成本约0.00035美元,连续评分的一致性表现突出——当然LangChain自己也强调,这是早期小规模测试,还要看真实生产任务。36氪
看懂这些案例,你就看懂了它火的逻辑:当判断每天要发生几十万次、几百万次时,延迟和成本就成了系统设计的一部分。用几千亿参数的大模型做判断题,等于让教授去批小学口算,又慢又贵。
三、先泼冷水:三个真数,两个宣传口径
刷屏归刷屏,掏钱之前(或者说花时间学之前),有几个数字必须自己看一遍。
第一个真数:准确率67.8%,低于Opus 5的73.1%。这是官方评测页自己的数字。也就是说,它不是"更聪明的模型",单论判断准确率,它暂时还不如最强的大模型。它赢的是速度和价格,不是对错。知乎
第二个真数:"零幻觉"说的是格式,不是对错。Jev不会输出一段胡编的答案,这叫格式零幻觉;但它完全可能把判断本身做错,而且不给任何理由——它不会解释,不会算数,不会数数,不能从原文里摘句子,不看图不听声。中文能处理,但官方自己承认不如英语,且没有公开成绩。知乎
第三个真数:TypeSafe宣称的"最高193.6倍速度提升、444.6倍成本优势",来自他们自己模型能力团队制作的测试集,且官方说明这处于预计实际收益的高端区间。参考可以,当结论不行。36氪
两个宣传口径也要拆开:一是"参与造出ChatGPT的研究员转身做新模型"这个故事本身,就是最强的传播素材,OpenAI的Tibo也在为它宣传,热度里有相当一部分是叙事红利;二是B站已经出现了"案例一半是假的"这样的质疑视频,社区案例库里的实验数据大多来自开发者自述,没有第三方复核。36氪哔哩哔哩
四、反方不是没有道理:这条路其实绕了一圈
知乎上有篇长文把Jev的"前世今生"捋了一遍,观点很值得看:这条路线并不新。BERT时代就有zero-shot分类器——给它一段话,它直接回"退款/投诉/咨询/物流"加概率;搜索系统里的Reranker,也是只打分不写答案。大模型出现后,这些专用判断模型一度不显眼了,如今Jev等于带着大模型时代的语义理解、结构化输出和概率校准,把判别模型这条老路线重新带回牌桌。知乎
这个判断有两个直接证据。
第一,可复制性太强。Jev发布后,Bespoke Labs的CEO在9月17日发帖问要不要做个开源版,第二天开源版Nimble就放出来了,说明文档里自己写的是"一天做完"。一个一天就能被复现的零件,护城河需要打个问号。国内APUS的AI实验室也公布了最早一批独立开源复现,号称跨平台、秒级决策。知乎知乎
第二,有人直接下了赌约。知乎上那篇流传很广的《新模型Jev火爆全网,但是我劝你先别学》说得直白:普通人现在不用学Jev,学了也没用,“我赌一个月以后,它会被其他AI大模型吃掉”。逻辑是:如果它真能在长任务里降本提速,所有大模型公司都会尽快把这个能力内置进自家产品——它火的那一刻,等于给全行业发了一份需求文档。知乎
五、比模型更值得看的,是创始人的那个判断
抛开产品本身,TypeSafe这个团队对行业的判断,可能是这件事里更耐看的部分。
Diogo Almeida在AI Engineer峰会上有个杀伤力很强的开场:他是OpenAI内部极少数公开"开黑"ChatGPT的人。知乎
他的核心论点是:当今大模型攻克了人类未解决的高等数学难题,但一家普通企业的客服系统,依然死死依赖人在回路才敢做最基础的决策——客服明明比数学题简单,AI却做不好。原因不是算法bug,而是设计:RLHF的训练回路里本来就塞着人,整个范式优化的是"取悦回路里的人",从来不是让软件自主运行。所以大模型的过度承诺和迎合是被刻意设计出来的特性。知乎
他的结论:RLHF不是通向AGI的康庄大道,更像一次始料未及的弯路,下一个时代属于真正的自主自动化。知乎
你未必同意这个判断,但它是理解Jev的钥匙:为什么一个模型要主动放弃"说话"这个大模型最招牌的能力?因为在Almeida看来,"会说话"本身就是助理时代的产物,而他要做的,是给自主运行的软件装上能自己做决定的零件。
六、名字里的彩蛋,才是对你我的真正影响
Jev这个名字是两层的:System One来自卡尼曼《思考,快与慢》里的系统1——快速、直觉式的判断;Jev则来自经济学家杰文斯,对应"杰文斯悖论":当一种资源的使用效率大幅提高,它的总消耗量反而会暴涨。36氪
放在AI上,这个彩蛋的含义非常实在:当一次智能判断的价格从几美分降到万分之四美元,开发者会开始在以前根本舍不得调模型的地方塞进AI——一条日志要不要重视、一封邮件归哪类、一个Agent步骤该不该继续、一个网页按钮该不该点。这些微小判断叠加起来,可能是下一代软件里最大的AI调用量。
对你我的影响分三层:你付的订阅费里,有相当比例的token其实花在了这类判断题上,判断变便宜,Agent产品才可能又快又便宜;你用的每个软件里,藏着的"智能if语句"会越来越多;以及,判断便宜到一定程度后,"AI功能"和"软件功能"的边界会消失——不再是侧边栏挂个聊天窗,而是流程里每一步都悄悄有了判断。
七、分人群说结论:谁该动,谁该等
普通用户:不用学,也不用焦虑。Jev连页面都没有,它是个零件不是产品,你没有任何需要直接操作它的场景。看到"再不学就晚了"的标题,可以直接划走。真正值得等的是结果:半年内你常用的AI工具变快变便宜,就说明这类判断模型起了作用。
开发者和做AI产品的人:值得花半天试试early access,尤其是Agent流程里有高频判断环节的。两个注意点:中文场景先自己测(官方承认中文弱且无公开成绩);关键决策别只看概率,它不给理由,出问题没法排查,适合做路由和初筛,不适合做终审。
关注行业的人:盯三个信号就够了。一是准确率能不能追上来——67.8%到75%以上,它就能吃掉更多场景;二是大厂是否跟进——OpenAI、Anthropic、谷歌谁先在自家API里内置判断原语,谁就宣布这个市场归自己;三是复现生态的走向——Nimble、APUS这些开源版如果跑出稳定的生产案例,TypeSafe的溢价空间就会被快速挤压。这三个信号任何一个落地,都比今天的3700万围观更有信息量。
一句话收尾:Jev本身可能一个月后就被大模型吸收,但它指出的那道缝是真的——软件世界里最多的活,不是写文章,是做判断。谁先把判断的成本打下来,谁就摸到了AI从"聊天气"走向"干实事"的门把手。