193倍快、444倍便宜:这个AI一个字都不写
9月15日前后,硅谷开发者圈被一个叫 Jev 的模型刷屏。它不会写文章、不会聊天、不写代码,一个字都不生成。
发布当天它长时间挂在 Hacker News 前列,创始人那条发布帖被翻到约 420 万次浏览、近 2 万次点赞。英文社区给它的定义很直白:Decisions, not strings。
一个"不说话"的模型,为什么能让见过大模型爆发的人集体围观?

它把"说话"这一步删掉了
一句话说清,Jev 像一个懂语义的 if 语句:给它一段信息和几个写死的选项,它回选择、分数和概率。
传统做法是另一套。电商 Agent 打开网页,把页面状态交给模型,模型一个 token 一个 token 生成"我应该点击右下角的 Checkout 按钮",软件再从这句话里把 Checkout 抠出来。
可软件真正需要的信息,可能只是"第三个按钮"。
Jev 把这一步省了。开发者预先规定 refund_risk={低,中,高},模型只返回"高风险 75%",不再生成那句解释。官方公开的输出有三类:Choice 在多选项里选一个,Score 给等级或连续打分,Noul 处理是或否并附概率。
拆开看,差别在输出空间。生成式模型是自回归解码,输出越长,解码步骤越多;Jev 把答案裁到几个选项,还宣称用 parallel sampler 在同一个查询里同时回答多个独立问题,比如一次判断发票类型、异常风险与是否需人工复核。官方演示里,同样一次判断它 0.114 秒,对照的生成式模型 8.566 秒。
放到风控场景里更清楚:模型返回"高风险 75%",后面的普通代码按阈值决定是否送人工复核,这一整段不需要模型写一句话。
Agent 里大部分调用,本来就不需要"写作"
一个复杂 Agent 跑完一件事,内部可能发生几十甚至几百次模型调用。真正需要规划、写代码、长文本的只占少数,剩下多是路由、分类、校验、状态判断。
这些活原本都交给同一个大模型,它不仅要看懂,还得生成一段没人读的文字。
Jev 打的就是这块成本。官方给出输入每百万 token 0.042 美元,输出不按 token 收费,单个 case 约 0.0004 美元、约 0.4 秒;最快与最便宜的极值口径是 193.6 倍和 444.6 倍。
它和 Gemini Flash、DeepSeek Flash 那条路线也不同:Flash 是让每个 token 更便宜,Jev 是不生成 token。
创始人 Diogo Almeida 是前 OpenAI 研究员、InstructGPT 论文主要作者之一,参与过 RLHF 流程。他离开后一直在问:模型已经这么聪明,为什么大多数工作还没被自动化。
三个最容易看错的地方
第一个是官网那句"Zero Hallucinations"。不少人直接读成它不瞎说,这话有它的道理:它确实不会输出选项之外的东西,官方称工具调用类型错误率为 0%,这对自动调 API、改数据库的生产系统有价值。但它解释不了判断层面的错:输入明明是一只猫,它回"狗 97%",类型没越界,结论全错。更准确的理解是,零幻觉约束的是输出格式与类型,不是事实与判断本身。
第二个是那组"193 倍、444 倍"。数字来自 TypeSafe 自己设计的 workflow 评测,比的是分类、选择、评分这类它最擅长的任务,两个极值取的是四类工作流里的最大差距;官方也承认测试任务由自家团队设计,部分参考答案由强模型生成。同一批测试里,Jev 平均约 67.8%,前沿模型在 68% 到 74% 之间。它同样没和 Flash 模型加结构化输出、传统分类器同台比过。能说明的只有一件事:当任务最终只需要一个选择或一个概率时,专门做判断的模型有机会便宜很多。
第三个是"这不就是把分类器重新包装一遍"。形式上,它输出的东西传统分类器也能给。差别在于,传统分类器每加一类任务,往往要重新标注数据、重新训练;Jev 想保住大模型的通用语义理解和零样本泛化,只把输出压成软件要的形状。团队还提出 RLCD,一种面向校准决策的强化学习,目标很具体:模型说 90% 有把握时,其中大约 90% 应该是对的。没定论的是这套方法能否被独立验证:完整论文没公开,参数规模、训练数据、消融实验都缺,社区的开源版本也在跟进同一方向。
你要不要现在就跟
判断标准不复杂,三个问题:这一步的输出空间能不能穷举?答错了有没有阈值或人工兜底?那串置信度校准验证过没有?
前两个答不上来,就先别把决策交给它。校准没验证之前,模型说的 99% 不能当 99% 用,它只能算一声提示音。
开放式写作、复杂规划、需要给出推理理由的长链条任务,也不在它的射程里。
你手上那条流程里,有多少步其实只需要一个是或否?
如果觉得今天这篇有启发,点个在看,顺手转发给需要的朋友;想第一时间收到推送,可以星标我⭐。
关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
