不会说话的AI模型Jev爆火,36小时14万开发者排队,判断速度比大模型快200倍
源自272位全网作者
03:07
精选参考来源
1
不写代码、不聊天,只会 "做判断" 的 Jev 凭什么刷屏?最近刷屏的 AI 模型 Jev,不写文章、不写代码、不能聊天 —— 它唯一的本领,是做判断。一、Jev 是谁做的Jev 出自旧金山创业公司 TypeSafe AI,2026 年9 月 15 日结束两年隐身正式亮相,同期官宣 4000 万美元种子轮(DCVC 领投,估值约 2 亿美元)。创始人是 Diogo Almeida:OpenAI 前研究员、InstructGPT 主要作者、RLHF 训练流程的核心构建者之一。他追问的问题很简单:大模型这么聪明,为什么大多数工作还没被自动化?Jev 就是他的答案。二、Jev 是什么TypeSafe 的定义:"Decisions, not strings"—— 要决策,不要文本。 官方说是「System One Model」(靠快速、直觉做判断的模型)。主流 LLM 本质是 token 生成机,一个 token 接一个 token 地 "说" 出答案,软件还得费力解析。Jev 把这条链路砍了:给它一段状态(state) + 一组类型化问题,它一次性并行返回所有答案 —— 每个答案都是结构化值,附带校准过的概率。一句话理解:拥有通用语义理解能力的 "智能 if 语句"。三、三种输出原语1、Noul(是 / 否):返回 0~1 的单一概率,无独立 confidence 字段;2、Choice(选择):从预定义选项里选一个赢家,返回选项、各项概率和 confidence;3、Score(评分):在有序量表上打分,返回分数、概率分布和 confidence,可有小数。四、工程要点(结论)1、每次外部动作后必须重建 state,决策要基于最新状态,而不是缓存;2、问题要原子化:一个判断一个问题,多个维度拆开问、在代码里组合;3、选项不完整时加 other / human 兜底,资格规则放代码里,让模型看不到不可能的动作;4、置信度是路由信号,不是正确性保证:内部标签 0.70 可直接自动处理,Agent 交接 0.80 重新评估,浏览器 / 工具动作 0.90 问人工,发布 / 支付 / 删除必须政策加人工;5、铁律:模型可以建议分支,代码决定分支能否执行 —— 绝不让概率绕过权限、预算或不可逆操作控制;6、记录完整概率分布而非只记赢家标签,执行后从外部系统验证效果。五、为什么快不生成文本 = 没有自回归解码,输出空间被提前限定,还能并行回答多个独立问题。一次调用同时问 13 个问题,比分开问 13 次快约 10 倍、便宜约 12 倍。定价:输入 0.042 美元 / 百万 token(约 0.28 元人民币),输出 token 免费;端到端延迟 70~500ms,多数约 100ms。六、RLCD:训练的是 "靠谱"Jev 的训练方法叫 RLCD(面向校准决策的强化学习):不优化 "回答讨不讨人喜欢",而是优化概率校准—— 模型说 90% 把握,一批判断里就该约 90% 是对的。校准过的概率,是企业敢让 AI 自动执行的信任基础。它宣称结构化输出 / 工具调用错误率 0%,这是结构性保证(输出被 schema 限定,不可能返回选项之外的值),但类型不错 ≠ 判断正确,它完全可能自信地选错。七、能干什么官方定位:分类、路由、评分、信息提取、业务流程分支,以及给 LLM 当裁判、护栏、越狱检测。社区实测已验证的结论:浏览器任务提速、写作质检数百次判断不到 1 秒、检索重排 Top-1 大幅提升、批量邮件 / 论文分类成本低至几美分。核心用法是 "快而准的粗筛 + 强模型精修":不确定或高风险的分支升级给更强模型。没 Key 也能先开发:官方提供 System One Adapter,套在 OpenAI/Anthropic 兼容 API 上返回同样的类型化结果,先做完系统,拿到 Key 只换接口、重放样本、重新校准阈值。八、会翻车的地方1、类型化输出不防提示词注入:网页、邮件、工具输出都是不可信数据,要先过滤再喂给 Jev;2、置信度 ≠ 准确率:高后果动作必须有弃权分支和人工审批;3、"完成" 标签不作数:验证必须看文件、页面、数据库、回执等外部结果;4、Choice 不能当多标签用:多个条件可能同时为真时,用多个独立 Noul 再在代码里组合;5、精确计算、日期运算、自由写作、不可逆执行不要交给 Jev。九、争议与意义争议在于:它是否只是 "高级分类器"?区别是不用为每个任务重新训练、保留零样本泛化,但官方没公开论文、参数规模和训练数据,无法独立验证。它的产业意义更值得关注:Agent 内部大量路由、分类、验证步骤,其实不需要一段没人读的文字。未来更现实的架构是多层分工——Frontier 模型管复杂推理,Flash 管普通推理,决策模型管高频判断,确定性部分交给代码。Code computes. LLMs create. Jev decides. Fresh state proves the result.(代码负责计算,LLM 负责创造,Jev 负责决策,新状态负责证明结果。)真正值得跟踪的,不是它快多少倍,而是能覆盖多少原本必须交给前沿 LLM 的判断—— 当一次判断便宜到一美分以下,软件会在你从没想过的地方,塞满决策。申请:typesafe.ai#HOW I AI# #程序员#
2
ChatGPT 联合发明人创办的 TypeSafe AI 正式发布了一种全新类别的 AI 模型:“System One 模型”,以及该类别下的第一个模型 Jev。和现有的大语言模型不同,Jev 完全放弃了文本生成能力,专门为软件内部的快速决策而设计:输入非结构化数据,输出带有校准概率的类型安全结构化结果。简单说:Jev 不会写文章、不会聊天,但能以极低的成本和延迟,在代码里充当一个“智能判断函数”:分类、打分、路由、提取,这些原本用规则引擎硬写但又写不好的事情,现在可以交给它。创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT 和 RLHF 的核心研发,是 ChatGPT 和 GPT-4 论文的共同作者。他在博客中描述:RLHF 让模型学会了取悦人类,却也让它们在自动化场景里不够可靠。于是他离开 OpenAI,潜行两年,用一套叫做 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)的新训练方法从头构建了 Jev。几个关键数字值得注意:响应速度 70 到 500 毫秒,比主流前沿大模型的 3 到 329 秒快了一到两个数量级。输入 Token 价格 0.042 美元/百万 Token(约 42 美元处理十亿 Token),输出 Token 免费。官方自称比同等智能水平的大模型快 20 到 200 倍,便宜 40 到 400 倍。这些数字的来源是 TypeSafe 自研的“工作流评测”(Workflow Evals),用 GPT-6 Astra 和 Anthropic 的 Fable 5.1 的平均结果作为参考答案。他们也承认,这种评测方式本身偏向 OpenAI 和 Anthropic 的模型,Jev 的实际相对表现可能被低估,但极端加速倍数(如 193 倍、444 倍)属于最优情况,不代表所有场景。速度为什么能这么快?因为架构上根本不同。大模型逐个生成 Token,前一个 Token 出来后才能算下一个。Jev 采用并行采样,所有输出一次算完。这和当年 Transformer 取代 RNN 是同一个思路:用并行取代串行。代价也很明确:Jev 不能生成文本。它输出的是事先定义好结构的决策结果,每个回答都附带置信度分数。官方宣称类型错误率从数学上等于零(因为输出结构在架构层面就被约束了),幻觉问题也因此不存在。对开发者来说,Jev 的定位不替代 ChatGPT 或 Claude 这类对话模型,主要是为了补上它们不擅长的那一环:当你需要在代码流程中嵌入一个 AI 判断节点,要求毫秒级响应、结构化输出、不能出格的时候,用大模型做这件事成本高、速度慢、还可能生成不可预期的内容。Jev 就是为这个场景设计的。TypeSafe 把这类任务叫做“智能 if 语句”,也就是用 AI 做原本 if-else 写不好的模糊判断。他们还做了两个有趣的演示:一个是用 Jev 实时操控经典游戏 DOOM 的 AI 机器人,每秒调用约 10 次,成本大约每小时 7 美元;另一个是 Wikipedia 竞速(从一个词条通过链接跳转到另一个指定词条),需要在成百上千个链接中做选择,Jev 在步数和速度上都领先于大模型的非推理模式。“System One”这个名字来自 Daniel Kahneman 的《思考,快与慢》中的“系统一”——快速、直觉、自动化的思维方式。“Jev”则取自经济学中的杰文斯悖论(Jevons Paradox):当某种资源的使用效率大幅提高时,总需求反而会增长。TypeSafe 显然在押注:把 AI 决策的成本降到足够低,用量会爆发式增长。从博客和文档里提到的信息来看,Jev 的应用场景集中在一个核心逻辑上:凡是你在代码里需要一个“聪明的判断”,但又不需要它写一段话给人看的地方,都是它的地盘。具体来说有几类:第一类是流程中的智能分支。比如客服系统里判断一张工单应该转给哪个团队、紧急程度多高、用户情绪如何——这些原本要么靠关键词规则(太死板),要么靠大模型(太慢太贵)。Jev 可以在几十毫秒内给出带置信度的判断,而且输出格式固定,代码直接用。第二类是大规模数据处理。比如对海量文档做分类、打标签、提取结构化字段。大模型做这件事单条成本还行,但量一上去就很贵,而且速度是瓶颈。Jev 42 美元处理十亿 Token,输出还免费,适合需要跑几百万甚至上亿条数据的场景。第三类是实时应用。100 毫秒级别的响应意味着可以用在用户体感得到延迟的地方——实时推荐、动态定价、游戏 AI、交互式产品里的智能判断。博客里那个 DOOM 演示就是这个意思:每秒调用 10 次,大模型根本做不到。第四类比较有意思——给大模型当“质检员”。用 Jev 来检查大模型的输出是否安全、是否符合格式、有没有越狱,做 guardrail(安全护栏)。因为 Jev 本身不会幻觉、响应极快,很适合在大模型输出之后加一层校验。总结一下就是:Jev 不是给终端用户用的产品,是给开发者在系统架构里嵌入的组件。它解决的问题是“我需要 AI 的判断力,但不需要它的表达力”。Jev 目前以早期访问形式开放,开发者可以在 typesafe.ai 加入候补名单。 宝玉xp的微博视频
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹