不会说话的AI模型Jev爆火,36小时14万开发者排队,判断速度比大模型快200倍

源自272位全网作者

03:07

精选参考来源

1
不写代码、不聊天,只会 "做判断" 的 Jev 凭什么刷屏?最近刷屏的 AI 模型 Jev,不写文章、不写代码、不能聊天 —— 它唯一的本领,是做判断。一、Jev 是谁做的Jev 出自旧金山创业公司 TypeSafe AI,2026 年9 月 15 日结束两年隐身正式亮相,同期官宣 4000 万美元种子轮(DCVC 领投,估值约 2 亿美元)。创始人是 Diogo Almeida:OpenAI 前研究员、InstructGPT 主要作者、RLHF 训练流程的核心构建者之一。他追问的问题很简单:大模型这么聪明,为什么大多数工作还没被自动化?Jev 就是他的答案。二、Jev 是什么TypeSafe 的定义:"Decisions, not strings"—— 要决策,不要文本。 官方说是「System One Model」(靠快速、直觉做判断的模型)。主流 LLM 本质是 token 生成机,一个 token 接一个 token 地 "说" 出答案,软件还得费力解析。Jev 把这条链路砍了:给它一段状态(state) + 一组类型化问题,它一次性并行返回所有答案 —— 每个答案都是结构化值,附带校准过的概率。一句话理解:拥有通用语义理解能力的 "智能 if 语句"。三、三种输出原语1、Noul(是 / 否):返回 0~1 的单一概率,无独立 confidence 字段;2、Choice(选择):从预定义选项里选一个赢家,返回选项、各项概率和 confidence;3、Score(评分):在有序量表上打分,返回分数、概率分布和 confidence,可有小数。四、工程要点(结论)1、每次外部动作后必须重建 state,决策要基于最新状态,而不是缓存;2、问题要原子化:一个判断一个问题,多个维度拆开问、在代码里组合;3、选项不完整时加 other / human 兜底,资格规则放代码里,让模型看不到不可能的动作;4、置信度是路由信号,不是正确性保证:内部标签 0.70 可直接自动处理,Agent 交接 0.80 重新评估,浏览器 / 工具动作 0.90 问人工,发布 / 支付 / 删除必须政策加人工;5、铁律:模型可以建议分支,代码决定分支能否执行 —— 绝不让概率绕过权限、预算或不可逆操作控制;6、记录完整概率分布而非只记赢家标签,执行后从外部系统验证效果。五、为什么快不生成文本 = 没有自回归解码,输出空间被提前限定,还能并行回答多个独立问题。一次调用同时问 13 个问题,比分开问 13 次快约 10 倍、便宜约 12 倍。定价:输入 0.042 美元 / 百万 token(约 0.28 元人民币),输出 token 免费;端到端延迟 70~500ms,多数约 100ms。六、RLCD:训练的是 "靠谱"Jev 的训练方法叫 RLCD(面向校准决策的强化学习):不优化 "回答讨不讨人喜欢",而是优化概率校准—— 模型说 90% 把握,一批判断里就该约 90% 是对的。校准过的概率,是企业敢让 AI 自动执行的信任基础。它宣称结构化输出 / 工具调用错误率 0%,这是结构性保证(输出被 schema 限定,不可能返回选项之外的值),但类型不错 ≠ 判断正确,它完全可能自信地选错。七、能干什么官方定位:分类、路由、评分、信息提取、业务流程分支,以及给 LLM 当裁判、护栏、越狱检测。社区实测已验证的结论:浏览器任务提速、写作质检数百次判断不到 1 秒、检索重排 Top-1 大幅提升、批量邮件 / 论文分类成本低至几美分。核心用法是 "快而准的粗筛 + 强模型精修":不确定或高风险的分支升级给更强模型。没 Key 也能先开发:官方提供 System One Adapter,套在 OpenAI/Anthropic 兼容 API 上返回同样的类型化结果,先做完系统,拿到 Key 只换接口、重放样本、重新校准阈值。八、会翻车的地方1、类型化输出不防提示词注入:网页、邮件、工具输出都是不可信数据,要先过滤再喂给 Jev;2、置信度 ≠ 准确率:高后果动作必须有弃权分支和人工审批;3、"完成" 标签不作数:验证必须看文件、页面、数据库、回执等外部结果;4、Choice 不能当多标签用:多个条件可能同时为真时,用多个独立 Noul 再在代码里组合;5、精确计算、日期运算、自由写作、不可逆执行不要交给 Jev。九、争议与意义争议在于:它是否只是 "高级分类器"?区别是不用为每个任务重新训练、保留零样本泛化,但官方没公开论文、参数规模和训练数据,无法独立验证。它的产业意义更值得关注:Agent 内部大量路由、分类、验证步骤,其实不需要一段没人读的文字。未来更现实的架构是多层分工——Frontier 模型管复杂推理,Flash 管普通推理,决策模型管高频判断,确定性部分交给代码。Code computes. LLMs create. Jev decides. Fresh state proves the result.(代码负责计算,LLM 负责创造,Jev 负责决策,新状态负责证明结果。)真正值得跟踪的,不是它快多少倍,而是能覆盖多少原本必须交给前沿 LLM 的判断—— 当一次判断便宜到一美分以下,软件会在你从没想过的地方,塞满决策。申请:typesafe.ai#HOW I AI# #程序员#
2
ChatGPT 联合发明人创办的 TypeSafe AI 正式发布了一种全新类别的 AI 模型:“System One 模型”,以及该类别下的第一个模型 Jev。和现有的大语言模型不同,Jev 完全放弃了文本生成能力,专门为软件内部的快速决策而设计:输入非结构化数据,输出带有校准概率的类型安全结构化结果。简单说:Jev 不会写文章、不会聊天,但能以极低的成本和延迟,在代码里充当一个“智能判断函数”:分类、打分、路由、提取,这些原本用规则引擎硬写但又写不好的事情,现在可以交给它。创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT 和 RLHF 的核心研发,是 ChatGPT 和 GPT-4 论文的共同作者。他在博客中描述:RLHF 让模型学会了取悦人类,却也让它们在自动化场景里不够可靠。于是他离开 OpenAI,潜行两年,用一套叫做 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)的新训练方法从头构建了 Jev。几个关键数字值得注意:响应速度 70 到 500 毫秒,比主流前沿大模型的 3 到 329 秒快了一到两个数量级。输入 Token 价格 0.042 美元/百万 Token(约 42 美元处理十亿 Token),输出 Token 免费。官方自称比同等智能水平的大模型快 20 到 200 倍,便宜 40 到 400 倍。这些数字的来源是 TypeSafe 自研的“工作流评测”(Workflow Evals),用 GPT-6 Astra 和 Anthropic 的 Fable 5.1 的平均结果作为参考答案。他们也承认,这种评测方式本身偏向 OpenAI 和 Anthropic 的模型,Jev 的实际相对表现可能被低估,但极端加速倍数(如 193 倍、444 倍)属于最优情况,不代表所有场景。速度为什么能这么快?因为架构上根本不同。大模型逐个生成 Token,前一个 Token 出来后才能算下一个。Jev 采用并行采样,所有输出一次算完。这和当年 Transformer 取代 RNN 是同一个思路:用并行取代串行。代价也很明确:Jev 不能生成文本。它输出的是事先定义好结构的决策结果,每个回答都附带置信度分数。官方宣称类型错误率从数学上等于零(因为输出结构在架构层面就被约束了),幻觉问题也因此不存在。对开发者来说,Jev 的定位不替代 ChatGPT 或 Claude 这类对话模型,主要是为了补上它们不擅长的那一环:当你需要在代码流程中嵌入一个 AI 判断节点,要求毫秒级响应、结构化输出、不能出格的时候,用大模型做这件事成本高、速度慢、还可能生成不可预期的内容。Jev 就是为这个场景设计的。TypeSafe 把这类任务叫做“智能 if 语句”,也就是用 AI 做原本 if-else 写不好的模糊判断。他们还做了两个有趣的演示:一个是用 Jev 实时操控经典游戏 DOOM 的 AI 机器人,每秒调用约 10 次,成本大约每小时 7 美元;另一个是 Wikipedia 竞速(从一个词条通过链接跳转到另一个指定词条),需要在成百上千个链接中做选择,Jev 在步数和速度上都领先于大模型的非推理模式。“System One”这个名字来自 Daniel Kahneman 的《思考,快与慢》中的“系统一”——快速、直觉、自动化的思维方式。“Jev”则取自经济学中的杰文斯悖论(Jevons Paradox):当某种资源的使用效率大幅提高时,总需求反而会增长。TypeSafe 显然在押注:把 AI 决策的成本降到足够低,用量会爆发式增长。从博客和文档里提到的信息来看,Jev 的应用场景集中在一个核心逻辑上:凡是你在代码里需要一个“聪明的判断”,但又不需要它写一段话给人看的地方,都是它的地盘。具体来说有几类:第一类是流程中的智能分支。比如客服系统里判断一张工单应该转给哪个团队、紧急程度多高、用户情绪如何——这些原本要么靠关键词规则(太死板),要么靠大模型(太慢太贵)。Jev 可以在几十毫秒内给出带置信度的判断,而且输出格式固定,代码直接用。第二类是大规模数据处理。比如对海量文档做分类、打标签、提取结构化字段。大模型做这件事单条成本还行,但量一上去就很贵,而且速度是瓶颈。Jev 42 美元处理十亿 Token,输出还免费,适合需要跑几百万甚至上亿条数据的场景。第三类是实时应用。100 毫秒级别的响应意味着可以用在用户体感得到延迟的地方——实时推荐、动态定价、游戏 AI、交互式产品里的智能判断。博客里那个 DOOM 演示就是这个意思:每秒调用 10 次,大模型根本做不到。第四类比较有意思——给大模型当“质检员”。用 Jev 来检查大模型的输出是否安全、是否符合格式、有没有越狱,做 guardrail(安全护栏)。因为 Jev 本身不会幻觉、响应极快,很适合在大模型输出之后加一层校验。总结一下就是:Jev 不是给终端用户用的产品,是给开发者在系统架构里嵌入的组件。它解决的问题是“我需要 AI 的判断力,但不需要它的表达力”。Jev 目前以早期访问形式开放,开发者可以在 typesafe.ai 加入候补名单。 宝玉xp的微博视频
全部
来源
内容由AI生成

精选参考来源

1. 不写代码、不聊天,只会 "做判断" 的 Jev 凭什么刷屏?最近刷屏的 AI 模型 Jev,不写文章、不写代码、不能聊天 —— 它唯一的本领,是做判断。一、Jev 是谁做的Jev 出自旧金山创业公司 TypeSafe AI,2026 年9 月 15 日结束两年隐身正式亮相,同期官宣 4000 万美元种子轮(DCVC 领投,估值约 2 亿美元)。创始人是 Diogo Almeida:OpenAI 前研究员、InstructGPT 主要作者、RLHF 训练流程的核心构建者之一。他追问的问题很简单:大模型这么聪明,为什么大多数工作还没被自动化?Jev 就是他的答案。二、Jev 是什么TypeSafe 的定义:"Decisions, not strings"—— 要决策,不要文本。 官方说是「System One Model」(靠快速、直觉做判断的模型)。主流 LLM 本质是 token 生成机,一个 token 接一个 token 地 "说" 出答案,软件还得费力解析。Jev 把这条链路砍了:给它一段状态(state) + 一组类型化问题,它一次性并行返回所有答案 —— 每个答案都是结构化值,附带校准过的概率。一句话理解:拥有通用语义理解能力的 "智能 if 语句"。三、三种输出原语1、Noul(是 / 否):返回 0~1 的单一概率,无独立 confidence 字段;2、Choice(选择):从预定义选项里选一个赢家,返回选项、各项概率和 confidence;3、Score(评分):在有序量表上打分,返回分数、概率分布和 confidence,可有小数。四、工程要点(结论)1、每次外部动作后必须重建 state,决策要基于最新状态,而不是缓存;2、问题要原子化:一个判断一个问题,多个维度拆开问、在代码里组合;3、选项不完整时加 other / human 兜底,资格规则放代码里,让模型看不到不可能的动作;4、置信度是路由信号,不是正确性保证:内部标签 0.70 可直接自动处理,Agent 交接 0.80 重新评估,浏览器 / 工具动作 0.90 问人工,发布 / 支付 / 删除必须政策加人工;5、铁律:模型可以建议分支,代码决定分支能否执行 —— 绝不让概率绕过权限、预算或不可逆操作控制;6、记录完整概率分布而非只记赢家标签,执行后从外部系统验证效果。五、为什么快不生成文本 = 没有自回归解码,输出空间被提前限定,还能并行回答多个独立问题。一次调用同时问 13 个问题,比分开问 13 次快约 10 倍、便宜约 12 倍。定价:输入 0.042 美元 / 百万 token(约 0.28 元人民币),输出 token 免费;端到端延迟 70~500ms,多数约 100ms。六、RLCD:训练的是 "靠谱"Jev 的训练方法叫 RLCD(面向校准决策的强化学习):不优化 "回答讨不讨人喜欢",而是优化概率校准—— 模型说 90% 把握,一批判断里就该约 90% 是对的。校准过的概率,是企业敢让 AI 自动执行的信任基础。它宣称结构化输出 / 工具调用错误率 0%,这是结构性保证(输出被 schema 限定,不可能返回选项之外的值),但类型不错 ≠ 判断正确,它完全可能自信地选错。七、能干什么官方定位:分类、路由、评分、信息提取、业务流程分支,以及给 LLM 当裁判、护栏、越狱检测。社区实测已验证的结论:浏览器任务提速、写作质检数百次判断不到 1 秒、检索重排 Top-1 大幅提升、批量邮件 / 论文分类成本低至几美分。核心用法是 "快而准的粗筛 + 强模型精修":不确定或高风险的分支升级给更强模型。没 Key 也能先开发:官方提供 System One Adapter,套在 OpenAI/Anthropic 兼容 API 上返回同样的类型化结果,先做完系统,拿到 Key 只换接口、重放样本、重新校准阈值。八、会翻车的地方1、类型化输出不防提示词注入:网页、邮件、工具输出都是不可信数据,要先过滤再喂给 Jev;2、置信度 ≠ 准确率:高后果动作必须有弃权分支和人工审批;3、"完成" 标签不作数:验证必须看文件、页面、数据库、回执等外部结果;4、Choice 不能当多标签用:多个条件可能同时为真时,用多个独立 Noul 再在代码里组合;5、精确计算、日期运算、自由写作、不可逆执行不要交给 Jev。九、争议与意义争议在于:它是否只是 "高级分类器"?区别是不用为每个任务重新训练、保留零样本泛化,但官方没公开论文、参数规模和训练数据,无法独立验证。它的产业意义更值得关注:Agent 内部大量路由、分类、验证步骤,其实不需要一段没人读的文字。未来更现实的架构是多层分工——Frontier 模型管复杂推理,Flash 管普通推理,决策模型管高频判断,确定性部分交给代码。Code computes. LLMs create. Jev decides. Fresh state proves the result.(代码负责计算,LLM 负责创造,Jev 负责决策,新状态负责证明结果。)真正值得跟踪的,不是它快多少倍,而是能覆盖多少原本必须交给前沿 LLM 的判断—— 当一次判断便宜到一美分以下,软件会在你从没想过的地方,塞满决策。申请:typesafe.ai#HOW I AI# #程序员#

2. ChatGPT 联合发明人创办的 TypeSafe AI 正式发布了一种全新类别的 AI 模型:“System One 模型”,以及该类别下的第一个模型 Jev。和现有的大语言模型不同,Jev 完全放弃了文本生成能力,专门为软件内部的快速决策而设计:输入非结构化数据,输出带有校准概率的类型安全结构化结果。简单说:Jev 不会写文章、不会聊天,但能以极低的成本和延迟,在代码里充当一个“智能判断函数”:分类、打分、路由、提取,这些原本用规则引擎硬写但又写不好的事情,现在可以交给它。创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT 和 RLHF 的核心研发,是 ChatGPT 和 GPT-4 论文的共同作者。他在博客中描述:RLHF 让模型学会了取悦人类,却也让它们在自动化场景里不够可靠。于是他离开 OpenAI,潜行两年,用一套叫做 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)的新训练方法从头构建了 Jev。几个关键数字值得注意:响应速度 70 到 500 毫秒,比主流前沿大模型的 3 到 329 秒快了一到两个数量级。输入 Token 价格 0.042 美元/百万 Token(约 42 美元处理十亿 Token),输出 Token 免费。官方自称比同等智能水平的大模型快 20 到 200 倍,便宜 40 到 400 倍。这些数字的来源是 TypeSafe 自研的“工作流评测”(Workflow Evals),用 GPT-6 Astra 和 Anthropic 的 Fable 5.1 的平均结果作为参考答案。他们也承认,这种评测方式本身偏向 OpenAI 和 Anthropic 的模型,Jev 的实际相对表现可能被低估,但极端加速倍数(如 193 倍、444 倍)属于最优情况,不代表所有场景。速度为什么能这么快?因为架构上根本不同。大模型逐个生成 Token,前一个 Token 出来后才能算下一个。Jev 采用并行采样,所有输出一次算完。这和当年 Transformer 取代 RNN 是同一个思路:用并行取代串行。代价也很明确:Jev 不能生成文本。它输出的是事先定义好结构的决策结果,每个回答都附带置信度分数。官方宣称类型错误率从数学上等于零(因为输出结构在架构层面就被约束了),幻觉问题也因此不存在。对开发者来说,Jev 的定位不替代 ChatGPT 或 Claude 这类对话模型,主要是为了补上它们不擅长的那一环:当你需要在代码流程中嵌入一个 AI 判断节点,要求毫秒级响应、结构化输出、不能出格的时候,用大模型做这件事成本高、速度慢、还可能生成不可预期的内容。Jev 就是为这个场景设计的。TypeSafe 把这类任务叫做“智能 if 语句”,也就是用 AI 做原本 if-else 写不好的模糊判断。他们还做了两个有趣的演示:一个是用 Jev 实时操控经典游戏 DOOM 的 AI 机器人,每秒调用约 10 次,成本大约每小时 7 美元;另一个是 Wikipedia 竞速(从一个词条通过链接跳转到另一个指定词条),需要在成百上千个链接中做选择,Jev 在步数和速度上都领先于大模型的非推理模式。“System One”这个名字来自 Daniel Kahneman 的《思考,快与慢》中的“系统一”——快速、直觉、自动化的思维方式。“Jev”则取自经济学中的杰文斯悖论(Jevons Paradox):当某种资源的使用效率大幅提高时,总需求反而会增长。TypeSafe 显然在押注:把 AI 决策的成本降到足够低,用量会爆发式增长。从博客和文档里提到的信息来看,Jev 的应用场景集中在一个核心逻辑上:凡是你在代码里需要一个“聪明的判断”,但又不需要它写一段话给人看的地方,都是它的地盘。具体来说有几类:第一类是流程中的智能分支。比如客服系统里判断一张工单应该转给哪个团队、紧急程度多高、用户情绪如何——这些原本要么靠关键词规则(太死板),要么靠大模型(太慢太贵)。Jev 可以在几十毫秒内给出带置信度的判断,而且输出格式固定,代码直接用。第二类是大规模数据处理。比如对海量文档做分类、打标签、提取结构化字段。大模型做这件事单条成本还行,但量一上去就很贵,而且速度是瓶颈。Jev 42 美元处理十亿 Token,输出还免费,适合需要跑几百万甚至上亿条数据的场景。第三类是实时应用。100 毫秒级别的响应意味着可以用在用户体感得到延迟的地方——实时推荐、动态定价、游戏 AI、交互式产品里的智能判断。博客里那个 DOOM 演示就是这个意思:每秒调用 10 次,大模型根本做不到。第四类比较有意思——给大模型当“质检员”。用 Jev 来检查大模型的输出是否安全、是否符合格式、有没有越狱,做 guardrail(安全护栏)。因为 Jev 本身不会幻觉、响应极快,很适合在大模型输出之后加一层校验。总结一下就是:Jev 不是给终端用户用的产品,是给开发者在系统架构里嵌入的组件。它解决的问题是“我需要 AI 的判断力,但不需要它的表达力”。Jev 目前以早期访问形式开放,开发者可以在 typesafe.ai 加入候补名单。 宝玉xp的微博视频

3. 【Jev:让AI像“直觉”一样快且准的系统一模型】OpenAI前研究员Diogo Almeida创立的TypeSafe AI发布了新模型Jev,它不生成文本,而是专为软件自动化设计的“决策机器”。通过自研的RLCD训练方法和并行采样架构,Jev能将非结构化文本直接转化为类型安全的JSON决策,其推理速度比主流大模型快20-200倍,成本降低40-400倍,且输出端完全免费。这件事的重要性在于它打破了“万物皆可Chat”的路径依赖。开发者常困扰于大模型在自动化链路中的高延迟、易幻觉和解析报错,而Jev通过放弃生成长文本的自由,换取了绝对的类型安全和毫秒级响应。它更像是一个拥有大模型理解力、却运行在软件内层的“智能if-else”。开发者应该意识到,AI的未来不只是对话框,这种能无缝嵌入代码逻辑、提供确定性概率反馈的“系统一”模型,才是真正大规模替代传统业务逻辑、实现复杂自动化工作流的底层基础设施。

4. 这两天,如果说最火的大模型是什么,那可能只有一个名字。Jev。这个模型来自TypeSafe AI,创始人就是这个Diogo Almeida。(图1)这哥们以前在OpenAI,参与创造了RLHF和InstructGPT,也就是后来让GPT真正学会说人话、最终催生ChatGPT和GPT-4的那一套关键方法的大佬。然后他在2024年初选择离开了OpenAI,出去创业,在隐身了两年以后,终于掏出了自己的这个全新的模型,Jev。这玩意,可能是我近一年,看到的确实有一点不一样的东西。真的,他又激发了很多我对于AI的想象,相信我,这个Jev,跟你过去见到过的所有的大模型,都不一样。因为,这个模型只会做一件事,那就是:高频决策。没错,一个2026年9月推出的新模型,没办法跟你聊天,也没办法写代码,甚至连文字都没有办法生成。只会帮你进行决策和判断,是一个完完全全的通用分类器。(视频1,图1左滑查看)可能听起来还是有点玄乎,不过这两天X上有个案例,我觉得特别适合解释Jev到底是什么。开发者Marcel Pociot接入Jev做了一个浏览器插件。(图3)作用特别简单。就是这个浏览器背后接了Jev,然后用Jev帮你过滤X上那些你压根不想看的东西。比如你可以设定好,说我不想看故意引战骗回复的内容,或者说不想看加密货币和NFT,又或者不想看政治争论啥的,都可以。甚至你可以说:“把那些明显只是为了让我生气、让我回复、让我停下来吵架的内容都折叠掉。”然后,你就继续正常刷X。每出现一条新的帖子。Jev就在后台飞快地判断一次:这条东西,有没有命中刚才那些我们不想看的内容分类?有的话就直接折叠不显示了,没有命中的话,就正常展现出来。(图4)而这个判断的速度,平均只需要380毫秒。也就是在Jev看到帖子的一瞬间,输入帖子,然后完成判断进行输出,是否要折叠,这一切,只发生在380毫秒的时间里面。过去我们看大模型,如果遇到这种问题,你当然可以让大模型来去做判断,即使你开了JSON Output的话,它也会很慢,甚至如果开了思考的话,那就更慢,可能需要十几秒,甚至是几十秒才能完成一个判断。但我们其实根本不需要那么多的东西,我们只需要模型以最快的速度,给出Yes或No就可以了。我们根本不需要它生成任何的内容,它只需要来帮我们做判断。Jev干的就是这件事。这就是Jev最奇怪,也最性感的地方。我们过去看到的大模型,都在努力学习一件事情,也就是怎么更好地回答人类。Jev直接换了个方向,它想解决的是:如果最后真正需要这个答案的,其实只是一段代码呢?代码根本不需要你文采飞扬。也不需要你解释半天。它只想知道:要还是不要、A还是B、继续还是停止等等等等。它需要的,是一个能直接执行的判断。而且我其实说实话,不只是代码,这个世界中,即使对于我们人类来说,绝大多数的东西,本质上其实也都是决策判断。这件衣服你要不要买,遇到Boss了你是格挡还是闪避,Token用完了你是重置还是摆烂,要结婚了这个彩礼到底是给还是不给...太多太多了。很多时候,即使在我们的人生中,我们也根本不需要那么长篇大论的文字或分析,我们只需要一个决策,仅此而已。所以,Jev奔着这个目标一路狂奔,他们为了最好的完成决策,直接把生成文字给砍掉了。于是,速度快了20~200倍,近乎逼近实时,当Jev打游戏的话,一秒可以决策10次,并且成本低了40~400倍,0.042美元/百万Token,便宜到离谱(输出Token还是免费的,因为只输出一个决策,那个Token太少了,他们干脆免费了)。网上的大佬们已经玩疯了。比如,有人会用它,玩马里奥,因为马里奥本质上也就是按键判断。。。(图5)效果出奇的好。(视频2,图5左滑查看)有人用它操控浏览器查询航班,一共就花了7秒,全部点完,毕竟,浏览器操控,本质上也是判断决策。(图7)还有大佬用它搭了一个交易机器人,因为做交易,本质上也是决策,就是买或者卖而已。(图8)还有太多太多了。Jev这个百毫秒级响应+大批量判断,既有超级实用的场景,也有无数能拓想象力的场景。这就是他们给自己定义的模型类型,称为System One Model。System One这个名字,来自丹尼尔·卡尼曼那本特别有名的《思考,快与慢》。卡尼曼把人的思考粗暴地分成两种。系统1就是快思考,自动的、直觉的。比如我问你:1+2等于几?你总不会低头沉思三分钟,然后才给我报个3对吧。系统2,就是慢思考。需要一步一步分析的,比如做数学证明,写复杂代码啥的。现在的GPT、Claude,尤其是各种Reasoning Model,越来越像一套特别强的系统2了。而Jev赌的则是另外一边,因为他们觉得,这个世界上其实存在着海量根本不需要长篇推理的智能任务。所以他们重新做了一套模型架构、并行Sampler,还有一种自己叫做RLCD的训练方法。全称是Reinforcement Learning for Calibrated Decisions。大概可以翻译成:面向校准决策的强化学习。就像我们过去说,RLHF优化其实是人类更喜欢哪个回答。然后RLVR优化的是,这个答案能不能被验证,所以后面数学、代码之类的这两年直接旱地拔葱式的大跃进。而RLCD想优化的,就是这个决定到底对不对,而且模型嘴里说的“我有90%把握”,到底是不是真的接近90%。因为如果你真要把AI塞进一个自动化系统里,那概率必须是有意义的。比如,Jev给出来的置信度 > 0.90,那就可以自动执行。0.7 < 置信度 < 0.90,那就交给更强的大模型复核。置信度 < 0.7,那就交给人来决策。所以我觉得在Jev这条路线里面,最重要的词甚至不只是快和便宜,这个“校准”,才是真正的核心。当你接了Jev让它输出的时候,也可以看到,它的输出,是这样的。(图9)这就很爽了。而且最骚的是,所有的这些需要判断的问题可以一次性并行问。比如我扔进去一条AI新闻。我可以同时问:是不是AI相关?是不是广告?是不是融资?应该归到哪个分类?值不值得推给用户等等等等。Jev可以一口气把这些判断一起做掉,速度极快,直接起飞。(图10)这跟传统LLM一个一个Token往外生成,完全是两种思路。所以,这玩意本质上有点像:一个拥有世界知识和语义理解能力的超级if。目前可以在他们的官网上申请资格,应该挺快就能过。网址在此:网页链接(图11)不过如果你急着测试的话,也可以去一个集合平台vercel上用,他们已经首发接入Jev了。(图12)我自己也第一时间把AIHOT里面的一些任务判断,都用Jev测了一下。比如一个非常基础的预筛任务,就是每天几千上万条我监控的内容会被爬下来打分,负责精选的模型是一个稍微大一点贵一点的模型,这样才能保证世界知识充足,品味足够的好。但是如果我们把这几千上万条信息都扔给这个模型的话,很贵。那所以前面就用一个便宜的模型来做一道预筛,把跟AI没有关的内容全部先剔除掉,这样就能省很多钱了。所以这个预筛任务特别简单,就是只判断,当前信息跟AI是否相关。100道的测试题,我让GLM-5.3 Flash、DeepSeek V4.1 Flash、Qwen 3.7 Flash、Jev同时测试了一下。结果是这样的,还挺意外的。(图13)GLM 5.3 Flash是唯一一个全对的,但是也最慢和最贵。Jev目前看起来是最综合的,准确性第二+便宜很多,比DeepSeek V4.1 Flash在空闲阶段还要便宜,但是因为国内网络延迟的问题,所以Jev的耗时和反应速度被拉高了。Qwen 3.7 Flash依然是最便宜性价比最高的,甚至只有Jev的一半,但是精准率跟DeepSeek V4.1一样,差了点。在另一个同事件聚簇判定的任务上,Jev差不多也维持着第二准确,但这次因为内容量表较大,所以终于变成了速度最快的角色。(图14)而如果让它做一个更适合Jev的并行判断任务,比如一个新闻背后,同时有十个问题需要判断并且输出。那这时候,优势就出来了。(图15)最高的准确率,最快的速度,第二低的成本。在追求精度的分类和判断场景上,Jev就是目前性价比最高的解,Qwen 3.7 Flash便宜是便宜,但是一旦稍微大一点的活,这个正确率能被拉7个点,这就没法用了。而且这只是第一代模型,如果几个月后,Jev出到2.0,那我不敢想象,这玩意准确性能高到什么程度,速度又能快到什么程度,以及价格又能便宜到什么程度。Jev这个名字,脱胎于一个经济学里著名的东西。杰文斯悖论。他的提出者,就叫William Stanley Jevons。19世纪的时候,蒸汽机越来越高效,理论上来说,烧同样的煤,可以干更多的活,那人类是不是会因此少烧煤?结果刚好反过来,因为蒸汽机效率越来越高,使用煤变得越来越划算,所以,越来越多行业开始用。最后,整个社会的煤炭消费量反而上升了。效率提高,单次消耗下降,总消耗却暴涨,这就是杰文斯悖论。而TypeSafe给模型起这个名字。意思已经非常明显了,他们赌的就是,智能也会发生杰文斯悖论。我们现在用的模型越来越贵,价格越来越高。但我们日常中真的需要用到这么高智力的模型吗?是不是有大量的判断和决策,还有事情只需要一个Jev这样的模型,就可以了呢?但如果有一天,一次拥有相当不错语义理解能力的判断,便宜到接近不要钱的时候,这个世界又会发生什么呢?AI,为什么一定要生成东西?智能当然可以用来创造。那,也可以只用来判断。Jev确实可能代表着Agent时代另外一块特别重要的拼图。一个我们过去因为ChatGPT太成功。反而一直没有认真看过的方向。未来的轮廓。好像也逐渐清晰了起来。以上,既然看到这里了,如果觉得不错,随手点个赞、评论、转发三连吧,这对我们有特别大的帮助~谢谢你看我的文章,我们,下次再见。#How I Al##AI##数字生命卡兹克#

5. #Jev为什么爆火AI圈#最近AI圈被一个很特别的模型Jev刷屏了。这个模型是前OpenAI ChatGPT的核心人员出来做的,它的理念很有意思:要决策,不要字符串。咱们平时用的大模型,相当于人脑的“慢思考”,也就是系统二,聊天、写东西、复杂推理都很在行。但Jev走的是系统一快思考路线,它压根就不跟你聊天写作文,只干一件事:做选择题、打分、算概率。为什么开发者这么吃这一套:✅幻觉几乎没有,结果只能从你提前给的选项里出,不会瞎编,再也不用痛苦处理乱七八糟的JSON,省一大堆校验代码。✅性能数据很猛,部分任务比普通大模型最快能快193倍,成本直接砍到1/444,而且输出token还免费。✅延迟很低,70‑500毫秒就能出结果,适合大批量反复判断。✅对做Agent的人简直是救星:工具选哪个、消息归类、内容过滤、风险判断、流程分支,这些细碎的小判断交给它,大模型专心干复杂的规划就行。刚上线,Vercel上面13%的付费开发团队就直接用上了,Hacker News直接冲上榜首,LangChain、Cloudflare也很快适配支持。⚠️但别神话它,它也有短板:不能聊天,不会写文案,也没法跟你解释它为啥选这个答案。不是来干掉GPT、Claude的,二者是搭档:大模型负责深度动脑,Jev负责海量快速做决定。现在行业也开始反思,通往AGI不一定非要死磕“会说话”。很多真实业务场景,AI根本不需要输出长篇大论,稳定、便宜、快速把判断做对,就已经价值巨大。#热点跨界共创##老张聊科技# #Jev为何火爆AI圈#

6. OpenAI前研究员发布全新AI模型,绕开文本生成,响应速度快200倍

7. 告别字符串幻觉:TypeSafe 发布 System One 决策智能大模型 Jev

8. AI不一定要“聊天”,OpenAI前研究员研发只做决策的模型,绕开文本生成,响应速度快200倍

9. 前OpenAI研究员推出首款“System One”模型引爆AI圈:不生成文本,专为机器做快速决策

10. 新模型Jev发布:速度提升200倍,输出Token免费!

11. Almeida推出AI模型Jev,不生成文本、输出免费

12. TypeSafe推出不生成文本的模型Jev

13. System One模型与Jev

14. 2400万人围观,前OpenAI研究员做了个「闭嘴」模型

15. 这个只会做选择题的Jev,却是今年我看到的最特别的大模型。

16. 两年隐身,两小时被复现:Jev 模型到底值不值 4000 万美元?

17. 这个只会做选择题的Jev,却是今年我觉得最特别的大模型。

18. 聊一聊最近大火的Jev模型

19. Jev模型:又快又便宜,消灭幻觉,轻松打败顶流LLM

20. Jev爆火硅谷,哑巴AI卷疯14万开发者

21. Jev,Agent专用决策大脑。前OpenAI RLHF核心研究员,推出全新AI模型Jev。 它放弃了大模型最核心的文字生成能力,不聊天、不写长文,只做结构化决策。 提前设定候选选项,直接输出选择、打分与概率,不会自由编造内容。 传统大模型一身多职:既要理解任务、生成文本,还要做分支判断。 代价是成本高,还容易出现幻觉、输出格式错乱。 Jev把「决策」单独剥离出来,形成三层分工: 通用大模型:处理复杂深度思考 Jev:承担海量、高频的分支判断 代码编排器:落地执行动作 决策和执行彻底分离,速度最高提升200倍,成本大幅下降,幻觉显著减少。 它的价值,不在于写文案,而在Agent自动化流程里: 判断信息可信度、选择调用工具、判定是否人工介入、确定下一步动作。 这些反复出现的标准化判断,交给Jev,毫秒就能出结果。 但它有明确边界: Jev无法独立完成完整任务,不能做开放式深度推理。 它是系统组件,不是用来替代通用大模型。 这也印证一个长期趋势: 未来AI软件不会由单个巨型大模型包揽全部工作,而是拆解成大量Harness。 轻量决策模型处理高频判断,大模型只专注少数复杂推理。 分工,是AI规模化落地的核心前提。 #Jev模型 #Agent架构 #Harness #AI工程化 #大模型

22. ChatGPT发明人新模型不会写字,我扒了Jev的账单和评测

23. 前OpenAI研究员做了「不会聊天」的AI:Jev只做判断,最高快200倍

24. Jev 到底是什么?为什么 AI 自动化需要一种新的模型

25. 刷屏了!前OpenAI研究员做的Jev,大家为啥抢着用?

26. Jev模型究竟是个什么鬼?凭什么海外爆火?

27. Jev:高速低成本零幻觉决策模型 | Matthew Berman

28. 输出免费!前OpenAI 研究员发布全新模型

29. RLHF核心研究者发布新模型,称比LLM快200倍

30. Jev:可能永久改变自动化的模式安全AI - RepoChad - 中配

31. Jev模型是什么?TypeSafe AI 的结构化决策模型

32. Jev 模型技术解析:从生成式 AI 到决策智能

33. 7分钟解读Jev:一个不会聊天的模型却打开巨大想象空间

34. 一文了解 Jev 模型到底是啥

35. 「不会聊天」的AI可以怎么玩?开发者用Jev接管Agent快速决策

36. 前OpenAI研究员发布新模型「Jev」,Agent的新路线? | 菜花睡前AI播客

37. Jev到底是什么?不是聊天大模型,而是专门给AI做“选择题”的决策模型!本地部署实测+开源项目盘点:模型路由、浏览器Agent、上下文压缩、Computer U

38. JEV 深度解析:首个为代码而生的 AI 模型

39. Jev 是什么?前 ChatGPT 共同发明者发布的超快决策模型

40. Jev大模型测评报告!究竟该怎么玩?

41. 看很多人在聊Jev,说是最近爆火的模型,可以用来快速指导浏览器、office、agent干活,我没太看懂,它不算是生成式大模型,倒有点像给ai用的ai。 有人用Jev测试在Google Flights上用自然语言搜索机票,Jev花了7秒搞定,而且token成本不到3分钱。一般的浏览器agent 可能要耗费更多时间去处理表单、下拉框等,由于需要llm识别截图,token消耗也贵不少。 我理解Jev有点像python里的if和switch语句,专门做决策用的,它有两种决策模式,Score按概率打分、Noul判断真假,然后返回置信度。 比如操作浏览器查机票,它会给每一步动作交互打分和判断真假,决定要不要做、下一步怎么做。 这样的好处是Jev处理任务的速度非常快,不需要像大模型那样思考后判断,直接把任务时间拉到毫秒级。 至于决策的精确度,Jev靠的是RLCD,简单来说用强化学习让模型给出靠谱的决策,比如说这个邮件有80%概率是垃圾邮件,不要求每次都百分百准确,但会做到每次都靠谱。 对应的大模型,它的核心机制是RLHF,考虑的是人类觉得这个回答好不好,要满足大部分人的需求和想法,总是输出“中位数”。这就是大家为什么觉得豆包、Gemini等ai会给出正确且安全的回答。 所以我说Jev是给ai用的ai,它能在需要快速决策的场景中帮到大模型和agent,两者不冲突。 #ai# #大模型# #人工智能# #agent#

42. AI 快 193 倍便宜 444 倍?自家评测表里却只排第五|TypeSafe Jev 实测拆解

43. 大模型输出费归零!TypeSafe首发决策模型Jev TypeSafe联手OpenRouter首发决策模型Jev:彻底抛弃逐字自回归,直接输出强类型布尔与打分,24秒筛选近400条新闻仅花一毛钱!老程序员客观复盘无长文代码能力的工程代价。以上内容为个人观点或见解,仅供参考。 #AI #大模型 #人工智能 #开源 #程序员

44. 超火大模型Jev,保姆级介绍和使用教程 不能聊天、不能写代码,只负责帮你做选择的模型,有什么用?本期用通俗案例介绍决策型模型Jev,讲清它如何根据背景信息和问题,完成是非判断、选项选择和程度评分。 通过模型路由、俄罗斯方块实测,以及广告识别、欺诈邮件判断、工具调用筛选等案例,看看这类模型如何与通用大模型配合,在工作流中承担判断任务,以及它在速度、成本和准确性上的表现与局限。 #vibecoding #jev

45. chatgpt联合创始人发布新模型jev

46. [中配]TypeSafe发布Jev:首个面向代码决策的AI模型,毫秒级响应与低成本解析

47. 一个视频搞懂Jev!

48. [中配]Jev模型解析:TypeSafe AI如何用概率分布挑战LLM在自动化领域的局限

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章