硅谷的新赛道:不生成文字,做决策

一款AI模型上线三周,日处理Token规模达到1万亿,约四分之一的世界500强企业投入使用。它不聊天,不写文章,不生成任何一段文字。它做的事情只有一件:做判断。
9月15日,TypeSafe AI发布了Jev。创始人迪奥戈·阿尔梅达曾是OpenAI的核心研究员,参与过ChatGPT训练方法的设计。两年前他离开OpenAI,创办了TypeSafe AI。他的判断很直接:围绕人类语言优化模型,并不适合计算机自动化场景。
———
一种“不写文章”的AI
Jev的运行方式和主流大模型完全不同。
传统大语言模型是“生成式”的:你给它一个问题,它逐字逐句地生成一段文本。它可能写得很好,也可能胡说八道,但无论如何,它交给你的是“一段话”。这段话需要人去读、去理解、去判断。
Jev不生成文字。它把输入信息归入预先设定的输出集合:回答“是”或“否”,给出一个数值评分,或者从既定选项里选一个。TypeSafe把这套技术路线称为“面向校准决策的强化学习”(RLCD)。
三种输出原语构成了Jev的全部能力。Choice——从你给定的选项里选一个;Score——在一个尺度上打分;Noul——判断一条陈述是否成立,返回0到1的概率。三个原语可以在一次请求里混着问,各自独立评估同一份输入,加问题几乎不增加响应时间。
这意味着,Jev和生成式大模型不是同一种产品。生成式大模型是一个“写手”,Jev是一个“裁判”。它不告诉你为什么,只告诉你是什么。
———
1万亿Token,25%的500强
Jev上线后的增长曲线,超出了所有人的预期。
阿尔梅达在上周一的采访中表示,大约一周之前,Jev的日处理Token数量就达到了1万亿。“而且业务显然还在呈指数级增长。”约25%的《财富》世界500强企业正在使用这款模型。
在开发者社区的实测中,Jev的速度和成本优势更为直观。在1000条用户请求的分类任务中,Jev每条消息的响应时间是0.23到0.24秒,而GPT-6 Luna需要0.95秒,Gemini 3.7 Flash需要2.93秒,Claude Haiku 4.5需要0.87秒。每百万条消息的成本,Jev是19到44美元,GPT-6 Luna是27到76美元,Gemini和Haiku则高达344到1025美元。
在一个客服工单分流测试中,Jev处理1000张工单的成本是0.0248美元,GPT-6 Luna是0.0921美元,Claude Opus则高达2.88美元。Jev的中位响应时间是194毫秒,大约是Opus的十分之一。
在一次数据科学任务的测试中,Jev和三个主流LLM在内容分类任务上的Cohen's κ一致性达到0.80,高于LLM之间的0.76。更关键的是,Jev为每个回答附带经过校准的置信度。当置信度高于0.9时——覆盖约三分之二的请求——Jev与所有三个LLM的一致率超过99%。只有置信度较低的那部分请求,才需要交给大模型做二次判断。
这意味着,企业可以用Jev处理大部分高频、结构化的判断任务,把昂贵的大模型留给真正需要复杂推理的少数请求。
———
校准:让置信度变得可信
Jev和生成式大模型最根本的区别,在于“校准”这个概念。
传统大模型在被问到“你有多少把握”时,往往会给出过于自信的回答。它说90%把握的事情,实际正确率可能只有60%。这种过度自信在自动化场景中是致命的——下游代码无法根据一个不可靠的置信度来决定是否信任这个判断。
TypeSafe用RLCD来解决这个问题。RLCD的优化目标和RLHF(基于人类反馈的强化学习)完全不同。RLHF优化的是“人类更喜欢哪个回答”,而RLCD优化的是“模型声称的置信度和实际正确率是否匹配”。
如果模型说70%把握,那么长期来看就应该有大约70%的判断是对的。这个目标听起来简单,但在机器学习中实现起来非常困难。TypeSafe为此设计了一套专门的训练方法,让模型输出的概率分布尽可能接近真实正确率。
校准的价值在于:它让置信度本身成为了一个可用的信号。下游代码可以设置阈值——比如置信度高于0.9的自动执行,低于0.6的转人工审核。这种“人机分工”的自动化逻辑,只有在置信度可信的前提下才能运转。
———
从“生成”到“判断”
Jev的出现,带动了一波行业跟风。
OpenAI上线了决策应用程序接口Decisions API,依托自家Luna模型,用来“回答一组由用户自行设定的特定问题,答案被限定在若干预先定义好的结果之内”。Databricks发布了ai_decide功能,一个原生AI函数,通过SQL或REST API把非结构化文本转化为结构化的分类、评分、选择和概率。Cloudflare推出了开源的Clef系列模型,亚马逊此前推出的Strands Decider 2B也属于同一路线。
一个模型新类别正在形成。生成式模型负责复杂推理,决策模型负责高频、有限选项的路由、分类、审批和智能体下一步动作。
Databricks在发布ai_decide时给出了一个典型的应用场景:一家公司每月收到数千条产品评论,需要判断每条评论主要反映什么问题、客户是否想退货。用传统大模型做这件事,成本高、延迟大。用决策模型,可以在一次SQL查询里完成分类和评分,成本只有大模型的几分之一。
另一个场景是模型路由。一个AI助手面对用户从“改写一句话”到“设计数据库架构”的各种请求,需要判断每个请求的复杂程度,然后路由到不同成本的模型。决策模型可以在几毫秒内完成这个判断,成本远低于让旗舰模型自己判断。
———
判断的边界
Jev的能力有明确的边界。
它只接受文本输入,不支持图像、音频或PDF。它的输入限制为64k Token,其中32k用于状态,剩下用于最长的问题。它在算术、计数和日期比较方面不可靠。它的准确性会随着输入中无关细节的增加而下降。
更重要的是,Jev回答的是“你定义的问题”,而不是“你认为重要的问题”。候选项是使用者给定的,模型只在你划定的边界里判断“选哪个”,“能不能执行”始终握在使用者的代码手里。
这意味着Jev不是一个通用智能体。它是一个高度专业化的判断工具,适用于那些“问题空间已知、答案空间有限、只需要做判断不需要做创造”的场景。它不能帮你写报告、不能帮你设计方案、不能帮你理解一段复杂的情感。在这些事情上,你仍然需要生成式大模型。
但反过来说,当你只需要一个“是或否”的判断时,使用一个能写诗的模型来做这件事,本身就是一种浪费。
———
“全新一类AI”的开端
阿尔梅达对Jev的定位很克制。他说Jev代表着“全新一类人工智能”的开端,人工智能领域仍存在大量有待开拓的技术方向。
这个判断的分量,不在于Jev本身有多强大,而在于它打开了一扇门。
过去几年,AI行业的叙事高度集中在“更大的模型、更多的参数、更强的生成能力”上。GPT系列从1亿参数走到1.8万亿参数,每一代都在刷新“能生成什么”的边界。但生成只是AI的一种能力。判断,是另一种。
判断和生成的区别,就像“写一篇论文”和“审一篇论文”的区别。前者需要创造力,后者需要准确性和一致性。在自动化软件、智能体、企业工作流这些场景中,后者的需求可能比前者更大。
TypeSafe AI目前只有约40名员工,获得的融资为4000万美元。据报道,公司正在洽谈新一轮融资,目标募资规模达到10亿美元甚至更高,部分意向投资者给出的估值已经超过100亿美元。
一个40人的团队,一款上线三周的模型,正在让硅谷重新思考:AI的下一个赛道,或许不在“生成更多”,而在“判断更准”。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
