4.2美分一百万token、9天估值翻50倍、6264个项目刷屏:不会聊天只会打勾的Jev,是新时代还是新营销——白嫖5美元额度之前,先把门槛、翻车、计价这三笔账算完

源自188位全网作者

09:01

这周AI圈最刷屏的,不是哪个更会聊天的模型,而是一个一个字都不会写的模型。

9月15日,隐身两年的TypeSafe AI发布首款模型Jev。9月21日全面开放注册,送5美元额度,还有限时免费token活动。9月24日The Information曝出它正洽谈10亿美元融资、估值超100亿美元,次日《金融时报》跟进证实,从发布时2亿美元估值算起,媒体把这叫"九天翻50倍"。36氪36氪知乎

热度是实打实的。接入Vercel AI Gateway后24小时内,接近13%的付费团队就用上了它。OpenRouter上发往Jev的token量一个周末涨了3倍。有人专门做了个网站统计X上用Jev搭的项目,目前已收录6264个,彭博社甚至把它比作2025年的DeepSeek时刻。36氪知乎

但与此同时,泼冷水的也不少。有媒体拿190次财报任务实测,发现它同一道除法题能连错10次。有人拿它做加密交易实测,跟着它操作跑输"买了不动"60.2%,连随机交易都不如。还有开源作者怒斥"这玩意我一年半前就做出来了",反手把论文和权重全开源了。36氪知乎知乎

一边是百亿估值,一边是连错10次。这个Jev到底是个啥,普通用户现在冲进去免费试,值不值?今天把三笔账一次算清。

Jev是个啥:不陪你聊天,只帮你打勾

先说人话版定义。你熟悉的ChatGPT、Claude是"生成式"的——问一句,它写一段。Jev完全反过来:它不生成任何文字,只做判断、选择和打分,官方称之为"SystemOne模型"这个新类别。它只回答三类问题。微博知乎

  • Choice(选择题):给几个选项,它选一个,并给出每个选项的概率;

  • Score(评分题):按你定义的等级(比如"很低"到"很高"五档)打分;

  • Noul(判断题):回答是/否,输出一个0~1之间的概率,0.5就是五五开。

你把材料(一段文字、一个JSON都行)连同问题一起丢给它,它返回结构化的判断结果和把握程度。36氪的编辑给了个很妙的比喻:这玩意原理像海龟汤——只能问封闭问题,只能得到"是"或"否",但它比海龟汤多给一个概率数字。

4.2美分一百万token、9天估值翻50倍、6264个项目刷屏:不会聊天只会打勾的Jev,是新时代还是新营销——白嫖5美元额度之前,先把门槛、翻车、计价这三笔账算完

来头也不小。创始人Diogo Almeida在OpenAI做了4年研究,参与的InstructGPT正是ChatGPT的前身,RLHF这套"让GPT学会说人话"的关键方法他也有份。2024年初他离职创业,理由很狂:他认为RLHF是条"史诗级大弯路"——取悦人类很在行,做自动化很糟糕。模型取名Jevons,致敬19世纪经济学家杰文斯。36氪微博

官方宣传的两个数字最抓眼球:速度最高可达LLM的200倍,成本只有1/400。记住这两个数字,后面算账要用。知乎

第一笔账:门槛账——不会写代码也能白嫖,但免费入口有三条路,别走错

很多人以为这种"开发者模型"跟自己没关系,其实现在的体验门槛已经低到离谱。三条路,按门槛从低到高排:

路线一:网页试玩,零成本。 第三方网站JevAIDev(jevai.dev)有中文Playground,登录就能用,每个账号每天有6次免费体验额度。36氪的上手实测就是用它跑的:丢一条"某AI公司宣称性能提升30%但没公布数据"的新闻进去,同时设置分类、可信度打分、是否已证明三个问题,Jev返回"产品发布(概率0.62)"“可信度较低(1.09)”“未证明(0.04)”——一次请求,三个判断,手机网页就能玩。36氪

4.2美分一百万token、9天估值翻50倍、6264个项目刷屏:不会聊天只会打勾的Jev,是新时代还是新营销——白嫖5美元额度之前,先把门槛、翻车、计价这三笔账算完

路线二:官网注册,领5美元额度。 TypeSafe AI官网注册、创建API Key即可,默认赠送5美元额度,有效期1个月。定价约每百万token 4.2美分(约合人民币3毛),输出token免费——5美元是什么概念?爱范儿的编辑拿它做了个"选题判断器",几十条选题批量打完分,结论是"5美元能花到地老天荒"。知乎36氪

4.2美分一百万token、9天估值翻50倍、6264个项目刷屏:不会聊天只会打勾的Jev,是新时代还是新营销——白嫖5美元额度之前,先把门槛、翻车、计价这三笔账算完

路线三:开发者路线。 HTTP API、Python SDK直连,或者用npx装个typesafe-ai skill塞进各种agent工具;也可以走OpenRouter聚合平台。注意一个坑:第三方网站的每日免费额度不带到OpenRouter,跑之前确认账户有余额。甚至已经有本地复现版——1GB内存就能跑,每秒60次决策。36氪

一个容易踩的时间差提醒:Vercel AI Gateway上Jev的免费期已于9月25日结束。很多教程还在说"Vercel白嫖",那是上周的事了。目前稳定的免费路径就两条:jevai.dev每天6次,官网5美元新额度(1个月内有效)。知乎

第二笔账:翻车账——红黑榜都摆出来,它强在哪、烂在哪

这是最值钱的部分。我把官方自测、媒体实测、社区野生测试的数据全部扒了一遍,先上红榜再上黑榜。

红榜(实测能打的):

  • 36氪用监管公告和上市公司中报出了15道中文财经判断题,每题问3遍:45次判断全部命中,且每题3次答案完全一致,单题成本不到0.001美元。最有意思的是猪周期拐点题——它是15题里唯一没把把握拉满的,三轮分别报85%、88%、85%,剩下的一成多不确定给了次优方向而不是乱选。会犹豫,说明不是瞎蒙。36氪

  • 同一轮测试里它还超出预期地做对了一些官方自称不行的事:泡泡玛特半年报里数IP收入下降数量,5轮全对;青岛啤酒单季利润降、累计利润涨混在一段里,5次没被带偏。

  • 知乎有人拿简历筛选实测:比DeepSeek快6倍——注意,远没到官方说的200倍,但也确实快。知乎

  • 新闻审核流水线(直接发布/先核实/直接拦截三分支)跑通;有人拿它分析微信聊天记录做了个"Crush好感监控器"。还有人用多智能体协作速通我的世界末影龙,成本不到1美元。36氪

黑榜(翻车现场):

  • 还是36氪那轮实测的第二部分,把算账的活还给它:同一道除法题,连错10次。需要先算两年毛利率再比较变化的题基本全错——唯一值得表扬的是它自己知道在猜,报出的把握不到两成。

  • 中文长文本是硬伤:同样的中报章节,英文版4.4万字符10次全对,海尔的中文版5次全被接口拒收——同样的篇幅,中文消耗的计费单位明显更高,更容易撞上读入上限。

  • 加密交易圈拿它实盘复盘,结论很损:跟着它炒,跑输"买了不动"60.2%;有人反着它的决策操作,结论是仍然一样烂。想拿它炒币的可以直接死了这条心。知乎

  • TypeSafe自己的评测也承认:5个业务场景里Jev准确率只追平中档水平,比最强的大模型工作流低6个百分点;最差的一项是发票核对,只有61.8%。官方说明书列了一串已知短板:读日期像读普通文字、不擅长算术、材料里塞无关内容会分心、英语最好中文偏弱。36氪

4.2美分一百万token、9天估值翻50倍、6264个项目刷屏:不会聊天只会打勾的Jev,是新时代还是新营销——白嫖5美元额度之前,先把门槛、翻车、计价这三笔账算完

还有一个比翻车更隐蔽的认知坑。Jev的卖点是"不会胡编"——严格说只对一半:它的答案只能落在你给的选项里,确实编不出不存在的概念,但它可以很有把握地勾错一个选项。错误从"写出一段不存在的话"变成"自信地打错勾",后者反而更难被察觉。创始人自己也承认高把握下答错是可能的。36氪

4.2美分一百万token、9天估值翻50倍、6264个项目刷屏:不会聊天只会打勾的Jev,是新时代还是新营销——白嫖5美元额度之前,先把门槛、翻车、计价这三笔账算完

另外,效果好不好,一半功力在你自己身上。爱范儿那篇实测说得很透:问题必须拆成封闭问题。"这封邮件适不适合发送"这种笼统问法,它照样给你一个没法验证的概率;拆成"是否泄漏草稿?是否引入无依据旧话题?是否混淆人物身份?"才有用。以前玩大模型拼提示词,现在玩Jev拼的是语文功底和出题能力。36氪

第三笔账:计价账+吃瓜账——4.2美分的生意,和一场没实锤的抄袭疑云

先算商业账。Jev真正革新的地方,是计价单位变了。大模型卖"字数",Jev卖"一次判断"。每百万token约4.2美分、输出免费,对照主流大模型每百万token数美元的报价,单次判断便宜几百倍。字数是服务的计价方式,一次判断是零件的计价方式——零件能进采购清单、能塞进一行代码跑上万次。36氪知乎

领投方DCVC的合伙人说TypeSafe AI已经盈利(公司没公开收入数据,无法核实)。百亿估值赌的就是这个"薄利多销":如果海量琐碎判断从前沿大模型迁移到便宜零件上,OpenAI和Anthropic会被抽走一块调用量。

4.2美分一百万token、9天估值翻50倍、6264个项目刷屏:不会聊天只会打勾的Jev,是新时代还是新营销——白嫖5美元额度之前,先把门槛、翻车、计价这三笔账算完

再算吃瓜账,这部分帮你把营销水分挤出来:

  • "九天翻50倍"有叙事成分:按创始人说法,最近才公开的4000万美元种子轮其实一年多前就完成了,2亿估值是旧闻,100亿是正在洽谈的新轮——钱还没到账。

  • 抄袭疑云(未实锤):一位叫NandhaKishor M的开发者怒斥Jev的路子他一年半前就做过,只是不懂营销没人理,反手把自己的论文和权重全部开源(项目名Laya,约4.2亿参数的BERT模型加判别头,两篇arXiv论文可查)。知乎上的省流结论是:Jev不开源,原理大概率与Laya同源,“又双叒叕是新闻学赢了”。注意,这是社区推断,没有实锤。知乎

  • 复制门槛不高:有网友号称两小时就复现了TypeSafeAI花两年RLCD训练的效果。谷歌转发了DiffusionGemma与Jev的对比,暗示自家更强;诺基亚应用研究院开源了AnyJev——不动一个参数,把现成开源大模型改造成决策模型。行业共识正在形成:需求是真的,护城河存疑。知乎

  • 服务还撑不起卖点:上线后需求超出承载能力,API一度无法对外服务;服务器目前只部署在美国西海岸,而它最大的卖点是低延迟。知乎

一众冷水里,Arena评测平台CEO的质疑最扎心——这和Meta、谷歌、Hugging Face都有的零样本分类器区别在哪?知乎

结论:谁该冲,谁绕行,以及接下来盯什么

值得花时间试的:手上有批量判断类活儿的人(内容筛选、选题评估、客服分流、风控初筛)、agent玩家、想看一眼"后生成式AI"长什么样的技术爱好者——反正jevai.dev每天6次免费,官网5美元一个月有效,试错成本约等于零。

建议绕行的:想找个聊天搭子或写作助手的(它一个字都不会写);想拿它做投资决策的(加密实测不如随机数);场景离不开算术、日期计算、中文长文本的(官方自己都劝你先自测)。

一句话定位:Jev不是更聪明的ChatGPT,而是一颗3毛钱能买几千次的"电子打勾零件"。它配不配得上百亿估值,不看发布会看留存。

接下来值得盯的五个信号。①Vercel免费期结束后的真实留存率和付费转化——这是检验百亿估值的第一组数据。②10亿美元融资是否真落地。③Laya、AnyJev、DiffusionGemma这些免费替代的扩散速度。④官方对抄袭疑云的回应。⑤中文能力和读入上限的改善。这五个信号里任何两个变了,这篇的结论就得重写——到时候咱们再算一遍账。知乎

内容由AI生成

精选参考来源

1. 我们用190次财报任务实测了Jev:当AI判断被卖成零件

2. 刚刚,Jev全网解禁,1.2亿Token限时免费用

3. 发布仅9天的Jev据称估值破百亿美金,硅谷也看好薄利多销?

4. 被硅谷吹爆的Jev到底有什么用?我们替你亲手试了试

5. JEV 这种“不会聊天”的 AI 模型为什么在加密交易圈突然火了?

6. 有没有能把JEV讲明白、讲透的文章推荐?

7. ChatGPT 联合发明人创办的 TypeSafe AI 正式发布了一种全新类别的 AI 模型:“System One 模型”,以及该类别下的第一个模型 Jev。和现有的大语言模型不同,Jev 完全放弃了文本生成能力,专门为软件内部的快速决策而设计:输入非结构化数据,输出带有校准概率的类型安全结构化结果。简单说:Jev 不会写文章、不会聊天,但能以极低的成本和延迟,在代码里充当一个“智能判断函数”:分类、打分、路由、提取,这些原本用规则引擎硬写但又写不好的事情,现在可以交给它。创始人 Diogo Almeida 曾在 OpenAI 参与 InstructGPT 和 RLHF 的核心研发,是 ChatGPT 和 GPT-4 论文的共同作者。他在博客中描述:RLHF 让模型学会了取悦人类,却也让它们在自动化场景里不够可靠。于是他离开 OpenAI,潜行两年,用一套叫做 RLCD(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)的新训练方法从头构建了 Jev。几个关键数字值得注意:响应速度 70 到 500 毫秒,比主流前沿大模型的 3 到 329 秒快了一到两个数量级。输入 Token 价格 0.042 美元/百万 Token(约 42 美元处理十亿 Token),输出 Token 免费。官方自称比同等智能水平的大模型快 20 到 200 倍,便宜 40 到 400 倍。这些数字的来源是 TypeSafe 自研的“工作流评测”(Workflow Evals),用 GPT-6 Astra 和 Anthropic 的 Fable 5.1 的平均结果作为参考答案。他们也承认,这种评测方式本身偏向 OpenAI 和 Anthropic 的模型,Jev 的实际相对表现可能被低估,但极端加速倍数(如 193 倍、444 倍)属于最优情况,不代表所有场景。速度为什么能这么快?因为架构上根本不同。大模型逐个生成 Token,前一个 Token 出来后才能算下一个。Jev 采用并行采样,所有输出一次算完。这和当年 Transformer 取代 RNN 是同一个思路:用并行取代串行。代价也很明确:Jev 不能生成文本。它输出的是事先定义好结构的决策结果,每个回答都附带置信度分数。官方宣称类型错误率从数学上等于零(因为输出结构在架构层面就被约束了),幻觉问题也因此不存在。对开发者来说,Jev 的定位不替代 ChatGPT 或 Claude 这类对话模型,主要是为了补上它们不擅长的那一环:当你需要在代码流程中嵌入一个 AI 判断节点,要求毫秒级响应、结构化输出、不能出格的时候,用大模型做这件事成本高、速度慢、还可能生成不可预期的内容。Jev 就是为这个场景设计的。TypeSafe 把这类任务叫做“智能 if 语句”,也就是用 AI 做原本 if-else 写不好的模糊判断。他们还做了两个有趣的演示:一个是用 Jev 实时操控经典游戏 DOOM 的 AI 机器人,每秒调用约 10 次,成本大约每小时 7 美元;另一个是 Wikipedia 竞速(从一个词条通过链接跳转到另一个指定词条),需要在成百上千个链接中做选择,Jev 在步数和速度上都领先于大模型的非推理模式。“System One”这个名字来自 Daniel Kahneman 的《思考,快与慢》中的“系统一”——快速、直觉、自动化的思维方式。“Jev”则取自经济学中的杰文斯悖论(Jevons Paradox):当某种资源的使用效率大幅提高时,总需求反而会增长。TypeSafe 显然在押注:把 AI 决策的成本降到足够低,用量会爆发式增长。从博客和文档里提到的信息来看,Jev 的应用场景集中在一个核心逻辑上:凡是你在代码里需要一个“聪明的判断”,但又不需要它写一段话给人看的地方,都是它的地盘。具体来说有几类:第一类是流程中的智能分支。比如客服系统里判断一张工单应该转给哪个团队、紧急程度多高、用户情绪如何——这些原本要么靠关键词规则(太死板),要么靠大模型(太慢太贵)。Jev 可以在几十毫秒内给出带置信度的判断,而且输出格式固定,代码直接用。第二类是大规模数据处理。比如对海量文档做分类、打标签、提取结构化字段。大模型做这件事单条成本还行,但量一上去就很贵,而且速度是瓶颈。Jev 42 美元处理十亿 Token,输出还免费,适合需要跑几百万甚至上亿条数据的场景。第三类是实时应用。100 毫秒级别的响应意味着可以用在用户体感得到延迟的地方——实时推荐、动态定价、游戏 AI、交互式产品里的智能判断。博客里那个 DOOM 演示就是这个意思:每秒调用 10 次,大模型根本做不到。第四类比较有意思——给大模型当“质检员”。用 Jev 来检查大模型的输出是否安全、是否符合格式、有没有越狱,做 guardrail(安全护栏)。因为 Jev 本身不会幻觉、响应极快,很适合在大模型输出之后加一层校验。总结一下就是:Jev 不是给终端用户用的产品,是给开发者在系统架构里嵌入的组件。它解决的问题是“我需要 AI 的判断力,但不需要它的表达力”。Jev 目前以早期访问形式开放,开发者可以在 typesafe.ai 加入候补名单。 宝玉xp的微博视频

8. Jev 模型使用体验如何?

9. 强烈建议大家看一下 Jev 创始人 Diogo Almeida 的这个演讲,关于 Jev 的一切,他在这个视频中早就预言。Jev 一开始就是盯着自动化去的, Diogo Almeida 认为现在的 LLM 陷入了一个史诗级大弯路,就是 RLHF。RLHF 在人机交互也就是取悦人类方面,很出色,但在自动化方面很糟糕。它不能实现完全的自动化,人类必须在环。不止 ChatGPT ,Claude Code 的原罪也在于 RLHF。所以他认为 ChatGPT 和 Claude Code 本质上属于一个范式,Claude Code 并不是下一个时代,真正的自动化才是下一个时代。简单来说,RLHF 就是收集人类偏好,并根据人类偏好优化。它的优化目标也不是自动化。他也否定了 RLVR 是答案:RLHF 优化人类偏好,RLVR 优化纯正确性,而他们在做的第三条路优化的是校准过的决策能力。Diogo Almeida 认为,数据比算力重要,做对的任务比数据重要得多。预训练模型本身已经足够聪明,问题只在于我们用偏好优化把它搞歪了。PS:视频翻译是用@宝玉xp 的 BaoCut 做的,属于是我的梦中情译软件了,太好用了。 i陆三金的微博视频

10. 我找到了 Jev 最适合打工人的用法,把老板炼成海龟汤

11. 怎么看谷歌转发了 Jev 和 DiffusionGemma 的对比,表示 比 Jev 更好?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章