不会说话的AI,一个多月估值75亿美元:微软用阿里Qwen3.5的底座跟进、连定价都原样照抄——喊泡沫或换API前,先把价格账、门槛账、冷水账分开算

源自187位全网作者

08:12

这几天AI圈出现了一个少见场面:一帮大厂争先恐后地做"不会说话的AI"。

10月9日,微软发布Microsoft-Decision-1;同一天,Nace.AI放出开源的Drex 1.5。10月10日,OpenAI的Decisions API进入公测。再算上Cloudflare此前两周连发的三个决策模型Clef、Clef-Flash、Clef-Omni,Databricks的ai_decide功能,亚马逊已经落地的Strands Decider 2B,还有Perplexity、Snowflake、Liquid AI各自的版本——据The Register统计,公开榜单上的同类模型已经超过100个。知乎36氪哔哩哔哩

而这一切的源头,是一个不会聊天的模型:Jev。

一个不写字的AI,凭什么值75亿美元

Jev是旧金山初创公司TypeSafe AI在9月15日发布的。它的特别之处在于:不生成文本。你给它一个情况和几个选项,它给每个选项打概率,完事。没有小作文,没有"作为一个AI助手",输出直接就是代码能用的结构化结果。36氪知乎

在聊天机器人席卷全球的当下,这个"哑巴模型"反而爆了。发布视频在社交平台拿了数千万播放,付费团队采用数在云开发平台上刷新纪录。然后就是资本市场的快进:TypeSafe AI刚走出隐身状态时,种子轮只有DCVC领投的4000万美元、估值约2亿;据The Information报道,之后一度有投资人给出超过100亿美元的估值报价;10月9日最终落定——a16z领投8.7亿美元,红杉和老股东DCVC跟投,投后估值75亿美元。从2亿到75亿,只用了一个多月。微博

资本为什么急?因为真实业务里的AI活儿,大多是选择题,不是作文题。

一封工单该转给客服还是转给技术、一条评论算不算违规、一份合同里有没有仲裁条款、Agent下一步该查数据库还是该调用工具——这些问题的答案本来就在有限的几个选项里。让大模型干这些活,得让它先写一段话,你再写代码从话里抠答案,又慢又贵,还可能编。决策模型直接输出选项和概率,软件拿到就能往下走。

不会说话的AI,一个多月估值75亿美元:微软用阿里Qwen3.5的底座跟进、连定价都原样照抄——喊泡沫或换API前,先把价格账、门槛账、冷水账分开算

这里面还有一层技术叙事,恰好来自TypeSafe联合创始人Diogo Almeida本人——他是RLHF(人类反馈强化学习)的共同发明人之一,当年正是因为对RLHF的质疑离开OpenAI。他的观点是:RLHF让模型学会了说漂亮话,代价是摧毁了模型的校准能力。他有个流传很广的比喻:一个模型如果"95%的时间像爱因斯坦一样聪明,剩下5%表现得像憨豆先生",那它在自动化生产环境里毫无用处。决策模型要治的,就是那要命的5%。36氪

a16z在投资公告里补了一个很损的细节,来说明Jev的输出有多精简:“输出小到,他们甚至不收输出费用”。36氪

价格账:微软把定价原样抄了一遍

先看两家头部玩家的账本。

Jev的定价是每百万输入token 0.042美元,输出免费。官方给的实测对比:处理同一批评论标注任务,Jev耗时203.2秒、成本0.84美元;对比的大模型耗时823.5秒、成本1.50美元。官方还宣称响应时间在700毫秒以内,比前沿大模型快约100倍,成本只有对方的1/100到1/500。36氪

然后是微软。Microsoft-Decision-1的定价:每百万输入token 0.042美元,输出免费——和Jev一字不差。官宣数据更猛:36项测试集(约15万道盲测题)准确率83.5%排第一,延迟约为GPT-6 Sol的1/35,比Jev快2.8倍,做文本分类比GPT-6 Sol便宜20多倍,输入扰动下决策翻转率只有1.3%。这里要划一条重点:上面这些数字,Jev那部分是公司官方口径,微软那部分全是微软自己报的,没有第三方复核。看个方向可以,当判决依据不行。知乎微博

但方向本身已经够吓人了。算笔账:如果你有个自动化流程,每天要分类100万条内容,按每条200 token算,一天2亿token输入,按0.042美元/百万token的价格,一天8.4美元,一个月约250美元。假如微软"比GPT-6 Sol便宜20多倍"的说法成立,同样任务用旗舰聊天模型跑,一个月要5000美元上下。一年下来,这是两位数的万元级差距——对靠API吃饭的独立开发者和小团队来说,这不是优化,这是生死线。

这也解释了为什么大厂反应这么快:企业API账单里,大头从来不是写诗和聊天,而是海量、重复、高并发的分类和路由任务。这块蛋糕以前只能用贵模型将就,现在有人端出了便宜20倍的专用餐具。

门槛账:底座是阿里Qwen3.5,爱好者在家也能训一个

但热闹看到这里,反常识的部分来了。

微软这个Decision-1,底座不是什么自研神器,是阿里的Qwen3.5-9B——一个90亿参数的开源模型,用微软开放数据做了后训练。而且微软自己说,之后还准备把底座换成自家MAI和OpenAI的模型,没解释原因。翻译一下:底座随便换,这个产品的核心不在模型本身。知乎

社区也看明白了。知乎"怎么看微软推出Decision-1"的问题下,一条166赞、170收藏的高赞回答写得直白:"看起来Jev这个赛道的门槛是真的低……基础模型都可以随便换。"该问题浏览量2.3万,另一个"OpenAI发布Decisions API,Jev还有前景吗"的问题浏览量1.8万——开发者圈正在认真争论这件事。

更狠的在B站和微博。有人用Unsloth把Qwen3.5微调成决策模型,脚本和架构全开源。10月11日,微博上有爱好者晒出自己在家训的Jeff——一个兼容Jev的0.8B决策模型,单次推理约30毫秒。0.8B参数,家用设备,一个周末的活儿。哔哩哔哩微博

不会说话的AI,一个多月估值75亿美元:微软用阿里Qwen3.5的底座跟进、连定价都原样照抄——喊泡沫或换API前,先把价格账、门槛账、冷水账分开算

那么问题来了:TypeSafe AI的75亿美元估值,买的到底是什么?

按公开信息拼一拼,大概是三样东西。第一是校准技术本身——Almeida那套"面向校准决策的强化学习",让概率输出真实可信,这是它宣称的核心壁垒。第二是企业渠道——TypeSafe宣称财富500强企业已有三分之一在使用Jev(同样是公司口径)。第三是时间窗口——第一个把这条路线推到聚光灯下的身位。36氪

反方证据同样清楚:榜单上同类模型超过100个,Cloudflare直接Apache 2.0开源了三个,连训练决策模型的RL微调流水线都开放成了平台产品。微软用开源底座几天就复刻了一个。"三分之一财富500强在用"和"门槛低到爱好者在家能训"这两句话,目前同时为真。a16z赌的是Jev能像早期的OpenAI一样,用先发和数据滚成平台;怀疑者赌的是它会被商品化。这局现在没人能判赢,但至少,75亿这个数字你该带着问号看。Cloudflare博客

泼冷水账:不做选择题的AI也会错,只是错得更安静

决策模型被夸得最狠的一点是"不会像聊天模型那样胡编"。这话只对了一半。

The Register提到,Cisco的博客已经专门写过决策模型的失误案例,也有研究者在讨论这些错误怎么在流水线里被放大。道理不难理解:聊天模型胡编,你一眼能看出来;决策模型选错选项,还会附赠一个自信的概率——错得更安静,更难被发现。当一个"85%置信度"的判断直接驱动退款、封号、转诊,错误的代价反而可能更大。知乎

开源的Drex 1.5把自己的短板写得倒是很诚实:约90亿参数,一块24GB显存的显卡能跑,量化版在苹果芯片和CPU上也能跑;在公开榜Decision Index 0.3.1上得58.08分,Jev是57.96分——两者落在榜单标注的并列区间内,现在根本分不出高低。但知识类题目GPQA Diamond它只有45.4%,Jev是78.6%。这很好理解:它只负责在选项里挑,不负责懂得多。选项本身给错了,它只会用高概率告诉你错误答案。另外它的许可协议是Nace.AI Open RAIL-M,带使用限制,商用前必须读条款。知乎

所以现在这个阶段,各家跑分挤在并列区间、口径全是自报、失误模式还没被充分研究——这不是一条已经铺好的路,是一场刚鸣枪的赛跑。

不会说话的AI,一个多月估值75亿美元:微软用阿里Qwen3.5的底座跟进、连定价都原样照抄——喊泡沫或换API前,先把价格账、门槛账、冷水账分开算

到底关你什么事:四类人四种动作

如果你是纯聊天用户,只用App写材料、问问题:这事暂时和你没关系。决策模型藏在产品后面,你唯一能感知到的,可能是某些App的审核、分类、推荐变快了变便宜了。不用做任何动作。

如果你用API搭过自动化流程、做过客服分流或内容分类:值得动,但别急着换供应商。正确姿势是拿自己的真实任务集,在两三家之间做A/B测试——现在榜单分不出高低,各家又都用自己的口径,任何"凭一个榜单选型"都是耍流氓。先从非关键路径切起,把错误成本可控的环节先迁过去。

如果你只是围观行业格局:接下来盯四个信号。一看微软是否真把底座换成自家模型——换了,说明它认真了;二看Decision Index榜单什么时候拉开差距——拉开了,说明技术还没同质化;三看OpenAI Decisions API公测后的正式定价——它敢不敢也定0.042;四看Cloudflare的免费开源会把谁的价格打穿。这四个信号任何一个动了,75亿美元的估值叙事就会被重新讲一遍。

如果你是本地部署玩家(一块24GB显卡或一台M系Mac):现在就能玩。Drex 1.5开源可跑,Cloudflare Clef系列Apache 2.0权重随便用,B站连Unsloth微调教程都有了,成本几乎只剩电费。想尝鲜"AI裁判"驱动游戏或家居自动化的,这是门槛最低的时刻。知乎

不会说话的AI,一个多月估值75亿美元:微软用阿里Qwen3.5的底座跟进、连定价都原样照抄——喊泡沫或换API前,先把价格账、门槛账、冷水账分开算

四年了,AI一直在学人说话。这一周,它开始学着闭嘴——只在选项里挑一个,然后给出概率。至于这场"沉默竞赛"最后剩下谁,价格战已经替我们开跑了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章