10月10日(北京时间),微软发布了决策模型 Microsoft-Decision-1:它不生成文字,单次推理直接对候选答案输出概率评分,底座是阿里的 Qwen3.5-9B,经过一轮以决策打分为目标的专项后训练。 官方价格表里最显眼的一行是:每百万输入 Token 0.042 美元,输出免费。 把它和主流旗舰模型、赛道同行摆在同一口径下,性价比的结论并不复杂:在高频、短输出的结构化决策调用里,这项成本优势是真实的;但支撑它的性能数字目前全部来自厂商自测,而开源阵营已经把同类能力的 API 成本做成了零——谁该马上切换、谁该等第三方评测,取决于下面几个口径。知乎知乎
对标的首先是 Jev,不是旗舰
这条赛道不是微软开的。Jev 是 TypeSafe AI 于 2026 年 9 月 15 日发布的决策模型,创始人 Diogo Almeida 此前在 OpenAI 做研究,公司拿了 DCVC 领投的 4000 万美元种子轮。知乎
定价方面,Jev 的官方口径同样是输入每百万 token 0.042 美元、输出免费,延迟区间 70 到 500 毫秒——Decision-1 亮出的价格结构与它完全一致,对标意图从价签开始就写明了。知乎
拿主流旗舰做对照:现阶段 GPT-6.1 Sol 按速度分三档售卖,标准版每百万 Token 输入 2 美元、输出 10 美元。 同为输入单价口径,Decision-1 约为标准版的 1/48;决策任务输出撑死几百 token,"输出免费"再把这条差距放大一截。知乎
"输出免费"不是让利,是把这类任务的真实成本结构摊开写进价签:输入是全部上下文——数据、候选方案、约束条件、历史记录,动辄几千上万 token,输出只是一个选项、一个分数。知乎
微软自己给的全任务口径更陡:Xbox Research 用它给逾 1 万条游戏反馈分类,与 GPT-6 Sol 质量相当、速度 14 倍以上、成本降低约 200 倍。 这是内部实测整条工作流的总成本,和公开 token 单价不是同一口径,"200 倍"与"1/48"不能互相换算。36氪
"35 倍"是流水线意义的快
微软宣称其 P50 延迟速度是 GPT-6 Sol 的 35 倍,对照口径取的是 Jev 系基准 JevBench 测试集的中位数——这把刻度尺出自赛道在位者。 差距的来源不是 9B 算力碾压旗舰,而是做法不同:你要一个是非判断,通用模型给的是一段话,得先约束格式、再解析输出,而且无法从一段文本里可靠地读出它有多确定。 Decision-1 不做生成,一次前向让每个候选选项直接拿到一个概率,业务代码拿结果就能分支、排序、路由。36氪知乎
速度的账单意义在链路上:如果连续做出 20 个决策,每个决策多花 100 毫秒,整条工作流就会多出 2 秒;决策环节每卡一秒,下游链路就多等一秒。36氪
自测边界:数字都还没被独立核验
微软称该模型在覆盖近 15 万道问题的 36 项基准测试中准确率均排名第一。 但这些性能数据来源于微软自身的基准测试,独立第三方验证目前尚未完成;赛道另一头的 Jev 处境相同——直到今年 9 月,也不存在任何对它的独立评测。36氪知乎
微软自报的鲁棒性数据值得一并摆出:对同一请求做八种形式扰动后,平均仅 1.3% 概率发生决策翻转,选项描述改写或选项顺序颠倒时翻转率为零。36氪
真正看不见的成本:概率可不可信
决策模型的价值不止"选得对",而是概率可信——置信度被代码直接拿去门控:继续执行、重新尝试、升级处理还是交人工审核。 后训练的功夫大多花在这里:Scam.ai 团队用 Qwen3-4B 加 LoRA 复现 Jev 式读出的 JevLite,专门在验证集上为每个模型拟合温度,校准本身就是训练目标的一部分。知乎知乎
开源小模型也在撞同一堵墙:上海人工智能实验室 9 月 26 日发布 Intern-Decision,三个档位全部 Apache-2.0 开源。 它的概率校准到什么程度、能否放心接进分支逻辑,要等社区用第三方口径复测——这也是评估 Decision-1 时最该优先看的指标,比"第几名"更有用。哔哩哔哩
性价比的另一端:开源把 API 账单清零
Decision-1 发布前的两周里,这条赛道已经挤满开源玩家,而且底座高度重合——近期至少有 4 个开源决策模型都基于 Qwen3.5 微调得来。 其中 Cloudflare 带着 Clef 入场,Apache 2.0 协议开源,自报在 Jev Decision Index 基准上排名第一;StartLux(原点星辉)则放出了 0.8B 到 27B 五档的 StartLux-Decision。 它的 9B 版本与 Decision-1 共用同一种地基:Qwen3.5-9B。知乎知乎知乎
本地化跑通的配套也在补齐:llama.cpp 官方把 SystemOne 接口做进了 llama-server,任何按 Jev 协议写的客户端都可以零改动指向本地推理,对数据不出内网的场景意义重大。知乎
消费级显卡上的账同样直观:LiquidAI 10 月 7 日开源的 d1 一次前向直接输出答案概率,RTX 4090 上单题 8 毫秒,年营收 1000 万美元以内可免费商用。 质量层面开源也不算弱势:同一个威胁情报分类流程,最快的通用模型 gpt-oss-120b 要 4.7 秒且只返回两个分类,Clef 用 2.2 秒输出多个类别的概率。哔哩哔哩知乎
所以性价比要拆成两段说:Decision-1 的"便宜"是相对旗舰顺手做决策的成本;绝对成本的下限在自托管——API 费用归零,换来的账单是 GPU 时间、运维和自证校准。
选型:先对表,再排队
适合现在就把决策环节切给 Decision-1 的团队画像很清楚:调用高频(路由分发、内容分类、优先级排序、结果验证)、输出短、且要在企业合规环境里开箱即用——该模型已通过 Microsoft Foundry 向开发者开放,OpenRouter 的接入仍在计划中。 有创作者实测称,OpenRouter 全站列表里还查不到它,眼下能走的就是微软自家的分发渠道。36氪哔哩哔哩
不必急着动的:决策量低、任务混合的团队,通用模型顺手做并不亏;这条赛道的真实门槛也确实不高——数据与场景握在手里的一方,入场只差一轮后训练。知乎
最值得盯的信号是底座:微软已明确表示,后面还准备把 Decision-1 的基础模型换成自己的 MAI 系列和 OpenAI 模型。 底座可换,既是"门槛低"的注脚,也是提醒:当前价配当前模型没有长期保证,单价、准确率、校准质量都可能随迁移漂移。36氪
模型正在变成公共零件——这轮 Qwen3.5 系底座同时被微软、Cloudflare、上海人工智能实验室选中。对选型的人来说,顺序恰好相反:先量清自己工作流里每个决策点的输入输出形状和调用频率,再决定 0.042 美元花给托管,还是 4090 的机时花给自己。