北京时间10月10日(美东10月9日),微软在官方开发者博客发布 Microsoft-Decision-1:一款不写文章、不编代码、只给一组固定候选项逐个打概率分的"决策打分模型",训练底座是开源的 Qwen3.5-9B,已上线 Microsoft Foundry 和 OpenRouter。微软官方博客
中文圈的转述数字很抢眼:比 GPT-6 Sol 快 35 倍、比 Quyet-1.0-Large 快 4.5 倍。 微软公告自己的表述是另一组口径:在近 15 万道题、36 项与训练相互保密的基准中拿到最高准确率。 定价同样是卖点:输入每百万 Token 0.042 美元、输出免费。但把公告内嵌图表里的原始数据摊开对照,结论要收着说:准确率第一只领先第二名 1.2 个百分点,校准度只排第三,"快35倍"参照的是没下场的通用大模型,且全部数字出自微软自测、尚未见第三方复测。华尔街见闻微软官方博客
第一步别站错队:它只会做选择题,选项得你来定
它的用法和普通大模型完全不同:输入当前状态加一组预设候选答案,模型单次推理返回每个选项的校准概率,支持"是/否"、单选、等级评分,还能按规则给 AI 的回答和动作打分。 微软给它的定位是路由、分类、优先级、校验和工作流控制——给 Agent 当闸门用的零件,不是替你做决定的大脑。有知乎答主把这条路拆得更白:微软做的其实是在保留 Qwen3.5-9B 语言理解能力的前提下,“通过专项后训练让模型适应固定选项的概率判断任务”。 第一个坑就在这:它只会在你给的选项里选。选项集合是否完整、阈值卡在哪、判错了谁负责,依然是业务方的事;丢给它一个开放性问题,它没有能力兜底。微软官方博客知乎
坑一:35倍的参照物,不是同行
"快 35 倍"听起来像吊打全场,但对照官方图表里的延迟列,35 倍的分母 GPT-6 Sol 的 P50 是 3010 毫秒,是通用旗舰的参照值,连准确率都没进同一张对比表;真实同赛道选手里,第二快的 H2O-Lightning-4B v1.1 也只比它慢 2.5 倍。 正确读法:35 倍说的是"把通用大模型从决策步骤里换掉"的流水线收益,不是它比同行快一个数量级。微软官方博客
坑二:只赢1.2分,而且榜单还在官方自己手里
微软公告发布后还追加过一次修订:初版没有 Jev 的对比数据,后来才补上准确率和校准两项。 补齐后的官方图表数据如下,P50 延迟测于 10 月 7 日,JevBench 名次是 10 月 8 日的快照:微软官方博客
模型 | 36基准平均准确率 | P50延迟 | 校准分(100为完美) |
|---|---|---|---|
Microsoft-Decision-1 | 83.5% | 85ms | 92.2(第三) |
Jev 1.13.0 | 82.3% | 240ms | 93.7 |
Quyet-1.0-Large(JevBench榜首) | 81.9% | 380ms | 93.1 |
H2O-Lightning-4B v1.1 | 77.2% | 210ms | 91.8 |
三个信息量:第一,83.5 对 82.3,领先幅度只有 1.2 个百分点,而且这 36 项基准含私有题目,目前除微软外没人复测过;第二,"准确率第一"和"榜单第一"不是一回事——JevBench 公开榜首 Quyet 在这套更广的自测题上只排第三,换基准集就换座次;第三,传播环节已经在出错:有热转帖把 83.5% 错写成校准度,而官方数据里 83.5 是准确率、校准分是 92.2。小红书
坑三:概率分离"可信"还差一截,翻转率是均值不是保证
这套模型的核心卖点本来就是"校准概率",而官方图表自己的结论句写着:准确率第一、速度最快,但校准分只排第三、落后 Jev 1.5 分——它的自信还得再核验一层。 官方对校准分的定义是 100 means a model’s confidence exactly matches how often it is right——模型声称的把握要和实际答对的比例严丝合缝才算满分,83.5% 的准确率则意味着大约每六次判断就有一次是错的。微软官方博客
鲁棒性同理,官方测得八类输入扰动下平均只有 1.3% 的决策翻转率,选项乱序和同义改写时零翻转——但"平均"意味着存在分布,换到你自己的话术和数据上,翻转长尾要自己压测。微软官方博客
免费是真便宜,200倍是别人家的场景
这套定价不是让利,而是决策负载"输入长、输出短"的成本结构明牌——上下文里装着数据、候选方案、约束条件和历史记录,输出只有几个概率值,生成式模型最贵的输出端它本来就不产生。 有开发者点评得更直白:输出免费"与其说是让利,不如说是把真实的成本结构摊开明说"。微软官方博客知乎
内部实测数字也确实亮眼:Xbox Research 用它分类逾一万条玩家反馈,与 GPT-6 Sol 质量持平的同时快 14 倍以上、成本降到约 1/200。 但请注意,这是"固定主题集分类"这一特定任务上的持平,Copilot 团队在响应评估上得到的也只是与 GPT-5.6 Luna 相近而非更优。 抄这份成绩单之前,先在你自己的数据上复测一遍。微软官方博客华尔街见闻
底座可换、赛道拥挤,别把零件当护城河
更值得留意的信号在最后:微软在公告里明写,这个基于 Qwen3.5-9B 的模型 will soon rebase it on other models, including Microsoft AI (MAI) and OpenAI——底座是可替换的。 公告附录一口气列出了 Jev、Quyet、H2O、Surogate、deck-31B、Strands 以及 OpenAI 自家的 GPT-6 Luna Decisions 等被对标产品,连社区都在感叹:“看起来 Jev 这个赛道的门槛是真的低”。 也就是说,"微软用开源底座做出世界第一决策模型"这类标题里,真正稀缺的不是模型,而是场景数据和管道。微软官方博客知乎
怎么用才算没盲信
它适合高频率、固定选项、中低风险的判断环节——分流、打标、打分、把关;不适合一次性、高后果、选项集合还没定型的决策。微软官方给的用法边界其实就一句话:应用拿置信度来决定 act、defer 还是转人工。 接进去的时候盯三件事:第三方何时按公开口径复测 83.5% 和 1.3% 这两个数;换底座到 MAI 或 OpenAI 模型后同一组基准是否还成立;你的业务话术在扰动下的实际翻转率。决策模型把"判断"从大模型里拆出来单独计价,是这轮 AI 落地里少见的确定性趋势——工具值得用,但微软自己的图表已经划清了它的边界:它是打分器,不是权威。微软官方博客