微软发布“只做选择题”的模型 Microsoft-Decision-1:底座是 Qwen3.5-9B,输出免费

源自91位全网作者

10-10 17:08

2026年10月9日(当地时间),微软在官方博客发布专用决策模型 Microsoft-Decision-1,Satya Nadella 同步在 X 上官宣。这款模型不写文章、不做开放式推理,只干一件事:给定一组预设选项,快速选出该选哪个,并给每个选项打一个校准过的概率分。它基于阿里开源模型 Qwen3.5-9B 后训练,单次推理就能出结果。定价为每百万输入 Token 0.042 美元,输出免费,微软 Foundry 和 OpenRouter 均已上线。微博微软官方博客知乎

把“选择题”从旗舰模型里拆出来

软件里的很多 AI 调用,其实并不需要“生成”,只需要“判断”:这条用户反馈属于哪一类、这个请求该交给哪个模型、智能体下一步是继续、重试还是交给人。答案早就写在固定选项里,让通用大模型写一段长文来回答这类问题,又慢又贵。微软在公告里算了一笔账:20 步串联的决策链路,每一步多慢 100 毫秒,整条流程就要多等 2 秒。微软官方博客

它能接三种题型:是/否、多选、评分档,也可以按预设标准给 AI 的回答或智能体的动作打分,输出是程序可以直接使用的结构化结果。概率本身是接口的一部分,而且是校准过的:模型说有 90% 把握,在代表性场景里大约十次能对九次。开发者可以据此设一条门槛:把握高就自动执行,把握低就转人工审核。微软官方博客微博

比准确率更值得注意的是稳定性:同一个请求换措辞、改选项描述、打乱选项顺序,总共八种扰动,判断结果平均只有 1.3% 会改变,打乱或反转选项时一次都没变。微软内部已经先用起来:Xbox 研究团队用它把一万多条玩家反馈按主题归类,质量与 GPT-6 Sol 相当,速度快 14 倍以上、成本低 200 倍;Copilot 团队用它给回答质量打分,效果接近 GPT5.6 Luna,速度快 100 倍。微软官方博客微博

公告当天,微软自己把数字改了一版

官方博客在发布当天修订过一次,文末的编辑注释写明,这次更新补上了与 Jev 的准确率、校准对比。而正是这套新对比表显示:它拿下准确率和速度两个第一,校准得分却排第三,仍落后 Jev 1.5 分。微软官方博客

10 月 10 日早间,中文互联网流传的还是另一组数字:36 项基准准确率最高,比亚军 Quyet-1.0-Large 快 4.5 倍。现在的正式版口径是:36 项基准、近 15 万道与训练隔离的题目里准确率第一;延迟比亚军 H2O-Lightning-4B v1.1 快 2.5 倍,比 GPT-6 Sol 快约 35 倍。不少转载没有跟上这次修订,读者看到的仍是旧数字。知乎微软官方博客

底座为什么是阿里的 Qwen

社区讨论最多的点恰恰是底座:微软不是没有自家模型,此前已经发布过网络安全专用模型 MAI-Cyber-1-Flash。 但这次,微软选择先在阿里的开源 Qwen 上完成专项后训练,公告里也写明,下一步会把底座换成自家的 MAI 和 OpenAI 的模型再练一版。换句话说,底座正在变成可替换的零件,微软要占的是“决策”这个场景的接口和生态位。界面新闻

这条赛道也不是微软自己开工。官方把多家模型放进了同一张对比表,基准成绩取自开源榜单 JevBench。中文技术圈的转述也直接把对标对象放在 Jev 上:相比原版,准确度更高、响应更快。据 HuggingFace 热榜盘点,榜单前六里一度有四个位置属于决策模型。微软官方博客微博哔哩哔哩

要不要换:先拿自己的样本跑一遍边界

对开发者来说,它适合一切“有选项、答案固定”的环节:微软官方的说法,是把路由、分类、优先级排序、结果核验和工作流控制这类任务,从通用大模型手里接过来,做成安全可信环境里的决策组件。但它不做生成、不做开放式推理,替代不了大模型本身,也接不了没有预设选项的开放问题。微软官方博客

两个边界要记牢:所有性能数字目前都来自微软自测,第三方独立复现还没有;而校准概率好不好用,取决于门槛设在哪,还是得拿自己业务的样本在边界附近跑一遍才知道。接下来值得盯的,是底座换成 MAI 和 OpenAI 之后,准确率、校准和价格会不会跟着变。微博

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章