张大妈

微软Decision-1决策模型上手指南:打工人如何用Qwen3.5-9B提效

源自139位全网作者

10-10 17:09

美西时间 10 月 9 日(北京时间 10 月 10 日),微软 CEO 萨提亚·纳德拉宣布推出新一代快速决策模型 Microsoft-Decision-1,专为结构化决策任务设计。对打工人来说,它值得单独写一篇上手指南的原因很实际:AI 工作流里最贵的环节之一——判断——开始变得又快又便宜。华尔街见闻

模型的底座是阿里今年开源的 Qwen3.5-9B,微软对它做专项后训练,让单次推理就能对每个候选答案输出概率评分。官方口径里,它覆盖了近 15 万道问题的 36 项基准测试,全部拿到最高精度。知乎华尔街见闻

定价跟着这个定位走:输入端收费为每百万 tokens 0.042 美元,输出则免费。发布当天它已经通过 Microsoft Foundry 向开发者开放,OpenRouter 的接入还在计划中;10 月 10 日午间的媒体跟进则称,已经上了 OpenRouter。华尔街见闻知乎

它只做选择题,把最贵的输出环节掐掉了

这类模型的活儿就三种:判断命题真假、从给定的候选选项里选答案、按有序等级打分。它不生成文本,读完内容后给几个固定选项各打一个校准过的概率,适合做分类、路由、优先级判断,也能当 agent 的闸门,决定该直接做、先缓一缓还是交给人审。知乎知乎

快和便宜是同一件事的两面。结构化决策的任务形状是输入长,输出短——上下文、候选方案、规则全在输入侧,输出只有一个选项或一个分数。生成式模型最贵的一段永远是输出,它把这最贵的一段掐掉了,于是输出可以干脆免费。知乎小红书

微软给的对比数字是:内部测试中运行速度比 GPT-6 Sol 快 35 倍,比另一款决策模型 Quyet-1.0-Large 快 4.5 倍。这不是跑分意义上的快,是流水线意义上的快:决策环节卡一秒,整条 Agent 链路就卡一秒。华尔街见闻

内部验证给了一个可感的量级:Xbox Research 团队用它给逾 1 万条游戏反馈分类,结果与 GPT-6 Sol 质量相当,速度超出 14 倍以上,成本则降低约 200 倍。华尔街见闻

社区也早有独立参照。9 月走红的同类路线 Jev 发布几天内,一批开源决策模型跟进;开发者 wangleineo 把这类模型与一台中档大模型对跑了 7 个测试集,准确率差距不大,Jev 类模型每个请求的平均响应只有 0.3 秒左右,而大模型生成结构化输出需要几秒甚至十几秒。知乎

他的判断是:这种决策模型的可用性被证明以后,AI 的成本会出现一个下降——应用里各种「决策点」被抽出来交给小模型,长思考留给大模型。知乎

底座是开源的 Qwen3.5-9B,今年 3 月就人人可用

9B 底座不是微软的私有资产:3 月 2 日,通义正式开源 Qwen3.5 小尺寸模型系列 Qwen3.5-0.8B/2B/4B/9B。小红书

官方给 9B 的定位是「紧凑尺寸,越级性能」:结构紧凑,但性能媲美 gpt-oss-120B。换句话说,微软没有重新发明模型,只是把一个开源通用底座做成了专业判断件。小红书

这条路已经挤满了人:到 10 月初,业内统计近期至少有 4 个开源决策模型都基于 Qwen3.5 微调得来。微软自己也把话说明白了:计划未来将该模型迁移至其 MAI 系列模型及 OpenAI 模型等其他底座之上。底座可换、复刻门槛低,说明各家抢的不是模型本身,而是场景和管道。知乎华尔街见闻

三条上手路线,按你会不会写代码来选

不会写代码的打工人,今天还没有直接用上它的入口——它是 API,不面向聊天框。但红利是间接的:微软已经把它用于事故响应、质量控制及科学研究等场景的内部测试。这些环节里大量的分类、路由、打分,原本靠旗舰大模型顺手完成,换成小模型后同样质量的流程会更快更便宜。值得盯的信号是你手上的 Copilot、工单、客服类工具,什么时候把「自动分类、自动路由、自动转人审」变成默认功能,账单有没有因此变薄。华尔街见闻

会写代码的团队,接入口已经打开:它已通过 Microsoft Foundry 向开发者开放,OpenRouter 的接入支持在计划之中。用法比想象中简单:一次调用可以回答多个问题,每个问题自带一组候选选项,模型给每个答案打出概率,你的业务代码按分数决定下一步。它不是聊天工具,也不生成解释,塞进工作流当分诊台和闸门才对路。华尔街见闻知乎

有一道红线要先看清:有博主翻完微软的模型目录后转述,该模型不作为信贷、就业、住房、保险等七类高后果决策的唯一依据。也就是说,它适合替你初判,不能替你签字,选项是否合法、阈值卡在哪一步、哪一步必须停下来找人,仍然由你的业务逻辑负责。小红书

但在意数据不出内网,路其实最短:Qwen3.5 小尺寸系列已经全部开源上架。照 Decision-1 或 Jev 的路子在自己的标注数据上做一轮专项后训练,就能攒出一个私有判断件。门槛低到有开发者看完 Jev 的发布,在 2 小时内打造了 Qwen-2.5-1B-RLCD 传上抱抱脸。0.8B、2B 官方定位端侧与边缘设备,9B 对应受限显存下的服务器部署,普通团队的两三个判断任务,喂得起。小红书知乎

下单之前,三个边界

所有核心数字目前是微软自报:官方称覆盖近15万道问题、36项基准最高精度,但公告同样写明,性能数据来源于微软自身的基准测试,独立第三方验证目前尚未完成。圈内人的说法更直接,「36 项基准准确率最高」这话要打折听。接入之前,先拿自己业务里的真实数据复测一轮,快 35 倍这种数字,只有在你自己的长输入上才作数。华尔街见闻知乎

它是选择题机器:问题得能列成候选项,开放式的写作、解释、跨学科判断仍是大模型的活。社区的冷水没凉,那条 732 赞同的高赞回答直言,对着选项选的准确率还不如当代前沿大语言模型直接出结果。对照 wangleineo 前文那轮对跑,更稳妥的理解是:这类模型达到中档大模型的判断水准,在窄任务上稳定、便宜、快,但谈不上碾压。知乎

门槛低不等于价值低。微软这步真正的动作是把账算明白了:只对输入收费、输出白送,等于替所有人宣布——决策环节从「用旗舰模型顺手做」转向「用专用模型专门做」,这一步微软只是走得靠前,后面排队的人不会少。对打工人,这份指南可以收拢成三步:找出工作流里输入长、输出短的判断点,先用现成 API 小流量试跑测准确率,过不了关或涉高后果决策的环节老老实实留给人。底座已经开源,判断件的账已经钉死在 0.042 美元,剩下的活在你的流程里。知乎

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章