张大妈

微软发布Decision-1:底座换成开源Qwen3.5-9B,AI竞争的规则正在改写

源自19位全网作者

10-10 17:05

10月9日,微软CEO萨提亚·纳德拉宣布推出Microsoft-Decision-1,一款专为结构化决策设计的新模型——它的底座,是阿里开源的Qwen3.5-9B。这个模型不做对话、不生成文本:输入一组固定选项,单次推理直接输出每个候选答案的校准概率分数,下游应用据此决定任务是继续执行、重新尝试、升级处理,还是交由人工审核。 这不是一篇"又强了一个模型"的故事,它的新意在两处:微软把开源中文模型写进了自家商用AI产品的技术架构,而这个模型被定位成插进流水线里的"零件",不是独立的终点。底座怎么选、价格怎么定、能力怎么交付,三者合在一起指向同一个趋势——大模型竞争正在进入"开源底座+场景专才"的阶段。微博知乎

一个只做选择题的模型

微软给Decision-1的功能定位是路由分发、内容分类、任务优先级排序、结果验证和工作流控制,可以嵌入现有应用、AI代理和工作流系统。有技术博主把它说得更直白:它是AI智能体里的"调度中枢",不是通用大模型,不擅长开放式文本生成,只负责从预设选项里做判断。知乎微博

微软公布的数字是:在近15万道盲测题目、36项基准测试中准确率最高,运行速度比OpenAI的GPT-6 Sol快约35倍、比Quyet-1.0-Large快4.5倍。这个35倍不是9B小模型在跑分上碾压旗舰,而是任务匹配:决策环节要的就是短、快、稳的输出,通用旗舰在这个场景里一大半算力花在了不需要的生成上。微博知乎

已披露的内部用例里,最具体的是Xbox Research:用它对逾1万条游戏反馈分类,质量与GPT-6 Sol相当,速度超出14倍以上,成本降低约200倍;Copilot团队则测得它在AI响应评估任务上与GPT-5.6 Luna表现相近。知乎

数字的口径要说清:以上"第一"和倍数全部来自微软自测,官方表述同样明确,独立第三方验证目前尚未完成。知乎

输出免费:把成本结构直接写在价签上

定价是每百万输入token 0.042美元,输出免费。决策类任务的形状是输入长、输出短——数据、候选方案、约束条件、历史记录全都要进来,出去的往往只是一个选项加一个分数,收入本来就集中在输入侧;"输出免费"不是让利,是把既有的成本结构摊开说破、顺手做成钩子,比全场打折更诚实。这套价格与Jev完全一致也被知乎用户点破——按其说法,“看起来 Jev 这个赛道的门槛是真的低”。微博知乎知乎

从定义品类到挤满人,只用了三周

这个品类的第一定义者是前OpenAI研究员团队创办的TypeSafe AI:9月15日发布Jev,首个明确以"System One"定位的专用决策模型——只做结构化判断、不生成文本,把"决策"从大模型里拆了出来。Jev发布时的口径相当激进:创始人Diogo Almeida称,速度快40–200倍、输入成本便宜5–238倍、输出接近免费。微博微博

三周左右,赛道从无人区变成早高峰:微软、OpenAI、Cloudflare、Perplexity等已相继推出或上线类似的决策专用模型与API。微博

开源侧的动作更快:Cloudflare开源了Clef和Clef Flash(参数量27B和9B,基础模型正是Qwen3.8-27B和Qwen3.5-9B),国产的StartLux一口气开源0.8B到35B-A3B整套Qwen系模型;两者在社区基准Decision Index 0.2.1上的成绩都压过了Jev——这套评测是Jev发布后才出现的,把GPQA、MMLU等原本测LLM能力的榜单整体改造成决策题,被视为当前针对这类模型比较可信的第三方尺子。门槛还在继续下探:Unsloth公开的本地复现方案显示,用LoRA(r=64)微调一个Clef头、训练一个epoch,就能把Qwen3.5 0.8B在3个决策基准上的综合准确率从20.7%提到74.3%,显存只占4GB。知乎微博

底座成了可替换的零件

把这条线连起来看,趋势就很清楚了:Cloudflare拿Qwen做开源决策模型,微软拿Qwen做商用决策模型,而Decision-1的底座本身也被微软标成了可替换件——计划未来迁移到自家MAI系列和OpenAI模型之上。底座不再是护城河,而是起跑线;竞争重心从"谁家的模型更强"挪向"谁家的场景、数据和分发管道更强"——用一位知乎用户的说法,模型在变成零件,平台在变成插座。边界也要画清:“用开源"不等于"自己开源”,就目前的公告口径,Decision-1仍是仅通过API提供的闭源产品,微软没有放出它的权重。对开源生态而言,这次发布的意义是头部大厂以最实在的身份——采购底座的最大客户——给开源中文模型做了一次价值背书:同一个Qwen3.5-9B,现在既是Cloudflare开源Clef Flash的起点,也是微软闭源Decision-1的起点。知乎知乎

接下来看什么

  • "36项基准全部第一"能否扛住复测:自测基准的数字要打折听,社区尺子Decision Index 0.2.1还没有Decision-1的成绩。知乎

  • 分发与竞争节奏:微软已通过旗下AI开发平台Microsoft Foundry向开发者开放该模型,OpenRouter的接入在计划之中;同类产品还在加码,社区信息显示OpenAI将基于Luna发布自己的决策类模型。知乎知乎

  • 换成MAI或OpenAI底座后性能是否保持:如果底座随便换、结果不掉队,那才真正说明竞争力沉淀在后训练数据和场景,而不在底模本身。知乎

对关注AI开源生态的人来说,最值得盯住的变化是:底座的身份之争正在退场,稳定的开源权重、齐全的社区生态和足够低的零件成本,将决定下一轮竞争里谁站在上游。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章