微软发布 Microsoft-Decision-1:基于 Qwen3.5-9B
微软发布 Microsoft-Decision-1:专做“选择题”的 AI 模型,基于 Qwen3.5-9B 后训练
专为 Agent 路由和结构化判断设计的轻量模型,性能数据详实且成本极低,做 AI 工程落地的同学值得重点关注。
微软发布 Microsoft-Decision-1:专做“选择题”的 AI 模型,基于 Qwen3.5-9B 后训练
微软推出新模型 Microsoft-Decision-1。它不写文章也不聊天,只做一件事:给定几个选项,快速判断该选哪个,并给每个选项打一个概率分。Satya Nadella 在 X 上宣布了这个模型,它已在微软的 AI 开发平台 Microsoft Foundry 上线,之后还会上 OpenRouter(一个聚合多家模型的 API 平台)。
微软把这类模型叫“决策模型”。大语言模型擅长生成文字、推理复杂问题,但软件里很多 AI 调用其实只是在做判断:这条用户反馈属于哪一类?这个请求该交给哪个模型处理?智能体下一步该继续、重试,还是交给人?这类问题的答案都在固定选项里,拿大模型来答又慢又贵。决策模型直接输出结构化结果,程序拿到就能用。
它是在阿里开源模型 Qwen3.5-9B 的基础上后训练出来的,只算一遍就出结果。支持是/否题、多选题和打分,也能按评分标准给 AI 的回答或智能体的动作打分。微软说之后会换到自家 MAI 模型和 OpenAI 的模型上重新训练。
它输出的概率是“校准过”的:模型说有 90% 把握时,实际大约十次能对九次。开发者可以据此设门槛,把握高就自动执行,把握低就转人工审核。
以下性能数据都来自微软自己的测试。在 36 个基准、近 15 万道题的对比里,它的准确率最高。速度上,它比第二名 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 快约 35 倍。微软还测了稳定性:把同一个请求换种说法、打乱选项顺序等,一共八种改动,判断结果平均只有 1.3% 会变,打乱选项顺序时一次都没变。
速度之所以重要,是因为智能体干活经常要连着做几十个小判断。每个判断慢 100 毫秒,20 步下来就要多等 2 秒。
微软内部已经在用。Xbox 研究团队用它把 1 万多条玩家反馈和评论按主题归类,质量和 GPT-6 Sol 相当,速度快 14 倍以上,成本低 200 倍。Copilot 团队用它给回答质量打分,效果接近 GPT5.6 Luna,速度快 100 倍。
对开发者来说,它适合那些答案在有限选项里的环节,比如模型路由、意图识别、内容审核、数据打标签、给 AI 输出当评委,以及让 AI 操作电脑时选下一步点哪里。把这些环节从大模型换成它,延迟和账单都能降下来。
价格是每百万输入 Token 0.042 美元,输出免费。现在就可以在 Microsoft Foundry 的模型目录里调用。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力