跳到主内容
@wquguru
精选88云头条模型发布/更新多源精选 ×6

微软发布决策模型Microsoft-Decision-1

微软叫板 Jev:底牌竟是阿里 Qwen!

原文
发到 X
推荐理由

微软直接基于开源权重推出专用决策模型并公布详细性能数据,对Agent路由架构有直接影响,值得开发者关注。

2026 年 10 月 10 日,微软发布 AI 决策模型 Microsoft-Decision-1,加入与 TypeSafe AI 旗下 Jev 的竞争。

这款约 90 亿参数的模型基于阿里云开放权重模型 Qwen3.5-9B 进行后训练。

9 月 10 日,Jev 运营主体 TypeSafe AI 完成 8.7 亿美元(58.22 亿元人民币)融资,估值达到 75 亿美元(502 亿元人民币)。《刚刚、爆火的 Jev 融资 58 亿!不聊天、不写代码!专门帮软件做决策,估值 500 亿》

微软公布的测试结果显示,其在 36 项基准测试中准确率排名第一,响应速度约为 GPT-6 Sol 的 35 倍。

不聊天、不写文章,微软推出专用 AI 决策模型

与 ChatGPT、Claude 等通用大语言模型不同,Microsoft-Decision-1 主要用于从给定的选项中作出判断,而非生成开放式文本。

开发者提供问题、相关内容和固定答案选项后,模型会返回各选项经过校准的概率分数,支持是非判断、多项选择和评分,也能根据预设标准评估 AI 回答及智能体拟执行的动作。

微软将其定位于分类、请求分流、优先级排序、验证和工作流控制等任务。

例如,当 AI 智能体需要判断下一步应该继续执行、重新尝试还是转交人工处理时,就可以使用这类模型完成决策。

Microsoft-Decision-1 的上下文窗口为 32,768 个 Token,仅支持文本输入,不生成解释,也不面向聊天、翻译、摘要或开放式问答。

微软披露,其训练数据包括公开数据集和团队生成的合成数据。

目前,微软尚未公开 Microsoft-Decision-1 自身的模型权重。

36 项测试拿下第一,速度达到 GPT-6 Sol 的 35 倍

微软公布的测试结果显示,在涵盖近 15 万道题目的 36 项基准测试中,Microsoft-Decision-1 的平均准确率达到 83.5%,位居参测模型首位。

在概率校准测试中,Microsoft-Decision-1 获得 92.2 分,排名第三,落后于 Jev 的 93.7 分和 Quyet-1.0-Large 的 93.1 分。

微软还在更新后的官方技术资料中补充了 Jev 的准确率和概率校准测试结果。

响应速度方面,Microsoft-Decision-1 的中位延迟为 85 毫秒,H2O-Lightning-4B v1.1 为 210 毫秒,GPT-6 Sol 为 3.01 秒。

按照这些数据计算,微软模型的响应速度分别约为后两者的 2.5 倍和 35 倍。

微软还将其与 Jev 进行比较。

Jev 的中位延迟为 240 毫秒,约为 Microsoft-Decision-1 的 2.8 倍。

不过,微软模型的延迟通过 Foundry 测量,其他模型采用 JevBench 的调整后中位延迟数据,比较结果不代表完全相同条件下的性能差距。

微软还测试了模型的稳定性。

研究人员对相同请求进行了八种形式的调整,包括修改表达方式、改变选项顺序和调整格式等。结果显示,模型平均有 1.3% 的决策发生变化,在改写选项描述或调整选项顺序的测试中,没有出现决策变化。

此外,微软使用覆盖 11 项基准测试的 5250 个请求评估模型安全性,测试内容包括有害请求、越狱攻击和提示词注入。

Xbox、Copilot 已经用上,成本降至 1/200

微软旗下 Xbox 研究团队已经使用 Microsoft-Decision-1,处理来自调查问卷、Steam 和 X 的超过 1 万条开放式玩家反馈及评论,并按照研究人员预设的主题进行分类。

微软称,在这项任务中,该模型的分类质量可与 GPT-6 Sol 竞争,处理速度超过后者的 14 倍,成本约为后者的 1/200。

Copilot 团队则使用该模型评估聊天及 AI 智能体生成内容的质量。

根据微软公布的测试结果,其质量可与 GPT-5.6 Luna 竞争,速度约为后者的 100 倍。

微软还将 Microsoft-Decision-1 用于故障响应和科学研究。

在运维场景中,该模型可以辅助检索日志、工单、通话及消息中的相关信息。Microsoft Discovery 团队则将其用于实验规划调整。

微软称,在科学研究场景中,与基于大语言模型的评分方案相比,Microsoft-Decision-1 的评分结果一致性达到前者的 46 倍,评分速度达到 3 倍,并使自适应重新规划的执行速度提高至接近 4 倍。

每百万输入 Token 仅 0.042 美元,微软还准备换底座

目前,Microsoft-Decision-1 已通过 Microsoft Foundry 提供服务,开发者也可以通过 OpenRouter 调用。

微软公布的价格为每百万输入 Token 0.042 美元,输出 Token 免费。按照这一价格计算,处理 1 亿个输入 Token 的费用为 4.2 美元,不包括其他可能产生的服务费用。

微软官方表示,未来将继续开发 Microsoft-Decision-1,并计划采用其他基础模型,包括 Microsoft AI(MAI)和 OpenAI 的模型,但尚未公布具体型号及切换时间。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

作者: 云头条

查看原文 →

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →