跳到主内容
精选85meng shao模型发布/更新多源精选 ×8

Meta 发布 Muse Spark 1.1,强 Agentic 低价格

小扎,对,就是 Meta 创始人 Mark Zuckerberg

原文
推荐理由

做 Agent 开发的开发者必看,Muse Spark 1.1 在工具调用和长程任务上表现突出,且定价低,值得立即测试 API。

小扎,对,就是 Meta 创始人 Mark Zuckerberg

23.07 后时隔三年,小扎再次在 X 发帖,官宣 Meta 新模型「Muse Spark 1.1」发布:强 agentic + 强 coding + 低价格,并通过全新的 Meta Model API 首次向开发者开放。

产品能力:以 Agentic 为核心卖点 · Agentic 性能与工具调用 —— 模型的主战场 · 长程任务 —— 1M token 上下文窗口 · 子 agent 并行委派 —— 可将执行分派给并行运行的 sub-agents · 跨端 GUI 操作 —— 训练用于 desktop / mobile / browser 的计算机界面操作

基准数据中,Agent 类 6 项中有 4 项领先: · MCP Atlas(规模化工具调用)88.1,领先第二约 6 分 · JobBench(专业工具使用)54.7,较前代 17.0 暴涨,碾压竞品(最高仅 48.4) · Humanity's Last Exam 62.1、Finance Agent v2 57.2 均为榜首 · 仅在 Toolathlon 与 OSWorld 略逊于 Opus 4.8

Muse Spark → Muse Spark 1.1 的提升幅度 JobBench:17.0 → 54.7,~3.2× DeepSWE 1.1:10.0 → 53.3,~5.3×

竞争格局:强在 Agent,coding 仍次于一梯队 客观来看,Muse Spark 1.1 并非全方位领先: · Coding:Terminal-Bench 80.0(GPT 5.5 为 83.4)、SWE-Bench Pro 61.5(Opus 4.8 为 69.2)、DeepSWE 53.3(GPT 5.5 为 67.0)——在复杂软件工程上仍落后 Anthropic 与 OpenAI 的旗舰。 · Multimodal:CharXiv 88.4、BabyVision 76.3,均略低于 Opus 4.8 / GPT 5.5。

但结合"very low price"的定价策略,这构成一个清晰的差异化定位:在 agentic 维度逼近或超越旗舰,在 coding/multimodal 维度做到"够用且便宜",对成本敏感的开发者与企业具有显著吸引力。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近