跳到主内容
@wquguru
精选75Chubby♨️模型发布/更新

GPT-6 Sol与Luna基准测试及API定价对比

Benchmarks GPT-6 Sol & Luna:

原文
发到 X

Benchmarks GPT-6 Sol & Luna:

GPT-6 Sol 与 Luna 基准测试:

• FrontierCode: 48.4% vs. Fable 5.1’s 48.7%, both at xhigh. $1.37 vs. $9.27 per task, roughly 85% cheaper.

• FrontierCode:48.4% vs. Fable 5.1 的 48.7%,均在 xhigh 级别。每任务成本 $1.37 vs. $9.27,便宜约 85%。

• DeepSWE: 68.8% at max vs. Fable 5’s best result of 69.9% at xhigh. $2.74 vs. $13.41 per task, roughly 80% cheaper.

• DeepSWE:max 级别下为 68.8% vs. Fable 5 在 xhigh 级别的最佳结果 69.9%。每任务成本 $2.74 vs. $13.41,便宜约 80%。

• AutomationBench: 33.2% at xhigh vs. Fable 5.1 with Opus 5 fallback at 31.4% on max. $0.27 vs. at least $2.45 per task.

• AutomationBench:xhigh 级别下为 33.2% vs. Fable 5.1 配合 Opus 5 回退机制在 max 级别下的 31.4%。每任务成本 $0.27 vs. 至少 $2.45。

GPT-6 Luna: • DeepSWE: 66.6% at max vs. Fable 5’s 65.4% at medium. $0.22 vs. $6.09 per task, roughly 96% cheaper.

GPT-6 Luna: • DeepSWE:max 级别下为 66.6% vs. Fable 5 在 medium 级别下的 65.4%。每任务成本 $0.22 vs. $6.09,便宜约 96%。

API pricing per million input/output tokens: • Sol: $2 / $10 • Luna: $0.10 / $0.50

API 按百万输入/输出 token 定价: • Sol:$2 / $10 • Luna:$0.10 / $0.50

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →