跳到主内容
@wquguru
精选88meng shao模型发布/更新多源精选 ×8

Google发布Gemini 3.8 Flash,成本仅为Opus 5的1/7

Gemini 3.8 Flash 发布:3.7 Flash 的速度和价格,接近前沿大模型的推理与编码能力

原文
发到 X
推荐理由

Flash系列在保持低价的同时实现显著的性能跃迁,性价比极具冲击力,做Agent和工程落地的同学值得重点关注其成本效益曲线。

Gemini 3.8 Flash 发布:3.7 Flash 的速度和价格,接近前沿大模型的推理与编码能力

六周内第三次发布 Flash 系列模型(距 3.7 Flash 仅三周),迭代节奏明显加快。这次发布的是 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。 https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber

看看 3.8 Flash 的基准测试表现

3.8 Flash 领先的项目: · Vals Finance Agent v2 61.4%,高于 Opus 5 的 58.6% · Harvey 法律智能体 10.0%,同组最高 · Terminal-bench 2.1 89.4%,略高于 Opus 5 的 89.1% · CharXiv Reasoning 86.2% · LVBench 87.8%(agentic)/ 87.1%(static),领先幅度较大 · HLE-Verified 54.9%,与 Opus 5 的 54.4% 及 GPT-5.6 Sol 的 54.5% 基本持平 · BioMysteryBench 高难度子集 56.5%,LABBench2 86.2%

3.8 Flash 未领先、且差距明显的项目: · GDPVal-AA v2(知识型工作)Elo 1545,Opus 5 为 1824,差距约 280 分,这是表中最大的落差 · Terminal-bench 4.0(通用智能体能力)19.1%,Opus 5 为 51.8%,GPT-5.6 Sol 为 37.3% · OSWorld-2.0(智能体电脑操控)59.0%,Opus 5 为 75.4% · DeepSWE v1.1 为 73.7%,略低于 Opus 5 的 74.0%,但已高于 GPT-5.6 Sol(72.7%)和 Sonnet 5(53.8%) · GDP.PDF 专家级 PDF 理解 35.0%,GPT-5.6 Sol 为 40.0%

相对 3.7 Flash 的进步幅度: · 提升最大:BioMystery 高难度 +13 个百分点、DeepSWE +8.4、OSWorld +8.4、Terminal-bench 4.0 +7.9 · 提升较小:HLE-Verified +1.3、CharXiv +1.7、Vals Finance +2.4

成本效率:真正的核心论点

3.8 Flash 在约 73–74% 准确率下,单任务平均成本约 $1.5–2;Opus 5 达到 74% 需约 $13,Fable 5 约 $15。

在长程软件工程任务上,3.8 Flash 以约 1/7 到 1/8 的任务成本实现了几乎相同的通过率,处于图中"最高效"区域的帕累托前沿。

从 3.5 Flash(约 33%)→ 3.6 Flash(约 46%)→ 3.7 Flash(约 65%)→ 3.8 Flash(约 74%),Flash 系列在一年内在几乎不变的成本下持续拉高上限。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近