跳到主内容
@wquguru
精选88meng shao产品发布/更新

GitHub 发布 HydraFusion:多模型动态编排实现低成本前沿代码质量

GitHub 推出一个研究预览版“复合模型”:HydraFusion

原文
发到 X
推荐理由

Agent 开发者的实用参考,HydraFusion 展示了如何通过多模型编排而非单一模型堆料来平衡成本与性能,其中的 Cascade 和 Critique 模式设计值得借鉴。

GitHub 推出一个研究预览版“复合模型”:HydraFusion TerminalBench 评测质量超过 Opus 5 且成本只有 1/3 🤩

开发者在 Copilot 里把它当作一个普通模型选择,但它在运行时会为每个任务动态构建一条跨供应商、多模型的执行流程,目标是以显著更低的成本达到前沿模型水平的代码质量。核心理念是:从"选最好的模型"转向"为每个任务动态构造最好的解法"。 https://github.blog/ai-and-ml/github-copilot/project-hydrafusion-frontier-quality-via-multi-model-orchestration

核心机制:三种执行模式 HydraFusion 把"怎么解这个任务"当作一个优化问题,依据推理、代码生成、调试、工具使用等能力信号,为每个请求选择三种模式之一: 1. Single:一个模型直接解题 2. Cascade:高效(便宜)模型先起草,经过一道质量门判断是否接受,不合格则升级到更强模型 3. Critique:模型 A 起草 → 来自另一模型家族的独立、只读批评者审阅(沿用 Rubber Duck 的审查模式)→ A 修订一次 关键词是选择性:系统总是选择"预期能达到质量要求的最简单流程",只有当额外调用大概率能提升结果时才增加模型调用。

五条工程原则 1. 完整核算:把起草、批评、修订、升级、重试、回退每一段的成本和用量全部汇总——不藏成本。 2. 有界执行:每一段都有明确的超时和取消机制,防止成本和时间失控。 3. 隔离审查:批评者运行在无工具、隔离的上下文中,不能改仓库;求解者才使用共享工作区和正常的权限感知 agent 循环。 4. 故障安全应用:流程被取消或验证失败时不应用任何补丁,避免半成品进入仓库。 5. 验证路由:执行前校验工作流定义、模型绑定、回退行为和模型可用性。

评测结果 在三个 agentic 编码基准上,以 Claude Opus 5 和 GPT-5.6 Sol 为基线(所有模型都设为 medium 推理强度,任务输入、工具、限制、定价假设、评分条件完全一致),指标为验证任务质量(确认正确的任务比例)和完整工作流成本: TerminalBench 2.1:成本低 67%,质量 +4.9% DeepSWE:成本低 36%,质量 -1.5% CheckpointBench:成本低 65%,质量 -0.1%

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近