跳到主内容
@wquguru
精选70Hugging Face 每日论文(json_list)论文研究

FlavourBench:基于可执行烹饪逻辑的模型基准测试

FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth

原文
发到 X

开放式语言模型基准测试通常继承一个评判者:人类偏好小组、另一个模型,或脆弱的精确匹配键。我们引入了 FlavourBench,这是一个自动化基准测试,其中版本化的烹饪系统提供密集的可执行真实情况。每个任务呈现八种食材,并要求提供一个三成分组合;在模型执行之前,Epicure 对所有 56 种可能的组合进行评分。我们在涵盖替换、配对和受限组成的相同 534 个任务核心上评估了 27 个前沿端点。每个排名模型在每个小组和家庭中恰好有 89 个有效响应(总共 14,418 个模型-任务单元),消除了排行榜上的差异缺失性。FlavourBench 分数是冻结任务分数的等家庭均值。我们使用 50,000 个锚点聚类自助重抽样来进行同时 95% 的分数区间,以及 100,000 个符号翻转抽取来进行所有 351 对模型对比,并采用 Holm 控制。两个独立编译的小组相关系数为 r = 0.89(秩 rho = 0.80)。Grok 4.6 具有最大的点估计值 65.1(同时 95% CI 61.0-69.2);351 对模型中有 101 对得到解决。发布内容包括提示词、所有组合评分图、原始响应、确切路径、内容哈希和一个离线验证器,后者可以重建每一个结果。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近