跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

Acquire, Repair, Preserve

Acquire, Repair, Preserve: A Diagnosis-Guided Post-Training Recipe for Small-Model Dialogue Game Agents

原文
发到 X

交互式对话游戏测试了一种静态基准测试大多未明确体现的能力:模型必须在多轮对话中维持状态、解读反馈,并在不断变化的约束下选择合法操作。我们在 LM Playschool Challenge 环境中使用一个拥有 2B 参数的开源权重模型研究了这一设定,发现许多失败不仅源于广泛的知识缺失,还涉及局部决策失误:例如重复猜测、格式错误的操作以及违反模型刚刚接收到的反馈。这些诊断结果催生了一套围绕三个步骤展开的训练方案:通过监督微调(SFT)获取广泛的参与能力;利用单轮局部的偏好对数据修复在特定对话游戏家族内可机械验证的失败案例;并保留超越这些对话游戏的通用能力。在官方最终评估中,我们的提交将公共 clemscore 从 10.67 提升至 38.92,封闭域内得分从 13.41 提升至 41.17,同时大致保持了整体静态性能(基线为 44.14,我们为 44.24)。域外 clemscore 仍较低,为 7.88,最大提升集中在目标家族的未见变体上。我们的结果表明,广泛的 SFT 带来了模型大部分的能力提升;当失败检测精确时,单轮局部监督可以发挥作用,且观察到的迁移效应主要集中在同一游戏家族内部。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近