精选75Hugging Face 每日论文(json_list)论文研究
R^3-Bench:共享预算下LLM资源理性推理不足
R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets
在认知科学中,资源理性探讨的是智能体应如何分配有限的计算资源以最大化预期价值。大多数推理和智能体基准测试采用独立的每任务预算;现有的共享预算研究并未将套件性能与同一模型所展示的单问题能力进行校准。我们引入了R^3-Bench,该基准在数学、竞争性编程和抽象推理领域,于无工具和智能体设置下,评估共享预算下的六问题套件。匹配的单问题响应曲线定义了一个基于观察成功的离线经验预言机。在六个模型的72个主表单元格中,预言机均值在所有单元格中均达到或超过竞赛均值,并在71个单元格中严格更高。在适度的无工具压力下,对于六个模型中的四个,均等分配重放也超过了竞赛表现。轨迹诊断揭示了有限的策略更新和依赖压力的失败模式。在强智能体压力下的三模型诊断中,至少有一个固定调度器在九个单元格中的六个超过了竞赛均值,但没有任何策略在所有领域占优。这些结果揭示了已展示能力与共享预算实现之间的持续差距。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力