精选80Hugging Face 每日论文(json_list)论文研究
PACE-Bench:动态环境下基于代码演化的物理适应基准
PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
自我进化智能体通过交互经验改进未来行为,然而现有评估通常在固定执行条件下进行优化,并未测试这些条件变化后的恢复能力。为弥补这一空白,我们引入了PACE-Bench(基于代码演化的物理适应基准),这是一个基于模拟器的基准测试,涵盖六个物理领域的144个源到目标适应对。每对将一个源环境与一个具有相同目标和接口的变异目标环境相连。在源环境中成功的代码驱动设计在目标环境中会失败,智能体必须在有限的尝试预算内,利用诊断性沙盒反馈,迭代地将其调整为可行的目标设计。我们比较了来自四种范式的十种自我进化方法。该基准远未饱和:Reflexion + Qwen3-14B仅在全部基准对的35.9%上成功,而GPT-5.5在完整预算下解决了静力学子集的66.7%。这些结果共同表明,基于模拟器的反思比未经验证的自我修订更可靠,而记忆将智能体锚定在早期设计上,广泛的树搜索则探索而不收敛。即使揭示确切的物理变化也不会提高性能上限,这指向机制重新设计而非参数推断是核心瓶颈。数据和代码可在https://github.com/thunlp/PACE-Bench获取。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力