跳到主内容
@wquguru
精选80Hugging Face 每日论文(json_list)论文研究

J-Zero:零数据下挑战者-求解器-裁判协同进化框架

J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data

原文
发到 X

自进化语言模型近期作为通往超级智能的一条有前景路径而出现,其优势在于降低人类监督成本。尽管在可验证领域已取得显著进展,但在不可验证领域中的自进化研究仍相对不足。我们提出从零数据出发的评判者协同适应(J-Zero),这是一个统一的挑战者—求解者—评判者协同进化框架,支持在两大领域中的自我改进。挑战者与求解者通过对抗性互动共同进化:挑战者生成日益困难的任务,而求解者则学习为其产出更高质量的回应。与此同时,评判者利用偏好对进行协同适应,这些偏好对的排序是预先根据各回应产生方式确定的,即求解者的答案优于挑战者的答案,以及其分解再重组后的答案优于其一次性答案,而非依据评判者自身的评分。J-Zero在可验证领域平均超越基线4.2分,在不可验证领域平均超越8.0分,并且至少持续改进十轮迭代,而基线在两轮后即出现退化。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近