跳到主内容
@wquguru
精选80Hugging Face 每日论文(json_list)论文研究

TTPO:无需标签的测试时策略优化,数学推理能力大幅提升

TTPO: Test-Time Policy Optimization

原文
发到 X

近期突出的后训练方法,如强化学习(RL)和同策略自蒸馏(OPSD),已推动大型语言模型在数学推理方面取得快速进展,然而它们对真实标签的依赖阻碍了测试时训练(TTT)。用多数投票伪标签替代真实标签是一种自然的替代方案,但它很脆弱:一个错误的投票会污染教师模型并误导每个令牌。我们观察到这种失败模式是不对称的:与伪标签不一致的展开通常都是错误的,无论投票本身是否正确。基于这一观察,我们提出了测试时策略优化(TTPO),这是一种不对称目标,通过OPSD蒸馏一致的展开,并通过分组RL惩罚不一致的展开。令牌级选择进一步优化了两个分支:蒸馏降低已收敛位置的权重,而RL仅惩罚自信的错误。即使在频繁的伪标签错误下,两种更新仍然保持良好基础,并且随着模型改进,多数投票路由产生更紧密的自监督。在没有标签的情况下,TTPO在五个竞赛级基准上匹配了标签监督的OPSD,在TTT中将Qwen3-1.7B从38.0%提升至45.2%,在不思考的情况下获得+25.2%至+36.4%的提升,并显示出强大的跨任务泛化能力。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近