精选75Hugging Face 每日论文(json_list)论文研究
无CoT数据下,混合SFT优于下一块推理RL
Is Next-Chunk Reasoning RL Really Better than SFT? Revisiting Training Strategies under no-CoT Data
近期研究提出了下一块推理强化学习(next-chunk reasoning RL),用于利用无思维链(no-CoT)数据——即包含丰富推理内容但缺乏显式思维链标注的语料,如解题过程和教科书推导。该方法训练模型生成隐式推理轨迹,并根据其预测下一块文本的能力给予奖励。尽管前景可观,现有评估主要与常规SFT基线对比,尚不清楚收益究竟源于强化学习本身,还是更有效地让模型接触no-CoT数据。我们通过一项对下一块推理强化学习的受控研究,以及一个简单但此前被忽视的替代方案——混合SFT(Mixed SFT),即单一监督微调阶段联合训练no-CoT和长思维链(long-CoT)数据——来解答这一问题。尽管简单,混合SFT在RLVR后的性能上限明显高于下一块推理强化学习,同时训练计算量减少超过60倍。这一优势在领域内数学推理和领域外推理任务中均保持一致。此外,我们表明,RLVR前更高的准确率并不必然转化为RLVR后更高的准确率,这凸显了在完整后训练流程背景下评估no-CoT训练策略的必要性。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力