精选70AK论文研究
优化训练策略的幻象:单调推理策略才是LLM强化学习的真正目标
The Mirage of Optimizing Training Policies
The Mirage of Optimizing Training Policies
Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力