Gambit:思维级束搜索提升推理模型测试时计算效率
Thought-Level Beam Search for Reasoning
测试时计算扩展是大型推理模型(LRM)性能的主要驱动力,但极端低效限制了当前方法,关键问题从花费多少计算转变为将计算分配到哪里。我们将测试时推理形式化为一个在部分轨迹上的受限计算分配问题。在固定硬件预算下,现有范式未能主动将计算分配给最有希望的部分进展:传统的并行采样独立处理轨迹并导致严重的内存瓶颈,而减法剪枝则使硬件饥饿,无法主动且充分地转移输出分布。为了克服这种二分法,我们引入了Gambit,一种执行思维级束搜索的推理算法。通过定期剪枝无望的轨迹并立即从高质量前缀分支,Gambit通过轻量级评分器探测隐藏状态,动态地将计算集中在最有希望的推理轨迹上,同时保持持续的高硬件利用率。跨多个模型和基准的广泛评估表明,Gambit严格优于现有基线。在相同硬件约束下,我们的方法在HMMT-24上相比剪枝基线取得了高达+6.7%的绝对准确率提升,在AIME-25上取得了+3.3%的提升,在轨迹完成方面提供了>2倍的吞吐量,并且相对于标准并行采样将总令牌消耗减少了高达68.5%。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力