跳到主内容
@wquguru
精选70Hugging Face 每日论文(json_list)论文研究

CLR:声明级可靠性评估提升测试时推理效率

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

原文
发到 X

我们提出以声明级证伪作为测试时扩展的原则,并通过声明级可靠性评估(CLR)加以实例化,这是一种无需训练的框架,将测试时计算从额外的解决方案采样重新分配至有针对性的验证。由于整体轨迹评估常因常规令牌的信号稀释而掩盖决定性错误,CLR将每条推理轨迹浓缩为一组决策关键声明,从而隔离其逻辑锚点。此外,鉴于在固定模型能力下生成完全正确解决方案的固有难度,CLR将重点转向语义证伪。这种方法利用了解决方案构建与声明反驳之间的根本不对称性。构建有效解决方案需要无懈可击的推理路径,而反驳错误声明仅需识别一个决定性缺陷。这种针对负面证据的定向搜索系统性地压缩了高置信度错误轨迹的生存空间,通过非线性可靠性评分有效抑制错误共识。在匹配预算下,跨四个LLM和四个推理基准,CLR通常优于pass@1和自一致性。例如,在GPT-OSS-20B/CMIMC25上,CLR超过pass@1达27.15个百分点,并将自一致性准确率从77.50%提升至82.19%,同时减少37.0%的令牌使用。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近