化学合理性感知大模型用于单步逆合成
Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis
单步逆合成是计算机辅助合成规划的核心组成部分,然而其本质上的一对多特性在单一答案评估和基准测试协议中未能得到充分体现。为解决这一问题,我们引入了Top-K提示作为一种稳健的训练与推理范式,以更好地捕捉多样且合理的反应预测。我们构建了CREED-CCV-2+USPTO-XL,一个包含约4560万个已验证反应的大规模数据集,用于训练C3LM(化学约束一致性语言模型)。通过将微调与基于ChemCensor和面向新颖性的奖励相结合,我们的模型在OOD URSA-expert-2026基准上达到了最先进的性能。对反应独特性的进一步分析表明,大型语言模型和传统模型探索了互补的反应空间,这推动了基于集成的逆合成系统的发展。总体而言,我们的结果确立了Top-K、合理性感知训练作为未来基于LLM的稳健合成规划的一个实用新方向。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力