跳到主内容
@wquguru
精选88Hugging Face 每日论文(json_list)论文研究

Nemotron-3-Nano-CC在IOI编程竞赛中超越人类金牌成绩

Post-Training Language Models for Gold-Medal Performance in Coding Competitions

原文
发到 X
推荐理由

这是首个在IOI正式赛制下超越人类最高分的AI系统,验证了特定领域后训练与测试时计算的巨大潜力,值得关注。

竞技编程已成为衡量大型语言模型推理能力的关键测试,国际信息学奥林匹克竞赛(IOI)和国际大学生程序设计竞赛(ICPC)代表了最具挑战性的场景。我们提出了一套端到端的专项优化流程,结合大规模问题筛选、合成推理轨迹、监督微调(SFT)和强化学习(RL)。利用 22,000 道精选题目,我们通过 SFT 和 RL 训练了 Nemotron-3-Nano-CC(30B-A3B),仅通过 SFT 训练了 Nemotron-3-Ultra-CC(550B-A55B)。此外,我们还引入了 GenCorrect,这是一种基于反馈的测试时计算策略,可迭代地生成、评估并优化多种解决方案。在 IOI 2025 中,Nano-CC 在训练后得分从 130 分提升至 291 分,在使用 GenCorrect 后达到 468 分,超过了 438.3 的金奖线;而 Ultra-CC 达到了 502 分。受这些结果启发,我们开发了一个针对竞赛的 Ultra-CC 系统,并在 IOI 2026 期间进行了前瞻性评估。在与人类选手相同的时间限制、互联网访问权限和提交次数限制下,该系统获得了 535.4/600 的高分,不仅超过了 361.12 的金奖线,也超越了最高的人类选手得分 498.27。据我们所知,这是首个在 IOI 试题集上得分超过最高分人类选手的 AI 系统。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近