国际信息学奥林匹克竞赛(IOI)与国际数学奥林匹克竞赛(IMO)对能力维度的要求截然不同:前者需在严格限制下通过算法代码的隐藏测试,后者则依赖严谨的自然语言证明。能在任一赛事中脱颖而出已属不易,若同时在两项比赛中均获佳绩,则意味着技术层面取得了更为广泛的突破。

最新结果显示,Nemotron已成为构建世界级专业模型的强大基础平台。基于Nemotron 3,团队结合监督微调(SFT)、强化学习(RL)及反馈驱动的推理机制,打造出在IOI 2026和IMO 2026中均达到金牌水平的系统。

双赛金牌成绩详解

在IOI 2026中,采用Nemotron-3-Ultra-CC并结合SFT和GenCorrect技术的配置,最终得分535.4/600。这一成绩不仅远超361.12分的金牌分数线,更突破了人类选手498.27分的最高纪录。需注意的是,该IOI成绩源于一次与人类参赛者限制完全一致的实时前瞻性运行,属于非官方、无监督的基准测试,未计入官方排名。

在IMO 2026中,Nemotron 3 Ultra通用版采用生成-验证-优化系统中的SFT和RL检查点,最终获得30/42分,超过官方金牌分数线(29分)。其提交的证明均由官方IMO评审员进行评分。

可复用的专业化微调配方

真正的“易于微调”不应仅指模型具备可训练性,更意味着强大的基础模型能通过清晰、可复用的配方适应高难度领域。该配方包含四个核心步骤:

  1. 以强大的Nemotron基础模型为起点;
  2. 整理特定领域题目及高质量推理轨迹;
  3. 应用SFT等标准后训练方法,必要时引入RL;
  4. 将专业模型与生成、评估及改进候选答案的推理循环相结合。

尽管训练和推理规模庞大,但底层方法熟悉且可重现。团队无需为每个挑战重建基础模型,而是对Nemotron进行了任务专业化适配。

从通用编码到IOI金牌的演进

在竞技编程领域,团队整理了22,000道题目并生成合成推理轨迹,训练了两个专业模型:总参数300亿的Nemotron-3-Nano-CC(经SFT和RL训练)以及总参数5500亿的Nemotron-3-Ultra-CC(经SFT训练)。

IOI 2025的表现演进清晰印证了专业化的价值。Nano模型在后训练前得分为130分,经SFT提升至280分,再经RL提升至291分。借助“生成-评估-优化”策略GenCorrect,其得分跃升至468分,超过438.3分的金牌门槛。Ultra-CC在同一测试时策略下达到502分。

实验表明,适配方式因模型规模而异。对于Nano模型,SFT带来主要增益,RL提供辅助改进;而对于性能更强的Ultra模型,仅需一轮SFT即可在IOI、ICPC和LiveCodeBench Pro上超越完全后训练的Nano模型。这一发现指导了IOI 2026专用Ultra-CC系统的构建,并最终斩获535.4分。

教导模型证明、检查与修订

IMO项目将相同理念应用于奥林匹克数学。基于Nemotron 3 Ultra,团队训练了SFT和RL两个专业模型。SFT语料库包含414,890个经质量过滤的示例,涵盖15,818道独特证明题,旨在教会模型构建论点、识别漏洞及判断证明完整性。RL模型则在9,597道接近能力边界的证明题上进行训练。

开发实验显示,SFT检查点在第一轮搜索中表现最强,RL检查点则实现了最佳的整体单检查点结果。最终系统互补使用了这两个专业模型及通用模型。针对每道题目,模型生成候选证明、评分并提出批评意见,通过独立的高算力阶段选择最终提交内容。整个系统仅使用自然语言,无需形式化证明器或外部工具,最终在六道题中四道获得满分。

微调与测试时算力的协同效应

此前的研究已展示测试时算力如何将开放权重模型推向金牌水平。新结果进一步补充:更好的专业化赋予推理系统更优质的候选答案、更敏锐的批评者及更有效的优化手段。

在IOI中,GenCorrect将微调增益通过多轮反馈放大;在IMO中,互补使用SFT和RL检查点比单纯增加采样更具价值。最佳结果均源于强大专业模型与搜索、验证、改进系统的结合。奖牌并非仅由微调或暴力采样产生,而是模型、数据和推理循环共同设计的成果。

开源模型、数据与配方

为使成果超越竞赛本身,Nemotron Labs IMO 2026集合已在Hugging Face上线,包含SFT和RL检查点、训练数据集及新的Nemotron-IMO-Bench基准(含200道奥林匹克级别题目)。相关论文描述了训练方法及生成-验证-优化系统,NeMo-Skills仓库则提供了推理管道、提示词及可复现指南。此外,Nemotron-3-Ultra-CC模型及IOI训练配方、GenCorrect方法论也已公开。

综上所述,IMO和IOI的成绩有力证明:Nemotron可被微调为世界级的领域专家,并与透明的推理工作流组合,解决人类竞争前沿的问题。社区接下来基于这些开放资源构建的成果,值得期待。