AI News字数 2860阅读时长8 分钟

NVIDIA Nemotron 在 IOI 2026 试题上获得 535.4 分,超过所有正式参赛者

NVIDIA 报告称,Nemotron-3-Ultra-CC 在 IOI 2026 中获得 535.4/600 分,高于最高人类选手的 498.27 分;这是一场非正式的实时运行。

文章目录 · 11
  1. 一、535.4 分意味着什么
  2. 二、该系统不只是一次单模型回答
  3. 三、NVIDIA 以吞吐量换取单样本准确率
  4. 四、已确认的内容与仍待验证的内容
  5. 常见问题
  6. Nemotron 赢得了 IOI 2026 吗?
  7. 正式人类最高分是多少?
  8. 该模型可以访问互联网吗?
  9. 模型是否被限制为每题只能提交一个答案?
  10. 研究人员现在可以复现这一结果吗?
  11. 参考来源

NVIDIA 研究人员报告称,经过竞赛优化的 Nemotron 版本在 2026 年国际信息学奥林匹克竞赛(IOI)题目中获得了 600 分中的 535.4 分。这比正式金牌分数线高出 174.28 分,也比得分最高的人类参赛者高出 37.13 分。

该结果是在竞赛期间、题目尚未公开时取得的,遵循与参赛者相同的两个五小时赛程、互联网限制、评测平台和提交次数限制。NVIDIA 称,这是已知首个在一套 IOI 题目上得分超过领先人类选手的 AI 系统。

不过,它并非正式参赛项目。NVIDIA 的论文明确将该实验描述为“unofficial, unsupervised benchmark”,并表示该运行未由 IOI 监督。该模型没有出现在正式排名中,也没有获得奖牌。

一、535.4 分意味着什么

IOI 2026 于 8 月 9 日至 8 月 16 日在乌兹别克斯坦塔什干举行。375 名参赛者来自 92 个 IOI 成员。在竞赛中,参赛者要解决六道算法题——每个比赛日三道——每题满分为 100 分。

正式结果显示,中国的徐祺文以 498.27 分排名第一。32 名参赛者达到 361.12 分的金牌分数线,银牌和铜牌分数线则分别为 303.28 分和 228.80 分。

因此,若将 NVIDIA 报告的 535.4 分列入计分板,它将排名所有参赛者之前。这相当于满分的 89.2%,而正式冠军为 83.05%。

这一比较具有意义,因为该实验是前瞻性运行,而不是针对公开基准的事后测试。根据技术报告,NVIDIA 在竞赛进行期间、六道题目尚未公开前运行了该系统。这大幅降低了模型从训练数据中记住这些特定题目的风险。

其他多个方面的条件也保持一致。模型不能访问互联网,但可以在本地执行代码。它使用竞赛评测系统,并被限制为每题最多 50 次提交,且通常每分钟最多提交一次。正式规则还会在每次提交后向参赛者提供子任务级别的分数,模型获得了相同类型的反馈。

这里存在一个重要的验证边界。NVIDIA 的 X 帖文称该分数是“as graded by the IOI team”,但随附论文表示模型的运行未由 IOI 监督。正式计分板独立确认了人类分数和奖牌分数线,但未确认模型的 535.4 分。因此,最公平的表述是:这是 NVIDIA 报告的、通过正式评测平台取得的分数,而非经 IOI 认证的竞赛结果。

二、该系统不只是一次单模型回答

实时系统以 Nemotron-3-Ultra-CC 为核心,这是一种面向竞赛编程的 NVIDIA Nemotron-3-Ultra-550B-A55B 改造版本。其底层混合专家模型总参数量为 5500 亿,每个 token 激活其中的 550 亿参数。

NVIDIA 更广泛的后训练项目始于一个包含 22,000 道编程题的语料库,这些题目来自 16 个竞赛体系和跨越约两个十年的在线平台。研究人员将题目打包为可执行环境,其中包含题面、约束条件、测试和参考解答,随后移除了会产生不一致结果的环境。

对于通用 Ultra-CC 模型,研究人员生成了 477,642 条监督微调轨迹。较小的 300 亿参数 Nemotron-3-Nano-CC 模型获得了 120 万条轨迹以及强化学习,但 NVIDIA 因计算成本而未将竞赛编程强化学习阶段应用于 Ultra。

实时 IOI 2026 版本还进行了进一步的竞赛专用适配。NVIDIA 在 2025 年 IOI 任务上评估了 GLM-5.2 和 DeepSeek-V4-Flash,将它们作为候选教师模型。GLM-5.2 得分为 66.0%,平均生成长度为 85,927 个 token;DeepSeek-V4-Flash 则为 55.3% 和 120,456 个 token。经 GLM 训练的 Ultra-CC 变体随后在 2025 年题目上达到 59.4%,而经 DeepSeek 训练的版本为 50.7%,因此 NVIDIA 为实时系统选择了 GLM-5.2 数据。

决定性组件是 GenCorrect,这是一种将评测器的子任务反馈转化为迭代搜索过程的推理方法。在前四轮中的每一轮,系统都会为每题生成最多 200 个候选程序,丢弃无效输出,对剩余程序按行为多样性进行聚类,并选择十个代表程序提交。

这些提交的分数显示哪些子任务已经解决。下一轮随后接收累积的子任务结果,并选择旨在保留已完成子任务、针对未解决子任务且维持多样性的先前解答。该设计利用了 IOI 计分的一项重要特征:参赛者对每个子任务的最终得分,是所有提交中取得的最高分,因此后续程序可以探索题目的不同部分,而不会抹去此前的进展。

在第五轮也是最后一轮中,NVIDIA 将每题候选解答池从 200 扩大至 1,000 个,但仍只提交十个。系统生成了 50 个针对具体题目的测试生成器和验证器,对它们进行筛选以获得 100 个有效测试输入,在本地执行候选程序,并使用模型生成的评分脚本对其排序。五轮下来,该流程每题最多可生成 1,800 个程序,同时遵守正式规则中每题最多 50 次计分提交的限制。

三、NVIDIA 以吞吐量换取单样本准确率

实时部署的峰值配置使用了 760 块 NVIDIA GB300 GPU。这样的硬件规模意味着,这一结果是在时间和提交规则匹配的条件下进行的比较,而不是一名青少年与一个模型实例之间资源对等的竞赛。

为在竞赛窗口内处理大批量候选程序,NVIDIA 将 Ultra-CC 量化为 NVFP4,并使用 FP8 键值缓存,将多 token 预测设为五。在 2025 年 IOI 开发集上,该配置实现了每块 GPU 每秒生成 736.8 个 token——是 BF16 基线每秒 199.1 个 token 的 3.7 倍。

量化降低了单样本准确率。所选配置在 IOI 2025 的 Score@1 上得分为 52.8%,而 BF16 为 59.4%,下降了 6.6 个百分点。NVIDIA 接受了这一取舍,因为 GenCorrect 依赖于在固定的五小时赛程内生成并测试规模大得多的解答池。

早期实验说明了其中原因。在 2025 年题目集上,通用 Ultra-CC 模型在第一轮 GenCorrect 后平均获得 343.9 分,五轮后达到 502.0 分,通过迭代采样和修正增加了 158.1 分。较小的 Nano-CC 系统则在相同的五轮中从 360.6 分升至 468.2 分。

因此,该结果并不表明一次没有辅助的模型补全超过了最佳参赛者。它表明,以模型为中心的系统——结合专门训练、并行生成、编译、聚类、合成测试、正式评测器反馈和大量硬件——能够在竞赛外部约束下,将大量推理计算转化为更高分数。

四、已确认的内容与仍待验证的内容

IOI 正式记录确认了六题形式、600 分满分、361.12 分的金牌分数线,以及徐祺文的领先分数 498.27。NVIDIA 的技术报告提供了模型分数、部署条件和系统细节。

论文仅报告了一次实时尝试。NVIDIA 此后在竞赛结束后又运行了五次标准 GenCorrect 流程,得到 521.72 分的平均值,分数范围为 495.0 至 545.8。实时分数比该平均值高出 13.68 分,但仍处于观测范围内。其中至多有四个结果可能超过最高人类分数,而报告的最低分则低 3.27 分;NVIDIA 未公布每次运行的单独分数。

该报告于 2026 年 9 月 2 日提交至 arXiv,是预印本而非同行评审发表成果。作者承认,该方法需要大量训练和推理计算,Ultra 规模的强化学习超出了他们的预算,且研究结果可能无法泛化至竞赛编程之外。

可复现性也尚不完整。NVIDIA 表示计划通过 NeMo Skills 发布竞赛检查点以及可运行的推理和评估组件,但论文称由于第三方限制,完整训练语料库无法再分发。在检查点和配方可用之前,外部研究人员无法仅根据该报告独立复现完整的实时系统。

对开发者而言,最明确的技术启示比“AI 击败程序员”更为狭窄。该实验表明,评测反馈可作为强大的测试时信号:生成许多不同的程序,选择有限的提交集合,观察哪些子任务通过,并将后续计算分配给剩余缺口。它还量化了这样一种情形:当任务允许与评估器进行重复且计分的交互时,推理吞吐量可以超过较低的单次响应准确率。

常见问题

Nemotron 赢得了 IOI 2026 吗?

没有。它不是正式参赛者,未出现在排名中,也没有获得奖牌。NVIDIA 报告称,其非正式实时运行的得分高于所有正式参赛者。

正式人类最高分是多少?

中国选手徐祺文以 600 分中的 498.27 分排名第一。NVIDIA 报告的模型分数为 535.4 分。

该模型可以访问互联网吗?

根据 NVIDIA 的报告,不可以。它可以在本地运行代码并访问竞赛评测平台,符合相关竞赛限制。

模型是否被限制为每题只能提交一个答案?

不是。GenCorrect 生成了数百个候选程序,并在五轮中每题最多使用 50 次正式提交。

研究人员现在可以复现这一结果吗?

还不能完全复现。NVIDIA 表示计划发布检查点和可运行配方,但完整训练语料库将因第三方限制而不予分发。

参考来源

Share

分享这篇文章