AI News字數 2827閱讀時長8 分鐘

NVIDIA 的 Nemotron 在 IOI 2026 題目中取得 535.4 分,超越所有官方參賽者

NVIDIA 表示,Nemotron-3-Ultra-CC 在 IOI 2026 取得 535.4/600 分,高於最高人類選手的 498.27 分;這是在一次非官方的即時運行中達成。

文章目錄 · 11
  1. 一、535.4 分代表甚麼
  2. 二、該系統不只是一個單一模型回應
  3. 三、NVIDIA 以單次取樣準確度換取吞吐量
  4. 四、已確認事項與仍未驗證事項
  5. 常見問題
  6. Nemotron 贏得了 IOI 2026 嗎?
  7. 最高官方人類分數是多少?
  8. 該模型是否可以存取互聯網?
  9. 模型是否每題只限提交一個答案?
  10. 研究人員現時可以重現該結果嗎?
  11. 參考來源

NVIDIA 研究人員表示,一個為競賽調校的 Nemotron 版本在 International Olympiad in Informatics 2026 題目組中取得 600 分中的 535.4 分。這比官方金牌門檻高出 174.28 分,亦比得分最高的人類參賽者高 37.13 分。

該結果在比賽期間、題目公開前產生,並遵守與參賽者相同的兩節各五小時賽程、互聯網限制、評分平台及提交次數限制。NVIDIA 表示,這是首個已知在一套 IOI 題目中得分超越領先人類選手的 AI 系統。

不過,這並非官方參賽項目。NVIDIA 的論文明確將該實驗描述為一次「非官方、無監督基準測試」,並表示該次運行並非由 IOI 監督。該模型沒有出現在官方排名中,亦未獲頒獎牌。

一、535.4 分代表甚麼

IOI 2026 於 8 月 9 日至 8 月 16 日在烏茲別克斯坦塔什干舉行。375 名參賽者代表 92 個 IOI 成員。在比賽期間,參賽者面對六道演算法題目——每個比賽日三題——每題最高 100 分。

官方結果顯示,中國的徐啟文以 498.27 分排名第一。32 名參賽者達到 361.12 分的金牌門檻,而銀牌及銅牌門檻分別為 303.28 分及 228.80 分。

因此,如將 NVIDIA 所報告的 535.4 分放入記分板,將會高於所有參賽者。這相當於最高可能分數的 89.2%,相比之下,官方冠軍為 83.05%。

這項比較具有意義,因為該實驗是前瞻性進行,而非在公開基準上事後運行。根據技術報告,NVIDIA 在比賽進行期間、六道題目尚未公開前操作該系統。這大幅降低了模型從訓練資料中記住特定題目的風險。

多項其他條件亦有對應。模型沒有互聯網存取權,但可在本機執行程式碼。它使用比賽評分系統,並受限於每題 50 次提交;一般而言,提交頻率限制為每分鐘一次。官方規則亦會在每次提交後向參賽者提供子任務層級的分數,而模型獲得相同類型的回饋。

當中存在一項重要的驗證界線。NVIDIA 的 X 貼文稱,該分數是「由 IOI 團隊評定」,但隨附論文指出模型的運行並非由 IOI 監督。官方記分板獨立確認了人類分數及獎牌門檻,並未確認模型的 535.4 分。因此,較公平的描述是:這是 NVIDIA 報告、透過官方評分平台取得的分數,而非經 IOI 認證的比賽成績。

二、該系統不只是一個單一模型回應

即時系統以 Nemotron-3-Ultra-CC 為核心,這是 NVIDIA 的 Nemotron-3-Ultra-550B-A55B 為競技程式設計調整後的版本。這個底層混合專家模型總共有 5,500 億個參數,並會為每個 token 啟用 550 億個參數。

NVIDIA 較廣泛的後訓練項目,起始於一個包含 22,000 道程式設計題目的語料庫,題目來自 16 個競賽系列及跨越約兩個年代的網上平台。研究人員將題目封裝成可執行環境,當中包含題目敘述、限制條件、測試及參考解答,然後移除會產生不一致結果的環境。

針對通用 Ultra-CC 模型,研究人員產生了 477,642 條監督式微調軌跡。較小的 300 億參數 Nemotron-3-Nano-CC 模型獲得 120 萬條軌跡及強化學習,但 NVIDIA 因計算成本而沒有將競技程式設計的強化學習階段套用至 Ultra。

IOI 2026 的即時版本再採用了針對比賽的調整。NVIDIA 在 2025 年 IOI 題目上評估 GLM-5.2 及 DeepSeek-V4-Flash,作為可能的教師模型。GLM-5.2 取得 66.0%,平均生成長度為 85,927 個 token;相比之下,DeepSeek-V4-Flash 為 55.3% 及 120,456 個 token。一個以 GLM 訓練的 Ultra-CC 變體其後在 2025 年題目中達到 59.4%,相對以 DeepSeek 訓練版本的 50.7%,因此 NVIDIA 為即時系統選擇了 GLM-5.2 資料。

決定性的組件是 GenCorrect,這是一個將評分器的子任務回饋轉化為迭代搜尋流程的推論程序。在首四輪的每一輪,系統為每題生成最多 200 個候選程式,剔除無效輸出,將其餘程式按行為多樣性分群,並選出十個代表作提交。

該等提交所得分數顯示哪些子任務已解決。下一輪隨後接收累積的子任務結果,並選取旨在保留已完成子任務、針對未解決子任務及維持多樣性的較早解答。此設計利用 IOI 評分的一項重要特性:參賽者每個子任務的最終分數,是所有提交中取得的最高分,因此較後的程式可以嘗試解決題目的不同部分,而不會抹去較早的進度。

在第五輪亦即最後一輪,NVIDIA 將每題候選解答池由 200 個擴展至 1,000 個,但仍只提交十個。系統生成 50 個特定於題目的測試產生器及驗證器,經篩選後取得 100 個有效測試輸入,在本機執行候選程式,並使用模型生成的評分腳本為它們排序。五輪合計,該程序每題可生成最多 1,800 個程式,同時遵守官方每題 50 次獲評分提交的限制。

三、NVIDIA 以單次取樣準確度換取吞吐量

即時部署使用最高 760 枚 NVIDIA GB300 GPU 的資源配置。這種硬件規模意味著,該結果是在時間及提交規則相同下作出的比較,而非一名青少年與一個模型實例之間的同等資源競賽。

為在比賽時限內容納大型候選批次,NVIDIA 將 Ultra-CC 量化為 NVFP4,並使用 FP8 key-value 快取,將多 token 預測設定為五。在 2025 年 IOI 開發集上,此配置每枚 GPU 每秒生成 736.8 個 token——是 BF16 基準每秒 199.1 個 token 的 3.7 倍。

量化降低了單次取樣準確度。所選配置在 IOI 2025 的 Score@1 中取得 52.8%,相比 BF16 的 59.4%,下降 6.6 個百分點。NVIDIA 接受這項取捨,因為 GenCorrect 取決於在固定的五小時賽程內生成及測試更大的解答池。

較早的實驗說明了原因。在 2025 年題目組中,通用 Ultra-CC 模型在首輪 GenCorrect 後平均取得 343.9 分,五輪後則為 502.0 分,透過迭代取樣及修正增加了 158.1 分。較小的 Nano-CC 系統在相同五輪中由 360.6 分升至 468.2 分。

因此,該結果並不顯示一次沒有輔助的模型完成結果超越了最佳參賽者。它顯示一套以模型為中心的系統——結合專門訓練、並行生成、編譯、分群、合成測試、官方評分器回饋及大量硬件——可在比賽的外部限制下,將大量推論運算轉化為更高分數。

四、已確認事項與仍未驗證事項

官方 IOI 紀錄確認六題形式、600 分滿分、361.12 分的金牌門檻,以及徐啟文領先的 498.27 分。NVIDIA 的技術報告則提供模型分數、部署條件及系統細節。

論文只報告了一次即時嘗試。NVIDIA 其後在比賽後以標準 GenCorrect 流程再運行五次,取得 521.72 分平均值,範圍介乎 495.0 分至 545.8 分。即時分數比該平均值高 13.68 分,但仍在觀察範圍之內。這些端點中,最多有四個可超過最高人類分數,而所報告的最低分則會低 3.27 分;NVIDIA 沒有公布每次個別分數。

該報告於 2026 年 9 月 2 日提交至 arXiv,是預印本而非經同行評審的出版物。作者承認,此方法需要大量訓練及推論運算、Ultra 規模的強化學習超出其預算,而且結果未必可推廣至競技程式設計以外的領域。

可重現性亦仍不完整。NVIDIA 表示計劃透過 NeMo Skills 發布競賽檢查點,以及可運行的推論及評估組件,但論文指出,由於第三方限制,完整訓練語料庫無法重新分發。在檢查點及操作配方可用前,外部研究人員無法僅根據報告獨立重現完整的即時系統。

對開發者而言,最清晰的技術含義比「AI 擊敗程式設計師」更為狹窄。該實驗展示,評分回饋可用作強大的測試時訊號:生成大量不同程式、選擇有限的提交集合、觀察哪些子任務通過,並將後續運算分配至剩餘缺口。它亦量化了當任務容許與評估器進行重複且有評分的互動時,推論吞吐量如何能夠勝過較低的單一回應準確度。

常見問題

Nemotron 贏得了 IOI 2026 嗎?

沒有。它並非官方參賽者,沒有出現在排名中,亦未獲頒獎牌。NVIDIA 表示,其非官方即時運行的分數高於所有官方參賽者。

最高官方人類分數是多少?

中國的徐啟文以 600 分中的 498.27 分奪得第一。NVIDIA 所報告的模型分數為 535.4 分。

該模型是否可以存取互聯網?

根據 NVIDIA 的報告,不能。它可在本機運行程式碼,並存取比賽評分平台,符合相關比賽限制。

模型是否每題只限提交一個答案?

不是。GenCorrect 生成數百個候選程式,並在五輪中每題使用最多 50 次官方提交。

研究人員現時可以重現該結果嗎?

未能完全重現。NVIDIA 表示計劃發布檢查點及可運行的配方,但完整訓練語料庫不會因第三方限制而發放。

參考來源

Share

分享這篇文章