NVIDIA의 Nemotron, IOI 2026 문제에서 535.4점 기록… 모든 공식 참가자 상회
NVIDIA는 Nemotron-3-Ultra-CC가 비공식 라이브 실행에서 IOI 2026에서 최고 인간 참가자의 498.27점보다 높은 535.4/600점을 기록했다고 보고했다.
목차 · 11
NVIDIA 연구진은 경쟁용으로 튜닝된 Nemotron 버전이 국제정보올림피아드(International Olympiad in Informatics) 2026 문제 세트에서 600점 만점에 535.4점을 기록했다고 보고했다. 이는 공식 금메달 기준점보다 174.28점 높고, 최고 득점 인간 참가자보다 37.13점 높은 점수다.
이 결과는 문제가 공개되기 전 대회 기간 중 산출됐으며, 참가자에게 적용된 것과 동일한 두 차례의 5시간 세션, 인터넷 제한, 채점 플랫폼 및 제출 횟수 제한 아래에서 이뤄졌다. NVIDIA는 IOI 문제 세트에서 선두 인간 참가자보다 높은 점수를 기록한 것으로 알려진 최초의 AI 시스템이라고 밝혔다.
다만 이는 공식 출전이 아니었다. NVIDIA의 논문은 이 실험을 명시적으로 “unofficial, unsupervised benchmark”라고 설명하며, 해당 실행은 IOI의 감독을 받지 않았다고 밝힌다. 이 모델은 공식 순위표에 없으며 메달도 받지 않았다.
1. 535.4점이 의미하는 것
IOI 2026은 8월 9일부터 8월 16일까지 우즈베키스탄 타슈켄트에서 열렸다. 92개 IOI 회원국을 대표하는 375명의 참가자가 출전했다. 대회 기간 참가자들은 각 대회일에 세 문제씩, 총 여섯 개의 알고리즘 문제를 풀었으며 문제당 만점은 100점이었다.
공식 결과에서 중국의 Qiwen Xu가 498.27점으로 1위를 차지했다. 32명의 참가자가 361.12점인 금메달 기준점에 도달했으며, 은메달과 동메달 기준점은 각각 303.28점과 228.80점이었다.
NVIDIA가 보고한 535.4점은 순위표에 넣을 경우 모든 참가자보다 높은 순위에 해당한다. 이는 가능한 최고점의 89.2%로, 공식 우승자의 83.05%와 비교된다.
이 비교가 의미 있는 이유는 공개 벤치마크를 대상으로 한 사후 실행이 아니라 사전적 실행이었기 때문이다. 기술 보고서에 따르면 NVIDIA는 대회가 진행 중이고 여섯 문제가 공개되기 전 시스템을 운용했다. 이로써 모델이 학습 데이터에서 특정 문제를 암기했을 위험이 크게 줄어든다.
조건은 그 밖의 여러 측면에서도 일치했다. 모델은 인터넷에 접근할 수 없었지만 로컬에서 코드를 실행할 수 있었다. 대회 채점 시스템을 사용했고 문제당 50회 제출로 제한됐으며, 일반적으로 제출은 분당 한 번으로 제한됐다. 공식 규칙은 각 제출 뒤 참가자에게 서브태스크별 점수를 제공했으며, 모델도 같은 유형의 피드백을 받았다.
중요한 검증 경계가 있다. NVIDIA의 X 게시물은 이 점수가 “as graded by the IOI team”이라고 말하지만, 함께 공개된 논문은 모델 실행이 IOI의 감독을 받지 않았다고 밝힌다. 공식 순위표는 인간 참가자의 점수와 메달 기준점은 독립적으로 확인하지만, 모델의 535.4점은 확인하지 않는다. 따라서 가장 공정한 설명은 IOI 인증 대회 결과가 아니라, 공식 채점 플랫폼을 통해 얻은 NVIDIA 보고 점수라는 것이다.
2. 시스템은 단일 모델 응답 그 이상이었다
라이브 시스템은 NVIDIA의 Nemotron-3-Ultra-550B-A55B를 경쟁 프로그래밍에 맞게 조정한 Nemotron-3-Ultra-CC를 중심으로 구축됐다. 이 기반 전문가 혼합 모델은 총 5500억 개의 파라미터를 가지며, 각 토큰마다 550억 개를 활성화한다.
NVIDIA의 광범위한 사후 학습 프로젝트는 약 20년에 걸친 16개 경쟁 분야와 온라인 플랫폼에서 가져온 22,000개의 프로그래밍 문제 코퍼스로 시작했다. 연구진은 문제 설명, 제약 조건, 테스트 및 참조 솔루션을 포함한 실행 가능한 환경으로 문제를 패키징한 뒤, 일관되지 않은 결과를 생성하는 환경은 제거했다.
일반 Ultra-CC 모델을 위해 연구진은 477,642개의 지도 미세 조정 트레이스를 생성했다. 더 작은 300억 파라미터 Nemotron-3-Nano-CC 모델은 강화학습과 함께 120만 개의 트레이스를 받았지만, NVIDIA는 계산 비용 때문에 Ultra에는 경쟁 코딩 강화학습 단계를 적용하지 않았다.
라이브 IOI 2026 변형에는 대회 특화 적응이 추가로 적용됐다. NVIDIA는 2025 IOI 과제에서 GLM-5.2와 DeepSeek-V4-Flash를 가능한 교사 모델로 평가했다. GLM-5.2는 평균 생성 길이 85,927토큰에서 66.0%를 기록했으며, DeepSeek-V4-Flash는 55.3%와 120,456토큰을 기록했다. 이후 GLM으로 학습한 Ultra-CC 변형은 2025 문제에서 59.4%에 도달했고, DeepSeek으로 학습한 버전은 50.7%였으므로 NVIDIA는 라이브 시스템용으로 GLM-5.2 데이터를 선택했다.
결정적인 구성 요소는 채점기의 서브태스크 피드백을 반복적 탐색 과정으로 바꾸는 추론 절차인 GenCorrect였다. 처음 네 라운드 각각에서 시스템은 문제당 최대 200개의 후보 프로그램을 생성하고, 유효하지 않은 출력을 버린 뒤, 행동 다양성을 위해 남은 프로그램을 클러스터링하고 제출할 대표 10개를 선택했다.
그 제출의 점수는 어떤 서브태스크가 해결됐는지를 보여줬다. 이후 라운드는 누적된 서브태스크 결과를 받고, 완료된 서브태스크를 보존하면서 미해결 항목을 겨냥하고 다양성을 유지하도록 설계된 이전 솔루션을 선택했다. 이 설계는 IOI 채점의 중요한 특징을 활용한다. 각 서브태스크의 최종 점수는 모든 제출에서 달성한 최고점이므로, 이후 프로그램은 이전 진전을 지우지 않고 문제의 다른 부분을 공략할 수 있다.
다섯 번째이자 마지막 라운드에서 NVIDIA는 문제당 후보 솔루션 풀을 200개에서 1,000개로 확대했지만, 여전히 10개만 제출했다. 시스템은 문제별 테스트 생성기와 검증기 50개를 생성하고, 이를 필터링해 유효한 테스트 입력 100개를 얻었으며, 후보 프로그램을 로컬에서 실행하고 모델 생성 채점 스크립트를 사용해 순위를 매겼다. 다섯 라운드에 걸쳐 이 절차는 공식 채점 제출 50회 제한을 준수하면서 문제당 최대 1,800개의 프로그램을 생성할 수 있었다.
3. NVIDIA는 단일 샘플 정확도 대신 처리량을 택했다
라이브 배포에는 최대 760대의 NVIDIA GB300 GPU가 할당됐다. 이 하드웨어 규모는 이 결과가 시간 및 제출 규칙을 맞춘 비교이지, 청소년 한 명과 모델 인스턴스 하나 사이의 동등 자원 대결은 아니라는 점을 의미한다.
대규모 후보 배치를 대회 시간 창에 맞추기 위해 NVIDIA는 Ultra-CC를 NVFP4로 양자화하고, 멀티 토큰 예측을 5로 설정한 FP8 키-값 캐시를 사용했다. 2025 IOI 개발 세트에서 이 구성은 GPU당 초당 736.8토큰을 생성했으며, BF16 기준선의 199.1토큰 속도보다 3.7배 높았다.
양자화는 단일 샘플 정확도를 낮췄다. 선택된 구성은 Score@1에서 IOI 2025 기준 52.8%를 기록했으며, BF16의 59.4%보다 6.6%포인트 하락했다. NVIDIA는 GenCorrect가 고정된 5시간 세션 안에 훨씬 큰 솔루션 풀을 생성하고 테스트하는 데 의존했기 때문에 이러한 상충관계를 받아들였다.
초기 실험은 그 이유를 보여준다. 2025 문제 세트에서 일반 Ultra-CC 모델은 첫 번째 GenCorrect 라운드 뒤 평균 343.9점을 기록했고, 다섯 라운드 뒤에는 502.0점에 도달해 반복적 샘플링과 수정으로 158.1점을 얻었다. 더 작은 Nano-CC 시스템은 같은 다섯 라운드 동안 360.6점에서 468.2점으로 상승했다.
따라서 이 결과는 도움 없이 생성된 단일 모델 완성이 최고 참가자를 능가했다는 것을 보여주지 않는다. 이는 특화 학습, 병렬 생성, 컴파일, 클러스터링, 합성 테스트, 공식 채점기 피드백 및 상당한 하드웨어를 결합한 모델 중심 시스템이 대회의 외부 제약 아래 대량의 추론 컴퓨트를 더 높은 점수로 전환할 수 있었음을 보여준다.
4. 확인된 내용과 아직 검증되지 않은 내용
공식 IOI 기록은 여섯 문제 형식, 600점 만점, 361.12점의 금메달 기준점 및 Qiwen Xu의 선두 점수 498.27점을 확인한다. NVIDIA의 기술 보고서는 모델 점수, 배포 조건 및 시스템 세부 사항을 제공한다.
논문은 라이브 시도 한 건만 보고한다. NVIDIA는 대회 뒤 표준 GenCorrect 파이프라인을 다섯 번 더 실행해 평균 521.72점과 495.0점부터 545.8점까지의 범위를 얻었다. 라이브 점수는 이 평균보다 13.68점 높았지만 관측 범위 안에 있었다. 이들 결과 중 최대 네 개는 인간 최고 점수를 넘을 수 있었고, 보고된 최저점은 3.27점 모자랐을 것이다. NVIDIA는 각 개별 점수를 공개하지 않았다.
이 보고서는 2026년 9월 2일 arXiv에 제출됐으며, 동료 심사를 거친 출판물이 아니라 프리프린트다. 저자들은 이 접근법에 상당한 학습 및 추론 컴퓨트가 필요하고 Ultra 규모 강화학습은 예산 범위 밖이었으며, 연구 결과가 경쟁 프로그래밍을 넘어 일반화되지 않을 수 있음을 인정한다.
재현성도 불완전하다. NVIDIA는 NeMo Skills를 통해 대회 체크포인트와 실행 가능한 추론 및 평가 구성 요소를 공개할 계획이라고 밝혔지만, 논문은 제3자 제한 때문에 전체 학습 코퍼스를 재배포할 수 없다고 말한다. 체크포인트와 레시피가 제공되기 전까지 외부 연구자들은 보고서만으로 완전한 라이브 시스템을 독립적으로 재현할 수 없다.
개발자에게 가장 명확한 기술적 함의는 “AI가 프로그래머를 이긴다”보다 좁다. 이 실험은 채점 피드백을 강력한 테스트 시점 신호로 사용할 수 있음을 보여준다. 즉, 서로 다른 프로그램을 다수 생성하고, 제한된 제출 세트를 선택하며, 어떤 서브태스크가 통과하는지 관찰하고, 이후 컴퓨트를 남은 공백에 할당하는 방식이다. 또한 작업이 평가자와의 반복적이고 점수가 매겨지는 상호작용을 허용할 때, 추론 처리량이 낮은 단일 응답 정확도를 능가할 수 있음을 정량화한다.
자주 묻는 질문
Nemotron이 IOI 2026에서 우승했나요?
아니요. 공식 참가자가 아니었고 순위표에도 없으며 메달도 받지 않았습니다. NVIDIA는 비공식 라이브 실행이 모든 공식 참가자보다 높은 점수를 기록했다고 보고했습니다.
가장 높은 공식 인간 참가자 점수는 얼마였나요?
중국의 Qiwen Xu가 600점 만점에 498.27점으로 1위를 차지했습니다. NVIDIA가 보고한 모델 점수는 535.4점이었습니다.
모델은 인터넷에 접근할 수 있었나요?
아니요. NVIDIA의 보고서에 따르면 그렇지 않았습니다. 관련 대회 제한에 맞춰 로컬에서 코드를 실행하고 대회 채점 플랫폼에 접근할 수 있었습니다.
모델은 문제당 하나의 답변으로 제한됐나요?
아니요. GenCorrect는 수백 개의 후보 프로그램을 생성하고, 다섯 라운드에 걸쳐 문제당 최대 50회의 공식 제출을 사용했습니다.
연구자들이 지금 결과를 재현할 수 있나요?
완전히는 아닙니다. NVIDIA는 체크포인트와 실행 가능한 레시피를 공개할 계획이라고 밝혔지만, 제3자 제한 때문에 전체 학습 코퍼스는 배포되지 않습니다.
참고 자료
Share