Nemotron от NVIDIA набрал 535,4 балла на задачах IOI 2026, превзойдя всех официальных участников
NVIDIA сообщает, что Nemotron-3-Ultra-CC набрал 535.4/600 на IOI 2026, превысив результат лучшего человека — 498.27 — в неофициальном запуске во время соревнования.
Содержание · 11
- 1. Что означает результат 535.4
- 2. Система была больше, чем один ответ модели
- 3. NVIDIA пожертвовала точностью одного образца ради пропускной способности
- 4. Что подтверждено, а что остаётся непроверенным
- Частые вопросы
- Nemotron выиграл IOI 2026?
- Какой был наивысший официальный результат человека?
- Модель имела доступ к интернету?
- Модель была ограничена одним ответом на задачу?
- Могут ли исследователи воспроизвести результат сейчас?
- Источники
Исследователи NVIDIA сообщают, что настроенная для соревнований версия Nemotron набрала 535.4 балла из 600 на наборе задач Международной олимпиады по информатике 2026 года. Это на 174.28 балла выше официального порога золотой медали и на 37.13 балла выше результата человека с наивысшим баллом.
Результат был получен во время проведения соревнования, до того как задачи стали публичными, в рамках тех же двух пятичасовых сессий, с теми же ограничениями на интернет, платформой проверки и лимитами отправок, что и для участников. NVIDIA утверждает, что это первая известная ИИ-система, превзошедшая ведущего человека на наборе задач IOI.
Однако это не была официальная заявка. В статье NVIDIA эксперимент прямо описан как “unofficial, unsupervised benchmark”, и указано, что запуск не проводился под наблюдением IOI. Модель не фигурирует в официальной таблице результатов и не получила медаль.
1. Что означает результат 535.4
IOI 2026 проходила в Ташкенте, Узбекистан, с 9 по 16 августа. В ней участвовали 375 конкурсантов, представлявших 92 членов IOI. Во время соревнования участники решали шесть алгоритмических задач — по три в каждый соревновательный день — с максимальным результатом 100 баллов за задачу.
Официальные результаты ставят китайского участника Qiwen Xu на первое место с 498.27 балла. Тридцать два участника достигли порога золотой медали в 361.12 балла, тогда как пороги для серебряной и бронзовой медалей составили 303.28 и 228.80 соответственно.
Таким образом, заявленный NVIDIA результат 535.4 оказался бы выше результата любого участника при включении в таблицу. Это 89.2% от максимально возможного балла против 83.05% у официального победителя.
Это сравнение существенно, поскольку эксперимент был перспективным, а не ретроспективным запуском на публичном бенчмарке. Согласно техническому отчёту, NVIDIA эксплуатировала систему в ходе соревнования и до публичного выпуска шести задач. Это резко снижает риск того, что модель запомнила конкретные задачи из обучающих данных.
Условия были сопоставлены и в нескольких других аспектах. Модель не имела доступа к интернету, но могла выполнять код локально. Она использовала соревновательную систему проверки и была ограничена 50 отправками на задачу; отправки, как правило, разрешались не чаще одной в минуту. Официальные правила также предоставляли участникам баллы по подзадачам после каждой отправки, и модель получала тот же тип обратной связи.
Есть важная граница верификации. В публикации NVIDIA в X говорится, что результат был “as graded by the IOI team”, но в сопровождающей статье указано, что запуск модели не находился под надзором IOI. Официальная таблица независимо подтверждает результаты людей и пороги медалей, но не 535.4 балла модели. Поэтому наиболее корректное описание — результат, заявленный NVIDIA и полученный через официальную платформу проверки, а не сертифицированный IOI результат соревнования.
2. Система была больше, чем один ответ модели
Рабочая система была построена вокруг Nemotron-3-Ultra-CC — адаптации для соревновательного программирования NVIDIA Nemotron-3-Ultra-550B-A55B. Базовая модель типа mixture-of-experts содержит 550 миллиардов параметров всего и активирует 55 миллиардов для каждого токена.
Более широкий проект NVIDIA по дообучению начался с корпуса из 22,000 задач по программированию, взятых из 16 семейств соревнований и онлайн-платформ за период примерно в два десятилетия. Исследователи упаковали задачи в исполняемые окружения, содержащие условия, ограничения, тесты и эталонные решения, а затем удалили окружения, дававшие несогласованные результаты.
Для общей модели Ultra-CC исследователи сгенерировали 477,642 трассировки дообучения с учителем. Меньшая 30-миллиардная модель Nemotron-3-Nano-CC получила 1.2 миллиона трассировок и обучение с подкреплением, однако NVIDIA не применяла этап обучения с подкреплением для соревновательного программирования к Ultra из-за его вычислительной стоимости.
Вариант для IOI 2026 в реальном времени использовал дополнительную адаптацию, специфичную для соревнования. NVIDIA оценивала GLM-5.2 и DeepSeek-V4-Flash как возможные модели-учителя на задачах IOI 2025. GLM-5.2 набрала 66.0% при средней длине генерации 85,927 токенов, по сравнению с 55.3% и 120,456 токенами у DeepSeek-V4-Flash. Вариант Ultra-CC, обученный на GLM, затем достиг 59.4% на задачах 2025 года против 50.7% у версии, обученной на DeepSeek, поэтому NVIDIA выбрала данные GLM-5.2 для рабочей системы.
Решающим компонентом был GenCorrect — процедура инференса, превращающая обратную связь проверяющей системы по подзадачам в итеративный процесс поиска. В каждом из первых четырёх раундов система генерировала до 200 программ-кандидатов на задачу, отбрасывала недопустимые результаты, кластеризовала оставшиеся программы для поведенческого разнообразия и выбирала десять представителей для отправки.
Баллы этих отправок показывали, какие подзадачи были решены. Затем в следующий раунд передавались накопленные результаты по подзадачам и выбирались более ранние решения, призванные сохранить завершённые подзадачи, нацелиться на нерешённые и поддерживать разнообразие. Эта конструкция использует важную особенность подсчёта баллов в IOI: итоговый балл участника за каждую подзадачу — это наивысший результат среди всех отправок, поэтому последующие программы могут решать разные части задачи, не стирая предыдущий прогресс.
Для пятого и последнего раунда NVIDIA расширила пул с 200 до 1,000 решений-кандидатов на задачу, всё ещё отправляя только десять. Система сгенерировала 50 специфичных для задач генераторов тестов и валидаторов, отфильтровала их до 100 допустимых тестовых входов, локально выполнила программы-кандидаты и использовала сгенерированный моделью скрипт оценки для их ранжирования. За пять раундов процедура могла сгенерировать до 1,800 программ на задачу, соблюдая официальный лимит в 50 проверяемых отправок.
3. NVIDIA пожертвовала точностью одного образца ради пропускной способности
В рабочем развёртывании использовалось пиковое выделение 760 GPU NVIDIA GB300. Такой масштаб оборудования делает результат сравнением при одинаковых ограничениях по времени и числу отправок, а не соревнованием с равными ресурсами между подростком и одним экземпляром модели.
Чтобы вместить большие пакеты кандидатов в окно соревнования, NVIDIA квантизировала Ultra-CC до NVFP4 и использовала FP8-кэш ключей и значений с multi-token prediction, установленным на пять. На наборе разработки IOI 2025 эта конфигурация генерировала 736.8 токена в секунду на GPU — в 3.7 раза больше, чем 199.1 токена у базовой версии BF16.
Квантизация снизила точность одного образца. Выбранная конфигурация получила 52.8% на IOI 2025 при Score@1 по сравнению с 59.4% для BF16 — снижение на 6.6 процентного пункта. NVIDIA приняла этот компромисс, потому что GenCorrect зависел от генерации и тестирования гораздо большего пула решений в пределах фиксированной пятичасовой сессии.
Предыдущие эксперименты показывают почему. На наборе задач 2025 года общая модель Ultra-CC в среднем набирала 343.9 балла после первого раунда GenCorrect и 502.0 после пяти раундов, прибавив 158.1 балла благодаря итеративной выборке и исправлению. Меньшая система Nano-CC выросла с 360.6 до 468.2 за те же пять раундов.
Таким образом, результат не показывает, что одно самостоятельное завершение моделью превзошло лучшего участника. Он показывает, что система, построенная вокруг модели, — сочетающая специализированное обучение, параллельную генерацию, компиляцию, кластеризацию, синтетические тесты, обратную связь официальной проверяющей системы и значительные аппаратные ресурсы, — могла преобразовать большой объём вычислений инференса в более высокий балл при внешних ограничениях соревнования.
4. Что подтверждено, а что остаётся непроверенным
Официальные записи IOI подтверждают формат из шести задач, максимум в 600 баллов, порог золотой медали в 361.12 балла и лидерский результат Qiwen Xu — 498.27. Технический отчёт NVIDIA содержит результат модели, условия развёртывания и детали системы.
В статье сообщается только об одной попытке в реальном времени. Позднее NVIDIA ещё пять раз запустила стандартный конвейер GenCorrect после соревнования, получив среднее значение 521.72 и диапазон от 495.0 до 545.8. Результат запуска в реальном времени был на 13.68 балла выше этого среднего, но оставался в наблюдаемом диапазоне. Максимум четыре из этих конечных результатов могли превзойти лучший человеческий результат, тогда как заявленный минимум оказался бы на 3.27 балла ниже; NVIDIA не публикует каждый отдельный результат.
Отчёт был отправлен на arXiv 2 сентября 2026 года и является препринтом, а не рецензируемой публикацией. Его авторы признают, что подход требует значительных вычислений для обучения и инференса, что обучение с подкреплением в масштабе Ultra выходило за пределы их бюджета и что выводы могут не обобщаться за пределы соревновательного программирования.
Воспроизводимость также неполная. NVIDIA заявляет, что планирует выпустить соревновательный чекпойнт и исполняемые компоненты инференса и оценки через NeMo Skills, однако в статье сказано, что полный обучающий корпус не может быть распространён из-за ограничений третьих сторон. Пока чекпойнт и рецепты не доступны, внешние исследователи не могут независимо воспроизвести полную рабочую систему только по отчёту.
Для разработчиков наиболее ясный технический вывод уже, чем «ИИ побеждает программистов». Эксперимент показывает, что обратная связь проверяющей системы может использоваться как мощный сигнал во время тестирования: генерировать множество различных программ, выбирать ограниченный набор отправок, наблюдать, какие подзадачи проходят, и направлять последующие вычисления на оставшиеся пробелы. Он также количественно показывает, как пропускная способность инференса может перевесить более низкую точность одного ответа, когда задача допускает повторяющееся взаимодействие с оценщиком, сопровождаемое баллами.
Частые вопросы
Nemotron выиграл IOI 2026?
Нет. Он не был официальным участником, не фигурирует в таблице результатов и не получил медаль. NVIDIA сообщает, что его неофициальный запуск в реальном времени набрал больше баллов, чем любой официальный участник.
Какой был наивысший официальный результат человека?
Qiwen Xu из Китая занял первое место с 498.27 балла из 600. Заявленный NVIDIA результат модели составил 535.4.
Модель имела доступ к интернету?
Нет, согласно отчёту NVIDIA. Она могла запускать код локально и получать доступ к соревновательной платформе проверки, что соответствовало релевантным ограничениям соревнования.
Модель была ограничена одним ответом на задачу?
Нет. GenCorrect генерировал сотни программ-кандидатов и использовал до 50 официальных отправок на задачу за пять раундов.
Могут ли исследователи воспроизвести результат сейчас?
Не полностью. NVIDIA заявляет, что планирует выпустить чекпойнт и исполняемые рецепты, но полный обучающий корпус не будет распространяться из-за ограничений третьих сторон.
Источники
Share