AIRA3 от Meta заняла восьмое место в Nemotron Challenge NVIDIA среди 4 182 команд
Meta заявляет, что AIRA3 получила золото Kaggle, автономно дообучив модель рассуждений Nemotron-3-Nano-30B от NVIDIA.
Содержание · 12
- 1. Живое соревнование поставило исследовательскую систему Meta в конкуренцию с тысячами команд
- 2. Что в действительности измерял Nemotron Challenge
- 3. AIRA3 использовала несколько моделей и кодовые обвязки
- 4. Как AIRA3 развивает предыдущую работу Meta над исследовательскими агентами
- 5. Что устанавливает результат — и что остаётся непроверенным
- Частые вопросы
- Что такое AIRA3?
- Победила ли AIRA3 в соревновании NVIDIA?
- Какие модели использовались в живой заявке?
- Что AIRA3 изменила в Nemotron?
- Доступна ли AIRA3 публично?
- Источники
1. Живое соревнование поставило исследовательскую систему Meta в конкуренцию с тысячами команд
Meta заявляет, что её автономная исследовательская система AIRA₃ заняла восьмое место в NVIDIA Nemotron Model Reasoning Challenge и получила золотую медаль Kaggle среди 4 182 команд.
Результат был получен в живом соревновании, а не в ретроспективном бенчмарке, составленном Meta. По данным Kaggle, конкурс проходил с 16 марта по 15 июня 2026 года, привлёк 5 223 участников и получил 71 743 отправки. Meta заявила AIRA₃ в июне и сообщает, что её финальная работа оценивалась на том же закрытом тестовом наборе, который использовался для ранжирования остальных участников.
Восьмое место не является победой в соревновании: выше AIRA₃ финишировали семь команд, а денежные призы Kaggle предназначались трём лучшим. «Золото» относится к уровню медалей платформы. Это различие важно, поскольку описание результата как того, что AIRA₃ «обошла 4 000 команд», стирает как более высоко ранжированные заявки, так и разницу между медалью и первым местом.
Даже с этой оговоркой место в рейтинге даёт более убедительные доказательства, чем внутренняя демонстрация. Целевая модель, формат отправки, процедура оценки и срок были заданы NVIDIA и Kaggle. Meta могла оптимизировать решение под опубликованную задачу, но не контролировала среду финального оценивания.
Meta трактует результат как свидетельство того, что AIRA₃ способна улучшать конкретную возможность модели на уровне, сопоставимом с человеческими экспертами. Рейтинг поддерживает более узкое утверждение: система подготовила весьма конкурентоспособную заявку на дообучение. Сам по себе он не доказывает наличие общих научных способностей или эквивалентности исследователям-людям в широком спектре открытых задач.
2. Что в действительности измерял Nemotron Challenge
Соревнование требовало от участников повысить точность рассуждений NVIDIA-Nemotron-3-Nano-30B, сохранив ту же базовую модель. Обязательной отправкой был совместимый адаптер low-rank adaptation, или LoRA, с максимальным рангом 32.
Это ограничение превращало конкурс в задачу целенаправленного улучшения модели, а не в поиск самой сильной неограниченной языковой модели. Участники могли менять обучающие данные, стратегию промптинга, пайплайн синтетических данных, метод обучения с подкреплением или облегчённый процесс дообучения, но их финальный адаптер должен был работать на назначенной NVIDIA модели и стеке оценки.
В техническом отчёте NVIDIA Nemotron 3 Nano описывается как гибридная mixture-of-experts-модель Mamba-Transformer. Она содержит в общей сложности 31,6 млрд параметров, из которых 3,2 млрд активируются при каждом прямом проходе, или приблизительно 3,6 млрд с учётом эмбеддингов.
Согласно публичному описанию решения победившей команды, предоставленный обучающий набор содержал 9 500 размеченных задач по побитовым операциям, числовым уравнениям, криптоарифметике, текстовым шифрам, системам счисления, переводу единиц и гравитации. Каждый промпт содержал примеры неизвестного преобразования и просил модель вывести правило перед ответом на новый случай.
Kaggle загружал каждый отправленный адаптер с помощью движка инференса vLLM. Ответы извлекались главным образом из выражения LaTeX \boxed{} и считались правильными, если они в точности совпадали с эталонной строкой или попадали в относительный числовой допуск \(10^{-2}\). Финальный балл представлял собой долю правильных ответов.
Фиксированная конфигурация инференса включала длину модели в 8 192 токена, до 7 680 сгенерированных токенов, температуру ноль и top_p, установленный на 1.0. Эти настройки уменьшали различия, вызванные поведением выборки, и концентрировали ранжирование на том, чему научился каждый адаптер.
Закрытый тестовый набор ограничивал прямую оптимизацию под финальные ответы, но не создавал контролируемого эксперимента «человек против ИИ». Команды Kaggle могли использовать разные вычислительные бюджеты, внешние ресурсы и автоматизированные инструменты, а некоторые отправки, возможно, сами в значительной степени опирались на ИИ. Поэтому таблица лидеров сравнивает завершённые системы и рабочие процессы, а не отдельных исследователей без вспомогательных средств в идентичных лабораторных условиях.
3. AIRA3 использовала несколько моделей и кодовые обвязки
Meta заявляет, что AIRA₃ не зависит от одного агента или центрального контроллера. Она запускает несколько долгоживущих агентов в изолированных средах, и каждый агент объединяет языковую модель с кодовой обвязкой.
Агенты асинхронно координируются через два общих механизма. Форум содержит гипотезы, результаты экспериментов и обсуждения, а общая файловая система хранит артефакты решений. По мере накопления информации отдельные агенты решают, какие открытия исследовать или развивать.
Эта архитектура призвана сохранять полезные находки за пределами контекстного окна или времени работы одного агента. Эксперимент, проведённый одной парой «модель — обвязка», может стать входными данными для другой, позволяя последующей работе опираться на более ранние результаты вместо независимого перезапуска поиска.
Для живого Nemotron-соревнования Meta использовала ансамбль, объединявший GPT 5.5 с OpenCode и Claude 4.8 с Claude Code. Поэтому результат на восьмом месте относится к полному рабочему процессу AIRA₃, а не к одной базовой языковой модели.
Meta также сообщила о нескольких постконкурсных оценках на том же закрытом тестовом наборе. Конфигурация Muse Spark 1.2 с MuseCode достигла того, что Meta описала как производительность уровня золотой медали. Muse Spark 1.1 с OpenCode и GLM 5.2 с OpenCode достигли диапазона серебряной медали.
Эти постфактум-результаты служат полезным свидетельством того, что схема оркестрации может работать с разными комбинациями моделей и обвязок, но они не являются дополнительными местами в живом рейтинге. Только ансамбль GPT 5.5 и Claude 4.8 получил заявленное восьмое место во время соревнования.
4. Как AIRA3 развивает предыдущую работу Meta над исследовательскими агентами
AIRA₃ следует за системой AIRA₂, которую Meta описала в апреле 2026 года. Тот более ранний проект был сосредоточен на трёх узких местах автономных исследований в машинном обучении: ограниченной пропускной способности экспериментов, ненадёжных сигналах валидации во время длительных поисков и ограниченном поведении фиксированных одношаговых операторов моделей.
AIRA₂ решала эти проблемы с помощью асинхронного пула воркеров на нескольких GPU, протокола Hidden Consistent Evaluation и ReAct-агентов, способных интерактивно определять рамки и отлаживать свою работу.
Meta сообщала, что AIRA₂ достигла среднего процентильного ранга 81,5 после 24 часов и 83,1 после 72 часов на MLE-bench-30 по сравнению с 72,7 у сильнейшего базового решения. В отдельном наборе AIRS-Bench AIRA₂ превзошла заявленный человеческий уровень техники на шести из 20 задач.
Анонс AIRA₃ переносит оценку с выбранных исследовательских бенчмарков на активное соревнование с внешним дедлайном и закрытым оцениванием. Её архитектура с форумом и файловой системой также акцентирует сотрудничество между постоянными агентами, а не представляет параллельных воркеров лишь как способ увеличить пропускную способность экспериментов.
Meta пока не опубликовала статью об AIRA₃, исходный код или подробный технический отчёт. В анонсе не раскрываются число агентов, совокупные вычислительные затраты, рецепт обучения, количество экспериментов, вмешательство исследователей Meta или абляция, отделяющая ценность общих знаний от ценности запуска большего числа попыток. Поэтому пока невозможно воспроизвести рабочий процесс, занявший восьмое место, или определить, какой компонент внёс наибольший вклад.
5. Что устанавливает результат — и что остаётся непроверенным
Самый ясный практический результат состоит в том, что автономный исследовательский рабочий процесс подготовил решение из топ-10 для ограниченной задачи обучения модели при внешней оценке. Для разработчиков исследовательских агентов это демонстрирует рабочий процесс, способный достаточно хорошо управлять генерацией данных, экспериментами, дообучением и отбором, чтобы конкурировать с опытными командами Kaggle.
Результат не показывает, что AIRA₃ самостоятельно выбрала ценную исследовательскую проблему, спроектировала оценку или улучшила собственные базовые модели агентов. Она оптимизировала заранее определённую способность отдельной модели Nemotron под известную цель соревнования. Описание этого как рекурсивного самоулучшения выходило бы за пределы имеющихся на сегодня доказательств.
Meta заявляет, что та же система может переходить между предметными областями, изменяя только спецификацию задачи. Она сообщила о снижении задержки на 27% для производственных GPU-ядер во внутреннем бенчмарке и о производительности золотого уровня в Deep Past Challenge Kaggle, где требовалось переводить транслитерированный староассирийский аккадский язык на английский.
Соревнование Deep Past независимо задокументировано Kaggle, но Meta не предоставила идентифицируемую запись AIRA₃ в таблице лидеров, балл или техническое описание для этого запуска. Показатель по GPU-ядрам также является внутренним и не сопровождается раскрытыми рабочей нагрузкой, базовой линией, конфигурацией оборудования или методом измерения. Поэтому оба результата следует рассматривать как заявленные Meta тесты переноса, а не как независимо воспроизводимые доказательства.
Для компаний, оценивающих автономные исследовательские системы, место в Nemotron-соревновании подтверждает конкурентоспособное выполнение задачи, но оставляет без ответа вопросы стоимости и эффективности. Без данных об использовании вычислений, записей о человеческом надзоре и контролируемых сравнений с независимыми параллельными агентами результат не может показать, экономичнее ли AIRA₃ экспертной команды или превосходят ли её механизмы совместной координации эквивалентный объём нескоординированного поиска.
Частые вопросы
Что такое AIRA3?
AIRA₃ — автономная система ИИ-исследований Meta. Meta описывает её как несколько долгоживущих пар «модель — кодовая обвязка», которые работают в изолированных средах и координируются через общий форум и файловую систему.
Победила ли AIRA3 в соревновании NVIDIA?
Нет. Она заняла восьмое место и получила золотую медаль Kaggle. Выше расположились семь команд, а призы за места в соревновании охватывали первые три позиции.
Какие модели использовались в живой заявке?
Meta заявляет, что живая заявка объединила GPT 5.5, работающую с OpenCode, и Claude 4.8, работающую с Claude Code.
Что AIRA3 изменила в Nemotron?
Она подготовила LoRA-адаптер с рангом не более 32 для базовой модели NVIDIA Nemotron-3-Nano-30B. Соревнование измеряло, отвечала ли адаптированная модель точнее на структурированные задачи рассуждений.
Доступна ли AIRA3 публично?
Анонс Meta не предоставил исходный код AIRA₃, загружаемую систему или полную техническую статью. Точный процесс её обучения и требования к вычислительным ресурсам остаются нераскрытыми.
Источники
- AI в Meta: результат AIRA₃ на Kaggle и ветка анонса
- Kaggle: NVIDIA Nemotron Model Reasoning Challenge
- Kaggle: решение победителя Nemotron Challenge
- Meta AI: AIRA₂ — преодоление узких мест в ИИ-исследовательских агентах
- Исследователи NVIDIA: технический отчёт Nemotron 3 Nano
- Kaggle: Deep Past Challenge — перевод с аккадского на английский
Share