AI News글자 수 3549읽는 시간9

메타의 AIRA3, NVIDIA의 4,182개 팀 Nemotron 챌린지에서 8위

메타는 AIRA3가 Kaggle 골드를 획득하며 NVIDIA의 Nemotron-3-Nano-30B 추론 모델을 자율적으로 파인튜닝했다고 밝혔다.

목차 · 12
  1. 1. 실시간 대회에서 메타의 연구 시스템이 수천 개 팀과 경쟁했다
  2. 2. Nemotron 챌린지가 실제로 측정한 것
  3. 3. AIRA3는 여러 모델과 코딩 하니스를 사용했다
  4. 4. AIRA3가 메타의 이전 연구 에이전트 작업을 확장하는 방식
  5. 5. 이 결과가 입증하는 것과 아직 검증되지 않은 것
  6. 자주 묻는 질문
  7. AIRA3는 무엇인가요?
  8. AIRA3가 NVIDIA 대회에서 우승했나요?
  9. 실시간 제출물에는 어떤 모델이 사용됐나요?
  10. AIRA3는 Nemotron에서 무엇을 변경했나요?
  11. AIRA3는 공개적으로 이용할 수 있나요?
  12. 참고 자료

1. 실시간 대회에서 메타의 연구 시스템이 수천 개 팀과 경쟁했다

메타는 자율형 연구 시스템 AIRA₃가 NVIDIA의 Nemotron Model Reasoning Challenge에서 4,182개 팀 가운데 8위를 차지하며 Kaggle 골드 메달을 획득했다고 밝혔다.

이 결과는 메타가 사후에 구성한 벤치마크가 아니라 실시간 대회에서 나왔다. Kaggle 기록에 따르면 이 챌린지는 2026년 3월 16일부터 6월 15일까지 진행됐으며, 5,223명의 참가자를 모아 71,743건의 제출을 받았다. 메타는 6월에 AIRA₃를 출전시켰고, 최종 작업물은 다른 경쟁자들의 순위를 매기는 데 사용된 동일한 비공개 테스트 세트로 평가됐다고 밝혔다.

8위는 대회 우승이 아니다. AIRA₃보다 높은 순위를 기록한 팀이 7개였고, Kaggle의 상금은 상위 3위에만 지급됐다. “Gold”는 플랫폼의 메달 등급을 뜻한다. AIRA₃가 “4,000개 팀을 이겼다”는 식의 설명은 상위 순위 항목과 메달과 1위의 차이를 모두 지운다는 점에서 이 구분은 중요하다.

이러한 단서를 고려하더라도, 이 순위는 내부 시연보다 더 강한 근거를 제공한다. 대상 모델, 제출 형식, 평가 절차 및 마감일은 NVIDIA와 Kaggle이 정했다. 메타는 공개된 과제에 맞춰 최적화할 수 있었지만, 최종 채점 환경을 통제하지는 않았다.

메타는 이 결과를 AIRA₃가 인간 전문가에 필적하는 수준으로 특정 모델 역량을 개선할 수 있다는 증거로 해석한다. 이 순위가 뒷받침하는 더 좁은 주장은 시스템이 매우 경쟁력 있는 파인튜닝 제출물을 만들었다는 것이다. 그 자체로 일반적인 과학 능력이나 개방형 작업 전반에서 인간 연구자와의 동등성을 입증하지는 않는다.

2. Nemotron 챌린지가 실제로 측정한 것

대회는 참가자들에게 동일한 베이스 모델을 유지한 채 NVIDIA-Nemotron-3-Nano-30B의 추론 정확도를 개선하도록 요구했다. 필수 제출물은 최대 rank가 32인 호환 가능한 저순위 적응, 즉 LoRA, 어댑터였다.

이 제약으로 인해 대회는 제한 없는 가장 강력한 언어 모델을 찾는 일이 아니라 목표가 명확한 모델 개선 문제가 됐다. 참가자들은 훈련 데이터, 프롬프팅 전략, 합성 데이터 파이프라인, 강화학습 방법 또는 경량 파인튜닝 과정을 바꿀 수 있었지만, 최종 어댑터는 NVIDIA가 지정한 모델 및 평가 스택에서 실행돼야 했다.

NVIDIA의 기술 보고서는 Nemotron 3 Nano를 하이브리드 Mamba-Transformer mixture-of-experts 모델로 설명한다. 이 모델은 총 316억 개의 파라미터를 포함하며, 각 순전파에서 32억 개가 활성화된다. 임베딩을 포함하면 약 36억 개다.

우승 팀의 공개 작성물에 따르면, 제공된 훈련 세트에는 비트 조작, 수치 방정식, 암호 산술, 텍스트 암호, 수 체계, 단위 변환 및 중력을 다루는 9,500개의 라벨링된 문제가 포함됐다. 각 프롬프트는 알려지지 않은 변환의 예시를 제공하고, 모델이 새로운 사례에 답하기 전에 규칙을 추론하도록 요구했다.

Kaggle은 제출된 각 어댑터를 vLLM 추론 엔진으로 로드했다. 답변은 주로 LaTeX \boxed{} 표현식에서 추출됐으며, 참조 문자열과 정확히 일치하거나 \(10^{-2}\)의 상대 수치 허용오차 안에 들면 정답으로 집계됐다. 최종 점수는 정답 비율이었다.

고정된 추론 구성에는 8,192토큰 모델 길이, 최대 7,680개의 생성 토큰, 0의 temperature 및 1.0으로 설정된 top_p가 포함됐다. 이러한 통제는 샘플링 동작으로 인한 차이를 줄이고 각 어댑터가 학습한 내용에 순위를 집중시켰다.

비공개 테스트 세트는 최종 답변에 대한 직접 최적화를 제한했지만, 통제된 인간 대 AI 실험을 만들지는 않았다. Kaggle 팀은 서로 다른 컴퓨팅 예산, 외부 리소스 및 자동화 도구를 사용할 수 있었고, 일부 제출물은 AI에 크게 의존했을 수도 있다. 따라서 리더보드는 동일한 실험실 조건에서 보조 없이 작업한 개별 연구자가 아니라 완성된 시스템과 워크플로를 비교한다.

3. AIRA3는 여러 모델과 코딩 하니스를 사용했다

메타는 AIRA₃가 단일 에이전트나 중앙 컨트롤러에 의존하지 않는다고 밝혔다. 이 시스템은 격리된 환경에서 여러 장기 실행 에이전트를 운영하며, 각 에이전트는 언어 모델과 코딩 하니스를 결합한다.

에이전트들은 두 가지 공유 메커니즘을 통해 비동기적으로 협업한다. 포럼에는 가설, 실험 결과 및 토론이 축적되고, 공유 파일시스템에는 솔루션 아티팩트가 저장된다. 개별 에이전트는 정보가 쌓이면서 어떤 발견을 조사하거나 확장할지 결정한다.

이 설계는 유용한 발견이 한 에이전트의 컨텍스트 윈도우나 실행 시간을 넘어서도 유지되도록 의도됐다. 하나의 모델-하니스 쌍이 수행한 실험은 다른 쌍의 입력이 될 수 있어, 이후 작업이 독립적으로 탐색을 다시 시작하는 대신 앞선 결과를 바탕으로 진행할 수 있다.

실시간 Nemotron 대회를 위해 메타는 OpenCode와 함께 GPT 5.5를 사용하는 구성 및 Claude Code와 함께 Claude 4.8을 사용하는 구성을 결합한 앙상블을 사용했다. 따라서 8위 결과는 하나의 기반 언어 모델이 아니라 완전한 AIRA₃ 워크플로에 귀속된다.

메타는 동일한 비공개 테스트 세트에서 여러 대회 후 평가 결과도 보고했다. MuseCode와 Muse Spark 1.2를 사용한 구성은 메타가 골드 메달 성능이라고 설명한 수준에 도달했다. OpenCode와 Muse Spark 1.1, OpenCode와 GLM 5.2를 사용한 구성은 실버 메달 범위에 도달했다.

이러한 사후 결과는 오케스트레이션 방식이 서로 다른 모델 및 하니스 조합에서도 작동할 수 있다는 유용한 근거이지만, 추가적인 실시간 순위는 아니다. 대회 기간에 보고된 8위 순위를 받은 것은 GPT 5.5와 Claude 4.8 앙상블뿐이다.

4. AIRA3가 메타의 이전 연구 에이전트 작업을 확장하는 방식

AIRA₃는 메타가 2026년 4월에 문서화한 AIRA₂ 시스템을 잇는다. 이전 프로젝트는 자율형 머신러닝 연구의 세 가지 병목, 즉 제한된 실험 처리량, 장기 탐색 중 신뢰할 수 없는 검증 신호, 고정된 단일 턴 모델 운영자의 제한된 행동에 초점을 맞췄다.

AIRA₂는 비동기 멀티 GPU 워커 풀, Hidden Consistent Evaluation 프로토콜 및 작업 범위를 대화식으로 정하고 디버깅할 수 있는 ReAct 에이전트로 이러한 문제를 해결했다.

메타는 AIRA₂가 MLE-bench-30에서 24시간 후 평균 백분위 순위 81.5, 72시간 후 83.1을 달성했다고 보고했으며, 이는 가장 강력한 베이스라인의 72.7과 비교된다. 별도의 AIRS-Bench 스위트에서는 AIRA₂가 20개 과제 중 6개에서 명시된 인간 최고 성능을 넘어섰다.

AIRA₃ 발표는 평가를 선택된 연구 벤치마크에서 외부 마감일과 비공개 채점을 갖춘 진행 중인 대회로 옮긴다. 또한 포럼 및 파일시스템 설계는 병렬 워커를 단지 실험 처리량을 늘리는 방법으로 제시하는 대신, 지속적으로 실행되는 에이전트 간 협업을 강조한다.

메타는 아직 AIRA₃ 논문, 소스 릴리스 또는 상세한 기술 보고서를 공개하지 않았다. 발표에는 에이전트 수, 총 컴퓨팅 지출, 훈련 레시피, 실험 횟수, 메타 연구자의 개입 또는 공유 지식의 가치와 더 많은 시행을 실행한 가치의 차이를 분리하는 어블레이션이 공개되지 않았다. 따라서 현재로서는 8위 워크플로를 재현하거나 어느 구성 요소가 가장 크게 기여했는지 판단할 수 없다.

5. 이 결과가 입증하는 것과 아직 검증되지 않은 것

가장 명확한 실용적 결과는 자율형 연구 워크플로가 외부 평가 아래 제약된 모델 훈련 문제에서 상위 10위 솔루션을 만들었다는 점이다. 연구 에이전트를 구축하는 개발자에게 이는 데이터 생성, 실험, 파인튜닝 및 선택을 충분히 잘 관리해 경험 있는 Kaggle 팀과 경쟁할 수 있는 워크플로를 보여준다.

이 결과는 AIRA₃가 가치 있는 연구 질문을 독립적으로 선택했거나, 평가를 설계했거나, 자체 기반 에이전트 모델을 개선했다는 것을 보여주지 않는다. 이 시스템은 알려진 대회 목표에 맞춰 별도의 Nemotron 모델의 사전 정의된 역량을 최적화했다. 이를 재귀적 자기 개선으로 설명하는 것은 현재 이용 가능한 증거를 넘어선다.

메타는 동일한 시스템이 과제 명세만 바꿔 도메인 간 이동할 수 있다고 밝혔다. 메타는 내부 벤치마크에서 프로덕션 GPU 커널의 지연 시간이 27% 감소했고, 음역된 고대 아시리아 아카드어를 영어로 번역하는 Kaggle의 Deep Past Challenge에서 골드 수준 성능을 기록했다고 보고했다.

Deep Past 대회는 Kaggle이 독립적으로 문서화했지만, 메타는 해당 실행에 대한 식별 가능한 AIRA₃ 리더보드 항목, 점수 또는 기술 작성물을 제공하지 않았다. GPU 커널 수치도 내부 결과이며, 공개된 워크로드, 베이스라인, 하드웨어 구성 또는 측정 방법이 없다. 따라서 두 결과 모두 독립적으로 재현 가능한 증거가 아니라 메타가 보고한 전이 테스트로 다뤄야 한다.

자율형 연구 시스템을 평가하는 기업에 Nemotron 순위는 경쟁력 있는 과제 성능을 보여주지만, 비용과 효율성은 답하지 못한다. 컴퓨팅 사용량, 인간 감독 기록 및 독립적인 병렬 에이전트와의 통제된 비교가 없다면, 이 결과는 AIRA₃가 전문가 팀보다 경제적인지 또는 공유 협업 메커니즘이 동등한 양의 비조정 탐색보다 뛰어난지를 보여줄 수 없다.

자주 묻는 질문

AIRA3는 무엇인가요?

AIRA₃는 메타의 자율형 AI 연구 시스템이다. 메타는 이를 격리된 환경에서 작업하고 공유 포럼 및 파일시스템을 통해 협업하는 여러 장기 실행 모델-코딩 하니스 쌍으로 설명한다.

AIRA3가 NVIDIA 대회에서 우승했나요?

아니다. 8위를 차지하고 Kaggle 골드 메달을 획득했다. 7개 팀이 더 높은 순위를 기록했으며, 대회의 순위 상금은 상위 3위에 지급됐다.

실시간 제출물에는 어떤 모델이 사용됐나요?

메타는 실시간 출전작이 OpenCode와 함께 실행된 GPT 5.5와 Claude Code와 함께 실행된 Claude 4.8을 결합했다고 밝혔다.

AIRA3는 Nemotron에서 무엇을 변경했나요?

NVIDIA의 Nemotron-3-Nano-30B 베이스 모델용으로 rank가 32로 제한된 LoRA 어댑터를 만들었다. 대회는 적응된 모델이 구조화된 추론 문제에 더 정확하게 답하는지를 측정했다.

AIRA3는 공개적으로 이용할 수 있나요?

메타의 발표는 AIRA₃ 소스 릴리스, 다운로드 가능한 시스템 또는 완전한 기술 논문을 제공하지 않았다. 정확한 훈련 과정과 컴퓨팅 요구 사항은 공개되지 않은 상태다.

참고 자료

Share

이 글 공유