Meta 的 AIRA3 在 NVIDIA 4,182 隊 Nemotron 挑戰賽中排名第八
Meta 表示,AIRA3 在自主微調 NVIDIA 的 Nemotron-3-Nano-30B 推理模型後獲得 Kaggle 金牌。
文章目錄 · 12
一、一項實時競賽讓 Meta 的研究系統與數千支隊伍較量
Meta 表示,其 AIRA₃ 自主研究系統在 NVIDIA 的 Nemotron Model Reasoning Challenge 中排名第八,在 4,182 支隊伍中獲得 Kaggle 金牌。
這項成績來自一項實時競賽,而非 Meta 事後整理的基準測試。Kaggle 記錄顯示,挑戰賽由 2026 年 3 月 16 日至 6 月 15 日舉行,吸引了 5,223 名參賽者,並收到 71,743 份提交作品。Meta 於 6 月讓 AIRA₃ 參賽,並表示其最終作品與其他參賽者一樣,均透過同一個私有測試集評估。
第八名並不等於贏得比賽:有七支隊伍的排名高於 AIRA₃,而 Kaggle 的現金獎項只頒予首三名。「金牌」指的是該平台的獎牌級別。這個區別很重要,因為把結果形容為 AIRA₃「擊敗 4,000 支隊伍」,會抹去排名更高的參賽作品,也混淆了獲得獎牌與取得第一名之間的差別。
即使有這項限定,這個排名仍較內部示範提供更有力的證據。目標模型、提交格式、評估程序及截止日期均由 NVIDIA 和 Kaggle 訂定。Meta 可以針對已公布的任務作出優化,但並不控制最終評分環境。
Meta 將結果解讀為證據,顯示 AIRA₃ 能以可與人類專家相比的水平,改善特定模型能力。該排名支持較狹義的說法:系統產出了極具競爭力的微調提交作品。它本身並不能證明一般科學能力,或證明系統在開放式工作中等同人類研究人員。
二、Nemotron 挑戰賽實際衡量甚麼
競賽要求參賽者在保留相同基礎模型的前提下,提高 NVIDIA-Nemotron-3-Nano-30B 的推理準確度。指定提交作品為相容的低秩適應(LoRA)適配器,最大秩為 32。
這項限制令比賽成為針對性的模型改進問題,而非尋找最強、沒有任何限制的語言模型。參賽者可以改變訓練資料、提示策略、合成資料流程、強化學習方法或輕量微調程序,但其最終適配器必須在 NVIDIA 指定的模型及評估堆疊上運行。
NVIDIA 的技術報告將 Nemotron 3 Nano 描述為混合式 Mamba-Transformer 專家混合模型。它合共包含 316 億個參數,每次前向傳遞會啟動 32 億個參數;若計入嵌入層,則約為 36 億個。
根據冠軍隊伍公開發表的說明,提供的訓練集包含 9,500 個附標籤問題,涵蓋位元操作、數值方程、字母算術、文字密碼、數字系統、單位換算及重力。每個提示均提供未知轉換的示例,要求模型在回答新個案前推斷規則。
Kaggle 使用 vLLM 推理引擎載入每個提交的適配器。答案主要從 LaTeX \boxed{} 表達式中擷取;當答案與參考字串完全一致,或落在 \(10^{-2}\) 的相對數值容差內時,即視為正確。最終分數為正確答案的比例。
固定推理設定包括 8,192 個詞元的模型長度、最多 7,680 個生成詞元、溫度為零,以及 top_p 設為 1.0。這些控制項減少了抽樣行為造成的差異,讓排名集中反映各適配器所學到的內容。
私有測試集限制了直接針對最終答案作出優化,但並未形成受控的人類對 AI 實驗。Kaggle 隊伍可以使用不同的運算預算、外部資源及自動化工具,而部分提交作品本身亦可能高度依賴 AI。因此,排行榜比較的是完成的系統和工作流程,而非在相同實驗室條件下、沒有輔助的個別研究人員。
三、AIRA3 使用多個模型及編碼工具框架
Meta 表示,AIRA₃ 並不依賴單一智能體或中央控制器。它在隔離環境中運行多個長時間運作的智能體,每個智能體均把語言模型與編碼工具框架配對。
這些智能體透過兩項共享機制非同步協調。一個論壇用於傳遞假設、實驗發現及討論,而共享檔案系統則儲存解決方案工件。隨着資訊累積,個別智能體自行決定要調查或延伸哪些發現。
此設計旨在讓有用的發現能跨越單一智能體的上下文視窗或運行時間而保留下來。一個模型與工具框架配對所進行的實驗,可以成為另一個配對的輸入,讓後續工作在先前結果之上建立,而非各自重新開始探索。
在實時 Nemotron 競賽中,Meta 使用了結合 GPT 5.5 與 OpenCode,以及 Claude 4.8 與 Claude Code 的集成系統。因此,第八名的成績屬於完整的 AIRA₃ 工作流程,而非任何單一底層語言模型。
Meta 亦報告了多項在同一私有測試集上進行的賽後評估。使用 Muse Spark 1.2 配合 MuseCode 的配置,達到 Meta 所形容的金牌表現。Muse Spark 1.1 配合 OpenCode,以及 GLM 5.2 配合 OpenCode,則達到銀牌範圍。
這些事後結果是有用證據,顯示協調機制可與不同的模型及工具框架組合配合運作,但它們並非額外的實時排名。只有 GPT 5.5 和 Claude 4.8 的集成系統,在比賽期間取得所報告的第八名。
四、AIRA3 如何延續 Meta 先前的研究智能體工作
AIRA₃ 延續 Meta 在 2026 年 4 月記錄的 AIRA₂ 系統。該早期項目聚焦於自主機器學習研究中的三項瓶頸:有限的實驗吞吐量、長時間搜尋期間不可靠的驗證訊號,以及固定、單輪模型操作員的受限行為。
AIRA₂ 透過非同步多 GPU 工作池、Hidden Consistent Evaluation 協議,以及能夠互動式界定範圍及除錯工作的 ReAct 智能體,處理了這些問題。
Meta 報告指出,在 MLE-bench-30 上,AIRA₂ 在 24 小時後達到平均百分位排名 81.5,72 小時後達到 83.1,而最強基線為 72.7。在其獨立的 AIRS-Bench 測試套件上,AIRA₂ 在 20 項任務中的六項超越了所述的人類最佳水平。
AIRA₃ 的公告把評估由選定研究基準,轉移至設有外部截止日期及私有評分的進行中競賽。其論壇及檔案系統設計亦着重持續運作智能體之間的協作,而非僅將並行工作者呈現為提高實驗吞吐量的方法。
Meta 尚未發表 AIRA₃ 論文、原始碼發布或詳細技術報告。公告未披露智能體數目、總運算支出、訓練配方、實驗次數、Meta 研究人員的介入程度,或用以區分共享知識價值與增加試驗次數價值的消融實驗。因此,目前尚無法重現第八名的工作流程,亦無法判斷哪個組件貢獻最大。
五、這項結果證實了甚麼,以及仍有哪些未獲驗證
最清晰的實際結果是,一個自主研究工作流程在外部評估下,為受限制的模型訓練問題產出了前十名解決方案。對正在建立研究智能體的開發者而言,這顯示該工作流程能夠妥善管理資料生成、實驗、微調及選擇,足以與經驗豐富的 Kaggle 隊伍競爭。
這項結果並未顯示 AIRA₃ 獨立選擇了有價值的研究問題、設計了評估,或改進了其自身的底層智能體模型。它是依循已知競賽目標,針對另一個 Nemotron 模型的預先定義能力作出優化。把這形容為遞歸式自我改進,將超出目前可得證據所支持的範圍。
Meta 表示,只要改變任務規格,同一系統便能跨領域運作。它報告稱,在一項內部基準中,生產用 GPU 核心的延遲降低了 27%,並在 Kaggle 的 Deep Past Challenge 中達到金牌級表現;該挑戰涉及把音譯的古亞述阿卡德語翻譯成英文。
Deep Past 競賽有 Kaggle 的獨立記錄,但 Meta 並未為該次運行提供可識別的 AIRA₃ 排行榜條目、分數或技術說明。GPU 核心的數字亦屬內部數據,沒有披露工作負載、基線、硬件配置或量度方法。因此,兩項結果均應視為 Meta 報告的遷移測試,而非可獨立重現的證據。
對評估自主研究系統的公司而言,Nemotron 的排名證明了具競爭力的任務表現,但成本及效率仍未有答案。沒有運算使用量、人類監督記錄,以及與獨立並行智能體進行的受控比較,該結果無法顯示 AIRA₃ 是否較專家團隊更具成本效益,或其共享協調機制是否勝過等量、沒有協調的搜尋。
常見問題
AIRA3 是甚麼?
AIRA₃ 是 Meta 的自主 AI 研究系統。Meta 將其描述為多組長時間運作的模型及編碼工具框架配對,在隔離環境中工作,並透過共享論壇及檔案系統協調。
AIRA3 贏得 NVIDIA 的競賽嗎?
沒有。它排名第八,並獲得 Kaggle 金牌。有七支隊伍排名更高,而比賽的名次獎金只涵蓋首三名。
哪些模型驅動實時提交作品?
Meta 表示,實時參賽作品結合了運行 OpenCode 的 GPT 5.5,以及運行 Claude Code 的 Claude 4.8。
AIRA3 在 Nemotron 中改變了甚麼?
它為 NVIDIA 的 Nemotron-3-Nano-30B 基礎模型產出了 LoRA 適配器,秩限制為 32。競賽衡量經適配的模型是否能更準確回答結構化推理問題。
AIRA3 有公開提供嗎?
Meta 的公告沒有提供 AIRA₃ 原始碼發布、可下載系統或完整技術論文。其確切訓練程序及運算需求仍未披露。
參考來源
Share