NVIDIA 表示 AVO 已完成全部 183 個 ARC-AGI-3 公開關卡
NVIDIA 表示 AVO 已完成全部 183 個 ARC-AGI-3 公開關卡,突顯代理程式框架的進展,但驗證問題仍未有定論。
一、NVIDIA 的 AVO 通過了基準測試的公開環境
NVIDIA 表示,其 AVO 編程代理程式在 ARC-AGI-3 的公開部分取得 100% 分數,完成了 25 個互動環境中的全部 183 個關卡。
公司於 8 月 21 日透過其已驗證的 NVIDIA AI 帳戶公布結果。根據該帖文,AVO 進入每個環境時均沒有指示、明確規則或既定目標。它必須自行發現可用控制方式、推斷何謂進展,並透過互動判斷如何完成每個遊戲。
這與回答一組固定問題有實質分別。ARC-AGI-3 向代理程式呈現一連串視覺狀態,並容許其採取行動。代理程式必須利用由此產生的變化推斷隱藏規則、在同一關卡中記住發現、修正錯誤信念,以及避免浪費行動。
公告沒有指出此次運行所使用的基礎模型,亦沒有提供推理成本、嘗試次數、總行動數、運算預算、完整軌跡或可重現的記分卡。因此,已確認的說法比「一個新模型解決了 ARC-AGI-3」更為有限:NVIDIA 表示,一個 AVO 代理程式系統完成了整個公開題組。
二、ARC-AGI-3 的 100% 分數衡量甚麼
ARC-AGI-3 於 2026 年 3 月推出,是 ARC-AGI-1 和 ARC-AGI-2 靜態網格轉換任務的互動式後繼版本。其環境旨在測試四項相互連結的能力:探索、獲取目標、建立世界模型,以及規劃。
測試者不會收到任何以自然語言提供的遊戲說明。它必須判斷哪些視覺元素重要、測試可能的行動、推斷因果關係,並利用這些發現有效率地行動。該基準測試刻意避免依賴語言知識或從互聯網檢索事實的任務。
單靠完成關卡不足以取得滿分。ARC-AGI-3 使用相對人類行動效率(Relative Human Action Efficiency,RHAE),將代理程式的行動次數與人類表現比較。按照現行評分系統,100% 的結果表示代理程式完成每一關,同時符合該基準測試整體相對人類效率的要求。
ARC Prize 在研究 458 名人類參與者後,於 4 月 14 日修訂該系統。每關的基準由第二佳人類表現改為人類表現中位數,減低對異常幸運運行的敏感度。單一關卡的最高貢獻亦由 100% 提高至 115%,容許某一關特別高效率的表現,抵銷其他地方較弱的效率。ARC Prize 表示,兩項改動合計使人類和 AI 分數提高約 0.5 個百分點。
推出時的難度差距相當大。ARC Prize 的技術報告記錄,人類能夠解決每一個環境,而所列的前沿系統在基準測試標準化、無框架輔助的評估下,分數低於 1%。截至 7 月 24 日,Claude Opus 5 在高推理力度下已取得經驗證的 30.16%,顯示模型層面的進展迅速,但在沒有專門編排的情況下,基準測試的大部分仍未被解決。
三、AVO 是代理程式系統,不是新公布的基礎模型
AVO 是 Agentic Variation Operators 的縮寫。NVIDIA 研究人員在 3 月一篇有關自主進化搜尋的論文中介紹這個方法。
傳統由 LLM 輔助的進化系統,會把模型置於固定流程之內。框架選擇父代解決方案、要求模型生成候選方案、評估該方案,並利用預先寫好的規則更新族群。
AVO 擴大了模型的角色。其通用編程代理程式可檢視先前解決方案和分數的完整譜系、查閱特定領域知識庫、運行評估工具、診斷失敗、編輯實作,並決定何時值得再作測試。持久記憶容許較早嘗試所得的證據影響後續決策。
在已發表的實作中,AVO 只會在新版本通過正確性檢查,且配得上或改善最佳已提交分數時才接受該版本。失敗實驗仍會作為搜尋歷史的一部分保留,而成功版本則會保留為提交紀錄。這使變異不再是一次性的生成呼叫,而成為延伸的計劃—實作—測試—修復循環。
NVIDIA 最初在 Blackwell B200 GPU 的注意力核心最佳化上評估 AVO。在七日自主運作期間,代理程式探索了超過 500 個最佳化方向,並提交 40 個核心版本。其最佳多頭注意力實作在 BF16 精度下達到 1,668 TFLOPS,在所測試配置中最多較 NVIDIA cuDNN 高 3.5%,較 FlashAttention-4 高 10.5%。
系統其後在約 30 分鐘內把所得工作調整至分組查詢注意力,較 cuDNN 最多提升 7.0%,較 FlashAttention-4 最多提升 9.3%。這些實驗確立了 AVO 作為長時間運行的軟件最佳化方法。把代理程式應用於陌生的互動遊戲,證明其循環或可轉移至最初記錄的核心搜尋場景以外。
NVIDIA 尚未公布足夠細節,讓外界確定 ARC-AGI-3 配置如何對應至核心論文所述架構。尤其是,公告沒有披露其中使用了甚麼工具、記憶結構、環境適配器或針對基準測試的指示。
四、公開題組結果並非該基準測試首個滿分
AVO 並非首個被報告完成全部 183 個公開關卡的代理程式系統。
Tycho 研究團隊於 7 月報告,同時使用 GPT-5.6 Sol 和 Claude Opus 5 取得 100.00 RHAE 分數。其 Opus 5 運行以 6,641 個計分行動完成公開題組,而 GPT-5.6 Sol 運行則使用 7,766 個。Tycho 建構可執行、針對特定遊戲的世界模型,可加以測試、修復、用於規劃,或在直接推理更合適時略過。
ARC Prize 的 Community Leaderboard 列出 Tycho 於 7 月 29 日取得 100%。榜單亦列出數個其他高度框架化、接近飽和的系統,包括 Retrodict 的 99.9% 及 executable-world-model baseline1 system 的 99.0%。
因此,NVIDIA 的結果並未證明 ARC-AGI-3 首次被解決。其較有限的研究價值在於:另一種代理程式架構——先前已在自主軟件最佳化上展示——據報亦達到相同的公開題組上限。
這項區分亦很重要,因為 ARC Prize 預設不會獨立驗證 Community Leaderboard 的提交結果。在公開任務上產生的結果通常屬自行申報,而公開環境、工具、評分程式碼和人類基準均可供系統開發者使用。
ARC Prize 的技術報告對這項限制說得格外直接。報告把公開題組描述為示範,並表示其表現「emphatically not a valid measure of progress towards AGI。」官方能力比較優先採用對未公開任務進行的受控評估,並排除針對特定任務的外部框架。
公開題組分數仍可衡量一個已有記錄的代理程式設計,是否成功探索及完成可用環境。然而,單憑這個分數,無法確立其在未見過的 ARC-AGI-3 遊戲上的表現、排除針對基準測試的工程設計,或證明通用智能。
五、結果為代理程式開發者帶來甚麼改變
AVO 的結果增添了證據,顯示語言模型周邊的系統,可能與所選模型本身同樣重要。
ARC-AGI-3 獎勵能保存觀察結果、把暫定規則轉化為可測試表述、偵測矛盾,以及選擇既能收集資訊又能朝目標推進的行動之代理程式。這些要求與長時間運行的軟件工作非常相似:代理程式必須保留儲存庫狀態、解讀測試失敗、修訂實作,並避免重複不成功的方法。
因此,對開發者而言,有用的比較不只是 100% 與較低模型分數之間的差異,而是無狀態或僅輕度框架化的模型呼叫,與配備持久記憶、可執行假設、評估工具和迭代控制循環的代理程式之間的差別。
尚未解決的問題是泛化能力。AVO 先前的核心結果與新的遊戲結果涵蓋兩個不同領域,這比只在單一基準測試上展示更具資訊價值。然而,NVIDIA 尚未發布 ARC 評估套件,讓獨立研究人員重現該次運行、檢查其軌跡,或在未公開環境上測試相同配置。
在這些產物或經驗證評估出現前,該結果應被視為公司所報告、具說服力的代理程式編排示範,而非新的基礎模型分數,亦非 ARC-AGI-3 私有泛化問題已被解決的證明。
常見問題
NVIDIA AVO 是甚麼?
AVO,即 Agentic Variation Operators,是一種自主編程代理程式方法,利用規劃、工具、持久記憶、執行回饋和重複測試來改善候選解決方案。
NVIDIA 有發布新模型嗎?
沒有任何新基礎模型隨 ARC-AGI-3 結果公布。NVIDIA 把 AVO 描述為通用編程代理程式,而帖文沒有指出其底層模型。
ARC-AGI-3 的 100% 代表甚麼?
這表示該報告中的系統完成了基準測試的 25 個公開環境及 183 個關卡,並取得最高的整體相對人類行動效率分數。
AVO 是首個取得 100% 的系統嗎?
不是。Tycho 於 2026 年 7 月報告,使用 GPT-5.6 Sol 和 Claude Opus 5 在同一公開題組上取得 100.00 RHAE。
NVIDIA 的結果是否經獨立驗證?
沒有。NVIDIA 的公告未包括獨立 ARC Prize 驗證或可重現的記分卡。除非另有明確標示,公開題組和 Community Leaderboard 結果均屬自行申報。
參考來源
Share