AI News字数 2924阅读时长8 分钟

NVIDIA 称 AVO 完成 ARC-AGI-3 全部 183 个公开关卡

NVIDIA 称 AVO 完成了 ARC-AGI-3 全部 183 个公开关卡,凸显了智能体框架的进展,同时也留下了验证方面的问题。

一、NVIDIA 的 AVO 通过了该基准测试的公开环境

NVIDIA 称,其 AVO 编程智能体在 ARC-AGI-3 的公开部分取得了 100% 的分数,完成了 25 个交互式环境中的全部 183 个关卡。

该公司于 8 月 21 日通过其经过验证的 NVIDIA AI 账号公布了这一结果。根据该帖文,AVO 在没有说明、明确规则或既定目标的情况下进入每个环境。它必须通过交互发现可用控制方式,推断何为进展,并确定如何完成每个游戏。

这与回答一组固定问题存在实质性差异。ARC-AGI-3 向智能体呈现一系列视觉状态,并允许其采取行动。智能体必须利用由此产生的变化来推断隐藏规则,在同一关卡中记住发现,修正错误认知,并避免浪费行动。

该公告没有说明此次运行所使用的基础模型,也没有提供推理成本、尝试次数、总行动次数、计算预算、完整轨迹或可复现的记分卡。因此,得到确认的说法比“一个新模型解决了 ARC-AGI-3”更为有限:NVIDIA 称,一个 AVO 智能体系统完成了全部公开测试集。

二、ARC-AGI-3 的 100% 分数衡量什么

ARC-AGI-3 于 2026 年 3 月推出,是 ARC-AGI-1 和 ARC-AGI-2 中静态网格变换任务的交互式后继版本。其环境旨在测试四项相互关联的能力:探索、目标获取、世界模型构建和规划。

测试者不会收到关于游戏的自然语言说明。它必须确定哪些视觉元素重要,测试可能的行动,推断因果关系,并利用这些发现高效行动。该基准测试刻意避免依赖语言知识或从互联网检索事实的任务。

仅完成关卡不足以获得满分。ARC-AGI-3 使用相对人类行动效率(Relative Human Action Efficiency,RHAE),将智能体的行动次数与人类表现进行比较。在当前计分体系下,100% 的结果意味着该智能体完成了每个关卡,同时满足了该基准测试对总体人类相对效率的要求。

ARC Prize 在研究了 458 名人类参与者后,于 4 月 14 日修订了该体系。每关基线从第二佳人类表现调整为人类表现中位数,降低了对异常幸运运行的敏感性。单个关卡的最高贡献也从 100% 提高到 115%,使某一关卡中异常高效的表现能够抵消其他关卡较弱的效率。ARC Prize 表示,这一组合调整使人类和 AI 分数均提高了约 0.5 个百分点。

该基准测试发布时的难度差距相当显著。ARC Prize 的技术报告记录显示,人类能够解决每个环境,而列出的前沿系统在该基准测试标准化、无框架的评估下得分低于 1%。截至 7 月 24 日,高推理强度下的 Claude Opus 5 已达到经验证的 30.16%,显示出模型层面的快速进展,但在没有专用编排的情况下,该基准测试的大部分仍未被解决。

三、AVO 是一个智能体系统,而非新发布的基础模型

AVO 是 Agentic Variation Operators(智能体化变异算子)的缩写。NVIDIA 研究人员在 3 月一篇关于自主进化搜索的论文中介绍了这一方法。

传统的 LLM 辅助进化系统将模型置于固定流程之中。框架选择父代解,要求模型生成候选解,对其进行评估,并使用预先写好的规则更新种群。

AVO 扩展了模型的角色。其通用编程智能体可以检查先前解及其分数的完整谱系,查询领域专用知识库,运行评估工具,诊断失败,编辑实现,并决定何时进行另一项测试是有用的。持久记忆使先前尝试中的证据能够影响后续决策。

在已发布的实现中,只有当新版本通过正确性检查,并达到或优于最佳已提交分数时,AVO 才会接受该版本。失败实验仍作为搜索历史的一部分保留,而成功版本则以提交形式保存。这使变异从一次性的生成调用,转变为延展的“规划—实现—测试—修复”循环。

NVIDIA 最初在 Blackwell B200 GPU 的注意力内核优化任务上评估 AVO。在七天的自主运行期间,该智能体探索了超过 500 个优化方向,并提交了 40 个内核版本。其最佳多头注意力实现以 BF16 精度达到 1,668 TFLOPS,并且在测试配置中最多比 NVIDIA cuDNN 高出 3.5%,比 FlashAttention-4 高出 10.5%。

随后,该系统在约 30 分钟内将所得成果适配到分组查询注意力,在相较 cuDNN 最多提升 7.0%、相较 FlashAttention-4 最多提升 9.3% 的情况下取得增益。这些实验确立了 AVO 作为一种长时间运行的软件优化方法。将该智能体应用于陌生的交互式游戏,表明其循环或许可以迁移到最初被记录的内核搜索场景之外。

NVIDIA 尚未公布足够细节,以确定 ARC-AGI-3 配置如何准确映射到内核论文中描述的架构。尤其是,该公告没有披露其中包含哪些工具、记忆结构、环境适配器或基准测试专用指令。

四、公开测试集结果并非该基准测试的首个满分

AVO 并非首个被报告完成全部 183 个公开关卡的智能体系统。

Tycho 研究团队报告称,其在 7 月使用 GPT-5.6 Sol 和 Claude Opus 5 获得了 100.00 RHAE 分数。其 Opus 5 运行以 6,641 次计分行动完成公开测试集,而 GPT-5.6 Sol 运行使用了 7,766 次。Tycho 构建可执行、针对特定游戏的世界模型,可对其进行测试、修复、用于规划,或在直接推理更合适时绕过它们。

ARC Prize 的社区排行榜将 Tycho 列为 100%,日期为 7 月 29 日。排行榜还列出了其他若干高度脚手架化、接近饱和的系统,包括得分 99.9% 的 Retrodict 和得分 99.0% 的 executable-world-model baseline1 系统。

因此,NVIDIA 的结果并不能证明 ARC-AGI-3 首次被解决。其更有限的研究价值在于:另一个智能体架构——此前已在自主软件优化中得到展示——据称达到了同一公开测试集上限。

这一区别也很重要,因为 ARC Prize 默认不独立验证社区排行榜提交结果。公开任务产生的结果通常为自报,且公开环境、工具、计分代码和人类基线均向系统开发者开放。

ARC Prize 的技术报告对这一限制的表述尤为直接。报告将公开测试集描述为演示,并称其表现“绝不是衡量通往 AGI 进展的有效指标”。官方能力比较优先采用在未公开任务上的受控评估,并排除任务专用的外部框架。

公开测试集分数仍可衡量一个有文档记录的智能体设计是否成功探索并完成可用环境。但它本身无法确立在未见过的 ARC-AGI-3 游戏上的表现,无法排除针对基准测试的专门工程,也无法证明通用智能。

五、这一结果对智能体开发者意味着什么

AVO 的结果进一步表明,围绕语言模型构建的系统与所选择的模型本身一样可能具有决定性影响。

ARC-AGI-3 奖励那些能够保留观察结果、将暂定规则转化为可测试表征、检测矛盾,并选择既收集信息又推进目标的行动的智能体。这些要求与长时间运行的软件工作高度相似:智能体必须保留代码库状态,解读测试失败,修订实现,并避免重复不成功的方法。

因此,对开发者而言,有价值的比较不只是 100% 与较低模型分数之间的差异,而是无状态或轻度脚手架化的模型调用,与配备持久记忆、可执行假设、评估工具和迭代控制循环的智能体之间的差异。

尚未解决的问题是泛化能力。AVO 先前的内核结果和新的游戏结果覆盖了两个不同领域,这比仅有基准测试演示更具信息量。然而,NVIDIA 尚未发布 ARC 评估包,无法让独立研究人员复现此次运行、检查其轨迹,或在未公开环境中测试相同配置。

在这些工件或经验证评估出现之前,该结果应被视为一项由公司报告、展示智能体编排能力的有力演示,而不应被视为新的基础模型分数,或 ARC-AGI-3 私有泛化问题已被解决的证明。

常见问题

NVIDIA AVO 是什么?

AVO,即 Agentic Variation Operators,是一种自主编程智能体方法,利用规划、工具、持久记忆、执行反馈和重复测试来改进候选解。

NVIDIA 发布了新模型吗?

没有与 ARC-AGI-3 结果一同公布新的基础模型。NVIDIA 将 AVO 描述为通用编程智能体,帖文也没有说明其底层模型。

ARC-AGI-3 上的 100% 是什么意思?

这意味着据报告的系统完成了该基准测试的 25 个公开环境和 183 个关卡,同时达到了最高的总体人类相对行动效率分数。

AVO 是首个达到 100% 的系统吗?

不是。Tycho 于 2026 年 7 月报告称,其使用 GPT-5.6 Sol 和 Claude Opus 5 在同一公开测试集上获得了 100.00 RHAE。

NVIDIA 的结果经过独立验证了吗?

没有。NVIDIA 的公告未包含 ARC Prize 的独立验证或可复现记分卡。除非明确标注为其他情况,公开测试集和社区排行榜结果均为自报。

参考来源

Share

分享这篇文章