NVIDIA AVO智能体ARC-AGI-3基准测试获100%满分 无监督自主推理能力取得突破
NVIDIA AVO智能体ARC-AGI-3基准测试获100%满分 无监督自主推理能力取得突破
8月22日,英伟达宣布通用编程智能体AVO在ARC-AGI-3交互式推理基准测试中取得100%得分,完成全部25个公开环境中的183个关卡,在无指令、无明确规则条件下通过自主探索学习完成任务。
2026年8月22日,英伟达官方宣布其通用编程智能体AVO在ARC-AGI-3交互式推理基准测试中取得100%满分,完成了全部25个公开环境中的183个关卡。这一结果展示了AI智能体在无监督环境下的自主推理和适应能力取得重要突破。
测试表现
- 满分成绩:AVO在ARC-AGI-3基准测试中完成100%的任务,25个公开环境的183个关卡全部通关
- 无监督设定:测试在没有任何指令、明确规则或既定目标的情况下进行
- 自主学习:智能体通过自主探索、学习、记忆和持续运行来发现规律并完成所有任务
- 交互式推理:不同于传统静态基准测试,ARC-AGI-3要求智能体在交互中动态理解环境规则
技术意义
ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是由François Chollet创立的基准测试,被视为衡量AI通用推理能力的重要标尺。ARC-AGI-3作为最新版本,引入了更复杂的交互式环境,要求智能体具备探索、试错、记忆和抽象推理能力。
AVO取得满分标志着AI智能体在开放世界推理方面取得显著进展。传统大语言模型虽然在语言理解和生成方面表现出色,但在需要主动探索、从稀疏奖励中学习、进行抽象类比推理的任务上仍有差距。英伟达此次突破表明,结合强化学习、世界模型和编程能力的智能体架构正在逼近通用智能体的核心能力。
这一成果与英伟达在AI算力和智能体基础设施上的持续投入密切相关。AVO的成功也将为自动驾驶、机器人、科学研究等需要自主决策的领域提供技术参考。