ARC Prize 基金会近日发布论文《ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence》(arXiv:2603.24621),正式介绍第三代智能体智能基准 ARC-AGI-3。与前两代的静态格子推理不同,本代改为「回合制交互环境」:智能体没有说明、没有目标指引,必须亲自探索、推断环境机制、规划动作。论文显示,所有环境都受过人类校准、人类可以 100% 解出;而截至发布的旗舰模型,在官方评测下的成绩全部低于 1%。
从静态谜题到交互式环境
ARC-AGI-1(2019)与 ARC-AGI-2(2025)用「从少量输入输出样例推断变换规则」的静态网格任务测量数据高效推理。ARC-AGI-3 把评测从「看样例猜规则」升级为「上场动手摸清规则」:每关是一个回合制环境,智能体逐步观察一帧 64×64 网格、16 色的画面,再用很小的动作空间(5 个基础动作 + 撤销 + 按坐标选格)推进游戏。环境刻意只用「核心知识先验」——物体性、基础几何、空间拓扑与物理直觉,全程不出现语言、数字与文化符号,避免依赖外部知识。
四个能力支柱
论文把智能体智能拆成四部分:探索(主动与周围互动获取信息)、建模(把观察归纳成可预测的世界模型)、目标设定(无人告知时自行判断值得追求的状态)、规划与执行(从当前状态规划路径并能不断纠偏)。最核心最难的一环是:智能体永远不知道目标和通关条件,必须自主推演。
以行动效率计分
本代改用动作效率替代正确率:从首次接触环境到通关所用「操作/回合」数越少越聪明。得分指标 RHAE(Relative Human Action Efficiency,读作 Ray)逐关把智能体动作数与「人类上位数最佳」基线相比,效率取平方(人类 10 步、AI 100 步时仅得 1%),并按关卡线性加权、单关上限 1.15 倍,最后跨全部环境取平均。这一设计既惩罚「暴力乱试」,也让 AI 成绩能与人类基线直接换算。
人类校准与数据集构成
为了保证「对人类容易」,每个环境由 10 位普通人试玩,至少 2 人能独立从零通关才纳入。官方累计 486 名参与者、414 个候选环境、2,893 次尝试,验证全部环境对人类 100% 可解(中位通关约 7.4 分钟)。数据集则反转前代约 10:1 的公私比例:公开演示集 25 个环境、半私有 55 个、全私有 55 个,后两者用作评测与比赛,刻意与公开集分布不同以防针对性过拟合。
发布时旗舰模型不足 1%
在官方排行榜(不带定制 harness、统一系统提示词)上,发布时四家前沿模型的半私有成绩为:Anthropic Opus 4.6(Max)0.50%、Gemini 3.1 Pro Preview 0.40%、GPT 5.4(High)0.20%、Grok-4.20 0.10%。官方另设社区榜收纳 harness 成果,但明确提示不能当作 AGI 进展的证据——公开的 harness 已能脚本化打满公开集 100%,因此公开集成绩永远不会计入官方榜。2026 年 ARC Prize 总奖池提升至 200 万美元,设 ARC-AGI-3 与(最后一年的)ARC-AGI-2 两条赛道。论文称,截至 2026 年 3 月它是唯一尚未饱和的通用智能体智能基准。
核心总结
- 升级方向:从静态规则推断转向回合制交互环境,重点测探索、建模、目标设定与规划执行
- 计分方式:以相对人类基线的「动作效率」(RHAE)计分,暴力尝试会被重罚
- 人类可解:486 人、414 个候选环境经校准,全部环境人类 100% 可解,中位约 7.4 分钟
- 数据集构成:公开 25 / 半私有 55 / 全私有 55,公私比例相对前代逆转
- 现状:发布时旗舰模型官方成绩 0.1%–0.5%,全部低于 1%
原文:ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence(arXiv,2026-04-17)



