近年来,在人工智能领域,除了大语言模型在自然语言处理上的惊艳表现外,一个名为ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence,抽象与推理语料库)的基准测试正悄然成为衡量AI系统“真正智能”的关键标尺。其对应的Leaderboard(排行榜)更是吸引了全球顶尖研究团队和独立开发者竞相角逐,成为AI领域最受瞩目的竞技场之一。

什么是ARC-AGI?为何重要?

ARC-AGI由OpenAI研究科学家François Chollet于2019年提出,旨在评估AI系统在从未见过的、简单的视觉推理任务上的表现。每个任务由若干对输入-输出网格组成,要求AI通过观察少数几个示例,归纳出隐含的规则,并应用到新的输入网格上。这些任务对人类来说极其简单——一个5岁儿童通常都能完成,但绝大多数AI系统至今仍举步维艰。

与传统的图像分类或自然语言处理基准不同,ARC-AGI刻意与训练数据无关:每个任务都是全新的,无法通过记忆或模式匹配解决。它测试的是AI的抽象推理能力、泛化能力以及因果理解力,这正是通用人工智能(AGI)的核心。Chollet曾表示:“如果你能解决ARC,你就基本解决了AGI的关键部分。”

排行榜现状:突破缓慢,但曙光初现

ARC-AGI Leaderboard记录了所有公开提交的系统在“隐藏验证集”上的得分,满分100%。截至2025年5月,排行榜最佳成绩仍徘徊在30%左右,远低于人类平均85%的水平。这一现实揭示了当前AI在“强智能”上的巨大短板。

不过,近两年出现了若干值得关注的进展:

  • 2024年,来自DeepMind的团队凭借“符号搜索+神经引导”混合方法,首次将得分推至29.6%,短暂登顶。
  • 2025年初,独立研究者“Ryan Krueger”使用一种基于程序合成的可微分搜索算法,以30.1%的成绩刷新纪录,引起社区热议。他发表的技术报告中指出,关键在于让模型自动生成能解释任务规律的小型程序,而非直接端到端学习。
  • 紧随其后的还有OpenAI的一个内部项目(未公开详细架构),得分29.8%,以及微软研究院的“ConceptFormer”系统,得分28.4%。

值得注意的是,所有排名靠前的系统都不是纯神经网络,而是结合了符号推理、搜索算法和手工设计的归纳偏置。这似乎印证了Chollet的论断:“当前的深度学习无法独自通向AGI,需要回归到更强的抽象建模。”

竞赛的深层意义:从“记忆”到“理解”

ARC-AGI Leaderboard并非简单的排名游戏,它正在深刻影响AI研究的方向。许多团队表示,为了提升在ARC上的表现,他们不得不放弃大规模数据和算力堆砌,转而专注于:

  1. 因果发现:让AI学会识别输入输出间的因果关系,而非相关性。
  2. 组合泛化:用有限的基本模块组合出无限任务,类似人类将已知知识迁移到新场景。
  3. 紧凑表示:鼓励用最少的规则解释一个任务,这与奥卡姆剃刀原则一致。

例如,排名第三的“ConceptFormer”通过显式建模对象的颜色、位置、数量等离散概念,并学习它们之间的转换规则,在涉及算术和空间变换的任务上表现突出。而DeepMind的混合系统则在需要“内外对称”推理的任务中几乎达到人类水平。

争议与未来展望

当然,ARC-AGI也并非没有争议。部分批评者认为,这些任务过于抽象且缺乏实际应用场景,无法完全代表AGI。但支持者引用Chollet的回应:“正是这种简洁性和普遍性,使其难以被数据驱动方法‘作弊’——它考验的是算法本身的智能。”

随着大语言模型展现出有限但令人惊讶的推理能力(甚至有人用GPT-4尝试解决ARC任务,仅得约10%),社区开始探索将语言模型与符号系统结合的新路径。2025年4月,Anthropic发布的研究显示,通过将ARC任务转化为自然语言描述并让Claude 3.5进行一步步行推理,得分达到18%,但该方法计算成本极高。

可以预见,ARC-AGI Leaderboard的竞争将持续升温。它不仅是技术的测试场,更是人类对“智能本质”理解的缩影。正如许多AI研究者所言:“我们离解决ARC还有多远,离AGI就有多远。” 未来,谁能突破那道30%甚至40%的关口,或许就会引发AI范式的真正革命。