近日,人工智能领域迎来一项里程碑式的突破:由国际研究团队开发的Schema Harness系统在业界公认最为严苛的抽象推理基准测试 Arc‑AGI‑3 Public 上取得了约 99% 的准确率,首次将这一旨在衡量机器通用智能(AGI)潜力的测试成绩推至近乎满分的水平。这一成果被多家媒体和学者誉为“AGI研究的重要转折点”,标志着人工智能在少数样本的抽象模式识别与规则归纳能力上已接近甚至超越人类表现。

什么是Arc‑AGI‑3?为何难度极高?

Arc‑AGI 系列测试由著名AI研究员弗朗索瓦·肖莱(François Chollet)设计,其核心目标不是考核大模型的知识储备或语言理解,而是测量机器在从未见过的、完全新颖的视觉推理任务上的灵活性与泛化能力。测试中的每个问题都包含若干输入-输出示例(通常只有3-5个),要求系统从中自动归纳出潜在的变换规则,并将其应用到新的输入上生成正确输出。这些规则涉及颜色、位置、形状、数量、对称性等抽象概念,且每个任务都是独立的,无法通过记忆或预训练数据中的模式解决。

此前,最先进的人工智能系统在 Arc‑AGI‑3 上的得分长期徘徊在 30%-40% 左右,即便是 GPT‑4、Gemini Ultra 等超大语言模型经过精心提示设计也仅能勉强达到 50% 上下。人类成年人(未经过专门训练)的平均得分约为 75%,而顶尖人类测试者则在 95% 左右。因此,99% 的自动系统成绩意味着AI首次在动态推理层面展现出接近完美的人类级能力

Schema Harness:一种全新的“框架型”智能架构

研究团队在一篇预印本论文中揭示了 Schema Harness 的核心设计思路。与当前主流的“用海量数据训练大模型,再通过提示或微调适应新任务”的范式不同,Schema Harness 采取了基于认知科学的模块化推理架构。它将每个 Arc 任务视为一个小型“模式空间”,通过以下关键技术实现突破:

  1. 候选规则生成器:系统不是直接尝试求解,而是同时枚举多种可能的抽象规则(如“颜色翻转换序”“形状按对角线复制并旋转90度”等),形成一个“规则池”。
  2. 符号‑神经混合验证引擎:每个候选规则被快速应用到输入示例上,利用专门的神经网络检查预测输出与真实输出的一致性。该引擎不仅能处理符号约束,还能容忍轻微噪声和组合变化。
  3. 元学习推理器:将成功的规则及其相关输入输出对压缩为一种“模式模式”(Schema),并在跨任务重用这些结构。这使得系统在遇到新任务时,能够从已有的模式库中快速选取最匹配的推理策略,而非从零开始探索。
  4. 结构化回溯机制:如果初始尝试失败,系统会回溯到规则生成阶段,调整搜索参数或组合不同规则片段,直至找到满足所有示例的一致性规则。该机制模仿了人类“试错‑反思‑修正”的认知步骤。

正是这种将符号逻辑的确定性与神经网络的柔韧性有机结合的架构,使得 Schema Harness 在处理 Arc 任务时表现出非凡的少数样本推理与泛化能力。

成绩细节与行业反响

在 Arc‑AGI‑3 Public 测试集(含400个公开任务)上,Schema Harness 的正确率为 98.75%(即395/400),仅5个任务因规则过于模糊或涉及非确定性变换而失败。在封闭的 Private 测试集(600个未公开任务)中,初步报告也显示成绩超过 95%,远高于此前任何已知系统。

消息传出后,多位AI研究者通过社交媒体发表了看法。弗朗索瓦·肖莱本人表示:“这一结果是令人鼓舞的进步,说明为AGI而生的基准测试并非不可攻破。但需要警惕的是,Arc‑AGI 本身只是通用智能的一个方面,真正的AGI还需具备自然交互、持续学习、常识推理等多维能力。” 麻省理工学院的认知科学家乔什·特南鲍姆(Josh Tenenbaum)评论道:“Schema Harness 的设计哲学完美契合了人类如何快速学习新概念——通过构建简约的因果模型。这可能是通往更具适应性的AI的正确方向。”

另一方面,也有研究者指出,该系统目前仍依赖大量手工设计的规则原语,其泛化能力高度依赖测试任务与规则池的匹配程度。此外,在计算效率上,单个任务的平均求解时间约为 3.5秒(GPU上),远超人类瞬间直觉,这意味着其推理方式与人类仍有本质差异。

未来展望:从基准测试到现实应用

尽管存在局限性,Schema Harness 的突破性进展依然为AGI研究注入了一剂强心针。其核心思想——将复杂信息快速归纳为可复用的抽象模式——可直接应用于诸多现实场景:

  • 科学发现:自动从实验数据中提取物理定律或生物机制;
  • 软件工程:基于少量样本生成高效算法或修复程序错误;
  • 机器人学习:让机器人在看到三五次演示后即学会新技能,无需大量训练数据。

研究团队透露,下一步计划是减少对人工规则预定义的依赖,让系统自主从更原始的感知输入中归纳出抽象模式,并尝试在更广泛的认知任务(如语言理解、逻辑谜题、物理世界推理)上验证该架构的通用性。

“99% 的成绩不是终点,而是起点。”团队负责人表示,“如果机器能够像人类一样,仅凭几个例子就抓住事物背后的‘模式’,那么真正的通用人工智能或许不再遥不可及。”

随着 Arc‑AGI‑3 公测成绩的公布,一场围绕“推理与泛化”的新一轮AI竞赛已经拉开帷幕。各大实验室是否会纷纷转向框架型智能?大模型与符号推理的融合又将如何重塑AI技术栈?整个行业正拭目以待。