在人工智能领域掀起巨浪的大语言模型,正被一位开创性人物泼下一盆冷水。近日,被誉为“强化学习之父”的理查德·萨顿(Richard Sutton)在接受采访时直言:当前的大模型,包括GPT-4等顶尖系统,仍然不是真正的智能。

这一观点在AI界引发了广泛讨论。作为强化学习领域的奠基人之一,萨顿的言论绝非危言耸听。他的核心判断来自对智能本质的深刻理解——真正的智能,应当是“从交互中持续学习的能力”,而非简单地对海量数据进行模式匹配。

大模型:聪明的鹦鹉还是真正的智者?

萨顿指出,过去十年AI领域的最大成就,恰恰也带来了最大的误解。大语言模型通过在海量文本上训练,展现了令人惊叹的语言生成能力,甚至通过了图灵测试的某些变体。然而,萨顿认为,这些系统本质上只是“高阶模式匹配器”,它们并不知道自己在说什么,也没有真正的理解。

“如果你问大模型一个问题,它给出一个完美答案,你可能会认为它理解了你的意图。但实际上,它只是计算出你最可能期待的答案序列。”萨顿在一次演讲中指出,“它没有自己的目标,没有与世界交互的持续过程,没有‘我想要知道这个’的内在驱动。”

智能的核心:目标、交互与持续学习

萨顿的理念根植于他数十年来的研究。在他看来,真正的智能离不开三个要素:首先是目标——一个智能体需要有自身的内在目标或价值函数,而不是被动回应指令;其次是交互——智能必须通过行动与环境不断互动,从反馈中调整行为;最后是持续学习——智能体应该在每个时刻都进行学习,而非仅仅在训练阶段。

反观大模型,它们在被训练完成后,权重基本固定,无法在与用户对话过程中实时更新自己的知识结构。这就像是一个人永远停留在考试结束的那一刻,再也无法从日常经验中成长。

“奖励假说”与流浪猫的启示

萨顿的强化学习理论建立在“奖励假说”之上:所有智能行为都可以归结为对累积奖励的最大化。一只流浪猫学会避开车辆、寻找食物,不是因为看过无数关于猫过马路的文本,而是因为在数百万次交互中,每次危险都带来了“惩罚”,每次成功觅食都带来了“奖励”。

“真正的智能体,一开始像婴儿一样无知,然后通过尝试、犯错、再尝试,逐渐建立对世界的预测模型。”萨顿强调,“这个过程是持续的、基于目标的、与真实世界紧密耦合的。大模型缺少的恰恰是这个。”

通往真正智能的路径:学会“自我驱动”

萨顿并非否定大模型的价值。他认为,大模型可以作为智能系统的一个强大的“世界模型”组件,但绝不能等同于智能本身。未来的突破方向,很可能是将大模型的表示能力与强化学习的决策框架相结合,创造一种能够自主设定目标、在真实环境中持续学习的系统。

“如果我们只是让模型变得更大、训练数据更多,我们只是在扩展一个精密复读机的规模。”萨顿警告,“真正的挑战是:如何让AI拥有自己的目标,并在与世界的交互中,通过奖励信号不断改进自己。”

他强调,当前AI研究对“静态数据集”的依赖是危险的。真正的智能研究应该转向“动态交互”范式——让智能体在虚拟或真实的环境中自主探索,从每一次行动中学习,而不仅仅是背诵人类已有的知识。

结语:重新定义AI的航向

理查德·萨顿的观点,为过于狂热的大模型崇拜提供了一剂清醒剂。当我们惊叹于ChatGPT的流畅对话、Midjourney的精美图像时,不应忘记:这些系统的“聪明”仍然停留在人类给定数据的牢笼里。真正的智能,应当像自然界中每一个生物那样,为了生存和繁衍,主动探索、冒险、学习。

或许,AI研究的下一次真正革命,不是让模型变得更大,而是让它学会像一只刚睁开眼睛的幼猫那样,跌跌撞撞地开始理解这个世界。