在游戏史上,总有那么几款作品以“反人类”的难度著称。其中,2008年诞生的《QWOP》凭借其离谱的操作设计,长期霸占“最难跑步游戏”的宝座——玩家需要分别控制Q、W、O、P四个键来调动运动员的左右大腿和小腿,稍有不慎就会摔得四仰八叉。这款游戏曾让无数玩家崩溃,甚至被戏称为“人类协调能力检测器”。然而近日,一位名为“Kyle”的AI研究者宣布,他已成功利用强化学习算法,让AI在《QWOP》中跑出了100米9.58秒的“博尔特级”成绩,彻底征服了这个折磨了玩家十多年的“魔鬼游戏”。

从“原地抽搐”到“百米飞人”

Kyle的研究过程并不轻松。他使用Unity游戏引擎模拟《QWOP》的物理环境,并基于PPO(近端策略优化)算法构建AI训练模型。初始阶段,AI的表现与新手玩家无异:它胡乱敲击键盘,导致运动员像癫痫发作般剧烈抖动,甚至直接向后摔倒。但经过数万次迭代后,AI逐渐学会了保持重心稳定、调整步频,并在弯道处控制身体倾斜角度。最终,在训练了约50万次后,AI不仅以9.58秒的成绩完成百米赛跑,还额外挑战了“用最小步数完成比赛”的极限模式——它用算法找到了一个近乎完美的“钟摆式”步态,将步数压缩到理论最小值的90%以下。

“最有趣的是,AI学会了一种人类从未尝试过的跑步姿势。”Kyle在博客中展示了几组对比片段:人类玩家通常会尽量让双腿交替前伸,但AI却选择让双膝始终微屈、躯干前倾接近水平,利用重力加速度不断“倒向”前方,再迅速用前脚撑地。“这看起来很不优雅,但物理效率极高——就像某种机械步进机构。”

技术细节:比打败《超级玛丽》更难

与之前AI攻克的《超级玛丽》、《星舰回合》等游戏不同,《QWOP》的难点在于持续的实时控制。AI必须每0.02秒做出一个决策,且任何一个微小的错误(比如某条腿多抬高了0.5度)都会导致连锁摔倒。Kyle的解决方案是引入“混合奖励机制”:AI的奖励不仅来自前进距离,还包括躯干倾斜角、膝盖角度、触地时间等多个子目标。如果躯干倾斜超过某个阈值,AI会立刻受到惩罚。这种设计迫使AI在“跑得快”和“不摔倒”之间找到平衡。

更令人惊讶的是,AI最终掌握的步态中存在大量看似“随机”的肌肉抖动。这些抖动的幅度仅有几像素,但通过高速摄像机分析,它们实际上是AI对抗重力微小扰动的主动调节。“人类运动员的步态中也有类似的无意识微调,但AI将其放大到了极致。”Kyle解释道,“这本质上是一个自适应控制系统在起作用。”

启示:游戏难度设计的边界

Kyle的成果迅速在游戏圈和AI学界引发讨论。一方面,玩家们哀叹“人类最后的尊严也沦陷了”——有玩家试图模仿AI的步态,结果跑了两步就摔断了腿(游戏中的虚拟腿)。另一方面,研究者指出,这种“从摔跤中学习”的范式可能对机器人运动控制具有借鉴意义。波士顿动力公司的工程师甚至主动联系Kyle,希望获取训练数据用于优化Atlas机器人的奔跑算法。

但也有声音质疑:AI攻克这类游戏是否只是“技术炫技”?毕竟《QWOP》的根本乐趣在于逗乐玩家,而非考验智能水平。对此,Kyle淡然回应:“我只是好奇这个游戏的物理极限在哪里。当AI以9.58秒冲过终点线时,我甚至觉得它有点难过——因为再也没有更高的奖赏了。”

或许,这个“死”在AI手上的游戏,恰恰证明了另一件事:我们离真正的“通用人工智能”还很远——因为任何一个会因胜利而高兴的玩家,都不会说出“再也没有奖赏”这种话。但至少,Kyle让我们看到了:无论多难的事,只要敢于用算法去挑战,总会有被征服的一天。