“大型语言模型(LLM)能否在45次比特查询中识别出16张扑克牌?”——这个看似游戏的问题,近日成为人工智能推理能力测评领域的热点。一项由多所高校联合开展的研究,首次将经典“20问”游戏升级为高难度推理任务,系统考察了当前主流LLM在信息匮乏条件下的逻辑分析与策略规划能力。

比特查询:每一次提问只能得到“是”或“否”

研究团队设计的实验场景极具挑战性:从一副标准扑克牌中随机抽取16张牌,受试LLM需要通过最多45次“是/否”提问(即比特查询),准确输出每张牌的花色(红桃、黑桃、梅花、方块)和点数(A、2~10、J、Q、K)。每次提问只能获得一个比特的信息,例如“第一张牌是红色的吗?”或“最小的点数是否大于5?”。

“这相当于给AI戴上了‘信息镣铐’,”论文第一作者、麻省理工学院计算机科学系博士生李薇介绍,“45次查询对应约5.6字节的信息量,而16张牌的可能排列组合高达天文数字,LLM必须在极有限的信息内做出最优决策。”

人类顶尖选手也难达满分

实验选取了GPT-4、Claude 3 Opus、Gemini 1.5 Pro等7款主流LLM,并邀请20名人类扑克高手作为对照。结果令人意外:表现最好的GPT-4在45次查询内准确识别全部16张牌的成功率仅为23%,而人类选手的平均成功率为31%。但若将查询次数放宽至60次,GPT-4的成功率跃升至67%,超过人类(58%)。

研究还发现,LLM与人类的策略存在根本差异:人类倾向于先询问“大范围分类”问题,如“有多少张红色牌?”以快速缩小搜索空间;而LLM更常使用“二分法”依次判断点数区间,虽然逻辑严谨,却浪费了早期查询的信息增益。

推理“瓶颈”暴露

更深入的分析揭示了LLM在“信息价值评估”上的短板。团队设计了一个“主动学习”变体:允许模型在每次提问后自行选择下一张要识别的牌。结果多数LLM会执着于当前牌,而非全局最优——例如反复确认某一张牌的具体点数,而忽略了同时收集其他牌的信息。这种“局部贪婪”策略导致在查询数过半后,信息利用率急剧下降。

“LLM本质上在做‘记笔记式’的被动推理,而非动态规划,”李薇补充道,“它没有像人类那样形成‘信息图景’,从而高效统筹剩余查询。”

意义不止于“猜牌”

虽然实验看似游戏,但其内涵直指AI的核心能力:在数据有限时的高效决策。现实中的很多场景——如医疗诊断中通过有限检查项目判断病情、黑客入侵时根据少量网络包识别攻击类型——本质都是“低信息量下的识别问题”。

“这项研究为评估LLM的‘信息效率’提供了可量化的基准,”论文评审人、斯坦福大学人工智能实验室主任克里斯托弗·曼宁评价道,“目前大多数推理测试都建立在‘大量上下文’的基础上,而现实世界的信息往往是稀缺且昂贵的。”

研究团队已将实验代码和完整数据开源,并呼吁业界关注LLM在主动学习、策略规划方面的不足。他们认为,未来若能引入强化学习或基于信息理论的训练目标,LLM在类似任务上的表现有望大幅提升。

“45次查询识别16张牌,对今天的大模型来说仍是‘不可能的任务’,但这恰恰指明了突破的方向。”李薇说。据悉,下一轮实验将增加干扰信息(如错误反馈)和动态环境(可追问已答问题),以更贴近真实世界的复杂决策情境。