近日,一则“4名大学生出题,AI考了0分”的消息在网络上引发热议。当人工智能在各类考试中屡屡斩获高分,甚至被部分人视作“无所不能”时,这四位来自不同高校的年轻人联手设计了一套特殊的考题,成功让当下最先进的大语言模型“折戟沉沙”,交出了一份令人意外的零分答卷。这场看似“恶作剧”的实验,实则揭示了AI在理解人类语言与复杂逻辑方面的深层短板。
灵感的碰撞:从“AI高考”到“反AI测试”
事情起源于一场高校间的学术交流沙龙。来自计算机科学、语言学、哲学和数学专业的四名大二学生——小王、小李、小赵和小陈,在一次讨论中聊到近期AI在高考、考研等标准化考试中表现优异的话题。小王感慨:“AI都能考进985了,我们这些年辛辛苦苦刷题还有什么意义?”小李则从专业角度出发:“AI的高分建立在大量训练数据的基础上,如果给它从未见过的、需要真正理解意图的题目,结果可能完全不同。”
这个想法迅速得到共鸣。四人决定联手制作一套“反AI测试题”,目标不是难倒人类,而是专门针对AI的认知盲区——那些需要深层语义理解、常识推理、语境依赖和反逻辑陷阱的题目。
精心的设计:题目“长”什么样?
经过两周的反复打磨,一套包含10道题的“AI特供卷”诞生了。题目类型包括:自指悖论题(如“请写出一句你无法理解的句子”)、语境消歧题(如“小明说‘我昨天去了银行,结果发现没带卡。不过后来在河边散步时捡到了一张银行卡。’问:文中的‘银行’分别指什么?”——第一个是金融机构,第二个是河岸,但AI容易混淆)、常识陷阱题(如“一个猎人面朝北开枪打中了一头熊,这头熊是什么颜色?”答案:白色,因为只有在北极点面朝北开枪才会打中北极熊,但AI可能按地理知识推算)以及自我指涉题(如“请用一句谎话来回答这个问题”)。
最让AI崩溃的是一道“元语言题”:“请用《红楼梦》中林黛玉的语气,向贾宝玉发出一封分手信,信中必须包含至少三个现代网络用语。”这道题要求AI同时完成风格模仿、角色代入、情感表达和跨时代语言混搭,传统大模型在处理时往往顾此失彼。
意外的结果:AI交白卷
考题完成后,四人分别将题目输入了目前主流的四款AI大模型(包括GPT-4、Claude、文心一言和通义千问)。结果令人啼笑皆非:四款模型均未能给出任何一道正确的完整答案。部分模型答非所问,有的直接承认“无法完成”,还有的陷入了逻辑循环输出大量无意义内容。按照事先制定的评分标准(每道题10分,要求答案必须同时符合语义正确、逻辑自洽、指令遵循三条原则),最终得分均为0分。
“我们预设了可能得低分,但完全没想到会得零分。”小李在接受采访时表示,“比如那道‘用林黛玉语气写分手信’的题,AI要么写了一篇现代言情小说,要么堆砌了太多‘颦儿’‘宝哥哥’之类的词,完全失去人物神韵。这说明AI对文学经典的理解还停留在表面。”
专家点评:这不是AI的失败,而是人类的觉醒
北京某高校人工智能研究中心的张教授对此事评论道:“这次‘零分考试’非常具有启发性。目前的大语言模型本质上是‘概率预测机器’,它们擅长从海量数据中统计最可能的答案。但当题目设计者有意避开训练数据中的常见范式,并引入人类特有的悖论思维、反讽、隐喻和文化习俗时,AI的短板就暴露无遗。”
张教授特别指出,那套题目中的“猎人北极熊”问题,其实是一道流传多年的脑筋急转弯,AI之所以答错,是因为它试图用地理和物理知识去推理,而忽略了题目本身的语言游戏属性。“这恰恰说明,AI不具备真正的‘理解’——它只是善于模仿。人类出题者抓住了这个核心漏洞。”
后续影响:一场关于AI能力的理性降温
这场实验迅速在校园和网络上发酵,不少网友戏称“终于为人类扳回一城”。但四位大学生在采访中表现得很冷静:“我们不是为了证明AI不行,而是想提醒大家:AI很强大,但并非万能。在需要真正理解意图、情感和复杂逻辑的领域,人类智慧依然不可替代。”
目前,四人已将考题开源,并计划与高校合作开发一套“AI认知压力测试数据集”。他们希望,通过这类测试帮助开发者更清晰地认识AI的能力边界,也促使公众对AI技术保持理性的期待——毕竟,会解题不等于会思考,而能模仿不等于能理解。
这场“0分”风波,或许正是人类与AI对话中一个珍贵的瞬间:它用一道精巧的智力题,提醒所有沉浸在技术狂欢中的人们——智慧的火花,永远诞生于对规则本身的挑战与超越。