在人工智能评测领域,动辄耗资数十万美元的基准测试早已司空见惯,但一群来自独立研究社区的开发者却反其道而行之——他们用仅99美元的成本,搭建了一个基于经典MUD(多用户地牢)游戏的实验环境,试图回答一个看似简单却极具颠覆性的问题:一个诞生于20世纪70年代的文本冒险游戏,能否有效评估当今最先进的大语言模型(LLM)?
从“龙与地下城”到“AI考场”
MUD,即Multi-User Dungeon(多用户地牢),是网络游戏的前身。玩家通过纯文本指令在虚拟世界中探索、战斗、解谜,所有交互依赖自然语言理解与逻辑推理。这种“无图形、无语音、纯文字”的特性,恰好成为评估LLM语言能力的天然试验场——没有视觉干扰,没有预设路径,模型必须像人类一样阅读环境描述、制定策略并输出连贯指令。
这项名为“MUD-Eval”的项目由匿名开发者社区“Lingua Machina”发起。他们租用了一台廉价云服务器(月费约10美元),部署了开源的MUD框架“Evennia”,并编写了包含15个谜题、3个战斗场景和1个开放探索区域的定制地牢。整个搭建成本(含服务器租赁、域名和基础配置)严格控制在99美元以内。
实验设计:让GPT-4、Claude与Llama“下地牢”
实验选取了6个主流LLM模型,包括GPT-4、Claude 3.5、Gemini 1.5 Pro以及三个开源模型(Llama 3 70B、Mixtral 8x22B、Qwen2 72B)。每个模型被赋予一个“冒险者角色”,通过API接口直接接收MUD服务器的文本输出,并生成下一步行动指令。
评估指标分为三类: - 生存能力:模型能否在遭遇怪物时合理战斗或逃跑 - 解谜效率:完成预置谜题所需的交互轮次 - 探索惊喜度:在未提示的情况下发现隐藏区域的比率
结果令人意外。GPT-4在解谜任务中得分最高(14/15),但有一次因过度谨慎试图“与巨型蜘蛛谈判”而被反复攻击,暴露出对情境危险度的误判。Claude 3.5则在探索惊喜度上领先,主动发现了开发者自己都忘记记录的一条隐藏密道。最令人惊讶的是开源模型Qwen2 72B,在战斗场景中表现出出人意料的策略性——它学会了“先撤退收集草药,再返回战斗”的复合指令,而GPT-4和Claude在同场景中均只会重复“攻击”。
99美元的镜子:折射LLM的明与暗
“许多人认为评估LLM需要复杂的数学基准或昂贵的人类标注,但我们想证明,一个99美元的文本游戏就能暴露模型的深层缺陷。”项目负责人“Marauder42”(化名)在接受采访时表示,“比如我们注意到,几乎所有模型都倾向于在遇到‘发光的门’时直接推门,而不会先检查是否有陷阱——这显然来自训练数据中‘发光的物体意味着重要道具’的统计偏见。”
但质疑声同样存在。伦敦大学学院AI安全研究员陈雨薇指出,MUD环境的评估维度过于狭窄:“它只能测试模型的文本理解和基本逻辑,无法衡量知识准确性、数学推理或代码生成能力。一个能在MUD中屠龙的模型,可能连小学数学题都做不对。”此外,99美元的成本虽然低廉,但维护一个持续更新的MUD场景需要不断投入人力,长远成本未必低于传统基准。
被遗忘的“压力测试”
值得注意的是,某些经典MUD谜题给LLM带来了意想不到的挑战。例如,一个需要玩家向NPC说出特定“口令”才能通过的门,模型往往尝试用暴力破解——连续输出数十个不同单词,而不是通过对话推断口令。这种“枚举式强迫症”揭示了LLM在推理深度上的短板。
“人类玩家会在对话中寻找线索:‘守卫提到他喜欢蜂蜜酒’——然后尝试说‘蜂蜜酒’。但模型会把每个单词都试一遍,这根本不是智能。”Marauder42补充道。
未来:MUD能否成为AI评测的“低成本快车道”?
尽管存在局限性,MUD-Eval项目已吸引到多家AI实验室的关注。谷歌DeepMind的一位匿名研究员表示,他们正在考虑将类似框架用于内部模型的“压力测试”:“传统基准测试越来越‘饱和’,模型分数都接近90%以上,但真实场景中的失误率仍然很高。MUD提供的是一种‘动态不可预测性’,这是静态数据集永远无法提供的。”
目前,项目团队已将代码开源,并计划推出“MUD挑战赛”,邀请开发者设计新的地牢场景。或许在不久的将来,我们评价一个AI模型时,不再只看它能在MMLU上得多少分,还要看它能否活着走出那座99美元搭建的古墓地牢。
(完)