“I‘m trying to understand how dictionaries work”——这句看似简单的英文自白,近日在社交平台上引发了一场关于词典本质的讨论。当一位网友在学术论坛上抛出这个困惑时,他或许没想到,这个问题背后竟牵涉到语言学、数据科学、历史考据乃至人工智能的交叉领域。词典,这本我们从小到大都视为“标准答案”的工具书,究竟是如何被创造出来的?它又是如何回答我们关于“这个词什么意思”的疑问的?
从羊皮卷到数据库:词典的进化史
最早的词典并非我们今天熟悉的样子。公元前7世纪的亚述字典只是将楔形文字与对应含义列成表格;中国的《尔雅》则是按义类编排的词汇手册。真正的转折发生在18世纪:塞缪尔·约翰逊编纂的《英语词典》首次引入大量文学作品中的例句,确立了“用引文证明词义”的范式。
而到了21世纪,词典的载体从纸张变成了屏幕。当你在手机上查词时,看到的词条背后是庞大的数据库——牛津英语词典的在线版本包含超过60万词条,每个词条平均有8-10个义项,每个义项都标注了首次出现年代、语料来源、使用频率等元数据。现代词典编纂者早已不是“坐在书堆里的老学究”,而是混合了语言学家、数据分析师和IT工程师的团队。
词条是如何“炼成”的?
要理解词典的工作原理,首先要明白一个核心问题:词典不是语言本身,而是对语言的“描写”。编纂团队会建立一个被称为“语料库”的海量文本库(现代词典通常包含数十亿词),通过算法自动提取生僻词、新词以及既有词汇的新用法。例如,当“selfie”在2013年突然流行时,牛津词典的监测系统在三个月内捕获了超过1.7万次使用案例,然后编纂者根据这些真实文本归纳出它的定义、词性、典型搭配(如“take a selfie”)。
更令人惊叹的是释义本身的艺术。词典学家需要将复杂的概念压缩成几十个字的定义,同时确保精准、通俗、无歧义。例如,“苹果”在词典中不能只说“一种水果”,还得区分“蔷薇科植物”“可食用”“通常红色或绿色”等特征。遇到动词时,还要区分及物与不及物、不同搭配下的语义差异。这背后有一套严密的“释义语言”规则:用最常用的500-1000个核心词汇来解释其他所有词汇,避免循环定义。
揭秘词典不为人知的“黑箱”
普通用户可能不清楚,词典的字母排序实际上暗藏玄机。英文词典中“a”开头的单词往往占整本书的10%-15%,因为前缀“a-”衍生出大量词汇;而“x”开头的词条可能只有十多个。为了平衡篇幅,编纂者需要精确计算每个字母的页面分配。更复杂的是多义词的处理:一个单词可能有几十个义项,比如“run”在《牛津词典》中收录了超过200个义项,编排顺序通常遵循“历史演变优先”或“使用频率优先”的原则——前者能呈现语义衍生脉络,后者更符合实际查询需求。
数字化时代还带来了新的挑战。如今的在线词典不仅要提供释义,还要整合发音(包括不同口音)、词形变化、同义词辨析、词源追溯等。有些词典甚至开始利用机器学习:当用户查询一个生僻词时,算法会自动推荐相关常见词汇,并给出例句中的语境分析。例如,谷歌词典的“来自网络”功能会从互联网实时抓取句子,但这也带来了准确性风险——2018年曾有人发现,一个编纂者故意输入的恶搞定义被算法抓取并展示在搜索结果中。
人工智能正在改变词典的定义
随着ChatGPT等大语言模型的普及,一场关于“词典未来”的争论正在上演。有人问道:既然AI可以瞬间生成任何词语的解释,我们还需要传统词典吗?对此,剑桥词典的编辑负责人曾指出:“机器生成的释义往往缺乏规范性——它可能告诉你‘苹果’就是一种‘圆圆的、可以吃的东西’,但不会告诉你它属于蔷薇科,也不会区分‘红富士’和‘嘎啦’的品种差异。”
更本质的区别在于,词典承载着语言规范化的使命:它需要判断某个用法是否已被广泛接受、是否需要标注“俚语”或“古语”。而AI只是概率性地复现训练数据中的常见模式,无法做出价值判断。例如,当“literally”一词被越来越多地用作“比喻性强调”时,传统词典需要经过多年的观察才会在词条中加入这个义项并标注“非正式”,而AI可能直接将它作为正常用法输出。
我们为什么依然需要词典?
回到那位网友的困惑——“我试着理解词典是如何工作的”,这个问题背后其实隐藏着人类对确定性知识的渴望。在我们这个词汇爆发式增长的时代(每年大约有1000个新词进入英语词典),词典依然充当着语言“仲裁者”的角色。它告诉我们:这个词是对的,那个词是错的;这个用法是优雅的,那个用法是粗俗的。
然而,词典的权威性正在受到挑战。2023年,美国方言学会将“-ussy”这个后缀评为“年度最有用新词”,但主流词典至今尚未收录。这折射出一个现实:词典的更新速度永远追不上语言的变化。但正如一位词典编纂者所说:“词典不是语言的监狱,而是语言的镜子——它反射的永远是已经发生的事实,而不是应该发生的事实。”
或许,理解词典如何工作,就是理解语言本身如何演化——它不是一套铁律,而是一个被亿万人不断重塑的活系统。下次你打开词典查词时,不妨多花十秒看看词条底部的词源信息或使用标签,那里藏着一个民族千百年的思维密码。而我们每个人,都在用自己的语言实践,参与着下一版词典的“编写”。