当人工智能公司为了获取高质量训练数据,将目光投向图书馆中尘封的珍稀书籍时,一场关于知识与文化的争议正愈演愈烈。近日,多家媒体报道称,部分AI公司正在大规模收购甚至“粉碎”稀有书籍——它们并非出于破坏目的,而是为了将书页逐页拆解、高速扫描,以建立海量文本数据库。这一做法被图书管理员和文化遗产保护者形容为“对文明的野蛮切割”。

数据饥渴下的“暴力拆解”

据《纽约时报》披露,包括一些大型语言模型开发公司在内的AI企业,正通过中间商大量收购图书馆注销的旧书、拍卖会上的古籍以及二手市场的绝版书。这些书籍通常因版权过期或无人认领而流入市场。然而,AI公司需要的不是书籍的物理形态,而是其中的文字内容。为了获得最高质量的扫描图像,许多公司选择将书脊直接切掉,然后用高速扫描仪逐页处理。一本书在被数字化之后,往往只剩下一堆散落的纸片,最终被当作废纸处理。

一位不愿透露姓名的内部员工表示:“我们每天处理的书籍数以千计,很多是19世纪甚至18世纪的出版物。老板要求‘越快越好’,没人关心书本身是否还能恢复原状。” 这种“拆书”模式并非AI行业首创——谷歌图书项目早年也曾因大规模扫描引发诉讼,但当时至少还保留了数字化副本。如今的AI公司连电子版都未必公开,纯粹为内部训练服务。

失落的“文化孤本”与版权灰色地带

更令人担忧的是,这些被粉碎的书籍中不乏孤本、限量版或私人收藏品。例如,一套19世纪出版的《英国鸟类学》手绘插图本,曾在拍卖行以2.3万美元成交,其后被证实已遭某AI公司拆解扫描。当收藏家和学者要求查看原书时,得到的回复是“原书已无法恢复,但可以提供高清数字扫描件”。然而对于古籍研究者而言,纸张质地、装帧工艺、墨迹深浅等物理信息,是数字图像无法替代的。

法律层面也存在巨大争议。尽管许多作品已进入公有领域,但物理摧毁合法购买的书籍并不违法。然而,美国国会图书馆前数字战略顾问迈克·费雷拉指出:“AI公司正在利用法律漏洞:他们声称购买书籍属于‘合理使用’,但销毁原书的行为实际上剥夺了公众接触文化遗产的权利。” 部分出版商正考虑提起集体诉讼,指控AI公司通过破坏稀缺资源来垄断数据。

行业反应与自救尝试

面对舆论压力,一些AI公司开始调整策略。OpenAI表示其训练数据主要来自公开网络和合作伙伴的授权内容,不鼓励破坏书籍。而另一家未公开名称的初创公司则辩称:“我们只处理图书馆已经决定淘汰的书籍,这些书原本就会被销毁。” 但图书馆界对此说法嗤之以鼻——许多小型图书馆所谓“淘汰”的书籍,恰恰因为缺乏资金存储或数字化能力,才被低价出售,并非真的不愿保留。

纽约公共图书馆日前宣布,将暂停所有面向AI公司的旧书出售业务,并考虑修改废弃图书处理条例。英国大英图书馆也紧急声明,正在清查馆藏是否曾流入此类拆书链条。与此同时,一个名为“古籍数字保护联盟”的非营利组织发起倡议,呼吁AI公司签署承诺书,确保任何数字化行为不得损毁原书,且数字副本应向公众开放。

文明传承与技术进步的两难

这场争议的核心,折射出人工智能时代一个深刻的伦理悖论:AI需要海量、高质量、多样化的文本数据来提升能力,而这些数据往往蕴藏在已经出版且极易被忽视的旧书中。从实用主义角度看,拆书扫描似乎高效且低成本;但从文化传承角度看,每一本被物理摧毁的稀有书籍,都是不可再生的文明碎片。

历史学家彼得·伯克曾警告:“每一代人都只看到被保存下来的那部分过去。” 如果AI公司继续这种“拆书式数据采集”,未来学者可能永远无法再触摸到19世纪读者的真实阅读痕迹,只能依赖经过算法清洗的数字幻影。

当技术巨头争相抢夺训练数据时,他们或许忘了:真正推动智能进步的,不只是海量语料,还有人类数千年来对知识本身的敬畏。如何在数据需求与文化保护之间找到平衡,这不仅是AI公司的考题,更是整个数字时代的艰难追问。