近日,一则关于“AI公司大规模销毁原版书籍”的消息在出版界和科技圈引发轩然大波。据多方信源证实,国内某知名人工智能企业于本周二(3月15日)在其位于北京的数据中心内,集中销毁了超过3万册未经授权的原版纸质书籍,包括大量学术专著、文学经典及技术手册。这一行为迅速被出版界人士、作家及版权保护组织称为“文化焚书”,并质疑其背后涉及的数据训练伦理与版权合规问题。

事件还原:一场隐秘的“清理行动”

据知情人士透露,此次销毁行动始于一周前,涉事公司以“优化存储空间、配合版权合规审查”为由,将库房中存放的纸质书籍全部运往指定销毁点。这些书籍主要来源于该公司早年自主研发的“知识图谱”项目——彼时,员工曾大量购入、复印甚至盗印各类外文原版图书,用于构建其早期自然语言处理模型的基础语料库。

一位不愿具名的前员工向记者表示:“公司当时对版权问题并不重视,认为‘学习’性质的使用属于合理范畴。但随着《生成式人工智能服务管理办法》等法规出台,内部开始紧张,决定彻底清除这批‘灰色资产’。”该员工透露,销毁过程中,公司特意避开了公开披露,直至有废品回收站工人拍摄视频上传社交平台,事件才浮出水面。

争议焦点:数据训练中的“原罪”与合规化转型

此次事件的核心争议,在于AI公司使用受版权保护作品进行模型训练的合法性。长期以来,大量AI企业通过“爬虫抓取+人工扫描”的方式积累训练数据,原版书籍因其内容质量高、逻辑性强,成为大模型理解人类语言的重要“素材”。然而,这种未经授权的使用始终游走在法律边缘。

北京知识产权律师王敏指出:“根据我国《著作权法》,未经权利人许可复制、发行作品,即构成侵权。即便是用于非商业性的科学研究,若涉及大规模复制,也需取得授权。AI公司以‘技术中立’为由的辩解,在司法实践中越来越难以站住脚。”她认为,此次销毁行为更像是企业在监管压力下的一次“紧急避险”——试图灭失侵权证据,而非真正解决版权问题。

行业反思:从“拿来主义”到“正版化”之路

事件发生后,中国出版协会、中国文字著作权协会等机构联合发表声明,呼吁AI企业与版权方建立合法授权机制。声明指出:“技术的进步不应以牺牲创作者权益为代价。AI公司作为技术红利的最先享受者,更应主动承担起版权合规的社会责任。”

事实上,近年来已有部分头部大模型企业开始尝试“正版化”转型。例如,OpenAI与多家出版商签署了内容授权协议,百度、字节跳动等国内企业也陆续建立了版权素材库。但就整个行业而言,大量中小型AI公司仍处于“野蛮生长”阶段,使用盗版书籍、论文、网文等成为公开的秘密。

一位不愿透露姓名的AI技术专家认为:“完全依赖正版数据训练大模型,成本将急剧上升,可能超出多数创业公司的承受能力。但这不是继续侵权的理由。行业需要建立统一的版权交易平台和合理定价机制,让数据使用变得透明、合法。”

涉事公司回应:承认“管理失当”,但拒绝透露细节

截至发稿前,涉事AI公司通过官方公关渠道发布了一份简短的声明,表示:“公司出于合规审查需要,对历史遗留的未经授权纸质资料进行了集中清理,以消除潜在的版权风险。我们对管理上的疏忽深表歉意,并已成立专项小组,全面排查数据来源。未来将严格遵守法律法规,推行100%正版化数据策略。”

然而,对于“是否已将图书内容用于训练已发布的大模型”“销毁书籍的具体书目及数量”等关键问题,声明未予回应。多位出版行业人士表示,仅凭书面承诺远远不够,呼吁监管部门介入调查,并对AI企业使用受版权保护内容的追溯期限、赔偿标准等作出明确界定。

专家建议:构建数字时代的版权新生态

此次“焚书”事件,表面上是一起企业内部清理行为,实则折射出AI行业与版权体系之间深层的结构性矛盾。中国社科院科技伦理研究中心主任李靖教授指出:“我们需要的不是简单的谴责或销毁,而是建立一套适应人工智能发展规律的新型版权框架——例如引入‘数据税’、设置训练补偿基金、推广区块链版权登记等。”

他强调,单纯销毁书籍并不能抹去模型已经“学习”到的知识痕迹。未来,AI企业必须从源头合规,同时在算法层面探索“遗忘”机制,逐步清除非授权数据带来的潜在风险。

结语

随着生成式AI技术的狂飙突进,版权问题正从出版界的角落走向公共舆论的中心。这场由“书籍销毁”引发的风潮,或许只是冰山一角。如何在技术创新与创作者权益保护之间找到平衡点,不仅考验着企业的商业伦理,更考验着整个社会的治理智慧。一夜之间,数万册图书化为纸浆,但关于数据所有的权争论,才刚刚开始。