近日,以自由软件和用户隐私为核心价值的代码托管平台 Codeberg 宣布,将对其服务条款(Terms of Use,ToU)进行重要更新,新增条款明确禁止利用平台上的代码库进行大型语言模型(LLM)的数据抓取与模型训练行为。这项被称为“LLM-extrusions”的禁令,被视为开源社区对AI公司未经授权使用代码训练模型的最新反击。
禁令背景:社区与AI公司的长期矛盾
随着ChatGPT、GitHub Copilot等AI工具在编程领域的广泛应用,大量开源代码被无差别地抓取、用于训练商业大模型。尽管许多开源协议允许修改和再分发,但AI公司往往忽视代码作者的署名要求,甚至将衍生作品作为闭源产品出售。Codeberg 作为一个由欧洲非营利组织运营的社区平台,长期强调开发者对自身代码的控制权。此次条款更新正是针对“爬虫批量抓取代码,用于训练大模型从而获利”这一现象的明确回应。
新条款核心内容
根据 Codeberg 官方博客披露,修订后的服务条款将“使用自动工具(包括但不限于网络爬虫、API批量请求)访问平台内容,并将其用于训练、微调或增强任何形式的机器学习模型(特别是大型语言模型)”列为禁止行为。违反者将面临账户封禁、内容删除等处罚。
值得注意的是,条款并未完全禁止开放共享。用户仍可出于教育、研究等非商业目的获取代码,但需明确标注来源。Codeberg 强调,这一修改并非反对AI技术本身,而是反对“不透明、无授权、无补偿”的数据利用方式。
开发者与业界反响
消息发布后,在Hacker News、Reddit等开发者社区引发了广泛讨论。许多开源贡献者表示支持,认为这是“保护代码产权的重要一步”。“我写了一个小工具,结果被某公司拿去训练模型,还改头换面成了付费功能,连我的名字都没提。”一位匿名开发者抱怨道。但也有人担忧,此类禁令可能阻碍合法的学术研究,或导致平台用户流失。
与此同时,部分大型AI公司尚未对此发表评论。有法律专家指出,Codeberg 作为平台方有权制定访问规则,但如何有效执行禁令仍存挑战——例如如何识别爬虫是否用于LLM训练,如何处理通过第三方间接获取数据的行为等。
更广泛的行业影响
Codeberg 并非首个采取此类举措的平台。此前,GitHub 曾因 Copilot 项目面临集体诉讼,而 Stack Overflow、Reddit 等平台也已对AI抓取施以更严格的限制。此次 Codeberg 的条款更新,进一步凸显了开源社区与AI商业化之间的紧张关系。
对于中小型AI开发者来说,这一变化可能意味着训练数据的合规成本上升。而对于大型企业,则可能促使更多公司转向与平台签订正式的数据授权协议。长远来看,开源生态或将走向一种更透明的数据共享模式——即代码提供者有权决定自己的劳动成果是否、以及如何被用于训练AI。
结语
技术演进与产权保护之间的博弈从未停止。Codeberg 的“LLM-extrusions禁令”看似是针对特定平台规则的一次调整,实则是对整个AI产业数据伦理的一次叩问。当代码成为驱动智能的“燃料”,如何平衡开放精神与创作者权益,将成为未来数年开源社区与科技公司共同面对的核心议题。