近日,美国加利福尼亚北区联邦地区法院作出了一项引发科技界与法律界广泛关注的裁决:法官正式驳回了谷歌公司试图依据《数字千年版权法》(DMCA)来阻止第三方对其搜索结果进行大规模数据抓取(scraping)的请求。这一判决不仅为长期悬而未决的网络数据权属争议划下了一条清晰的界限,也意味着科技巨头在“反爬”战场上尝试的“版权武器”未能奏效。
案件背景:谷歌的“反爬”新策略
本案源于谷歌对一家名为“Bright Data”的数据抓取公司提起的诉讼。Bright Data专门提供公开网络数据采集服务,其业务涉及抓取谷歌搜索结果、购物信息等公开页面内容。谷歌认为,这种大规模抓取行为不仅违反了其服务条款,更构成了对谷歌数据库的侵权。然而,与传统以“违反服务条款”或“计算机欺诈”为由的诉讼不同,谷歌此次创新性地引用了DMCA中的“避风港原则”反制条款。
谷歌主张,其搜索结果页面中的元数据、摘要文本以及URL结构属于受版权保护的“汇编作品”,而Bright Data的抓取行为相当于“规避了谷歌用于保护这些作品的技术措施”。具体而言,谷歌声称其网页中的robots.txt文件(爬虫协议)、网页代码中的特定标识符以及反爬机制(如CAPTCHA验证码)构成了有效的“技术保护措施”,而Bright Data通过绕过这些措施获取数据,属于DMCA第1201条禁止的“规避行为”。
法院裁决:DMCA不适用于“网页爬虫”
负责审理此案的法官在裁决书中明确指出,谷歌的诉讼请求存在根本性的法律缺陷。法院认为,DMCA的立法初衷是保护电影、音乐、软件等具有“原创性表达”的作品免受非法拷贝,而非用于阻止对公开网络数据的访问和获取。法官特别强调:
“谷歌试图将DMCA的‘技术保护措施’条款扩展至机器人排除协议(robots.txt)和网页结构本身,但后者本质上并非‘有效控制访问’的版权保护装置,而是网站所有者对自动化程序的管理指令。法律不应当将商业惯例的违反等同于版权侵权。”
裁决进一步指出,Bright Data抓取的谷歌搜索结果是“公开可访问”的,任何普通用户都可以通过浏览器正常查看,不存在所谓的“版权屏障”。即便谷歌在代码层面设置了反爬机制,这些机制也仅是“网站运营策略”,而非法律意义上的“保护版权作品的技术措施”。
法律意义:数据权属的“分水岭”
这一判例被法律界视为网络数据权属争议的“分水岭”。长期以来,科技公司一方面依赖网络爬虫抓取公开数据来训练人工智能、优化搜索引擎等,另一方面又试图通过版权法、合同条款、技术壁垒来阻止他人抓取自己的数据。此案明确传递了两条重要信号:
第一,DMCA不是“万能反爬工具”。该法的技术保护措施条款主要针对盗版电影、软件破解等“硬规避”行为,而网页的robots.txt协议、速率限制、IP封锁等属于“软管理”,不构成DMCA意义上的“有效访问控制”。强行套用可能导致法律条款的滥用。
第二,公开数据的“合理使用”空间得到维护。法官实际上暗示,对于用户可以通过正常浏览获取的公开信息(如搜索结果标题、摘要、价格等),第三方在非商业恶意用途下进行抓取,不必然构成侵权。这为搜索引擎、价格比较网站、学术研究等依赖数据采集的业态提供了法律保障。
各方反应:科技界与数据行业博弈加剧
谷歌方面对裁决表示“失望”,并称将继续通过其他法律途径保护其服务免受“寄生性抓取”的侵害。其发言人表示:“Bright Data的行为不仅消耗我们的服务器资源,更试图利用谷歌投入数十亿美元构建的搜索结果来牟利。”谷歌可能选择上诉,或转向以“不正当竞争”“违反服务条款”等理由重新起诉。
Bright Data则在声明中高呼“胜利”,认为裁决“捍卫了互联网的开放精神”。该公司CEO表示:“公开数据属于所有人,任何公司都不应该用版权法来锁住公共信息。这场判决是对数据垄断主义的有力回击。”
值得注意的是,此案也引发了AI行业的密切关注。当下,众多AI模型训练需要大量抓取网络公开数据,谷歌、微软等巨头本身就依靠抓取数据训练模型,却同时起诉第三方抓取者,这种“双重标准”一直备受争议。此次裁决可能促使更多AI公司大胆进行数据采集,但也可能催生新的立法博弈——美国国会正研究是否需要对网路数据抓取进行专门立法。
展望:并非“末日”,而是规则重建的开始
尽管Bright Data暂得胜诉,但这并不意味着网络爬虫从此“无法无天”。法官在裁决中保留了谷歌基于其他理由(如合同违约、不正当竞争)继续诉讼的权利。此外,如果谷歌确实对搜索结果页面中的“原创表达”(如精心撰写的产品描述、图片、视频)添加了真正的DRM保护(如加密流媒体),他人绕过该保护仍属违法。
长远来看,这一判例可能推动行业建立更清晰的“爬虫规则”:网站所有者可以继续通过技术手段限制抓取速率,但无法再援引DMCA进行“版权恐吓”;而数据采集者也需要更多地关注robots.txt协议、尊重服务器负载,并避免对登录后内容、重构HTML等“非公开”数据的突破性抓取。
结语:互联网从诞生之初就建立在“链接与抓取”的开放精神之上,但商业力量的介入使得“数据围墙”越来越高。法官此次在DMCA问题上的“一票否决”,或许正是提醒各方:版权法的利刃不应斩向公共信息的获取自由。大数据时代的数据权属博弈,仍需在法律、商业与公共利益之间寻找更精巧的平衡点。