【北京,2025年4月15日电】 一项本为学术资源整合而进行的网络爬虫任务,意外引爆了全球数学界的“地震”——人工智能系统Codex在抓取国际数学家大会(ICM)官网数据时,竟解析出一份疑似“2026年菲尔兹奖得主名单”的内部页面。该消息迅速在学术圈和科技媒体中发酵,截至发稿时,国际数学联盟(IMU)尚未正式回应,但已紧急将相关页面设置为不可访问状态。
据知情人士透露,此次事故源于Codex团队对ICM官网进行的一次“学术信息结构化采集”。该项目旨在自动整理历届大会论文集、获奖者资料及会议日程,以便构建知识图谱。然而,当爬虫深入至一个带有“/admin/2026-fields-confidential”路径的隐藏目录时,意外提取到一个标记为“内部评审备忘录”的HTML文件。文件中列出了四位数学家的姓名、所属机构及简短的研究贡献摘要,格式与官方此前公布的历届菲尔兹奖公告高度一致。
被曝光名单中的四位学者分别来自美国、法国、俄罗斯和巴西,研究方向涵盖数论、几何分析、动力系统与计算数学。其中,巴西籍学者若昂·佩雷拉(João Pereira)的入选尤其引发热议——若属实,他将成为首位来自南美洲的菲尔兹奖得主。名单中还有一位年仅28岁的法国数学家克莱尔·杜邦(Claire Dupont),她因在“双曲几何与Teichmüller理论”中的突破性工作被认为有望获奖,但其年龄与资历是否足以支撑最高荣誉,此前在学界争议不断。
事件曝光后,Codex项目组迅速发布声明,强调爬虫行为“完全基于公开可访问的网页”,且并未使用任何破解或越权手段。“我们只是按照标准robots.txt协议抓取公开页面,并未预期会接触到敏感信息。”项目负责人、麻省理工学院计算机科学教授艾伦·麦卡锡在声明中表示,“发现内容可能涉密后,我们立即截停了爬虫,并通知了IMU秘书处。”
然而,这一解释并未平息质疑。信息安全专家指出,ICM官网的“/admin”路径虽未设密码,但通常会被robots.txt文件禁止抓取。Codex的行为是否构成“技术性越权”,取决于该路径是否明确标注为禁止爬取。截至目前,ICM官网的robots.txt并未直接提到“admin”目录,但包含一条“Disallow: /internal/”的规则。Codex团队认为“admin”不等于“internal”,因此认为抓取合法。
数学界的反应则更为复杂。一方面,多位学者对名单真实性表示怀疑。菲尔兹奖评选流程极其严密,决选名单通常在颁奖前数月才由评委会闭门确定,且从未发生过提前两年外泄的先例。2022年菲尔兹奖得主、美国数学家詹姆斯·梅纳德在社交媒体上评论:“如果这份名单是真的,那意味着评委会已经做出了最终决定——而据我所知,提名轮次甚至还没开始。”另一方面,也有不愿具名的ICM内部人士透露,官网确实存在一个“测试环境”,用于模拟公告页面的排版与数据校验,其中包含的可能是“模拟数据”而非真实名单。
国际数学联盟(IMU)在一份简短声明中表示,已“注意到相关报道,并正在调查ICM网站的信息安全状况”。声明强调,官方2026年菲尔兹奖得主的正式公告将于2026年7月在首尔举行的国际数学家大会上揭晓,“任何提前泄露的信息均不代表最终结果”。
此次事件已引发更广泛的行业讨论:AI爬虫在学术资源开放与隐私保护之间的边界究竟在哪里?当“公开可访问”与“非预期公开”之间的灰色地带被技术手段不断突破时,学术机构是否需要重新审视其数字基础设施的安全策略?加拿大滑铁卢大学信息伦理学家凯瑟琳·陈指出:“这次事件不是AI犯错,而是人类在部署AI时缺乏对既有权限边界的敬畏。一个爬虫怎么知道‘admin’文件夹里的内容不应该被公开?它只是按照指令行事。”
截至记者发稿时,Codex团队已删除所有本地缓存数据,并承诺配合IMU进行取证调查。而被曝光的四位数学家的名字,已在全球数学爱好者的群组中疯狂传播,真假莫辨。无论最终结果如何,这场“提前两年的剧透”都已为2026年菲尔兹奖蒙上了一层前所未有的戏剧性阴影。正如一位网友在数学论坛上的留言:“要么Codex发现了一个世纪大瓜,要么它帮ICM做了一次史上最成功的营销。”