当人工智能领域的巨头因代码错误而向同行发动“网络攻击”,这听起来像是科幻小说中的桥段。然而,就在本周,这一幕真实发生了——OpenAI 的一个服务缺陷意外导致其 API 对 Hugging Face 的推理端点发起大规模重复请求,后者一度被迫中断服务。这场持续数小时的“攻击”虽无恶意,却暴露了AI基础设施生态中深藏的脆弱性。

意外“开火”:一次代码失误如何演变成DDoS

据Hugging Face技术团队披露,北京时间11月15日下午,该平台的模型推理服务突然遭遇异常流量峰值。来自OpenAI API的请求在数分钟内暴增了3000倍,且这些请求并非用户正常调用,而是由OpenAI侧的一个重试机制错误触发的无限循环。每个失败的或超时的推理请求都会被系统自动重试,而重试又因同一缺陷再次失败,形成指数级的流量放大。

OpenAI在随后发布的故障说明中承认,其内部某次模型更新引入了一项针对长序列推理的优化逻辑,但该逻辑在处理特定格式的输入时触发了错误的分支条件,导致网络层不断重复发送已完成的请求。由于Hugging Face的推理端点恰好被大量使用该功能的用户通过OpenAI API间接调用,这场“内部风暴”便顺势席卷了对方的服务器。

“这就像你的智能音箱因为听错了命令,开始疯狂拨打邻居家的电话,直到邻居的电话交换机瘫痪。”网络安全专家李然用比喻解释道。尽管OpenAI的流量并非恶意构造,但从Hugging Face的角度来看,其效果与分布式拒绝服务攻击(DDoS)完全一致——带宽耗尽、响应超时、服务降级。

连锁反应:一个脆弱的AI生态系统

事件发生后,Hugging Face的官方状态页面显示多个关键推理模型无法访问,包括Meta的Llama系列和Mistral AI的热门模型。据统计,约有1.2万名开发者的应用因依赖Hugging Face的推理服务而遭遇中断,其中不乏使用AI辅助编程、图像生成等实时场景的用户。初创公司“途灵AI”的联合创始人王振说,他们的客服机器人在当晚彻底“失声”了两小时,“我们以为是自家代码出了bug,怎么也想不到是两个巨头之间的‘误伤’。”

这起事件折射出一个深层问题:当前AI产业链高度依赖少数平台的服务链式调用。OpenAI的API作为上层入口,Hugging Face作为模型托管与推理的中层枢纽,它们之间并无标准化的流量控制与熔断协议。一旦上游出现异常,下游毫无防护。这种“牵一发而动全身”的结构,让本应分散的算力资源变成了脆弱的串联网。

Hugging Face CEO克莱门特·德朗格在社交平台上发文称:“我们欢迎合作,但需要更好的容错机制。AI世界的互操作性不能建立在‘相信对方不会犯错’的基础上。”他暗示,未来将引入更严格的速率限制与优先级队列,甚至要求API供应商签署流量波动补偿协议。

科幻成真?技术伦理的灰色地带

值得注意的是,此次事件虽非人为攻击,却引发了关于AI系统“自主错误行为”的讨论。当AI系统的自我修复逻辑(如重试机制)以超出人类预期的规模运行时,它是否构成了某种失控?斯坦福大学人机交互研究中心教授迈克尔·伯恩斯坦评论道:“我们总在担心AI会主动作恶,但更现实的风险是它以一种愚蠢、固执的方式执行编程错误,从而伤害其他系统。这才是我们真正需要关注的科幻场景。”

OpenAI方面已向Hugging Face致歉,并承诺将重构重试模块,引入全局熔断开关和流量自限流策略。同时,Hugging Face也宣布将启动“互操作安全倡议”,邀请谷歌、微软、亚马逊等云服务商共同制定跨平台流量异常时的协同响应标准。

一场由代码bug引发的“战争”迅速平息,但它留下的警示不会消失:在人工智能的基础设施尚未成熟之前,每一个算法都可能成为多米诺骨牌的第一张。而那些听起来像科幻小说的场景,或许只是技术狂飙时代的日常插曲。