近日,Google Cloud Platform(GCP)旗下的Agent Platform服务被曝出现严重异常:其核心组件Pipelines在执行模型获取操作(ModelGetOp)时频繁报错,导致大量依赖AI Agent自动编排的企业级工作流中断。据Google Cloud状态面板显示,该问题已持续超过48小时,部分用户反馈模型调用延迟激增、pipeline执行失败率攀升至30%以上。
故障表现:模型获取操作反复超时
多位使用GCP Agent Platform的开发者向媒体证实,自本周一凌晨起,其Pipelines中涉及ModelGetOp的节点开始出现异常。ModelGetOp是Agent Platform中用于从模型注册表(Model Registry)拉取已部署模型元数据及版本信息的核心操作,通常出现在多步骤pipeline的初始化阶段。当该操作失败时,整个工作流将无法继续,表现为“模型未找到”或“权限拒绝”等误导性错误。
一位不愿具名的AI基础设施工程师透露:“我们的pipeline需要动态选择最新版本的LLM模型进行推理,ModelGetOp就是获取版本列表的入口。现在pipeline要么卡在等待状态超过10分钟,要么直接返回空响应。我们不得不回退到手动指定模型版本的临时方案,但这破坏了自动化的灵活性。”
影响范围:跨区域多服务链路中断
根据GCP官方社区论坛和社交媒体上的用户反馈,受影响区域包括us-central1、europe-west4及asia-east1等主要部署区。受波及的服务不仅限于Agent Platform自身,还包括与之集成的Vertex AI、Cloud Run及BigQuery。一些企业级用户表示,其基于Agent Platform构建的客户服务机器人、自动化数据分析pipeline及实时决策系统均出现了功能降级。
某金融科技公司CTO在内部邮件中描述:“我们的欺诈检测pipeline在高峰时段丢失了80%的模型调用能力,导致交易审核延迟从5秒飙升至2分钟。虽然GCP的SLA承诺了99.95%的可用性,但这次故障已经持续超出预期恢复时间。”
官方回应:定位为后端API限流逻辑缺陷
Google Cloud团队于北京时间周三凌晨在状态页面更新了初步调查结果。工程师确认,问题根源在于Agent Platform的后端API网关对ModelGetOp请求实施了过于激进的限流机制——在应对正常流量峰值时,错误地将合法请求判定为恶意攻击并进行了阻断。这一逻辑缺陷导致pipeline在并发模型获取场景下大量失败。
GCP建议受影响用户采取以下临时措施:
- 在pipeline的ModelGetOp节点后增加重试机制,并设置指数退避策略;
- 降低pipeline中模型版本动态查询的频率,改用缓存固定版本号;
- 对于非关键任务,可暂时将Agent Platform downgrade至旧版API端点。
但部分用户指出,这些方案会牺牲Agent Platform的核心价值——自动感知模型更新并平滑切换。一位开发者抱怨:“如果每次都要手动缓存版本,那和直接写死模型名称有什么区别?”
行业影响:AI Agent编排可靠性受拷问
此次事件并非GCP Agent Platform首次出现大规模稳定性问题。2024年11月,该平台曾因底层Kubernetes节点升级引发过类似的pipeline中断。频繁的故障正在动摇企业对AI Agent自动化编排的信任。Forrester分析师在近期报告中指出,虽然Agentic AI是2025年最热门的趋势,但平台层的韧性建设并未跟上模型能力的进化速度。
GCP承诺将在一周内完成修复并发布详细的事后分析报告。然而,对于依赖Agent Platform构建关键业务流的用户而言,这次长达数十小时的“中断”已经留下了难以忽视的裂痕。而整个云计算行业也需要反思:当AI成为基础设施核心组件时,其基础操作——哪怕只是获取一个模型版本——的可靠性是否足以支撑起企业级承诺?