近日,多位谷歌云(Google Cloud)Vertex AI 用户反馈,在调用新一代高效模型 gemini-2.5-flash 时,即使使用付费账户,也频繁遭遇 429 Too Many Requests 错误,错误详情为 RESOURCE_EXHAUSTED。这一异常现象迅速在开发者社区引发热议,尤其对依赖该模型进行实时推理和生产级部署的团队造成显著影响。
错误现象:付费用户未获应有配额保障
根据多名用户在谷歌云官方论坛、Reddit 以及 GitHub Issue 上的反馈,问题集中表现在:当尝试通过 Vertex AI API 调用 gemini-2.5-flash 时,后端返回HTTP 429状态码,并明确提示资源耗尽(RESOURCE_EXHAUSTED)。尽管用户的计费账户处于正常活跃状态,且未超出官方文档列出的配额限制,但请求仍被拒绝。
值得注意的是,gemini-2.5-flash 是谷歌今年上半年主推的轻量级多模态模型,主打低延迟和高性价比,原本被定位为开发者优先选用的“均衡型”推理模型。其付费定价为每百万输入token 0.15美元、输出token 0.60美元,远低于旗舰模型。然而,该模型在部分地区的可用性本就受限,如今连付费用户也遭遇“容量不足”,令不少中小团队感到失望。
深层原因:区域资源稀缺与配额逻辑存疑
业内人士分析,429错误的核心可能并非用户账户级别的配额问题,而是 Vertex AI 后端计算资源调度逻辑 所致。gemini-2.5-flash 模型虽标榜高效,但部署节点有限,尤其是在亚太、欧洲等非美区域,谷歌未能分配足够的 GPU/TPU 集群支撑峰值请求。当短时间内请求集中时,系统优先保障内部服务或大型企业客户的SLA,普通付费用户的请求便被降级丢弃。
另一种可能性是 速率限制(Rate Limit) 与 配额(Quota) 的混淆。谷歌云文档显示,Vertex AI 对每个项目、每分钟的请求数(RPM)和每分钟token数(TPM)均有软限制。但多名用户反映,即使将请求频率降至低于建议值5次/秒,仍间歇性触发429。这说明底层资源池已接近满载,而非单纯的速率控制。
此外,有开发者指出,谷歌近期将 gemini-2.5-flash 模型从“预览版”转为“正式版”后,并未同步增加公共资源池容量,反而因更多用户涌入导致竞争加剧。
影响范围:从原型验证到生产服务均受波及
此次故障已影响多个领域。AI应用开发商反馈,其聊天机器人、文档摘要等关键服务出现周期性不可用,用户流失率上升。一位在东京运营SaaS产品的工程师表示:“我们为Vertex AI支付了每月数千美元的费用,但昨天下午高峰期有近40%的请求被429拒绝,系统自动重试三次后仍失败,最终导致客户端超时。”
此外,教育、医疗等对实时性要求较高的垂直场景也受到冲击。部分依赖 gemini-2.5-flash 进行数据分析的科研团队不得不临时切换至更昂贵的 gemini-2.5-pro 模型,成本陡增。
官方回应迟缓,社区呼吁透明化
截至发稿时,谷歌云尚未针对该问题发布官方声明或公告。在谷歌云状态面板(Status Dashboard)上,也未见相关区域的异常提示。不过,在社区论坛中,一名谷歌云工程师于昨日晚间回复称:“团队已注意到关于 gemini-2.5-flash 的429错误报告,正在优先调查资源分配逻辑。建议用户尝试使用不同区域(如 us-central1、europe-west4)或启用请求重试与退避策略。” 该回复并未承认问题源于资源短缺,也未给出修复时间表。
临时应对建议
面对短期内无解的现状,开发者总结了若干缓解措施:
- 切换区域:将端点从 asia-southeast1 等热点区域改至 us-central1(美中)或 europe-west4(荷兰),成功率显著提升。
- 请求退避策略:采用指数退避重试,间隔从1秒逐步增至60秒。
- 提升配额:在谷歌云控制台“IAM与管理→配额”页面申请提高 Vertex AI API - Model requests per minute 的配额,尽管部分用户反映此操作未生效。
- 降级模型:临时换用 gemini-2.5-flash-lite 或 gemini-1.5-flash,代价是降低能力或延迟优势。
未来展望:AI基础设施的“最后一公里”难题
此次事件折射出AI云服务行业的一个共同困境:模型能力的快速迭代与底层算力部署之间存在严重滞后。即使对于谷歌这样的巨头,也无法保证所有地域、所有付费层级都能获得一致的资源体验。对于开发者而言,在依赖单一模型前,建立多模型备份、设计优雅的降级逻辑,或将成为生产架构的必修课。
Vertex AI 团队若不能尽快明确资源分配规则并增加公共算力,恐怕会动摇中小客户对谷歌云AI服务的信任。毕竟,“付费即获得稳定服务”是云计算最基础的契约。