近日,多个开发者和AI研究团队在技术社区反映,使用Google Cloud Vertex AI平台对Gemini 2.5 Flash模型进行监督微调(Supervised Fine-tuning, SFT)时,任务在提交后长期停滞于“Preparing for tuning”(准备调优)状态,无法进入实际的训练流程,且平台未提供任何错误提示或预计等待时间。

这一现象迅速引发了AI社区广泛关注和讨论,不少用户直言“提交后仿佛泥牛入海”,对Google云AI服务的稳定性和可靠性提出严重质疑。

问题曝光:无辜的“准备”状态成为难以逾越的屏障

据多位受影响用户描述,他们在Vertex AI控制台中提交Gemini 2.5 Flash微调任务后,任务状态立即变为“Preparing for tuning”。乍看之下,这似乎是模型训练的正常初始化环节。然而,用户发现该状态持续数小时甚至数天而无任何进展,最终不得不手动终止或反复重试。

一位来自北美AI初创公司的工程师在Google Cloud Issue Tracker上表示:“我们团队已经等待了超过48小时,任务毫无进度更新的迹象,尝试重新提交后仍然卡在相同的状态。”

更令人困惑的是,现象不仅影响少数用户,而是呈现出明显的普遍性与重复性特征。

技术深层分析:症结可能在哪?

针对该问题,有业内技术专家初步分析,可能原因包括以下几个方面:

1. 资源分配策略出现系统性阻塞

Gemini 2.5 Flash作为Google最新的轻量级高效模型,微调需求激增。然而,Vertex AI可能未能同步扩容底层计算资源,特别是在“准备”阶段需要加载模型权重、校验数据集、初始化训练环境等耗时步骤,该依赖的资源如果出现调度冲突,将直接令任务陷入无限等待。

2. 数据集验证环节异常

微调任务在“准备”状态下需要完成数据集的格式校验、有效性扫描和预处理加载。有用户猜测,如果用户上传的数据集存在隐藏问题(如样本数不符合微调最小要求、数据字段与SFT模板不匹配、存储桶权限不当等),但平台并未给出明确的错误反馈,导致流程始终卡在验证阶段被动重试。

3. Cloud底层服务依赖故障

Vertex AI的微调流水线高度依赖Cloud Storage、Compute Engine等底层服务。如果这些组件出现网络延迟或配额不足,同样可能造成“准备”阶段无法推进。

Google官方回应:沉默与初步指导令用户不满

截至目前,Google Cloud团队尚未就此事发布官方声明。不过,在Issue Tracker中,有Google工程师初步回复,建议用户检查是否满足以下条件:一是确保数据集大小不低于官方推荐的64条训练样本,二是检查是否已为服务账号授予足够的权限。这些基础排查措施被部分用户视为隔靴搔痒。

有用户指出:“我们不仅样本充足,同类配置也曾在数周前成功运行,这显然是平台有问题。”

行业影响:不止是工作流受阻

此次“卡死”事件对依赖Vertex AI进行模型定制的企业级用户产生了实质影响。产品迭代节奏被打乱、实验成果提交延迟,直接导致研发人员时间和云资源成本的双重浪费。更有厂商表示,已经考虑将微调任务迁移至其他云平台,例如Amazon SageMaker或Hugging Face AutoTrain。

此外,事件反映出AI云服务“黑盒化”趋势中存在的隐患。开发者需要越来越依赖平台稳定的自动调度,但当前缺乏透明的状态反馈与完善的错误诊断机制,一旦遭遇类似问题往往只能被动等待或尝试盲解。

暂时的解决建议

针对当前受困用户,专家建议以下尝试方向:

  • 完全删除任务并重试:清空提交历史,从控制台全新创建微调任务,避免历史残留导致状态锁定。
  • 精细检查数据集:确保数据集格式符合官方SFT规范,建议先使用小样本测试,以快速定位问题。
  • 联系Google Cloud Support:通过付费支持渠道提交工单,获取后台排查。

结语:云AI平台急待加强稳定性与透明度

作为面向开发者的关键基建,Vertex AI本次故障显然暴露出Google在AI模型服务规模化交付中的短版。监督微调是定制生成式AI应用的核心环节,“准备”阶段的长期卡死使得用户效率大打折扣。

业界期待Google尽快就本次事件拿出详细解释、透明报告,并在未来推出更可靠的排队与诊断机制。否则,用户热情与信任一旦冷却,将很难再被重新点燃。