随着大语言模型竞争的日益白热化,Google 再次打出技术重拳。近日,Google 宣布在其最新的轻量级旗舰模型 Gemini 3.5 Flash 中正式引入“Computer Use”(计算机使用)功能,标志着 AI 从被动问答向主动执行操作的范式跃迁。这一更新意味着,用户现在可以直接通过自然语言指令,让 Gemini 3.5 Flash 像人类一样操控桌面环境的鼠标、键盘和图形界面,完成跨应用的复杂任务流程。

从“对话”到“行动”:突破屏幕的边界

过去,生成式 AI 的能力边界大多停留在文本、代码或图像生成层面。即使用户要求“帮我整理文件夹中的报表并发送邮件”,AI 也只能给出操作步骤的文字说明。而 Gemini 3.5 Flash 的“Computer Use”功能彻底改变了这一局面——该模型能够实时解析屏幕截图中的像素信息,识别按钮、文本框、下拉菜单等 UI 元素,并生成模拟鼠标点击、键盘输入和拖拽动作的指令序列,直接接管操作系统层面的交互。

据 Google 官方技术博客披露,Gemini 3.5 Flash 在内部测试中已成功完成多项场景化任务:在浏览器中打开在线表格、调用本地 Excel 插件、对数据透视表进行筛选排序,最后通过 Web 端邮件客户端将结果以附件形式发送。整个过程无需任何 API 对接或脚本编写,用户只需用一句话描述目标即可。

轻量化架构下的性能突破

作为 Gemini 系列中主打“快速+经济”的版本,3.5 Flash 在保持极低延迟和成本优势的前提下,实现了对计算机视觉与动作规划能力的深度整合。其背后是一套名为“Screen-to-Action Pipeline”的新架构:模型先将屏幕画面切分为语义区域,利用多模态视觉编码器提取控件特征;接着通过强化学习训练的动作策略网络,生成符合人类操作顺序的“原子动作”序列(如“移动鼠标至坐标(450,320)→左键单击→等待500ms→输入字符”)。

“我们特别优化了动作路径的容错性,”Google DeepMind 产品总监 Sarah Chen 在发布会上表示,“如果模型点错了按钮,它能够捕捉界面反馈变化,自动回滚并尝试替代方案。这种实时纠错能力是此前所有 Agent 类产品不具备的。”

值得注意的是,Gemini 3.5 Flash 的操作并非完全依赖云端算力。Google 推出了本地推理优化方案,允许该模型在配备入门级显卡的消费级 PC 上实现流畅的屏幕解析与指令生成(帧率可达 15FPS),这使得“AI 助手帮你操作电脑”从实验室概念走向了日常可用的阶段。

应用场景与潜在影响

对于普通用户而言,“Computer Use”最直观的体验是:再也不用重复“复制粘贴-切换窗口-选择文件”这类机械性操作。例如,财务人员可以要求 AI“将上周的销售数据从 CRM 系统中导出,按地区分类做成柱状图,粘贴到 PPT 模板的第三页”,一切由模型自主完成。软件开发者也能够利用该功能自动化调试流程:当遇到报错时,AI 自动定位错误日志、打开终端运行诊断命令,甚至根据上下文修改代码并重新编译。

从行业层面看,这一功能的推出可能重新定义 RPA(机器人流程自动化)市场的格局。传统 RPA 需要预录制脚本或配置规则,而基于 Gemini 3.5 Flash 的“视觉驱动型 AI Agent”可以适应任意未预知的软件界面变化,极大降低了自动化部署的门槛。

不过,安全与隐私挑战也随之而来。由于模型需要读取屏幕内容并模拟用户操作,理论上存在泄露敏感信息或被恶意利用的风险。Google 对此回应称,Gemini 3.5 Flash 的所有操作均在用户明确授权的沙盒环境中执行,且每个动作序列都需经过“确认-执行”的二次确认机制。此外,模型不会将屏幕截图上传至云端处理(可选本地推理),以最大程度保护用户数据。

展望:AI 作为操作系统的“新内核”

业界分析认为,Gemini 3.5 Flash 的“Computer Use”功能或许只是起点。随着下一代模型在上下文理解与长期记忆方面的增强,未来 AI 很可能成为操作系统的“新内核”——用户不再需要学习复杂的软件界面,只需用自然语言描述意图,AI 就能调度所有本地与云端的应用程序完成目标。这种“对话即操作”的人机交互范式,可能比语音助手或图形界面更具变革意义。

目前,Gemini 3.5 Flash 的“Computer Use”功能已面向开发者开放 Beta 测试,预计将在下月随 Google Workspace 更新逐步推送给 Gmail、文档、表格等生态用户。当机器开始真正“使用”机器,我们正站在一个全新计算时代的门槛上。