在AI赛道上,微软与OpenAI的关系正在经历微妙而深刻的转变。据多方消息证实,微软正逐步用自研的图像生成模型替代OpenAI旗下的DALL-E系列模型,并将其率先部署于PowerPoint和Bing Image Creator(必应图片创建者)等核心产品中。这一动作标志着科技巨头在关键AI能力上从“外部依赖”转向“自主掌控”,也可能重塑生成式AI应用的市场格局。
从“抱团”到“独立”:微软自研模型浮出水面
长期以来,微软凭借对OpenAI的巨额投资,获得了其尖端模型的独家授权及API调用权,并将GPT-4、DALL-E 3等技术深度嵌入Office 365、Azure云服务和Bing搜索中。这种“独家代理”模式一度被视为双赢的典范。然而,随着OpenAI近期启动自有商业化布局——包括面向企业直接销售API、推出ChatGPT Pro订阅服务,以及内部对“通用人工智能(AGI)”定义的争议——微软意识到了潜在的供应链风险。
据知情人士透露,微软内部早已秘密推进代号为“Florence”的图像生成模型项目(基于此前开源的Florence-2视觉基础模型进行扩展)。新模型被命名为 “Microsoft Designer AI” 或 “Cocreator” 的底层内核,其训练数据来自微软旗下Bing图像搜索的海量合规内容,并针对商业办公场景进行了专门优化。
PowerPoint率先切换:从“DALL-E生成”到“一键设计”
最直观的变化出现在PowerPoint 2024的年度更新中。此前,PowerPoint的“根据文字提示生成配图”功能依赖OpenAI的DALL-E 3。但在最新预览版中,用户会看到“使用Designer AI生成图像”的选项。微软官方文档表示,新模型在生成与演示文稿内容相关的图标、插画和背景图时,渲染速度提升了40%,且生成的图像在排版对齐、色彩匹配上更贴合Office设计规范。
例如,用户输入“森林中的会议室”,旧模型可能输出一张写实照片,而新模型会自动生成一张扁平风格、比例适配幻灯片宽高比的矢量插画,甚至同步给出可编辑的图层。微软设计团队表示:“我们不需要高精度的艺术作品,我们需要的是能无缝嵌入文档的视觉元素。”这一改变隐含着对大模型应用场景的重新定义:工具性优先于创意性。
Bing Image Creator同步更新,商业场景更“安全”
Bing Image Creator是微软面向普通用户提供的免费AI绘图入口。目前该服务已开始灰度测试自研模型。据测试者反馈,新的Cocreator模型在生成Logo、广告物料、产品包装设计等商业相关图像时,对商标、名人肖像、版权物体的规避能力明显强于DALL-E。这背后是微软为减少版权诉讼风险而进行的针对性训练——模型被强制学习“拒绝生成受版权保护的品牌标识或已知角色形象”,并能在提示词包含“米老鼠”“星巴克”等关键词时自动返回“无法生成”或替换为通用图形。
这一调整对营销人员和中小商家至关重要。此前使用Bing Image Creator生成商业图稿时,常因无意中触犯版权而被平台拦截。微软通过自研模型绕开了OpenAI在内容安全策略上的“黑箱”,直接嵌入自己的内容审核规则,确保每张图像都可追溯源头。
成本与效率:微软的算力账本
从商业逻辑看,“替代”的核心驱动力之一是成本。据行业分析师估算,向OpenAI调用DALL-E API的单价约为每张图像0.04-0.08美元(根据分辨率浮动),而微软自研模型部署在自有Azure GPU集群上,随着推理优化和硬件升级(如定制版AMD MI300加速器),边际成本可降至每张0.005美元以下。按PowerPoint全球超过15亿用户的基数计算(即便仅有5%的用户月均生成一张图),每年节省的API调用费用就高达数亿美元。
更重要的是,自研模型允许微软进行端到端的数据闭环:用户的每一次“不满意”生成指令都可以作为微调样本,不断优化模型对办公场景的理解,而不必等待OpenAI的版本迭代。
对OpenAI的冲击:既是挑战,也是必然
微软的“自立门户”并不意味着与OpenAI彻底分道扬镳。双方在大型语言模型(GPT系列)上的合作仍将延续,毕竟Azure是OpenAI唯一的云提供商,且微软对GPT的依赖远超图像模型。但图像的“替代”传递了一个明确信号:在非核心的、高度垂直的应用层,微软不会再为“OpenAI溢价”买单。
分析师指出,这可能会促使OpenAI加速推出更差异化的图像模型(如即将发布的Sora视频生成能力),同时倒逼其降低API商业定价。不过,对普通用户和中小企业来说,微软的举措反而意味着更稳定、更廉价的AI图像工具——因为微软的目标是“让每个人都能用AI做设计”,而非“让少数人用AI做艺术”。
未来展望:微软的“模型矩阵”雏形
随着Cocreator的全面铺开,微软正在构建一个层次化的AI模型体系:底层由GPT-4/5支撑写作与推理,中层由自研图像模型处理设计任务,上层则依托Azure AI Studio运行第三方(如Meta Llama、Mistral)开源模型以控制成本。这意味着,未来你在Word里调整图表、在Teams里生成虚拟背景、在Outlook里设计邮件模板时,背后的AI引擎可能都是微软“自家产”的模型。
当AI竞争从“谁能做出最大的模型”转向“谁能做出最便宜、最适用的模型”,微软这一步棋走得看似激进,实则务实。而对于每天用PowerPoint做方案、用Bing找灵感的人来说,唯一的变化可能是:那些图片比以前更好用了,也更难侵权了——这或许正是技术从“热搜”走向“日常”的最好注脚。