过去一年,人工智能领域的“开源 vs 闭源”之争从未如此激烈。从Meta接连推出Llama 2、Llama 3,到Mistral AI、国内的DeepSeek、阿里通义千问开源版,再到最近大放异彩的LLaMA 3.1 405B,开源大模型在多项基准测试中已经逼近甚至部分超越了GPT-4、Claude 3.5等闭源旗舰产品。当“免费午餐”越来越好吃,那些估值动辄数百亿乃至千亿美元的闭源模型公司,还能守住自己的“金饭碗”吗?
开源追平闭源,不再是“狼来了”
近期,Meta发布的Llama 3.1 405B在MMLU、HumanEval等测试中的得分与GPT-4 Turbo仅差1-2个百分点,而在某些推理任务上甚至反超。更令人惊讶的是,Mixtral 8x22B、DeepSeek-V2等小规模开源模型,通过MoE(混合专家)架构,在推理成本仅为闭源模型十分之一的前提下,取得了接近GPT-4的性能。这标志着开源社区不再只是“追赶者”——从代码生成到多轮对话,从数学推理到长文本理解,开源模型已经全面进入“可用且好用”的阶段。
与此同时,谷歌Gemini 1.5 Pro、OpenAI的GPT-4o虽然仍保持领先,但领先幅度正在急剧收窄。一个典型的例子是:在LMSYS Chatbot Arena排行榜上,前五名中已经出现了两个开源模型(Gemma 2 27B与Llama 3.1 405B)。对于企业用户而言,当开源模型能在95%的场景中满足需求,且数据可私有化部署、无API调用费,闭源模型的“溢价”便显得岌岌可危。
估值逻辑面临拷问:靠什么维持高溢价?
众所周知,包括OpenAI(估值约800亿美元)、Anthropic(估值约184亿美元)在内的闭源AI公司,其高估值核心建立在三个支柱之上:性能领先、生态锁定、安全壁垒。如今第一根支柱正在松动,后两者能否撑住?
性能优势不再是护城河。 闭源模型曾凭借更大的参数量、更优质的训练数据和RLHF调优,在复杂推理和创造力上碾压开源。但开源社区通过“社区微调+分布式训练”迅速缩小差距。例如,DeepSeek-V2仅用2000亿参数,就在数学竞赛问题(MATH)上超过了GPT-4。如果性能差距持续压缩,企业用户将更有理由转向成本更低、可控性更强的开源方案。
生态锁定或许是最强防线。 OpenAI通过ChatGPT Plus、企业API、插件生态、微软Office集成,构建了强大的用户粘性。Anthropic的Claude则主打“安全可控”的企业级SaaS。但开源模型也正在建立自己的生态:Hugging Face成为模型仓库,Ollama、llama.cpp等工具让本地部署触手可及,LangChain等框架无缝集成。一旦开源生态成熟,闭源的“护城河”将变成消费者选择权的问题。
安全与合规是双刃剑。 闭源公司强调“可控性”——API监管、内容过滤、可审计。但开源模型用户可自行审计代码,反而在隐私保护(如医疗、金融数据不出境)上更具优势。欧盟《AI法案》即将落地,开源模型可能因“透明度高”获得合规红利,而闭源的黑箱特性反而成为隐患。
市场反应:估值泡沫还是价值回归?
二级市场的信号更为直接。过去半年,美股AI概念股波动加剧,一批专注开源模型的初创公司(如Mistral AI、Together AI)却获得大额融资。投资机构正在重新评估“模型即服务”的商业模式:当基础模型变成商品,利润将从模型层流向应用层和基础设施层。
有分析师指出,闭源模型的估值逻辑可能从“技术垄断性定价”转向“服务溢价”——即通过更优的推理速度、更低的延迟、更完善的开发者工具来维持付费意愿。例如,Anthropic推出了Claude Max的团队协作功能,OpenAI则强化了语音、图像等多模态能力。但这些差异化是否足以支撑千亿美元估值,尚存疑问。
未来展望:共存而非替代
笔者认为,开源与闭源最终将走向分工:开源模型将覆盖80%的通用场景(个人助理、代码生成、客服),闭源模型则专注于20%的高端需求(复杂法律分析、多模态创作、高风险决策)。闭源公司的估值必须从“卖模型”转向“卖解决方案”——比如提供行业定制、数据飞轮、安全合规咨询等增值服务。
否则,当开源模型的性能真正“平起平坐”的那一天,资本市场的用脚投票,会比任何技术报告都来得更诚实。