近期,国产大模型厂商DeepSeek启动新一代模型DeepSeek-V4的灰度测试,本应是技术迭代的喜讯,却在AI社区引发了一场关于“模型真实身份”的激烈辩论。部分开发者及技术爱好者通过对比测试发现,DeepSeek-V4在某些任务上的输出风格、推理逻辑甚至错误模式,与Anthropic旗下的Claude Fable、Opus等闭源模型高度相似,进而质疑其是否“路由”了外部模型。这一争议迅速从技术圈蔓延至AI行业舆论场,折射出大模型领域“自研与复用”边界模糊的深层焦虑。

质疑声起:从“惊艳”到“似曾相识”

DeepSeek-V4的灰度测试从本月中旬开始,主要面向受邀用户开放API接口。早期测试者普遍反馈其多轮对话能力、代码生成质量及复杂推理表现“超出预期”,尤其在一些开放式问题上的回答细腻程度,被认为“不像传统开源模型”。然而,随着更多用户加入测试,异样的声音开始浮现。

一位ID为“LazyCat”的开发者在小红书及知乎等平台发布对比实验:他将同一组逻辑推理题分别提交给DeepSeek-V4、Claude Fable(Anthropic新近推出的轻量级模型)以及GPT-4o。结果显示,DeepSeek-V4在解题步骤中的符号使用习惯、对特定函数调用的格式化偏好,甚至对同一道题的“狡辩”方式,都与Claude Fable惊人一致。另一位博主则指出,DeepSeek-V4在回答涉及隐私伦理的敏感问题时,拒绝措辞与Claude Opus的“安全应答模板”几乎逐字相同。

“如果只是思路相似,可以理解为数据蒸馏或对齐训练的结果,但连错误模式都一致,很难不让人怀疑底层模型就是Claude。”前某大厂AI研究员、现独立开发者邓轩在接受采访时表示,其团队进行了盲测,发现DeepSeek-V4在部分长文本理解任务上的输出质量与Claude 3 Opus的API调用结果相关系数高达0.94,“巧合概率极低”。

技术猜想:路由、蒸馏还是真正的“神似”?

所谓“模型路由”,是指平台在前端封装一个统一的API接口,背后实际调用的是其他公司的模型,以此节省训练成本或快速获得高性能。这一做法在早期AI创业公司中并非罕见,但顶级开源社区对此深恶痛绝,认为这是“学术不端”和“商业欺诈”。

针对DeepSeek-V4的争议,技术社区主要提出了几种可能性:

  1. 直接路由模型:即DeepSeek将用户请求转发至Claude API,再将结果返回,仅做轻量级后处理。
  2. 知识蒸馏:使用Claude生成大量微调数据,训练自己的模型。这一做法在业界合规,但如果声称“自研100%”,则存在误导。
  3. 高度相似的对齐训练:采用与Claude相似的RLHF(基于人类反馈的强化学习)数据集和安全过滤策略,导致行为趋同。

“区别在于,路由是实时‘套壳’,而蒸馏是离线‘复制’。”一位不愿具名的AI安全研究员解释,“通过分析响应时间、token输出速度、以及跨语言的稳定性,可以大致判断。但目前社区拿到的测试样本量有限,不足以实锤。”

官方沉默与行业反应

截至发稿,DeepSeek官方尚未就这一争议发表正式声明。其官方技术博客在三天前更新了V4的预训练简报,仅提及“在公开数据集和自有数据上进行了大规模预训练,参数量未公布”,未回应路由质疑。创始人刘云浩在内部群聊中被截图的发言称“大家先测试,别被带节奏”,但未提供技术澄清。

业界对此反应两极化。支持者认为,DeepSeek作为开源社区的重要贡献者,此前发布的V2、V3模型均经过独立验证,不可能在V4上冒“信任崩塌”的风险。反对者则认为,大模型赛道竞争白热化,许多公司为了在基准测试中“刷榜”,私下使用闭源模型作为教师网络,早已是公开的秘密。

Anthropic方面则拒绝对此置评。不过,接近Anthropic的消息人士透露,公司已注意到相关讨论,并正在内部调查是否有API密钥被滥用或被盗用。“如果发现第三方未授权使用我们的模型,我们会采取法律行动。”

深层拷问:大模型时代的“信任危机”

这一事件之所以引发如此关注,深层原因在于大模型行业正面临“自研与复用”的信任困境。一方面,训练一个大模型动辄上亿美元,多数创业公司难以承担从头训练的成本;另一方面,主流基准测试已被“刷分”行为侵蚀,公众难以分辨模型真实能力。当“套壳”成为一种隐形成本,行业公信力将面临系统性风险。

“这不是DeepSeek一家的问题,而是整个AI赛道的‘灵魂拷问’。”中国科学技术大学计算机学院教授李明认为,行业需要建立类似学术论文的“模型披露标准”:必须公布预训练数据构成、微调过程中使用的教师模型、以及推理时的完整技术栈。“否则,每一次‘惊艳’都可能伴随着‘陷阱’。”

对于DeepSeek而言,最好的自证方式是开放部分模型权重或进行第三方审计。但考虑到商业竞争压力,这一做法可能并不现实。目前,部分测试者已开始呼吁社区发起“众筹审计”,通过黑盒测试精准定位模型来源。

结语

截至记者发稿时,DeepSeek-V4的API仍正常提供服务,测试者们的质疑声浪也未消退。是技术创新的高光时刻,还是又一次“套壳”风波?答案或许在DeepSeek的下一份公开技术报告中。但可以确定的是,这一事件再次敲响警钟:在AI技术飞速迭代的今天,透明度与公信力,已比技术本身更能决定一家企业的长期命运。