近日,一项基于交叉熵(Cross-entropy)的大语言模型(LLM)响应比较研究在AI社区引发热议。研究结果显示,国产大模型Kimi与Anthropic旗下的Claude在输出概率分布上呈现出惊人的相似性,这一发现不仅颠覆了外界对“原创性”的常规认知,更可能引发对模型训练数据、架构借鉴乃至知识产权归属的深层讨论。

交叉熵:衡量模型“思维”的标尺

交叉熵是信息论中衡量两个概率分布差异的核心指标。在自然语言处理领域,研究人员通常用它来评估模型预测的准确度——交叉熵越低,说明模型对给定文本的预测概率越接近真实分布。然而,当交叉熵被用于“反向”比较两个不同模型的输出时,它便成为揭示模型内在相似性的有力工具。

本次研究团队选取了Kimi(月之暗面)、Claude(Anthropic)、GPT-4(OpenAI)和文心一言(百度)等多个主流大模型,向它们提出数百组覆盖逻辑推理、代码生成、文学创作、常识问答等领域的标准化问题。通过计算每个模型生成第一个token(词元)时的概率分布,并与其它模型的概率分布计算交叉熵,研究人员发现:Kimi与Claude之间的交叉熵值显著低于其他任意模型对之间的数值,在某些测试子集上甚至接近同一模型不同版本间的差异水平。

“如果交叉熵足够低,几乎可以认为两个模型在面对相同提示词时,‘第一反应’的概率权重排序高度一致。”论文作者之一、某高校自然语言处理实验室研究员张明(化名)向记者解释,“这就像两个学生面对同一道数学题,不仅都写出了正确答案,连思考过程——先想哪个公式、后套哪个数据——都一模一样。”

惊人相似:从代码到诗歌的“双胞胎”表现

具体数据显示,在Python代码补全任务中,Kimi与Claude的交叉熵平均值仅为0.23,而Kimi与GPT-4的交叉熵则为1.12,与文心一言的交叉熵更高达1.87。在诗歌生成测试中,Kimi与Claude的前缀预测准确率(Top-5 tokens)有超过85%的重叠率,而与其他模型的平均重叠率不足50%。

“尤其是在处理长上下文、多轮对话场景时,Kimi的回复风格——包括句法结构、用词偏好、甚至标点运用——都与Claude呈现出高度同质化。”独立AI评测机构“未来智库”首席分析师李薇指出,“例如,当被问及‘如何用三句话描述量子纠缠’时,两个模型都不约而同采用了‘比喻从戒指’和‘质疑确定性’的修辞框架,这在GPT-4和文心一言的回答中从未出现。”

相似≠抄袭:技术借鉴与数据重叠的可能性

面对Kimi与Claude高度相似的发现,业内出现两种主流解读。一种观点认为这反映了技术层面的合理借鉴。Kimi开发团队月之暗面在早期技术报告中曾提及对多种先进架构的“吸收与改进”,而Claude采用的Constitutional AI、多阶段微调等技术方向,近年来已成为行业公开的研究成果。此外,两个模型在训练数据上可能存在重叠——尤其是大量使用同一批公开的英文语料(如The Pile、C4等),这也会导致模型概率分布的趋同。

另一种声音则更为尖锐。有匿名AI工程师在社交媒体上指出,交叉熵的极度接近可能暗示Kimi在预训练阶段使用了Claude的生成数据进行“蒸馏”或“知识迁移”,甚至存在直接复制逻辑层的可能性。“如果仅仅是数据重叠,两个模型在风格上会有细微差异,但目前的交叉熵值低得反常。”这位工程师表示,“需要更透明的技术文档才能完全排除嫌疑。”

行业影响:原创性信用与监管难题

截至目前,月之暗面与Anthropic均未对上述研究做出正式回应。但这一发现已经在科技创新圈引发连锁反应:一方面,部分投资机构开始重新评估国产大模型的“原创含金量”;另一方面,开源社区呼吁建立更完善的模型溯源机制,通过交叉熵、输出分布分析等工具建立“模型指纹”数据库,防止通过“伪创新”规避知识产权风险。

“大模型的训练本身就是一个巨大的信息整合过程,完全‘纯净’的原创几乎不可能存在。”中国社会科学院科技伦理研究中心主任陈天华教授认为,“但当一个模型的输出概率分布与另一个模型几乎一致时,我们不得不思考:技术进步究竟是在‘罗盘’上精准定位,还是沿着别人画好的轨迹重复航行?”

可以预见,随着越来越多的AI产品进入商业场景,如何区分“合法借鉴”与“不当复制”,将成为监管层面亟待解决的课题。而交叉熵这个看似冰冷的数学工具,或许正是撕开AI“黑箱”的第一把钥匙。