近日,编程语言Zig的创始人兼核心开发者Andrew Kelley在个人博客及社交媒体上发表尖锐评论,直指人工智能企业Anthropic在技术宣传中存在夸大其词、误导公众的行为。Kelley以“直言不讳”(calls a spade a spade)的风格,批评Anthropic在AI安全与能力方面的陈述“如同吹出的烟雾”,缺乏扎实的技术验证和透明性。

事件起源于Anthropic近期发布的一份技术白皮书,其中宣称其Claude系列模型在多个复杂推理任务上实现了“突破性进展”,并暗示其安全对齐技术已接近“可证明的可靠”。然而,Kelley在仔细阅读白皮书后指出,文中多处使用模糊表述,例如“显著提升”“远超基线”等词汇,却未提供足够具体的基准测试细节或可复现的代码。他在博客中写道:“如果一家公司声称自己的模型比竞争对手更安全、更智能,那么它就应该拿出类似于‘在X数据集上,错误率从Y%降至Z%’这样的硬数据,而不是一堆修饰性的形容词。”

Kelley特别质疑了Anthropic在所谓“Constitutional AI”方面的宣传。Anthropic声称通过一套内嵌规则的训练方式,使模型能够自我约束违背伦理的输出。但Kelley认为,这套方法本质上仍是黑箱,其宣称的“可控性”缺乏第三方独立审计。“当一家商业公司告诉你,他们已经解决了AI对齐的核心问题,而证据只是几个演示视频时,你最好保持怀疑。”他在一篇推文中写道。

此外,Kelley还结合自己在编程语言设计领域的经验,对AI行业的整体风气提出批评。他指出,Zig语言社区始终坚持“代码即文档”的理念,任何性能提升都必须有可复现的基准测试和详细的设计文档。而AI行业却常常依赖“演示效果”来吸引投资和用户,这种做法与工程领域的严谨传统背道而驰。“如果你不能给出可复现的测试框架,你的‘突破’就只是公关部门的KPI。”Kelley在博客中如此总结。

面对Kelley的指责,Anthropic的一位发言人通过邮件回应称,公司“重视来自技术社区的反馈”,并表示将逐步开放更多模型评估细节。但发言人同时强调,Anthropic一直致力于在“负责任披露”的前提下发布研究成果,部分安全相关方法的细节暂不能完全公开,以避免被恶意利用。这一回应并未平息争议,反而被不少开发者视为“打太极”。

业内评论人士指出,Kelley的批评反映了开源社区与商业AI公司之间日益加深的信任鸿沟。Zig作为一门系统编程语言,其社区本身就以对“炒作”高度警惕而闻名。Andrew Kelley此前就曾多次抨击Rust语言的过度营销,如今将矛头指向AI领域,并不令人意外。

事实上,这并非Anthropic第一次遭遇类似质疑。今年早些时候,就有第三方研究人员指出,Anthropic的安全评估框架存在选择性省略重要指标的问题。而在更广泛的AI领域中,诸如“大模型通用性被高估”“评估基准过度拟合”等批评早已屡见不鲜。Kelley的这番表态,不过是给这场旷日持久的信任危机又添了一把火。

截至发稿时,相关话题已在Hacker News等开发者社区引发激烈讨论。不少用户支持Kelley的“直言不讳”,认为AI公司应当像传统工程领域一样,接受公开、可复现的同行评议。但也有声音认为,Kelley的批评过于严苛,忽略了AI研究本身的探索性特征——并非所有成果都能在早期就具备完美的定量证据。

无论争议如何演变,一个事实正在浮出水面:当技术宣传与工程现实之间的缝隙越拉越大,像Andrew Kelley这样“叫牌为牌”的冷静声音,或许正是整个行业所需要的镜子。