在人工智能安全领域素以“谨慎”著称的Anthropic公司,如今正因其AI模型在自家故事创作平台Fable上的内容审核行为,陷入一场关于“过度监管”的舆论风波。多位用户及创作者近日公开抱怨,Fable平台所使用的AI分类器在识别潜在有害内容时“用力过猛”,导致大量正常、甚至具有文学价值的叙事作品被无端标记、屏蔽或修改,仿佛每一则寓言背后都潜伏着需要被“消灭”的罪恶。
这场争议的核心,直指一个行业长期悬而未决的难题:AI安全护栏的“度”在哪里?
Fable的“安全滤镜”为何成为创作者的噩梦?
Fable是Anthropic推出的一款侧重于创意写作与故事生成的AI工具,旨在帮助用户创作“有意义且安全”的叙事内容。然而,自该平台引入更严格的分层分类审核系统以来,越来越多的用户反馈,他们的创作自由正在被一套“过于激进的算法”所侵蚀。
一位不愿具名的独立作家向记者展示了他被系统拒绝的短篇童话。故事讲述了一只狐狸通过计谋躲避猎人的追捕,其中包含“诱捕”、“陷阱”等词汇。尽管情节完全符合经典寓言的逻辑,且没有任何血腥描写,系统却判定其包含“诱导暴力行为”的风险,并拒绝生成后续内容。这位作家无奈地感叹:“如果连《伊索寓言》都无法通过审核,那Fable究竟想让我们写什么?”
更令用户不满的是,审核系统的判断标准缺乏透明度。当创作者的稿件被拦截时,系统往往只给出诸如“含有成人内容”、“可能引发焦虑”等模糊标签,却无法提供具体的修改方向。许多用户尝试简化语言、删减冲突描写,甚至将主角从“狼”改为“兔子”,仍无法摆脱被误伤的命运。
“过度善意”背后的技术困境与商业逻辑
Anthropic一直以其对AI安全的前瞻性投入而闻名,其联合创始人卡普兰曾多次强调,公司宁愿过度保守,也不愿因内容安全问题让AI技术重蹈社交媒体的覆辙。正是这种“零容忍”的安全哲学,催生了Fable平台上一套极其复杂的审核网络。
据业内人士分析,Fable采用的审核器并非单一模型,而是由多个针对不同风险维度的子分类器组成。理论上,这种“重叠防御”机制能最大程度地过滤仇恨言论、暴力描述和色情内容。然而,在实际运行中,多个分类器在处理非结构化、充满隐喻与讽刺的文学作品时,往往会发生“共振式误判”。一个描写悲伤情绪的句子,可能同时触发“心理健康风险”和“负面情绪渲染”两个警报;一个关于国王与骑士的战争背景,则可能被错误地标记为宣扬“军事冲突”。
这种技术上的“泛安全化”倾向,正在将Fable变成一个“政治正确”的叙事牢笼。有用户尖锐地指出:“如果AI只允许生成歌颂阳光与和平的文字,那么文学中最深刻的悲剧、最动人的挣扎都将不复存在。”
行业反思:安全与自由的平衡木该如何走?
Anthropic的困境并非孤例。从Meta的社交内容审核到OpenAI的API使用政策,几乎所有主流的AI内容平台都在“严格审查”与“创作自由”之间反复摇摆。批评者认为,过度依赖算法进行内容判断,本质上是将复杂的伦理判断简化为冷冰冰的概率计算,这不仅抹杀了文学的多义性,更可能让AI创作沦为千篇一律的“安全废话”。
面对外界的质疑,Anthropic官方回应称,公司已经注意到Fable上的审核误判问题,并正在对分类器的敏感度进行微调。同时,平台计划推出更详细的“创作指南”和申诉机制,以帮助用户更好地理解审核逻辑。“我们承认,目前的系统还不够完美,”一位发言人在声明中表示,“但我们的目标始终是在保护用户免受真实高风险内容的伤害与保留创造性表达之间,寻找到最合理的平衡点。”
然而,对于许多已经对Fable失去耐心的创作者来说,Anthropic的承诺来得可能有些太晚了。在文学的世界里,没有冲突就没有故事,没有阴影就没有光。当一个平台的AI开始扮演“文学警察”的角色时,它守护的究竟是用户的安全,还是自身的声誉?
对于Anthropic而言,如何拆除这些“过于热心的分类器”为Fable筑起的高墙,或许比训练一个更强大的模型,更考验其技术智慧和战略眼光。毕竟,一个不能容纳“饿狼传说”的平台,注定也无法诞生“神曲”与“悲剧”。