近年来,大型语言模型(如GPT系列、Claude等)的快速迭代,使得学术界对AI辅助写作的依赖程度急剧上升。预印本平台arXiv作为全球物理学、计算机科学、数学等领域的核心论文发布渠道,已成为观察这一趋势的重要窗口。日前,一项题为《How we measured AI writing across arXiv, and where the measurement breaks》的研究引发学界关注。该研究首次系统性地提出一套测量arXiv论文中AI写作成分的方法,同时坦诚地指出了这套方法在哪些场景会“失灵”。本文带您深入了解其中关键。

为何要测量AI写作?

随着ChatGPT于2022年底爆红,学术界很快发现,部分论文的摘要、引言甚至方法部分呈现出明显的“AI腔调”——用词过于规整、句式高度雷同、缺乏人类特有的逻辑跳跃或口语化表达。为了量化这种现象,研究团队决定对arXiv自2020年至2024年的数百万篇论文进行大规模文本分析。

他们的核心思路是:通过对比已知的纯人类写作语料库与已知的AI生成文本,训练一个分类器,识别出arXiv论文中哪些段落更可能出自AI之手。具体来说,他们提取了词频分布、句子长度标准差、特定过渡词(如“然而”“此外”“值得注意的是”)的密度、以及词汇多样性等统计特征。这些特征在AI生成的文本中往往呈现高度一致性。

主要发现:AI写作占比显著攀升

根据该研究,在2022年底之前,arXiv论文中被标记为“高度疑似AI写作”的摘要比例不足5%。但进入2023年后,这一数字迅速跃升至15%以上,并在2024年某些子学科(如计算机视觉、自然语言处理)中达到30%以上。研究还发现,AI更频繁地被用于撰写“技术报告”和“实验评估”部分,而在理论推导和数学证明中作用有限。

值得注意的是,研究团队强调,他们的测量结果反映的是“辅助写作概率”,而非完全的AI代写。许多作者可能仅使用AI润色语言或组织段落,而非直接复制粘贴。因此,这些数字并不代表学术不端,而是学术写作模式正在发生结构性变化。

测量“断点”在哪里?

研究的标题特意点出了“where the measurement breaks”。团队在论文中指出,他们的方法至少在三类情况下面临失效风险:

  1. 高度专业化的领域术语:当论文涉及极其冷门的数学符号、实验设备名称或算法编号时,AI模型往往无法模仿人类的随机性和错误习惯,因而导致分类器误判为“人类写作”。例如,某些生物物理学的公式排版和特殊用词,AI难以精准还原,反而显得“更不像AI”。

  2. 语言风格重叠:部分人类写作者本身就有“教科书式”的写作习惯——严谨、平直、极少使用修辞。这样的人类论文特征与AI生成文本高度重合,分类器很容易将其错误归类为AI辅助。

  3. 混合写作与迭代修改:现代学术写作越来越常见“人机协作”——作者先用AI生成初稿,再大幅修改内容、调整逻辑。当修改幅度足够大时,文本统计特征会回归到人类水平,但AI的底层影响依然存在。现有方法无法捕捉这种“隐性AI贡献”。

此外,研究还指出一个系统性偏差:arXiv的论文多为英文,但大量非英语母语作者可能使用AI进行语言校正,这使得检测模型难以区分“AI润色”与“AI生成核心内容”。

学术界的反应与意义

该研究一经发布,立即在学术社交平台引起讨论。有学者认为,这项测量工作提供了一个宝贵的基线,帮助学术出版机构制定更透明的人工智能使用政策。比如,部分期刊已要求作者在投稿时声明是否使用AI工具,而本研究的方法可作为交叉验证的参考。

但也有批评意见指出,任何统计检测方法都无法避免“对抗性攻击”——如果作者刻意调整词汇模式,比如手动加入了一些语法错误或口语化表达,AI检测就会失效。更深远的问题是:当AI写作变得无处不在,人类写作的定义本身是否需要重构?

研究团队最后强调,他们并不主张用这些数据来“惩罚”使用AI的作者,而是希望推动学界正视这一技术变革。测量的“断点”恰恰提醒我们,在AI时代,任何单一的检测方法都有其边界。未来的学术诚信体系,可能需要从“检测违规”转向“声明与透明”的新范式。

随着大语言模型能力持续提升,arXiv上的AI写作比例很可能继续增长。这项研究的价值或许不在于给出了一个精确数字,而在于让所有科研工作者意识到:我们已经进入了一个文本归属难以追溯的时代。如何在这种模糊性中维持学术交流的信任基础,将是整个学术界面临的共同课题。