arXiv论文AI写作检测:约三分之一新论文被标记为机器生成

一项针对arXiv预印本平台的最新研究揭示了AI对学术写作的渗透程度。研究团队检测了12,750篇论文后发现,大约三分之一的新提交论文在文风上呈现机器写作特征,其中计算机科学领域的比例高达65%。

研究方法:以误报率为锚点

这项研究由unslop团队完成,核心方法论值得关注。研究人员没有直接使用现成的AI检测工具给出粗略比例,而是先将检测器在2021至2022年(ChatGPT出现前)的论文上进行校准,将误报率严格控制在0.4%。也就是说,检测器被设定为仅对0.4%的真正人工写作论文产生误判。

在这个阈值下,检测器能够识别出85%的AI学术文本。研究团队随后对2023年1月至2026年7月间10个学科领域的约12,750篇论文进行全文检测(使用version-1 PDF,避免修订版本污染数据),并结合2021至2022年的8个对照月份进行横向对比。

核心发现:两个增长波峰

检测结果呈现出清晰的上升趋势:

  • 2021至2022年:被标记比例维持在0.4%的基准线
  • ChatGPT发布后不久:比例开始攀升
  • 2026年初:达到约39%的峰值
  • 最近完整季度:稳定在约32%

不同学科的差异极为显著。过去12个月的数据(截至2026年7月)显示:

  • 计算机科学:65.0%(95%置信区间:59.3%至70.3%)
  • 定量生物学:56.3%
  • 电气工程与系统科学:51.3%
  • 经济与金融:47.0%
  • 应用物理:34.0%
  • 统计学:31.3%
  • 凝聚态物理:24.0%
  • 高能物理:14.0%
  • 天体物理:10.7%
  • 数学:0.7%

为什么数学领域几乎为零?

数学论文的机器写作检出率仅为0.7%,但这并不意味着数学界完全未使用AI辅助。研究者坦承,这一低值存在特殊的解释困境。

数学论文的文本结构高度特殊——大量篇幅被公式、定理和证明占据,一旦去除这些符号和参考文献,剩余的自然语言段落非常稀少。检测器针对的是科学英语文本进行训练,而数学论文的 prose(散文部分)往往超出了训练分布。因此,一篇大量使用AI辅助撰写的数学论文,可能因为文本分布不符而得到低分。

换句话说,数学领域的低检出率可能是”低使用率”和”检测盲区”两种因素共同作用的结果,现有数据无法将其区分。

局限与启示

研究者在论文中明确列出了几项关键局限:

首先,对照样本量有限。每个学科在2021至2022年的对照样本仅约200篇,在0.4%的误报率下,整个对照集仅有约8篇论文会被误判,导致学科间的对照基准存在较大不确定性。

其次,检测器无法区分”轻度AI辅助编辑”和”完全由AI生成”的文本,因此报告的数字代表的是”具有机器写作特征的文本 prevalence”,而非严格意义上的AI代笔比例。

最后,由于检测器对不同生成模型的敏感度存在差异,实际检出率应被视为真实比例的下限——实际情况可能更高。

这项研究为理解AI对学术出版的影响提供了迄今最为严谨的数据基础,也为学术界如何制定AI使用规范提出了紧迫的议题。