ArXiv新论文超三成疑似AI生成 封面图
技术进展

ArXiv新论文超三成疑似AI生成

Heooo 07月21日01时29分 8 阅读

「一项针对ArXiv论文的检测研究显示,截至2026年7月,约32%的新提交论文内容疑似由AI撰写。研究团队使用自研检测器,以0.4%的假阳性率为基准,分析了来自十个领域的12,750篇论文。结果显示,计算机科学领域AI生成比例最高,达65%,而数学领域最低,仅约0.7%。该研究还指出,摘要检测会低估AI使用程度,正文检测更为准确。研究同时坦诚了控制样本量等局限性。」

一项针对学术预印本平台ArXiv的最新研究揭示了一个引人注目的趋势:超过三成的新提交论文内容读起来像是机器撰写的。该研究由独立团队完成,通过自研的AI文本检测器对12,750篇论文进行了系统分析,发现自ChatGPT问世以来,ArXiv上疑似AI生成的论文比例经历了两次显著攀升,在最近一个完整季度达到约32%。

严谨的检测方法:以假阳性率为锚

研究团队首先回应了AI检测领域的一个常见质疑:许多检测工具会误伤人类撰写的文本,导致检测结果虚高。为了解决这一问题,他们构建了一个以假阳性率为核心的校准体系。具体来说,检测器被设定为在2021年和2022年(即ChatGPT发布前)的论文中,仅将0.4%的文本标记为“AI撰写”。这0.4%被视为一个“地板值”,所有后续的检测结果都建立在这个极低的误报基准之上。

研究人员解释道:“如果检测工具将40%的新论文标记为机器撰写,但同时将20%的ChatGPT之前发表的论文也标记为机器撰写,那么真正的故事其实是那没人提及的20%。”通过将预LLM时代的论文作为“真实人类写作”的控制组,并设定极低的误报门槛,研究确保了后续任何比例的上升都反映了真实的变化,而非检测工具的偏差。

ArXiv新论文超三成疑似AI生成

数据采样与关键发现

研究团队从ArXiv的十个学科领域中抽样,每个领域每月选取约25篇论文,时间跨度从2023年1月到2026年7月,并额外包含了2021年和2022年的8个控制月份,共计12,750篇论文。值得注意的是,研究分析的是论文的完整正文而非摘要。研究人员发现,许多论文的摘要AI得分低于20%,而正文得分却超过70%,这意味着仅依赖摘要会严重低估AI的使用程度。

研究结果显示,被检测为AI撰写的论文比例在2021年和2022年期间稳定在0.4%的基线水平,但在ChatGPT发布后的几个月内迅速攀升,并经历了两波增长,在2026年初达到约39%的峰值。在最近12个月(截至2026年7月)的统计中,计算机科学领域以约65%的比例高居榜首,而数学领域则最低,仅为0.7%左右。研究人员指出,数学领域的低数值可能与其独特的符号系统和严谨的论证结构有关,检测器可能难以有效识别。

ArXiv新论文超三成疑似AI生成

局限性与坦诚的反思

尽管研究设计严谨,团队也坦诚地指出了其局限性。首先,控制样本量相对较小:每个领域在ChatGPT前的控制组仅有200篇论文。在0.4%的误报率下,整个2000篇控制组论文中仅有约8篇被标记,分散到十个领域后,每个领域的控制组数据显得较为粗糙。这可能导致某些领域的基线估计不够精确。

其次,检测器本身可能对某些类型的学术写作风格存在偏见。例如,数学论文中大量使用公式和符号,可能使得检测器难以捕捉到AI写作的特征。此外,研究仅关注了文本的“读感”,并未评估这些AI辅助内容的质量或原创性。一篇论文可能部分由AI生成,但经过人类作者的实质性修改和验证,其学术价值可能并不低于纯人类写作的论文。

这项研究为学术界提供了一个重要的量化视角。随着AI写作工具的普及,学术论文中AI内容的占比正在迅速上升。这不仅引发了关于学术诚信和署名权的讨论,也对同行评审过程提出了新的挑战。如何在利用AI提高研究效率的同时,保持学术成果的原创性和透明度,将成为未来学术界必须面对的核心议题。

# AI检测 # 学术论文 # ArXiv # 自然语言处理 # 人工智能

来源:Heooo AI工具导航