作者:互联网 时间: 2026-07-21 14:33:03
我们对 12,750 篇 arXiv 论文的全文进行了评分,发现大约三分之一的新论文是机器编写的。这是方法、结果以及对局限性的诚实说明。


有一种标题说“X 的 N% 现在是人工智能”,大多数都不值得阅读,因为数字背后的检测器也标记了一些真正的人类写作。如果一个工具将 40% 的新论文标记为机器编写的,同时也将 20% 在 ChatGPT 存在之前编写的论文标记为机器编写的,那么真正的情况是无人提及的 20%。
因此我们围绕这一反对意见进行了研究。此处描述的我们的检测器针对学术写作进行了校准;以 0.4% 的误报率,它清除了 99.6% 的真实 LLM 预科科学文本,并恢复了 85% 的 AI 学术文本。我们将假阳性率作为锚点。我们在 ChatGPT 之前收集了 2021 年和 2022 年提交的论文,将它们视为真实的人类,并设置了标志阈值,以便其中只有 0.4% 的人会触发该阈值。那条线就是地板。我们报告的每个数字都是超过阈值的论文比例,按结构计算,真正的大语言模型预科写作占 0.4%。然后,ChatGPT 之前的年份充当内置控制:如果上升是探测器的假象,那么 2021 年和 2022 年将高达 2026 年。第一个图显示事实并非如此。
我们从 2023 年 1 月到 2026 年 7 月对 10 个领域组进行了抽样,每个领域每月大约 25 篇论文,加上 2021 年和 2022 年的 8 个控制月,总共 12,750 篇论文。对于每一篇文章,我们都提取了版本 1 PDF,因此 2026 年修订的论文无法将现代文本泄漏回其 2023 年插槽中。我们对全文而不是摘要进行评分,因为摘要低估了信号:我们看到同一篇论文的摘要得分低于 20%,正文得分超过 70%。每个报告的数字都带有引导 95% 置信区间。
到 2021 年和 2022 年,标记的份额一直保持在 0.4%,在 ChatGPT 发布后的几个月内开始上升,并在最近一个完整季度中分两波攀升至 32% 左右,并在 2026 年初达到接近 39% 的峰值。跨领域的分布很大,表格和第二个数字体现了这一点。下面的值是截至 2026 年 7 月的 12 个月内每个领域的标记份额及其预大语言模型控制水平。
计算机科学领先,约为 65%。数学最低,接近 0.7%,限制部分解释了为什么其低值难以解释。控制列是每个字段 2021 年至 2022 年标记率在三个敏感度设置上的平均值;上升最多的领域并不是大语言模型预科控制水平最高的领域,因此起点升高并不能解释上升的原因。
控制样本量。每个领域预ChatGPT控制为200篇论文。在 0.4% 的标记率下,在整个 2,000 篇论文控制中只有 8 篇论文标记,分散在十个字段中,因此每个字段的单阈值控制率是粗略的。合并下限经过很好的估计,也是本研究的锚点,但每个领域的控制水平只是近似的,更大的控制水平并不能解决这个问题:将每个领域的百分之几的比率固定将需要每个领域数千篇控制论文,而 2023 年之前的 arXiv 卷不包含这些论文。
低分可能表明采用率较低或存在检测器盲点。数学是最明显的例子。数学论文以符号和定理证明结构为主,一旦方程和参考文献被删除,剩下的散文就很稀疏,不像检测器所训练的科学英语。在大量模型辅助下起草的数学论文可能得分较低,因为其散文对于检测器来说不符合分布,因此数学得分低是人类撰写论文的证据不足。结果与两种截然不同的解释一致,即该寄存器中采用率较低或检测器灵敏度降低,并且该数据无法将它们分开。分布假设最强的领域,即以散文为主的领域,也是上升最多的领域,因此这种混杂因素并不能解释总体趋势。但在低分领域,排名应被视为采用率的下限。
探测器覆盖范围。检测器对某些生成器比其他生成器更敏感,我们无法根据作者实际使用的模型和提示的精确、私人组合来评估它。不完整的覆盖率会降低标记率,因此报告的患病率是一个下限:真实的比例至少是我们测量的。检测器记录报告每个生成器的性能。
旗帜不是作者身份。检测器以已知错误率的校准概率来估计文本读起来是否为机器编写的。它无法将经过轻微编辑的文档与完全生成的文档区分开来,并且单个分数永远不能成为指责特定个人的理由。我们报告了机器写作的盛行,其中包括大量人工智能辅助编辑。
该探测器运行成本低廉,我们不从中赚钱。您可以在此处的任何 arXiv 论文以及此处的您自己的文本上免费试用。