一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

三分之一arXiv失守,CS论文65%被检出“AI味”,数学仅0.7%

时间:2026-07-29 10:47:03 编辑:袖梨 来源:一聚教程网

arXiv论文中,竟有三分之一可能出自AI?

最近,unslop的一项研究在外网引发了热烈争论。

它的检测器把过去一年计算机科学领域65%的新论文标成了红色。

网友还为这种现象专门造出一个名词——「大泔水时代」。

然而在同一时期,数学论文的比例却仅为0.7%。

ChatGPT登场,曲线迅速起飞

研究团队扫描了12750篇arXiv论文,覆盖时间从2023年1月一直延伸到2026年7月。

研究锁定十个学科,并从每个领域每月抽取约25篇全文。

对照组选取2021至2022年的论文,当时ChatGPT尚未诞生,论文仍处于纯人类写作时代。

数据显示,2021至2022年的标记率始终稳定在0.4%;ChatGPT发布后,曲线却在几个月内迅速上扬。

最近一个完整季度的标记率已经达到32%,2026年初的峰值更接近39%。

若按学科划分,计算机科学的情况最突出,标记率达到65%。

ChatGPT问世以前,该领域的基准值仅有0.2%。不过短短三年,这个数字就猛增了300多倍。

其后依次为定量生物学56.3%、电气工程51.3%、经济与金融47%;继续往下则是应用物理34%、统计31.3%、凝聚态物理24%、高能物理14%、天体物理10.7%。

位于榜单最后的是数学,比例为0.7%。

而且,这些结果还只是下限;一旦AI文本被隐藏得足够巧妙,检测器就无法将其识别出来。

面对同一个论文库,同一台检测仪给出的学科差距接近100倍。

究竟是数学家都在坚持纯手工写作,还是这台机器面对数学公式时根本无法识别?

0.7%跌至谷底,源于机器致盲

实际上,unslop已经亲自在报告中写出了答案。

一篇标准数学论文是什么模样?符号、公式、定理和证明铺满页面,真正以英语写成的散文句子少之又少。

但这台检测器偏偏只能识别文字,关注的是句子结构、用词习惯以及段落组织方式。

数学论文仅有的几行文字,又多是「设X为某某」「由引理3可推导」之类的格式化表述,与检测器训练中接触的科学英语几乎不在同一频道。

因此,团队也主动承认当前研究仍有不少局限:

目前不能用数学的0.7%说明什么:数学家或许确实很少使用AI,也可能只是检测器无法理解数学论文,而现有数据不能区分这两种情况。

对照组的规模同样偏小。每个学科只有200篇ChatGPT出现前的论文;按照0.4%的误报率计算,2000篇中总计仅有8篇被标记,因此只能得到粗略估计。

此外,正如前文所说,检测器无法全部抓出。因此,这些数字依旧只是下限,真实比例只可能更高。

竞争越激烈,越难离开AI

那么,使用AI写论文的究竟是谁?

答案来自斯坦福另一项延续两年的研究。

2024年3月,斯坦福Weixin Liang团队首先把测量工具用于同行评审:在ICLR 2024的审稿意见中,约10.6%的句子曾被LLM大幅修改。论文尚未测完,审稿人已经率先用上了。

到了2025年8月,同一团队把样本扩大至112万篇论文,研究还直接登上《自然·人类行为》。

研究发现,截至2024年9月,CS论文摘要经LLM修改的比例最高达到22.5%。使用最频繁的,则是预印本发布最勤、身处竞争最激烈领域的研究者。

领域竞争越激烈,使用程度也越高。

在这里,AI写作已演变成军备竞赛:当同行纷纷借助AI提速,坚持手写的人便会慢上一拍。

难怪X上一条流传颇广的相关转发,配文里第一行就是:「提示词:写一篇能发arXiv的论文。」

它识别的是「味」,并非AI

不过,不要急着用这65%给论文定罪。

团队也在报告中承认,检测器无法区别「AI顺过一遍语法」与「整篇机器代工」,它只能判断文字中机器味的浓度。

因此,65%应被理解为「65%的论文读起来像AI」,而非「65%的论文由AI写成」。

真正棘手的是,人类写作本身也可能带有这种机器味。

有研究者不信这一结果,便把自己多年前的旧论文放入检测工具,最终仍有27%到74%的内容被标红。

而在那个年代,ChatGPT甚至还没有出现。

其中的原因并不难发现。

如今的学术期刊中,大型语言模型、基准测试和业界最前沿等内容随处可见。措辞越规范、结构越整齐,就越容易符合检测器认定的机器特征。

更何况,LLM原本就是以这类论文训练的。并非学者写得像AI,而是AI天生就写得像学者。

当每段文字都背上嫌疑

过去这两年,其实我们一直在做与检测器相同的事。

当一段文字四平八稳、词句规整,还不时出现「不仅……而且……」,人们心里便会突然一紧:这不会是AI写的吧?

unslop的检测器,相当于把这种近乎玄学的嗅觉制成了一台可以批量生产数字的仪器。

因为怀疑一旦进入脑海,就再也难以卸下。

过去,「写下来」这件事本身就是背书;一个人肯用几个小时组织文字,至少能够表明他的认真。

如今无论写得多漂亮,也可能只得到一句「AI吧」。

甚至有人故意避开自己用了半辈子的词语,只因为它们「听起来太AI」。

现在,「AI味」正逐渐成为席卷文字圈的一种新型原罪。

荒诞之处在于,直至今天,我们仍无法精确测量这种「AI味」到底由哪些部分构成。

热门栏目