ArXiv AI 写作信号超过 30%,但检测结果并非证据
- Martin Chen

- 5天前
- 讀畢需時 15 分鐘
据一项针对 12,750 篇全文论文的分析,截至 2026 年 7 月,ArXiv AI 写作信号据称出现在 32% 的新投稿中。今年早些时候,这一数字曾接近 39%。如果这些估算成立,那么 AI 辅助的学术写作已经从偶尔出现的新奇现象,转变为科学交流中的常规组成部分。
这一标题很容易让人得出一个简单结论:机器正在撰写三分之一的新 ArXiv 论文。但其基础证据仅支持一个范围更窄的判断。检测器发现了与 AI 写作一致的文本模式,但这并不能确定每个句子由谁创作,也无法证明 AI 的具体使用程度。
这一区别构成了核心矛盾。研究人员希望借助工具减少语言障碍并缩短编辑时间。出版商和读者则需要可追责的作者身份、准确的引用,以及对精良文字仍然反映经核实研究成果的信心。
据称,得出这一新估算的检测器能够识别 85% 的 AI 学术文本,误报率为 0.4%。然而,即使基准测试表现出色,也无法将概率性分类转化为针对某篇论文的确凿证据。
因此,这一结果的重要性不在于指控成千上万名作者,而在于它作为一个群体层面的信号,表明科学出版已经进入新阶段,而相关披露和评审制度仍未定型。
ArXiv AI 写作信号升至 30% 以上
这项新分析描述的是新预印本文字风格的快速转变,而不是经核实的机器撰写论文数量。
据称,Unslop 发布的分析检查了 12,750 篇 ArXiv 论文的全文。其 ArXiv 写作分析估算,截至 2026 年 7 月,32% 的新投稿表现出与 AI 生成学术文字一致的特征。
2026 年初,这一估算比例一度接近 39%,随后有所下降。这一变化很重要,因为它表明 AI 的采用并不均衡,也无法用一个永久不变的百分比来概括。
一篇论文可能因多种原因包含类似 AI 的文本。作者可能要求模型起草某一章节、翻译已有文字、修改语法或规范技术语言。检测器能够识别由此产生的风格,却无法揭示究竟是哪种工作流程生成了这些文本。
该分析还指出,不同学科之间存在巨大差异。计算机科学的估算比例最高,达到 65%,而数学仅为 0.7%。
这些领域的写作条件截然不同。计算机科学论文通常包含大量阐释、基准测试叙述、实现细节以及快速变化的文献综述。数学则更加依赖形式化符号、简洁证明和专业化的论证结构。
因此,这种差距可能同时反映了采用程度和可检测性。计算机科学家既是生成式模型的高频使用者,也是其构建者。他们的论文还包含更多连续文字,可供文本分类器评估。
数学论文能让检测器检查的常规语言更少。较低的分数可能意味着 AI 使用有限,也可能意味着可检测的文字有限,或两者兼而有之。
对于所报告的检测器性能,也需要谨慎解读。85% 的真阳性率意味着,在测试条件下,每 100 个符合条件的 AI 撰写样本中,系统能够识别出 85 个。0.4% 的误报率意味着,每 1,000 个人类撰写样本中,有 4 个被错误标记。
这些基准数据令人鼓舞。然而,基准样本通常附有标签,生成设置受到控制,而且文本来源已知。真实稿件则混合了人类起草、机器编辑、引文、公式、模板以及多名作者的内容。
基础发生率也会进一步改变读者对结果的解读方式。即使误报率很低,在整个大型文献库中应用时也会产生错误分类。当分数与个人挂钩,而不是以群体统计形式呈现时,这一风险尤其重要。
因此,应将 32% 的估算视为广泛语言变化的证据。它并不意味着 32% 的研究人员将其智力工作交给了模型。
即使采用这种更严格的解读,这仍然是一项重大进展。AI 辅助文字已经普遍到足以影响一个重要全球预印本平台上的科学写作面貌。
早期研究已经发现了这一趋势
这项新估算延续了独立研究人员在 2026 年之前发现的趋势,尽管早期方法得出的数字较低。
一项经过同行评审的大型研究调查了来自 ArXiv、bioRxiv 和 Nature 旗下期刊的 1,121,912 篇论文。数据集覆盖 2020 年 1 月至 2024 年 9 月。
其科学写作研究采用群体层面的词频变化,而不是为每篇论文指定明确的作者身份标签。研究人员估算,计算机科学论文中经 LLM 修改的比例最高可达 22%。
数学论文和 Nature 旗下出版物显示出的估算证据较少,最高为 9%。该研究还发现,在竞争激烈的研究领域、篇幅较短的论文以及更频繁发布预印本的作者中,估算使用率更高。
早期研究中的 22% 与最新分析中的 32% 之间存在差异,但这并不自动意味着增长了十个百分点。这些研究覆盖的时期、数据集、定义和检测方法均不相同。
尽管如此,它们所指向的方向是一致的。两者均认为计算机科学是 AI 辅助科学写作的领先领域,也都发现不同学科之间存在显著差异。
其他证据表明,采用情况还具有重要的地域差异。一项针对超过 200 万篇生物医学出版物的研究发现,非英语国家研究人员使用 AI 辅助写作的增长速度更快。
这项生物医学采用情况研究估算,非英语国家的增幅约为 400%,而英语国家为 183%。研究还发现,资历较浅的科学家采用率更高。
这些证据使“AI 写作仅仅是一种捷径”这一常见说法变得更加复杂。英语仍然是国际科学界的主导语言。研究人员可能拥有可靠的研究结果,却要为以达到出版标准的英语呈现这些结果承担额外负担。
模型可以通过翻译、语法纠正和结构编辑来减轻这种负担。如果谨慎使用,这些功能可以在不改变基础科学贡献的情况下扩大参与范围。
但同一界面也可以生成整篇文献综述、结论或解释。仅凭文本,很难将这些用途中的语言辅助与智力替代区分开来。
这种模糊性解释了为什么“AI 撰写”是一个不稳定的类别。完全由 AI 生成的引言与仅由 AI 修正冠词的人类草稿,都可能带上与模型输出相关的统计痕迹。
群体层面的方法仍然有用,因为它们能够发现总体变化,而无需追究个别作者。当机构将其估算转化为学术不端判定时,它们就会引发更多争议。
新的 ArXiv 数据也符合模型采用的时间进程。到 2026 年,研究人员已经使用通用聊天机器人、专业写作助手以及集成到编码环境中的模型数年之久。
学术工作流程很少将编码、搜索、记笔记和写作完全分开。一名计算机科学家可能使用同一个模型调试实验、总结日志、修改段落并编排文档格式。
即使模型对研究问题或结果毫无贡献,写作信号也可能保留下来。反过来,作者也可能大量使用 AI,然后对文字进行充分编辑,从而避开检测。
因此,这一核心趋势比自动化署名更为广泛。机器介导的语言正成为研究生产中的又一层工具,就像文献管理器、拼写工具和统计软件一样。
与这些早期工具不同,生成式模型能够编造事实和论点。正是这种能力,使科学机构更难将其日益普遍的存在视为普通自动化。
真正的冲突在于辅助与问责
AI 可以改善科学交流的可及性,同时削弱精良论断背后的证据链。
对研究人员而言,其直接好处不难理解。模型可以整理笔记、改写不清晰的段落、提出标题建议、翻译文本并总结相关研究。
当英语流利程度成为非正式的门槛时,这些任务尤其有价值。语言模型可以帮助作者表达已有的推理,而不一定会取代推理本身。
生产效率的提升也可能帮助小型团队。研究人员可以减少修改措辞的时间,将更多时间用于开展实验、检查假设或修订分析。
然而,科学问责所依赖的不仅仅是易读的文字。作者必须理解每项论断、核实每条引文、披露相关方法,并能够在质询中为论文进行辩护。
当生成式系统插入看似合理却未经任何人独立核实的陈述时,这条责任链就会被削弱。流畅的段落比明显不完整的人类草稿更能有效掩盖不确定性。
这构成了 ArXiv AI 写作争论中的主要对立:便捷的语言辅助与可追溯的人类问责。
这种冲突并非简单地将人类与机器分隔开来,而是将保留责任的工作流程与掩盖责任的工作流程区分开来。
使用 AI 修改语法但核实每个句子的研究人员,仍然保有清晰的问责路径。作者若仅因生成的论断听起来可信便予以接受,则是在转移判断权,却没有转移责任。
这一问题在文献综述中会变得更加严重。模型可以将真实概念组合成不存在的论文、错误的作者名单或捏造的标识符。由此产生的引用可能看起来十分常规,足以通过快速审阅。
一项 2026 年的分析审查了多个文献库中 250 万篇论文的 1.11 亿条参考文献。其引用审计保守估算,仅 2025 年就出现了 146,932 条幻觉引用。
研究人员报告称,这些错误更常出现在带有 AI 辅助写作语言信号的稿件中。他们还得出结论,预印本审核和期刊出版仅发现了其中一小部分问题。
这种关联并不意味着每篇类似 AI 写作的论文都包含虚假参考文献。它揭示的是一种超越文体和披露问题的具体风险。
预印本面临着特殊压力,因为速度本身就是其宗旨的一部分。ArXiv 帮助研究人员在正式期刊发表之前分享成果,从而支持快速讨论和优先权声明。
这一模式有赖于读者理解审核并不等同于同行评审。然而,论文仍然会被编入索引、引用、分享到社交平台,有时甚至被视为已经确定的研究结论。
当投稿量与精良的机器撰写文字同步增长时,评审者和读者便会面临注意力难题。以专业方式包装薄弱论断的成本变得更低,而仔细核实仍然代价高昂。
计算机科学正处于这种压力的中心。该领域发展迅速,重视预印本的快速传播,同时也创造了推动这一变化的工具。
据报道,65% 的估算结果并不能证明计算机科学领域存在研究诚信危机。但它确实表明,未披露的 AI 协助已不能再被视为该领域中的边缘情况。
机构现在需要制定基于行为和责任的政策,而不能仅仅依据文本相似性。关键问题涉及核查、披露、数据完整性、引用准确性以及作者对内容的理解。
仅凭检测分数无法回答这些问题。它可以识别需要审查的材料,但追究作者责任需要过程证据。
草稿历史、来源笔记、实验记录、版本控制以及有记录的审查决定能够提供更有力的背景信息。可搜索的个人知识库也可以保留论点如何从来源中发展而来的过程。
随着最终文本变得更容易生成,这种溯源信息也愈发宝贵。完成后的文档越来越难以揭示其背后的思考路径。
为什么 AI 写作检测不能作为证据
检测器衡量的是文本与习得模式的相似程度,而对作者身份的指控则需要有关行为和过程的证据。
AI 文本检测器通常会对与模型生成语言相关的统计特征进行分类。这些特征可能包括可预测的用词、一致的句子结构、重复的过渡语以及有限的变化。
学术写作天然具有其中若干特征。期刊鼓励采用正式语气、标准化结构、谨慎的论断以及学科内反复使用的表达。
将英语作为附加语言使用的作者可能会更加依赖常规结构。文字编辑和语法工具也可能使行文更加统一。
即使公布的基准误报率看似很低,这些重叠特征仍会造成误报。它们也会使检测器的输出受到文本长度、学科、编辑程度和模型家族的影响。
独立评估已多次警告,不应将单一分数视为决定性证据。一项检测器评估在陌生领域和模型中测试了多个系统。
研究人员重点考察了固定误报率下的表现。在某些评估条件下,一些检测器记录的真正例率甚至低至零。
这一发现并不意味着所有检测器都无效。它表明,当测试环境不同于训练或验证环境时,醒目的准确率数字可能会急剧下降。
对抗性编辑带来了另一个弱点。人们可以提示模型改变句子长度、删除其偏爱的表达,或模仿特定作者。
人工修改也可以消除明显的模型特征。因此,经过精心处理的滥用行为可能逃过检测,而经过合法编辑的文本却可能得到更高的检测分数。
据报道的 Unslop 结果同样值得审慎审视。误报率为 0.4% 时检测率达到 85%,听起来十分精确,但读者仍需了解其校准细节。
相关问题包括:哪些模型生成了测试样本、哪些学科提供了人工撰写的对照文本,以及该工具如何处理混合创作的文本。
时间范围也很重要。随着提供商更新系统以及用户采用新的提示策略,模型行为会不断变化。依据旧版输出校准的检测器在面对较新模型时可能会失去敏感度。
全文分析带来了进一步的复杂性。一篇论文包含语言特征截然不同的多个部分,包括摘要、证明、图注、致谢、附录和参考文献。
整篇文档的单一分数可能掩盖信号究竟遍布整篇稿件,还是只出现在少数格式化程度较高的段落中。在评估可能的使用方式时,这一区别非常重要。
0.4% 的误报率也需要明确的判定阈值。降低阈值可以捕获更多 AI 文本,但通常会增加误报。提高阈值可以保护人工写作,却会漏掉更多生成内容。
任何阈值都无法解决根本的归因问题。检测可以估算语言与已知 AI 输出的相似程度,但无法还原作者确切的工作流程。
其实际含义十分明确。针对整个存档的估算可以揭示趋势,而针对单篇论文的分数应引发进一步询问,而非直接作出判决。
这种区分既能保护科学诚信,也能保护研究人员。机构需要在不因正式的行文风格而错误指控作者的前提下,调查不负责任使用行为的方法。
它也能避免形成误导性的二元判断。科学论文越来越多地融合了作者、合作者、编辑、翻译系统和生成式模型共同参与的写作成果。
相关政策问题并不是机器是否接触过文本,而是每一位署名作者是否仍对论文中的论断和证据负责。
更像 AI 的行文并不自动意味着科学质量更差
写作来源与研究有效性有所重叠,但二者都不能替代对另一方的评估。
一篇论文即使完全由人撰写,也仍可能包含伪造数据、薄弱的方法或误导性的结论。一篇经过 AI 编辑的论文也可能报告严谨且可复现的研究。
因此,仅凭文本质量无法确定科学质量。审稿人仍必须评估方法、数据、统计分析、既有研究以及证据与结论之间的联系。
然而,生成式写作改变了生成看似可信稿件的成本结构。它减少了将不完整的研究包装成精致学术语言所需的工作量。
这种转变可能在审稿能力没有同步提升的情况下增加投稿量。它也可能使低质量论文在初步审阅时更难被识别。
风险并不仅仅是糟糕的语法消失了。模型可以生成连贯的过渡,使缺乏支持的论断显得彼此关联。
模型还可以依据从训练数据中学到的模式总结某个领域,而不是通过经过验证的来源检索来总结。其结果可能听起来见多识广,却包含细微的事实错误。
引用幻觉提供了最清晰、可衡量的例子。一条虚假参考文献可能污染未来的文献综述、自动化研究工具和模型训练数据集。
这种污染可能形成递归循环。后续系统可能吸收机器生成的论断,并将其当作源自独立学术研究的内容加以复述。
关于递归训练数据的研究表明,反复使用生成材料进行训练可能会导致模型分布退化。科学文献也面临与此相关的知识质量问题。
这种直接比较存在局限。预印本存档本身并不是模型训练流程,而且人工审查可以纠正错误。尽管如此,预印本经常会进入搜索索引和下游数据集。
这使得来源核查对于研究人员和 AI 开发者而言都变得日益重要。一句精致流畅的话绝不能成为证明其自身准确性的证据。
这一新估算还引发了公平性方面的担忧。基于语言检测的激进执法可能会给最能从语言辅助中受益的非英语母语作者带来负担。
禁止所有生成式编辑的政策可能会重新竖起过去的语言壁垒,却无法提高研究质量。忽视 AI 使用的政策则会留下严重的责任缺口。
更合理的分界线应围绕允许的辅助方式和保留的责任来划定。语法修正、翻译和结构建议都可以披露,而不意味着将机器列为作者。
由模型生成的事实论断、文献综述或解读则需要更严格的核查。作者应保留来源,并确认每一项引用的作品都真实存在且支持所陈述的观点。
编辑可以优先进行客观检查。引用解析、数据可用性、代码执行、图像完整性以及所报告方法与结果之间的一致性,都能提供可操作的证据。
检测器分数可以补充这些检查,尤其是在处理大型文献集合时。但它们不应取代这些检查。
作者还可以通过维护研究轨迹来保护自己。来源注释、带日期的草稿、实验日志以及保留的提示词,都可以证明稿件的发展过程。
即使没有发生任何指控,这些记录也有助于实现可复现性。它们能帮助合作者在写作过程中区分经过验证的发现与暂定总结。
AI 使用的增长使这种规范变得更加重要。当生成流畅语言只需几秒钟时,保存每项论断的来源反而成了更困难的任务。
这正是据报道的 32% 这一数字更深层的含义。科学交流正变得越来越容易自动化,但科学责任依然顽固地属于人类。
ArXiv 和研究人员接下来应关注什么
有三个信号可以表明,AI 辅助写作究竟会成为负责任的基础设施,还是成为日益加剧的不确定性来源。
第一个信号是对 32% 这一估算的独立复现。研究人员需要使用不同的检测器和群体层面的方法,对 ArXiv 同一时期的内容进行测试。
如果不同方法得出的结果一致,就会强化这样一个结论:如今约三分之一的新投稿中出现了受 AI 影响的行文。如果差异很大,则会暴露结果对校准或学科的敏感性。
复现研究应报告文档选择、模型覆盖范围、分章节结果以及不确定性区间。它还应区分完全生成的样本和经过轻度修改的人工草稿。
这些细节将决定这一醒目数字衡量的是广泛的辅助使用,还是大规模的自动化写作。缺少这些信息,这一百分比虽仍有参考价值,却定义不够明确。
第二个信号是类 AI 文本与可验证研究缺陷之间的关系。相比风格上的相似性,引用错误、缺乏支持的论断、论文撤稿和复现失败更为重要。
如果在控制学科和作者特征后,具有强烈 AI 信号的论文始终表现出更多客观缺陷,那么更严格的审查将获得实证支持。
如果不存在这种关系,机构就应避免将检测结果作为质量的替代指标,而应专注于直接检查。
2026 年的引用研究结果提供了早期警示,但并未确定因果关系。使用 AI 的研究人员可能身处发展更快的领域,而这些领域的参考文献本来就更难核实。
未来的研究应区分这些影响。还应评估披露和有记录的核查是否能够降低错误率。
第三个信号是政策转向以过程为基础。ArXiv、会议和期刊可以界定可接受的使用方式,同时要求作者继续承担责任。
有用的政策应涵盖生成的引用、捏造的内容、披露、保密的同行评审材料,以及将模型视为非作者的处理方式。
执行方式将揭示真正的发展方向。仅依据检测器分数自动拒稿,会加剧人们对公平性和可靠性的担忧。
分层审查会更具合理性。分数可以用于识别需要验证引用、向作者提问或开展更深入方法检查的稿件,而不直接判定其有过错。
研究人员不应等待统一规则出台。任何使用模型的人都可以记录模型执行了哪些任务、保留使用 AI 之前的草稿,并核查每一项事实性输出。
作者还应测试自己能否在不求助于模型的情况下解释每一个段落。如果他们无法为某项论断辩护,该论断就尚未达到投稿标准。
读者也应采用同样务实的标准。预印本流畅精致的文风既不应自动赢得信任,也不应自动引发怀疑。
检查证据、审阅引用来源,并将研究质量与表达的流畅程度区分开来。无论作者身份如何,这些习惯始终有用。
一旦有独立团队复现这一结果,ArXiv AI 写作信号的相关结论将变得更具意义。在此之前,32% 是一个严肃的估算值,而非全面统计结果。
未来几个月应该会出现更多针对不同检测工具、学科和文档章节的对比研究。这些结果将揭示,2026 年初的峰值究竟代表了暂时性行为,还是一种持久的基准水平。
对于研究人员而言,当下要做的很简单:保留从来源到结论的完整路径。对于机构而言,则应调查证据,而非仅凭写作风格作出判断。
对于读者而言,最有用的问题并不是:“这是 AI 写的吗?”而应该问:作者是否核实了内容、披露了相关辅助,并对每一项结果承担责任。


