top of page

LLM 陈词滥调高亮器:AI 写作陈词滥调检测器向 AI 检测行业发起挑战

已更新:7月20日

Simon Willison 在又一篇充斥着熟悉机器腔调的文章令他难以忍受后,发布了 LLM 陈词滥调高亮器这款 AI 写作陈词滥调检测器。他的浏览器工具不会给出 AI 概率,而是标记“没有废话,没有填充内容,没有行话”等反复出现的模式。冲突由此立刻显现。大多数 AI 检测器承诺给出作者身份判定,而 Willison 的工具则向读者展示究竟是哪些具体措辞让一段文字显得像机器生成。

这种区别很重要,因为传统检测依然不可靠。OpenAI 在报告其准确率不佳后,于 2023 年撤下了自己的文本分类器,其中一项评估显示其误报率为 9%。Willison 选择了一条更窄的路径。他的工具识别编辑层面的症状,却不假装这些症状能够证明文本是由谁或什么写成的。

这使得该项目与其说像学术诚信系统,不如说像一款针对疲惫文风的拼写检查器。与此同时,Wikipedia 编辑们已经花费数年时间整理 AI 辅助写作中反复出现的迹象。由此产生的问题,并不是软件能否揭露一个隐形的机器作者,而是这些显而易见的陈词滥调能否提供足够证据,让文章写得更好。

LLM 陈词滥调高亮器究竟改变了什么

Willison 将人们对 AI 腔调文章的主观反应,转化成了一个可供检查的编辑界面。

Willison 于 2026 年 7 月 17 日通过其个人工具网站发布了这款工具。据他的发布文章所述,这款工具源于他的挫败感。他又遇到了一篇充斥着类似“没有废话,没有填充内容,没有行话”这类短语的文章,于是让 Fable 5 围绕十种常见模式构建一个应用程序。

最终完成的 LLM 陈词滥调高亮器可以接收粘贴的文本,也可以接收从 URL 加载的内容。分析会在用户输入时实时运行。匹配的措辞会被高亮显示,其所在句子则会获得单独的视觉标记,以保留上下文。

用户可以启用或停用单个模式。他们还可以查看总数、检查匹配项列表,并直接跳转到每一处匹配。诸如“没有 X,没有 Y”这样的连锁结构会显示条目数量,有助于区分单一结构与较长的修辞序列。

该应用程序通过 localStorage 将文本存储在浏览器中;localStorage 是一种可在不同会话间保留数据的浏览器功能。Willison 表示,分析过程完全在用户的设备上运行。这种设计降低了检查草稿的操作门槛,同时也避免了将文本强制上传到远程文本分析服务。

该界面还可以通过文本提取服务加载公开 URL。这使它适合检查已发布的文章、落地页、新闻简报和文档。不过,它的主要交互方式依然简单:提供文本,然后检查被高亮的措辞。

这里有一个细微的数字出入。Willison 的文章提到十种常见模式,而截取的界面显示全部 11 种模式均已启用。这种差异可能源于应用程序对规则进行分组或计数的方式,但文章并未作出解释。

这种不一致并未改变产品的核心用途。它会标记已知的表达结构,而不是计算整篇文档是否由 LLM 生成。匹配结果只表明某个选定模式出现了,并不能确定文本来源。

这种克制的主张正是它最重要的特点。该工具不会给作者贴上不诚实的标签,不会指控学生行为不端,也不会给出一个貌似科学的百分比。它只会指出某个短语,为编辑提供可供具体评估的对象。

以“没有废话,没有填充内容,没有行话”为例。这个结构通过重复来承诺直截了当,但它往往占用了篇幅,却没有增加任何证据。无论这句话出自人类、模型,还是使用模型的人,高亮器都能揭示这一弱点。

Willison 展示的其他模式包括“好好体会一下”、“你已经知道”,以及围绕某件事“值得点明”而构建的表达。这些短语本身并没有错。但反复使用它们,仍然可能形成一种由常见网络修辞拼装而成、容易辨认的声音。

因此,该应用程序改变了分析单位。商业检测器通常评估整篇文档并给出结论,而 Willison 评估的是局部措辞,并返回可供编辑的候选项。

这种差异构成了本文的核心张力。LLM 陈词滥调高亮器提供的确定性不如作者身份检测器,但它有限的输出更容易检查、质疑和使用。

为什么 AI 写作检测需要更克制的主张

这款工具之所以重要,是因为可以观察到的陈词滥调并不等同于 AI 作者身份的证据。

AI 文本检测一直面临一个棘手的分类问题。人类写作与机器写作有所重叠,因为语言模型本就是从人类文本中学习的。人们也会修改机器输出,而模型则可以模仿指定的语气、格式和个人风格。

检测器仍然必须区分这些相互交织的类别。即使底层区别并不稳定,它给出的分数也可能显得十分精确。短篇文本、编辑过的草稿、陌生的主题,以及非英语母语者的写作,都会让结果变得更加复杂。

OpenAI 已停用的分类器提供了一个有用的历史参照。该公司报告称,在其英语挑战数据集中,这款分类器将 26% 的 AI 写作样本识别为可能由 AI 生成,同时将 9% 的人类文本错误归类为 AI 写作。

由于准确率过低,OpenAI 于 2023 年 7 月下线了这款分类器。其存档的分类器公告还警告称,短文本尤其难以可靠检测,而经过编辑的 AI 文本可能逃过检测。该公司表示,不应将该系统作为主要决策工具。

当一个分数会影响成绩、就业、出版或声誉时,这些局限就会变得非常严重。误报造成的后果不只是给出糟糕的建议,它还会让一名作者遭受怀疑,而作者可能很难推翻一个不透明的结果。

LLM 陈词滥调高亮器完全避开了这种主张。它不会依据统计特征推断隐藏的来源,而是查找其规则所选定的明确字符串或表达结构。

从基本意义上说,这使其输出具有可复现性。两位读者可以看到被高亮的短语、审阅句子,并讨论这些措辞是否陈旧。他们不必将某个无法深入了解的模型所给出的概率视为最终答案。

该工具还将检测器营销中经常混为一谈的两个问题区分开来:

  • 这段文本是否包含经常与 LLM 输出相关的表达习惯?

  • 这段文本是否由 LLM 写成?

第一个问题涉及风格,第二个问题涉及作者身份。一篇文章可能满足其中任一条件,而不满足另一个条件。

人类营销文案作者可能会使用“没有废话,没有填充内容”,因为这个短语在销售文案中很常见。经过提示后,LLM 也可以通过使用具体细节来避开它。一个人还可以采纳模型提供的结构建议,同时重写每一个句子。

关于文体计量学——即通过可测量特征分析写作风格——的研究进一步印证了这种谨慎态度。一项发表于 Computational Linguistics、探讨文体计量学局限的研究发现,风格检测无法区分语言模型的正当应用与机器生成的虚假信息。无论底层内容是否具有欺骗性,都会出现相似的表层特征。

该研究针对的是另一代模型和范围更窄的虚假信息问题,但其概念层面的警示依然适用。风格可以帮助识别模式,却无法可靠地揭示意图、真相或确切的生成过程。

Willison 的工具接受了这一界限。它将公式化文章视为编辑问题,而不是将其转化为指控。

这种方法对一线编辑尤其有意义。他们眼前的任务通常不是取证式归因,而是判断一个句子是否值得保留、是否足够具体,以及是否传达了作者想要表达的含义。

短语级标记能够支持这项工作。编辑可以删除陈词滥调、用证据替换它,或者在节奏合适时将其保留。输出始终是建议,而不是判决。

这种更克制的主张,以一种出人意料的方式对传统 AI 检测器构成了压力。Willison 并不是在基准测试准确率方面展开竞争,而是在质疑作者身份分类是否真的是日常编辑所需要的正确产品。

真正的对手是基于判决的 AI 检测

这场竞争的核心,是可供检查的编辑信号与不透明的作者身份判决之间的较量。

基于判决的检测器承诺为一个充满情绪色彩的问题提供明确答案。粘贴文档,等待分析,然后获得一个百分比或标签。对于面对海量生成文本、无法逐一人工审阅的教师、编辑、招聘人员和出版商来说,这种简单性很有吸引力。

这种输出也掩盖了许多棘手的选择。达到什么阈值才算 AI 写作?系统如何进行校准?哪些模型生成了它的训练数据?它如何处理翻译、语法纠正,或人机混合起草的文本?

新模型和写作工作流不断改变检测目标。一个基于昨天未经编辑的聊天机器人输出训练而成的检测器,可能难以应对明天的模型。当人们重构、缩短或个性化文本后,它也可能作出错误判断。

LLM 陈词滥调高亮器颠倒了这种产品逻辑。它要求用户进行更多解释工作,而不是更少。它不给出单一分数,而是提供多个需要判断的段落。

这听起来像是一种局限——事实也确实如此。但它同时也是这款工具可信度的来源。

被高亮的“你已经知道”无法证明任何作者身份信息,却能揭示对读者缺乏依据的假设。编辑可以追问:受众是否真的知道所提到的事实,还是这个句子只是在模拟亲近感?

同样,在一个令人难以接受或出乎意料的事实之后使用“好好体会一下”可能很有效。但如果在缺乏此类事实的情况下反复使用,它实际上是在要求读者自行赋予论点尚未赢得的情感分量。问题不在于机器是否参与,而在于用修辞代替了实质内容。

“没有 X,没有 Y”式连锁结构体现了另一种容易辨认的机制。并列否定营造出有力的节奏,并宣扬文本避开了哪些内容。当多个这样的结构连续出现时,文案可能会把更多精力花在宣称自己直接,而不是真正做到直接。

传统检测器将许多信号转化为一个用户无法充分检查的结论。Willison 则公开了一小组信号,并拒绝据此得出结论。这使该应用程序作为执法软件时较为薄弱,但作为编辑辅助工具时更加强大。

Wikipedia 社区制定的指南也采取了类似立场。编辑们建立了一份公开目录,收录与 LLM 贡献相关、反复出现的语言、格式、引用和互动模式。该指南提醒读者,这些迹象只是线索,而非证据。

关于 Wikipedia 实用指南的报道指出,单个暴露特征的词语只能提供薄弱证据。只有当审阅者将这些模式与事实问题、引用行为及周边编辑语境结合起来考虑时,它们才会变得更有用。

这种区别对专业内容团队很重要。用一个陈词滥调替换另一个,并不能修复一篇建立在无依据论断之上的文章。去除带有 AI 味道的措辞,甚至可能让薄弱的内容更难被识别,却没有改善其实质。

因此,陈词滥调高亮工具的最佳用途是诊断。一组集中出现的匹配项会告诉编辑应该在哪里放慢审阅速度。随后,编辑应检查该段落的证据、具体程度,以及它与读者实际需求之间的联系。

这个过程可能揭示 AI 辅助出版中一个更深层的问题。语言模型很容易生成过渡语、摘要、均衡的列表和激励式结论。这些优势有助于完成初稿,但也可能掩盖报道内容的缺失。

一个润色精良的段落可能不包含任何原创观察。它的句子可以流畅推进,而论点却原地不动。程式化表达经常出现在作者本应提供具体示例、明确来源或可辩护论断的地方。

高亮工具无法识别所有这类缺口。它可以充当一道可见的警戒线,提示其中几种常见问题。

对于知识工作者而言,这形成了一套实用的审阅顺序。首先,找出重复的修辞模板。其次,询问每个模板发挥了什么作用。最后,用事实、示例、限制条件或决定替换空洞的强调。

这套工作流程也适用于更广泛的个人知识实践。保存可搜索来源资料的作者,可以用自己工作中的细节替换模型生成的泛泛措辞。结构化的 AI 第二大脑 有助于在起草阶段开始之前保存这些细节。

基于结论的检测为机构提供便利。短语级审阅则要求个人承担责任。Willison 的这个小工具有力地证明:与一个无法解释的百分比相比,责任意识能带来更好的文字。

这款 AI 写作陈词滥调检测器无法证明什么

LLM 陈词滥调高亮工具可以识别重复,但无法识别作者身份或衡量内容真实性。

每一种被标记的模式都有人类使用的先例。语言模型并没有发明平行否定、直接称呼、戏剧性停顿或疗愈式措辞。它们只是从人类创作的文字中吸收了这些表达手法。

称其为“LLM 陈词滥调”,描述的是它们出现的频率和文化关联,而不是其起源。模型偏爱的句式往往来自本就充斥着套路的文体,包括营销页面、自助类帖子、咨询材料和面向搜索的文章。

这会在解读层面带来误判风险。应用程序可以准确匹配一个短语,但读者可能由此对作者得出毫无依据的结论。技术上的准确并不能保证使用方式负责任。

教师不应将高亮短语视为学术不端的证据。编辑不应因为一篇投稿包含多个已列出的模式就将其拒绝。雇主也不应使用这个界面评判候选人是否诚实。

工具的名称清楚表明了它的关注对象,但它的设计也传达了更安全的边界。它只报告匹配项和被标记的句子,不会显示“人类”或“AI”标签。

用户必须保持这种克制。陈词滥调是检查一个句子的理由,而不是调查一个人的理由。

模式列表也会过时。一旦作者和模型开发者意识到某种句式不受欢迎,就可以通过提示词抑制它。用户可以要求减少平行否定、避免疗愈式框架,并使用更具体的语言。即使大部分初稿仍由模型生成,这些可见信号也会消失。

这种适应会让传统检测器陷入一场军备竞赛,也会给高亮工具带来维护问题,尽管后者造成的后果较小。过时的规则集会遗漏较新的习惯,或者继续标记那些已不再具有相同关联的语言。

当前的模式也反映了英语阅读环境。不同语言、方言、专业群体和文化语境中的修辞习惯并不相同。在北美科技写作中有用的模式,在其他地方可能只是普通表达。

这还涉及另一个公平性问题。通过正规教学学习英语的人可能更依赖可复用的过渡语和均衡的句子结构。专业模板也会鼓励相同的行为。将这些句式标记为机器化表达,可能会强化一种狭隘的“真实声音”观念。

针对黑人用户使用 AI 辅助写作的研究,已经记录了辅助功能与身份认同之间的张力。一项 2025 年的研究中,参与者一方面描述了写作工具带来的好处,另一方面也担忧生成的语言无法代表自己。这个更广泛的问题无法被简化为一份陈词滥调清单。

高亮工具仍然可以帮助用户注意到助手何时抹平了自己的声音。但它不应定义人类的声音必须是什么样子。

该应用也无法评估事实准确性。一个不含任何已列出陈词滥调的句子,仍可能包含捏造的统计数据、不存在的来源或被歪曲的背景。一个被大量标记的句子也可能完全准确。

因此,风格审阅必须重新与来源审阅结合起来。编辑需要分别核实姓名、日期、引文、链接和因果论断。删除“值得注意的是”并不能验证其后的内容。

这个工具也无法判断使用 AI 辅助是否恰当。作者可能使用模型进行头脑风暴、语法校正、翻译或拟定提纲。另一个人可能生成整篇文章,却完全不进行核实。仅凭成稿未必能揭示这种区别。

更成熟的出版政策应聚焦于责任。谁核查了事实?谁对论点负责?哪些辅助行为必须披露?作者能否解释并捍卫最终作品?

陈词滥调高亮可以支持这类政策,因为它鼓励细读。但它无法取代披露规则、编辑审阅或来源追踪系统。

因此,“检测器”这个标签需要谨慎使用。这是一款 AI 写作陈词滥调检测器,而不是可靠的 AI 作者身份检测器。混淆这两个类别,将重现该工具克制的设计所避免的那种过度自信。

它的局限不是隐藏的缺陷,而是界定了产品的正确用途。

为什么陈词滥调检测本质上是一项写作质量测试

最有价值的结果不是抓出 AI,而是迫使模糊的文字变得具体。

许多 LLM 陈词滥调承担了本应由证据承担的工作。它们宣告重要性、亲密感、清晰度或情感分量,却没有证明这些特质。将其高亮,便提供了一个机会,让人追问这个句子尚未赢得什么。

以“这种失落是真实的,值得被说出来”这样的短语为例。这句话可能是在富有同理心地回应一种真实经历。但在另一种语境中,它可能只是在模仿共情,同时回避究竟是谁失去了什么,以及为什么会失去这些细节。

编辑可以通过点明后果来改进第二种版本。某个团队错过了截止日期。某位客户失去了对已存储工作的访问权限。某项政策取消了一项原本预期存在的保障措施。具体的语言让读者有内容可供判断。

同样的原则也适用于“你已经知道”。这个短语声称双方拥有共同认知,可以让文字显得更具对话感。但它也可能排斥某些读者,或掩盖解释的缺失。

修改时可以用一句话直接陈述相关事实。如果这个事实并非必要,作者可以完全删除铺垫。无论选择哪一种,都比模拟熟悉感更能服务读者。

“没有废话,没有填充,没有术语”则适合更直接的修复方式。删掉承诺,直接呈现有用的信息。如果后面的段落仍显得模糊,那么这句口号掩盖的就是结构性缺陷。

这正是 LLM 陈词滥调高亮工具可以嵌入编辑工作流程的地方。它最适合在作者完成完整初稿之后、最终文案编辑之前使用。目标不是自动清除每一个匹配项。

首先,审查集中出现的匹配项。一个短小章节中出现多个匹配,表明文字严重依赖预制的节奏。单独出现的一个匹配则可能是有意为之,而且效果很好。

其次,检查其功能。询问这个短语是否增加了含义、控制了节奏,或帮助读者理解论点。如果有,就保留它。

第三,在作者的来源材料中寻找替代内容。会议记录、访谈、研究论文、产品日志和客户反馈都包含泛泛措辞无法提供的细节。可搜索的知识工作流可以缩短这一步骤。

第四,大声朗读修改后的内容。移除熟悉的句式后,文字可能变得僵硬或支离破碎。目标并不是让每个句子都达到最大程度的原创,而是形成一种可信的声音,并具备足够的变化和具体性来持续吸引注意力。

这个编辑过程也说明了为什么自动替换会是一个错误。一个替换所有被标记短语的工具,可能只是创造出另一套公式。下一个模型会学会这些替代表达,读者也会再次对此感到厌倦。

语言通过重复而变化。表达之所以成为陈词滥调,是因为它们曾经足够有效,因而被人模仿。AI 通过以惊人频率生成流行结构加速了这个循环,但人类仍然是这一反馈循环的一部分。

更好的应对方式不是建立一份永久黑名单,而是主动判断一个短语在当前语境中是否仍然承载意义。

内容团队可以将汇总后的匹配项用作质量信号,但不应把匹配数量变成目标。作者会针对任何指标进行优化。低匹配数可以与一篇空洞的文章并存,就像高匹配数也可能出现在一篇有效的个人随笔中一样。

对团队最有用的问题是定性的:在这份出版物中,哪些反复出现的句式与薄弱作品存在关联?编辑可以根据自己的受众、形式和主题维护本地化指南。

技术文档团队可能会标记“轻松”“只需”之类缺乏依据的简单化表述。新闻编辑部可能会关注模糊的归因。研究机构则可能优先关注夸大的重要性陈述和因果跳跃。

Willison 的项目展示了实现这种方法的界面。可切换的模式让用户决定哪些规则重要。结合上下文的句子高亮,可以避免匹配短语脱离其实际作用。

纯浏览器设计也支持处理私人初稿。作者可以检查尚未发表的文字,而无需将其提交给另一个托管式 AI 检测服务。不过,通过 URL 加载内容会涉及外部提取路径,因此敏感材料应使用粘贴工作流,而不是公开 URL。

这个微小区别体现了该工具更广泛的吸引力。它并不试图成为全能的内容权威,而是提供一个聚焦的视角,让用户将其与事实核查、来源管理和人工编辑结合起来。

如果使用得当,LLM 陈词滥调高亮工具会让写作更具责任性。作者必须决定一个短语为什么存在,以及应该用什么替换它。这比接受一个检测器评分更慢,但最终得到的是一份真正经过审阅的文档。

三个信号将表明 LLM 陈词滥调高亮工具是否真正重要

接下来的考验是,这项实验会成为一种可调整的编辑实践,还是仅仅停留在对 2026 年文风的一次巧妙快照。

第一个信号是模式维护。Willison 的发布文章描述了十种模式,而可见界面显示有 11 条启用中的规则。未来新增、删除或完善规则,将表明这份列表正在成为一套持续维护的 LLM 常见习惯词汇表。

这种发展会增强该工具的编辑价值。静止不变的列表仍能捕捉熟悉的句式,但随着模型和提示实践发生变化,它的代表性会逐渐降低。

重要的衡量标准不是规则总数。庞大的规则目录会让写作者不堪重负,并增加意外匹配。有效的维护应优先考虑易于识别且具有明确编辑意义的模式。

第二个信号是编辑、教育工作者和内容团队是否将其作为修订辅助工具采用。负责任的采用方式会强调对高亮段落的讨论。惩罚性的采用方式则会将匹配结果视为违规使用 AI 的证据。

第一种结果会强化 Willison 的审慎做法。第二种结果则会削弱这种做法,因为它把一个透明的文风检查工具变成了临时拼凑的监控工具。

留意用户如何描述他们的结果。“这帮助我发现了重复性语言”符合该应用的实际能力。“这证明了作者使用了 AI”则超出了现有证据所能支持的范围。

第三个信号是主流写作产品是否开始效仿。语法检查器、文档编辑器和出版系统已经能够识别被动语态、重复用词、语气和可读性问题。它们完全可以轻松加入可自定义的 AI 文风模式检查功能。

如果这些产品将该功能定位为编辑指导,就说明 Willison 的理念得到了传播。如果它们把相同的信号包装成作者身份评分,那么检测行业只是吸收了这种界面,却没有理解其核心启示。

模型提供商也会以间接方式作出回应。提示词和系统指令正越来越多地避免套话、过多的标题、公式化的过渡语和夸张的强调。更好的默认设置可以减少最明显的症状。

这并不会让陈词滥调高亮功能变得过时。现有的人类写作工具也会对熟练写作者本可避免的习惯发出警告。它的价值在于,当人的注意力有限时帮助发现这些问题。

更大的不确定性在于,可识别的 AI 文风是否仍会是一个稳定的类别。随着人们阅读生成文本,他们会吸收其中的一些词汇和节奏。随后,模型又会在更多受早期模型影响的文本上进行训练。人类与机器的语言习惯会越来越难以区分。

这种反馈循环让作者身份检测变得更不可靠,同时也让编辑标准变得更加重要。出版机构需要明确自己想要什么样的写作,而不能仅仅定义它们怀疑存在的模式。

LLM 陈词滥调高亮工具指向了这样的未来。它用一场关于语言的透明讨论,取代了确定性检测的幻想。衡量其成功与否的标准应当是修订质量是否有所提升,而不是它看起来抓住了多少写作者。

对读者而言,实际操作很简单。粘贴一份草稿,检查每处匹配,并思考高亮短语是否增强了证据、清晰度或节奏。如果答案具体明确,就保留它。如果该短语只是在表现自信或情绪,就重写它。然后独立核实其中的主张,因为文风干净并不能保证报道准确。当 LLM 陈词滥调高亮 AI 写作陈词滥调检测器用于开启一项编辑决策,而不是终结决策时,它才最有用。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page