Claude Opus 5.5 的写作特征变了,但并未消失
尽管 Anthropic 对风格进行了大幅调整,Claude Opus 5.5 的写作特征依然存在,尽管该模型使用破折号的频率降低了 99%。如今最强的信号是“可靠”,该词在模型撰写的文章中出现的频率是同类人类作品的 23 倍。
这一发现来自 Graphite 对涵盖 9,974 个匹配主题文章的分析。研究人员识别出 2,548 个词语、短语和句式,它们在 Opus 5.5 中的使用频率至少是人类作者的两倍。
这一结果让 Anthropic 关于 Opus 5.5 沟通方式更自然的说法变得更复杂。它的词汇确实明显更接近人类写作,但数千项统计差异依然存在。该模型并未失去自己的语言指纹,而是以一组新的偏好取代了若干熟悉的习惯。
OpenAI 的 GPT-6 Astra 则呈现出另一种截然不同的模式。它更常为论断添加限定,并倾向于采用纠偏式表述;而 Opus 则偏爱最高级和强调重要性的声明。这样的比较使 AI 写作检测成为一个不断变化的目标。每个模型版本都会改变编辑、教师和读者自认为能够识别的证据。
23 倍的偏好揭示了新的 Opus 模式
最新的 Claude Opus 5.5 写作特征,是因重复使用而显得不同寻常的普通词汇。
Graphite 在 Anthropic 于 2026 年 9 月 22 日发布该模型后,公布了其 Opus 5.5 更新报告。这项研究扩展了此前针对十个 AI 模型和一组人类对照文本的分析。
研究人员选取了 9,974 个主题,每个模型和人类语料库都对应一篇相关文章。人类文章均发布于 ChatGPT 推出之前,从而降低了样本中含有未标注生成式 AI 内容的可能性。
每个模型都获得一份摘要,并就同一主题生成一篇新文章。这种方法减少了主题差异,但无法消除由提示词或来源选择造成的所有影响。
随后,研究人员比较了按篇幅标准化后的词语和短语频率。他们还研究了框架句式,即带有空位、可容纳最多三个词的重复语言模式。
按照 Graphite 的定义,某种特征在 AI 写作中的出现频率至少是人类文本集的两倍,才会被视为写作特征。频率筛选会排除仅出现在少数文档中的表达。
这项AI 写作研究发现了 2,548 个 Opus 5.5 写作特征。这一数量仅比 Opus 5 记录的 2,666 个少 4%。
“可靠”以人类使用频率的 23 倍,位居该模型评价性形容词之首。“稳定”出现频率为 11 倍,“周到”为 9 倍,“有意义”则达到人类频率的 8 倍。
这些词本身并不天然带有人工痕迹。人类作者完全可以合理地称一项服务可靠,或形容某个回应周到。它们的价值体现在整体行为中,而非孤立出现的场景。
过渡性语言也很有辨识度。“展望未来,……”的出现频率是人类的 40 倍。“增添了另一层含义”达到 27 倍,“接下来会发生什么”达到 24 倍。
Opus 5.5 还保留了对对比表达的偏好。句式“is more than a _ it”在该模型中的出现频率是人类文章的 98 倍。“Rather than simply”的频率则是人类的 32 倍。
其最显著的类别涉及强调重要性。“This matters”的出现频率是人类文本集的 116 倍。“Why _ matters”的频率则高达 92 倍。
这些数字并不意味着每篇 Opus 文章都包含这些短语。它们描述的是大型受控语料库中的相对频率。当人类几乎从不使用某个罕见短语时,即便该短语本身也不常见,也可能产生很高的比率。
对于任何想把单一表达视为证据的人而言,这一区别很重要。该研究描绘的是群体层面的习惯,并不能为某一段落、电子邮件或学生论文提供可靠的作者归属判断。
更站得住脚的结论更为有限。Opus 5.5 在将摘要转化为文章时,反复使用某些评价性和组织性短语。即使经历重大风格修订,这些偏好依然可见。
熟悉的 AI 写作特征已经过时
破折号不再是有用的捷径,因为模型行为变化得比流行的检测建议更快。
多年来,读者一直将破折号视为生成文本的非正式标志。这种标点符号因 Claude 早期版本频繁使用而与其联系在一起。
Opus 5.5 基本放弃了这一习惯。Graphite 测得其每 1,000 个词仅使用 0.015 个破折号,而 Opus 5 为 2.92 个。这意味着下降了约 99%。
另一项评估得出了方向相似的结果。一名 Arize 研究人员使用 Opus 5.5 生成了 57,000 个词,仅发现两个破折号。他的 Opus 5 样本则每 1,000 词出现 12.9 个。
这项规模较小的独立写作测试使用了涵盖五种体裁和五个主题领域的 20 份固定简报。研究人员先手动标记了 153 个样本,随后构建自动化评估器。
该数据集远小于 Graphite 的语料库,但它直接将 Anthropic 修订后的模型与其前代进行了测试。测试发现,其他可识别的“Claudisms”大约减少了一半,而非彻底消失。
这种变化带来了令人不安的逆转。如今,使用当前前沿模型很少采用的标点符号的人类作者,反而可能面临怀疑。
模型开发者可通过后训练、系统指令或生成输出偏好来压制显眼的习惯。用户也可以在提示词中用一句话要求使用不同的标点方式。
这使表层线索变得脆弱。“Delve”、破折号、整齐的三段式列表和精致的结尾,都可以描述一种风格,但没有任何一种能确立作者身份。
同样的问题也会影响商业 AI 检测器。经过昨日模型训练的分类器,可能在提供商改变输出行为后失去准确性。底层模型或许仍保留相同名称,但其风格会随更新而变化。
误报会带来真实后果。教师可能指控一名本就习惯正式文风的学生。编辑可能为了避免自动化怀疑,而抹平投稿人具有辨识度的标点风格。
漏报同样很容易制造。用户可以要求不规则的句长、删除偏好的短语,或让第二个模型改写第一个模型的输出。人工编辑可以抹去明显模式,而不改变文本的来源。
实际可行的应对方式,是综合评估来源链路、事实依据和修订历史。风格证据可以促使人们进行更严格的审查,但不应单独决定结论。
对于专业团队而言,这意味着应保留来源笔记和草稿。一套可检索的个人知识库可以帮助将论断与其证据关联起来,并记录一份文档如何演变。
这一工作流应对的是实际的质量风险。未披露的 AI 使用可能很重要,但缺乏依据的论断和责任缺失通常会造成更大的运营问题。
因此,Graphite 的发现削弱了简单检测规则的合理性,同时强化了流程证据、编辑审查和透明政策的重要性。
Anthropic 改进了风格,却未抹去指纹
Opus 5.5 在统计意义上更接近人类写作,但保留了与 Opus 5 几乎同样多的可测量特征。
Anthropic 在推出 Opus 5.5 时直接提出了沟通能力方面的主张。该公司称,该模型写作更自然,将重要信息置于首位,并减少了术语和特异化表达。
据报道,早期测试者认为其文本更清晰、更易于理解。Anthropic 还将更好的沟通视为一项安全优势,因为读者可以更轻松地审查模型的工作。
Graphite 的结果在一定程度上支持了这一立场。研究人员使用 Jensen-Shannon 散度衡量词汇分布差异,这是一种比较两个概率分布的统计指标。
得分为零意味着词语使用完全相同。得分为一则意味着二者完全没有重叠。
Opus 5 相对于人类写作的得分为 0.064。Opus 5.5 降至 0.052,减少了 19%。这意味着其整体词汇分布更接近人类语料库。
该模型在“矫饰性文风”方面也有所改善。Anthropic 将其定义为以修辞或隐喻替代直接陈述的语言。Graphite 报告称,Opus 5.5 的得分为 10.57,比 Opus 5 的 16.75 低 37%。
人类文章得分为 6.65,GPT-6 Astra 为 7.91。因此,Opus 虽然明显进步,但仍比两组对照更显矫饰。
对矫饰性文风结果需要谨慎解读。Graphite 使用 Claude Opus 5 本身,对 1,000 个匹配主题的子样本按零到 100 的量表进行评分。
评估器不知道每篇文章由哪个模型生成。即便如此,其判断反映的仍是另一个模型的解释,而非机械测量。
特征数量构成了核心张力。Opus 5.5 的整体词汇相似度更高,但其 2,548 个特征仅比 Opus 5 的总数少 4%。
这些结果衡量的是不同属性。分布相似度关注整个词汇表与人类写作的比较;特征计数则关注有多少具体模式跨过频率阈值。
模型可以改善第一项指标,而不消除第二项。广泛的词汇选择可以更像人类,而狭窄的习惯仍可能高度集中。
Anthropic 的Opus 5.5 公告还强调了更强的知识工作表现。在一项内部研究任务中,18 份报告中有 16 份在不同投入设置下通过了严格质量阈值。
Anthropic 表示,虚构的数字或引语会导致报告不合格。该公司称,早期的 Opus 和 Fable 模型在任何一次尝试中都未通过这一标准。
这些内部结果之所以相关,是因为自然的文本表达和可靠的研究工作是不同维度。重复的短语并不意味着报告在事实上出错,听起来像人类的语言也不代表论断准确。
该公司更广泛的论点关乎可用性。更清晰的写作即使仍让编辑识别出反复出现的风格模式,也能减少审查时间。
Graphite 的研究并未否定这一改进,而是为其划定了边界。Opus 5.5 在整体上似乎更像人类,但“更像人类”并不等于无法区分。
Opus 和 Astra 留下不同的语言指纹
关键竞争并非人类文本与一种固定 AI 风格之间的较量,而是不断变化的模型指纹与稳定检测假设之间的较量。
GPT-6 Astra 并非只是比 Opus 5.5 表现更好或更差,它展现出了一组不同的习惯。
Astra 更常为论断添加限定。“May provide”在 Astra 中的出现频率是 Opus 5.5 的 18 倍。“Not necessarily”的频率则是 17 倍。
“Does not establish”呈现出更大的差异,达到 Opus 5.5 使用频率的 275 倍。这些模式表明,Astra 经常通过明确限制来保护一项论断。
Opus 5.5 则更倾向于使用最高级。与 Astra 相比,它使用“the most popular”的频率高出 45 倍,使用“the most powerful”的频率高出 24 倍。
“Perhaps the most”的出现频率高出 29 倍。句式“one of the best _ about”则达到 Astra 使用频率的 79 倍。
这种反差影响了语气。Astra 可能显得更谨慎或更具纠偏意味。Opus 则可能更偏向评估性、也更自信,尤其是在强调重要性时。
Graphite CEO Ethan Smith 将这种模式描述为差异,而非稳定的进步。每一代新模型可能在某一维度上有所提升,同时形成另一种可辨识的表达节奏。
相关行业报道也得出了相同结论。一项模型对比指出,该研究在同样的 9,974 个主题上评估了十个模型。
Opus 5.5 的词汇分布更接近人类。Astra 则偏离得更远,从 GPT-5.6 Sol 的 0.101 升至 0.109。
然而,Astra 生成的文本比 Opus 少一些矫饰感。这使得基于单一分数进行简单排名并不可行。
有用户可能偏好 Astra 的直接,却不喜欢它的过度谨慎。另一些人则可能更喜欢 Opus 的流畅度,但会在编辑时删去不必要的最高级表述。
这些发现也让模型归因变得更复杂。一段文字可能带有与多个系统相关的特征,因为用户会在同一工作流中组合使用多种工具。
一个模型可能负责研究,另一个负责起草,第三个则负责编辑。随后,人类还可能在发布前修订结果。
提示词又增加了一层变量。明确禁用某个短语会改变其出现频率。要求采用谨慎的科学语言,可能使 Opus 在某一维度上更像 Astra。
微调系统和应用层指令会造成更多差异。用户看到的输出可能同时反映了提供商的模型、应用的系统提示词以及用户的请求。
这正是为什么“AI 风格”这一说法已显得过于宽泛。前沿模型不再共享一种稳定的声音,即便它们仍会重复一些熟悉的结构。
竞争压力同时落在模型实验室和 AI 检测厂商身上。实验室希望文本能够适应用户意图。检测厂商则需要能够经受快速模型迭代考验的系统。
编辑也面临另一重压力。他们必须区分无害的文风重复,以及损害准确性、清晰度或可信度的缺陷。
一句“这很重要”或许令人厌烦,但并不因此自动成为错误。带有虚构来源的一句优雅表述,问题则严重得多。
有用的教训并非寻找某一个替代性特征,而是认识到生成文本带有不断变化的统计特征;其中没有任何一项应取代编辑判断。
该研究无法识别单篇文本的作者
Graphite 衡量的是语料库层面的差异,而不是针对单篇文档或作者的法证测试。
该研究的规模使其总体发现颇具说服力。但其设计也限制了这些发现应如何被使用。
首先,该实验聚焦于根据摘要生成文章。它并不能自动描述电子邮件、小说、法律分析、课堂论文或日常对话。
不同任务会改变模型的语言。技术报告天然可能包含更多限定语。营销文案天然可能包含更多最高级表述。
其次,人类对照文章早于 ChatGPT。这样可以避免基线受到明显污染,但也引入了时间差异。
编辑规范会变化。搜索优化会变化。出版商会调整标题结构、段落长度和偏好的标点方式。
一些归因于模型的差异,可能部分反映了当代写作环境。Graphite 的主题匹配设计减少了内容偏差,但无法消除所有历史差异。
第三,频率比可能夸大罕见行为。如果人类几乎从不使用某个短语,模型即便只是少量使用,也可能产生显著的倍数。
研究人员采用最低频率要求来应对这一问题。在一种排名视图中,词语需要至少出现在 500 篇模型文章中;其他分析则使用各自的阈值。
即便有这些筛选条件,比率仍需结合基准频率解读。“这很重要”的使用频率达到人类的 116 倍,听起来具有决定性,但这并未说明该短语每篇文章实际出现多少次。
第四,结果反映的是特定模型版本和实验设置。提供商更新、推理设置、系统提示词和用户指令都可能改变输出。
第五,该研究来自营销与增长公司 Graphite,而非独立学术实验室。其研究人员公开了底层特征数据和原始文章,这有助于外部审查。
独立复现仍然很有价值。研究人员应测试其他文类、语言、提示词设计和人类基线,也应同时报告绝对频率和相对比率。
早期的 Arize 测试提供了一项有用对照。它支持了破折号使用大幅减少的结论,同时发现更广泛的文体习惯仍然存在。
不过,其 20 份简报无法验证近 10,000 个对齐主题得出的每一项结果。两个项目采用了不同设计,回答的也是不同问题。
最严谨的外部报道始终清楚划定这些边界。最初的写作特征报道描述了模型习惯,但并未声称任何短语能够证明 AI 作者身份。
读者也应保持同样的克制。一个可疑短语可以促使人提出问题,但无法单独回答这个问题。
对出版商而言,更可靠的审查方式是核查主张是否有来源、引文是否与原文一致、结论是否由证据推出,也要确认谁对最终文本承担责任。
对学校而言,作者身份政策应在争议发生前明确界定可接受的辅助方式。草稿历史、引用和口头追问,比标点或词汇本身更能提供有力证据。
对企业而言,披露规则应与风险相匹配。常规内部摘要不需要与医疗建议、金融分析或公开报道同等严格的控制。
该研究揭示的是倾向,而非罪责。将其当作检测器,会把审慎的描述性研究变成不可靠的执法工具。
三项信号将揭示这些新特征能否持续
接下来的考验是:Opus 5.5 当前的指纹特征能否经受复现、用户提示和下一次模型更新。
第一项信号是独立复现 Graphite 的结果。研究人员需要使用不同提示词、文类和人类样本生成可比语料库。
如果“可靠”、“这很重要”以及对比框架依然保持较高频率,那么 Opus 5.5 存在持久特征的证据将更充分。如果它们会因微小的提示词变化而消失,那么它们就是较弱的归因信号。
第二项信号是 Anthropic 改变模型语言的速度。该公司显然已对外界对 Opus 5 沟通风格的批评作出回应。
后续更新可能会像 Opus 5.5 大幅减少破折号那样,显著削弱当前的特征。这将证明显而易见的文体特征属于可调整的产品行为。
第三项信号是检测厂商是否发布针对特定版本的评估。检测器应在当前模型、人类与 AI 混合工作流以及经编辑的输出上接受测试。
准确率声明还需要涵盖不同写作群体的误报率。非英语母语写作者、技术专家和使用正式文风的人,不应成为附带受害者。
更有价值的未来或许在于溯源,而非语言猜测。经过签名的生成记录、保留的草稿和明确披露,能够在不假装仅凭文本就能揭示来源的前提下建立过程证据。
对写作者而言,眼下的行动很简单:在草稿中搜索重复的评价性词语、套路化对比、不必要的最高级表述,以及那些宣告重要性却未加以证明的句子。
然后核实每一项事实主张。删除缺乏依据的自信表述。只有当不寻常的标点确实服务于句子时才保留它,而不是为了避免怀疑而将其删除。
Claude Opus 5.5 的写作特征提供了一份有价值的编辑检查清单,但它们不是最终裁决。出版商会利用这些发现改进审查,还是会将另一种暂时模式变成不可靠的捷径?



