Claude Opus 5.5の文体的特徴は変化したが、消えたわけではない
Anthropicによる文体の刷新後も、Claude Opus 5.5の文体的特徴は残った。モデルによるエムダッシュの使用は99%減少したにもかかわらずだ。現在最も強いシグナルは「dependable」で、モデルが執筆した記事では、比較対象となる人間の執筆物より23倍多く使われていた。
この知見は、9,974件の対応するトピックを扱った記事についてGraphiteが分析した結果によるものだ。研究者らは、Opus 5.5が人間のライターより少なくとも2倍の頻度で使用した単語、フレーズ、文パターンを2,548件特定した。
この結果は、Opus 5.5がより自然にコミュニケーションできるというAnthropicの主張を複雑にする。その語彙は測定可能なほど人間の文章に近づいたが、数千に及ぶ統計的な差異は残った。モデルは言語的な指紋を失ったのではない。馴染み深い複数の癖を、新たな選好の集まりへと置き換えた。
OpenAIのGPT-6 Astraは、また異なるパターンを示した。主張により頻繁に限定を加え、訂正的な枠組みに依拠する一方、Opusは最上級表現や重要性を宣言する表現を好んだ。この比較により、AI文章の検出は動く標的の問題となる。モデルの各バージョンは、編集者、教師、読者が認識できると考える証拠を変えていく。
23倍の選好が新たなOpusのパターンを明らかにした
最新のClaude Opus 5.5の文体的特徴は、反復によって異様に見えるありふれた単語だ。
Graphiteは、Anthropicが2026年9月22日にモデルを公開した後、Opus 5.5のアップデートを発表した。この研究は、10のAIモデルと人間の対照コレクションを対象とした先行分析を拡張したものだ。
研究者らは、すべてのモデルと人間コーパスに対応する記事がある9,974のトピックを使用した。人間の記事はChatGPTの公開前に発表されたものであり、これらのサンプルに表示されない生成AIの出力が含まれる可能性を低減した。
各モデルには要約が与えられ、同じ主題に関する新しい記事を生成させた。この手法はトピックの差異を抑えたが、プロンプトや情報源の選択による影響をすべて取り除くことはできなかった。
研究者らは次に、長さで正規化した単語とフレーズの頻度を比較した。また、最大3語を含みうる空欄を持つ、反復される言語パターンであるフレームも調べた。
Graphiteの定義では、AI文章において人間のコレクションの少なくとも2倍の頻度で現れる特徴を「tell」とする。頻度フィルターにより、ごく少数の文書にしか現れない表現は除外される。
その結果、AI文章に関する研究では、Opus 5.5の特徴が2,548件見つかった。これはOpus 5で記録された2,666件をわずか4%下回るだけだった。
「Dependable」は、人間の頻度の23倍でモデルの評価的形容詞の先頭に立った。「Steady」は11倍、「thoughtful」は9倍、「meaningful」は人間の頻度の8倍に達した。
これらの単語自体が人工的なわけではない。人間のライターも、サービスをdependableと呼んだり、回答をthoughtfulと表現したりすることは妥当だ。その価値は孤立した出現ではなく、集計された行動にある。
移行を示す言葉遣いも特徴的だった。「Looking ahead the」は人間の頻度の40倍で現れた。「Adds another layer」は27倍、「what comes next」は24倍に達した。
Opus 5.5は対比を好む傾向も維持した。「is more than a _ it」というパターンは、人間の記事より98倍多く現れた。「Rather than simply」は人間の頻度の32倍だった。
最も強いカテゴリーは、重要性を示す表現だった。「This matters」は人間のコレクションの116倍、「Why _ matters」は92倍現れた。
これらの数値は、すべてのOpus記事にこうしたフレーズが含まれることを意味しない。大規模で統制されたコーパス全体での相対頻度を表している。人間がほとんど使わない珍しいフレーズは、大きな比率を生むことがある。
この区別は、単一の表現を証拠として扱いたくなる人にとって重要だ。この研究は集団レベルの習慣を示している。1段落、メール、学生のエッセイについて、信頼できる著者判定を提供するものではない。
より妥当な結論は限定的だ。Opus 5.5は、要約を記事へ変換する際に、特定の評価的・構成的フレーズを繰り返し用いる。その選好は、大規模な文体改訂の後でも可視化されたままだ。
よく知られたAI文章の特徴はすでに時代遅れだ
モデルの挙動は一般的な検出アドバイスより速く変化したため、エムダッシュは有用な近道ではなくなった。
数年間、読者はエムダッシュを生成テキストの非公式な印と見なしてきた。この句読点は、以前のバージョンが頻繁に使っていたことからClaudeと結び付けられるようになった。
Opus 5.5は、その習慣をほぼ放棄した。Graphiteは、1,000語当たりのエムダッシュを0.015本と測定したのに対し、Opus 5では2.92本だった。これは約99%の減少に相当する。
別の評価でも、同様の方向性を示す結果が得られた。Arizeの研究者はOpus 5.5で57,000語を生成し、エムダッシュはわずか2本だったと報告した。Opus 5のサンプルでは1,000語当たり12.9本が生成された。
このより小規模な独立した文章テストでは、5つのジャンルと5つの主題分野にまたがる20件の固定ブリーフを用いた。研究者は自動評価器を構築する前に、153例を手作業で記録した。
データセットはGraphiteのコーパスよりはるかに小さいが、Anthropicが改訂したモデルを前モデルと直接比較した。他の認識可能な「Claudism」は消滅するのではなく、おおむね半減したことが分かった。
この変化は不都合な逆転を生む。現在の最先端モデルがほとんど使わない句読点を用いることで、人間のライターが疑いをかけられるリスクが生じるのだ。
モデル開発者は、ポストトレーニング、システム指示、生成出力の選好を通じて、明白な癖を抑制できる。ユーザーもプロンプトの一文で異なる句読点を求められる。
このため、表面的な手掛かりは脆弱だ。「Delve」、エムダッシュ、整った3項リスト、洗練された結論は、ある文体を表すことはできる。しかし、どれも著者性を立証するものではない。
同じ問題は商用AI検出器にも影響する。昨日のモデルで訓練された分類器は、提供者が出力挙動を変えた後に精度を失う可能性がある。基盤モデルは同じ名前のままでも、アップデートによって文体が変化しうる。
誤検知は現実的な結果を伴う。教師は、もともとフォーマルな散文を書く学生を非難するかもしれない。編集者は自動化された疑念を避けるため、寄稿者特有の句読点を平板化するかもしれない。
見逃しも同様に容易に生み出せる。ユーザーは不規則な文長を求め、好まれるフレーズを削除し、別のモデルに最初の出力を書き換えさせることができる。人間による編集は、テキストの出自を変えずに明白なパターンを消去できる。
実務的な対応は、出所、事実的裏付け、改訂履歴を合わせて評価することだ。文体的な証拠は精査を促すことはできるが、それだけで判断を下すべきではない。
プロフェッショナルなチームにとっては、情報源のメモと下書きを保存することを意味する。検索可能なパーソナルナレッジベースは、主張とその証拠を結び付け、文書がどのように発展したかを記録する助けになる。
このワークフローは、実際の品質リスクに対処する。開示されていないAI利用は重要になりうるが、裏付けのない主張と説明責任の欠如の方が、通常はより大きな運用上の問題を生む。
したがってGraphiteの知見は、単純な検出ルールの根拠を弱める。その一方で、プロセスの証拠、編集レビュー、透明な方針の必要性を強める。
Anthropicは文体を改善したが、指紋を消去したわけではない
Opus 5.5は統計的に人間の文章へ近づいた一方、Opus 5とほぼ同数の測定可能な特徴を保持した。
Anthropicは、コミュニケーションに関する直接的な主張とともにOpus 5.5を導入した。同社は、このモデルがより自然に書き、重要な情報を先に置き、専門用語や特異な言い回しをより避けると述べた。
初期のテスターは、この散文がより明瞭で追いやすいと報告したとされる。Anthropicは、読者がモデルの作業をより容易に確認できるため、コミュニケーションの改善は安全性の利点でもあると位置付けた。
Graphiteの結果は、この見解を部分的に支持している。研究者らは、2つの確率分布を比較する統計量であるJensen-Shannon divergenceを用いて、単語分布の乖離を測定した。
スコアがゼロなら、単語の使用は同一であることを示す。スコアが1なら、重なりがないことを示す。
Opus 5は人間の文章に対して0.064を記録した。Opus 5.5は0.052まで低下し、19%の減少となった。これは、全体的な単語分布が人間のコーパスへ近づいたことを意味する。
モデルはまた、Anthropicが直接的な記述の代わりに装飾や比喩を用いる言語と定義する「mannered prose」でも改善した。Graphiteは、Opus 5.5のスコアを10.57と報告しており、Opus 5の16.75から37%低下している。
人間の記事は6.65、GPT-6 Astraは7.91だった。したがってOpusは大幅に改善したが、比較対象のどちらよりもなお装飾的な文体だった。
mannered-proseの結果には慎重な解釈が必要だ。Graphiteは、対応する1,000トピックのサブサンプルを、ゼロから100の尺度で採点するためにClaude Opus 5自体を用いた。
評価器は、各記事をどのモデルが作成したかを知らなかった。それでも、その判断は機械的な測定ではなく、別のモデルによる解釈を反映している。
特徴の数が中心的な緊張を生み出す。Opus 5.5は全体的な語彙類似性で改善したが、その2,548件の特徴はOpus 5の合計よりわずか4%少ないだけだった。
これらの結果は異なる性質を測定している。分布類似性は、語彙全体が人間の文章とどのように比較されるかを問う。特徴数は、どれだけ多くの特定パターンが頻度の閾値を超えるかを問う。
モデルは、後者をなくさずに前者を改善できる。広範な語彙選択はより人間らしくなっても、狭い習慣は依然として強く集中して残りうる。
AnthropicのOpus 5.5発表では、ナレッジワークにおけるより強い性能も強調された。社内のある調査タスクでは、異なる努力設定において18件中16件のレポートが厳格な品質基準を満たした。
Anthropicによると、作り上げた数値や引用が1つでもあれば、そのレポートは不合格となる。以前のOpusモデルとFableモデルは、どの試行でもこの基準を満たさなかったという。
自然な散文と信頼できる調査は別の次元であるため、こうした社内結果は関連性がある。反復的なフレーズがレポートを事実として誤らせるわけではない。人間らしく聞こえる言葉が、主張を正確にするわけでもない。
同社のより広い主張は使いやすさに関するものだ。編集者が繰り返される文体パターンを識別できる場合でも、より明瞭な文章はレビュー時間を短縮できる。
Graphiteの研究はその改善を否定していない。その範囲に境界を設けている。Opus 5.5は集計上より人間らしく見えるが、「より人間らしい」は区別不能と同義ではない。
OpusとAstraは異なる言語的指紋を残す
重要な競争は、人間の散文と固定された1つのAI文体の対立ではなく、変化するモデルの指紋と安定した検出前提の対立だ。
GPT-6 Astraは、Opus 5.5より単純に優れている、あるいは劣っているというわけではなかった。異なる習慣の集合を示した。
Astraは、より頻繁に主張へ限定を加えた。「May provide」はAstraでOpus 5.5の18倍、「not necessarily」は17倍の頻度で現れた。
「does not establish」というフレーズはさらに大きな差を示し、Opus 5.5の275倍に達した。これらのパターンは、Astraが明示的な制限によって主張を保護することが多いことを示唆している。
Opus 5.5は最上級表現により強く依拠した。Astraと比べ、「the most popular」は45倍、「the most powerful」は24倍使われた。
「Perhaps the most」は29倍の頻度で現れた。「one of the best _ about」というフレームは、Astraの79倍に達した。
その対照は文体のトーンにも影響する。Astraは慎重、あるいは訂正的に聞こえることがある。Opusは、とりわけ重要度を位置づける際に、より評価的で自信に満ちた印象を与えやすい。
GraphiteのCEOであるEthan Smithは、この傾向を着実な進歩ではなく違いとして説明した。新しいモデルは、ある側面で優れる一方、別の認識可能なリズムを身につける場合がある。
報じられた業界記事も同じ結論に至った。モデル比較では、この研究が同じ9,974のトピックで10モデルを評価したことが指摘されている。
Opus 5.5の単語分布は人間に近づいた。一方、Astraは人間から遠ざかり、GPT-5.6 Solの0.101から0.109へ上昇した。
それでも、AstraはOpusよりも作為的でない文章を生成した。このため、単一のスコアに基づく単純な順位付けは成り立たない。
あるユーザーはAstraの率直さを好む一方で、その慎重すぎる表現を嫌うかもしれない。別のユーザーはOpusの流れを好みつつ、編集時に不要な最上級表現を削るかもしれない。
この調査結果は、モデルの帰属判断も複雑にする。ユーザーが一つのワークフローで複数のツールを組み合わせるため、文章には複数のシステムに関連する特徴が含まれ得る。
あるモデルが調査を行い、別のモデルが下書きを作成し、三つ目が編集することもある。その後、人間が公開前に結果を修正する可能性もある。
プロンプトも別の層を加える。あるフレーズを明示的に禁止すれば、その出現頻度は変わり得る。慎重な科学的表現を求めれば、ある側面ではOpusがAstraに似る可能性がある。
ファインチューニングされたシステムやアプリケーションレベルの指示も、さらなる変動を生む。ユーザーに見える出力には、提供元のモデル、アプリケーションのシステムプロンプト、そしてユーザーの要求が反映されている可能性がある。
これが、「AIの文体」という表現が広すぎるものになった理由だ。最先端モデルは、よく知られた構造を一部繰り返していても、もはや一つの安定した声を共有していない。
競争圧力は、モデル研究所とAI検出ベンダーの双方にかかっている。研究所はユーザーの意図に適応する文章を求める。検出ベンダーには、急速なモデル変更に耐えられるシステムが必要だ。
編集者にも別の圧力がある。無害な文体上の反復と、正確性、明瞭さ、信頼を損なう欠陥とを見分けなければならない。
「これは重要だ」と述べる文は退屈かもしれないが、自動的に誤りになるわけではない。架空の情報源を含む洗練された文のほうが、はるかに深刻だ。
有用な教訓は、一つの代替的な兆候を探すことではない。生成された文章には変化する統計的シグネチャが伴うこと、そしてそれらのどれも編集上の判断に取って代わるべきではないことを認識することだ。
この研究は、単一の文章を書いた人物を特定できない
Graphiteが測定したのはコーパスレベルの差異であり、個々の文書や著者に対する法科学的な検査ではない。
研究の規模は、その集計的な知見に説得力を与える。同時に、その設計は知見の利用方法に制約を課している。
第一に、この実験は要約からの記事生成に焦点を当てた。メール、小説、法的分析、授業のエッセイ、あるいはカジュアルな会話を自動的に説明するものではない。
タスクが異なれば、モデルの言語も変わる。技術レポートには当然、より多くの限定表現が含まれるかもしれない。マーケティングコピーには、当然、より多くの最上級表現が含まれるかもしれない。
第二に、人間による対照記事はChatGPT以前のものだった。これによりベースラインは明白な混入から守られるが、時間差も導入される。
編集上の慣習は変化する。検索最適化も変化する。出版社は見出し構造、段落の長さ、好まれる句読点を変える。
モデルに帰属された差異の一部は、現代の執筆環境を部分的に反映している可能性がある。Graphiteのトピックを対応させた設計は内容上のバイアスを減らすが、あらゆる歴史的差異を消すことはできない。
第三に、頻度比はまれな行動を誇張し得る。人間があるフレーズをほとんど使わない場合、モデルによる比較的少数の使用でも目を引く倍率になり得る。
研究者らはこの問題に対処するため、最低頻度の要件を適用した。ある順位付けの分析では単語が少なくとも500本のモデル記事に出現する必要があり、ほかの分析では独自の閾値が用いられた。
こうしたフィルターがあっても、比率には基準となる出現率が必要だ。「これは重要だ」が人間の出現率の116倍というのは決定的に聞こえるが、記事ごとにそのフレーズがどの程度現れたかは示していない。
第四に、結果は特定のモデルバージョンと実験設定を反映している。提供元の更新、推論設定、システムプロンプト、ユーザー指示はいずれも出力を変え得る。
第五に、この研究は独立した学術研究機関ではなく、マーケティングおよびグロース企業であるGraphiteによるものだ。同社の研究者は基礎となるtellsデータと生の記事を公開しており、これは外部からの検証を支えている。
独立した再現研究には依然として価値がある。研究者は別のジャンル、言語、プロンプト設計、人間のベースラインを検証すべきだ。また、相対比と並べて絶対頻度も報告すべきである。
初期のArizeテストは、有用な比較を一つ提供している。これはem dashの大幅な減少を支持する一方、より広範な文体上の習慣は残っていることを示した。
ただし、20件のブリーフでは、約10,000の対応トピックから得られたすべての結果を検証できない。両プロジェクトは異なる設計を用い、異なる問いに答えている。
最も堅実な外部報道は、こうした境界を明確に保っている。元のwriting-tells報道は、いずれかのフレーズがAIによる著作を証明すると主張せず、モデルの習慣を説明した。
読者も同じ慎重さを適用すべきだ。不審なフレーズは疑問を持つきっかけにはなる。しかし、それ単独でその疑問に答えることはできない。
出版社にとって、より信頼できるレビューでは、主張に情報源があるか、引用が原文と一致するか、結論が証拠から導かれているかを問う。また、最終テキストに誰が責任を負うのかも問う。
学校にとって、著者性に関する方針は、紛争が起こる前に許容される支援を定義すべきだ。下書き履歴、引用、口頭での追跡確認は、句読点や語彙だけよりも強い証拠を提供する。
企業にとって、開示ルールはリスクに見合うべきだ。日常的な社内要約に、医療ガイダンス、財務分析、公開報道と同じ統制は必要ない。
この研究が示すのは傾向であり、有罪ではない。これを検出器として扱えば、慎重な記述的研究を信頼できない執行ツールへと変えてしまう。
新たな特徴が続くかどうかを示す三つのシグナル
次の検証点は、Opus 5.5の現在のフィンガープリントが、再現研究、ユーザープロンプト、次回のモデル更新を経ても残るかどうかだ。
第一のシグナルは、Graphiteの結果が独立して再現されることだ。研究者は異なるプロンプト、ジャンル、人間のサンプルを使い、比較可能なコーパスを生成する必要がある。
「dependable」、「this matters」、そして対比フレームが高いままなら、持続的なOpus 5.5シグネチャの根拠は強まる。小さなプロンプト変更で消えるなら、それらは弱い帰属シグナルである。
第二のシグナルは、Anthropicがモデルの言語をどれほど速く変更するかだ。同社はOpus 5のコミュニケーションスタイルに対する批判に明確に応答した。
後の更新で、Opus 5.5がem dashを減らしたのと同じほど急激に、現在の特徴が減る可能性がある。それは、目に見える文体的特徴が調整可能な製品上の振る舞いであることを裏づけるだろう。
第三のシグナルは、検出ベンダーがバージョン固有の評価を公開するかどうかだ。検出器は、現行モデル、人間とAIが混在するワークフロー、編集済みの出力でテストされるべきだ。
精度に関する主張には、異なる執筆コミュニティにまたがる偽陽性率も必要である。英語を母語としない執筆者、技術専門家、格式ばった文体を使う人々が、巻き添えになるべきではない。
より有用な将来は、言語的な推測ではなく来歴情報に関わるものかもしれない。署名付きの生成記録、保存された下書き、明確な開示は、文章だけでその起源が分かると装うことなく、プロセスを確立できる可能性がある。
執筆者にとって、すぐに取るべき行動は単純だ。下書きから、反復される評価語、決まり文句の対比、不必要な最上級表現、実証する代わりに重要性を宣言する文を探す。
次に、すべての事実上の主張を検証する。根拠のない自信を取り除く。疑いを避けるために削除するのではなく、文に役立つ場合は変わった句読点を残す。
Claude Opus 5.5のwriting tellsは価値ある編集チェックリストを提供するが、判定ではない。出版社はこの知見をレビューの改善に使うのか、それとも別の一時的なパターンを信頼できない近道に変えるのか。



