top of page

ClaudeがADHDの思考整理で優位に立ち、AnthropicとGoogleの競争はより身近なものに

散らかった、きわめて個人的な課題――ライターが書き出したADHDにまつわる思考の断片を整理すること――を軸にした4チャットボットのテストで、AnthropicはGoogle、OpenAI、Microsoftを上回った。

元の比較記事では、ChatGPT、Gemini、Claude、Copilotに対し、整然とした段落としては出てこない思考に秩序を与えるよう求めた。報道によると、Claudeはライターが最も役立つと感じた回答を示したという。

この結果だけで、普遍的な順位が決まるわけではない。対象は1人、1種類のタスクであり、扱いやすいと感じたものについての主観的な判断だった。それでもこのテストは、AnthropicとGoogleの競争における重要な分岐点を浮き彫りにしている。

最も役立つアシスタントは、必ずしも機能一覧が最も充実しているものでも、ベンチマークのスコアが最も高いものでもなかった。回答を理解し、行動に移すために必要な作業を最も減らしたアシスタントだった。

ADHDの人にとって、この違いは重要だ。ADHDは注意、計画、ワーキングメモリー、タスク管理に影響を及ぼすことがあるが、その現れ方は大きく異なる。米国立精神衛生研究所による臨床的な概要も、診断と治療は有資格の専門家に委ねるべきだと強調している。

AIアシスタントがそのようなケアを提供することはできない。しかし、言いたいことは分かっている一方で、それを実用的な流れにまとめるのが難しい人に対し、情報を再構成する支援はできる。

この限定的なユースケースは、このチャットボット比較に、また一つの人工的なランキング以上の重みを与えている。アシスタントが、認知的な混乱を新たな混乱の層を生まずに外部の構造へ変換できるかを試しているからだ。

Claudeは多くのAIベンチマークが見落とすテストで勝った

意味のある変化は新モデルのリリースではなかった。主要な4つのアシスタントが、整理されていない思考をより扱いやすくできるかを試したことだった。

従来のAI評価は、測定可能な答えがある問いに焦点を当てる。研究者はコーディング課題、数学問題、事実の正確性、レイテンシー、指示への追従度を採点できる。個人的な思考の断片を整理することには、唯一の正解がない。

そのためライターの判断は、実用的な性質に依存した。回答は優先順位を特定したか。ライターの意図を保ったか。迷わずにざっと確認できるか。もっともらしい次の行動を生み出したか。

これらの問いは、情報アーキテクチャ、つまりコンテンツをどうグループ化し、ラベル付けし、並べるかを試すものでもある。また、アシスタントがどれほどの解釈作業をユーザーに返すかも問うている。

回答は技術的に有能であっても、使いにくいことがある。長大な分類体系を作り、すべての詳細を繰り返し、励ましの言葉を加え、複数の計画手法を提示するかもしれない。それぞれを単独で見れば、役立ちそうに聞こえる。

しかし、そうした追加要素が重なると、認知負荷、すなわち一度に保持し処理しなければならない情報量を増やしかねない。結果として、ユーザーはアシスタントによる整理をさらに整理する必要が生じる。

報じられたClaudeの勝利は、このケースでよりよいバランスを見つけたことを示唆する。その回答は、ライターの思考により沿っており、外部の構造としてより有用に感じられたようだ。これは、単に洗練された要約を生成することとは異なる。

この違いは、ADHDに関連するワークフローの中心にある。重要な文脈を取り除けば、簡潔な回答でも失敗しうる。逆に、カテゴリーや選択肢、事前の手順を過剰に示せば、包括的な回答も失敗しうる。

最良の結果は、重要なものを保ちながら、始めるために必要な意思決定の数を減らす。密度の高い思考の断片を、優先事項、未解決の問い、次の行動といった少数の理解可能な要素へ変えるべきだ。

だからこそ、この比較を「Claudeが最も賢い」と単純化すべきではない。このテストは、一般知能、臨床的な有効性、長期的な生産性を測ったものではない。あるアシスタントの出力スタイルと、ある人のその時点での認知的ニーズとの適合を測ったものだ。

その適合は、なお価値ある証拠である。消費者向けAIの普及は、ベンチマーク表だけでなく、こうした反復的な瞬間を通じて進む。

モデルは、誰かが未完成の素材を託せるようになったときに役立つものになる。その素材には、断片的なアイデア、重複した懸念、感情的な文脈、相反する締め切り、明確なカテゴリーを持たないタスクが含まれることがある。

アシスタントは、不確実性が消え去ったふりをせずに構造を推測しなければならない。秩序を与えすぎれば、ユーザーの意図をゆがめる可能性がある。与えなさすぎれば、ユーザーは意味のある負担軽減を得られない。

報道によると、Claudeはテスト中にこの境界をよりうまく見極めた。この結果は、整理がニッチな文章作成機能ではなく、コアとなるインターフェースの課題になりつつあることから、すべての競合に圧力をかけている。

AnthropicとGoogleの競争は、いま認知的摩擦に左右される

AnthropicとGoogleの競争は、回答を受け取った後にユーザーが最も少ない修正作業で済むアシスタントはどれか、という点にますます集約されている。

Googleは、アカウント、地域、設定、製品構成に応じて、Geminiを大規模なサービス群や個人情報に接続できる。その広がりにより、Geminiは文書、メッセージ、カレンダー、その他の保存された文脈を扱うタスクで明らかな優位性を持つ。

AnthropicはClaudeで異なる立場を取る。その製品アイデンティティは、慎重な文章作成、長い分析、大量の文脈の取り扱いをしばしば重視してきた。構造化されていない思考の断片にとっては、別のアプリケーションにアクセスできること以上に、こうした特性が重要になりうる。

この比較は、統合の広さと対話品質の競争を明らかにしている。統合はアシスタントによる素材の取得に役立つ。しかし、最終回答が処理しやすいものになる保証はない。

20個の断片的な思考を持つユーザーが、常により多くの文脈を必要としているとは限らない。ユーザーが必要としているのは、より的確な選別、より明瞭なグループ化、競合する提案の削減かもしれない。

Googleは依然として強い戦略的立場にある。Geminiは、すでにGoogle製品群で進行しているワークフローに参加できる。関連情報がそれらのサービス内にある場合、コピー、切り替え、手作業での取得を減らせる可能性がある。

ただし、取得はタスクの前半にすぎない。アシスタントは、何に注意を向けるべきかを判断し、ユーザーが行動に移せる形で提示しなければならない。

ここで認知的摩擦が競争上の指標になる。認知的摩擦とは、不明確なラベル、過剰な選択肢、繰り返される意思決定、大幅な編集を要する出力など、インターフェースによって生じる精神的な負荷を指す。

チャットボットはしばしば、流暢な文章の背後にその摩擦を隠す。完全な文と整った書式を使うため、回答は完成して見える。それでもユーザーは、重要な点を特定し、重複を削り、一般的な助言を具体的な行動に変換する必要があるかもしれない。

ADHDのユーザーにとって、その修正作業は本来の目的を損ないかねない。注意を向け、目標志向の活動を完了するための精神的プロセスである実行機能は、同じ重みの選択肢を多く示す回答によって負荷がかかることがある。

適切な出力は、常に最短のものではない。理解可能な階層を備えた回答だ。

有用な階層は、ユーザーの当面の目的から始め、次に取るべき物理的な行動を示し、その後に補足メモを置くことができる。優先度の低いアイデアは、最初の一歩と競合させずに残しておける。

この構造は、ADHDのない人にも有益だ。管理職、研究者、学生、開発者は、1回で評価できる以上の情報を日常的に集めている。

したがって、市場全体での機会は大きい。断片的な入力を信頼できる計画へ一貫して変換するチャットボットは、単なる質問応答システム以上のものになる。思考と行動の間をつなぐインターフェースになる。

Googleにとっての危険は、Stuffのライター1人がClaudeを好んだこと自体ではない。Geminiの方が自分の情報に幅広くアクセスできる場合でも、ユーザーがClaudeを摩擦の少ない思考タスクと結び付ける可能性があることだ。

Anthropicにとっての危険は逆である。強い出力設計は単独のプロンプトでは勝てるが、統合された競合は配布面での優位性を保ったまま、そこから学べる。

OpenAIとMicrosoftも同じ圧力に直面している。ChatGPTは幅広い消費者認知を持ち、持続的なパーソナライゼーション機能も拡大している。MicrosoftはCopilotを職場の文書やコミュニケーションの近くに配置できる。

これらの利点のいずれも、回答設計を自動的に解決するわけではない。よく知られたアプリケーション内に表示されても、混み合った回答は混み合ったままだ。

競争の次の段階では、何を知っているかだけでなく、特定の人の特定の瞬間に合わせてそれをどうパッケージ化するかに適応できるアシスタントが評価されるだろう。

Claude対Geminiは、実際には構造と機能の広さの対決だった

Claude対Geminiは、単なるモデル同士の競争ではなかった。構造が、より広い製品の足跡を上回れるかを試す実用的なテストだった。

AI企業は、パーソナライゼーションを好みの記憶や関連ファイルへのアクセスとして説明することが多い。こうした機能は継続性を高められるが、アシスタントがユーザーの望む詳細度を理解する保証にはならない。

調査中には包括的な回答を求め、圧倒されているときには3行のチェックリストを望む人もいる。持続的なプロフィールだけでは、どのモードが毎回適切かを完全には判断できない。

アシスタントは、現在の依頼の中にあるシグナルを検出しなければならない。長く整理されていない入力は、ユーザーが圧縮を必要としていることを示すかもしれない。一方で、すべての詳細が重要に感じられ、追跡可能な形で残すべきことを意味する場合もある。

優れた回答は、段階的な情報開示によって両方のニーズを満たせる。この設計は、最初に不可欠な情報を示し、その下に補足の詳細を利用可能な形で置く。

たとえば、アシスタントは中心的な問題を説明する1文から始められる。続いて3つの優先事項を挙げ、それぞれに次の行動を1つ割り当て、未解決の素材は別の保留セクションに置くことができる。

階層は装飾的な書式より重要だ。すべての見出しが同じように重要に見えるなら、10個の見出しは長い段落と同じくらい摩擦を生む可能性がある。

報じられたClaudeの優位性は、独立して測定された能力差よりも、回答がライターにどう感じられたかによる可能性が高い。この主観的な側面を軽視すべきではない。使いやすさは常に人によって経験されるものだからだ。

ただし、これは普遍的な結論を妨げる要因でもある。別のユーザーはGeminiの整理方法、ChatGPTの会話スタイル、あるいはCopilotの職場環境との接続を好むかもしれない。

プロンプトの文言も結果を変えうる。「これらの考えを整理して」という指示には、かなり大きな解釈の余地がある。モデルは要約、分類、優先順位付け、スケジュール作成、確認質問のいずれかを選ぶかもしれない。

これらは異なるタスクである。求められた変換を推測できるアシスタントには優位性があるが、ユーザーの意図が変われば、その推測は失敗しうる。

これは4社すべてに設計上の課題をもたらす。複数の確認質問をすれば精度は上がるかもしれないが、ユーザーが支援を得る前に新たな障壁も生まれる。

最も強い対話は、前提を可視化しながら即座に下書きを提示するものかもしれない。たとえば、素材を緊急度でグループ化したことを伝えた上で、テーマ別や時系列に切り替える選択肢を示せる。

このアプローチは勢いを保つ。また、早い段階での設定作業を強いることなく、ユーザーにコントロールを与える。

OpenAIのメモリ機能は、この問題の別の側面を示している。同社のメモリ管理機能では、ChatGPTが会話をまたいで特定の詳細を保持するかどうかをユーザーが管理できる。永続的なコンテキストにより繰り返し説明する手間は減らせるが、ユーザーはシステムが何を記憶しているのかを把握できる必要がある。

Geminiが接続された情報を利用する際、Googleも同様の信頼に関する課題に直面する。同社のプライバシーに関するガイダンスでは、アクティビティ、人によるレビュー、接続済みサービスがユーザー設定とどのように関わるかを説明している。

こうした管理機能が重要なのは、個人的な思考の吐き出しには、通常の検索クエリ以上に機微な情報が含まれうるためだ。ユーザーは健康上の懸念、職場での対立、家族に関する詳細、未完成のアイデア、他者の名前などを記す場合がある。

したがって、組織化を支援するアシスタントは、ユーザーが非常に個人的な内容を共有する前に、プライバシーの境界を理解できるようにすべきだ。また、削除、一時セッション、保存される記憶と一度きりのコンテキストの明確な分離も支援する必要がある。

職場では、Microsoftがさらに別の論点を加える。Copilotの回答は、会社のファイル、メッセージ、ポリシーの近くで機能する可能性がある。こうしたコンテキストは関連性を高められる一方、権限、保持期間、個人的な振り返りを雇用主が管理するアカウント内に置くべきかといった疑問も生む。

勝つ製品には、優れた文章力だけでは足りない。有用な構造、適切なコンテキスト、低い操作コスト、理解しやすいデータ管理を組み合わせる必要がある。

Stuffの比較でClaudeが得た結果は、Anthropicにとって好意的な一例となる。ただし、その優位性がアカウント、プロンプト、モデルのバージョン、言語、あるいはより長いワークフロー全体で持続するかどうかまでは示していない。

ある書き手の成功は臨床的エビデンスではない

有用なチャットボットの結果は、AIがADHDを治療したり専門的な支援を代替したりする証拠ではなく、ワークフローに関する観察として扱うべきだ。

ADHDは、現れ方や機能障害の程度がさまざまな臨床的状態である。個人の体験談は、ある人にとって何が役立ったかを示しうるが、より広い集団に対する有効性を確立することはできない。

Stuffの比較は、統制された研究には見えない。代表性のある参加者集団、盲検評価、固定された採点フレームワーク、異なるタスク種別にわたる反復試験が欠けている。

モデルの挙動も変わりうる。ベンダーはシステム指示、安全ポリシー、インターフェース、基盤モデルを更新する。あるセッションで観察された結果が、後で再現されるとは限らない。

同じ製品内でも、回答の質はアカウント設定、会話履歴、有効化されたツール、入力文の正確な表現に左右されることがある。公平な比較には、こうした変数を統制する必要がある。

また、回答を見る前に成功の定義を決める必要もある。そうしなければ、評価者は最もなじみ深く感じるスタイルを無意識に好む可能性がある。

考えられる基準には、元の考えへの忠実さ、重複したアイデアの削減、優先順位の明確さ、実行可能な次のステップの数、読む際の負荷、後でユーザーが計画を思い出せるかどうかなどが含まれる。

より強固な研究では、整理された出力が実際に行動を変えるかを検証するだろう。参加者は意図したタスクを始めたのか。計画は翌日も役立ったのか。見落とした約束を減らしたのか。それとも数分間、安心感を与えただけだったのか。

この違いが重要なのは、チャットボットが完了したように見せることに非常に長けているからだ。美しく整形された計画は、実行の継続を改善しなくても、一時的なコントロール感を生み出しうる。

AIは個人情報を再構成する過程で、誤りを持ち込むこともある。別々の懸念を統合したり、ユーザーが表明していない緊急性を割り当てたり、些細に見えても感情的には重要な詳細を省いたりする可能性がある。

ユーザーは、医療、金融、雇用、法的な判断に出力を頼る前に確認すべきだ。また、自信に満ちた表現を、アシスタントがあらゆる含意を理解した証拠として扱うべきではない。

最も安全な位置づけは、拡張である。チャットボットはユーザーの思考を編集可能な外部表現として提供する。ユーザーは、その表現が正確かつ適切かを判断する責任を引き続き負う。

この原則は生産性に関する助言にも当てはまる。モデルはタイムブロッキング、リマインダー、優先順位付けマトリクス、作業をより小さなタスクに分解することなどを提案するかもしれない。こうした手法が役立つ人もいれば、かえって苛立たせる人もいる。

提案された仕組みで繰り返しうまくいかないことを、個人的な失敗と解釈すべきではない。単にその仕組みが、ユーザーのニーズ、環境、または現在の余力に合っていない可能性がある。

依存のリスクもある。ユーザーが優先順位付けのすべてを外部委託すれば、AIによる処理をもう一度行わなければ先に進むことをためらうようになるかもしれない。

より良い設計目標は、調整可能な支援だ。アシスタントが完全な構造を作るべき場合もある。一方で、次に取るべき行動を一つだけ特定し、その後は身を引くべき場合もある。

AIベンダーは、この形態の支援を測定する標準的な方法をまだ確立していない。エンゲージメント指標は、むしろ誤った行動を評価してしまう可能性さえある。長い会話や繰り返しのプロンプトは、プラットフォームにとっては好意的に見えても、ユーザーにとっては追加の摩擦を表しているかもしれない。

プライバシーも依然として別の制約だ。非常に個人的な思考の吐き出しは、症状、診断、関係性、職場での懸念を明らかにしうる。ユーザーは、そのような内容を共有する前に、適用されるデータ設定を確認すべきだ。

また、個人向けアカウントと雇用主が管理するサービスを区別する必要がある。組織のポリシーは、保持期間、管理者によるアクセス、許可された利用に影響しうる。

こうした注意点は、書き手の結果を否定するものではない。その適切な範囲を定めるものだ。

報道によれば、Claudeは特定の使いやすさに関する場面で勝利した。これは個人の体験としては信頼でき、製品シグナルとしても有用だ。ただし、治療上の利益やモデル全体としての優位性の証明ではない。

Anthropic、Google、OpenAI、Microsoftが次に証明すべきこと

次の勝者は、一度成功した整理用プロンプトを、再現可能で制御可能なワークフローへと変えるアシスタントになる。

最初に注目すべきシグナルは、多様な思考の吐き出しに対する再現性だ。同じアシスタントが、短いリスト、長い感情的な叙述、会議の断片、競合する締め切り、数日にわたって集められたメモを扱えるべきである。

一貫した性能は、Claudeに持続的な整理上の優位性があるという主張を強める。プロンプトごとの振れ幅が大きければ、Stuffの結果が一度の好都合なやり取りに強く依存していたことを示唆する。

再現性には忠実さも含まれる。モデルは、ユーザーの意味をひそかに変えることで読みやすさを高めてはならない。不確実性を保持し、約束とアイデアを区別し、優先順位を推論した箇所を示すべきだ。

二つ目のシグナルは、適応的な出力制御である。ユーザーには、詳細を減らす、より多くのコンテキストを加える、分類方法を変える、あるいは直ちに取る行動を一つだけ求めるための、簡単な手段が必要だ。

これはプロンプトに関する専門知識を必要としてはならない。インターフェースの操作では、「次のステップのみ表示」「すべての詳細を保持」「緊急度で分類」といった選択肢を提示できる。

Anthropicが好意的な出力スタイルを理解しやすい操作に変えられれば、Claudeの立場を強化できる。GoogleがGeminiの接続済みコンテキストに同様に効果的な操作を加えれば、その流通面での優位性はより重要なものになる。

OpenAIは、内容だけでなく回答の構造を変えるパーソナライゼーションで対応できる。Microsoftは、関わる職場資料の種類に合わせて整理方法を調整することで、Copilotをより有用にできる。

三つ目のシグナルは、持続的なワークフロー統合だ。よく整理された回答も、ユーザーが忘れてしまう孤立したチャットの一つになるなら、その価値は限られる。

ユーザーは、選択したアクションをカレンダー、タスクシステム、文書、または検索可能な個人知識ベースへ移せる必要がある。アシスタントが不要なタスクを作成したり、機微な情報を自動保存したりしないよう、この移行は意図的なものであるべきだ。

ここで最良のAIオーガナイザーには、継続性と制御のバランスが求められる。ユーザーが記憶してほしいものを記憶し、一時的であるべきものを破棄し、その違いを説明すべきだ。

有用なワークフローは、フィルタリングされていない思考の吐き出しから始められる。アシスタントは簡潔な地図を返し、ユーザーにカテゴリを承認させた後、承認された構造だけを保存する。

このプロセスは、私的な表現と永続的な知識の間に監査ポイントを作る。また、誤った解釈が他のシステムへ広がる可能性も減らす。

すでに個人知識ベースを構築している人々も、同じ課題に直面している。情報を取り込むのは簡単だ。それを検索可能で実行可能なものに変えるには、ユーザー本来の意図をなお反映する構造が必要になる。

したがって、AnthropicとGoogleの競争はモデルの回答だけにとどまらない。メモリ、権限、統合、編集ツール、会話から行動への移行の質も含まれる。

ベンダーは、主観的な支援について、より明確な評価方法も公表すべきだ。有用なベンチマークでは、タスク完了、ユーザーが評価した精神的負荷、事実への忠実さ、必要となった修正回数を組み合わせられるかもしれない。

こうしたテストには、神経多様性のある参加者を、一様な集団として扱わずに含めるべきだ。また、異なるストレスや時間的圧力の水準で、異なるインターフェースのパターンがよりよく機能するかも検証すべきである。

現時点では、読者も自分で慎重な比較を行える。同じ匿名化した入力を使い、新しいセッションで始め、不要なパーソナライゼーションを無効にし、回答を読む前に採点基準を決める。

各アシスタントが意味を保ち、信頼できる最初の一歩を特定し、判断の数を減らしたかを評価する。長さや見た目の洗練さを自動的に評価してはならない。

次に、異なる種類の思考の吐き出しでもテストを繰り返す。一度の勝利は興味深い。一貫したパターンは、製品選びの指針となるエビデンスである。

Stuffの書き手の結果は、この限定的なシナリオでClaudeに早期の優位性を与える。同時に、すべての競合他社に明確な目標も示している。すなわち、ユーザーの未整理な思考と、実行可能だと感じられる最初の行動との距離を縮めることだ。

次にメモが区別のつかない塊になったときは、その距離についてアシスタントを試してみてほしい。機微な詳細を削除し、同じ入力を使い、各ツールに優先事項を一つ、次のアクションを三つ、そして別の保留領域を求める。行動を起こす前に最も少ない修正で済む出力はどれか。この問いは、どのモデルが最も賢そうに聞こえるかを問うよりも有用だ。また、それはAnthropicとGoogleの競争が一般のユーザーにとってますます何を意味するのかを捉えている。勝つアシスタントは、単に最も流暢な回答を生成するだけではない。人々の判断、プライバシー、コントロールを守りながら、方向感覚を取り戻す手助けをする。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page