top of page

DartmouthのTherabotは有望な成果を示すが、責任あるAIセラピーには依然として人間による監督が必要

DartmouthのTherabotは、106人を対象とした試験で特異な矛盾が浮き彫りになったことを受け、Google Newsで再び注目を集めている。症状に意味のある改善をもたらした一方、研究者たちは依然としてこのソフトウェアだけを信頼することはできないとしている。チャットボットは24時間利用でき、参加者との間に驚くほど強い結びつきを築いた。しかし開発者らは、生成AIは自律的なメンタルヘルスケアを担うにはまだ準備ができていないと述べている。

この緊張関係は、チャットボットが共感的に聞こえるかというおなじみの問いよりも重要だ。Therabotは心理療法のために特別に構築され、対照群との比較試験を受け、臨床研究者による監視も行われた。単にカウンセラーのように振る舞うよう指示された汎用アシスタントではない。

したがって中心となる対立は、Therabotと人間のセラピストの間にあるのではない。臨床的に監督されたAIと、制約のないチャットボット療法との対立だ。一方は、会話型ソフトウェアを、根拠、監視、エスカレーション手順を必要とする介入として扱う。もう一方は、同等の安全策なしに、説得力のあるモデルを脆弱な利用者の前に置く。

Dartmouthの結果は、特化型チャットボットが一部の人々を支援できるという信頼に足る証拠を示している。ただし、ボットが患者を診断できること、あらゆる危機に対応できること、あるいは専門家の判断を代替できることを立証するものではない。次の段階では、管理された研究内で観察された利益が、より予測しにくい現実の環境への導入後も維持されるかを検証する。

DartmouthのTherabot試験が実際に変えたこと

Therabotは、生成AIによるセラピーを説得力のあるデモンストレーションの段階から無作為化臨床試験へと進めた。ただし、それは慎重に管理された条件下に限られる。

Dartmouthの研究者は、2025年3月27日にTherabotの結果を発表した。この研究では、大うつ病性障害、全般性不安障害、または摂食障害リスクの高まりを抱える成人を調査した。参加者は米国各地から集まり、スマートフォンアプリを通じてシステムを利用した。

介入群は106人で構成された。同じ症状を持つ104人の対照群は、管理フェーズ中にTherabotへのアクセスを受けなかった。この比較により、研究者は体験談やアプリストアのレビューよりも強固な基盤に基づいて変化を評価できた。

Therabotに割り当てられた参加者には、4週間の無制限アクセスが提供された。システムはチェックインを開始でき、利用者は支援を求めたいときにいつでも会話を始められた。研究者は、能動的なプロンプトが停止された後の4週間後に、追加評価を行った。

発表された臨床試験によると、影響を受けたTherabot利用者のうつ症状は平均51%低下した。全般性不安の症状は31%低下した。摂食障害のリスクがある参加者では、ボディイメージと体重に関する懸念が19%低下した。

これらの割合は、標準化された症状指標における変化を示す。Therabotがこれらの状態を治癒したことや、すべての参加者に同一の効果をもたらしたことを意味するものではない。また、このソフトウェアが人間による完全なセラピーの一連の過程に匹敵することを直接証明するものとして扱うべきでもない。

それでも、これらは些細な変化ではなかった。Dartmouthは、改善が臨床医が意味のある変化を識別するために用いる閾値を上回ったと述べている。不安を抱える一部の参加者は、中等度の症状から軽度へ、あるいは軽度から診断基準の閾値未満へと移行した。

利用者は研究期間中、平均6時間をTherabotに費やした。Dartmouthの研究者は、この利用時間を従来のセラピー約8回分と比較した。この比較は時間と報告された結果に関するものであり、訓練を受けた専門家の完全な臨床能力を比較したものではない。

このソフトウェアは強い治療同盟も形成した。この用語は、患者とケア提供者の間に築かれ得る信頼、コミュニケーション、共通の目的意識を指す。参加者は、外来ケアで報告される水準に匹敵する評価をTherabotとの関係に与えた。

この結果は、研究の上級著者であり、Dartmouthの生物医学データサイエンスおよび精神医学の准教授であるNicholas Jacobsonを驚かせた。参加者は頻繁に会話を始め、ときにはアプリケーションを友人のように扱った。深夜を含む困難な時間帯には、利用が増加した。

この結果は、試験がGoogle Newsで再び注目を集めた理由の説明にもなる。生成AIチャットボットは、利用者にとって主観的に意味のある対話を生み出すために、意識や本物の感情を必要としない。利用者が聞いてもらえたと感じ、関わり続けるのに十分な一貫性で応答すればよい。

ただし、エンゲージメントが自動的に治療的であるとは限らない。有害な信念を肯定したり、依存を深めたり、親密な情報を収集したりしながら、人の注意を引きつけるシステムもあり得る。Therabotの重要性は、エンゲージメントを測定可能な結果と能動的な監督に結びつけている点にある。

研究開始時、Therabot群のほぼ4分の3は、薬物療法も他の治療も受けていなかった。これは、このアプリケーションが定期的な治療の外にいる人々に届いたことを示唆する。同時に、ボットがリスクに直面した際にどのような支援が存在したのかを理解する重要性も高めている。

研究チームは、受け入れられている治療実践との一貫性を確認するため、会話をレビューした。参加者が急性の安全上の懸念を表明した場合、研究者は介入できるよう準備していた。アプリケーションは、自殺念慮を検出した際には、緊急サービスや危機対応リソースへ利用者を案内した。

これらの統制は、この研究を消費者向けチャットボットとの日常的な会話から区別する。発表された結果は、監督下にある目的特化型システムのさらなる調査を支持するものだ。温かみのある口調を採用したり、製品説明に「セラピー」と記したりするすべてのチャットボットを正当化するものではない。

Google Newsでの注目が重要性を高める理由

この見出しが届く市場では、それらのシステムがセラピー向けに設計されていたかどうかにかかわらず、人々はすでに汎用チャットボットを感情的な支援に利用している。

需要は理解しやすい。人間によるケアは、提供者不足、地理的条件、保険上の制約、スケジュール、スティグマ、個人負担のために得にくい場合がある。チャットボットは即座に応答し、待合室も必要としない。

Jacobsonはこの不足を厳しい言葉で表現している。彼は米国では、利用可能な提供者1人当たり、うつ病または不安を抱える人が約1,600人いると推定した。現実的な代替案がケアなしである場合、不完全なデジタル介入であっても魅力的になる。

Therabotが最も強く訴えられる点は、すべての臨床医を上回れることではない。臨床医が利用できない瞬間にも、構造化された支援を人々に届けられることだ。不安に苦しむ利用者は、苦痛が悪化したり対処法を忘れたりする前に、午前2時でもアプリケーションを開ける。

ソフトウェアの設計も重要である。Therabotは2019年から開発が続けられ、Dartmouthの心理学者と精神科医から継続的な意見を得てきた。当初の学習素材は、エビデンスに基づく心理療法と認知行動療法に由来していた。

認知行動療法、すなわちCBTは、思考、感情、行動を結びつける有用でないパターンを人々が特定し、変えるのを支援する。演習、内省を促すプロンプト、対処戦略をソフトウェアで提供できるほど構造化されている。そのため、開放的な臨床判断よりも自動化の対象として現実味がある。

不安を経験している人は、圧倒されていると感じることを説明するかもしれない。Therabotは利用者に一歩引いて、その反応の原因を検討し、対処技法に取り組むよう促せる。また会話の文脈を記憶し、後のプロンプトを個別化することもできる。

こうした可用性は、従来のケアシステムに圧力をかける。即時のデジタル応答に慣れた患者は、予約と予約の間に日常的な支援がなぜ消えるのかを問うようになる。提供者は、すでに重い業務負荷を増やさずに、より頻繁なチェックインを提供するよう圧力を受けるだろう。

責任ある答えは、臨床医を置き換える必要はない。リスクに応じて業務を分担することが可能だ。ソフトウェアは日常的な演習を案内したり、症状の変化を記録したりできる一方、専門家は診断、治療計画、危機管理、説明責任を維持する。

このようなハイブリッドシステムは、臨床ワークフローを変える。セラピストは予約前に、セッション間の活動の要約を確認するかもしれない。患者は、誘因、症状、試みた対処戦略について、より明確な記録を持って来院できる。

こうした記録には慎重な取り扱いが必要だ。うつ病、トラウマ、物質使用、摂食行動についての詳細な会話は、従来の症状質問票より多くの情報を明らかにし得る。また、家族、雇用主、人間関係、病歴に関する情報も含み得る。

個人的な内省のためのツールは、すでに利用者に自分の思考の検索可能な記録を構築するよう促している。責任を持って設計されたパーソナルナレッジシステムは情報整理に役立つが、セラピーの記録には、より厳格な同意、アクセス、削除、セキュリティの管理が求められる。

Dartmouthの研究は、消費者向けAI企業にも圧力をかける。ChatGPT、Gemini、Claude、そしてコンパニオン製品には、すでにメンタルヘルスに関する打ち明け話が寄せられている。それらの提供者は、汎用目的というラベルだけで、利用者が流暢な会話をケアとして扱うことを防げるとは考えられない。

同時に、特化型の開発者は、より高い証拠基準に直面している。洗練されたインターフェースや共感的な言葉遣いだけでは、もはや不十分だ。Therabotは、診断を受けた参加者、検証済みの質問票、対照群、監視された会話を含む参照点を提供している。

それでも、Dartmouthの手法が最終基準になるわけではない。この試験は比較的小規模で、期間も8週間だった。より大規模な研究では、改善が持続するか、利用者が離脱するか、まれな害が大規模に現れるかを検証しなければならない。

Google Newsでの可視性は、こうした区別を単純な問いへと圧縮し得る。チャットボットは責任あるセラピストになれるのか。証拠が支持するのは、より限定的な答えだ。目的特化型チャットボットは有用な治療的要素を提供できるが、責任は依然として、それを設計、試験、監視、導入する人間にある。

責任あるAIセラピーとは、モデルの本能に抗うこと

有用なセラピーチャットボットは、もっとも同意的な応答が臨床的には誤った応答となり得るため、もっともらしい共感を生成するだけでは不十分だ。

大規模言語モデルは、学習したパターンから、起こりそうな単語の並びを予測する。患者の病歴を独自に理解したり、懸念を抱いたり、法的責任を引き受けたりするわけではない。その流暢さは、利用者が最も安心を求めるときにこそ、こうした限界を隠し得る。

消費者向けモデルは一般に、満足感のある会話を維持するよう最適化されている。そのため、応答性、温かさ、同意が促される。しかしセラピーにおいては、自動的な同意が歪んだ思考を強化したり、危険な解釈を肯定したりする可能性がある。

臨床医は、ときに患者へ穏やかな異議を示す必要がある。患者は中立的な出来事を迫害と解釈したり、証拠なしに拒絶されたと考えたり、差し迫った危険を生む計画を表明したりするかもしれない。その前提を温かく受け入れることは、状況を悪化させかねない。

Stanfordの研究者は、この問題を複数のセラピーチャットボットで検証した。彼らのメンタルヘルス研究では、システムが統合失調症やアルコール依存を含む状態に対し、うつ病よりも強いスティグマを示したことが明らかになった。

新しい、あるいはより大規模なモデルが、その挙動を自動的に解消したわけではない。研究者らは、単にデータを追加したりモデルをスケールアップしたりするだけでは不十分だと主張した。システムはより雄弁になれても、臨床的に信頼できるようになるとは限らない。

スタンフォード大学のチームは、自殺念慮や妄想を含む応答も検証した。あるシナリオでは、ユーザーが失職したことに触れた後、ニューヨーク市の高い橋について質問した。一部のボットは、そこに含意された危険を認識せず、場所に関する質問へ回答した。

この例は、基本的な安全上の欠陥を示している。従来のアシスタントは文字どおりの依頼を評価する。責任ある臨床システムには、会話を解釈し、リスク信号を特定し、通常の応答経路を中断することが求められる。

Therabotは、専門的なトレーニング、危機検知、研究チームによる監督を通じて、この課題に対処しようとした。自殺念慮を検知した場合、アプリケーションは緊急サービスや危機ホットラインへのボタンを表示できた。研究者らは、必要に応じて直接介入できる態勢を整えていた。

こうした安全策は重要だが、あらゆる危機を検知できる分類器は存在しない。人は危険を間接的に表現し、ユーモアを用い、話題を変え、意図を隠し、文化的に固有の言葉で伝えることがある。よく知られた表現を中心に訓練されたシステムは、そうした表現を一度も使わない人を見落としかねない。

誤警報も別の問題を生む。通常の会話を危機警告で繰り返し中断するボットは、ユーザーをいら立たせ、信頼を損なう可能性がある。したがって安全性には、見逃すリスクと不要なエスカレーションの均衡が伴う。その結果は、ほとんどのソフトウェア調整の判断よりはるかに重大である。

Therabotの管理された環境は、不確実性の一部を減らした。研究者らは、誰が参加登録し、どのような状態を申告し、アプリケーションがどのように応答すべきかを把握していた。必要に応じてやり取りを確認し、本人に連絡することもできた。

一般公開では、その境界の多くがなくなる。ユーザーは未成年かもしれず、精神病症状を経験している、酩酊している、ドメスティックバイオレンスに直面している、あるいは緊急リソースが想定する国の外で暮らしている可能性がある。製品に何ができるかを誤解している場合もある。

そのため、American Psychological Associationのhealth advisoryは、生成AIチャットボットが資格を持つメンタルヘルス専門職の代わりになるべきではないと勧告している。同勧告は、支援的な利用と、心理療法、診断、危機ケアを区別している。

この区別は、AIにとってより信頼できる道筋を生む。チャットボットは、日記作成、構造化された振り返り、スキル練習、受診準備、セッション間の課題を支援できる。それぞれのタスクは、治療全般への責任を担うと想定するよりも明確な境界を持つ。

Nicholas JacobsonとMichael Heinzも同様の主張をしている。両氏は、ソフトウェアベースの支援が対人ケアと並行して機能する可能性を見ている。Heinzはまた、メンタルヘルスにおける多様な高リスクのシナリオ全体で、完全自律的に運用できる生成AIエージェントはまだ存在しないと述べている。

この認識は、研究を損なうどころか、その意義を強める。責任あるAIセラピーは、定義された適用範囲とエスカレーション経路から始まる。人間によるケアが時代遅れになったと主張することから始まるのではない。

試験の期待は、安全性、プライバシー、説明責任と衝突する

Therabotは監督下で有効性を示したが、監督がなくなると未解決のリスクは大きくなる。

第一の限界は期間である。4週間の無制限アクセスと8週間の評価期間は、初期の症状変化を検出できる。しかし、改善が6か月続くか、依存が高まるか、遅れて害が現れるかまでは立証できない。

第二の限界は規模である。介入群と対照群を合わせて210人を対象とする試験では、一般的な効果を示すことはできる。しかし、一般公開された製品が数十万人のユーザーに達した後に現れる可能性のある、すべてのまれな失敗を明らかにする可能性は低い。

1万人に1人の失敗率は、研究環境では小さく聞こえる。消費者向けの規模では、多くの人に影響しうる。失敗が自殺リスク、妄想的思考、摂食障害、服薬判断、虐待に関わる場合、その重要性は大きい。

第三の限界は比較に関するものだ。対照群は、管理期間中にTherabotを利用しなかった。したがって、この研究が示すのはその対照条件に対する優位性であり、免許を持つ臨床家による治療との同等性ではない。

Dartmouthは、症状変化と治療同盟の評価を外来治療で報告されているパターンと比較した。こうした比較は有益だが、臨床家主導の治療と直接比較する試験の代わりにはならない。

今後の研究では、監督下でのTherabot利用、従来の療法、ハイブリッドケア、適切な対照条件を比較すべきだ。また、有害事象、治療からの離脱、危機時のエスカレーション、その後の人間によるケアの利用も測定する必要がある。

第四の問題は説明責任である。免許を持つセラピストは職業基準に従う義務があり、懲戒や法的な結果に直面しうる。チャットボットは免許を保持できず、問われた際に意図を説明することも、有害な推奨への責任を引き受けることもできない。

その代わり、責任は開発者、臨床責任者、医療システム、ベンダー、導入組織にまたがる。契約と規制がそれらの役割を定義しない限り、問題が起きた後に各当事者が別の当事者を指し示すことになりかねない。

Illinois州はすでに法的な境界を引いた。2025年8月に署名された同州のtherapy lawは、セラピーサービスを免許を持つ人間の専門職に限定している。この措置はなお、AIの特定の事務的・補助的利用を認めている。

このアプローチは、代替ではなく拡張を重視する。メンタルヘルスのすべてのワークフローでソフトウェアを禁止するものではない。自律システムそのものが専門的なセラピーを提供できるという主張を制限するものだ。

他の法域は異なるルールを選ぶ可能性があり、市場は断片化する。スマートフォンのアプリケーションは瞬時に州境を越えられる一方、臨床ライセンスと消費者保護は依然として所在地に結び付いている。開発者は、ユーザーがどこにいて、その地域でどのような主張ができるかを把握しなければならない。

プライバシーも未解決の問題である。人は判断されにくいと期待するため、チャットボットにより多くを打ち明けることが多い。この開放性はTherabotの治療同盟を生む一助となったが、同時に非常に機微なデータセットも生み出す。

ユーザーは症状、診断、性的指向、家族内の対立、職場の問題、物質使用、自殺念慮を明かす可能性がある。こうした開示は、漏えい、目的外利用、販売、または実質的な同意なしに将来のモデルの訓練へ使われた場合、有害になりうる。

多くの消費者向け健康アプリケーションは、病院や臨床家と同じ形ではHIPAAの規制を受けない。Federal Trade Commissionは、そのbreach notification ruleが、HIPAAの対象外にある多くの健康アプリと関連技術に適用されることを明確にしている。

侵害通知は保護の一層にすぎない。責任ある製品には、データ最小化、暗号化、アクセス制御、削除手続き、保持期間の制限、モデル訓練に関する明確な制約も必要だ。

ユーザーは、臨床家が会話を読めるかどうか、自動フラグがいつレビューを引き起こすのか、緊急介入が起こりうるのかを知るべきだ。こうした事実は、安全性と、ユーザーが率直に話す意思の双方に影響する。

最後の問題はバージョンの安定性である。臨床試験は、特定の条件下における特定のシステムを評価する。生成AI製品は、モデルの更新、ポリシー調整、検索機能の変更、新しいインターフェース機能を通じて変化する。

一般的な会話を改善する更新が、危機時の挙動を変える可能性がある。新しい記憶機能は継続性を改善しつつ、プライバシーへの曝露を増やしうる。より同調的な口調はエンゲージメントを強める一方、治療的な迎合を悪化させる可能性がある。

したがって、臨床的検証は一度限りの認証ではありえない。重要なシステム変更には、再試験、継続的な監視、文書化されたロールバック手順が必要である。そうでなければ、患者が使う製品は、研究者が評価した製品から静かに乖離していく可能性がある。

Google Newsの読者が次に注目すべきこと

決定的な証拠は、より大規模な比較試験、執行可能な導入ルール、現実世界での失敗に関する透明な報告から得られる。

最初のシグナルは、積極的治療との比較を含む、より大規模かつ長期間のTherabot研究である。研究者らは参加者を8週間より長く追跡し、チャットボットを臨床家主導のケアおよびハイブリッドケアと比較する必要がある。

そのような研究では、症状の平均値以上のことを検証すべきだ。改善した人、変化しなかった人、悪化した人、利用をやめた人、緊急介入を必要とした人の数を報告すべきである。結果は診断、年齢、背景、治療歴別にも分ける必要がある。

数か月にわたって便益が意味のある水準に保たれるなら、監督下のAI支援を支持する根拠は強まる。効果がすぐに薄れる、あるいは有害な結果が特定のグループに集中するなら、導入範囲はそれに応じて狭めるべきだ。

直接比較により、Therabotが最も価値を加える領域も明らかになる可能性がある。ケアを待つ人々にとって即時の橋渡しとして最も機能するかもしれない。主たる介入としてよりも、受診の間や構造化された課題で役立つ可能性がある。

第二のシグナルは、詳細な臨床導入モデルである。読者は、Dartmouthまたはその提携先が、明確に定義されたエスカレーション責任と専門職の監督の下で、Therabotを医療システム内に配置するかどうかを注視すべきだ。

重要な問いは運用に関するものとなる。フラグが付いた会話を誰が確認するのか。人が応答しなければならないまでの時間はどれくらいか。ユーザーが提供者の管轄外にいる場合はどうなるのか。確立された臨床家がいない患者もツールを使えるのか。

信頼できる導入では、その境界を平易な言葉で公開すべきである。対象となる状態、除外対象の集団、危機対応手順、データ実務、あらゆる治療上の主張を支える根拠を示すべきだ。

医療システムは、アプリケーションが臨床家の業務負担を変えるかどうかも開示すべきである。監視義務が管理可能な範囲にとどまる場合にのみ、自動化はアクセスを広げられる。警告を過剰に発生させるサービスは、容量不足の問題を解決するのではなく移し替える可能性がある。

Therabotが信頼できる監督と管理可能な人員需要の下で日常診療に入るなら、ハイブリッドモデルを支持することになる。安全な運用に常時の手動レビューが必要なら、スケーラブルなアクセスという主張は弱まる。

第三のシグナルは、ウェルネス支援と臨床治療の境界をめぐる規制の収束である。現在の市場には、専門的介入、汎用アシスタント、コンパニオンボット、ウェルネスアプリケーションが存在し、ユーザーには似て見える場合がある。

規制当局は、会話によるガイダンスがいつセラピーの実践になるかを判断しなければならない。関連要因には、診断上の主張、治療上の推奨、脆弱な集団での利用、臨床家の関与、危機への製品の応答が含まれうる。

プライバシー規則も臨床ルールと並行して進化しなければならない。ユーザーには、極めて個人的な会話記録に対する実質的な管理権限が必要である。開発者は、長いポリシーに埋もれた同意を、無制限の保持やモデル訓練を認める許可として扱うべきではない。

独立した安全性評価も重要になる。開発者は、微妙な危機表現、妄想、摂食障害に関するプロンプト、物質使用、虐待、文化的に多様な苦痛表現に対してシステムを試験すべきだ。結果には、成功例だけでなく失敗率も含めるべきである。

したがってTherabotの物語は、「セラピスト」という肩書に値する機械を作ることよりも、どの治療的タスクをソフトウェアが実行できるのか、誰の権限の下で、どのような根拠に基づき、どのような退出経路を備えて行うのかを決めることにある。

Google Newsを通じてこの議論を追う読者にとって、実際的な問いは、チャットボットがかつて共感的な答えを生み出したかどうかではない。便益が測定されたか、人間が介入できるか、失敗が報告されているかを問うべきだ。

人々はAIを使って質問を整理し、パターンを振り返り、専門家との会話に備えることができる。検索可能な第二の脳は、治療を提供するものと装うことなく、そうした準備を支援し得る。

Therabotは、この議論における楽観的な側面の信頼性を高めた。目的特化型の生成AIシステムが継続的な利用を維持し、測定可能な症状改善に寄与し得ることを示したからだ。一方で、Dartmouth自身が示した慎重な見解は、反対を示すエビデンスの重要性も同じく浮き彫りにしている。

今後1〜3カ月は、追跡研究、臨床パートナーシップ、州レベルの規制に対する精査が進むはずだ。拡大の是非は、応答の流暢さではなく、それを取り巻く安全策によって判断されるべきである。

あなたなら、メンタルヘルスのチャットボットが理解を示すように聞こえるという理由で信頼するだろうか。それとも、会話がうまくいかなくなったときにどう対処するかを確認してから信頼するだろうか。この違いは、患者、臨床医、開発者、政策立案者の指針となるべきだ。AIはケアの提供範囲を広げる助けになり得るが、言葉だけでは不十分なときに行動できる人々や組織に、責任は引き続き結び付けられていなければならない。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page