ChatGPTのパラドックス: 大規模言語モデルが時間とともに苦戦する理由
- Aisha Washington

- 6月6日
- 読了時間: 10分
更新日:6月17日

ChatGPTに量子物理学のソネットを書かせたり、Pythonコードのブロックをデバッグさせたりすると、不気味なほどの能力で対応してくれることが多い。しかし、「今何時?」と尋ねると、幻覚を見たり、拒否されたり、あるいは3時間前の時間を教えられたりするかもしれない。それは衝撃的な体験だ。私たちはコンピューターを単なる時計として使うことに慣れている。スマートフォン、電子レンジ、車は、当たり前のようにこのタスクをこなす。それなのに、現代の旗艦である大規模言語モデル、ChatGPTは、5ドルの腕時計でも完璧にこなせるはずの質問に苦労しているのだ。
これは単なる奇妙な点ではない。これらのシステムがどのように機能するかについての根本的な啓示なのだ。時間を告げられないことは、「人工知能」という光沢のあるベニヤを剥がし、その下にある確率的な機械を露呈させる。なぜChatGPTがこの点で失敗するのかを理解することは、大規模言語モデルが実際には何であり、そして、より重要なことには、何ではないのかについての、より鮮明な絵を提供する。
大規模言語モデルのアーキテクチャ:「ChatGPTがデザイン上、時間を扱えない理由」

このエラーを理解するには、大規模言語モデルが存在する環境を見る必要がある。コンピューターのオペレーティングシステムには、メインプロセッサが何をしていても秒を刻み続ける、バッテリーで駆動される専用回路であるリアルタイムクロック(RTC)がある。ChatGPTにはそのような回路はない。それは、トレーニングデータから完全に構築された静的な宇宙に存在する。
テキスト予測 vs. ChatGPTにおけるリアルタイム情報
大規模言語モデルは、本質的に閉鎖された部屋で機能する。プロンプトを入力すると、ドアの下に紙切れを滑り込ませているようなものです。ChatGPTはそのメモを読み、膨大な量の凍結されたテキスト(トレーニングデータ)のライブラリを参照し、最も可能性の高い応答を予測します。
根本的な問題はテキスト予測です。モデルは、数ヶ月または数年前のデータから派生した統計的な尤もらしさに基づいて言語を生成します。現在形で物事を「知っている」わけではありません。時間を尋ねられた場合に、役立つアシスタントが何を言うかを予測します。リアルタイム情報にアクセスできない場合、トレーニングセットで頻繁に出現するトークンシーケンスであるため、もっともらしく見える時間、たとえばアナログ時計のストックフォトによく表示される10時10分を幻覚する可能性があります。アナログ時計のストックフォトによく表示される一般的な時間です。
本でいっぱいの島に漂着した船乗りを想像してみてください。あなたが日付を尋ねるメッセージをボトルに入れて送ったとしても、その船乗りはシェイクスピアを引用したり、相対性理論を説明したりすることはできますが、存在しないカレンダーを見ることはできません。彼らは時間の流れから切り離されています。ChatGPTはその船乗りなのです。
技術的な応急処置:ChatGPTの大規模言語モデルにおけるツール呼び出しとコンテキストウィンドウ

OpenAIや他の研究所のエンジニアは、このことに気づいていないわけではありません。「パーソナルアシスタント」は、会議がいつ始まるかを知る必要があることを彼らは理解しています。彼らが実装した解決策は「ツール呼び出し」です。これは、大規模言語モデルが生成を一時停止し、Google検索やシステムクロックチェックなどのスクリプトを実行することを許可される方法です。
関数呼び出しにより、LLMは会話中に外部サービスやAPIから情報を要求できます。ユーザーが外部データを必要とする質問をした場合、LLMはその必要性を認識し、適切な関数を呼び出します。あなたの関数ハンドラが実行され、結果が返され、LLMがその応答に組み込みます。
ChatGPTで時間を伝える能力の欠陥を修正するためのコスト
ツール呼び出しは完璧な解決策のように聞こえますが、驚くほど信頼性が低いままです。システムは非決定的です。ChatGPTに時間を尋ねた場合、推測できると確信してツールを呼び出さないことを決定するかもしれません。あるいは、ツールを呼び出して正しい時間を取得しても、会話が進むにつれてその特定の詳細を失ってしまうかもしれません。
ここでコンテキストウィンドウの話になります。これは大規模言語モデルの短期記憶です。現在のタイムスタンプを含むすべての情報が、このウィンドウ内の「トークン」を消費します。あるAIロボット工学の専門家はThe Vergeに対し、エンジニアが人間のような時間の感覚をシミュレートするためにChatGPTに毎秒時計を確認するように強制した場合、それはコンテキストウィンドウを無駄なノイズで氾濫させると説明しました。それは、誰かが毎瞬現在の秒を耳元で叫んでいる間に会話を続けようとするようなものです。最終的には実際の議論の糸口を見失うでしょう。
その結果、ChatGPTは時間を内部定数ではなく、オンデマンドの外部事実として扱います。毎回「調べに行く」必要があります。プロンプトがその特定の検索動作をトリガーしない場合、モデルは重み(静的メモリ)にフォールバックし、2024年なのに自信を持って2025年だと言ったり、世界の反対側のタイムゾーンを教えてくれたりします。
AIの幻覚と大規模言語モデルChatGPTにおける能力の錯覚
時間管理の失敗は、いわゆるAIの幻覚しかし、それはユーザーの期待とシステムの現実との間の哲学的な亀裂も露呈させます。人間のアシスタントが時間を知らない場合、時計を見ます。時計が見つからなければ、「わかりません」と言います。パターンを完成させるという至上命令に突き動かされたChatGPTは、会話の流れを中断するよりも、もっともらしい時間をでっち上げることを好むことが多い。
ChatGPTからスクラブルチャンピオンまで:大規模言語モデルの模倣
元のレポートのコメント欄には、ナイジェル・リチャーズという素晴らしいアナロジーがあります。リチャーズはフランス語を話せずにフランスのスクラブル選手権で優勝しました。彼は定義を理解せずに、辞書、つまり文字のシーケンスと有効な組み合わせを記憶しました。
ChatGPTも同じ原理で動作します。それは人間のインタラクションの「辞書」を記憶した大規模言語モデルです。彼は「今何時ですか?」という質問の後に、通常「XX:XX PM」のような数字のパターンが続くことを知っています。彼はそのパターンを提供します。そのパターンが地球の回転や水晶振動子に対応するものであるとは理解していません。
ここでユーザーのフラストレーションがピークに達します。私たちは機械に心があると投影します。コードを書くことができるなら、基本的な認知的な状況認識を持っているはずだと仮定します。時間を伝えることができないことは、それがそうではないことを証明します。あるユーザーが指摘したように、それは「誰かの宿題をコピーするようなものだ。先生に直接質問されて、カンニングできない限りは大丈夫だ。」これは単に非常に高度なテキスト予測機能です。先生が、ノートを見ずに答えなければならない質問をしたとき、A+の評価は失われます。
ChatGPTに関するユーザーの不満:期待と大規模言語モデルの現実

これらのツールのマーケティングは混乱をさらに悪化させます。企業はChatGPTを非常に有能なエージェントとして売り込んでいます。ユーザーがそのように扱ったとき、失敗は裏切りのように感じられます。
大規模言語モデルをデジタルヒューマンとしてマーケティングすること:ChatGPTが失敗する場所
あるユーザーはThe Vergeに次のように不満を述べました。「もしChatGPTが『私自身の能力をはるかに超える認知能力を持つ』と見なされたAIモデルの評判を汚すなら、このことに注意してください。」チャットボットが基本的な時間管理ができない場合、有能であるという幻想はすぐに打ち砕かれます。
一貫性のなさが致命的です。時々ChatGPTは検索を正常に実行して時間を正しく答えます。5分後には失敗します。この非決定性は、客観的な現実のインターフェースとして不適切です。従来のコードは透明です:入力AはルールCを介して出力Bにつながります。レイヤーが見えます。ニューラルネットワークはブラックボックスです。モデルが今回インターネットを確認するのではなく、時間を幻覚として生成することを決定した理由はわかりません。
平均的なユーザーにとって、この予測不可能性は、時間に関係するタスクにおける「アシスタント」という称号を無意味にします。特定のニューロンが誤って発火したために、時々先週の火曜日だと思っているカレンダーマネージャーを信頼することはできません。大規模言語モデルは、唯一の正解がない創造的なタスクには非常に優れています。唯一の正解があり、その答えが毎秒変わるタスクには非常に劣っています。
「タイプライターを持つ猿」という批評は、ここで共感を呼びます。それは情報処理と理解の違いを浮き彫りにします。ChatGPTは時間の構文を処理しますが、時間的実在の意味論を欠いています。静的な知識と動的な現実の間のギャップを埋めるようにアーキテクチャが変更されるまで、AIに時間を尋ねることはサイコロを転がすようなものになります。AIに時間を尋ねることは、サイコロを転がすようなものになります。
FAQ:ChatGPT、時間、およびLLMの制限

なぜChatGPTは時々時間を正しく伝え、時々間違えるのですか?
ChatGPTは、インターネットを検索したりシステムプロンプトを確認したりするための「ツール呼び出し」を正常にトリガーした場合に時間を正しく伝えます。内部のトレーニングデータ(静的)に依存したり、外部チェックを実行できなかったりした場合に間違え、確率に基づいた推測につながります。
プロンプトを工夫することで、ChatGPTが時間を伝えられない問題を修正できますか?
「ブラウザツールを使用して現在の時刻を確認する」と明示的に指示するか、最初のシステムプロンプトに現在の日時を提供することで、精度を向上させることができます。しかし、これらの指示があっても、大規模言語モデルは、会話が長くなりすぎると、時折ドリフトしたり幻覚を見たりする可能性があります。
「コンテキストウィンドウ」とは何ですか?また、それが時間管理にどのように影響しますか?
コンテキストウィンドウとは、AIが一度に考慮できるテキストの量の上限のことです。AIが一度に考慮できるテキストの量の上限のことです。これは、プロンプト、提供されたコンテキスト、会話履歴、モデルの応答など、すべてを含みます。この上限に近づくと、モデルが情報を理解し処理する能力を最大限に活用していることになります。
常に現在の変化する時間をこのウィンドウに注入すると、ウィンドウが散らかり、タイムスタンプの更新のために、モデルは会話の以前の部分を「忘れる」ことを余儀なくされます。
開発者はなぜ大規模言語モデルに内蔵時計を搭載しないのでしょうか?
与えること大規模言語モデル時計は思ったほど単純ではありません。なぜなら、モデルはリアルタイムで「思考」するのではなく、トークンごとにテキストを生成するからです。リアルタイム時計を統合するには、コアモデルの外側に配置される外部アーキテクチャ(エージェントワークフローなど)が必要となり、複雑さと遅延が増加します。
時間を知ることができないのは、AIが実際には知能を持っていない兆候でしょうか?
多くの専門家は、この限界が「機能的な処理」と「真の理解」の違いを浮き彫りにすると主張しています。ChatGPTは高度なレベルで記号や言語を操作できますが、時間的認識の欠如は、人間のような意識や根拠のある知性の基本的な要素を欠いていることを示唆しています。
この問題は、すべてのAIモデルに影響しますか、それともChatGPTだけですか?
この問題は、事前学習済みの静的なデータの同じ基盤アーキテクチャを共有しているため、すべてのネイティブ大規模言語モデルに影響します。しかし、GoogleのGeminiのようなモデルは、検索エンジンやシステムツールとの統合がより緊密であることが多く、同じコアの制限があるにもかかわらず、時間管理タスクにおいてより信頼性が高く見えるようになります。


