AIスケーリング問題:なぜ私たちは間違った種類の人工知能を追い求めているのか
更新日:6月17日
はじめに
人工知能の分野が目が回るような速さで進歩しており、その容赦ないペースについていくのは不可能だという感覚が蔓延しています。毎週のように、新しい見出しが「AIがまた一つ人間のベンチマークを超えた」と宣言しているかのようです。SATで満点を取る、博士レベルの物理学の問題を解く、あるいは複雑なプログラミングの課題をマスターするといった具合に。テックリーダーやソーシャルメディアのインフルエンサーはこの物語を増幅させ、汎用人工知能(AGI)は単に視野に入っているだけでなく、目前に迫っているのだと示唆しています。 この絶え間ないブレイクスルーの連発は、高度なスキルを持つ人間の仕事が廃止の危機に瀕しているのではないかと、誰をも立ち止まらせ、不安にさせます。
しかし、大手テック企業やメディアのハイプによって売り込まれたこの一般的なAGIのビジョンは、根本的に誤解を招くものです。今日のAIモデルは非常に強力ですが、人間の知能を再現するための直接的な道筋にあるわけではありません。その理由は、知能とは真に何であるかという根深い誤解にあります。私たちは「AIが知識を応用する能力を測定すること」に執着するようになりましたが、知識を「獲得」する能力については、ほぼ完全に無視してきました。このギャップこそがAIスケーリング問題の本質であり、少なくとも一つの決定的な点において、私たちは正しい方向にさえ進んでいないことを明らかにしています。
AIスケーリング問題とは一体何か? — 進歩という名の幻想

AIのスケーリング問題は、モデルのサイズや使用する計算リソースの量に関するものではありません。それは、現在のAI開発パラダイムにおける根本的な欠陥に関するものです。AIをより賢くするためには、より巨大なニューラルネットワークを構築し、より多くのデータで学習させるだけでよいという考えが主流です。この「ビッグデータ」マインドセットは、ある時点までは驚異的な効果を発揮してきましたが、現在は壁に突き当たっています。真の問題は、現在の手法が「計算リソースとデータ」の組み合わせによってスケールしており、そのデータの使用効率が極めて低いという点にあります。
AIスケーリング問題の本質は、主に計算リソースをより効果的に活用することで、より知的で有能になるアルゴリズムを設計するという挑戦にあります。単にインターネット上の情報をより多く暗記するのではなく、真に知的なエージェントは、自身の経験を取り込み、より多くの思考時間(計算リソース)をかけることで、より深い洞察を抽出し、新たな繋がりを形成し、すでに見たものからより多くを学べるようになるべきです。
進歩しているという錯覚は、学習能力ではなくタスクの完了率を測定するベンチマーク. AIは、学習データ内で無数の類似した問題を目にすることでテストで満点を取ることができますが、これは基礎となる概念を柔軟で汎用的な方法で理解していることを意味しません。真の知能とは、知識やスキルを習得し、それを応用する能力によって定義されます。現在のモデルは応用の達人ですが、非常に高額な初期トレーニングプロセスが完了した後に新しい知識を習得する能力は、著しく制限されています。
なぜAIのスケーリング問題がAGIへの決定的な障壁となるのか

AIのスケーリング問題を無視することは、ますます洗練されてはいるものの、最終的には脆弱なシステムを構築していることを意味します。これらのモデルは、驚異的な検索機能を備えた百科事典のようなものです。膨大な情報を保持していますが、真に新しい知識を生み出したり、学習データから大きく外れたシナリオに適応したりする能力に欠けています。これは、AGIの達成を妨げるいくつかの重大な制限につながります。
第一に、現在のAIはパーソナライゼーションやニッチなタスクに苦労しています。LLMにクリエイティブなアイデアを求めると、あなたの独自のスタイルや文脈を学習できないため、一般的で味気ない提案を生成することがよくあります。同様に、あまり普及していないプログラミングライブラリの使用を依頼すると、そのスキルを「学習」するために必要な数百万もの例を見ていないため、失敗する可能性が高いでしょう。新しい概念を把握するために数百万の例を必要とするエージェントは、定義上、何も学習することはできません。大規模なデータセットがすでに存在する事柄しか学習できないのです。
第二に、現在のアプローチには長期的な推論や創造性のための基盤が欠けています。人間の創造性は、既存の知識をランダムにサンプリングすることから生まれるのではありません。それは、私たちの視点を形作る、ユニークで継続的な生涯の経験から生まれます。継続的な相互作用の流れから学習する能力がなければ、AIがこのようなニュアンスに富んだ、文脈を認識できる知能を発達させることは決してありません。それは既存の情報をリミックスするためのツールのままであり、真に斬新な洞察を生み出すためのエンジンにはなり得ないのです。
AIにおける学習の進化:忘れ去られた道
興味深いことに、巨大で静的なデータセットへの執着は、AIの歴史においては比較的最近の現象です。初期のAI研究は、動物のような継続的な学習を模倣するシステムの構築にはるかに焦点を当てていました。1930年代まで遡ると、Thomas Rossとその「思考機械」、そしてその後のパイオニアである 迷路の進み方を学習できるロボットラットを開発した Steven Smith らは、知能の本質が適応であり、世界との相互作用から学ぶことにあると理解していました。
これらの初期のシステムは、学習が一回限りのイベントではなく、継続的なプロセスであるという理解のもとに設計されていました。知的なエージェントは、実行と学習を同時に行う単一のフェーズの中に存在するべきです。トレーニング、ファインチューニング、そしてデプロイ(その後、モデルの重みはしばしば永久に固定される)というフェーズを厳格に分ける現代のパイプラインは、このより有機的で、おそらくより正しい知能の捉え方からは逸脱しています。動的な学習よりも静的な知識を優先することで、私たちは AGI への最も有望な道から外れてしまったのかもしれません。
AI スケーリング問題を克服するための3つの柱

汎用学習アルゴリズムとして定義される、より意義のある形式の AGI への軌道に戻るためには、一般的な議論で見落とされがちな3つの重要な研究領域に焦点を移す必要があります。
真の継続的学習(Continual Learning)の採用
第一の、そして最も重要な柱は 継続的学習(continual learning):AIエージェントは学習を止めるべきではないという考え方です。AIは、その存在期間を通じて新しい情報を統合し、世界に対する理解を更新し、新しいスキルを習得し続けなければなりません。
現在のモデルは、ファインチューニングやインコンテキスト学習といった手法を通じて、すでにこれを実現していると主張する人もいるかもしれません。しかし、これらの手法は不十分です。新しいタスクでモデルを再学習させるファインチューニングは、しばしば破滅的忘却(catastrophic forgetting)と呼ばれる問題を引き起こし、モデルが以前に知っていたことを忘れてしまいます。また、ファインチューニングを繰り返すと可塑性が失われ、時間の経過とともにモデルの学習能力が低下する可能性もあります。プロンプト内で新しい情報を与えるインコンテキスト学習も、一時的な解決策に過ぎません。その知識はその特定のやり取りの間だけ保持され、モデルのコアパラメータは固定されたままであるため、情報がコンテキストウィンドウから外れるとすぐに消えてしまいます。
単一の体験的ストリームからの学習
第二の柱は、現在のトレーニング手法からの根本的な脱却を必要とします。インターネットからランダムにサンプリングされた何十億ものバラバラなテキストセグメントから学習するのではなく、エージェントは人間と同じように、単一の連続した体験データストリームから学習しなければなりません。
私たちの生活は、ランダムなデータポイントの集まりではありません。それらは時間的に相関のある一連の出来事です。この連続的なストリームこそが、私たちにエピソード記憶、長期的な因果関係の理解、そして創造性の源となる独自の視点を与えてくれるのです。ソースのトランスクリプトの著者は、自身のビデオのアイデアは、アカデミアやスタートアップでの独自の個人的な経験の連続から生まれたものであり、汎用的なLLMでは決して再現できない履歴であると述べています。AIが真の推論と独創性を発達させるためには、自らの経験を生成し、そこから学習できなければなりません。生涯にわたるインタラクションの連続(世界との関わり)。
スケールの再定義—データ量だけでなく、計算資源(Compute)の拡大へ
最後の柱は、データと計算資源の組み合わせではなく、計算資源のみでスケールするアルゴリズムを開発することです。私たちは急速に、インターネット上で利用可能な高品質データの限界に近づいています。技術関係者の間では、次世代モデルのトレーニングにおけるデータ不足の問題がすでに報告されています。これは「データの不足」ではなく「アプローチの問題」です。人間はインターネットのすべてを読まなくても非常に知的になれるという事実は、膨大なデータ量だけが正解ではないことを証明しています。
未来は、よりデータ効率の高い手法を構築することにあります。計算能力が高まれば、これらのアルゴリズムは既存のデータに対してより「深く思考」し、より多くの知識を抽出し、より深いパターンを発見し、一瞬一瞬の経験からより多くを学べるようになるはずです。有望な研究分野としては、モデルベース強化学習 および 表現学習のための補助タスク はすでにこの方向性を模索していますが、さらなる研究が必要です。
AIの未来:万能の知から、万能の学習への転換
remio の北極星、すなわち AI研究 の指針は変わらなければなりません。膨大なデータを暗記し、あらゆるタスクに汎化できる単一の「全知全能」のエージェントを作るという非現実的な目標から脱却する必要があります。この視点は、学習という根本的な重要性を取り込めていないからです。
私たちが目指すべきAIの未来は、あらゆるものから学習できるエージェントです。自らの目標を持ち、自律的にデータストリームを制御して自学自習できるエージェント。人間を教えるときと同じように、自然なやり取りを通じて教えることができるエージェント。これこそが、継続的に適応し、パーソナライズされ、成長し続けるシステムである「万能の学習(all-learning)」AIのビジョンです。
結論:AIスケーリング問題に関する重要なポイント
AIの目覚ましい進歩は本物ですが、私たちの解釈には欠陥があります。私たちは、静的ベンチマークにおける目覚ましいパフォーマンス は真の知能を目指す上で、私たちを AGI(汎用人工知能)には決して到達できない道へと導いているのかもしれません。AIのスケーリング問題はこの重大な誤りを浮き彫りにしています。真の知能とは「何を知っているか」ではなく、「学習する能力」にあるのです。
次世代のAIを構築するためには、新しいパラダイムの3つの柱を中心に、私たちの取り組みを再構築しなければなりません。
真の継続学習(True Continual Learning):その存在期間を通じて、忘れることなく学習し続けるエージェントの構築。
単一の経験ストリーム: AIが継続的かつ個人的なデータフローから学習できるようにし、創造性と長期的な推論を育みます。
計算量によるスケーリング: 経験からより深い理解を抽出するために計算リソースを活用する、データ効率の高いアルゴリズムを設計すること。
万能なアーカイブの構築から、あらゆることを学習するエージェントの育成へと焦点を移すことで、現在の限界を超え、私たち自身と同じようにダイナミックで適応力があり、機知に富んだ人工知能に向けた真の進歩を始めることができます。
AIスケーリング問題に関するよくある質問(FAQ)

1. AIスケーリング問題とは簡単に言うと何ですか?
そのAIスケーリング問題は、AIモデルを大規模化し、より多くのデータを与えるだけでは、真の人間のような知能には繋がらないという課題です。核心的な問題は、現在のAIが新しい経験から継続的に学習するのが非常に苦手であり、代わりに大規模な一回限りのトレーニングプロセスに依存していることです。目標は、単にデータを消費するのではなく、処理能力(コンピュート)をより効率的に使用することで、より賢くなるAIを構築することです。
2. なぜChatGPTのようなAIは、私の個人的な好みを永続的に学習できないのですか?
ChatGPTや同様のモデルが永続的に学習できないのは、その基盤となるアーキテクチャに起因します。1回の会話の中で提供された情報を「コンテキスト内」で使用することはできますが、この知識は一時的なものであり、会話が終了すると忘れられてしまいます。これらのコアプログラムは、個々のユーザーとのやり取りから継続的かつ永続的にアップデートを行うようには設計されていません。これは、continual learning(継続学習)という概念が解決しようとしている主要な制限です。
3. 「継続学習」は、AIモデルの再トレーニングやファインチューニングとどう違うのですか?
モデルをゼロから再トレーニングすることは、非常にコストがかかり非現実的です。ファインチューニングは部分的なアップデートですが、多くの場合、モデルが以前の知識を忘れてしまう原因となります。これは「破滅的忘却(catastrophic forgetting)」と呼ばれる問題です。対照的に、継続学習は、人間と同じように、既存の知識を損なうことなく、新しい情報やスキルを時間の経過とともにシームレスかつ効率的に統合できるAIの理想的な能力を指します。
4. 研究者は AI スケーリング問題の解決にどのように着手すればよいでしょうか?
研究者は、この記事で概説されている3つの主要な柱に焦点を当てることができます。これには、破滅的忘却を克服する継続学習(continual learning)のための新しいアルゴリズムの開発、大規模なランダムバッチではなく、単一の連続的なデータストリームから効果的に学習できるモデルの設計、そして、データ効率の高い手法(利用可能な計算量に応じてパフォーマンスがスケールし、より少ないデータからより多くを学習できる手法)の構築が含まれます。
5. もし AI スケーリング問題が解決されたら、「オールラーニング(all-learning)」な AI はどのような姿になるでしょうか?
「オールラーニング」な AI は、今日のモデルよりもはるかに協調的で、パーソナライズされたものになるでしょう。わずか数回のやり取りから、ユーザー固有の仕事のスタイルやクリエイティブな好み、あるいはニッチな技術スキルを学習できるようになります。長期的なプロジェクトについて推論し、独自の経験に基づいて真に斬新なアイデアを生み出し、開発者による再学習を必要とせずに世界の新しい情報に適応することが可能になります。それは静的な百科事典というよりも、ダイナミックに進化し続ける知的なパートナーのような存在になるでしょう。



