top of page

Transfer Learningとは? 新しいタスクでより速く学習するためのAIの活用

転移学習は、あるタスクで学習したモデルが学習済みのパターンを新しい関連タスクに再利用する機械学習手法です。このアプローチにより、2番目のタスクに必要なラベル付きデータ量と計算時間を削減できます。現在、多くのコンピュータビジョンおよび言語システムがこの再利用に依存しています。

転移学習を利用するモデルは、最初の学習実行で獲得した広範なパターンから開始します。これらのパターンは、ランダムな重みから始めることなく、2番目のタスクでのパフォーマンスをガイドします。

Key Takeaways

  • 転移学習は、大規模なソースタスクで学習したパターンを再利用して、小規模なターゲットタスクでの速度と精度を向上させます。

  • この手法は、ソースタスクとターゲットタスクが画像のエッジやテキストの構文などの類似した低レベル特徴を共有する場合に最も効果を発揮します。

  • チームは、データサイズと計算予算に応じて、最終層のみを微調整するか、ネットワーク全体を適応させることができます。

  • タスクの違いが大きすぎる場合や、ソースデータにバイアスが含まれておりそれが引き継がれる場合に制限が現れます。

  • このアプローチが知識ツールにどのように適合するかを確認しますか?ローカルファーストのオプションについてはダウンロードページをご覧ください。

Transfer Learning Definition

転移学習は、大規模なソースデータセットで学習したモデルを取り、その内部表現を新しいターゲットデータセットに適応させます。ソースデータセットは通常公開されており規模が大きい一方、ターゲットデータセットはより小さくタスク特化型です。基本的な前提は、ソースドメインで発見された有用な特徴がターゲットドメインでも関連性を保つというものです。

この実践を定義する3つの属性があります。第一に、ソースタスクとターゲットタスクはある程度の構造を共有する必要があります。そうでなければ再利用は信号ではなくノイズを加えます。第二に、学習は2段階で行われます。ソースでの事前学習に続き、ターゲットでの適応です。第三に、適応は早期層の凍結から全重みの更新まで幅があり、利用可能なターゲットデータの量で制御されます。

How Transfer Learning Works

このプロセスは明確な一連の段階に従います。各段階は前の段階の出力に基づいて構築されます。

Stage 1: Pre-training on a large source domain

モデルは大規模なデータセットで多数のエポック学習します。ビジョンタスクでは、数百万枚のラベル付き写真を含むデータセットが使われる場合があります。言語タスクでは、ウェブテキストから数十億のトークンを含むデータセットが使われる場合があります。初期層はエッジ、テクスチャ、または一般的な単語の共起などの汎用的な特徴を学習します。これらの特徴は再利用可能なビルディングブロックとなります。

Stage 2: Feature extraction or fine-tuning on the target domain

事前学習済みの重みを新しい学習実行に読み込みます。2つの一般的な選択肢があります。特徴抽出では、最終分類器以外の全層を凍結し、そのヘッドのみをターゲットデータで学習します。ファインチューニングでは、ソースの有用な知識を上書きせずに表現を調整できるよう、小さな学習率で一部または全層を更新します。

Stage 3: Evaluation and iteration

ターゲット検証セットでのパフォーマンスが成功を決定します。精度が plateau した場合、対象例を追加したり、凍結する層を調整したり、学習率スケジュールを変更したりします。結果がプロジェクトの閾値を満たすまでサイクルを繰り返します。

Real-World Applications

コンピュータビジョンチームは医療画像に転移学習を適用します。日常の写真で事前学習したモデルは、数 hundred 枚のラベル付きスキャンのみでX線画像の腫瘍を検出できます。エッジや形状のソース特徴が医療ドメインに直接転移します。

自然言語チームは文書分類に同じパターンを使用します。一般的なウェブテキストで事前学習したモデルは、数 thousand 件のラベル付き契約書に触れた後、法的契約レビューの高精度に到達します。事前学習中に学習した構文および意味パターンが、数百万の法的例の必要性を低減します。

ロボット工学研究者はシミュレーションで学習した移動ポリシーを物理ロボットに転移します。ソースタスクは無制限の試行が可能な物理エンジンを使用します。ターゲットタスクは数時間の現実世界センサーデータを使用して、ハードウェアノイズにポリシーを適応させます。

Transfer Learning in Practice - How remio Applies Related Ideas

知識ツールの中で、remio はすべての取得コンテキストをユーザーデバイスに保持する異なるアプローチを取ります。新しい情報が到着すると、システムは外部の学習実行にデータを送信することなく、既存のメモリとブレンドします。このローカルブレンドは、再利用の原則を反映しています。

https://www.remio.ai/knowledge-blending

Common Questions About Transfer Learning

Q: 転移学習ではソースタスクとターゲットタスクが同一である必要がありますか?

A: いいえ。タスクは有用な低レベル特徴を共有するだけで十分です。重なりが小さい場合、パフォーマンス向上は縮小または消失します。

Q: 通常、ターゲットデータはどれくらい必要ですか?

A: ソースモデルが強力な場合、数百から数 thousand のラベル付き例で十分なことが多いです。正確な数はタスクの類似性とモデルサイズに依存します。

Q: ソースデータセットのバイアスはターゲット結果に影響しますか?

A: はい。事前学習中に存在したバイアスが下流の予測に現れる可能性があります。ソースデータの構成を確認し、ターゲット指標で disparate impact を監視することが必要です。

Q: 転移学習は深層ニューラルネットワークに限定されますか?

A: この用語は最も頻繁にニューラルネットワークを指しますが、事前知識を再利用するという基本的なアイデアは、古典的機械学習におけるドメイン適応などの他の手法にも現れます。

Q: ソースとターゲットの分布が大きく異なる場合はどうなりますか?

A: 負の転移が発生する可能性があります。ターゲットタスクでの精度が、ゼロから学習したモデルを下回ります。分布シフトを早期に検出することでこの結果を回避できます。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page