top of page

Generally AI – シーズン2、第1話:生成AIと創造性

Generally AIの第2シーズンは、いまや研究室をはるかに超えて広がる問いから始まります。ソフトウェアが書籍、楽曲、サンプル、エッセイ、画像をほぼ瞬時に生み出せるようになったとき、創造性はどうなるのでしょうか。司会者たちは、実践的な実験、技術的な評価手法、そしてすでにオンラインで注目を競っている合成メディアの事例を通じて、このテーマに取り組みます。

彼らの対話からは、二つの異なる物語が同時に進行していることが浮かび上がります。生成AIは使い捨ての素材で市場をあふれさせる可能性がある一方、アーティストに非常に柔軟な生のアイデアの源も与えられます。その違いを理解するには、機械がもっともらしいものを生成できるかどうかを超えて、その出力が有用か、制御可能か、独創的か、そして人間の観客の時間を費やす価値があるかを問う必要があります。

AI生成書籍と豊富さの経済学

このエピソードは、オンラインで販売されている書籍に関するオランダの調査から始まります。調査対象となったおよそ323,000冊のうち、約2%がAI生成と見られました。推定割合は急上昇しており、ChatGPT登場前のおよそ0.1%から、2024年4月には4.2%に達していました。

これらの数字は、原稿の制作に何か月もの作業が必要でなくなったとき、出版がどれほど急速に変化するかを示しています。司会者たちは、Amazonが著者1人あたり1日3冊という上限を設けていることに触れます。この制限は産業規模のアップロードを抑えるかもしれませんが、通常の執筆基準からすれば、依然として驚異的な生産速度です。

品質もまた懸念事項です。AI生成と疑われる書籍の多くは、星2つ以下の評価を受けていました。特に示唆的な失敗例として、ある顧客は意図された文章ではなくAIへの指示文を含む本を受け取ったと報じられています。これは、誰かが最終テキストを確認すらせずにその素材を出版した証拠です。

問題は、平凡な本が増えることだけではありません。安価な合成タイトルは検索結果を埋め尽くし、信頼できる作品を見つけにくくする可能性があります。エピソードの終盤で司会者たちは、オランダの書店でオッペンハイマーの伝記を検索したところ、映画と関連する高く評価された伝記American Prometheusが目立つ形で表示される代わりに、AI制作の代替作品に遭遇したと語ります。彼らは、健康、セルフヘルプ、マネジメント、自己啓発がAI生成出版物を引き寄せているカテゴリーに含まれることを、とりわけ問題視しています。こうした分野での誤りは、刺激に欠ける小説よりも大きな害をもたらしかねません。

ノベルティソングから果てしない合成音楽の流れへ

AI音楽は、ポッドキャストの第1シーズン以降、大きく進歩しています。司会者たちはSunoについて話し、ほぼあらゆるプロンプトを題材に、耳に残る洗練された楽曲を生成するという発想を試します。猫をテーマにしたトラックは、この技術が持つ即時的な魅力を示します。それはアップビートで、記憶に残り、どのように組み立てられたかを知らなくても簡単に楽しめます。

その手軽さは、極端な量の出力も可能にします。このエピソードでは、あるクリエイターが1日でSpotifyに複数の猫テーマのアルバムをリリースした例が紹介されます。こうした慣行が一般的になれば、ストリーミングサービスは最終的に、書籍プラットフォームが導入したものに匹敵するアップロード制限を必要とするかもしれません。

ある司会者は、生成された楽曲を従来のストリーミング音楽の代替として扱う実験をします。最初は楽しい体験ですが、絶え間ないポップ志向はすぐに疲れるものになります。これは、最初の驚きによって隠されている制約を指し示しています。音楽は十分に巧みに聞こえても、幅、抑制、持続する芸術的アイデンティティを欠くことがあります。

この区別は重要です。心地よい一曲を生み出せるジェネレーターが、人々が繰り返し聴き返す作品群を必ずしも作っているとは限りません。新奇さは一度だけ注目を集めますが、意味のある変化と芸術的意図がそれを持続させます。

AIは完成品ではなく、創作素材として最も力を発揮する

このエピソードは、自動的な楽曲制作から、ミュージシャンが能動的に操作できるツールへと話題を移すと、より楽観的になります。司会者たちは、AI生成の音楽要素をライブのループや演奏とミックスしたGoogleのデモンストレーションについて語ります。ここで機械は、自律的な作曲家というより、拡張可能な楽器として機能します。

この協働モデルは、より強い創造的な提案をもたらします。ミュージシャンは、未知のテクスチャーを生成し、その断片を切り出し、リズムを変え、既存のループと組み合わせ、それを元のシステムには予測できなかったものへと変化させるかもしれません。人間は、選択、構成、センス、方向性に責任を持ち続けます。

AIサンプルジェネレーターは、このワークフローを具体的なものにします。エピソードで取り上げられるあるサービスは、ファンキーなメロディー、ピアノのフレーズ、特定のストリングスのテクスチャーといった説明から、短いオーディオクリップを生成します。得られる2〜4秒の音はサンプラーに読み込まれ、ビートへと再構成できます。

司会者たちは、このプロセスを無限にあるレコード箱を掘り出す行為になぞらえます。しかし、従来のクレート・ディギングとは異なり、元となる素材は発見するのではなく、求めることができます。Teenage Engineering PO-33サンプラーは、不完全な生成クリップがより大きな楽曲の材料になり得ることを、手を動かす形で実演します。

これは、AI支援による創造性について、より生産的な定義です。完成した成果物のためにボタンを押すことではなく、生成を用いて、人間の判断に利用できる素材の空間を広げることです。

オーディオ生成が依然として正確な指示に抵抗する理由

サンプル実験は、この技術の弱点も明らかにします。出力には一貫性がなく、使用できる音を得るには繰り返し試す必要があるかもしれません。クリップの始まりが早すぎたり、不自然な盛り上がりを伴ったり、要求以上の動きが含まれたりすることがあります。

司会者たちは、単一でクリーンな音を求める難しさを説明します。たとえばアヒルの鳴き声を一つだけ求めるプロンプトが、複数の鳴き声やノイジーな連続音を生み出すことがあります。モデルは、沈黙が持つ音楽的な価値を尊重するよりも、利用可能な時間を埋めたがっているように見えます。

一部のアーティファクトは、モデルの出力をオーディオ波形へ変換する過程で生じる可能性があります。トークンベースの生成とデコーディングは、ノイズを導入したり忠実度を下げたりすることがあります。しかし、より大きな障害はインタラクションです。人間の協働者なら、「ベースをもっと暗くして」「その音をもっと長く伸ばして」「アタックの前にもっと間を空けて」といった依頼を理解できます。現在のツールは、そのような反復的で音楽を理解したフィードバックを一貫して支援できていません。

司会者たちは、ドラムやストリングスでベースラインに伴奏でき、ひょっとするとエフェクトペダルの中に組み込まれるようなシステムを想像します。こうしたツールがあれば、ミュージシャンは孤立したテキストプロンプトを繰り返し送るのではなく、応答する機械とジャムセッションができるようになります。このエピソードは、このリアルタイムのパートナーシップが、信頼できる製品というよりは、いまだ願望に近いことを示しています。

テキストからサンプルを作るツールと著作権の問題

エピソードで取り上げられる別のテキストからサンプルを作るアプリケーションは、スタンドアロンプログラムまたはプラグインとして実行でき、生成されたクリップをバーチャル楽器やドラムキットへドラッグできます。ローカルで実行されるバージョンは、音楽生成モデルをMacBookにダウンロードし、寛容なライセンスを持つモデルがさまざまな制作ツール内のコンポーネントになり得ることを示しています。

生成されたサンプルは、既存楽曲から録音を抽出する代替手段にもなり得ます。従来のサンプリングには、特に借用した断片に大きく依存するミュージシャンにとって、複雑な権利処理が必要になることがあります。Beastie BoysのPaul’s Boutiqueのようなアルバムは、サンプリングがいかに創造的に強力であり得るかを示す一方、ライセンス環境がまったく異なっていた時代も思い起こさせます。

合成サンプルが、法的または倫理的な問題をすべて自動的に解消するわけではありません。それでも、新たなソースオーディオを生成することで、認識可能な著作権保護された録音への依存を減らし、サンプルベースのアーティストに、作り変えるためのより多くの素材を与えられるかもしれません。

単一の正解がない創造性を測定する

このエピソードにおける二つ目の大きなテーマは、評価です。従来の分類器は既知のラベルに対してテストでき、回帰モデルは期待される数値と比較できます。しかし、創造的な生成には、これほど明確な目標があることはめったにありません。あるプロンプトに対して、普遍的に正しい歌、エッセイ、画像というものは存在しないのです。

それでも、言語モデルの訓練は測定可能なシグナルを提供します。次トークン予測は損失値を生み出し、スケーリング則は、期待される性能をモデルの規模、訓練データ、計算量に関連付けます。しかし、損失が低いことはあくまで代理指標にすぎません。ユーザーが最終的に気にするのは、モデルが質問に答え、指示に従い、正確に要約し、あるいは価値のあるものを作り出せるかどうかです。

MMLUのようなベンチマークは、検証可能な答えを持つ質問を通じて知識をテストし、公開リーダーボードは複数のタスクにわたってモデルを比較します。これらの手法は、成功を客観的に採点できる場合に最もよく機能します。自由度の高い文章作成に対しては、決定力が弱くなります。

テキスト指標は部分的な解決策を提供します。BLEUとROUGEは、重複する単語または単語列を通じて生成テキストを参照文と比較し、それぞれ異なる精度と再現率の側面を重視します。一方、BERTベースのスコアリングは意味表現を比較するため、異なる言葉で表現された類似の意味を認識できます。とはいえ、参照文との類似が、必ずしも品質や創造性と同じとは限りません。

画像生成も同じジレンマに直面します。Fréchet Inception Distanceは、生成画像群と参照画像群の統計的表現を比較します。CLIPベースのスコアリングは、画像がそのプロンプトに対応しているかを推定します。どちらも有用ですが、視覚的な一貫性、独創性、人間の好みを完全に捉えるものではありません。審査役として使われるモデルも、それ自身の弱点を引き継ぎます。たとえば、物体を正確に数えることの難しさです。

人間の選好、モデルランキング、RLHF

客観的な採点が限界に達すると、ホストたちは人間の判断に立ち返ります。人は二つの出力を並べて比較し、より良いほうを選べます。これはエピソードでいう「検眼士」のアプローチです。絶対的な品質スコアが存在しなくても、比較を繰り返すことでElo方式のランキングを作成できます。

同じ原則は、人間のフィードバックからの強化学習も支えています。評価者はプロンプトに対する複数の応答を順位付けし、言語モデルをより役立つものにし、ユーザーの意図により適合させるために利用できる選好データを作ります。

研究者は、あるモデルに別のモデルを評価させることもでき、人間によるレビューのコストを削減できる可能性があります。しかし、これは循環的な問題をもたらします。機械の審査役はバイアスを再現したり、誤りを見逃したり、テスト対象のモデルと同じ表面的な性質に報酬を与えたりするかもしれません。自動評価は監督をスケールさせられますが、人間の基準を不要にするわけではありません。

ホストたちの実践的な結論は、AIは人々が意図したことを達成する手助けをするときに成功する、というものです。したがって、創造的なシステムにとって最終的なテストは、単なる技術的なもっともらしさではありません。人々がその結果に価値を見いだすかどうかです。

生成AIにおけるクレバー・ハンスの警告

動物知能に関する終盤の議論は、適切な注意を与えます。かつて算術ができると信じられていた馬、クレバー・ハンスは、最終的には近くにいる人間の微妙な合図に反応していたことが示されました。観察者たちは、異なる仕組みによって生み出された行動に、高度な推論を見いだしていたのです。

生成AIも同様の解釈上のリスクを招きます。流暢な言語や魅力的なメディアは、人々にシステムの意図や理解を投影させることがあります。ときには、曖昧な出力に意味を与える人間の観察者こそが、最も創造的な行為を行っているのです。

だからといって、この技術が役に立たないわけではありません。むしろ、どこに価値があるのかを明確にします。生成システムは驚くほど大量の素材を生み出せますが、どの断片が注目に値するか、それをどう発展させるべきか、そして最終的に何を意味するのかを決めるのは、依然として人間です。このエピソードが示すように、豊富さを生み出すのは容易です。判断力こそが、希少な創造的資源であり続けます。

情報源

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page