top of page

Google DeepMind、Lyria 3.5を発表。AI音楽の競合に圧力強まる

7月30日
読了時間: 18分

Google DeepMindは7月29日、Lyria 3.5を発表し、4つの改善点を掲げた。AI音楽企業が品質、操作性、著作権をめぐる圧力の高まりに直面する中での発表となる。このモデルは、完成した楽曲を生成・編集する同社のブラウザベースのワークスペース、Google Flow Musicを通じて展開される。

Lyria 3.5の発表によると、このアップデートでは楽曲構成、歌詞、ボーカル、テンポと長さの制御が改善された。これらは、生成音楽で繰り返し指摘されてきた弱点を狙ったものだ。AIが生成する楽曲は数秒間は洗練されて聞こえても、その後に展開を見失ったり、不自然なフレーズを繰り返したり、説得力のある感情を伴わないボーカルになったりすることがある。

そのため、これは単なる定例のモデル刷新にとどまらない。Google DeepMindは、短く印象的なデモから、クリエイターが完成曲を指示・修正できる制作環境へと進もうとしている。Suno、Udio、その他の音楽生成サービスは今後、モデル、制作インターフェース、配信プラットフォーム、透かしシステムを統括する企業と競わなければならない。

Lyria 3.5は生成楽曲の弱点を狙う

Lyria 3.5のアップデートは、AI生成トラックが冒頭の数瞬を過ぎても説得力を保てるかどうかに焦点を当てている。

Googleによると、このモデルはより豊かで複雑なメロディー構造を作り出し、より自然に聞こえるという。ここでいう音楽性とは、リズム、メロディー、ハーモニー、アレンジ、トランジションが、一貫した楽曲としてどのように機能するかを指す。トラックは音質がクリアでも、この基準を満たさないことがある。

この区別は重要だ。音声の忠実度と作曲の質は同じではない。モデルは鮮明なドラムやリアルなギターを生成できても、緊張感や解放感、明確な到達点のないアレンジにしてしまう可能性がある。Lyria 3.5は、こうした根本的な音楽の流れを改善することを目指している。

歌詞も同様に強化される。Googleは、このモデルがプロンプトにより正確に従い、楽曲構成への理解を深めたと主張している。これにより、すべての行を交換可能なテキストとして扱うのではなく、ヴァース、コーラス、ブリッジに意図された役割に歌詞を適合させやすくなるはずだ。

楽曲全体では、構造への理解が特に重要になる。通常、ヴァースでは細部を展開し、コーラスでは中心的なアイデアを反復して凝縮する。そうした機能を無視する歌詞は、技術的には十分なトラックであっても未完成に感じさせかねない。

Googleはまた、Lyria 3.5がより表現力豊かなボーカル、感情のニュアンスを備えた歌唱、より正確な発音を実現するとしている。ボーカルのリアリズムは、正しい言葉を生成するだけでは成立しない。タイミング、強調、息づかい、音程の動き、音色が、楽曲の感情的な方向性と合致する必要がある。

これらの改善は、すでにボーカル、タイミング付きの歌詞、完全なインストゥルメンタルアレンジを生成していたLyria 3を土台としている。Googleの音楽APIドキュメントでは、従来のモデル群について、テキストまたは画像入力から44.1 kHzのステレオ音声を生成すると説明している。Clipモデルは30秒の出力を生成し、Lyria 3 Proは数分間に及ぶ楽曲に対応する。

Lyria 3.5では、出力時間とテンポをより直接的に制御できるようになった。テンポは楽曲の速さであり、通常はビートの速度で捉えられる。テンポ制御が向上すれば、クリエイターはトラックを動画、パフォーマンス、広告、予定されたアレンジに合わせやすくなる。

長さの制御は、別の実用上の制約にも対応する。固定されたシーン用にサウンドトラックを制作するクリエイターは、どのような曲の長さでも受け入れられるわけではない。音楽は、適切なタイミングで転換点やクライマックスに到達する必要がある。

Googleは、各能力がどの程度改善したかを示す比較スコアを公表していない。また、Lyria 3.5をSuno、Udio、Lyria 3 Proと比較したリスニングテストの結果も公開していない。したがって、より広範な検証が利用可能になるまでは、発表された向上点は企業側の主張として扱うべきだ。

それでも、選ばれた対象はGoogleの優先事項を示している。同社は、楽しめる生成結果と、クリエイターが継続して発展させられるトラックを分ける要素の改善を目指している。

Google DeepMindは単なるモデルではなくワークフローを構築している

Lyriaが単独のプロンプト入力欄ではなく、編集ワークフローの中で動作する時、Google DeepMindは最も強い優位性を得る。

Flow Musicではすでに、ユーザーが楽曲を作成、修正、共有できる。Googleは5月、セクション単位の編集機能を追加した。これにより、クリエイターは一部の区間を選択し、トラック全体を置き換えることなく、その歌詞、編成、スタイルを変更できる。

このワークフローは、音楽モデルの価値を変える。ワンショット型の生成ツールでは、ユーザーは完成形を聞く前に説明しなければならない。制作ツールは、最初の出力が出発点にすぎないことを前提にしている。

音楽制作が、指示から最終録音まで一直線に進むことはめったにない。プロデューサーはコーラスを残し、ヴァースから楽器を外し、あるフレーズを書き換え、最後のセクションのエネルギーを変えるかもしれない。局所的な編集は、こうした反復的なプロセスを支える。

Googleの以前のFlow Musicアップデートでは、選択した歌詞の書き換えや翻訳、特定セクションのスタイル変更を行うコントロールが導入された。また、音楽と動画をまたぐ対話型の指示のために、製品をGemini Omniと接続した。

Lyria 3.5は、編集対象となる素材そのものを改善することで、このインターフェースを強化する。より信頼性の高い歌詞により、対象を絞った書き換えが有用になる。発音が改善されれば、許容できるボーカルラインを得るための再生成の必要性は減る。より強固な楽曲構成は、セクション単位の編集により安定した基盤を与える。

この製品の経緯も重要だ。Flow Musicは以前、ProducerAIと呼ばれており、そのチームはこのサービスをミュージシャンが自らの創作活動のために作ったツールだと説明していた。Googleはその後、画像・動画生成と並ぶより広範なFlowファミリーの中にこれを位置付けた。

この統合により、Googleはプロフェッショナルと消費者の制作活動に向けた複数の導線を得る。Geminiはカジュアルユーザーに短い音楽生成を紹介できる。Flow Musicは長尺プロジェクトや詳細な修正を支援できる。YouTubeは、生成されたサウンドトラックを既存のクリエイターワークフローに近づけられる。

Google CloudとGemini APIは、開発者向けに別の導線も作る。企業は消費者向けインターフェースに依存せず、アプリケーション内で音楽生成を活用できる。この幅広い配布は、1つのモデルの改善を複数の製品にまたがるアップグレードへと変えうる。

この戦略は、モデル品質だけでは決定力が弱まるため、専門のAI音楽企業に圧力をかける。競合は優れたトラックを生成できても、クリエイターには編集、プロジェクト管理、共有、書き出し、来歴、配信も必要になる。

Googleは、すでに運営している製品を通じてこれらの段階を接続できる。それがより良い音楽を保証するわけではないが、生成から公開までの摩擦を減らす。

また、フィードバック面での優位性も生まれる。異なるインターフェースは異なるユーザーニーズを明らかにする。Geminiのプロンプトはカジュアルな利用例を示し、Flow Musicは制作時の行動を捉え、開発者APIは企業がどの機能を自動化するかを示す。

その結果、これは従来型のモデル発表よりも深い競争上の立ち位置となる。Lyria 3.5はエンジンの更新だが、Flow Musicは、そのエンジンが繰り返される創作上の意思決定を支えられるかをGoogleが検証する場だ。

Google DeepMind、SunoとUdioにプラットフォームの圧力をかける

競争の中心は、どの企業が1つのプロンプトからもっともらしい曲を生成できるかではなく、誰が完全な制作ワークフローを所有できるかへ移っている。

SunoとUdioは、現代のAI楽曲生成における消費者向けフォーマットの確立に貢献した。ユーザーはジャンル、テーマ、ムード、歌詞のコンセプトを説明し、ボーカル付きでアレンジされたトラックを受け取る。こうした特化型製品により、従来の制作ソフトウェアなしでも音楽生成にアクセスできるようになった。

Google DeepMindは、異なる資産の組み合わせでこの競争に参入している。Lyriaファミリーを開発し、Flow Musicを運営し、YouTubeを所有し、クラウドインフラを販売し、Geminiを消費者向け・ビジネス向け製品に配布している。

各資産は、音楽パイプラインの異なる段階に対応する。モデルが音を生成する。Flow Musicが反復作業を提供する。クラウドサービスが統合を支える。YouTubeは音楽、動画、クリエイター配信の大きな到達先を提供する。

この組み合わせは、個々のモデルが競争力を保っている場合でも、独立系の競合に圧力をかけうる。クリエイターは、単独のベンチマークではなく、ワークフローの利便性に基づいてツールを選ぶことが多い。ファイル転送や繰り返しの設定作業が少ないことは、わずかな音質改善と同じくらい重要になりうる。

Googleは、活動中のアーティストとの直接的な関係構築にも着手している。5月には、選ばれたBelieveおよびTuneCoreのアーティストにFlow Musicへのアクセスを提供するBelieveとの提携を発表した。

参加するアーティストとプロデューサーは、毎週プロダクトチームと会い、フィードバックを提供する予定だ。この取り決めにより、プロフェッショナルが生成素材をどのように利用し、却下し、修正するかをGoogleが学ぶための構造化された経路が得られる。

Googleは、Flow Musicを通じて生成されたオリジナルコンテンツの所有権を主張しないとしている。また、メロディー、歌詞、ジャンル、楽器、ボーカルのアイデアを探るための創造的な協働者として、この製品を位置付けている。

この位置付けは、自動的な置き換えという議論から距離を取ろうとするものだ。モデルが実験を加速させる一方で、ミュージシャンは引き続き演出家である、という提案である。Lyria 3.5の編集コントロールは、生成後にユーザーがより多くの判断を下せるようにするため、この説明を支えている。

ただし、操作性の向上は代替圧力も高めうる。表現力のあるボーカル、実用的な歌詞、対象を絞った修正を備えた完成曲を生成するシステムは、複数の有償クリエイティブ業務と競合できる。そうした業務には、デモ制作、ストック音楽、仮のサウンドトラック、基本的なボーカルモックアップが含まれる。

影響は市場によって異なる。コーラスのアイデアを試すソングライターと、背景音を生成するブランドでは必要とするものが違う。映画音楽の作曲家には、短いクリップを作るSNSクリエイターよりも、タイミングとアレンジの精度が求められる。

SunoとUdioは、モデル改善、ライセンス提携、より強いコミュニティ、特化型ワークフローを通じて対応できる。両社の集中した事業は、Googleの大きな製品組織が慎重に動く領域で迅速に動くことを可能にするかもしれない。

Googleの配布面での優位性は、依然として模倣が難しい。Flow Musicは、すべてのミュージシャンの主要ワークステーションになる必要はない。Googleのより広いクリエイティブ環境における標準の音楽レイヤーになれば、成功しうる。

これが、Lyria 3.5が競争を決着させずに圧力を高める理由だ。Googleは信頼できるフルスタックの道筋を構築した一方、独立系プラットフォームには、熱心なユーザー、認知された製品アイデンティティ、独自の生成ワークフローが残されている。

創作上の制御向上では著作権の対立は解決しない

Lyria 3.5は創作上の制御を改善できても、モデルの背後にある素材を誰が許可したのか、生成曲が活動中のミュージシャンにどう影響するのかという問いには答えない。

Googleは、利用規約、パートナー契約、適用法に基づいてYouTubeとGoogleが使用権を持つ素材を用いてLyriaを訓練したとしている。この表現はGoogleの法的立場を示すものだが、訓練カタログの公開リストを提供するものではない。

この違いは重要だ。なぜなら、許諾はAI音楽をめぐる決定的な争点になっているからだ。レコードレーベルやアーティストは、どの録音物が訓練データセットに入ったのか、そうした利用をどのライセンスがカバーしているのか、クリエイターがどのように金銭面で関与するのかについて、より明確な回答を求めている。

Googleの規模は、こうした問題をより慎重に扱うべきものにしている。YouTubeは膨大な量の音楽をホストしながら、クリエイター、広告主、レーベル、リスナーにもサービスを提供している。Googleは現在、同じ広範な環境で流通し得る音楽を生成できるツールを提供している。

3月にGoogleを相手取って提起された連邦訴訟では、同社のAI音楽システムが著作権保護された録音物を許可なく使用したと主張されている。これらの主張はまだ司法判断を受けておらず、訴状は裁判所の認定ではなく原告側の見解を示すものだ。

同様の紛争はGoogleの競合他社にも及んでいる。Sony Musicは7月、トレーニングのために3万件超の録音物がYouTubeからコピーされたとして、Udioに対する新たな訴訟を起こした。Udioはトレーニング手法を巡る以前の訴訟にも直面しており、一方で業界の契約により、市場の一部はライセンス済みモデルへと移行し始めている。

Udio訴訟は、技術的進歩をデータの権利から切り離せない理由を示している。よりリアルなボーカルと高い音楽性はモデルの有用性を高めるが、その一方で、モデルが参照した録音物との競合を巡る疑問も強める。

Googleは、Lyriaで生成された音楽にSynthIDを適用している。SynthIDは生成音声に埋め込まれる聞き取れない電子透かしであり、対応する検出システムがGoogle AIの出力を識別できるようにする。

同社によると、この音声透かしは圧縮、ノイズの追加、再生速度の調整といった一般的な変更を経ても残存する可能性がある。Googleはまた、アップロードしたメディアにSynthIDマーカーが含まれるかをGeminiに尋ねることも可能にしている。

透かしは来歴の把握に役立つが、解決できるのは問題の一部にすぎない。Google AIが出力を作成または編集したことを示せる一方、モデルの完全なトレーニングデータを公に説明するものでも、生成された楽曲が既存作品を侵害しているかを判断するものでもない。

検出はアクセスと導入状況にも左右される。リスナーはSynthIDを聞き取れず、プラットフォーム側にはこの信号を活用するための適切なツールまたはポリシーが必要となる。即時の開示が必要な場面では、メタデータや可視ラベルが依然として必要になる可能性がある。

規模を巡っては、もう一つ未解決の問題がある。生成性能の向上により、楽曲制作に必要な時間は短くなる。これは個人のクリエイターが試行錯誤する助けになる一方、大量のカタログを自動生産する手段にもなり得る。

ストリーミングサービスは、そうしたカタログをどのようにラベル付けし、推薦し、収益化し、またはフィルタリングするかを決めなければならない。ミュージシャンは、AI支援を自身の創作アイデンティティのどこに位置付けるかを見定める必要がある。権利者は、いつモデルにライセンスを付与し、そこから生まれる収益をどう分配するかを決定しなければならない。

Googleのアーティストとのパートナーシップは、協議への一つの道筋を示している。毎週のフィードバックセッションは製品を形作ることができ、パートナー契約は許諾された利用方法を定められる。しかし、限られたパートナーグループでは、すべての演奏者、作詞作曲家、プロデューサー、独立系権利者を代表することはできない。

本当の試金石は、Googleが権利の枠組みを製品コントロールと同じくらい理解しやすいものにできるかどうかだ。クリエイターは今や、テンポの変更や、より強いボーカル表現を求められる。それでもなお、許可、帰属、報酬についてより明確な答えを必要としている。

Lyria 3.5には依然として独立したリスニングテストが必要

Googleは改善の方向性を示したが、その向上の規模や一貫性を測るには十分な証拠を提示していない。

この発表には、ベンチマーク表、選好スコア、失敗率、Lyria 3 Proとの直接比較が含まれていない。評価に参加したリスナー数や、テストした音楽スタイルの範囲についても説明されていない。

この不在は重要だ。なぜなら、音楽の品質は単純な測定に抵抗するからである。音声の忠実度は技術的な信号を通じてテストできるが、歌詞の質や感情表現は、言語、ジャンル、演奏の伝統、リスナーの期待に大きく依存する。

シンセティック・ポップで機能するボーカルが、ジャズ、オペラ、ヒップホップ、地域固有のスタイルでは通用しないことがある。一つの言語で発音が向上しても、対応するすべての言語で同等の進歩があったことにはならない。テンポ制御が正確でも、セクション間の移行は弱いままかもしれない。

Googleの以前のLyria 3モデルカードでは、人間の専門家と自動化手法を用いた評価が行われたとされている。音楽品質、美的評価、ボーカル品質、音声忠実度、プロンプト遵守度を検証した。同社はLyria 2からの改善を報告したが、公開ページでは詳細な比較数値を公表していない。

したがってLyria 3.5には、複数の観点にわたるより広範なテストが必要だ。レビュー担当者は最も優れたサンプルだけを選ぶのではなく、同一プロンプトから繰り返し生成した結果を比較すべきである。また、狙った編集が変更していないセクションをどの程度維持できるかも検証すべきだ。

反復的な音楽ツールでは、維持性能が極めて重要になる。一つの歌詞を変えたことで、別の箇所の声、ミックス、メロディーまで微妙に変化するなら、クリエイターは局所的な編集への信頼を失う。その場合、このツールは制御された制作ではなく、繰り返しの再生成として振る舞うことになる。

プロンプト遵守度にも同様の精査が必要だ。モデルはテンポや長さに関する明示的な指示には従えても、緊張感、楽器編成、歌詞の視点に関するより繊細な要望を無視する可能性がある。複雑なプロンプトは、制御が本物なのか、ほぼ表面的なものにすぎないのかを明らかにする。

歌詞は、孤立したテキストではなく、実際に歌われる言語として評価すべきだ。文章として正しく読める一行でも、拍の置き方を誤ることがある。紙面上では機能する韻でも、歌うと不自然に聞こえることがある。構造への理解は、言葉をメロディーやアレンジと結び付けなければならない。

ボーカル評価には、トラック全体を通した一貫性も含めるべきだ。AI音声は短いパッセージでは説得力があっても、後半で声色、アクセント、アイデンティティが変わることが多い。より感情的な表現は、不自然に感じられる誇張したフレージングを生むこともある。

実際のクリエイティブ作業も、別の試金石となる。プロデューサーは、アイデアをエクスポートし、修正し、比較し、ときには断念する必要がある。初回再生では印象的に聞こえる生成結果でも、他の素材と統合するのは難しいかもしれない。

Googleが公開比較データを欠いているからといって、改善が小さいことを意味するわけではない。ユーザーは、この発表の主張と検証済みの性能を切り分けるべきだ。リスニングテスト、制作レビュー、反復的なワークフロー試験が、欠けている証拠をもたらすだろう。

最も強いシグナルは、バイラルなデモではない。同じプロジェクトに戻り、制御された修正を行い、その結果得られた素材を使い続けるクリエイターの存在だ。

Lyria 3.5がAI音楽を変えるかを示す3つのシグナル

Lyria 3.5が制作の標準となるのか、それとも短命なモデルアップグレードに終わるのかは、導入、競合の反応、権利ポリシーによって決まる。

最初のシグナルは、Flow Music内での継続的な利用だ。Googleは複数の重要なカテゴリーで改善を発表したが、利用状況や継続率の数値は開示していない。繰り返し編集する行動が見られれば、クリエイターが目新しいトラックの生成を超えた価値を認めていることが分かる。

最も示唆的な活動は、最初の出力の後に起こる。ユーザーは歌詞を書き直し、セクションを調整し、ボーカルを再生成し、未完成の曲に戻るだろうか。こうした行動は、Flow Musicがクリエイティブ・ワークスペースとして機能するというGoogleの主張を裏付けることになる。

クリエイターが一度生成して離脱するなら、音楽性の向上だけではワークフローの問題を解決していない。修正してプロジェクトを完成させるなら、Googleの統合的アプローチは信頼性を増す。

第二のシグナルは、Suno、Udio、その他の競合他社がどう反応するかだ。楽曲構成、長さ、テンポ、局所編集に関する新たなコントロールが登場すれば、Googleが競争の基準線を変えたことを示唆する。ライセンスに関する発表も同じくらい重要になり得る。

音声品質だけに焦点を当てた反応は、競合が依然としてモデル性能を主な戦場と見ていることを示すだろう。編集、来歴、コラボレーション、配信にまたがる反応であれば、Googleのより広範な戦略を裏付けることになる。

Googleはまた、Lyria 3.5がGemini、Vertex AI、または開発者向けAPIに提供されるかを明確にすべきだ。現時点の発表ではFlow Musicが指定されている。より広い配布は導入を拡大し、外部開発者がより多くのユースケースでモデルをテストできるようにする。

第三のシグナルは、著作権ポリシーと訴訟における動きだ。裁判所の判断、ライセンス契約、プラットフォームのラベル表示ルールは、モデルのリリースよりも速く市場を再編し得る。技術的に優れたシステムでも、防御可能なデータ権利と実行可能な配信ポリシーを必要とする。

GoogleのSynthIDシステムは来歴を示す仕組みを提供するが、業界の受容が依然として鍵となる問題だ。ストリーミングサービス、ディストリビューター、権利者がこれを一貫したポリシーに組み込めるようになれば、検出はより有用になる。

クリエイターは、より明確なトレーニング開示、権利者の参加、報酬体系に注目すべきだ。これらのシグナルは、Googleの協力者としての物語を強化するだろう。曖昧さが続けば、創作へのアクセスとクリエイターの同意との対立は未解決のままとなる。

活動中のミュージシャンにとって、実務的な対応は慎重な実験である。複数の出力を比較し、プロンプトと編集内容を記録し、元の素材を保存し、生成作品を公開する前に配信条件を確認することだ。検索可能なプロンプトライブラリも、チームが有用な結果を生んだ指示を追跡する助けになる。

開発者やメディアチームにとって、Lyria 3.5はGoogleが生成を編集と配信に結び付けている点で注目に値する。モデルが主張する改善は重要だが、周辺のシステムはそれ以上に重要である。

目新しさを狙ったプロンプトではなく、実際のクリエイティブブリーフに対してツールを試してほしい。構成に従うか、修正を維持できるか、実際に残したいと思える素材を生み出すかをテストするべきだ。Google DeepMindはAI音楽における次の試験を定義した。Lyria 3.5がそれに合格するかは、クリエイターが決める。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page