top of page

Google DeepMind lancia Lyria 3.5, aumentando la pressione sui rivali della musica AI

30 lug
Tempo di lettura: 13 min

Google DeepMind ha lanciato Lyria 3.5 il 29 luglio, presentando quattro miglioramenti dichiarati mentre le aziende di musica AI affrontano una pressione crescente su qualità, controllo e copyright. Il modello viene distribuito tramite Google Flow Music, l'ambiente di lavoro basato su browser dell'azienda per generare e modificare brani completi.

L'aggiornamento migliora la struttura musicale, i testi, le voci e il controllo su tempo e durata, secondo il lancio di Lyria 3.5. Queste categorie riguardano debolezze ben note della musica generata. Le canzoni AI possono sembrare curate per alcuni secondi, poi perdere direzione, ripetere frasi goffe o proporre voci prive di un'emozione convincente.

Questo rende l'annuncio più di un normale aggiornamento del modello. Google DeepMind sta passando da brevi dimostrazioni d'effetto a un ambiente di produzione in cui i creatori possono dirigere e rivedere tracce complete. Suno, Udio e altri generatori musicali devono ora competere con un'azienda che controlla il modello, l'interfaccia creativa, le piattaforme di distribuzione e il sistema di watermarking.

Lyria 3.5 punta alle parti più deboli delle canzoni generate

L'aggiornamento Lyria 3.5 si concentra sulla capacità di una traccia generata dall'AI di restare convincente dopo i primi istanti.

Google afferma che il modello crea strutture melodiche più ricche e complesse, dal suono più naturale. In questo contesto, la musicalità descrive il modo in cui ritmo, melodia, armonia, arrangiamento e transizioni collaborano per formare una composizione coerente. Una traccia può avere un audio pulito e fallire comunque questo test.

La distinzione è importante perché fedeltà audio e qualità compositiva non sono la stessa cosa. Un modello può generare batterie nitide e chitarre realistiche, ma organizzarle senza tensione, rilascio o una meta chiara. Lyria 3.5 è pensato per migliorare quel movimento musicale di fondo.

I testi ricevono un aggiornamento simile. Google sostiene che il modello segua i prompt con maggiore accuratezza e dimostri una migliore consapevolezza della struttura della canzone. Questo dovrebbe aiutare i testi ad adattarsi ai ruoli previsti di strofe, ritornelli e bridge, invece di trattare ogni verso come testo intercambiabile.

La consapevolezza strutturale è particolarmente importante nelle canzoni complete. Una strofa di solito sviluppa i dettagli, mentre un ritornello ripete e concentra l'idea centrale. Testi che ignorano queste funzioni possono far sembrare incompleta una traccia tecnicamente competente.

Google afferma inoltre che Lyria 3.5 produce voci più espressive, interpretazioni emotivamente sfumate e una pronuncia migliore. Il realismo vocale dipende da molto più che dalla generazione delle parole corrette. Tempismo, enfasi, respiro, movimento dell'intonazione e timbro devono corrispondere alla direzione emotiva della canzone.

Questi miglioramenti si basano su Lyria 3, che già generava voci, testi sincronizzati e arrangiamenti strumentali completi. La documentazione dell'API musicale di Google descrive la famiglia precedente come capace di produrre audio stereo a 44,1 kHz da input testuali o visivi. Il suo modello Clip crea output di 30 secondi, mentre Lyria 3 Pro supporta canzoni della durata di alcuni minuti.

Lyria 3.5 aggiunge un controllo più diretto sulla durata dell'output e sul tempo. Il tempo è la velocità di una composizione, solitamente intesa attraverso la sua frequenza di battuta. Un miglior controllo del tempo aiuta i creatori ad abbinare una traccia a un video, una performance, una pubblicità o un arrangiamento pianificato.

Il controllo della durata affronta un altro vincolo pratico. Un creatore che produce una colonna sonora per una scena di durata fissa non può semplicemente accettare qualsiasi lunghezza del brano. La musica deve raggiungere transizioni e climax in momenti utili.

Google non ha pubblicato punteggi comparativi che mostrino di quanto sia migliorata ciascuna capacità. Non ha nemmeno diffuso risultati di test d'ascolto che confrontino Lyria 3.5 con Suno, Udio o Lyria 3 Pro. I miglioramenti annunciati dovrebbero quindi essere considerati dichiarazioni dell'azienda fino a quando non saranno disponibili test più ampi.

Tuttavia, gli obiettivi scelti rivelano le priorità di Google. L'azienda sta cercando di migliorare gli elementi che separano una generazione divertente da una traccia che i creatori possono continuare a sviluppare.

Google DeepMind sta costruendo un workflow, non solo un modello

Google DeepMind ottiene il suo vantaggio più forte quando Lyria opera all'interno di un workflow di editing anziché in una casella di prompt autonoma.

Flow Music consente già agli utenti di creare, rivedere e condividere canzoni. A maggio Google ha aggiunto l'editing a livello di sezione, permettendo ai creatori di selezionare un passaggio e modificarne testi, strumentazione o stile senza sostituire l'intera traccia.

Questo workflow cambia il valore di un modello musicale. Un generatore one-shot chiede agli utenti di descrivere un risultato finito prima di ascoltarlo. Uno strumento di produzione presuppone che il primo output sia solo un punto di partenza.

La creazione musicale raramente segue una linea retta dall'istruzione alla registrazione finale. Un produttore potrebbe preservare il ritornello, rimuovere uno strumento dalla strofa, riscrivere una frase e cambiare l'energia della sezione finale. L'editing locale supporta questo processo iterativo.

Il precedente aggiornamento di Flow Music di Google ha introdotto controlli per riscrivere o tradurre testi selezionati e per rielaborare nello stile desiderato sezioni specifiche. Ha inoltre collegato il prodotto con Gemini Omni per una guida conversazionale tra musica e video.

Lyria 3.5 rafforza questa interfaccia migliorando il materiale da modificare. Testi più affidabili rendono utili le riscritture mirate. Una pronuncia migliore riduce la necessità di rigenerare linee vocali accettabili. Una struttura musicale più solida offre all'editing a livello di sezione una base più stabile.

Anche la storia del prodotto è rilevante. Flow Music si chiamava in precedenza ProducerAI e il suo team descriveva il servizio come uno strumento creato da musicisti per il proprio lavoro creativo. Da allora Google lo ha inserito nella più ampia famiglia Flow, accanto alla generazione di immagini e video.

Questa integrazione offre a Google diverse vie d'accesso alla creazione professionale e consumer. Gemini può introdurre gli utenti occasionali alla generazione di brevi brani musicali. Flow Music può supportare progetti più lunghi e revisioni dettagliate. YouTube può avvicinare le colonne sonore generate ai workflow già esistenti dei creatori.

Google Cloud e l'API Gemini creano un'altra strada per gli sviluppatori. Le aziende possono usare la generazione musicale all'interno delle applicazioni senza dipendere dall'interfaccia consumer. Questa ampia distribuzione può trasformare i miglioramenti di un modello in aggiornamenti per diversi prodotti.

La strategia mette sotto pressione le aziende specializzate nella musica AI perché la qualità del modello da sola diventa meno decisiva. Un rivale può generare una traccia forte, ma i creatori hanno anche bisogno di editing, gestione dei progetti, condivisione, esportazione, provenienza e distribuzione.

Google può collegare queste fasi attraverso prodotti che già gestisce. Questo non garantisce musica migliore, ma riduce l'attrito tra generazione e pubblicazione.

Crea anche un vantaggio in termini di feedback. Interfacce diverse fanno emergere esigenze degli utenti diverse. I prompt di Gemini rivelano casi d'uso occasionali, Flow Music raccoglie comportamenti di produzione e le API per sviluppatori mostrano quali funzionalità le aziende automatizzano.

Il risultato è una posizione competitiva più profonda rispetto a un rilascio convenzionale di un modello. Lyria 3.5 è l'aggiornamento del motore, ma Flow Music è il luogo in cui Google verifica se quel motore può sostenere decisioni creative ripetute.

Google DeepMind mette Suno e Udio sotto pressione di piattaforma

La sfida centrale non riguarda più quale azienda possa generare una canzone plausibile da un singolo prompt, ma quale possa possedere l'intero workflow creativo.

Suno e Udio hanno contribuito a stabilire il formato consumer della moderna generazione di canzoni con l'AI. Gli utenti descrivono un genere, un tema, un'atmosfera o un concetto lirico, quindi ricevono una traccia arrangiata con voci. I loro prodotti mirati hanno reso la generazione musicale accessibile senza software di produzione tradizionale.

Google DeepMind entra in questa competizione con una diversa raccolta di risorse. Sviluppa la famiglia Lyria, gestisce Flow Music, possiede YouTube, vende infrastruttura cloud e distribuisce Gemini attraverso prodotti consumer e aziendali.

Ogni risorsa affronta una fase diversa della pipeline musicale. Il modello genera il suono. Flow Music consente l'iterazione. I servizi cloud supportano le integrazioni. YouTube offre un'ampia destinazione per musica, video e distribuzione dei creatori.

Questa combinazione può mettere sotto pressione i concorrenti indipendenti anche quando i loro singoli modelli restano competitivi. I creatori spesso scelgono gli strumenti in base alla comodità del workflow, non a un benchmark isolato. Un minor numero di trasferimenti di file e passaggi di configurazione ripetuti può contare quanto un miglioramento marginale dell'audio.

Google ha anche iniziato a costruire rapporti diretti con artisti professionisti. A maggio ha annunciato una partnership con Believe che offre ad artisti selezionati di Believe e TuneCore l'accesso a Flow Music.

Gli artisti e i produttori partecipanti dovrebbero incontrare settimanalmente il team di prodotto e fornire feedback. Questo accordo offre a Google un canale strutturato per capire come i professionisti usano, rifiutano o modificano il materiale generato.

Google afferma di non rivendicare la proprietà dei contenuti originali generati tramite Flow Music. Presenta inoltre il prodotto come un collaboratore creativo per esplorare melodie, testi, generi, strumenti e idee vocali.

Questo posizionamento cerca di allontanare la conversazione dalla sostituzione automatica. Il messaggio è che i musicisti restano i direttori, mentre il modello accelera la sperimentazione. I controlli di editing di Lyria 3.5 sostengono questa tesi perché danno all'utente più decisioni dopo la generazione.

Tuttavia, un controllo migliore può anche aumentare la pressione di sostituzione. Un sistema che produce canzoni complete con voci espressive, testi utilizzabili e revisioni mirate può competere con diverse attività creative retribuite. Queste attività includono la produzione di demo, la musica stock, colonne sonore temporanee e bozze vocali di base.

Gli effetti varieranno a seconda del mercato. Un autore che prova idee per un ritornello ha esigenze diverse da quelle di un brand che genera audio di sottofondo. Un compositore cinematografico richiede maggiore precisione nel tempismo e nell'arrangiamento rispetto a un creatore di social media che produce una breve clip.

Suno e Udio possono rispondere attraverso miglioramenti dei modelli, partnership di licensing, community più forti o workflow specializzati. Il loro focus potrebbe consentire loro di muoversi rapidamente dove la più grande organizzazione di prodotto di Google procede con cautela.

Il vantaggio distributivo di Google resta comunque difficile da replicare. Flow Music non deve diventare la postazione di lavoro principale di ogni musicista per essere rilevante. Può avere successo diventando il livello musicale predefinito nell'ambiente creativo più ampio di Google.

È per questo che Lyria 3.5 aumenta la pressione senza risolvere la sfida. Google ha costruito una credibile strada full-stack, mentre le piattaforme indipendenti mantengono utenti dedicati, identità di prodotto riconoscibili e i propri workflow di generazione.

Un migliore controllo creativo non risolve il conflitto sul copyright

Lyria 3.5 può migliorare il controllo creativo senza rispondere a chi abbia autorizzato il materiale alla base del modello o a come le canzoni generate influenzino i musicisti professionisti.

Google afferma di aver addestrato Lyria usando materiali che YouTube e Google hanno il diritto di utilizzare in base ai termini di servizio, agli accordi con i partner e alla legge applicabile. Questa formulazione esprime la posizione legale di Google, ma non fornisce un inventario pubblico del catalogo di addestramento.

La differenza è importante perché l'autorizzazione è diventata la controversia centrale intorno alla musica AI. Etichette discografiche e artisti vogliono risposte più chiare su quali registrazioni siano entrate nei dataset di addestramento, quali licenze coprano tali usi e come i creatori partecipino finanziariamente.

La scala di Google rende queste questioni più delicate. YouTube ospita un enorme volume di musica, servendo al contempo creator, inserzionisti, etichette discografiche e ascoltatori. Google fornisce ora strumenti in grado di generare musica che può circolare nello stesso ecosistema più ampio.

Una denuncia federale presentata contro Google a marzo sostiene che i suoi sistemi di IA per la musica abbiano utilizzato registrazioni protette da copyright senza autorizzazione. Le accuse non sono state ancora giudicate e la denuncia rappresenta la ricostruzione dei querelanti, non una sentenza del tribunale.

Controversie simili riguardano i concorrenti di Google. Sony Music ha presentato a luglio una nuova causa contro Udio, sostenendo che oltre 30.000 registrazioni siano state copiate da YouTube per l'addestramento. Udio ha già affrontato precedenti contenziosi sulle sue pratiche di addestramento, mentre accordi nel settore hanno iniziato a spostare parti del mercato verso modelli con licenza.

La causa contro Udio mostra perché il progresso tecnico non può essere separato dai diritti sui dati. Voci più realistiche e una musicalità più solida rendono i modelli più utili, ma intensificano anche le questioni relative alla concorrenza con le registrazioni che li hanno informati.

Google applica SynthID alla musica generata da Lyria. SynthID è una filigrana impercettibile integrata nell'audio generato, che consente ai sistemi di rilevamento compatibili di identificare l'output dell'IA di Google.

L'azienda afferma che la sua filigrana audio può resistere a modifiche comuni quali compressione, rumore aggiunto o regolazioni della velocità. Google consente inoltre agli utenti di chiedere a Gemini se i contenuti caricati contengono un marcatore SynthID.

La filigrana aiuta con la provenienza, ma risolve solo una parte del problema. Può indicare che l'IA di Google ha creato o modificato un output. Non spiega pubblicamente l'intero set di dati di addestramento del modello né determina se una composizione generata viola un'opera esistente.

Il rilevamento dipende anche dall'accesso e dall'adozione. Un ascoltatore non può sentire SynthID e le piattaforme necessitano di strumenti o politiche adeguati per utilizzare il segnale. Metadati ed etichette visibili potrebbero comunque essere necessari quando le persone hanno bisogno di una divulgazione immediata.

Rimane un'altra questione irrisolta relativa alla scala. Una generazione migliorata riduce il tempo necessario per produrre brani. Questo può aiutare i singoli creator a sperimentare, ma può anche sostenere la produzione automatizzata di grandi cataloghi.

I servizi di streaming devono decidere come etichettare, raccomandare, monetizzare o filtrare questi cataloghi. I musicisti devono stabilire dove l'assistenza dell'IA si inserisca nella loro identità creativa. I titolari dei diritti devono decidere quando concedere in licenza i modelli e come condividere i ricavi risultanti.

Le partnership di Google con gli artisti offrono una strada verso la consultazione. Sessioni settimanali di feedback possono plasmare il prodotto, mentre gli accordi con i partner possono stabilire utilizzi autorizzati. Tuttavia, un gruppo limitato di partner non può rappresentare ogni interprete, autore, produttore e titolare indipendente di diritti.

La vera prova è se Google riesca a rendere il proprio quadro dei diritti comprensibile quanto i controlli del prodotto. I creator possono ora chiedere un tempo diverso o un'emozione vocale più intensa. Hanno ancora bisogno di risposte più chiare su autorizzazione, attribuzione e compenso.

Lyria 3.5 Ha Ancora Bisogno di Test di Ascolto Indipendenti

Google ha descritto la direzione del miglioramento, ma non ha fornito prove sufficienti per misurare l'entità o la coerenza dei progressi.

L'annuncio non contiene tabelle di benchmark, punteggi di preferenza, tassi di errore né confronti diretti con Lyria 3 Pro. Non descrive inoltre il numero di ascoltatori coinvolti nella valutazione né la gamma di stili musicali testati.

Questa assenza è importante perché la qualità musicale resiste a misurazioni semplici. La fedeltà audio può essere testata mediante segnali tecnici, ma la qualità dei testi e l'espressione emotiva dipendono fortemente da lingua, genere, tradizione esecutiva e aspettative degli ascoltatori.

Una voce che funziona nel pop sintetico può fallire nel jazz, nell'opera, nell'hip-hop o negli stili regionali. I miglioramenti nella pronuncia in una lingua non dimostrano progressi equivalenti in ogni lingua supportata. Il controllo del tempo può essere accurato mentre le transizioni tra le sezioni rimangono deboli.

La precedente scheda del modello Lyria 3 di Google affermava che le valutazioni includevano esperti umani e metodi automatizzati. Esaminava qualità musicale, estetica, qualità vocale, fedeltà audio e aderenza al prompt. L'azienda ha riportato un miglioramento rispetto a Lyria 2, ma non ha pubblicato numeri comparativi dettagliati nella pagina pubblica.

Lyria 3.5 necessita quindi di test più ampi su diverse dimensioni. I revisori dovrebbero confrontare generazioni ripetute a partire da prompt identici, senza scegliere solo il campione più forte. Dovrebbero inoltre testare quanto bene le modifiche mirate preservino le sezioni non toccate.

La preservazione è fondamentale in uno strumento musicale iterativo. Se la modifica di un singolo testo altera sottilmente la voce, il mix o la melodia altrove, i creator perdono fiducia nell'editing locale. Lo strumento si comporta quindi come una rigenerazione ripetuta anziché come una produzione controllata.

L'aderenza al prompt richiede un esame analogo. Un modello potrebbe seguire istruzioni esplicite su tempo e durata ignorando richieste più sottili relative a tensione, strumentazione o prospettiva lirica. I prompt complessi rivelano se il controllo sia reale o perlopiù cosmetico.

I testi dovrebbero essere valutati come linguaggio eseguito, non come testo isolato. Un verso può essere corretto sulla pagina ma cadere sul beat sbagliato. Una rima può funzionare sulla carta ma suonare forzata quando viene cantata. La consapevolezza strutturale deve collegare le parole con melodia e arrangiamento.

La valutazione vocale dovrebbe includere la coerenza lungo un brano completo. Le voci IA spesso risultano convincenti in passaggi brevi, ma in seguito cambiano tono, accento o identità. Una resa più emotiva può inoltre produrre un fraseggio esagerato che appare artificiale.

Il lavoro creativo reale offre un altro test. I produttori devono esportare, rivedere, confrontare e talvolta abbandonare le idee. Una generazione che suona impressionante al primo ascolto può comunque essere difficile da integrare con altro materiale.

La mancanza di dati comparativi pubblici da parte di Google non significa che i miglioramenti siano modesti. Significa che gli utenti dovrebbero separare le affermazioni dell'annuncio dalle prestazioni verificate. Test di ascolto, revisioni di produzione e prove ripetute dei flussi di lavoro forniranno le prove mancanti.

Il segnale più forte non sarà una dimostrazione virale. Saranno i creator che tornano allo stesso progetto, apportano revisioni controllate e mantengono il materiale risultante.

Tre Segnali Mostreranno Se Lyria 3.5 Cambia la Musica IA

Adozione, risposte della concorrenza e politica dei diritti determineranno se Lyria 3.5 diventerà uno standard di produzione o un altro aggiornamento di modello di breve durata.

Il primo segnale è l'uso continuativo all'interno di Flow Music. Google ha annunciato miglioramenti in diverse categorie importanti, ma non ha divulgato dati di utilizzo o fidelizzazione. Un comportamento di editing ripetuto mostrerebbe che i creator vedono valore oltre la generazione di un brano di novità.

L'attività più rivelatrice avverrà dopo il primo output. Gli utenti riscrivono i testi, regolano le sezioni, rigenerano le voci e tornano ai brani incompiuti? Queste azioni sosterrebbero l'affermazione di Google secondo cui Flow Music funziona come spazio di lavoro creativo.

Se i creator generano una volta sola e poi se ne vanno, una musicalità più forte da sola non ha risolto il problema del flusso di lavoro. Se rivedono e completano i progetti, l'approccio integrato di Google acquista credibilità.

Il secondo segnale è il modo in cui Suno, Udio e altri concorrenti rispondono. Nuovi controlli per struttura del brano, durata, tempo ed editing locale suggerirebbero che Google abbia cambiato il livello di base competitivo. Gli annunci sulle licenze potrebbero rivelarsi altrettanto importanti.

Una risposta incentrata solo sulla qualità audio indicherebbe che i rivali considerano ancora le prestazioni del modello come il principale terreno di scontro. Una risposta che abbracci editing, provenienza, collaborazione e distribuzione convaliderebbe la strategia più ampia di Google.

Google dovrebbe inoltre chiarire se Lyria 3.5 raggiungerà Gemini, Vertex AI o le API per sviluppatori. L'annuncio attuale specifica Flow Music. Una distribuzione più ampia aumenterebbe l'adozione e consentirebbe agli sviluppatori esterni di testare il modello in più casi d'uso.

Il terzo segnale è il movimento nella politica sul copyright e nei contenziosi. Decisioni giudiziarie, accordi di licenza e regole delle piattaforme sull'etichettatura possono rimodellare il mercato più rapidamente del rilascio di un modello. Un sistema tecnicamente superiore necessita comunque di diritti sui dati difendibili e politiche di distribuzione praticabili.

Il sistema SynthID di Google le offre un meccanismo di provenienza, ma l'accettazione del settore resta la questione chiave. Il rilevamento diventa più utile quando servizi di streaming, distributori e titolari dei diritti possono integrarlo in politiche coerenti.

I creator dovrebbero osservare divulgazioni più chiare sull'addestramento, partecipazione dei titolari dei diritti e strutture di compenso. Questi segnali rafforzerebbero la narrativa di Google come collaboratore. Un'ambiguità persistente manterrebbe irrisolto il conflitto tra accesso creativo e consenso dei creator.

Per i musicisti professionisti, la risposta pratica è una sperimentazione attenta. Confrontate più output, documentate prompt e modifiche, conservate il materiale sorgente e verificate i termini di distribuzione prima di pubblicare opere generate. Una libreria di prompt ricercabile può inoltre aiutare i team a tenere traccia delle istruzioni che hanno prodotto risultati utili.

Per sviluppatori e team media, Lyria 3.5 merita attenzione perché Google collega la generazione con l'editing e la distribuzione. I miglioramenti dichiarati dal modello contano, ma il sistema circostante conta di più.

Provate lo strumento su un vero brief creativo, non su un prompt di novità. Testate se segue la struttura, preserva le revisioni e produce materiale che manterreste davvero. Google DeepMind ha definito il prossimo test per la musica IA. I creator decideranno se Lyria 3.5 lo supera.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page