top of page

Google DeepMind 推出 Lyria 3.5,加大 AI 音乐竞争对手压力

Google DeepMind 于 7 月 29 日推出 Lyria 3.5,宣称在四个方面实现改进;与此同时,AI 音乐公司正面临来自质量、控制力和版权问题的日益增长压力。该模型正通过 Google Flow Music 推出,这是该公司用于生成和编辑完整歌曲的浏览器端工作区。

根据 Lyria 3.5 发布公告,此次更新提升了音乐结构、歌词、人声,以及对速度和时长的控制能力。这些类别直指生成音乐的常见短板。AI 歌曲可能在最初几秒听起来颇为精致,随后却失去方向,出现生硬重复的短语,或呈现缺乏说服力的情感人声。

因此,这不只是一次常规的模型更新。Google DeepMind 正从短暂而惊艳的演示,迈向一个让创作者能够指导并修改完整音轨的制作环境。Suno、Udio 及其他音乐生成器现在必须与一家同时掌控模型、创作界面、分发平台和水印系统的公司竞争。

Lyria 3.5 瞄准生成歌曲最薄弱的环节

Lyria 3.5 更新的重点在于,AI 生成的音轨能否在开场之后依然保持可信。

Google 表示,该模型可创作更丰富、更复杂且听起来更自然的旋律结构。这里的音乐性,指的是节奏、旋律、和声、编曲和过渡如何共同构成连贯的作品。一首音轨即便音质干净,也未必能通过这项检验。

这种区别很重要,因为音频保真度与作品质量并不是一回事。模型可以生成清晰的鼓点和逼真的吉他,却仍可能在编排上缺乏张力、释放感或明确的走向。Lyria 3.5 的目标是改善这种底层的音乐推进。

歌词也获得了类似升级。Google 称,该模型能更准确地遵循提示词,并对歌曲结构表现出更强的理解。这应有助于让歌词契合主歌、副歌和桥段的预期功能,而不是将每一句都当作可互换的文本。

结构意识对于完整歌曲尤其重要。主歌通常用于展开细节,而副歌则重复并凝练核心想法。忽视这些功能的歌词,会让一首技术上合格的作品显得尚未完成。

Google 还表示,Lyria 3.5 可生成更具表现力的人声、更具情感层次的演唱,以及更好的发音。人声的真实感不只取决于是否生成了正确的词语。节奏、重音、呼吸、音高变化和音色都必须与歌曲的情感方向相匹配。

这些改进建立在 Lyria 3 的基础上,后者已能生成演唱、定时歌词和完整的器乐编曲。Google 的音乐 API 文档称,该早期模型家族可根据文本或图像输入生成 44.1 kHz 立体声音频。其 Clip 模型可生成 30 秒输出,而 Lyria 3 Pro 支持时长数分钟的歌曲。

Lyria 3.5 增加了对输出时长和速度的更直接控制。速度指作品的快慢,通常通过节拍速率来理解。更好的速度控制有助于创作者让音轨匹配视频、表演、广告或预定编曲。

时长控制则解决了另一项实际限制。为固定场景制作配乐的创作者,不能只是接受任意长度的歌曲。音乐需要在合适的时刻抵达转场和高潮。

Google 尚未公布比较分数,以说明各项能力具体提升了多少。它也尚未发布将 Lyria 3.5 与 Suno、Udio 或 Lyria 3 Pro 对比的试听测试结果。因此,在更广泛的测试结果出现前,已宣布的提升应被视为公司自身说法。

不过,所选择的改进目标揭示了 Google 的优先事项。该公司正试图改善那些将一次有趣的生成结果与创作者可持续开发的音轨区分开的要素。

Google DeepMind 正在构建工作流,而不只是模型

当 Lyria 在编辑工作流中运行,而不是作为独立的提示词输入框时,Google DeepMind 才能获得最强优势。

Flow Music 已可让用户创作、修改和分享歌曲。Google 在 5 月加入了分段编辑功能,允许创作者选择某一段落并更改其歌词、配器或风格,而无需替换整首音轨。

这种工作流改变了音乐模型的价值。一次性生成器要求用户在听到成品前就描述出最终结果。制作工具则假定,第一次输出仅仅是一个起点。

音乐创作很少沿着从指令到最终录音的直线推进。制作人可能保留副歌、从主歌中移除一种乐器、重写一句歌词,并改变尾段的能量感。局部编辑支持这一迭代过程。

Google 此前的 Flow Music 更新引入了重写或翻译选定歌词、以及重塑特定段落风格的控制功能。它还通过 Gemini Omni 将产品与音乐和视频的对话式指导连接起来。

Lyria 3.5 通过改善可供编辑的素材,强化了这一界面。更可靠的歌词使定向重写更有价值。更好的发音降低了重新生成可接受人声线条的需要。更强的音乐结构则为分段编辑提供了更稳定的基础。

该产品的历史同样重要。Flow Music 之前名为 ProducerAI,其团队曾将该服务描述为由音乐人为自身创作工作打造的工具。此后,Google 已将其纳入更广泛的 Flow 产品家族,与图像和视频生成并列。

这种整合为 Google 打开了进入专业和消费级创作的多条路径。Gemini 可以让普通用户接触短音乐生成。Flow Music 可以支持更长的项目和精细修改。YouTube 则可将生成的配乐置于既有创作者工作流附近。

Google Cloud 和 Gemini API 又为开发者提供了另一条路径。企业可在应用中使用音乐生成,而不必依赖消费级界面。这种广泛分发能将一个模型的改进转化为多个产品的升级。

这一策略给专业 AI 音乐公司带来压力,因为模型质量本身变得不再那么决定性。竞争对手可以生成一首出色的音轨,但创作者还需要编辑、项目管理、分享、导出、溯源和分发。

Google 可以通过其已有产品连接这些阶段。这并不保证能创作出更好的音乐,但能降低生成与发布之间的摩擦。

它也带来了反馈优势。不同界面会暴露不同的用户需求。Gemini 提示词反映休闲使用场景,Flow Music 捕捉制作行为,开发者 API 则显示企业自动化了哪些功能。

结果是一个比传统模型发布更深的竞争位置。Lyria 3.5 是引擎更新,但 Flow Music 才是 Google 测试该引擎能否支撑反复创作决策的地方。

Google DeepMind 让 Suno 和 Udio 面临平台压力

核心竞争已不再是哪家公司能根据一个提示词生成一首看似合理的歌曲,而是哪家公司能掌控完整的创作工作流。

Suno 和 Udio 帮助确立了现代 AI 歌曲生成的消费级模式。用户描述一种流派、主题、情绪或歌词概念,随后便会获得一首包含人声的编排音轨。它们聚焦的产品让音乐生成无需传统制作软件也变得触手可及。

Google DeepMind 带着不同的资产组合进入这场竞争。它开发 Lyria 模型家族、运营 Flow Music、拥有 YouTube、销售云基础设施,并在面向消费者和企业的产品中分发 Gemini。

每项资产都对应音乐流程的不同阶段。模型生成声音,Flow Music 提供迭代能力,云服务支持集成,YouTube 则为音乐、视频和创作者分发提供大型目的地。

即使独立模型仍具竞争力,这种组合也可能给独立竞争者带来压力。创作者选择工具时,往往看重工作流便利性,而不是孤立的基准成绩。减少文件传输和重复设置步骤的重要性,可能不亚于轻微的音频改进。

Google 也开始与职业艺术家建立直接关系。5 月,该公司宣布与 Believe 建立合作,让部分 Believe 和 TuneCore 艺术家获得 Flow Music 的使用权。

参与的艺术家和制作人预计将每周与产品团队会面并提供反馈。这种安排为 Google 提供了一个结构化渠道,以了解专业人士如何使用、拒绝或修改生成素材。

Google 表示,它不主张拥有通过 Flow Music 生成的原创内容的所有权。它也将该产品定位为探索旋律、歌词、流派、乐器和人声构想的创作协作者。

这一定位试图将讨论从自动替代转移开来。其主张是,音乐人仍是决策者,而模型加速了实验。Lyria 3.5 的编辑控制支持了这一说法,因为它们让用户在生成后能作出更多决定。

不过,更强的控制能力也可能加大替代压力。一个能生成具表现力人声、可用歌词和定向修改的完整歌曲系统,可能与多项付费创作工作竞争。这些工作包括样带制作、素材音乐、临时配乐和基础人声样稿。

影响将因市场而异。测试副歌构想的词曲作者,与生成背景音频的品牌有不同需求。电影作曲家对时间点和编曲精度的要求,也高于制作短视频片段的社交媒体创作者。

Suno 和 Udio 可以通过模型改进、授权合作、强化社区或专业化工作流来应对。它们的专注度可能使其在 Google 更庞大的产品组织谨慎推进之处快速行动。

Google 的分发优势仍然难以复制。Flow Music 无需成为每位音乐人的主要工作站才能产生影响。只要成为 Google 更广泛创作环境中的默认音乐层,它就能取得成功。

这正是 Lyria 3.5 在未终结竞争的同时加大压力的原因。Google 已构建出一条可信的全栈路径,而独立平台仍拥有专注用户、鲜明的产品定位和各自的生成工作流。

更好的创作控制并未解决版权冲突

Lyria 3.5 可以改善创作控制,但无法回答谁授权了模型背后的素材,或生成歌曲将如何影响职业音乐人。

Google 表示,其使用 YouTube 和 Google 根据服务条款、合作伙伴协议及适用法律有权使用的材料训练 Lyria。这一表述说明了 Google 的法律立场,但并未提供训练目录的公开清单。

这种差异很重要,因为授权已成为 AI 音乐领域最关键的争议。唱片公司和艺术家希望更清楚地了解哪些录音进入了训练数据集、哪些许可涵盖这些使用,以及创作者将如何在经济层面参与其中。

Google 的规模让这些问题更加敏感。YouTube 承载着海量音乐内容,同时服务创作者、广告主、唱片公司和听众。Google 如今提供的工具能够生成音乐,而这些音乐可以在同一更广泛的生态中流通。

今年 3 月针对 Google 提交的一项联邦诉状称,其 AI 音乐系统未经许可使用了受版权保护的录音。相关指控尚未经过裁决,该诉状代表的是原告方的陈述,而非法院认定。

Google 的竞争对手也面临类似争议。Sony Music 于 7 月对 Udio 提起新诉,指控其从 YouTube 复制了逾 30,000 条录音用于训练。Udio 此前已因其训练做法面临诉讼,而行业协议已开始推动部分市场转向获得授权的模型。

这起 Udio 诉讼表明,技术进步无法与数据权利割裂开来。更逼真的人声和更强的音乐性会让模型更具实用价值,但也会加剧其与启发这些模型的录音作品之间竞争关系的疑问。

Google 将 SynthID 应用于由 Lyria 生成的音乐。SynthID 是嵌入生成音频中的不可听见水印,使兼容的检测系统能够识别 Google AI 输出。

该公司表示,其音频水印可在压缩、添加噪声或调整播放速度等常见改动后继续保留。Google 还允许用户询问 Gemini:上传的媒体是否含有 SynthID 标记。

水印有助于追溯来源,但它只解决了部分问题。它可以表明某项输出由 Google AI 创建或编辑,却无法公开说明模型完整的训练数据,也无法判定生成的作品是否侵犯现有作品。

检测同样取决于访问条件与采用程度。听众无法听见 SynthID,而平台需要适当的工具或政策来利用这一信号。当人们需要即时披露时,元数据和可见标签可能仍然不可或缺。

围绕规模还有另一个尚未解决的问题。生成能力的提升降低了制作歌曲所需的时间。这可以帮助个人创作者进行尝试,但也可能支持自动化生产大量曲目。

流媒体服务必须决定如何标注、推荐、变现或筛选这些曲库。音乐人必须确定 AI 辅助在其创作身份中应处于何种位置。权利持有人必须决定何时为模型授权,以及如何分配由此产生的收入。

Google 与艺人的合作关系提供了一条通向协商的路径。每周反馈会议可以塑造产品,而合作协议可以确立获授权的使用方式。但有限的合作伙伴群体无法代表每一位表演者、词曲作者、制作人和独立权利持有人。

真正的考验在于,Google 能否让其权利框架像产品控制功能一样易于理解。创作者如今可以要求不同的节奏或更强烈的人声情感,但他们仍需要有关许可、署名和报酬的更清晰答案。

Lyria 3.5 仍需独立试听测试

Google 已描述了改进方向,但尚未提供足够证据来衡量这些提升的幅度或一致性。

该公告没有基准测试表、偏好评分、失败率,也没有与 Lyria 3 Pro 的直接比较。它同样未说明参与评估的听众人数,或测试涵盖的音乐风格范围。

这一缺失很重要,因为音乐质量难以通过简单方式衡量。音频保真度可以借助技术信号测试,但歌词质量和情感表达在很大程度上取决于语言、流派、表演传统和听众预期。

适用于合成流行乐的人声,可能无法胜任爵士、歌剧、嘻哈或区域性音乐风格。某种语言中的发音提升,并不能证明在所有支持语言中取得了同等进步。节奏控制或许准确,但段落过渡仍可能较弱。

Google 此前的 Lyria 3 模型卡称,评估包含人工专家和自动化方法,并考察了音乐质量、美学、人声质量、音频保真度和提示词遵循度。该公司报告称其较 Lyria 2 有所改进,但未在公开页面发布详细的比较数据。

因此,Lyria 3.5 需要在多个维度进行更广泛的测试。评测者应比较来自相同提示词的重复生成结果,而不是只挑选最强样本。他们还应测试定向编辑在多大程度上能够保留未修改的部分。

在迭代式音乐工具中,保留原有内容至关重要。如果修改一句歌词会微妙地改变其他位置的音色、混音或旋律,创作者将失去对局部编辑的信心。这样一来,该工具的行为更像是反复重新生成,而非可控制作。

提示词遵循度也需要同样严格的审视。模型可能会遵循关于节奏和时长的明确指令,却忽略关于张力、配器或歌词视角等更细微的要求。复杂提示词能揭示控制能力是真实存在,还是大多只是表面效果。

歌词应作为被演唱的语言来评估,而不是孤立的文本。一句歌词读起来可能正确,却落在错误的节拍上。押韵在纸面上可能成立,但唱出来却显得生硬。结构意识必须将文字与旋律和编曲联系起来。

人声评估应涵盖整首曲目中的一致性。AI 声音常常在短片段中听起来令人信服,却会在后续改变音色、口音或身份特征。更富情感的演绎也可能产生夸张的措辞方式,让人感到不自然。

真实创作工作构成另一项测试。制作人需要导出、修改、比较,有时还要放弃创意。一段首次试听时令人印象深刻的生成内容,仍可能难以与其他素材整合。

Google 缺乏公开比较数据,并不意味着这些改进幅度很小。这意味着用户应将公告中的主张与经验证的表现区分开来。试听测试、制作评审和重复的工作流试验将提供缺失的证据。

最强的信号不会是一段病毒式传播的演示,而是创作者回到同一个项目,进行可控修改,并保留最终生成的素材。

三项信号将表明 Lyria 3.5 是否改变 AI 音乐

采用情况、竞争性回应和权利政策将决定 Lyria 3.5 会成为制作标准,还是又一次昙花一现的模型升级。

第一个信号是 Flow Music 中的持续使用。Google 已宣布在几个重要类别上的改进,但尚未披露使用量或留存数据。重复编辑行为将表明,创作者认为它的价值不止于生成一首新奇曲目。

最能说明问题的活动将发生在首次输出之后。用户会不会重写歌词、调整段落、重新生成声乐,并回到尚未完成的歌曲?这些行为将支持 Google 关于 Flow Music 作为创作工作空间运作的主张。

如果创作者只生成一次便离开,那么更强的音乐性本身尚未解决工作流问题。如果他们修改并完成项目,Google 的一体化方案便会更具可信度。

第二个信号是 Suno、Udio 和其他竞争对手的回应。针对歌曲结构、时长、节奏和局部编辑的新控制功能,将表明 Google 已改变竞争基线。授权公告可能同样重要。

若回应只围绕音频质量展开,将说明竞争对手仍将模型性能视为主要战场。若回应涵盖编辑、溯源、协作和分发,则将验证 Google 更广泛的战略。

Google 还应明确 Lyria 3.5 是否会进入 Gemini、Vertex AI 或开发者 API。当前公告指定的是 Flow Music。更广泛的分发将提升采用率,并让外部开发者在更多使用场景中测试该模型。

第三个信号是版权政策与诉讼方面的进展。法院裁决、授权协议和平台标签规则可能比一次模型发布更快地重塑市场。技术上更优越的系统仍需要站得住脚的数据权利和可行的分发政策。

Google 的 SynthID 系统为其提供了来源追溯机制,但行业接受度仍是关键问题。当流媒体服务、分发商和权利持有人能够将其纳入一致政策时,检测才会更有用。

创作者应关注更清晰的训练披露、权利持有人参与机制和报酬结构。这些信号将强化 Google 的协作者叙事。持续的模糊性将使创作可及性与创作者同意之间的冲突悬而未决。

对于职业音乐人而言,务实的应对方式是谨慎试验:比较多个输出结果,记录提示词和编辑过程,保留源素材,并在发布生成作品前审阅分发条款。可搜索的提示词库也能帮助团队追踪哪些指令产生了有用结果。

对于开发者和媒体团队而言,Lyria 3.5 值得关注,因为 Google 正在将生成、编辑和分发连接起来。该模型宣称的提升很重要,但周边系统更重要。

请用真实的创意简报而非新奇提示词来测试该工具。测试它是否遵循结构、保留修改,并产出你真正愿意保留的素材。Google DeepMind 已为 AI 音乐定义了下一项考验。创作者将决定 Lyria 3.5 能否通过。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page