top of page

ByteDance Seed Audio 1.0 将一个提示词变成完整配乐

7月20日
讀畢需時 15 分鐘

ByteDance 发布了 Seed Audio 1.0,直接向传统 AI 音频制作发起挑战。如今,一个模型就能同时生成语音、音乐、环境声和音效。

这种差异至关重要,因为大多数生成式音频工作流程仍被拆分在不同的专业系统中。创作者先生成对话,再到其他地方添加音乐、获取音效、对齐每个元素,最后混合完整时间线。

ByteDance Seed Audio 1.0 试图将这一链条压缩为一次由提示词驱动的生成。该公司表示,该模型每次可生成约两分钟的内容,支持 20 多种语言,并能以 100 毫秒为间隔控制时间。

因此,这不只是又一款文本转语音产品。ByteDance 正在测试模型能否像音频导演一样工作,而不只是充当合成表演者。

因此,核心较量在于统一生成与模块化制作。专业工具可以控制各条独立音轨,而 ByteDance 则以更少的人工交接提供一个完整场景。

这一愿景很有吸引力,但也带来了一个棘手的问题:一个模型能否在不剥夺创作者控制权的前提下协调所有声音层次?

ByteDance Seed Audio 1.0 改变了单次生成所包含的内容

关键变化并不是合成语音变得更好,而是模型的输出从语音扩展到了完整的音频场景。

根据 ByteDance 的音频模型发布公告,Seed Audio 对语音、音效和环境音频进行联合建模。一条指令就能定义角色、对话、声音表现、背景音乐以及周围的声学环境。

提示词可以描述两个紧张的角色在行驶中的火车里交谈,还可以指定车厢噪声、远处的广播、克制的音乐、停顿,以及在特定时刻关闭的车门。

传统生成方式会将这些指令拆分成不同的任务。语音系统负责台词,其他模型或素材库则提供火车声、关门声和音乐。

随后,创作者必须将这些素材导入编辑器。每一层都需要裁剪、对齐和调整音量;如果各个部分听起来不协调,有时还需要重新生成。

Seed Audio 1.0 则在一次处理中生成混音后的结果。端到端生成意味着系统可以直接将指令转换为目标音频,无需人工拼装中间时间线。

这种统一方法同样适用于非语言表演。据称,提示词可以在台词中安排笑声、呼吸声、叹息、停顿、口音和情绪变化。

这些细节并非装饰。它们决定了生成的对话听起来像一个完整场景,还是一组制作精良的语音片段。

该模型接受文本或参考音频作为控制输入。参考音频让创作者无需重新训练专用语音模型,也能引导声音特征或表演特点。

ByteDance 表示,音色与风格可以分开控制。音色指声音中可辨识的身份特征,而风格则涵盖情绪、语速和表达方式等属性。

将两者分离后,角色在从平静转为恐惧、愤怒或兴奋时,应该仍能保持可辨识度。这也针对了较长合成对话中的一个常见弱点:声音会逐渐失去原本的身份特征。

该公司表示,单次生成可达到约两分钟,还可以使用之前的音频作为参考继续扩展。这种设计面向广播剧、有声故事、播客、广告和电影化段落。

两分钟无法取代完整的制作时间线,但足以覆盖一个有实际意义的场景,而不只是短暂、孤立的声音。

该模型已在中国的火山方舟体验中心上线。API 访问最初进入邀请测试阶段,使这次发布处于公开演示与完全成熟的生产服务之间。

这一差异需要明确。体验中心开放使用证明了模型具备可访问性,但无法证明它在大规模商业使用中的可靠性。

尽管如此,该产品的形态已经清晰可见。ByteDance 希望生成的基本单位成为整个场景,而不是单独的语音或音效。

统一 AI 音频让编辑时间线面临压力

Seed Audio 真正瞄准的是从一个想法到可用配乐之间碎片化的制作流程。

电影、广告、播客和游戏团队很少将音频视为一个不可区分的单一文件。他们会将对话、拟音、环境声、音乐和房间底噪作为不同的声音层来处理。

拟音是指通过表演或生成得到的日常声音,例如脚步声、布料摩擦声或物体撞击表面的声音。房间底噪则记录物理空间独有的背景声特征。

独立音轨让编辑人员可以修复错误,而不影响场景中的其他部分。他们可以替换一句台词、调低音乐、移动脚步声或去除不需要的噪声。

这种灵活性也会带来制作成本。每增加一个声音层,就意味着多一份需要生成、标记、传输、定位、审核和修改的素材。

这个问题在短内容中更加明显。创作者制作一段 30 秒的短片时,组装音频所花的时间可能比生成画面还长。

ByteDance 押注许多创作者愿意牺牲部分音轨级控制来换取速度。如果首次生成的混音结果可以使用,完整场景便能直接导入视频编辑器。

该公司报告称,在大多数测试场景中,音频可用率超过 90%。它还表示,多语言自然度的平均意见分超过了四分。

平均意见分(MOS)用于汇总人类听众在数值质量量表上给出的评分。这些数据由该公司自行报告,尚未在公开基准测试中得到独立复现。

即便如此,可用性才是正确的商业问题。一个模型不必每次都生成完美配乐,也能改变制作成本结构。

它需要减少获得可接受结果所需的生成次数、编辑操作和工具切换次数。一份可用的初稿可以成为预览、内部草稿、社交媒体短片,或进一步完善的起点。

以一部拥有三个固定角色的广播剧为例。模块化工作流程需要分别生成语音、确定时序、添加环境声和过渡音乐,并完成最终混音。

Seed Audio 1.0 可以通过一条结构化指令接收所有这些要求。如果它能保持角色身份并正确安排事件,初稿中的多个制作环节就可以被省去。

同样的逻辑也适用于本地化。支持 20 多种语言,可能让团队在保留场景情绪和环境结构的同时,为不同市场重新生成内容。

不过,语言数量本身并不能证明各种语言的质量相同。口音准确性、语码转换、专有名称、文化化表达以及低资源语言都需要更深入的评估。

ByteDance 公布的 MOS 结果表明,多语言自然度是其重点之一。但发布信息较少公开测试构成、听众群体或各语言具体得分等细节。

这些缺失的信息对企业买家十分重要。平均值可能会掩盖广泛使用的语言与较小语言市场之间的显著差异。

更大的压力落在围绕独立生成阶段构建的工具链上。它们必须证明,模块化控制带来的额外价值足以抵消增加的工作量。

这并不意味着数字音频工作站会消失。专业团队仍然需要可编辑音轨、精确母带处理、版权管理和受控的交付格式。

相反,统一生成可能会改变工作的起点。编辑人员可以从一个已经组装好的场景开始,只分离或替换需要处理的元素。

这种转变与视觉创作领域已经出现的变化相似。生成式合成图像并未淘汰图层和蒙版,但减少了制作初始概念所需的工作。

对个人创作者而言,这种影响可能更为明显。许多人没有高级混音技能、声音素材库,也没有时间协调多个专业服务。

能够生成连贯场景的提示词,使这些用户也能使用过去隐藏在专业工具中的制作规范。模型由此成为一种带有明确倾向的制作界面。

只有当系统的决策可以预测时,这种界面才能成功。一个节省了十个编辑步骤、却需要修改十次提示词的系统,只是把工作量转移到了别处。

核心较量是统一生成与模块化控制

ByteDance 主张音频元素应在上下文中统一生成,而成熟的工作流程则通过分离来保障质量。

这两种方法都在解决实际问题。统一生成优先考虑连贯性和速度,模块化生成则优先考虑可编辑性、独立性和可预测的人工干预。

ElevenLabs 展示了专业化路线。它的音效系统可以根据文本创建拟音、环境声、电影化音效和音乐元素。

该服务允许用户将单个音效的时长控制在 0.1 秒至 30 秒之间,还为较长的环境声纹理提供循环功能。

这种设计为创作者提供了独立素材。生成的雷声可以被移动、缩短、叠加或丢弃,而无需重新生成旁白。

语音产品遵循类似的模式。它们会优化语音质量、发音、情绪、延迟或说话者一致性,同时将音乐和环境声交给其他系统处理。

模块化还可以让质量保证变得更容易。团队可以单独检查对话、确认台词内容,并按照不同标准审核音乐或音效。

统一输出会让这种检查更加复杂。一处口误、一个错位的声音或音量过大的配乐,都可能导致完整结果需要重新生成。

Seed Audio 的 100 毫秒时序控制旨在缩小这一劣势。100 毫秒等于十分之一秒,因此提示词可以在相对精细的时间线上安排事件。

这种控制精度可以支持在指定时间点安排玻璃撞击声、角色反应、打断或音乐进入。当音频必须与已经剪辑好的画面匹配时,这一点尤其重要。

然而,数值上的精确并不会自动带来感知上的准确。人类听众在意的是事件听起来是否同步,而不是提示词中是否出现了指定时间戳。

脚步声可能在正确时刻开始,却仍然听起来与房间环境脱节。对话可能与剪辑点对齐,却缺少场景所暗示的节奏感。

Google DeepMind 在其视频转音频研究中记录了类似的同步挑战。其系统使用视频像素和可选文本来生成对话、音效和声景。

Google 指出,视觉伪影可能会降低音频质量。它还发现,生成的口型动作与语音文本不匹配,是造成唇音同步不自然的原因之一。

这一对比揭示了通往同一目标的两条路径。Google 从视频入手并生成配套音轨,而 Seed Audio 则从音频指令和可选参考素材出发。

以视频为条件的系统可以利用运动和视觉事件作为时间依据。指令驱动的音频模型则能让创作者在成片视觉画面出现之前拥有更大的自由度。

这种差异会影响各模型进入制作流程的阶段。Seed Audio 可以在早期帮助确定场景节奏,并可能进一步指导剪辑,甚至视频生成过程。

视频转音频系统介入得更晚,因为此时视觉运动已经提供了一条时间线。它们可以响应屏幕上出现的内容,但也会继承源视频中的任何不一致。

没有哪条路径能在所有用例中胜出。实际问题在于,创作者希望音频跟随画面,还是帮助定义画面。

对于叙事原型制作,音频优先的流程具有优势。团队可以在投入成本高昂的视觉修改之前,先听到角色节奏、紧张感和转场效果。

对于已经完成的影像,视觉条件能够提供更强的同步线索。模型可以观察碰撞、动作、剪辑和画面中可见的说话者,而不必完全依赖书面时间指令。

专用模型还通过替换机制保留了另一项优势。如果生成的音乐不合适,模块化工作流可以保留已经获批的语音和音效。

统一模型需要具备编辑功能、分轨或可靠的重新生成控制,才能提供同等保障。否则,前期的便利可能会在后期演变为僵化。

ByteDance 早期的音乐框架已经认识到了这种区别。其研究人员描述了初学者和专业制作人的不同需求,其中包括对乐器分轨和精细控制的需求。

Seed Audio 1.0 如今正在验证,足够连贯的完整混音能否同时服务这两个群体。答案取决于修改时的表现,而非令人印象深刻的样例。

ByteDance 的质量声明未能证明什么

此次发布提出了强有力的能力声明,但关于一致性、安全性和生产级控制的公开证据仍然有限。

ByteDance 表示,在大多数场景中,输出的可用率超过 90%。在外界能够将其与竞品进行比较之前,这一说法需要有公开的评估方案作为支撑。

“可用”可以有多种含义。社交媒体草稿、有声书章节、付费广告和院线电影音轨所要求的标准截然不同。

该公司尚未公开说明这一可用率所基于的样本数量,也没有按内容类型、语言、时长或说话者数量提供完整细分数据。

报告中的 MOS 分数也需要以同样审慎的态度看待。人工听感评分取决于测试材料、播放环境、评分人员、对比系统以及所提出的具体问题。

高于四分听起来令人鼓舞,但不能作为普遍适用的质量保证。独立测试应分别考察发音、身份漂移、提示词遵循度、噪声和情感一致性。

长篇内容的连续性是另一个悬而未决的问题。两分钟的生成时长很实用,但许多播客、故事和戏剧作品远远超出这一时间窗口。

ByteDance 表示,基于参考素材的续写可以保留上下文。然而,每次续写仍可能导致声音、环境氛围、音量或音乐结构发生漂移。

创作者需要测试错误是否会随着多次扩展而累积。一个在两分钟内保持稳定的角色,在完整的一集中可能会变得不那么可靠。

实际用户报告还表明,提示词的措辞仍然非常重要。将声音描述为冷淡或年轻,可能产生缺乏预期权威感的结果。

更具限制性的描述可能改善输出,但这种行为也暴露出一个解释层。用户必须摸索模型会将哪些语言线索与特定声音特征关联起来。

这种迭代对于生成式系统而言很正常。但如果一次调整还会改变音乐、节奏、环境氛围或其他已经获批的元素,成本就会变得高昂。

由于参考音频可以指导声音生成,此次发布也引发了有关同意和身份的问题。生产服务需要明确控制谁可以上传声音,以及输出内容可以如何使用。

合成声音滥用并非 ByteDance 独有的问题,其中包括冒充他人、欺骗性广告、未经同意的声音克隆、诈骗和伪造证据。

发布材料更侧重创作能力,而非公开的安全文档。购买方应关注同意验证、水印、可追溯性、内容审核以及清晰的滥用举报流程。

Google 曾介绍使用音频水印来识别受支持系统生成的内容。ByteDance 若能提供类似披露,将有助于客户评估来源保护措施。

版权也带来了相关的不确定性。能够生成音乐和电影级音效的模型,需要涵盖训练数据、风格模仿和商业输出权利的政策。

现有发布信息不足以评估这些问题。团队不应认为获得技术访问权限就会自动解决所有权或许可问题。

制作格式同样值得关注。混合文件便于立即使用,但专业工作流通常需要独立分轨和无损交付。

对白、音乐、音效和环境声可能需要不同的响度处理。广播机构和流媒体平台可能会施加单个生成混音无法满足的交付标准。

无障碍需求又增加了一层复杂性。语音必须在音乐和环境噪声中保持清晰可懂,而字幕必须与最终口述内容一致。

如果模型在重新生成时即兴添加词语或改变时间,字幕和转录文本就可能过时。因此,统一工作流还需要可靠的文本对齐输出。

这些不足并不意味着该产品不重要。它们界定了一个引人入胜的创作模型与可靠生产基础设施之间的距离。

最出色的发布样例将展示该系统能够做到什么。反复且受控的测试则会揭示团队可以围绕它安全地构建什么。

ByteDance 为何正从语音转向完整场景

Seed Audio 1.0 契合 ByteDance 更宏大的布局:生成短视频、故事叙述和广告所需的相互关联的媒体组件。

ByteDance 已经运营着由视听创作和推荐机制塑造的平台。这一地位使该公司有充分理由减少从创意到可发布媒体之间的阻力。

仅提供语音的模型只能解决这一流程中的一个环节。创作者仍然需要音乐、音效、时间编排、视觉素材和编辑应用程序。

场景生成器连接了更多制作阶段。它可以将脚本或概念转化为承载角色、情感、节奏和氛围的作品。

该作品可以支持多种下游工作流。它可以成为生成视频的音轨、供导演预览的样片,或叙事项目的音频优先草稿。

ByteDance 还开发了用于语音的 Seed-TTS 和用于音乐生成的 Seed-Music。Seed Audio 将此前彼此独立的研究方向整合进一个共同的创作界面。

此次发布的时机反映了生成式媒体领域更广泛的变化。模型开发者正在超越孤立的模态,转向协调视频、语音、声音和音乐的系统。

Veo 在生成视频的同时引入了原生音频生成,Google 的研究则探索了以现有视觉内容为条件生成音轨。ElevenLabs 也从语音扩展到音效和音乐相关能力。

在研究层面,统一音频正成为一个明确的技术方向。近期系统已经探索了适用于语音、音乐和环境声音的通用框架。

其吸引力在于上下文学习。一个同时生成所有声音的模型,理论上可以理解耳语对白需要更安静的音乐和更克制的声学环境。

模块化流水线通常缺少这种共享上下文。每个系统接收的提示词范围更窄,并依赖编辑人员建立最终的协调关系。

统一训练也带来了艰难的优化取舍。语音优先考虑语言准确性,音乐需要长程结构,而音效则要求令人信服的物理质感。

改进一个领域可能会与另一个领域争夺模型容量或训练侧重点。单一评估分数无法涵盖所有这些要求。

ByteDance 的应对方式是围绕创作而非专业化合成来定位产品。该模型的评判标准是完整场景,而不仅仅是孤立的语音或音乐质量。

这种定位有利于那些更看重速度和情感连贯性,而非取证级控制的市场。音频小说、预览样片、短广告和社交视频都符合这一特征。

它也有利于习惯通过叙事指令思考的创作者。他们可以描述应该发生什么,而不必学习复杂的混音操作。

专业应用需要在这两种思维模式之间建立桥梁。创作指导需要保持简单,而当项目进入下一阶段时,制作控制必须变得明确。

一种可能的桥梁是从同一底层场景生成可编辑的分轨。另一种是受限重新生成,即只更改一个元素,同时保留其他所有已经获批的决定。

第三种是时间线集成,让模型将事件、说话者和音乐转场呈现为可编辑对象。这会将提示词转变为结构化的制作计划。

ByteDance 尚未公开承诺提供这些具体功能。但正是这些能力,才能使模块化竞品更难忽视统一生成。

此次发布也可能影响视频模型的发展。如果音频能够定义节奏、角色轮次和戏剧事件,未来的系统就可以将其视为条件时间线。

这颠覆了声音必须跟随成片画面的常见假设。在某些工作流中,生成的视觉内容可以跟随已经获批的音频表演。

对于探索这些系统的团队而言,保留提示词、脚本、反馈和已经获批的参考素材非常重要。可搜索的 AI 知识库可以在反复的制作周期中保留这些决定。

其运营价值来自复用。团队可以比较提示词的变化、记录发音决定,并找回生成结果获批背后的上下文。

这些上下文之所以重要,是因为创作模型的输出具有概率性。仅凭最终文件无法说明究竟是哪条指令、哪份参考素材或哪项审核决定促成了它。

三个信号将表明 Seed Audio 能否成为生产工具

下一阶段取决于独立的质量证据、更深入的编辑控制,以及在 ByteDance 演示环境之外的采用情况。

第一个信号是可复现的技术评估。ByteDance 报告的可用率和 MOS 数据需要配套的方法论、测试集,以及按语言和任务分类的结果。

独立比较应涵盖多说话者身份一致性、时间准确性、语音清晰度、音乐平衡和环境真实感,还应测试同一提示词的多次生成结果。

重复试验很重要,因为平均质量可能掩盖不可预测的故障。制作团队需要估算一个结果通常要重新生成多少次,而不只是判断最佳样例听起来有多好。

清晰的评估将强化 ByteDance 关于统一生成能够取代多个中间步骤的主张。如果变化程度方面的数据表现不佳,模块化工具仍然有充分的存在理由。

第二个信号是产品的编辑模型。API 可用性很有价值,但开发者还需要能够保护生成结果中已验收部分的控制功能。

应关注分轨、选择性重新生成、时间线事件、说话人锁定、响度控制和机器可读的转录文本。这些功能可以将混合输出转变为可编辑的制作资产。

如果缺少这些功能,Seed Audio 1.0 的优势将主要局限于快速草稿和短篇内容制作。专业团队不太可能仅仅为了便利就放弃可逆编辑能力。

第三个信号是其在 ByteDance 的创作者产品和第三方应用中的部署。该公司已表示,该模型将进入与视频和内容创作相关的产品。

真实应用将揭示哪些使用场景能够经受普通用户的实际检验。完成率、重新生成行为、导出模式和项目的重复使用情况,会比发布演示更有参考价值。

第三方接入将提供另一重检验。开发者会让该模型面对内部展示可能未覆盖的提示词、语言、时长和制作限制。

在这一信号中,竞争对手的应对也很重要。专业服务商可以通过通用时间线将语音、音效和音乐关联起来,同时保留独立输出,从而捍卫自己的市场地位。

视频模型开发者也可以从另一个方向作出回应。他们可以提高原生声音的可控性,从而减少对独立的音频优先制作阶段的需求。

因此,ByteDance Seed Audio 1.0 开启的是一场工作流设计之争,而非对某一项基准冠军的争夺。它的核心主张是:应当基于上下文一体化生成。

如果创作者持续接受首次生成的混合场景,这一主张就会更有说服力。如果他们反复需要分离、修复和重构其中的各个组成部分,这一主张就会被削弱。

对创作者而言,合理的下一步是进行一次受控项目测试。选择一个包含多位说话人、明确环境、一个定时音效以及清晰情绪转变的场景。

运行多个版本,然后衡量哪些内容需要修正。记录语音一致性、时序、可懂度、音乐平衡、提示词修改情况,以及导出后所需的工作量。

将这一流程与你现有的模块化工作流进行比较。决定性指标并不是 Seed Audio 能否生成令人印象深刻的片段。

而是该模型能否在保留项目所需控制力的同时,减少总体制作工作量。这正是决定统一音频能否成为默认选择的标准。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page