top of page

Fish Audio 融资 5200 万美元,挑战封闭式语音 AI 巨头

Fish Audio 完成 5200 万美元种子轮融资后登上 Google News,这笔规模罕见的早期投资押注于其开源语音 AI 战略。这家总部位于帕洛阿尔托的初创公司称,已有超过 800 万人使用其托管或开源模型。公司还表示,自去年推出以来,其年度经常性收入已达 2100 万美元。

这些数字意味着,这笔融资并非又一则普通的初创公司融资消息。Fish Audio 在保持多个语音模型开源的同时,已将一个开发者项目打造为商业平台。如今,它希望在创意制作、客户服务、游戏和实时对话代理等领域,挑战规模更大的语音 AI 公司。

更严峻的考验始于融资之后。Fish Audio 必须证明,开放式分发能够支撑持久的企业业务,同时不削弱对同意授权、许可和语音所有权的保护。ElevenLabs 及其他成熟厂商已在部署选择、安全系统、集成能力和企业关系方面展开竞争。

这轮 5200 万美元融资改变了 Fish Audio 的任务

Fish Audio 已经证明了自身的分发能力和早期营收,但新资金将评判标准从有前景的模型开发商提升为可靠的平台提供商。

这家初创公司于 2026 年 7 月 28 日宣布完成种子轮融资。据最初的融资报道称,Coreline Ventures 和 Capital Today 领投本轮融资。参与投资的机构包括 359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 和 HF0。

Fish Audio 最初是前 Nvidia 研究员 Shijia Liao 创建的一个小项目。据报道,在发现现有合成语音的表现力不足后,他使用一块 GPU 训练了早期语音生成模型,随后将这项成果开源。

这一起源很重要,因为它解释了 Fish Audio 如何进入市场。公司并非以庞大的企业销售团队或资金雄厚的消费级应用起步,而是通过开放代码、社区实验和公开发布模型来吸引开发者。

Fish Speech repository 已累计超过 3.1 万个 GitHub stars。Stars 并不等同于活跃部署或商业合同,但确实表明,这一年轻的语音项目获得了不同寻常的开发者关注。

Fish Audio 表示,独立开发者、游戏设计师和创作者都在使用其模型。这些群体提供了严苛的测试环境,因为他们的需求不止于清晰朗读文本。游戏角色需要丰富的情感表现,而对话代理则需要低延迟和可预测的发音。

公司在成立第一年内推出了五个模型。其中四个用于语音生成,另一个用于将语音转换为文本。Fish Audio 将三个生成模型开源,但其较新的 S2.1 Pro 模型通过商业 API 提供。

API,即应用程序编程接口,让其他产品无需自行运行底层模型即可请求生成语音。这种安排使 Fish Audio 能够更好地控制性能、基础设施和计费;当客户反复使用服务时,也能带来经常性收入。

因此,所披露的 2100 万美元年度经常性收入是这则报道的核心。年度经常性收入衡量重复订阅和合同收入的年度价值。这是公司自行披露的运营指标,而非通过公开文件披露的经审计营收。

对所称 800 万用户也应持同样谨慎态度。该数字包含使用托管服务的人群,以及访问开源模型的人群;它并未说明其中有多少人为付费用户、保持活跃,或在生成生产环境工作负载。

即便存在这些限制,这些数字仍描绘出一家在获得机构资金前就已找到市场需求的公司。CEO 兼联合创始人 Rissa Cao 表示,Fish Audio 过去运营高效,并不需要外部融资。但随着公司寻求开发先进模型并拓展企业客户,战略发生了变化。

这一转变构成了本文的核心张力。开源帮助 Fish Audio 分发技术、邀请测试并建立知名度;但企业扩张如今要求热门代码库本身无法提供的控制能力。

企业买家会评估正常运行时间、延迟、支持、数据处理、区域部署和合同责任。他们还需要明确哪些声音可以使用,以及使用条件为何。Fish Audio 的种子轮融资正为其进军这一要求更高的市场提供资金。

市场对公司的评判已不再只是其演示听起来是否自然。它必须证明,客户能够围绕其模型构建可靠产品,其中包括服务于来电者、员工、观众和玩家的产品——而这些人从未选择过底层语音提供商。

Fish Audio 登上 Google News,为何让更大的语音实验室提高警惕

压力并非仅来自融资金额,而是 Fish Audio 将广泛的开发者访问与托管业务结合了起来。

一家初创公司可以发布模型权重,却未必能建立一家有实质意义的公司;另一家公司也可以销售 API,同时完全封闭其研究。Fish Audio 正试图连接这两条路径:用开放模型推动采用,用托管产品实现商业增长。

这种组合从下方给专业语音公司带来压力。开发者可以检查或部署可用的 Fish Audio 模型,降低早期实验所需的投入。一旦项目发展壮大,开发者便可转向托管模型或商业 API。

这种方式还让 Fish Audio 从许多不同环境中获得反馈。创作者可能测试旁白,工作室则会评估角色表演;语音代理开发者会关注响应时间、打断处理,以及长时间对话中的稳定性。

Fish Audio 表示,其平台提供超过 1.5 万项自然语言控制。用户可通过普通词语描述表达特征,而不是手动调整音频参数。公司将这一范围定位为让生成语音更具可控性的方式。

可控性意味着用户可以指导模型如何演绎,而非只是选择一种声音并接受默认表达。对于创意工作,这可能涉及情绪、节奏或力度;企业应用则可能需要更平和的语气、一致的发音或快速的对话节奏。

Cao 介绍了 Fish Audio 客户群体的不同需求。她表示,AI 虚拟人开发商 HeyGen 优先考虑真实感,游戏工作室需要富有表现力的角色,而语音代理平台则需要足够快速到可用于实时对话的自然语音。

Fish Audio 还称,HeyGen 和 Sanas 正在使用其技术。这些合作关系表明,其模型已经超越孤立的演示案例。不过,现有报道并未披露合同规模、工作负载量、留存情况或涉及的具体产品。

公司近期最有力的突破口,可能来自希望获得比简单旁白产品更多控制权的开发者。工作室可以为一句台词生成多种演绎,而无需再安排一次录音;客服应用则可以针对不同客户情境调整表达方式。

这些场景提升了表现力控制的价值,但也提高了运营要求。戏剧性的声音在编辑期间可以容忍短暂的生成延迟;实时销售或客服通话却无法承受会让对话显得中断的停顿。

因此,Fish Audio 必须服务两个优先级相互冲突的市场。创作者重视实验、情感表现力和编辑灵活性;企业则优先考虑一致性、安全性、监控能力以及规模化下可预测的性能。

竞争对手也在朝同一方向发展。ElevenLabs 已从文本转语音生成扩展至配音、声音设计、音效和对话代理。其 2025 年的 Series C announcement 表示,用户已通过该平台生成了 1000 年时长的音频。

ElevenLabs 当时还称,超过 60% 的 Fortune 500 公司员工正在使用其产品。这些是公司自行提供的数据,衡量的是广泛采用情况,而非完整的企业合同;不过,它们仍说明了 Fish Audio 正在接近的规模。

截至 2026 年 5 月,ElevenLabs 表示其年度经常性收入已超过 5 亿美元。这一说法为 Fish Audio 所披露的 2100 万美元提供了更清晰的竞争参照。Fish Audio 的确势头强劲,但规模仍远小于该领域的领头企业。

这家现有厂商的优势不止于模型质量。ElevenLabs 提供云端、虚拟私有云、本地部署和端侧部署等选择。其本地部署面向具有数据驻留、离线或受控基础设施需求的买家。

Fish Audio 无需立即匹配每一项功能,但必须提供令人信服的理由,让开发者和买家愿意承担切换成本。只有当商业平台保持可靠时,开放可用性和细致控制才能构成这一理由。

Google News 带来的关注让 Fish Audio 在投资者、客户和创作者中获得更广泛的可见度,同时也引来与已花费多年构建安全和企业系统的厂商更密切的比较。公众关注既提升机会,也加强审视。

开放模型是 Fish Audio 的切入点,而非其全部业务

当开放发布降低采用门槛,而其托管模型提供客户愿意付费使用的能力时,Fish Audio 的战略才能奏效。

开源 AI 往往造成混淆,因为开放访问可存在于多个层面。一个项目可能公开代码、模型权重、训练配方,或仅公开部分组件;每种选择都会赋予外部人员不同程度的控制力和可复现性。

根据公司说法,Fish Audio 已将三个语音生成模型开源,而其商业 S2.1 Pro 模型则通过付费 API 提供。这一区分表明,开放性是一种分发机制,而不是对每次发布都绝对开放的承诺。

这一结构类似漏斗。开发者发现项目后,测试可用模型,并判断输出是否适合自己的应用。一部分人会自行运行模型,另一些人则更愿意使用免去基础设施工作的托管服务。

自行托管使团队能够控制部署和定制化,但也将 GPU、扩展、更新、可观测性和安全性的责任转移给该团队。托管 API 简化了这些工作,却增加了对提供商的依赖。

无论哪种结果,Fish Audio 都能从中受益。自行托管的采用扩大其技术影响力和社区可见度;托管服务的使用则带来经常性收入,并让公司直接了解生产环境需求。

随着最强大的能力转移到 API 之后,这种平衡会变得更困难。当开源版本仍然有用时,开发者或许会接受开源与商业模型之间的差距;若开源仅沦为推广样品,他们可能会失去兴趣。

因此,Fish Audio 必须维持可信的开放模型,同时又不能放弃所有商业优势。这正是其挑战封闭式语音平台的核心机制。公司可以通过开放性获得关注,而竞争对手则需通过营销、合作伙伴关系或创业补贴来购买这种关注。

其披露的运营历程表明,这一机制在初始阶段已经奏效。超过 800 万用户和 3.1 万个 GitHub stars 表明其获得了广泛关注。披露的经常性收入则表明,至少部分用户已转化为付费客户。

这些数字都无法证明用户留存具有持久性。一次病毒式传播的模型发布,可能吸引一次性试用,却未必能形成长期工作负载。如果少数客户占据了大部分使用量,收入集中度同样可能掩盖风险。

该公司尚未公开足够细节来解答这些问题。它未披露净收入留存率、毛利率、推理成本,或创作者收入与企业收入之间的构成。这些指标之所以重要,是因为语音生成可能消耗大量计算资源。

精细化控制同样有成本。模型必须在保持所选说话者身份特征和可理解度的同时,稳定地解读指令。更多控制选项会产生更多组合,需要跨语言、口音和情绪风格进行测试。

投资者押注 Fish Audio 能够高效应对这种复杂性。359 Capital 的 Rico Mallozzi 强调,细致的开发者控制能力和高成本效益的模型训练是其竞争优势。这是投资者的判断,而非独立技术基准测试的结论。

单 GPU 的起源故事强化了效率叙事。但训练早期模型与服务数百万用户和企业工作负载并不相同。生产系统必须处理并发请求、故障、滥用行为和不断变化的需求。

Fish Audio 下一步计划推出的模型将扩大这一挑战。该公司计划在 2026 年发布音频理解模型,并正在开发语音到语音技术。音频理解是在声音中解读含义、事件、情绪或上下文,而不只是转录文字。

语音到语音系统会将语音输入直接转换为新的语音输出。相比先将语音转成文本的流水线,它们能更好地保留时序和表达信息,也能让实时智能体显得更灵敏。

这些项目使 Fish Audio 超越了合成旁白的范畴。它们让这家初创公司更接近一个服务于智能体、媒体工具和交互式应用的通用音频智能平台。这一更大的雄心解释了公司为何选择此时融资。

这也提高了执行风险。每个新模型都会扩大测试范围,并争夺工程资源。Fish Audio 必须在持续研究和支持庞大开源社区的同时,改进其商业服务。

这一战略是连贯的,但不会自行实现。开放分发可以填满漏斗顶端。只有可靠的产品、清晰的许可条款和持续的客户价值,才能将这种关注转化为持久的企业市场地位。

语音同意缺口如今已成为商业风险

Fish Audio 最大的障碍不在于生成语音是否听起来像真人,而在于人们能否信任语音如何进入和离开其平台。

Fish Audio 曾邀请用户贡献自己的声音,用于模型训练和平台使用。当其他人使用这些声音时,公司可以向贡献者提供报酬。理论上,这形成了一个市场,让人们可以许可其声纹身份的数字版本。

当上传者提交他人的声音时,系统的风险会大幅上升。一些创作者声称,他们的声音未经同意便出现在 Fish Audio 上。现有报道表明,该公司设有下架流程,但此前移除所需时间过长。

Cao 向 TechCrunch 表示,Fish Audio 已将该流程自动化。她称,创作者可以提交一小段语音样本或合同作为证明。根据她的说法,平台随后可在三分钟内移除存在争议的声音。

这一改变提升了投诉发生后的响应速度。但它无法阻止未经授权的上传内容在受影响者发现之前就上线。该系统仍将部分发现负担放在声音所有者身上。

这一区别很重要,因为移除和预防解决的是不同问题。快速移除系统会在发现后限制持续伤害;验证则是在声音变得可搜索或可用之前,检查上传者是否拥有许可。

Coreline Ventures 合伙人 Osuke Honda 承认,创作者信任对社区模式至关重要。他呼吁建立同意、透明度、归属标注、简便举报机制以及最终的收入分成。他的表态值得注意,因为它将安全视为投资逻辑成立的条件。

在美国,语音权利仍处于法律分散的状态。版权法并不总是保护一个人的声音本身。公开权、隐私权、合同、欺诈和州级数字复制品法律,可能会因使用方式和所在地不同而适用不同规则。

美国版权局在其数字复制品报告中审视了这些缺口。该机构建议制定针对未经授权数字复制品的联邦法律,因为现有保护被认为缺乏一致性。政策发展并不会自动厘清平台责任。

对 Fish Audio 而言,实际问题会在任何最终全国标准出台之前到来。企业客户不希望某项语音资产在部署后引发纠纷。游戏工作室、广告商或客服供应商需要证据,证明是谁授权了某个声音,以及协议允许哪些用途。

同意的细节也远不止单一的是或否选择。说话者可能允许个人实验,却拒绝商业广告。另一些人可能允许旁白使用,但禁止政治内容、成人内容或冒充。

许可系统必须在声音流经工具和客户应用时保留这些条件。平台还需要保留可审计的同意、变更和撤回记录。否则,买方无法自信地评估自身风险敞口。

收入分成又增加了一层复杂性。报酬可以鼓励合法贡献,并让创作者在平台中拥有经济利益。但如果原始上传未经授权,付款并不能构成同意。

自动化验证也可能出错。语音相似度会随录音质量、口音、年龄、情绪和背景噪声而变化。假阴性会让未经授权的声音继续留在网上,而假阳性则可能移除合法模型。

Fish Audio 尚未公开其所有权核验或下架系统的独立准确性数据。它也未披露有多少争议声音被举报、移除,或在申诉后恢复。这些缺失的数据使得全面评估无法进行。

不应将这家初创公司视为唯一要为行业性问题负责的主体。每一家语音克隆服务商都必须应对冒充、欺诈、所有权争议和不断变化的法律。开放模型进一步增加了执法难度,因为第三方可以在托管平台之外运行它们。

这一更广泛的背景并不能减轻 Fish Audio 的义务。其社区驱动模式使信任成为核心产品功能。平台在更多人贡献声音时获得价值,但每一份贡献都需要可信的许可和可追溯性。

企业会在采购过程中检验这些控制措施。他们可能要求赔偿保障、数据处理条款、安全文档以及已获许可训练材料的证据。引人注目的演示不能替代这些保障。

Fish Audio 的融资为其加强这一层能力提供了资源,也使“这类系统必须等到以后再建”的借口不再成立。同意架构如今应与延迟和表现力一道,列入公司的产品路线图。

Fish Audio 要在模型质量上超越的不只是 ElevenLabs

竞争正在演变为一场涉及部署、工作流、信任和分发的平台竞赛,而不是对自然语音效果进行单一排名。

ElevenLabs 仍是最显眼的参照对象,因为它同时覆盖创作者和企业市场。它提供语音生成、配音、声音设计、音效、对话式智能体和内容制作工具。其规模让客户获得的是一个广泛的平台,而非单一模型端点。

Fish Audio 还与 WellSaid、Cartesia、Speechify、Async 和 Krisp 等专业厂商竞争。这些公司从不同起点切入音频领域,包括旁白、实时生成、通信增强和创作者工作流。

这种多样性使基准测试的胜利不再那么决定性。一种模型可能在精心准备的样本中表现出色,却难以处理罕见姓名或实时打断。另一种模型可能响应迅速,但情绪变化能力较弱。

企业团队会评估语音背后的完整运营系统。他们会询问供应商是否能够达到延迟目标、应对流量高峰、保护客户数据并维持稳定输出。他们还会评估文档、支持和部署灵活性。

创作者使用的是不同的评分标准。他们需要富有表现力的输出、实用的编辑工具、可预测的角色声音和可控的修订周期。他们可能看重广泛的声音库,但仍会对其中的所有权纠纷保持敏感。

Fish Audio 报告称拥有 15,000 项控制能力,如果用户能够有效使用它们,这可能会使平台脱颖而出。庞大的控制词汇并不自动意味着更好的界面。用户需要可重复的结果、合理的预设,以及保留已获批准表演效果的方法。

该公司还可以通过开发者社区展开竞争。开放模型让工程师能在本地测试、观察行为并调整集成方式,然后再决定是否绑定某家供应商。这种灵活性吸引了不喜欢封闭依赖的团队。

然而,开放模型也可能帮助竞争对手。其他公司可以吸收公开研究成果、微调模型,或围绕其提供托管服务。Fish Audio 必须持续提供无法仅靠下载权重就能复制的产品价值。

托管的 S2.1 Pro 模型就是一种应对方式。将更新的模型保留在 API 之后,可以保护差异化并支持收入。但如果性能差距过大,这一决定也会削弱开放性的优势。

这就是为什么 Fish Audio 的主要对手是封闭、垂直整合的平台路径,而不只是 ElevenLabs。封闭厂商将模型开发、托管、安全执行和商业关系集中于一个受控服务中。Fish Audio 希望实现社区分发,同时不放弃这些企业级优势。

开放路径可以加速实验并扩大采用范围。整合路径则可以简化问责机制和产品一致性。两种结构都不能保证在每种情况下带来更好的语音、更低的成本或更安全的部署。

Fish Audio 必须证明其混合方式能够保留两者的优势。开发者应获得有意义的访问权限,企业买方则应获得可控且可支持的服务。创作者应获得机会,同时不失去对自身身份的控制权。

该公司披露的客户说明了这一机会。HeyGen 可以将生成语音与 AI 虚拟形象结合使用,而 Sanas 致力于面向实时通信的语音技术。这些应用将语音置于更广泛的产品之中,而非把它作为独立的新奇功能。

游戏提供了另一项高要求测试。一个工作室可能需要为角色、情绪和剧情分支生成数千行内容。模型必须在响应指令的同时保持角色身份一致,并避免发音前后不一。

客户支持则带来不同的挑战。语音代理必须快速说话、理解用户打断,并能从不确定的输入中恢复。若政策或法律要求透明披露,它还必须说明自身为自动化系统。

这些环境会形成转换成本。团队一旦围绕某家供应商调校提示词、质量检查、发音规则和监控体系,迁移就会变得昂贵。Fish Audio 需要尽早进入项目,或提供足够显著的改进,才能证明替换现有方案是合理的。

Google News 的曝光有助于让这家初创公司进入评估名单,但无法让 Fish Audio 独自通过采购流程。买家希望看到其在自身工作负载下经过测量的表现,而不只是关于表现力的笼统说法。

这笔融资为 Fish Audio 赢得了积累这类证据的时间。公司可以扩大评估、企业控制能力、安全系统和部署选项。下一阶段将揭示,它能否把技术热情转化为机构层面的信任。

融资热度消退后值得关注的事项

以下三个信号将表明 Fish Audio 正在打造持久的语音平台,还是仅仅延续一个成功开源项目带来的关注。

第一个信号是计划中的音频理解模型。Fish Audio 表示,计划在 2026 年发布该模型。一次实质性的发布将表明,该公司能够从语音生成扩展到理解更广泛音频语境的系统。

关键细节包括模型访问方式、支持的任务、延迟、语言以及评估方法。仅提供 API 的演示将支持其商业平台战略;可信的开放发布则会强化 Fish Audio 以社区驱动分发的论点。

独立测试的重要性将高于公司排行榜。音频理解涵盖多种任务,单一分数可能掩盖表现的不均衡。开发者应考察模型如何应对嘈杂录音、重叠说话者、情绪表达和陌生声音。

第二个信号是语音到语音技术的进展。Fish Audio 支持实时转换的能力,将决定它能否在对话式代理领域展开深入竞争。产品必须在不增加尴尬停顿的前提下保留富有表现力的信息。

应关注在真实客户环境中运行的集成方案。经过精心打磨的实验室案例,对处理打断、通话质量或正常运行时间的说明有限。生产部署将强化 Fish Audio 能够服务企业通信的主张。

竞争对手的反应也属于这一信号的一部分。ElevenLabs、Cartesia 和其他供应商将持续改进延迟、可控性和部署选项。Fish Audio 必须在基准持续演进时取得进展,而不是与一个停滞的市场版本竞争。

第三个信号是语音所有权方面可衡量的进展。Fish Audio 应披露其验证和下架系统在大规模运行下的表现。实用指标包括投诉量、下架中位耗时、重复上传、申诉以及已验证声音的参与度。

预防性的所有权系统,比又一次快速下架的声明更能强化公司的平台论点。这可能包括上传者验证、明确的许可选择、持久归属信息,以及随每个声音一同生效的限制措施。

独立审计或可信的创作者合作伙伴关系同样重要。它们无法消除滥用,但可以表明 Fish Audio 将同意机制视为基础设施。随着使用规模扩大,若在这些指标上保持沉默,将削弱外界信心。

投资者自然会关注营收增长,但营收本身无法回答战略问题。建立在少数合同之上的快速增长可能较为脆弱。创作者、开发者和企业客户的广泛留存,将提供更有力的证据。

据报道,2100 万美元的经常性收入提供了有用的基准。未来披露应明确客户集中度、托管使用量和企业收入贡献。缺少这些背景,外部观察者无法区分持久扩张与暂时性需求。

Fish Audio 的融资轮值得关注,因为该公司已经拥有用户采用、收入和可见的开发者社区。它并非从一份融资演示文稿起步,而是在尝试将开源立足点转化为广泛的音频业务。

反转之处在于,模型质量可能是下一阶段最容易解决的部分。Fish Audio 现在面临的是基础设施、支持、合规、所有权和可重复部署这些不那么光鲜的工作。正是这些系统决定哪些前景看好的 AI 供应商能成为长期供应商。

对于创作者而言,核心问题是,更具表现力的工具是否会同时带来对声音身份可执行的控制。开发者应测试,随着 Fish Audio 最佳模型走向商业化,开放访问是否仍然具有实际意义。企业买家则应像审视音频质量一样仔细审查许可和部署细节。

下一条 Google News 标题的重要性将低于这些运营信号。请依次关注模型发布、实时集成和所有权保障。它们将共同表明,Fish Audio 的混合战略能否挑战目前定义市场的语音 AI 平台。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page