top of page

Treble 融资轮新增 1800 万美元,推动语音仿真迈向物理 AI

7天前
讀畢需時 14 分鐘

Treble Technologies 完成 1800 万美元融资,使这轮 Treble 融资成为对语音机器应如何开发与测试的一次押注。这家冰岛初创公司希望让声学仿真成为语音模型、可穿戴设备、机器人、车辆及其他必须理解声音的产品所共用的基础设施。

Paladin Capital Group 领投这轮 A-2 轮融资,KOMPAS VC、Frumtak Ventures 和 European Innovation Council Fund 也参与其中。Treble 表示,这笔投资使其累计融资额达到 3600 万欧元,并将支持其在美国的业务扩张。

真正的矛盾并不在融资本身。语音系统在干净录音中可能表现良好,却可能在餐厅、车辆、混响房间和移动设备中遇到困难。Treble 押注于基于物理的合成数据,能够在团队开展昂贵的录音采集或制造最终硬件之前暴露这些问题。

这使该公司处于两条既有开发路径之间。音频团队传统上会收集录音并测试实体原型,而 COMSOL 等工程平台已可对声学行为进行建模。Treble 希望通过面向产品工程师和 AI 模型开发者的云平台,将这两个世界连接起来。

Treble 融资轮带来了什么变化

这笔融资让 Treble 有空间从专业声学软件迈向更广泛的、服务于具备听觉能力机器的开发层。

该公司于 2026 年 9 月 17 日宣布完成 1800 万美元 A-2 轮融资。Paladin Capital Group 领投,现有投资者 KOMPAS VC、Frumtak Ventures 和 EIC Fund 继续参与。

TechCrunch 报道称,Omega ehf 也参与了本轮融资,并使 Treble 的累计融资额超过 4000 万美元。Treble 自身的公告则将总额表述为 3600 万欧元,反映了其融资历史中所使用的不同货币。

这一差异之所以重要,是因为该轮融资是对此前 A 轮融资的延续,而非开启一个全新的融资阶段。Treble 曾在 2024 年融资 1100 万欧元,用于扩大团队、研究项目、企业客户基础和地域覆盖范围。

最新一轮 Treble 融资有着更明确的商业目标。Treble 计划将其音频开发平台扩展至语音 AI、消费设备、工业系统、机器人、汽车产品和无人机等领域。

Treble 由声学工程师 Finnur Pind 和 Jesper Pedersen 于 2020 年在雷克雅未克创立。其平台可模拟声音如何穿过空间、材料、设备以及不断变化的声源位置。

这些输出可支持虚拟原型设计、模型评估和合成数据生成。合成声学数据是由模拟物理条件塑造的计算机生成音频,而非在每个真实地点收集的录音。

Treble 表示,Amazon 和 Logitech 正在使用其技术。这些应用说明,同一套仿真引擎可以服务不同类型的客户。

根据 Treble 的音频平台公告中引用的一份声明,Amazon 在 Alexa 的设计和模型开发中使用虚拟声学环境。Logitech 表示,该平台帮助其模拟在实体测试中难以稳定复现的环境。

这些客户案例比本轮融资的 headline 金额更具参考价值。它们表明,Treble 正在切入开发工作流程,其仿真结果可能影响模型选择、硬件布局和测试计划。

因此,这笔融资既扩大了 Treble 的市场,也加重了其技术负担。用于固定会议扬声器的平台,与用于测试移动机器人、智能眼镜或车辆的平台,面临的条件并不相同。

Treble 必须模拟变化的距离、麦克风位置、背景噪声、房间材料和设备移动。它还必须证明,这些虚拟条件足以准确预测真实表现,从而指导工程决策。

该公司称,它可以将部分测试和数据收集周期从数月缩短至数天。这仍是公司自身的说法,实际结果将取决于具体产品、环境和验证流程。

不过,其商业目标十分明确。Treble 希望客户更早模拟更多条件,再将实体测试保留给验证环节,以及模型无法解决的问题。

为什么语音 AI 需要模拟房间

语音 AI 的部署难题不只是识别词语,而是在物理世界改变信号之后,仍能识别这些词语。

麦克风很少能接收到语音模型在精心整理的数据集中见过的那种干净人声。墙壁会反射声音,家具会使声音散射,背景声源会造成干扰,距离则会削弱直达声信号。

开发者将远距离麦克风的使用称为远场语音识别。在这种场景下,说话者距离麦克风数英尺,而不是直接对着手机或耳机说话。

房间脉冲响应记录短促声音如何从一个位置传播至另一个位置。开发者可以将这一响应应用于干净语音,生成带有模拟房间混响和空间行为特征的音频。

Treble 将低频段的波动计算与高频段的几何声学建模相结合。该公司表示,这种混合方法能够捕捉更简单的基于射线仿真可能遗漏的效应,包括衍射、干涉和模态行为。

这一机制之所以重要,是因为语音产品正逐渐摆脱可预测的麦克风配置。智能音箱通常固定在一个位置,但眼镜、机器人、无人机和车辆会在不断变化的声学场景中移动。

机器人可能听到障碍物后方传来的警告。智能眼镜可能需要在拥挤的餐厅中分离出附近说话者的声音。车载助手则必须将指令与道路噪声、乘客声音、娱乐音频以及不断变化的车舱条件区分开来。

为每种组合收集录音很快就会变得不切实际。团队需要使用不同的房间、设备摆放方式、说话者、噪声、材料和移动路径。

录制数据也带来运营限制。工程师必须安排场地、控制设备、标注样本,并在设备或麦克风布局变化时重复采集工作。

仿真提供了另一种工作流程。团队定义房间、声源、接收器、材料、噪声和设备几何结构,然后生成可重复的测试条件。

这种可重复性支持受控比较。工程师可以在保持房间、说话者和噪声源不变的情况下,仅改变一个麦克风的位置。

合成数据还会继承其构建过程中的标签。系统本就知道每种声音源自何处、使用了哪些房间属性,以及设备如何摆放。

不过,生成的音频并不会自动代表现实。模拟器可能遗漏材料细节、不可预测的噪声、人类行为、制造差异或硬件效应。

这构成了 Treble 扩张背后的核心要求:当模型和设备离开虚拟环境后,其仿真仍必须保持实用。

Treble 与 Hugging Face 的合作,为这一命题提供了早期公开测试。他们的远场基准测试在模拟房间、实验室实测条件、不同噪声水平和移动声源场景中评估语音识别系统。

该基准测试包含 14 个带家具的虚拟空间,房间体积从 20 立方米到 470 立方米不等。场景包括浴室、办公室、教室、客厅和餐厅环境。

每个场景将一个目标说话者与最多三个噪声源组合。该基准测试区分高、中、低信噪比条件,并报告识别错误率和处理速度。

这种结构让声学失效问题更早进入模型评估阶段。它也为 Treble 提供了一个公开场所,使研究人员可以比较模拟条件与实测条件。

对于开发团队而言,这类证据需要始终与决策相连。一个可搜索知识库可以在重复评估过程中保留测试假设、模型版本、声学场景和工程结论。

更大的转变在于组织层面。声学仿真不再仅限于估算房间或扬声器的声音效果。

Treble 希望让仿真输出影响训练数据、AI 基准测试、麦克风布局、降噪、语音增强和最终设备行为。这将受众从声学专家扩展至机器学习和产品团队。

核心押注是在实地测试之前进行仿真

Treble 并非认为实体测试会消失;它主张应由仿真决定哪些方案进入实体测试。

传统音频开发通常经历录音、原型、听音测试、测量和迭代等环节。这个过程能够捕捉真实行为,但要实现广泛的场景覆盖,可能既缓慢又昂贵。

Treble 提出的流程更早开始。团队会在投入大规模录音项目之前,创建房间、设备、车辆和声源的数字声学版本。

随后,他们可以生成训练数据、比较硬件配置、评估语音模型并寻找薄弱条件。实体测试则成为验证层,并为改进仿真提供测量数据来源。

这正是该公司物理 AI 叙事背后的机制。物理 AI 指能够在真实环境中感知和行动的系统,包括机器人、车辆和可穿戴设备。

视觉之所以主导这一领域,是因为摄像头能提供可见物体和运动的信息。声音则可以补充发生在摄像头视野之外、障碍物后方,或物体尚未可见之前发生的事件。

家用机器人可能检测到另一间房里的碰撞声。工业机器人可能在摄像头朝向其他方向时识别出警报声。

这些例子仍属于前瞻性用例,并不能证明其已获得广泛商业采用。不过,它们确实解释了 Paladin 为何将声学智能视为多模态感知栈的一部分。

该投资者的论点是,机器将需要结合视觉与听觉输入。Treble 提供了开发和测试第二条感知通道所需的声学环境。

同样的理念也适用于消费硬件。耳机和智能眼镜越来越多地配备麦克风、处理器和模型,用于决定哪些声音传递给用户。

Treble CEO Finnur Pind 描述了一项可能的听觉功能:在嘈杂餐厅中突出附近说话者的声音。他还提出,设备可以在研讨会期间抑制周围的交谈声。

这些场景需要的不仅是语音转录。设备必须估计方向、距离、噪声、混响,以及听者不断变化的位置。

通过录音测试所有组合将十分困难。仿真可以成倍扩展测试案例,而无需为每种配置安排新的场地。

Treble 的平台还支持扬声器和耳机的虚拟原型设计。工程师可以在最终确定实体设计之前,研究预测的声音行为。

这使 Treble 进入了一个已有成熟工程软件的市场。例如,COMSOL acoustics suite 可对扬声器、麦克风、传感器、移动设备、房间及振动效应进行建模。

Ansys 也提供产品声音与声学分析工具。传统声学咨询公司则提供测量、房间建模和专业设计服务。

因此,Treble 的差异化不能仅建立在声学仿真这一能力本身之上。该领域早已有成熟的工具和技术方法。

它真正押注的是工作流程和规模。Treble 希望通过一个云平台,将物理仿真与合成数据集、AI 评估和硬件开发连接起来。

这一定位使模型开发者成为重要客户群体。许多工程仿真器面向的是已经理解材料、网格、求解器和声学边界条件的专业人士。

AI 团队需要不同的产出。他们需要带标签的数据集、可重复的基准测试、程序化生成,以及覆盖多种配置的测试。

Treble 已发布的数据集展示了这种衔接可能如何实现。Treble10 集合包含十个布置家具的空间的房间脉冲响应和混响语音。

其六个子集涵盖单声道音频、81 通道空间格式,以及六麦克风设备布局。配套的混响语音版本使研究人员能够评估多项远场任务。

根据配套的 Treble10 research,该数据集面向语音识别、去混响、语音增强和数据增强。作者将其描述为对规模有限的测量数据集的一种可复现替代方案。

这笔融资为 Treble 提供了更多资源,可将这一研究模式转化为企业基础设施。其成功取决于团队是否会在整个开发过程中采用该平台,而非仅将其用于偶尔开展的声学研究。

Treble 的基准测试揭示了什么,以及仍无法证明什么

公开基准测试支持 Treble 的技术论点,但尚未证明仿真带来的收益能在多大范围内迁移至已上市产品。

Far-Field ASR Leaderboard 突出了模型的一项真实弱点。当语音从干净、近距离的音频转变为嘈杂、有混响且距离较远的条件时,识别错误会增加。

Hugging Face 表示,在低信噪比测试中,各提交模型的词错误率比近场测试高出数倍。这一结果强化了 Treble 的观点:干净语音上的表现可能掩盖部署中的问题。

该基准使用标准化硬件,并同时报告词错误率和处理速度。它还将评估音频保持私有,从而降低参与者直接使用测试样本训练的可能性。

实测与仿真实验室赛道尤为重要。两方都会复现相近的房间条件,使参与者能够考察虚拟测试与录音之间的匹配程度。

该基准还在 beta 阶段纳入了移动声源评估。这些测试面向说话者或设备改变位置的场景,包括机器人、汽车和移动助手。

这是一项有用的证据,但其边界依然明确。一个基准只能涵盖其设计者所选择的房间、麦克风、噪声源、语言、移动方式和模型。

十四个模拟空间无法代表所有住宅、工厂、车辆、街道或工作场所。即使拥有更大的目录,仍会面对罕见材料、非典型布局和不可控组合。

Treble 也参与了该基准的设计,并提供其仿真引擎。与 Hugging Face 的合作提升了可见度和可访问性,但独立复现仍然重要。

Treble10 数据集提供了另一条验证路径,因为研究人员可以下载并检查其输出。其声学数据集涵盖十个布置家具的房间,具有不同的体积和混响时间。

不过,数据集可获得并不能证明每一项企业仿真都能与其物理对应物相匹配。客户必须验证那些对自身设备真正重要的场景。

硬件也带来了另一层不确定性。麦克风公差、扬声器失真、外壳振动、信号处理、热行为和制造差异都可能改变结果。

人的行为同样难以参数化。人们会改变音量、朝向、口音、距离、说话速度和设备位置,而不会遵循实验室计划。

对于机器人和移动式可穿戴设备,这一问题还会进一步扩大。系统必须更新声学几何结构,同时电机、风声、脚步声和物理运动还会产生额外噪声。

Treble 表示,其数字孪生可在团队制造原型之前表征设备和环境。数字孪生是对物理产品或环境的计算表示。

任何数字孪生的质量都取决于其输入。错误的材料属性、几何结构、设备响应或边界假设,都可能产生看似精确却具有误导性的结果。

商业层面的证据仍然有限。Amazon 和 Logitech 证明主要产品团队看到了价值,但 Treble 尚未公开披露客户集中度或经常性收入。

公司也没有提供来自建筑、消费电子、AI 数据集或 physical AI 的收入细分。因此,其市场转型的速度难以衡量。

Treble 关于将部分开发工作从数月缩短至数天的说法,也需要放在背景中理解。仿真可以缩短特定实验,但实施、验证和集成仍会占用工程时间。

因此,最有力的解读应比公司的宏大愿景更为收窄。Treble 已展示,基于物理的数据能够揭示标准语音测试所忽略的声学条件。

尚未回答的问题是,客户是否会将这种能力视为必要基础设施。这需要在多种产品中获得可重复的证据,而不只是令人信服的演示和基准测试结果。

当音频进入 physical AI,谁将面临压力

Treble 正在推动 AI 实验室、硬件制造商和成熟仿真供应商,更早地将声学测试与模型开发连接起来。

语音模型开发者面临最直接的压力。他们不能再假设,干净或近场音频上的表现能够预测部署设备中的行为。

在受控条件下排名靠前的模型,可能会在说话者转身、穿过房间,或与通风噪声竞争时失效。公开的远场比较让这些弱点更容易被发现。

这可能改变采购对话。设备制造商可能要求模型供应商提供在特定房间、麦克风阵列、运动和噪声条件下的结果。

模型供应商随后将需要合适的评估数据。他们可以收集录音、构建内部仿真器、与测试实验室合作,或使用像 Treble 这样的平台。

消费硬件团队面临相关选择。更好的模型无法完全弥补糟糕的麦克风布局、外壳声学设计或设备几何结构。

仿真让团队能在生产前比较这些决策。如果结果能够预测真实测量,声学数据就会成为工业设计的输入,而非后期验证步骤。

成熟工程软件供应商面临不同挑战。他们的求解器已经覆盖复杂的声学和机械问题,通常具备广泛的专业控制能力。

Treble 正在将这门科学的一部分打包为云端工作流程、合成数据生成和 AI 评估。竞争的核心在于可访问性、自动化和集成,而不仅仅是物理学本身。

传统录音与测试服务提供商仍将十分重要。物理测量提供真实基准,并揭示虚拟模型遗漏的因素。

他们的角色可能会转向更高价值的验证和不常见的边缘情况。当仿真被证明足够准确时,常规场景扩展可能转向合成数据。

这种压力也延伸至机器人公司。大多数机器人团队会优先考虑摄像头、深度传感器和运动系统,然后才是声学感知。

Treble 的主张是让它们将声音视为一种互补传感器。这意味着要向音频分配模型能力、麦克风、算力、测试时间和安全分析资源。

采用情况将取决于应用。一台仓库机器人可能很难从复杂的听觉能力中获得太多收益,而家用或照护机器人则可能受益于摄像头覆盖范围外的声音检测。

汽车开发者已经在处理车舱声学、语音助手、警示音和噪声消除。统一的仿真工作流程可以连接这些功能,但成熟供应商和内部工具构成了很高的进入壁垒。

可穿戴设备提供了更直接的路径。耳机、耳塞式耳机、助听设备和智能眼镜已经将麦克风置于靠近用户的位置,并在不可预测的空间中运行。

Treble 可以服务于这些产品的两端。它既可以建模硬件行为,也可以为增强、抑制、分离或分类声音的算法生成数据。

公司必须避免将自身铺得过于分散。语音 AI、消费电子、机器人、汽车、无人机和建筑声学涉及不同的买方和验证标准。

Treble 的融资轮为扩张提供了资本,但资金无法消除这些市场差异。Treble 需要可重复的产品化方案,而不是一系列定制项目。

这一区别将决定它是成为基础设施,还是仍停留在专业工程软件层面。基础设施通常通过让团队更容易反复采用而取胜。

1800 万美元融资轮后值得关注的三个信号

Treble 的下一项考验是可衡量的采用、独立验证,以及移动机器是否需要其声学仿真层的证据。

第一个信号是客户是否扩展至两个公开名称之外。关注机器人、汽车、无人机、智能眼镜或助听设备公司的已披露部署。

一个具名的量产项目将强化 Treble 的 physical AI 论点。另一个探索性合作伙伴关系能显示兴趣,但未必意味着持续使用。

第二个信号是独立的 sim-to-real 验证。研究人员或客户应在陌生的房间、设备和移动配置中,将 Treble 生成的场景与测量结果进行比较。

来自外部评估的接近结果将支持该平台的核心主张。较大或不一致的差距则会将仿真的角色限制在早期探索阶段。

第三个信号是更广泛的基准参与。更多模型提交、麦克风阵列、语言、多说话者场景和回声消除测试,会让远场排行榜更具参考价值。

参与情况也将揭示语音开发者是否将现实声学评估视为共同要求。有限的活动将表明,这一问题依然重要,但仍然专业化。

投资者很可能会重点关注商业扩张,尤其是在美国。开发者则应关注另一项指标:Treble 的输出是否改变了训练选择、设备布局和发布决策。

这 1800 万美元并未解决这一问题。它为一次更大规模的尝试提供资金,以在多个产品类别中回答这个问题。

对于语音 AI 团队,实际行动是将干净音频结果与嘈杂、远距离和移动声源评估进行比较。硬件团队应确定哪些物理测试可以在不削弱验证的前提下进行仿真。

机器人和可穿戴设备开发者应询问,音频是否提供了摄像头无法捕获的信息。随后,他们应测试虚拟场景能否预测其实际设备上的表现。

Treble 此轮融资之所以重要,是因为声音正成为系统级工程问题。其结果将显示,基于物理的声学数据能否成为标准 AI 基础设施,还是仍将只是专业测试工具。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page