Nuance Labs A轮融资押注:AI需要的不只是文字
Nuance Labs 融资5000万美元,用于打造一款能在实时对话中观察、倾听、说话并改变表情的AI模型。Nuance Labs A轮融资将这一技术构想转化为一场更大规模的考验。该公司必须证明,富有表现力的行为能让AI更有用,而不只是显得更像人。
这家西雅图创业公司并非只是提出为聊天机器人配上一张动画脸。该公司表示,一款全双工模型将处理文字、语音、注视、手势和时机,同时生成视听回应。全双工意味着双方可以同时交流,包括打断对方和简短回应。
这一方法挑战了语音智能体和数字虚拟形象中已被广泛采用的模块化系统。这些系统通常将语音识别、语言模型、语音合成和面部动画连接起来。Nuance Labs 认为,统一模型能够保留在这些组件之间传递时丢失的对话信号。
这笔融资为这一主张提供了有力支持。但它也带来了紧迫的时间表,因为 Nuance Labs 计划在2026年晚些时候开放公开研究预览。OpenAI、Hume AI、Tavus 和其他团队已经提供了 Nuance 希望整合的部分体验。
Nuance Labs A轮融资为统一对话模型提供资金
关键变化不只是融资本身。Nuance Labs 如今拥有了推动其统一视听模型迈向公开测试的资源。
Lightspeed Venture Partners 领投本轮5000万美元A轮融资。Accel 和 South Park Commons 继续投资,NVIDIA 和 Define Ventures 则加入本轮。继1000万美元种子轮后,这笔融资使该公司的累计披露融资额达到6000万美元。
Nuance Labs 于2026年9月14日宣布本轮融资。其 A轮融资公告称,这笔资金将用于模型开发、研究人员招聘,以及在今年晚些时候推出公开预览。
据一份详细的融资报道,本轮融资披露时,该公司有27名员工。公司计划在建模、数据、评估、推理和实时服务等领域招聘人才。
这些招聘方向揭示了技术压力所在。训练视听模型只是问题的一部分。模型还必须理解实时数据流、判断哪些信息重要、生成回应,并以足够快的速度呈现,才能支撑自然对话。
即便是微小的延迟,也会改变一段交流的感受。在某些场景中,停顿可能体现深思熟虑;在另一些场景中,则可能意味着困惑。一次打断可能显得投入,也可能显得无礼。若面部反应晚于对应的话语才出现,便可能看起来与其含义脱节。
Nuance Labs 由前 Apple 研究人员 Fangchang Ma、Edward Zhang 和 Karren Yang 于2025年初创立。Zhang 获得华盛顿大学计算机图形学博士学位。Ma 和 Zhang 此前曾参与 Apple 的 Digital Persona 技术,该技术为用户创建用于空间通信的数字化表征。
这一背景有助于解释公司的起点。Nuance Labs 将面部、语音和对话策略视为同一生成式问题的组成部分。它并不把面部动画视为答案完成后才附加的装饰层。
该公司将其系统描述为面向人类对话和表达的基础模型。它表示,该模型接收实时视听信号,并实时输出面部和语音回应。其既定目标是打造一名能在人说话时作出反应的AI参与者,而不是等待转录文本完成后再给出完整答案。
随公告发布的一段演示展示了一个作为积极倾听者的虚拟形象。它的表情和口头回应会随着用户说话而变化。这一演示说明了目标体验,但并非对该模型的独立评估。
这种区别很重要。受控演示能够证明系统可以运行,却无法证明系统将如何处理口音、昏暗光线、重叠语音、非常规表情、情绪模糊性或长时间对话。
因此,公开研究预览的重要性将超过融资公告本身。它应当揭示 Nuance Labs 的情感AI在脱离预先准备的互动后,是否仍能保持响应。它也将提供关于可靠性和用户舒适度的首批有意义证据。
为何富有表现力的AI已成为竞争目标
AI公司正在争夺交互层的主导权;在这里,时机与社交线索的重要性可能不亚于回答质量。
文本聊天为生成式AI确立了基本模式:用户提交消息、等待,然后获得完整回应。语音系统改变了输入和输出形式,但许多系统仍保留着相同的底层顺序。
典型的模块化语音智能体会先将语音转换为文本。语言模型生成答案,语音合成器再将答案转为音频。视频虚拟形象则可以增加另一个组件,将音频映射为面部动作。
每一次交接都可能丢失信息。转录文本或许保留了词语,却失去了犹豫、强调、语速和重叠语音。生成的语音可能重建语气,却并不确切知道用户说话时的表情。虚拟形象可能为答案制作动画,但并未参与生成该答案的推理过程。
Nuance Labs 表示,其统一架构旨在避免这些损失。模型同时观察多个通道,也同步生成多个通道。从理论上说,这让回应不仅能反映一个人说了什么,也能反映这段交流是如何展开的。
时机对其有利,因为用户已经理解实时多模态AI。OpenAI 将 GPT-4o 介绍为一款跨文本、视觉和音频训练的统一模型。其公开的GPT-4o 系统卡称,音频响应时间最低可达232毫秒,平均为320毫秒。
这些数据确立了明确的竞争基准。专用模型不能依赖“与AI交谈”的新鲜感,而必须提供比大型模型提供商支持的系统更具说服力或更有用的交互。
Hume AI 专注于富有表现力的语音和情绪测量。Tavus 构建了结合感知、轮次管理、语音和动画数字人物的实时视频智能体。Synthesia 及相关平台则让生成式演示者在培训和商务沟通中变得常见。
Nuance Labs 进入了这些类别之间的领域。其构想结合了情绪感知语音系统所具备的表达敏感度,以及虚拟形象平台所具有的视觉存在感。它还声称,应由一个模型而非一条流水线来主导整段交流。
这使 Nuance Labs A轮融资成为对架构和产品体验的押注。如果统一模型能更好地保留上下文,它就可能令模块化系统显得像是机械拼装而成。若用户几乎感受不到实际差异,现有服务商则可继续改进各自的独立组件。
目标应用让赌注更高。Nuance Labs 将销售、客户服务、职业辅导和教育列为潜在市场。这些场景中,注意力、犹豫和挫败感都可能影响下一次回应。
销售助手或许能在买家提出下一个问题前察觉其不确定性。导师或许能在检测到困惑后放慢节奏。辅导系统或许能识别出一段经过排练的回答缺乏自信。客服智能体则可能在来电者描述严重问题时,避免使用轻快的表情。
这些例子解释了 Nuance Labs 情感AI的吸引力,也揭示了它需要承担的举证责任。识别出一个对话信号,并不自动意味着理解其成因。
一个人不看着对方,可能是出于文化规范、残障、疲劳、摄像头位置或分心。提高音量可能意味着愤怒、听力困难、环境噪音或兴奋。模型必须避免将微弱信号转化为笃定判断。
Nuance Labs 如何摆脱传统AI接力模式
Nuance Labs 押注于让对话行为在模型内部自然涌现,而不是在答案生成后再进行拼装。
其核心机制是同步视听处理。该公司表示,模型在同一实时循环中观察和聆听用户,同时生成语音和面部行为。
这一描述不同于传统接力模式。在接力模式中,一个组件会先完成自己的任务,再将简化结果传递给下一个组件。转录系统输出文字,语言模型输出文本,动画系统输出动作。
统一模型则能够表征这些信号之间的关系。一次停顿和向下的一瞥,可能改变对一句话的理解。随后生成的回应便可以协调措辞、语气、时机、注视和表情。
这便是 Nuance Labs 在概念层面的工作方式。不过,该公司尚未公开足够的技术细节,无法独立评估其架构、训练语料、基准测试结果或运行需求。
其投资者给出了更具体版本的论点。Accel 早期的种子轮投资论点描述了一种接收文本、语音、面部表情和肢体语言的模型。该文还称,Nuance 会将人类视频压缩为 token,并将语言模型架构扩展至视觉和音频输入。
Token 是模型在学习或生成信息时处理的紧凑单元。将视频转换为高效的 token,能够减少表征每一帧的计算负担。困难之处在于保留塑造互动的细节。
压缩得过于激进,短暂的表情便可能消失;保留的信息过多,系统则会变得昂贵或缓慢。实时对话几乎不给这两种失败留下余地。
Nuance Labs 还必须决定何时不该回应。自然对话包含点头、简短回应、打断和沉默。对每一个可见动作都作出反应的智能体会令人觉得躁动不安;等待明确轮次才回应的智能体则可能显得缺席。
这使轮次管理成为模型智能的一部分。系统需要判断说话者是已经讲完、为了强调而停顿、在邀请回应,还是开始了新的想法。它必须持续更新这一判断。
面部生成又带来了另一项依赖关系。模型的表情必须与其回答的内容和语气保持一致。它还必须在不断变化的摄像头条件和更长的会话中维持视觉一致性。
若同情的语音配上毫无变化的笑容,互动体验可能比仅有音频时更糟。一个在错误时机出现的点头,可能暗示系统认同了一项本应质疑的说法。更具表现力的输出,也创造了更多社交失误的机会。
公司的单模型方法或许能减少协调错误,因为同一学习表征会影响每一种输出。然而,整合并不保证准确。统一系统也可能将一次错误的理解,同时传播到语音、语言和面部表现之中。
算力成本将影响这项技术能够部署在哪里。实时视听推理处理的信息量大于一次文本交互。商业化使用将需要在并发会话中提供可预测的延迟和容量。
NVIDIA 的参与具有相关性,因为该模型需要高效的训练和服务基础设施。但投资关系并不能证明该系统能够满足企业在成本或性能方面的要求。
公开预览应当明确用户是通过浏览器、应用程序还是 API 进行交互。它还应展示开发者能否控制虚拟形象、对话行为、安全规则和留存数据。
在这些细节披露之前,这一机制仍是一条可信的技术路径,而非经过验证的产品优势。这笔融资为 Nuance Labs 赢得了构建时间。预览必须证明,这种架构是否真正改变了体验。
主要对手是模块化 AI 技术栈
Nuance Labs 必须证明,单一整合模型带来的收益足以抵消专用组件在灵活性上的优势。
模块化技术栈存在明显弱点,但也具备实际优势。开发者可以根据自身需求选择语音识别器、语言模型、语音引擎和虚拟形象供应商。
他们可以在不重新训练整个系统的情况下替换某个组件。他们可以将简单任务路由到更小的模型,将敏感任务交给受控工作流。他们还可以在调试故障时检查转录文本和中间输出。
统一模型可能会让这些边界变得不那么明显。这或许能提升对话连续性,但也可能使诊断更加复杂。当虚拟形象给出不恰当回应时,开发者需要知道故障究竟源于感知、推理、生成还是策略。
模块化方法还受益于各个类别内部的快速竞争。语音系统在转录和轮次检测方面持续提升。语音模型提供更自然的节奏和更丰富的情感表现。视频平台在扩展虚拟形象控制能力的同时,也在缩短渲染延迟。
因此,Nuance Labs 面对的是不断移动的目标。它并非在与一代停滞不前、由多个工具拼接而成的产品竞争。它的对手已经在缩小组件之间的差距。
OpenAI 提供了最清晰的广义对照。GPT-4o 在文本、视觉和音频上进行了端到端训练,尽管产品访问方式和输出模式有所不同。其系统卡也记录了与语音生成、说话人识别、敏感特征归因和情感依赖有关的风险。
Hume AI 代表了一条更专业化的路线。其平台将实时语音交互与表达测量相结合。它强调语音韵律,即节奏、音高、重音以及字面词语之外的其他特征。
Tavus 则从视觉侧切入,提供对话式视频代理。其系统协调感知、轮次交接、语音和数字化分身。这种面向产品的定位,让开发者无需等待新的基础模型,就能部署面对面的代理。
Nuance Labs 需要展现出相较于每条路线都可衡量的优势。仅凭更好的面部渲染,会使其与成熟的虚拟形象公司竞争。仅凭更好的情绪分类,会使其与情感计算供应商竞争。仅凭更好的语音交互,则会让它与已被广泛部署的音频模型竞争。
该公司最强的主张是,这些能力不应被割裂。其模型应当理解完整的交流过程,并生成协调一致的存在感。
投资者看到了这种整合的价值。Define Ventures 将面向患者的医疗服务列为潜在应用场景之一。一个能够察觉困惑并调整解释方式的系统,可能支持导诊、教育和日常沟通。
医疗保健也说明了模块化技术栈为何仍难以被取代。组织需要访问控制、审计记录、可预测的行为和明确的升级路径。他们可能更倾向于选择能够逐一监控的组件。
同样的问题也适用于客户服务和销售。企业会问,富有表现力的代理是否能改善问题解决率、满意度、转化率或培训效果。仅有视觉真实感不足以证明部署的合理性。
因此,Nuance Labs 的情感 AI 必须在结果上取胜,而非外观上。统一模型只有在能更准确地理解对话语境、更快地回应,或比现有替代方案需要更少工程投入时,才有价值。
Nuance Labs 的 A 轮融资为公司赢得了证明这些提升的时间。但它并未终结架构之争。模块化技术栈仍是主要对手,因为它已经能够运作、进步迅速,并且让买方能够分别管理每一层。
人类表达也是该模型最大的风险
一个看似具备社会感知能力的系统,可能在获得准确性之前就先赢得信任。
情绪并不是隐藏在面孔或声音中的清晰标签。人们会掩饰感受、表现礼貌、使用讽刺,并在不同文化中作出不同反应。同一种可见行为可能有多重含义。
这在检测信号和推断心理状态之间形成了根本区别。模型或许能准确检测到微笑、停顿或音调升高,但不能假定任何单一信号就能揭示一个人的感受或意图。
研究多次指出,自动情绪识别存在公平性问题。近期一项情绪偏见研究考察了多模态模型中涉及种族、性别和肤色的刻板印象。这类发现使得关于情绪理解的广泛主张尤其敏感。
Nuance Labs 尚未发布公开基准结果,以展示其在不同人口群体、文化、语言、残障情况、摄像条件或对话场景下的表现。它也尚未公布足够关于评估方法的信息。
这种缺失并不证明模型表现不佳。它意味着,在更广泛的测试产生证据之前,有关理解人类情绪的说法仍只是公司的主张。
公开预览应当将可观察行为与推断出的情绪区分开来。它可以报告用户暂停或改变了音量,而不宣称该用户感到困惑、愤怒或具有欺骗性。产品团队也应能够关闭敏感推断。
同意将是另一项考验。视听代理能够处理比文本聊天机器人更多的个人信息。即使用户避免明确分享,面孔、声音、周围环境和行为模式也可能暴露身份和情境。
评估该系统的公司将需要获得有关存储、留存、模型训练、生物特征处理和删除机制的明确答案。用户应当知道,何时分析已经超出了他们提供的文字。
富有表现力的输出会带来独立风险。能够响应的面孔和温暖的声音会增强拟人化,即人们将人类特质归因于软件的现象。即使回答不准确,系统也可能显得十分关注用户。
OpenAI 曾警告,人类般的语音交互可能鼓励不恰当的信任和情感依赖。动画化的面孔可能加剧这种效果,因为注视和表情带有社会意义。
这种危险并不限于陪伴场景。具有说服力的销售代理可以根据可见的犹豫调整推销话术。客户服务系统可以模拟关切,却没有解决问题的权限。教练代理可能在误读用户处境时依然显得笃定。
Nuance Labs 将需要为高风险用途设定边界。富有表现力的界面不应暗示该系统并不具备的临床判断、情绪确定性或人为问责。
安全性同样重要。能够生成逼真声音和面孔的模型会带来冒充风险。供应商需要围绕肖像、身份验证、输出来源和未经授权的复制建立控制措施。
因此,该系统最大的挑战并非让虚拟形象看起来像人,而是确保类人行为不会掩盖模型的不确定性。
Nuance Labs 可以在广泛部署前公布评估协议,以强化自身论点。有价值的报告应包括常规条件下的延迟、打断表现、不同人群的误差分析、拒答行为和失败案例。
精心编排的演示展示的是预期体验。透明的评估则表明这种体验是否值得信任。
三个信号将决定这场押注是否成功
下一阶段将由公开证据决定,而不是又一次精致的虚拟形象演示。
第一个信号,是计划于 2026 年晚些时候推出的公开研究预览。访问范围应超越精选演示,并允许持续、无脚本的对话。
用户应测试打断、沉默、背景噪声、光线变化、多名说话者以及情感含义模糊的语言。他们也应能够观察模型在误解某个线索后如何恢复。
若预览仅涵盖有限场景,将削弱公司的核心主张。若广泛预览仍能保持响应性和符合语境的表现,则会强化统一模型的论点。
第二个信号,是已发布的评估框架。Nuance Labs 需要与其产品论点相匹配的指标,而不能只依赖视觉质量或语言基准。
这些指标应包括响应延迟、轮次交接准确性、视听同步、表情恰当性以及从错误解读中恢复的能力。评估应覆盖不同口音、肤色、文化、沟通方式和无障碍需求。
独立研究人员还会关注不确定性处理。值得信赖的模型应在信号模糊时避免自信地贴上情绪标签。它应让用户能够纠正其理解,而不会令交互变得尴尬。
第三个信号,是在明确应用场景中持续使用的证据。无论是在辅导、教练服务、客户支持还是患者导诊中的小规模部署,所揭示的信息都会多于通用演示。
关键衡量指标将取决于具体场景。辅导系统可能追踪学习者是否提出更多问题或完成更多课程。客户服务可能考察解决质量和升级处理行为。教练服务则可能侧重重复使用率和用户对相关性的评分。
这些证据必须将富有表现力的行为与新奇感区分开。人们在初次测试期间,往往会花更多时间体验陌生界面。持久价值会在视觉效果变得熟悉后、他们依然回归使用时显现。
竞争对手的反应将提供更多背景信息。如果大型模型供应商开放更丰富的视听控制,开发者或可在现有平台内获得类似能力。如果虚拟形象公司采用更整合的感知模型,Nuance Labs 希望抹除的边界将会缩小。
这家创业公司仍可能在这种环境中成功。其创始人拥有相关研究和产品经验,投资者则为其带来资本、算力关系和企业网络。
然而,公司需要具备超越“更像人”的可防御优势。这一表述难以衡量,也容易被竞争对手重复使用。
Nuance Labs 的 A 轮融资之所以重要,在于它资助了一项关于对话式 AI 应如何构建的直接检验。该公司认为,文字、声音、时机、注视和表情应当属于同一个模型。模块化技术栈则认为,专用系统可以以更强控制力实现相同结果。
开发者和企业买家应带着一个实际问题关注这次预览:统一模型究竟能否帮助人们更有效地沟通,还是主要让机器显得更具说服力?
这一差异将决定表达型 AI 会成为持久的交互界面,还是沦为又一个令人惊艳的演示类别。当预览开放时,请像检验其个性一样仔细测试它在不确定情境下的表现。



