top of page

Nuance LabsのSeries A、AIには言葉以上のものが必要だという賭けに資金を投じる

2 時間前
読了時間: 20分

Nuance Labsは、ライブ会話の最中に見て、聞いて、話し、表情を変えるAIモデルの開発に向けて5,000万ドルを調達した。Nuance LabsのSeries Aは、この技術的な提案をはるかに大きな試練へと変える。同社は、表現豊かな振る舞いがAIを単に人間らしく見せるだけでなく、より有用にすることを示さなければならない。

シアトル拠点のこのスタートアップが提案するのは、チャットボットにアニメーションの顔を付けただけのものではない。同社によると、単一のフルデュプレックスモデルが言葉、音声、視線、身ぶり、タイミングを処理しながら、視聴覚的な応答を生成する。フルデュプレックスとは、割り込みや短い相づちを含め、双方が同時にコミュニケーションできることを意味する。

このアプローチは、音声エージェントやデジタルアバターですでに使われているモジュール型システムに挑むものだ。こうしたシステムはしばしば、音声認識、言語モデル、音声合成、顔のアニメーションを接続する。Nuance Labsは、統合モデルであれば、それらのコンポーネント間で失われる会話上のシグナルを保持できると主張している。

この資金調達は、その主張に本格的な後ろ盾を与える。同時に、Nuance Labsは2026年後半に公開研究プレビューを開始する計画であり、厳しいスケジュールも生まれる。OpenAI、Hume AI、Tavusなどのチームはすでに、Nuanceが統合を目指す体験の一部を提供している。

Nuance LabsのSeries A、統合型会話モデル1つに資金を供給

重要な変化は、資金調達そのものだけではない。Nuance Labsは今、統合型の視聴覚モデルを公開テストに向けて進めるための資源を手にした。

Lightspeed Venture Partnersが5,000万ドルのSeries Aを主導した。AccelとSouth Park Commonsは既存投資家として再び参加し、NVIDIAとDefine Venturesもこのラウンドに加わった。この資金調達により、1,000万ドルのシードラウンド後の同社の累計調達額は、報道ベースで6,000万ドルに達した。

Nuance Labsは2026年9月14日にこのラウンドを発表した。同社のSeries A発表によると、資金はモデル開発、研究人材の採用、そして今年後半の公開プレビューを支援するために使われる。

資金調達が報じられた時点で、同社の従業員数は27人だった。詳細な資金調達レポートによると、同社はモデリング、データ、評価、推論、リアルタイム提供の各領域で採用を進める計画だ。

これらの採用分野は、技術的な負荷がどこにあるかを示している。視聴覚モデルの訓練は問題の一部にすぎない。モデルはライブストリームを解釈し、何が重要かを判断し、応答を生成し、会話に十分な速さでレンダリングしなければならない。

わずかな遅延でも、やり取りの印象を変えうる。ある場面では間が思慮深さを示す一方、別の場面では混乱を示すかもしれない。割り込みは積極的にも無礼にも感じられる。対応する文の後に顔の反応が届けば、意味から切り離されて見える可能性がある。

Nuance Labsは、元Apple研究者のFangchang Ma、Edward Zhang、Karren Yangによって2025年初めに設立された。ZhangはUniversity of Washingtonでコンピューターグラフィックスの博士号を取得している。MaとZhangは以前、空間コミュニケーション向けにユーザーの表現を作成するAppleのDigital Persona技術に携わっていた。

この経歴は、同社の出発点を説明するのに役立つ。Nuance Labsは、顔、声、会話ポリシーを同じ生成上の問題の一部として扱っている。回答が完成した後に顔のアニメーションを装飾的なレイヤーとして加えるアプローチではない。

同社は、自社システムを人間の会話と表現のための基盤モデルと説明している。モデルはライブの視聴覚シグナルを取り込み、顔と音声の応答をリアルタイムでストリーミングするとしている。掲げる目標は、文字起こしを待って完成済みの回答を返すのではなく、人が話している最中に反応するAI参加者だ。

発表に合わせて公開されたデモでは、アバターが能動的な聞き手として振る舞った。ユーザーの発話中に、表情と口頭での相づちが変化していた。このデモは目標とする体験を示しているが、モデルの独立した評価ではない。

この区別は重要だ。制御されたデモは、システムが動作することを示せる。一方で、アクセント、暗い照明、重なり合う声、珍しい表情、感情の曖昧さ、長時間の会話にどう対処するかを証明することはできない。

したがって、公開研究プレビューは資金調達の発表よりも重要になる。Nuance Labsの感情AIが、準備されたやり取りの外でも応答性を維持できるかが明らかになるはずだ。また、信頼性とユーザーの快適さについて、最初の意味ある証拠も示されるだろう。

表現力豊かなAIが競争の標的になった理由

AI企業は、回答の質と同じくらいタイミングや社会的手がかりが重要になりうる、インタラクション層の主導権を争っている。

テキストチャットは、生成AIにおける基本的なパターンを確立した。ユーザーがメッセージを送信し、待ち、完成した応答を受け取る。音声システムは入出力形式を変えたが、多くは同じ基礎的な順序を維持した。

典型的なモジュール型音声エージェントでは、まず音声をテキストに変換する。言語モデルが回答を生成し、音声合成器がその回答を音声に変える。ビデオアバターは、音声を顔の動きに対応付ける別のコンポーネントを追加できる。

各引き渡しのたびに、情報が失われる可能性がある。文字起こしは言葉を保存しても、ためらい、強調、話す速さ、重なり合う発話を失うことがある。生成音声は、ユーザーが話している時にどのような表情をしていたかを正確には知らずに、口調を再構成するかもしれない。アバターは、回答を生み出した推論に参加することなく、その回答をアニメーション化する可能性がある。

Nuance Labsによると、その統合アーキテクチャはこうした損失を避けるために設計されている。モデルは複数のチャネルを同時に観察し、複数のチャネルをまとめて生成する。理論上、これにより応答は、人が何を言ったかだけでなく、やり取りがどのように展開したかも反映できる。

タイミングは有利だ。ユーザーはすでにリアルタイムのマルチモーダルAIを理解している。OpenAIは、テキスト、視覚、音声をまたいで訓練された単一モデルとしてGPT-4oを導入した。公開されたGPT-4oシステムカードでは、音声応答時間は最短232ミリ秒、平均320ミリ秒と報告されている。

こうした数値は明確な競争上のベンチマークを生み出した。特化型モデルは、AIと会話できる新鮮さだけには頼れない。はるかに大規模なモデル提供者に支えられたシステムよりも、説得力がある、または有用なインタラクションを提供する必要がある。

Hume AIは、表現力のある音声と感情測定に注力してきた。Tavusは、知覚、ターンテイキング、音声、アニメーション化されたデジタル人物を組み合わせたリアルタイム動画エージェントを構築している。Synthesiaと関連プラットフォームは、研修やビジネスコミュニケーションにおいて生成されたプレゼンターを身近なものにしてきた。

Nuance Labsは、これらのカテゴリーの間に参入する。同社の提案は、感情認識型音声システムに関連する表現上の感度と、アバタープラットフォームに関連する視覚的な存在感を組み合わせるものだ。また、パイプラインではなく単一モデルが、やり取りを統制すべきだとも主張している。

これにより、Nuance LabsのSeries Aはアーキテクチャとプロダクト体験への賭けとなる。統合モデルが文脈をより適切に保持できれば、モジュール型システムは機械的に組み立てられたものに感じられるかもしれない。ユーザーが実用上の違いをほとんど感じなければ、既存提供者は個々のコンポーネントを改善し続けられる。

対象アプリケーションは、その重要性を高める。Nuance Labsは、営業、顧客サービス、専門的なコーチング、教育を潜在市場として挙げている。これらは、注意、ためらい、フラストレーションが次の応答に影響しうる領域だ。

営業アシスタントは、購入者が次の質問をする前に不安を示していることに気づくかもしれない。チューターは、混乱を検出して説明の速度を落とすかもしれない。コーチングシステムは、練習済みの回答に自信が欠けていることを認識するかもしれない。顧客サービスエージェントは、発信者が深刻な問題を説明している際に、明るい表情を避けるかもしれない。

これらの例は、Nuance Labsの感情AIが持つ魅力を説明している。同時に、その立証責任も浮き彫りにする。会話上のシグナルを読み取ることは、その原因を理解することを自動的には意味しない。

人が目を合わせないのは、文化的規範、障害、疲労、カメラの位置、気の散りやすさが理由かもしれない。声を荒らげることは、怒り、聴覚上の困難、周囲の騒音、熱意を示している可能性がある。モデルは、弱いシグナルを確信に満ちた判断へと変換することを避けなければならない。

Nuance Labsが従来のAIリレーなしで動作する仕組み

Nuance Labsは、会話上の振る舞いが回答後に組み立てられるのではなく、モデル内部で生まれるべきだと賭けている。

中核となる仕組みは、同時的な視聴覚処理だ。同社によると、そのモデルはユーザーを見聞きしながら、同じリアルタイムループ内で音声と顔の振る舞いを生成する。

この説明は、従来のリレー方式とは異なる。リレー方式では、あるコンポーネントが処理を完了してから、単純化された結果を次に渡す。文字起こしシステムは言葉を出力し、言語モデルはテキストを出力し、アニメーションシステムは動きを出力する。

統合モデルでは代わりに、これらのシグナルをまたぐ関係性を表現できる。間と下向きの視線は、文の解釈を変えるかもしれない。生成される応答は、言葉、口調、タイミング、視線、表情を協調させることができる。

これが概念上のNuance Labsの仕組みだ。しかし同社は、アーキテクチャ、訓練コーパス、ベンチマーク結果、運用要件を独立して評価できるほどの技術的詳細を公表していない。

投資家は、この仮説についてより具体的な説明を示している。Accelの以前のシード投資の論拠では、テキスト、音声、顔の表情、ボディランゲージを取り込むモデルが説明されている。また、Nuanceは人間の動画をトークンに圧縮し、言語モデルのアーキテクチャを視覚と音声の入力へ拡張するとしている。

トークンとは、モデルが情報を学習または生成する際に処理するコンパクトな単位だ。動画を効率的なトークンに変換すれば、すべてのフレームを表現する計算負荷を減らせる。難しいのは、インタラクションを形作る細部を保持することだ。

圧縮しすぎれば、一瞬の表情が消える可能性がある。保持しすぎれば、システムは高コストまたは低速になる。リアルタイムの会話では、どちらの失敗にもほとんど余地がない。

Nuance Labsは、いつ応答しないかも判断しなければならない。自然な会話には、うなずき、短い相づち、割り込み、沈黙が含まれる。目に見える動きすべてに反応するエージェントは、せわしなく感じられる。明確なターンを待つエージェントは、不在のように感じられることがある。

このため、ターンテイキングはモデルの知性の一部となる。システムは、話者が話し終えたのか、強調のために間を置いたのか、応答を促したのか、新しい考えを話し始めたのかを推定する必要がある。この推定を継続的に更新しなければならない。

顔の生成は別の依存関係を生む。モデルの表情は、回答の内容と口調に一致しなければならない。また、変化するカメラ条件や長時間のセッションでも視覚的一貫性を維持する必要がある。

共感的な声に変わらない笑顔が組み合わされると、音声だけの場合よりもやり取りが悪く感じられることがある。誤ったタイミングでのうなずきは、システムが疑問視すべき発言に同意しているように見せる可能性がある。より表現力のある出力は、社会的な失敗の機会も増やす。

同社の単一モデルのアプローチは、同じ学習済み表現が各出力に影響するため、協調上のエラーを減らせる可能性がある。しかし、統合は正確性を保証しない。統合システムは、音声、言語、顔全体に、1つの誤った解釈を広げてしまう可能性もある。

コンピュートコストは、この技術をどこで運用できるかを左右する。ライブの音声・映像推論は、テキストのやり取りより多くの情報を処理する。商用利用には、同時セッションにおいて予測可能なレイテンシーと容量が求められる。

NVIDIAの参画は、モデルが効率的な学習・推論インフラを必要とする点で重要だ。ただし、投資関係があるからといって、そのシステムが企業のコストや性能要件を満たせることを意味するわけではない。

公開プレビューでは、ユーザーがブラウザ、アプリケーション、APIのどれを介して操作するのかが明らかになるはずだ。また、開発者がアバター、会話の振る舞い、安全ルール、保持データを制御できるかも示されるべきである。

こうした詳細がなければ、この仕組みは検証済みの製品優位性ではなく、もっともらしい技術的方向性にとどまる。資金調達はNuance Labsに開発の時間を与える。プレビューは、そのアーキテクチャが体験を変えるものかどうかを示さなければならない。

最大の対抗勢力はモジュラー型AIスタック

Nuance Labsは、単一の統合モデルが、専門コンポーネントの柔軟性を上回るほど大きな利点を生むことを証明する必要がある。

モジュラー型スタックには明白な弱点がある一方、実用上の利点もある。開発者は、要件に応じて音声認識器、言語モデル、音声エンジン、アバター提供事業者を選択できる。

システム全体を再学習させることなく、一つのコンポーネントを置き換えられる。単純なタスクは小規模モデルへ、慎重な扱いが必要なタスクは管理されたワークフローへ振り分けることも可能だ。障害をデバッグする際には、文字起こしや中間出力も確認できる。

統合モデルでは、こうした境界が見えにくくなる可能性がある。それは会話の継続性を高めるかもしれないが、診断を複雑にすることもある。アバターが不適切な応答をした場合、開発者は失敗が知覚、推論、生成、ポリシーのどこで起きたかを把握する必要がある。

モジュラー型アプローチは、各カテゴリ内での急速な競争からも恩恵を受ける。音声システムは文字起こしと発話ターン検出を継続的に改善している。音声モデルは、より自然なテンポと豊かな感情表現を提供している。動画プラットフォームは、アバター制御を拡大しながらレンダリング遅延を削減している。

したがってNuance Labsは、変化し続ける対象と対峙している。競合しているのは、固定化された寄せ集めのツール群ではない。ライバルはすでにコンポーネント間の隔たりを縮めている。

最も明確で幅広い比較対象はOpenAIだ。GPT-4oはテキスト、視覚、音声をまたいでエンドツーエンドで学習されたが、製品上のアクセスや出力モードには変動があった。同社のシステムカードでは、音声生成、話者識別、センシティブな属性の推定、感情的依存に関するリスクも記録されている。

Hume AIは、より専門化されたルートを示している。同社のプラットフォームは、リアルタイム音声対話と表情・感情の測定を組み合わせる。文字どおりの言葉を超えたリズム、ピッチ、強勢などを含む音声プロソディを重視している。

Tavusは、会話型ビデオエージェントで視覚面に取り組む。同社のシステムは、知覚、発話ターン制御、音声、デジタルレプリカを連携させる。この製品志向により、開発者は新たな基盤モデルを待つことなく、対面型エージェントを展開できる。

Nuance Labsは、それぞれのルートに対して測定可能な優位性を示す必要がある。顔のレンダリングが優れているだけでは、成熟したアバター企業との競争になる。感情分類が優れているだけでは、感情コンピューティングのベンダーとの競争になる。音声対話が優れているだけでは、広く展開された音声モデルと競うことになる。

同社の最も強い主張は、これらの能力を分離すべきではないという点にある。同社のモデルは、やり取り全体を理解し、協調した存在感を生成することを目指している。

投資家はこの統合に価値を見出している。Define Venturesは、患者対応のヘルスケアを想定される用途の一つとして挙げた。混乱を察知して説明を調整するシステムは、案内、教育、日常的なコミュニケーションを支援できる可能性がある。

ヘルスケアは同時に、モジュラー型スタックが依然として置き換えにくい理由も示している。組織には、アクセス制御、監査記録、予測可能な振る舞い、明確なエスカレーション経路が必要だ。個別に監視できるコンポーネントを好む可能性がある。

同じ問題は、カスタマーサービスや営業にも当てはまる。企業は、表現力のあるエージェントが解決率、満足度、コンバージョン、研修成果を改善するのかを問うだろう。視覚的なリアリズムだけでは、導入を正当化できない。

したがってNuance Labsの感情AIは、見た目ではなく成果で勝たなければならない。統合モデルに価値があるのは、利用可能な代替手段よりも会話の文脈を正確に理解し、より速く応答し、必要なエンジニアリングを減らせる場合に限られる。

Nuance LabsのSeries Aは、こうした改善を実証する時間を同社に与える。だが、アーキテクチャをめぐる議論に決着をつけるものではない。モジュラー型スタックは、すでに機能し、急速に改善し、購入者が各層を個別に管理できるため、依然として最大の対抗勢力である。

人間の表情はモデル最大のリスクでもある

社会的な洞察力があるように見えるシステムは、正確さを獲得する前に信頼を得てしまう可能性がある。

感情は、顔や声の中に隠れた単純なラベルではない。人は感情を隠し、礼儀正しさを演じ、皮肉を使い、文化によって異なる反応を示す。同じ目に見える行動でも、複数の意味を持ちうる。

ここには、シグナルを検出することと精神状態を推測することの根本的な違いがある。モデルは笑顔、間、声の高さの上昇を正確に検出できるかもしれない。しかし、単一のシグナルから、その人が何を感じ、何を意図しているかを明らかにできると仮定することはできない。

研究では、自動感情認識における公平性の問題が繰り返し指摘されてきた。最近のemotion bias studyは、マルチモーダルモデルにおける人種、性別、肌の色に関するステレオタイプを検証した。このような知見は、感情理解に関する広範な主張を特に慎重に扱うべきことを示している。

Nuance Labsは、人口統計グループ、文化、言語、障害、カメラ条件、会話環境をまたぐ性能を示す公開ベンチマーク結果を発表していない。また、評価手法に関する十分な情報も公開していない。

この不在は、モデルの性能が低いことを証明するものではない。より広範なテストが証拠を生み出すまでは、人間の感情を理解するという主張は企業側の主張にとどまることを意味する。

公開プレビューでは、観察可能な行動と推定された感情を分けるべきだ。例えば、ユーザーが間を置いた、または声量を変えたことは報告できても、その人が混乱している、怒っている、または欺こうとしていると断定すべきではない。製品チームは、センシティブな推定を無効化できるべきでもある。

同意もまた試金石となる。音声・映像エージェントは、テキストチャットボットより多くの個人情報を処理しうる。顔、声、周囲の環境、行動パターンは、ユーザーが明示的な共有を避けていても、本人確認情報や文脈を明らかにする可能性がある。

このシステムを評価する企業には、保存、保持、モデル学習、生体情報処理、削除について明確な回答が必要になる。ユーザーは、分析が自分の提供した言葉を超えているタイミングを知るべきだ。

表現力のある出力には別のリスクがある。反応する顔と温かい声は、擬人化を強める可能性がある。擬人化とは、人々がソフトウェアに人間的な性質を帰属させる現象だ。回答が不正確でも、システムは注意深く対応しているように感じられるかもしれない。

OpenAIは、人間らしい音声対話が誤った信頼や感情的依存を促す可能性があると警告している。視線や表情には社会的な重みがあるため、アニメーション化された顔はその効果を強めうる。

危険はコンパニオン用途に限られない。説得力のある営業エージェントは、目に見えるためらいを利用して売り込みを調整できる。カスタマーサービスシステムは、問題を解決する権限がなくても懸念をシミュレートできる。コーチングエージェントは、ユーザーの状況を誤読しながらも確信に満ちた口調で話す可能性がある。

Nuance Labsは、重要な判断が伴う用途に境界を設ける必要がある。表現力のあるインターフェースは、システムが持たない臨床的判断、感情に関する確実性、人間としての説明責任を示唆すべきではない。

セキュリティも重要だ。リアルな声と顔を生成するモデルは、なりすましの懸念を生む。提供事業者には、肖像、本人確認、出力の来歴、不正な複製に関する管理が必要となる。

したがってこのシステムの最大の課題は、アバターを人間らしく見せることではない。人間らしい振る舞いがモデルの不確実性を覆い隠さないようにすることだ。

Nuance Labsは、本格展開の前に評価プロトコルを公開することで、その主張を強化できる。有用な報告には、通常条件でのレイテンシー、割り込み時の性能、人口統計別の誤差分析、拒否時の挙動、失敗事例が含まれる。

厳選されたデモは意図された体験を示す。透明性のある評価は、その体験を信頼できるかどうかを示す。

この賭けが成功するかを決める3つのシグナル

次の段階を決めるのは、磨き上げられたアバターのデモではなく、公開された証拠である。

第1のシグナルは、2026年後半に予定されている公開研究プレビューだ。アクセスは選定されたデモを超え、持続的で台本のない会話を可能にすべきである。

ユーザーは、割り込み、沈黙、背景雑音、変化する照明、複数話者、感情的に曖昧な言葉をテストすべきだ。また、手がかりを誤解した後にモデルがどのように回復するかも観察できる必要がある。

シナリオが限定されたプレビューでは、同社の中核的な主張は弱まる。応答性と文脈的な適切さを維持する幅広いプレビューなら、統合モデルの主張を強めるだろう。

第2のシグナルは、公開された評価フレームワークである。Nuance Labsは、視覚品質や言語ベンチマークだけに頼るのではなく、自社の製品仮説に合致する指標を必要としている。

その指標には、応答レイテンシー、発話ターンの正確性、音声・映像の同期、表現の適切性、誤った解釈からの回復を含めるべきだ。評価は、異なるアクセント、肌の色、文化、コミュニケーションスタイル、アクセシビリティ上のニーズを対象とすべきである。

独立研究者は、不確実性の扱いにも注目するだろう。信頼できるモデルは、シグナルが曖昧なときに確信を持った感情ラベルを避けるべきだ。やり取りを不自然にすることなく、ユーザーがその解釈を修正できるようにすべきでもある。

第3のシグナルは、定義された用途における継続利用の証拠だ。個別指導、コーチング、カスタマーサポート、患者案内における小規模な導入は、汎用デモより多くを明らかにする。

重要な指標は用途によって異なる。個別指導システムでは、学習者がより多く質問するか、セッションを完了するかを追跡できる。カスタマーサービスでは、解決の質とエスカレーション時の挙動を検証できる。コーチングでは、継続利用とユーザー評価による関連性に焦点を当てられる。

この証拠は、表現力のある振る舞いと新奇性を区別しなければならない。人々は初期テストの段階で、見慣れないインターフェースにより長く時間を費やすことが多い。視覚的な効果に慣れた後も戻ってくるときに、持続的な価値が現れる。

競合の反応も追加の文脈を与える。大手モデル提供事業者がより豊富な音声・映像制御を公開すれば、開発者は既存プラットフォーム内で類似の能力を得られるかもしれない。アバター企業がより統合された知覚モデルを採用すれば、Nuance Labsが消そうとしている境界は狭まる。

このスタートアップは、その環境でも成功できる可能性がある。創業者は関連する研究・製品経験を持ち、投資家は資本、コンピュート面での関係、エンタープライズネットワークへのアクセスを提供する。

しかし同社には、より人間らしいと主張するだけではない、防御可能な優位性が必要だ。その表現は測定が難しく、競合が繰り返しやすい。

Nuance LabsのSeries Aが重要なのは、会話AIをどう構築すべきかに関する直接的な検証に資金を提供するからだ。同社は、言葉、声、タイミング、視線、表情が一つのモデルの中に属すべきだと主張する。モジュラー型スタックは、専門化されたシステムが、より大きな制御性で同じ結果を提供できると主張する。

開発者とエンタープライズの購入者は、実用的な一つの問いを念頭にプレビューを注視すべきだ。統合モデルは人々のより効果的なコミュニケーションを助けるのか。それとも主に、機械をより説得力のあるものにするだけなのか。

この違いが、表現力豊かなAIが持続的なインターフェースになるのか、それとも印象的なデモの一カテゴリーにとどまるのかを左右する。プレビューが公開されたら、個性だけでなく不確実性についても同じくらい慎重に検証すべきだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page