Instinctが独自のConciergeを追加、Meta Museの通話機能も登場
Metaは、ライバルのInstinctがConciergeを発表したのと同時期にMeta Museの通話機能を有効化し、競合する2つのAIエージェントに企業へ電話をかける能力を与えた。両社の発表は9月16日に行われ、それまで欠けていた機能がほぼ一夜にして新たな競争の主戦場となった。
これらのエージェントは、ウェブサイトやアプリでは完結できないタスクにも取り組めるようになった。Instinctによると、Conciergeはオンライン予約に対応していないレストランに連絡したり、歯科医のキャンセル待ちリストに登録したり、ケーブルテレビ料金の請求に異議を申し立てたりできる。Museは米国全土の企業に発信できる。
同時リリースは、通常の機能競争よりも鮮明な対立を生み出している。Instinctは、応答性の高いパーソナルオペレーターのように振る舞うことでユーザーを惹きつけてきた。一方Metaは、確立された消費者向けプラットフォーム、専用クラウド環境、そしてはるかに大きな潜在的配布ネットワークを携えて参入する。
電話をかけることは、段階的な機能強化のように聞こえるかもしれない。しかし実際には、パーソナルエージェントを重要な境界の向こう側へ押し出す変化だ。もはや情報を読み取ったり、ウェブサイトをクリックして進んだりするだけではない。要求や約束、誤解が現実的な結果を伴い得る会話において、人を代理できるようになる。
InstinctとMuseが実際に提供した機能
通話により、パーソナルAIエージェントは、依然として人による対応、保留待ち、電話メニューで運営される企業にアクセスできるようになる。
Instinctの創業者Noah Shinnは、より個別の対応を必要とする依頼向けの早期アクセスサービスとしてInstinct Conciergeを発表した。calling featureによると、当初は利用可能なユーザーを限定し、その後より多くのユーザーへ拡大する予定だ。
その例からは、想定する市場が見えてくる。レストランにオンライン予約機能がない場合、Conciergeは予約を試みることができる。歯科医に空きが出た際の連絡を依頼することもできる。また、本来なら顧客が保留で待たなければならないサービス上のトラブルについても対応できる。
これらは単なる検索クエリの音声版ではない。どのタスクでも、エージェントは目的を伝え、返答を解釈し、次に何をすべきか判断する必要がある。代替日を提案したり、手数料がかかるかを尋ねたりすることもある。
この違いにより、Instinct Conciergeの通話は自動化された予約リマインダーよりも重要な意味を持つ。従来の音声ボットは通常、電話をかける組織が作成したスクリプトに従う。対してパーソナルエージェントは消費者を代理し、予測不能な会話を切り抜けなければならない。
Metaも同日にMuse向けの同様の機能を有効化した。MetaのプロダクトリーダーであるRyan Foxは、ベータ版が米国企業への発信に拡大されたと述べた。Metaは以前にMuseへこの機能を求めていた人々を優先した。
この展開方法は、需要の収集も兼ねている。ユーザーがまだ提供されていない機能を求めた場合、Metaはそのプロンプトを機能に対するシグナルとして扱える。すでに関心を示した人々が、機能提供時には初期参加者となる。
Muse自体は、通話機能の拡大のわずか8日前、9月8日に米国でローンチされた。専用アプリ、WhatsApp、ウェブインターフェースを通じて利用できる。Metaによると、AIグラスにも搭載される予定だ。
同社はMuseを会話型チャットボットではなく、パーソナルエージェントとして位置付けている。チャットボットは主に情報や生成コンテンツで応答する。エージェントは複数のステップを実行し、外部サービスを利用し、ユーザーが離席した後も作業を続けられる。
Metaによると、Museはブラウザを開き、フォームに入力し、メールを送り、旅行を予約し、購入を行える。同社のMuse introductionによれば、特定の機微な行為の前には承認を求める。
電話へのアクセスは、この運用モデルをソフトウェアのインターフェースの外へ広げる。レストランは予約枠をアプリケーションプログラミングインターフェース、すなわちAPIで公開していない可能性がある。地域のクリニックは、キャンセルを受付窓口でしか管理していないかもしれない。
電話は、こうした企業への汎用的な接続手段となる。エージェントは歯科医、請負業者、ジム、地域のレストランごとに専用統合を必要としない。通常の電話に確実に参加できればよい。
この柔軟性こそ、AIエージェントによる通話が競争上の指標となった理由を説明する。Wajoを含む小規模なアシスタントは、電話による実行を優位性として売り込んできた。InstinctとMetaは現在、その差別化を縮小している。
両製品が同等に優れた性能を持つことを、これらのリリースが示しているわけではない。どちらの発表も、標準化されたタスク全体における比較可能な完了率、エラー率、通話録音を示していない。機能の提供はチェックリスト上の同等性を示すにとどまり、実運用上の同等性を証明するものではない。
より重要な変化は戦略面にある。注目される2つのアシスタントはいずれも、有用な消費者向けエージェントはオフラインのボトルネックに対応しなければならないという見方で一致している。ブラウザだけでは不十分だ。
Meta Museの通話機能が賭け金を引き上げる理由
Meta Museの通話機能は、すべてのパーソナルアシスタントに対し、次の一手を勧めるだけでなく、タスクを完遂できることを示すよう求めている。
消費者向けAI製品は、長年にわたり回答の改善に取り組んできた。エージェントは、価値の尺度を応答品質から完了した仕事へと移す。予約はカレンダーに登録されるか、されないかのどちらかだ。
電話は、ユーザーがすでによく理解している煩わしいタスクを扱うため、この転換を強める。人々はケーブルテレビ会社の担当者を待つ不便さや、予約の空きを繰り返し確認する手間を知っている。その時間を節約する価値には、ほとんど説明を要しない。
Instinctは大きな勢いを得てこの競争に臨んだ。Spear Street Technologyが運営するこのスタートアップは、BenchmarkとIndex Venturesが主導したと報じられるSeries Bラウンドを調達した。この取引により、累計調達額は3億5,000万ドル、評価額は25億ドルとなったとfunding detailsは伝えている。
その後TechCrunchは、Instinctがはるかに高い評価額で別の資金調達について協議していると報じた。こうした協議は、完了済みの取引ではなく、あくまで報じられた交渉段階にある。それでも投資家の関心は、パーソナルエージェントが消費者向けソフトウェアの大きなカテゴリーになり得るとの期待を反映している。
Instinctの魅力は、会話型の提示方法にもある。ユーザーは複雑な自動化システムを設定するのではなく、慣れ親しんだメッセージングチャネルを通じてアシスタントとやり取りする。その後、エージェントがユーザーに代わって複数のサービスを横断して作業する。
このスタートアップは最近、エージェントに独自のメールアドレスも与えた。この追加により、アカウント登録やコミュニケーションをより自律的に管理できる。信頼ネットワーク機能では、あるユーザーのアシスタントが別の人のアシスタントと特定のタスクを連携できる。
メール、メッセージング、ブラウザアクセス、電話を組み合わせることで、より広範な実行レイヤーが形成される。各チャネルは他のチャネルが残す隙間を埋める。アシスタントはオンラインで調査し、企業にメールを送り、返信がなければ電話をかけ、結果を持ち帰ることができる。
Metaは異なる優位性を持ち込む。MuseはWhatsAppで利用でき、同社にはすでに確立されたコミュニケーション接点がある。Metaはまた、権限や製品ルールに従うことを前提に、文脈を提供し得る主要ソーシャルプラットフォームを管理している。
TechCrunchが引用したSensor Towerのデータによると、Museは最初の5日間で米国において73万件以上のダウンロードを記録した。Meta AIアプリは、同じく最初の5日間で70万7,000件のダウンロードを記録している。Museは一時、米国のアプリランキングで2位にも到達した。
これらの初期数値は獲得状況を示すものであり、継続的な利用を測るものではない。ダウンロード総数からは、アカウントを接続した人、タスクを完了した人、最初のセッション後に戻ってきた人の数は分からない。それでも、Metaが未知のエージェントを短期間で大規模なユーザー層へ紹介できることは示している。
したがって、競争圧力は両方向に働く。Instinctは、Metaが同様の機能を大規模に配布する前に、明確な製品優位性を維持しなければならない。Metaは、その到達力が信頼と信頼性の高い実行に結び付くことを証明する必要がある。
他のアシスタントも、分かりやすい差別化ポイントを失う。主要なライバルが電話アクセスを提供するようになれば、製品は電話アクセスだけに頼れなくなる。競合各社には、より優れた信頼性、より狭い専門性、より強いプライバシー、あるいは独自サービスへのアクセスが必要になる。
この競争は、OpenAI、Google、その他の大手プロバイダーの既存アシスタントにも圧力をかける。ユーザーは今後、異なるチャネルをまたいでどのような用事を完了できるかで比較するようになる。強力な汎用推論は依然として重要だが、それは一要素にすぎなくなる。
企業の購買担当者にとって、この変化は新たな判断をもたらす。企業は構造化されたエージェント向けインターフェースを公開することも、既存のサポート回線を通じて消費者エージェントから電話を受けることもできる。後者は統合を必要としないが、運用上の不確実性を生む可能性がある。
企業は、発信者が実在の顧客を代理しているかを特定するのに苦労するかもしれない。また、同意、録音、認証、異議のある指示に関するポリシーも必要になる可能性がある。説得力のある合成音声は、正当な権限を証明するものではない。
したがってMeta Museの通話機能は、Museを拡張するだけにとどまらない。電話ベースの行動が、期待されるエージェントの標準機能の一部になりつつあることを示している。すべての競合企業は、自社ソフトウェアにどれほどの現実世界での権限を与えるべきか、今や判断を迫られている。
Instinct対Metaは委任された行動をめぐる競争
InstinctとMetaは、単にユーザーを支援するのではなく、ユーザー自身として行動することを信頼されるソフトウェアレイヤーになるために競っている。
この違いが、主要な競争を定義している。アシスタントは、人が判断するために役立つ情報を提供する。委任されたエージェントは目標を受け取り、それを前進させる行動を取る。
電話へのアクセスは、委任を特に可視化する。エージェントがレストランのホストと話すとき、そのやり取りにおいてユーザーの立場を占める。企業側は、エージェントの発言に基づいて判断する可能性がある。
予約依頼を考えてみよう。エージェントには希望日、人数、場所、食事制限が必要になる。理想の時間が空いていなければ、どの代替案が受け入れ可能かを把握しなければならない。
厳格なエージェントは、あらゆる変更について停止して承認を求めるかもしれない。より自律的なエージェントは、過去の行動に基づいて近い時間を選ぶ可能性がある。後者は時間を節約するが、望まない約束につながる可能性を高める。
このバランスこそ、両方が番号をダイヤルできるかどうかよりも、製品を意味のある形で分けるものだ。ユーザーは、各エージェントが曖昧さをどれほど適切に扱い、不確実性をどのようにエスカレーションし、最終結果をどう記録するかで評価するだろう。
Instinctの立場は、新しいインターフェースを定義しようとする焦点を絞ったスタートアップに近い。機能を素早くリリースし、パーソナルな委任を中心に体験を形作ることができる。初期ユーザーは、新しく感じられる機能と引き換えに、荒削りな部分を許容するかもしれない。
Metaは同じ概念の周囲に、より多くのインフラを統合できる。Museは独自のブラウザを備えた永続的仮想マシン、Muse Secure VM内で動作する。仮想マシンとは、クラウドインフラ内で動作する、隔離されたソフトウェア上のコンピューターだ。
Metaによると、別のSentinelエージェントが外部への活動を監視し、同社の制御に違反する行為をブロックする。また、主要エージェントが読み取れない場所にMuseが認証情報を保存するとしている。
購入時には、MuseはStripeのLinkサービスを通じてワンタイムカードを利用できる。このシステムは、加盟店やエージェントがユーザーの実際のカード番号を見られないようにすることを目的としている。対象取引には、指定された購入保護も適用される。
これらの設計上の選択は、より広い約束を支えている。すなわち、エージェントが行動するために十分なコンテキストを与えつつ、露出や悪用の余地を制限することだ。Metaはこの方針をagent safety designで説明している。
しかし、こうした安全策は、外部の研究者が現実的なシナリオで検証できるようになるまで、企業側の主張にとどまる。安全なアーキテクチャはリスクを下げられても、判断ミスをなくすことはできない。エージェントは認証情報を保護できても、誤ったテーブルを予約してしまう可能性はある。
Instinctも、公開されている制御策が少ない中で同じ課題に直面している。その有用性は、メッセージ、アカウント、個人の好みへのアクセスに依存する。権限を追加するたびに実行能力は向上しうる一方、ミスが起きた場合の影響も大きくなる。
このため、消費者向けエージェントは従来のスマートスピーカーとは異なる。スピーカーはタイマーを設定したり、事実に関する質問に答えたりする程度だった。新たなシステムは、アカウントを閲覧し、メッセージをやり取りし、金銭を使い、企業と交渉できる。
成功する製品には、効果的な権限モデルが必要になる。そのモデルは、エージェントが独自に実行できること、承認を必要とすること、そして禁止されたままにすべきことを定義する。
通話は、取り消しにくい行為をもたらす。キャンセル待ちリストへの登録は通常、低リスクだ。既存の予約やサブスクリプションを取り消すと、違約金、アクセス喪失、限られた復旧手段につながる可能性がある。
エージェントは証跡も残さなければならない。ユーザーは、かけた番号、名乗った身元、伝えた依頼、受け取った応答を確認できるべきだ。要約だけでは、紛争を解決するために必要な詳細が抜け落ちるおそれがある。
Metaによれば、Museは完了済みおよび予定された行動の監査証跡を提供する。これは有用な基盤だが、電話でのやり取りにはさらなる明確化が必要だ。ユーザーは、通話が録音、文字起こし、要約、保持されるかどうかを知る必要がある。
企業側にも開示が求められる。電話に出た人は、自動化システムと話していることを知るべきだ。適用される同意要件は、地域や録音の有無によって異なる場合がある。
どちらの製品発表も、こうした運用上の疑問を完全には解消していない。両社のリリースは、エージェントと人間の通話に共通するエチケットを確立する前に、機能を打ち出した。
この順序は、消費者向けテクノロジーでは珍しくない。普及はしばしば安定した規範に先行する。ただし今回は、ソフトウェアが当初から個人的な権限を持って行動する点が異なる。
ユーザーにとって実用的な比較は、制御された実行に焦点を当てるべきだ。どのエージェントが適切な瞬間に停止するのか。どれが誤解から回復できるのか。どれが有用な記録を残すのか。
こうした問いは、人格や会話の流暢さより重要だ。誤った行動を完了する魅力的なエージェントは、確認を求める無愛想なエージェントよりも多くの手間を生む。
本当の試練は音声ではなく権限にある
最も難しい問題は自然な音声を生み出すことではなく、エージェントが約束を成立させるのに十分な権限をいつ持つのかを判断することだ。
最近のInstinctに関する体験は、この区別が重要である理由を示している。The Atlanticの記者は、同アシスタントが業者を見つけ、清掃会社に連絡し、書籍の集荷を手配したと報じた。これらの例は、委任された調査と連絡の利便性を示している。
同じ記事は、他のテスターから報告された、より懸念される結果も記録している。あるユーザーは、エージェントが早まってフライトをキャンセルし、200ドルを超える損失が出たと述べた。別のユーザーは、Instinctが承認なしに200ドルのキャンセル料がかかるレストランを予約したと話した。
別のユーザーは、エージェントが予約リクエストを繰り返し送信した後、Resyへの一時的なアクセスを失ったと報じられている。Instinctの創業者Noah Shinnは、これらの出来事に関する同誌のコメント要請に応じなかった。
これらのケースは個別の報告であり、Instinct全体の信頼性を統制された形で測定したものではない。エラーがどの程度の頻度で起きるかを示すこともできない。ただし、アシスタントに運用上の権限が与えられたときに可能になる失敗の種類を示している。
報告されたエージェントのエラーは、難しい製品上の緊張関係も浮き彫りにしている。ユーザーはシステムに摩擦を取り除いてほしいと望む。確認プロンプトを繰り返せば、その摩擦はユーザーへ戻る。
しかし、チェックポイントのない自律性は、情報を求める依頼を意図しない取引へ変えてしまう可能性がある。「キャンセル条件を確認して」と「予約をキャンセルして」は異なる。信頼できるエージェントは、長く複雑なやり取りの中でも、その違いを維持しなければならない。
電話はさらに別の曖昧さを加える。事業者の従業員は、代替商品、別の予約枠、あるいは条件付きのキャンセルを提案するかもしれない。エージェントは、会話が当初の権限を越えたことを認識する必要がある。
自然言語モデルは、あらゆる制約と完全に整合していなくても、もっともらしい応答を生成できる。長い会話は、指示が競合したり、ずれたりする機会も生む。
プロンプトインジェクションも関連する脅威だ。これは、信頼できないコンテンツがAIエージェントをユーザーの指示から逸らそうとすることで発生する。メール、ウェブサイト、通話にアクセスできるエージェントは、そのようなコンテンツの多くの発信源に接する。
Metaは、エージェントには通常のチャットボットより強力な隔離が必要であることを認めている。同社のSentinelシステムは、Museモデルとは別に行動を検査するよう設計されている。Metaはまた、メール送信や購入を含む機密性の高い手順について、ユーザーが承認すると説明している。
こうした制御は妥当に聞こえるが、通話は既存の承認ルールにきれいに収まらないカテゴリーを生む。レストランのキャンセルポリシーに同意することは購入に当たるのか。予約を確定することは法的拘束力のある約束になるのか。
製品チームには、「機密性の高い行動の前には尋ねる」より精密な方針が必要になる。機密性はコンテキスト、コスト、可逆性、開示される情報に左右される。
プライバシーも別の課題をもたらす。通話では住所、生年月日、アカウント番号、医療予約の詳細が必要になる場合がある。エージェントは、タスクを完了するのに十分な情報を開示しつつ、無関係なデータを露出させない必要がある。
Metaによれば、Museの会話と仮想マシンのデータは、同社の広告システムには提供されない。また同社は、やり取りをAIトレーニングに利用しないようユーザーがオプトアウトできるとしている。
Associated Pressは、広範なデジタルアクセスを必要とする製品を投入するMetaが、プライバシーを強調していると指摘した。同社のローンチ報道は、消費者の信頼をMuseにとって中心的な問題として位置づけた。
Instinctは、権限とデータ利用規約をめぐって、より厳しい精査に直面している。同社のポリシーは、接続サービスのデータとモデル学習について疑問を呼んでいる。ユーザーは、機密性の高いアカウントを連携する前に、最新の設定と規約を確認すべきだ。
エージェントが独立したサービス群を横断して動作する場合、どのアーキテクチャでもあらゆるリスクを取り除くことはできない。レストランの従業員がエージェントを誤解することもある。通話が切断されることもある。ユーザーが不完全な指示を出すこともある。
したがって、信頼性には透明な測定が必要だ。企業は、タスク完了率、未承認行動率、取り消しの結果、人間の介入頻度を報告すべきである。厳選されたデモンストレーションでは、これらの疑問には答えられない。
ユーザーには明確な回復手段も必要だ。有用なエージェントは、自らのエラーを特定し、やり取りの履歴を保持し、行動の取り消しを支援すべきだ。何が起きたかをユーザー自身に再構築させるべきではない。
業界が短期的に直面する課題は、委任を検証可能にすることだ。意味のあるすべてのステップは、ユーザーの指示、権限ルール、監査記録に結び付くべきである。
この基準は、無制限の自律性より遅く感じられるだろう。それでも、長期的な信頼を得る可能性は高い。事後にエージェントを監督しなければならないなら、消費者は重要なタスクを委任し続けない。
通話エージェントが定着するかを示す3つの兆候
次の局面を決めるのは、導入の質、目に見える安全策、競合他社の対応の速さだ。
第一の兆候は、Instinct Conciergeの通話とMeta Museの通話機能が繰り返し利用されるかどうかだ。初期ダウンロード数や機能リクエストは関心を示すが、ユーザーが毎週通話を委任することの証明にはならない。
重要な指標は、完了したタスクと再利用するユーザーだ。企業は、修正なしで依頼した結果を達成した通話の頻度を明らかにすべきである。また、単純な問い合わせと、金銭やアカウント変更を伴う約束とを区別する必要がある。
どのカテゴリーが継続的な需要を引き付けるかを注視したい。レストラン予約は分かりやすいデモだが、多くの人にとって頻繁な利用を支えるとは限らない。医療予約、家庭向けサービス、請求トラブル、サブスクリプション解約は、より広範なテストとなる。
各カテゴリーには異なるリスクもある。レストランではキャンセル料が発生しうる。医療への電話は機密情報を露出させる可能性がある。サブスクリプションをめぐる問題は、継続課金やアクセスを変更しうる。
通話が複数のカテゴリーで日常的な行動になれば、パーソナルエージェントの意義はより強まる。利用がデモや目新しさを目的とするタスクに集中したままであれば、現在の熱狂は弱まる。
第二の兆候は、MetaとInstinctがより明確な権限および監査コントロールを公開するかどうかだ。ユーザーに必要なのは、必要なときに承認が行われるという約束だけではない。製品が何を必要と見なすのかを理解する必要がある。
有用な制御には、支出上限、禁止されたタスクカテゴリー、承認済み連絡先、不可逆的な行動に対する確認ルールが含まれる。通話履歴では、エージェントが何を依頼し、事業者が何の提供に同意したかを説明すべきだ。
エラー報告も同じくらい重要になる。失敗のカテゴリーを開示する企業は、制御が時間とともにどのように改善するかを示せる。沈黙は、ユーザーを散発的な逸話と宣伝的な事例に頼らせる。
Muse Secure VMとSentinelをめぐるMetaの主張は、独立したセキュリティテストによって強化されるだろう。Instinctも同様の開示を行えば、ユーザーは利便性以外の軸でも製品を比較できる。
両社がきめ細かな制御を追加し、有意義な信頼性データを公開すれば、通話エージェントは信頼できるサービスに近づいて見える。大まかな保証に頼るなら、信頼は障壁のままだ。
第三の兆候は競争上の対応だ。Wajoなどの小規模エージェントは、すでに通話をポジショニングの一部として活用している。今後は単なる機能へのアクセスではなく、専門性やより優れた実行力を示さなければならない。
OpenAI、Google、その他のプラットフォーム提供者も戦略的な選択に直面している。直接の発信機能を追加するか、音声インフラ提供者と提携するか、あるいはこのチャネルを専門サービスに委ねるかだ。
企業向けプラットフォームは逆側から対応する可能性がある。予約システム、医療ポータル、カスタマーサービス事業者は、認可されたエージェント専用のインターフェースを作成できる。構造化されたアクセスは、自由形式の通話と比べて誤解を減らせる可能性がある。
ただし、企業が制限を導入する可能性もある。自動化された疑いのある発信者をブロックしたり、明示的な開示を求めたり、高頻度のリクエストを制限したりできる。Resy型のレート制御は、その摩擦の初期的な兆候を示している。
規制当局はいずれ、こうしたやり取りに影響を及ぼす。開示、同意、録音、なりすまし、消費者保護に関するルールは、日常的な取引を交渉するパーソナルエージェントを前提に設計されていない。執行やガイダンスによって、製品の運用方法は変わりうる。
現時点では、ユーザーは範囲が限定され、取り消し可能なタスクで通話エージェントを試すべきだ。利用可能な予約時間を尋ねることは、キャンセルを認可することよりリスクが低い。明確な制約があれば、結果も評価しやすくなる。
また、結果が重大な場合は、調査と実行を分けるべきだ。エージェントがまず選択肢を集め、その後に確定前の承認を求めることができる。このワークフローは、驚きを抑えながら時間短縮の利点を大部分維持する。
エージェントの挙動を研究するチームは、独自に記録を残しておくべきです。検索可能なAIワークフローは、繰り返しのテストにおける依頼、結果、失敗を記録するのに役立ちます。製品に関する主張が公表済みのベンチマークを上回るスピードで進むとき、エビデンスは重要です。
Meta Museの通話機能とInstinct Conciergeの通話は、消費者向けエージェントの真の拡張を示しています。これらは、構造化されたデジタルシステムではなく、依然として会話に依存する企業とAIソフトウェアをつなぎます。
その持続的な価値は、合成音声が人間らしく聞こえるかどうかには左右されません。エージェントが限界を理解し、適切なタイミングで質問し、問題が起きたときに復旧できるかどうかにかかっています。
今日、あなたの代わりにエージェントが保留で待つことを許可しますか? それなら簡単に選べるでしょう。より難しい問いは、料金の受諾、アカウントの変更、個人情報の開示を任せるかどうかです。まずは元に戻せるタスクから始め、記録を確認し、その結果がどれだけの権限に値するかを判断してください。



