Claude Voice Mode 现已支持 Opus、Sonnet、已连接工具和更多语言,但语音本身已不再是重点
Claude Voice Mode 现已支持 Opus、Sonnet、已连接工具和更多语言,结束了此前语音对话依赖轻量级模型的局面。7 月 23 日的更新让 Claude 语音超越了快速问答和免手动听写。现在,用户可以与 Claude 讨论更棘手的问题,同时让其从 Gmail 或 Slack 等服务中检索信息。
这改变了竞争的核心问题。OpenAI、Google 和其他开发商一直将自然、低延迟的对话视为语音助手的决定性品质。Anthropic 则更加重视推理、模型选择以及对工作上下文的访问。
其成果不只是一个更出色的对话式聊天机器人。Claude Voice Mode 正在成为文本聊天中相同模型和工具的另一种交互界面。它的价值将不再主要取决于语音听起来有多像真人,而更多取决于它能否在不中断对话流程的情况下完成有用的工作。
Claude Voice Mode 现已支持 Opus、Sonnet、已连接工具和更多语言
核心变化在于,语音对话不再必须局限于 Claude 最轻量的模型和孤立的聊天窗口中。
根据 Anthropic 的语音模式更新,语音对话现在可以在 Opus、Sonnet 或 Haiku 上运行。这些模型系列在推理深度、响应速度和用量消耗方面提供了不同的平衡。
用户可以在对话过程中切换模型。Voice Mode 还会默认使用用户最近一次文本聊天所采用的模型。这种机制缩小了输入复杂问题与继续通过语音开展同类工作之间的差距。
该更新目前以测试版形式向所有 Claude 用户开放。免费用户可以使用 Haiku 和一个已连接工具。付费用户可以使用更多模型,以及其账户所提供的全套已连接工具。
Anthropic 还扩展了多语言输入功能。其更新后的语音文档确认,多语言语音输入目前处于测试阶段,但该页面并未公布完整的语言列表。
这一点很重要,因为语音识别只是多语言助手的一部分。底层模型还必须能够跨语言理解含义、保留上下文并给出恰当回答。当提示中包含本地表达、混合语言语音或专业术语时,性能可能会有所不同。
Voice Mode 仍然是一种双向语音体验,而不只是简单的听写。听写会将语音转换为文本提示,而 Voice Mode 会在持续对话中全程倾听并用语音回应。用户还可以在同一聊天中切换语音和文本。
语音对话的文本记录会保存在聊天历史中。这使用户停止说话后仍能恢复语音会话,也意味着语音工作会像文本工作一样,成为同一份持久对话记录的一部分。
此次更新沿用了 Claude 的标准用量限制。因此,与选择 Haiku 相比,选择能力更强的模型可能会消耗用户更多的可用额度。模型选择并不是毫无运营成本的免费质量升级。
这种权衡在较长的语音会话中尤为重要。用户可能会为一项困难的战略决策选择 Opus,然后在进行简短的后续提问时切换回 Haiku。Sonnet 则处于中间位置,适合日常分析和多步骤工作。
当对话需要判断而非仅仅检索信息时,实际差异就会显现出来。轻量级模型可以总结一条短消息或回答一个直接问题。更复杂的规划讨论则可能需要比较约束条件、质疑假设,并在多轮对话中保持连贯的推理链。
在此次发布之前,语音为这类对话设置了较低的能力上限。习惯在文本中使用其他 Claude 模型的用户,无法期望在开始说话后获得相同的推理表现。新的模型选择器消除了大部分这种人为划分。
此次公告还将发布前不久测试中出现的一项变化正式化。TestingCatalog 报道称,一个模型选择器曾出现在功能标志之后,但会话最初仍继续通过 Haiku 路由。正式发布将这一隐藏实验转变为公开的产品方向。
Claude Voice Mode 现已支持 Opus、Sonnet、已连接工具和更多语言,是因为 Anthropic 希望语音能够继承 Claude 更广泛的能力。语音界面不再被视为一个独立、简化的产品。
已连接工具将对话转变为基于上下文的工作
模型访问能力让语音更加善于思考,而已连接工具则让它与用户的实际工作密切相关。
Claude 连接器将助手与外部服务和数据连接起来。Anthropic 表示,其第一方选项包括 Gmail、Google Drive、Google Calendar、GitHub、Slack 和 Microsoft 365。
这些集成使用 Model Context Protocol(即 MCP),这是一项用于连接 AI 系统与外部信息和操作的开放标准。连接器文档称,连接器可以提供数据、开放工具,并在对话中呈现交互式元素。
语音访问改变了这些连接带来的体验。用户不再需要中断语音讨论、手动搜索收件箱,然后粘贴相关消息。Claude 可以在对话继续进行的同时检索已连接的上下文。
以一位在会议之间步行的产品经理为例。该经理可以让 Claude 查看已连接的日历、查找相关的 Slack 讨论并找出尚未解决的决策。随后,用户无需分别打开每个应用程序,便可以继续讨论这些决策。
客户经理可以在通话前询问与某位客户相关的最新通信。研究人员可以检索已保存的文档,并通过对话分析其研究方法中的不足。工程师可以在远离键盘时询问 GitHub issue 的相关情况。
这些示例取决于权限和连接器能力。能够搜索数据的连接并不会自动获得修改数据的权限。用户在依赖语音指令之前,应确认授予每项服务的权限范围。
工具使用也会带来延迟。Claude 必须理解请求、选择工具、等待外部服务、处理结果,再将结果转化为对话式回答。每个步骤都可能打断用户对语音助手所期待的节奏。
Anthropic 产品团队成员 Tobin South 在发布后描述了这一挑战。他指出,将工具调用穿插在语音中可能会影响延迟和用户体验,让用户陷入等待。
这正是此次更新背后的隐藏技术难题。文本界面可以在工具运行时显示加载状态。语音对话中的沉默则会让人更加困惑,因为用户并不总能确定系统是否听到了自己说的话。
优秀的实现需要将对话处理与较慢的工具执行分离。它还需要在不使用多余语音填满每段延迟的情况下,告知用户当前正在发生什么。助手必须在保留工具状态的同时,始终允许用户打断。
外部服务还会引入另一层可靠性边界。Gmail、Slack 或文档提供商可能返回不完整的结果、拒绝授权或更改响应格式。即使底层模型能力强大,也无法消除这些集成故障。
用户还应区分检索与验证。Claude 可以在已连接的收件箱中找到一条消息,但它的解读仍然可能有误。重要日期、承诺和指示都应与原始来源进行核对。
隐私同样至关重要。连接收件箱所暴露的敏感上下文比提出一般性问题更多。Anthropic 的 Google Workspace 指南称,连接器数据不会用于训练其模型,但复制的内容可能适用不同的账户设置。
最安全的做法是仅连接特定工作流所需的服务。组织在公司账户中启用语音检索之前,还应审查保留政策、访问控制和管理设置。
对于个人知识工作而言,更宏观的模式并不陌生。有用的答案通常依赖于分散在消息、文件和笔记中的上下文。个人知识库通过让零散信息可搜索、可复用来解决类似问题。
语音改变的是访问方式,而不是底层需求。助手仍然需要可靠的上下文、明确的权限,以及一份可供用户在对话后检查的记录。
Anthropic 押注的是推理,而非原生语音的华丽表演
核心竞争并非 Claude 与某个特定聊天机器人之间的较量,而是以推理为中心的语音与主要围绕对话表现设计的语音之间的较量。
原生语音系统将音频作为核心模型输入进行处理,并可以直接生成音频。这种架构可以改善时机把握、情绪表达和响应速度。
Anthropic 展现出的策略则有所不同。Claude Voice Mode 在成熟的语言模型前加上了语音界面。模型负责推理和工具选择,语音层则负责倾听和语音输出。
这种差异很重要,因为两种方案针对不同的体验进行优化。原生语音模型可以流畅应对停顿、语气或打断。以推理为中心的技术栈则可以复用已经在文本中得到验证的相同模型、上下文和工具基础设施。
Anthropic 的方案让用户能够直接选择模型。Haiku 适合优先考虑速度的简短请求。Sonnet 适合常规分析和工作流。Opus 则面向值得以较慢响应和更高用量消耗为代价的困难问题。
这种结构让语音成为传递智能的通道。用户可以在需要精确表达时打字,在想法尚未成熟时说话,并在两者之间自由切换,无需选择另一个独立助手。
这种连续性具有战略价值。Anthropic 不需要让语音成为一个拥有自身模型行为的独立目的地。它需要让语音将 Claude 环境延伸到不方便打字的场景中。
该公司于 2025 年 5 月推出了最初的移动端语音测试版。当时,一篇发布报道介绍了语音对话、五种语音选项、文本切换以及有限的连接器访问能力。
最初版本进入市场时,用户已经熟悉聊天机器人的语音交互。它的差异化功能较为有限,因为竞争对手同样提供语音对话。Claude 缺乏一个明确理由,让用户将严肃工作从文本转移到语音。
最新更新提供了这个理由。Opus 和 Sonnet 带来了更深入分析的潜力。已连接工具则让模型能够以用户的文档、消息和日程为依据开展分析。
这并不能保证带来更好的语音体验。经过尴尬停顿后给出的深思熟虑答案,可能比立即给出的简单回答感觉更糟。用户对语音界面中的迟疑、打断和重复往往更加苛刻。
然而,仅有自然的表达方式,对知识工作而言价值有限。即使声音听起来像真人,如果无法检索到正确的文档,用户仍然需要亲自完成实际的信息整合。Anthropic 押注的是,有用的上下文将比表演式的流畅表达更重要。
模型切换设计进一步强化了这一立场。用户可以让计算投入与问题难度相匹配,而不必让每句话都经过同一个系统处理。这带来了更多控制权,但也引入了更简单的语音产品所没有的选择难题。
许多用户并不知道何时需要 Opus。他们可能会用它处理日常请求,更快耗尽使用额度,然后因为 Voice Mode 变得受限而责怪它。另一些用户可能一直使用 Haiku,并得出这次更新几乎没有改进的结论。
因此,默认行为至关重要。Claude 会使用用户最近一次文本对话中的模型,这有助于保持连续性,但也可能带来意外。用户若曾为一份高难度文档选择 Opus,可能会无意间在下一次语音会话中继续使用同一模型。
Anthropic 这一策略的最佳形态,是在不隐藏复杂性的前提下妥善管理它。Claude 可以清楚标明当前启用的模型、解释其对使用额度的影响,并让用户能够在对话过程中轻松切换。
如果这一点能够实现,语音就会成为进入 Claude 完整产品体验的灵活入口。如果失败,用户就只能承受模型选择的复杂性,却得不到稳定且更出色的语音助手体验。
更强的模型无法消除 Voice Mode 最棘手的风险
此次更新提高了 Claude 的能力上限,但也放大了请求听错、检索错误和用户信任错位所带来的后果。
语音本身就具有歧义。背景噪声可能会改变姓名、数字或指令。用户也可能在一句话说到一半时改变想法,却没有明确撤销前面的内容。
连接工具后,这些错误会带来更严重的影响。听错一个普通问题,只会生成无关的回答;听错涉及电子邮件、文档或办公系统的请求,则可能暴露错误的信息,或触发非预期操作。
Anthropic 将 Voice Mode 限制为使用预设语音,并表示它不支持语音克隆。其安全文档还指出,标准使用政策和滥用检测会继续适用于语音对话。
这些保障措施针对的是冒充行为和禁止内容,却无法消除日常工作中的普通错误。系统可能完全符合政策,却仍然检索了错误的会话,或得出了缺乏依据的结论。
语音也会促使用户以更随意的方式给出提示。人们说话时往往不如写作时有条理。他们会省略日期、默认双方拥有共同背景,并使用指代对象可能在长时间讨论中发生变化的代词。
更强的模型能够推断出部分缺失信息。但如果模型没有要求澄清,而是自信地填补空白,这种能力反而会带来新的风险。即使 Claude 选择了错误的信息源,接入的数据也可能让回答听起来有理有据。
用户需要针对会产生重要后果的操作设置确认步骤。在发送消息、修改文档或更改记录之前,助手应概述操作目标和拟执行的操作。语音确认也应足够简短,以保持易用性。
组织则面临不同的治理问题。管理员必须决定员工可以启用哪些连接器、Claude 可以检索哪些数据,以及语音转录文本是否符合现有的数据保留政策。
保存转录文本有助于问责,但也会留下用户原以为只是临时对话的记录。员工应当明白,与 Claude 交谈并不一定意味着这是一场不留痕迹的交互。
多语言支持带来了另一项不确定性。Anthropic 已确认测试版支持多语言输入,但支持并不意味着所有语言、口音或专业领域都具有同等表现。即使日常对话运转良好,专业词汇仍可能难以处理。
跨语言使用工具会进一步增加复杂性。用户可能用西班牙语说话、检索一封英文邮件,然后要求 Claude 用法语进行总结。模型必须在多次转换过程中准确保留姓名、日期和意图。
Anthropic 尚未发布涵盖这些工作流的语音专项评测。缺少这些衡量数据,任何宽泛的质量比较都还为时过早。此次发布证明了功能可用,但并未证明不同模型和语言之间已达到同等水平。
因此,测试版标签具有实际意义。用户应预期中断处理、连接器行为、模型可用性和使用限制都会发生变化。围绕当前界面构建的工作流可能需要调整。
延迟仍然是最明显的产品风险。Opus 比 Haiku 需要更多推理,而外部工具调用又会增加网络延迟。Voice Mode 必须同时处理这两点,且不能让用户疑惑系统是否仍在运行。
使用限额是另一项制约因素。更长的提示、检索到的上下文、工具结果和更深入的推理都会增加消耗。具体影响因模型、账户和任务而异,因此任何单一的通用估算都会误导用户。
Claude 的回答也依然具有概率性。Opus 的推理可以比小型模型更深入,但它仍可能误解证据或虚构关联。用户在依据敏感结论采取行动前,应检查原始资料。
此次发布不应被解读为可以取代会议、专业判断或有记录的审批流程。它只是改进了界面,让用户在移动过程中更容易使用现有的 AI 能力。
这种便利可能使采用速度超过组织更新管控措施的速度。企业买家应将语音和连接器放在一起评估,因为两者组合后的系统与独立聊天机器人具有不同的风险特征。
一个实用的试点方案应从只读检索和低风险任务开始。团队可以在启用更广泛的操作前,衡量转录错误、信息源选择、响应延迟和纠正频率。
关键问题不在于 Claude 听起来是否聪明,而在于用户能否察觉系统何时存在不确定性、何时正在等待工具,以及何时依赖不完整的上下文。
Claude 的语音策略如今让谁感受到压力
Anthropic 正在向所有仅将语音视为对话功能,而非知识工作操作层的助手施压。
OpenAI 帮助确立了一种预期:AI 语音界面应当快速响应,并支持自然打断。Google 已将其语音体验与整个产品环境中的服务相连接。其他助手则通过个性化体验、特色语音或设备集成展开竞争。
Claude 的更新将比较重点转向了一组不同的问题。语音背后由哪个模型进行推理?助手能否访问相关工作数据?用户能否在不退出对话的情况下切换能力等级?
这一框架有利于拥有强大模型和成熟工具系统的公司。与可靠的权限模型、连接器目录和推理体系相比,悦耳的声音更容易复制。
Anthropic 已经在 MCP 方面拥有架构优势。该协议为 Claude 提供了一种与外部工具通信的通用方式。其他产品也可以采用 MCP,因此这项标准并不是其独有的护城河。
更广泛的采用仍可能让 Anthropic 受益。开发者围绕 MCP 封装服务后,Claude 就能更轻松地访问这些服务。即使 Anthropic 不亲自构建每项集成,其生态系统也可以继续扩展。
竞争对手可以通过多种方式回应。他们可以在语音会话中加入模型选择、深化对企业应用的访问能力,或使用语音原生模型,以更低的感知延迟完成工具调用。
他们也可以简化体验。Anthropic 的模型选择器提供了灵活性,但竞争对手可以在快速推理系统和深度推理系统之间自动分配每项请求。用户可能更愿意让系统代为选择。
企业软件供应商同样面临压力。如果 Claude 能够跨应用搜索消息、阅读文档并讨论决策,对话层就会成为工作的起点。各个应用可能面临沦为助手背后数据源的风险。
这一结果并非必然。供应商掌控着身份验证、操作权限和数据质量。他们可以限制集成,也可以开发更贴近源信息运行的自有助手。
对于知识工作者而言,此次更新缩短了非结构化想法与有依据分析之间的距离。用户可以说出一个初步想法、检索证据、质疑假设并保存转录文本,而无需先组织出书面提示。
对于开发者而言,真正有趣的问题隐藏在界面之下。通过语音使用工具,需要精细的状态管理、中断处理和错误恢复。一次成功的交互既取决于模型智能,也取决于编排能力。
对于企业买家而言,此次发布催生了一个新的评估类别。语音助手应当根据真实工作流进行测试,而不是只测试预先编排的对话样例。检索准确性和权限行为应当获得与音频质量同等的重视。
Anthropic 的定位也进一步强化了 Claude 作为思考伙伴的形象。当用户需要推演问题,而不仅仅是获得语音回答时,语音才真正具有价值。
“思考伙伴”这一说法仍可能夸大产品能力。Claude 不会分担责任,无法独立理解一个组织,也不能保证判断正确。它只是根据可用上下文和系统行为生成回答。
然而,这种界面能够改变人们使用 AI 的方式。打字更适合提出已经成形的请求;说话则允许不完整的推理、反复修改和探索性提问,更接近一场积极展开的工作会议。
这种转变可能会扩大用户尝试借助 Claude 完成的复杂工作范围,也可能产生更多定义不清的任务。最终胜出的助手需要将随意的口头表达转化为明确、可审查的步骤。
三个信号将表明此次更新是否真正重要
接下来的考验是采用情况、可靠性和竞争对手的反应,而不是模型选择器中列出了多少个模型。
第一个信号是用户是否会在持续的语音会话中选择 Opus 或 Sonnet。Anthropic 已宣布相关模型可用,但尚未披露不同模型的语音使用情况或平均会话时长。
频繁切换将印证 Anthropic 的判断,即用户在说话时希望使用不同级别的推理能力。高度依赖 Haiku 则意味着,速度和使用限制仍比深度分析更重要。
最能说明问题的工作流将涉及判断和相互关联的证据。战略规划、研究审查、客户准备和项目分析,比天气查询或简短摘要更具检验价值。
第二个信号是对话过程中的连接器可靠性。用户需要稳定的检索、易于理解的等待状态,以及服务失败时清晰的恢复机制。如果工具使用只能在受控演示中正常工作,就无法支撑日常使用习惯。
Anthropic 最终应提供更多关于工具延迟、请求失败和确认机制设计的细节。企业客户也会需要将语音访问纳入连接器治理的管理控制措施。
需要关注进度提示方面的改进。简短的语音更新可以让用户确信 Claude 正在搜索,但过多的过程叙述会令人分心。界面必须传达状态,又不能主导对话。
第三个信号是竞争对手会如何将更深入的推理与语音结合起来。如果竞争助手加入类似的模型选择和连接工具访问能力,Anthropic 的差异化优势将迅速缩小。
更有力的回应,是将工具使用与保持低延迟的语音原生架构相结合。这样的结果将削弱“用户必须在自然对话与严肃推理之间做出选择”这一论点。
较弱的回应,则会聚焦于新语音、视觉效果或个性设置。这会进一步印证 Anthropic 的主张:更重要的竞争在于上下文处理和工作完成能力。
应从这三个信号全面监测多语言表现。用户反馈将揭示,在不同口音、混合语言提示词和翻译后的源材料中,识别与推理能力是否依然可靠。
Anthropic 可以通过发布专门针对语音的评估来增强其论据。值得参考的指标包括转录纠错率、工具任务完成情况、中断恢复能力,以及不同受支持语言之间的事实一致性。
用户无需等待正式基准测试。他们可以通过一个范围明确的工作流测试 Claude Voice Mode,并将结果与通过文本完成同一任务的结果进行比较。
从一个需要使用单个已连接来源并产出明确交付成果的问题开始。要求 Claude 指明其使用的来源、总结结论,并说明任何不确定性。然后检查转录文本和原始材料。
在可用时,分别使用 Haiku、Sonnet 和 Opus 重复该任务。比较响应时间、来源选择、推理质量和用量影响。这种实际测试比精心制作的演示更能说明问题。
Claude Voice Mode 现已支持 Opus、Sonnet、已连接工具和更多语言,但功能可用只是第一步。当工具响应缓慢、语音存在歧义,且上下文横跨多个服务时,深度推理能否依然保持实用?
答案将决定语音是会成为知识工作的严肃交互界面,还是仅在不便打字时充当一个方便的选项。选择一个真实的工作流,认真测试,并确保原始来源随时可查。



