Anthropic Verge:Claude Voice Mode 获得 Opus 和 Sonnet 支持,但竞争对手仍掌握节奏
- Sophie Larsen

- 3小时前
- 讀畢需時 15 分鐘
Anthropic 已取消 Claude 语音模式的一项重大限制,让复杂对话不再局限于 Haiku,而是可使用能力更强的 Opus 和 Sonnet 模型。Anthropic Verge 的这则报道之所以重要,是因为语音不再只是置于 Claude 最强智能能力之外的轻量化界面。它如今可连接人们已用于高要求任务的模型、应用程序与工作上下文。
用户可在对话过程中切换 Haiku、Sonnet 和 Opus,也可在语音与文本之间切换而不丢失既有上下文。只要用户授予权限,Claude 就能访问 Gmail、Google Calendar、Google Docs 和 Slack 等已连接服务。
这一组合让 Claude 语音模式不再只是一个免手操作的问答框。一项口头请求可以从邮件线程开始,结合日历限制继续推进,最终形成草稿或摘要。Anthropic 押注于模型深度和工作场景上下文,试图弥补其在 ChatGPT Voice 和 Gemini Live 之后才入场的劣势。
时机带来了核心张力。OpenAI 最近让其语音系统更具对话感,而 Google 已将 Gemini Live 与摄像头、屏幕共享及已连接服务结合起来。Anthropic 强化了麦克风背后的“大脑”,但智能本身并不能决定语音助手是否真正好用。
Anthropic Verge 报道标志着超越 Haiku 的转变
关键变化不只是 Claude 能通过另外两个模型进行语音交流。语音如今遵循与用户文本工作相同的模型选择机制。
Anthropic 更新后的语音模式指南称,该功能可使用与文本聊天相同的 Claude 模型家族。它会从用户最近选择的模型家族开始,例如 Sonnet、Opus 或 Haiku。
系统会自动使用该家族中最新可用的一代模型。用户选择的是模型家族,而非在语音模式中指定具体模型版本。在对话仍处于进行状态时,用户也可以更改这一选择。
这消除了交互模式之间一个尴尬的边界。此前,用户可能先用能力更强的文本模型处理困难任务,却在切换到语音后失去这种能力。这让语音像是 Claude 独立且被削弱的版本。
新方式让对话始终与所选智能水平绑定。Claude Sonnet 语音可处理与 Sonnet 使用权限相关的日常分析任务。Claude Opus 语音则将这一模式扩展到定位于更高难度推理任务的模型家族。
Anthropic 尚未公布独立证据,说明各模型能在多大程度上提升语音任务完成效果。但这种差异仍然重要,因为模型会接收转录文本,并决定下一步该说什么或做什么。即使语音界面本身不变,更强的推理能力仍可改善规划、理解和指令遵循。
语音对话会计入每个账户的常规使用限额。模型可用性也取决于用户的订阅方案。这意味着获得语音访问权限,并不自动意味着可以使用所有 Claude 模型。
该功能仍适用于 Free、Pro、Max、Team 和 Enterprise 方案。它可在 iOS、Android、桌面端和网页端运行,但 Anthropic 表示,在手机上使用体验最佳。
这一平台扩展改变了可能的使用场景。用户可在笔记本电脑上处理文档时继续进行语音对话,离开办公桌后再转到手机上。文本与语音保留在同一段对话中,而不会生成彼此孤立的转录记录。
Anthropic 还提供免手操作和按住说话选项。免手操作模式会监听自然停顿,而按住说话让用户在嘈杂环境中拥有更多控制权。用户可通过说话打断 Claude,不过底层交互仍依赖可识别的对话轮次。
公司的文档也承认存在实际限制。多个已连接工具可能带来短暂延迟,并非每一种结果都适合通过语音界面呈现。复杂请求在被拆分为更小的部分后,效果也可能更好。
这些限制意味着,这次发布不能被简单理解为 Opus 已解决语音交互问题。更强的模型是在周边系统生成的转录文本基础上行动。语音识别、延迟、轮次检测、权限和工具可靠性,仍是整体体验的一部分。
因此,Anthropic Verge 的叙事最好被理解为一次界面校正。Anthropic 正将语音拉近 Claude 的其他能力,而不再把它当作一条简化的产品线。这一校正为更高难度的任务打开了空间,但也让 Claude 面临更严苛的比较。
已连接应用将语音变为工作界面
当口头请求能够触及用户真实的工作内容,而不只是 Claude 的通用知识时,Opus 和 Sonnet 才会变得更具意义。
Claude 可在语音对话中使用网页搜索和已连接工具。Anthropic 在当前文档中特别列出了 Gmail、Google Calendar、Google Docs 和 Slack。最初的 Claude 语音扩展也强调,Canva 是 Anthropic 更广泛连接器推进计划中的应用之一。
这些连接在“对话”与“协助”之间造就了实际差异。询问通用的日程安排建议,只需要模型作答;要求 Claude 查看日历、找出冲突并协助准备变更,则需要经授权的访问权限和正确的工具使用。
设想一位经理正在通勤途中为当天做准备。该经理可以要求 Claude 总结一条邮件线程、查看下一场会议,并找出尚未解决的问题。一个有能力的模型必须跨这些来源连接细节,同时不混淆发件人、日期或承诺事项。
Haiku 仍适合快速检索和简短回答。当请求涉及多份文档或包含含糊指令时,Sonnet 会更具相关性。当用户希望进行延展分析、谨慎起草,或通过对话制定策略时,Opus 则更有吸引力。
这种区分并非绝对。Anthropic 并未承诺 Opus 总能做出更好的工具决策,而更大的模型也可能带来更长等待时间。用户很可能会根据任务复杂度、可用额度和对延迟的容忍度选择模型。
当用户在文本与语音之间切换时,Claude 会保留上下文。这对需要准确名称、URL、代码或难以口述的编辑工作很重要。用户可以先通过语音梳理想法,输入一条精确引用,再继续讨论,而无需重新构建提示词。
这种混合行为可能比纯语音设计更有用。语音适合探索,因为人们可以快速描述不确定性;文本仍更适合核验,因为用户可以检查名称、数字、链接和最终措辞。
已连接应用模式也引入了权限边界。Claude 只能使用用户已连接的工具,而这些工具也遵循订阅方案规则。Free 用户可以连接一个工具,付费方案则支持更多连接。
连接器并不等于不受限制的访问。每项集成均通过权限以及向 Claude 开放的能力运行。组织仍必须决定,哪些账户、文件、频道和操作应纳入 AI 辅助工作流。
当界面具备对话性时,这些决定会变得更加重要。输入的命令在提交前会留下可见措辞;在免手操作模式下,即兴表达的请求即使会触发从敏感工作系统中检索信息,也可能显得没那么重要。
因此,用户应确认具有实质影响的输出,而不能把口头操作的便利性当作正确性的证明。摘要可能遗漏限定条件,日历请求可能指向错误事件,草稿可能把暂时性的讨论表述为既定决定。
一个良好的 AI 工作流会保留可供审阅的信息来源。语音可加速导航与整合,而可见记录则支持核验。当信息来自多场会议、文档和消息线程时,这种分工尤其有用。
更大的战略意义很明确。Anthropic 正将 Claude 扩展到知识工作者协调活动的层面。麦克风只是入口,真正的竞争资产是一个能够理解请求、检索上下文,并返回行动或决策的系统。
ChatGPT 和 Gemini 从不同方向向 Claude 施压
Anthropic 面对的是两种不同的标准:OpenAI 的对话流畅性,以及 Google 对设备、屏幕和服务的接入能力。
OpenAI 2026 年 7 月的语音发布说明介绍了面向付费用户的 GPT-Live-1,以及面向免费用户的 GPT-Live-1 mini。两种模型都可同时听和说,从而支持打断和更自然的轮次交替。
这种全双工行为意味着,系统能够在生成语音输出的同时处理输入语音。Claude 的免手操作模式支持打断,但其体验仍围绕检测用户何时说完一个想法来组织。即使两个系统都理解同一请求,这种差异也可能影响交互节奏。
在语音场景中,缓慢或生硬的轮次可能比文本中更重要。文本用户习惯于按下按钮后等待;语音用户则会将助手与人类对话比较,而犹豫和打断能够传递注意力。
OpenAI 还让其当前语音系统可以使用网页搜索、记忆、文本和图像。不过,GPT-Live-1 发布时未支持视频或屏幕共享。符合条件的用户若要使用这些视觉功能,仍须依赖旧版高级语音体验。
Google 则从另一个方向施压。其官方 Gemini Live 指南支持摄像头输入、屏幕共享、打断和已连接应用。Gemini 可以讨论用户看到的内容,同时访问 Calendar、Keep、Tasks 和 Workspace 等服务。
这种组合赋予 Google 在 Android 上的结构性优势。Gemini 可作为移动助手运行,浮现在其他应用之上,并利用与 Google 设备环境关联的上下文。Anthropic 必须通过自有应用和第三方连接来构建可比的实用性。
Claude 确实拥有一项明确优势。用户常会选择 Sonnet 或 Opus,是因为他们需要持续推理、起草或分析能力。当用户停止输入时,让这些模型可通过语音使用,便保护了这种价值。
Claude Opus 语音可能尤其适合开放式工作。一位创始人可以口述彼此竞争的定位方案,挑战既有假设,并要求生成一段简洁的推介文案。其价值在于维持推理线索,而非更快地给出语音答案。
Claude Sonnet 语音则可能覆盖更广泛的职场任务。它可支持文档摘要、会议准备、研究整合和结构化起草,而不会迫使用户使用最重型的模型家族。
尽管如此,模型质量并不能消除用户对交互界面的期待。一个能力很强、却在不确定的停顿后才给出的回答,可能不如一个更简单但流畅给出的回答自然。语音产品比拼的是时机把握、打断处理、识别质量、语调和错误恢复能力。
它们也在比拼触达范围。ChatGPT 在消费者市场拥有广泛影响力,而 Gemini 则处于 Google 的移动端和生产力环境之中。Anthropic 凭借 Claude 的写作和编程能力获得了相当高的认可,但语音需要培养不同的使用习惯。
这为 Anthropic 带来了强劲对手:具备深度平台访问能力的实时多模态助手。OpenAI 和 Google 不需要在每一次推理比较中胜出。它们只需让语音系统足够便利,让用户习惯从那里开始。
Anthropic 的应对方式,是让语音成为进入其最强模型和工作场所连接器的入口。这是一项连贯的策略,但它仍要求用户打开 Claude,而不是调用已深度嵌入设备各处的助手。
市场不会仅通过基准测试来判定这场比较。胜出的系统必须理解杂乱的语音、检索正确的上下文,并在误解时安全地恢复。它还必须以足够快的速度完成这些事情,才能让人们持续交谈。
更强的智能并不能消除语音模式的风险
这项升级提升了 Claude 的实用性,但也提高了误解请求或检索错误上下文的代价。
语音在模型开始推理前就会引入歧义。名称可能发音相近,背景噪声可能扭曲指令,自然语言中也常有修正或未完成的想法。能力强的模型或许能推断出用户意图,但过于自信的推断也可能掩盖转录错误。
Anthropic 建议用户在拥挤或嘈杂环境中使用按住说话模式。它也建议将复杂问题拆分成更小的部分。这些建议表明,该界面仍依赖环境条件以及谨慎的任务表述。
延迟是另一项尚未解决的权衡。Anthropic 表示,同时使用多个工具可能会带来短暂延迟。Sonnet 和 Opus 处理的工作也比 Haiku 更复杂,因此响应速度必须在模型深度与对话节奏之间取得平衡。
当 Claude 正在分析一段长线程时,几秒钟的等待或许可以接受。但在头脑风暴或演练期间,同样的延迟会显得干扰性很强。用户可能为了速度切换到 Haiku,这会削弱提供更强模型的实际效果。
Claude 无法在语音模式内显示每一项已连接工具的结果。当用户需要比较文档、检查来源或确认特定记录时,这一限制尤为重要。语音可以总结,但许多核验任务仍离不开屏幕。
语音对话的转录文本会像文字对话一样保存在聊天记录中。这种连续性有助于后续复查,但也会形成口述材料的记录。用户在通过任何托管式助手讨论机密工作前,应了解所在组织的相关规定。
已连接服务带来了另一层暴露风险。一句口头提示可能会从电子邮件、日历、文档或工作场所消息中调取信息。模型的回答可能会整合此前分散在不同上下文中的材料。
这种整合创造了价值,但也可能模糊边界。用户可能只是要求概述项目进展,却收到受限线程中的细节。管理员在更广泛部署前,必须评估连接器权限、保留设置和可接受的使用方式。
Anthropic 表示,语音模式使用有限数量的预设声音,且不提供声音克隆。该公司将这一限制视为防范冒充的措施。其常规使用政策和滥用检测也同样适用于语音交互。
这些保障措施针对的是生成语音,而非所有工作场所风险。它们无法保证摘要包含所有限定条件,无法阻止用户授予超出预期的访问权限,也不会在执行操作前独立验证其正确性。
语言支持带来了更多不确定性。Claude 现在支持更多语言的语音对话,尽管 Anthropic 的帮助中心仍将非英语支持标为 beta。用户可以选择语音语言,或在对话中要求 Claude 切换。
多语言可用性扩展了 Claude 的覆盖范围,但可用并不等于可靠性相同。口音、专业词汇、混合语言语音和名称都会影响识别效果。Anthropic 尚未发布有关此次更新的详细对比准确率数据。
因此,该公司最有力的主张应保持在较为有限的范围内。Claude 现在在语音模式中支持 Opus 和 Sonnet。它可以在语音和文本之间保留上下文,也能访问获得授权的工具。但这些事实并不能证明其对话质量更优,或能可靠地自主完成任务。
这篇 Anthropic Verge 报道反映了一项重要的产品变化,但其真实价值仍将由外部测试决定。评测者需要在真实工作场景中衡量任务成功率、延迟、打断行为和来源准确性。
企业采购方也应使用自身的术语和权限运行相同测试。通用演示无法揭示系统如何处理内部项目名称、重叠日历、敏感频道或组织特定的审批规则。
知识工作者可以在不立即交给 Claude 具有重要后果的操作的前提下测试语音模式。可从只读摘要、会议准备和想法发展开始。在扩展工作流前,应将口头回答与底层来源进行对照。
这种分阶段方法将语音视为具有独特故障模式的交互界面。它避免假设更好的语言模型会自动产生更安全的助手。更强的智能可以改善理解,但更广泛的访问权限也会提高每一次理解出错的风险。
Claude Voice Mode 正在成为模型路由器
Anthropic 最有意思的决定,是让用户无需放弃当前对话,就能更换驱动该对话的智能模型。
模型路由器会根据成本、速度或能力,将请求导向不同模型。Claude 通过模型选择器,将部分决定权交到用户手中。用户可以选择 Haiku、Sonnet 或 Opus,同时保留周围的上下文。
这种结构符合许多人的实际工作方式。并非每一步都需要同样的深度。用户可能先用 Haiku 检索日历事项,再用 Sonnet 分析复杂线程,最后用 Opus 审视一项战略结论。
该系统不要求用户了解具体的模型代际。它展示熟悉的系列名称,并将每项选择对应到最新一代。这减少了界面杂乱,同时保留了有意义的控制权。
用户控制也可能带来摩擦。大多数人不想决定每个口头请求应由哪个模型回答。他们希望助手能够理解任务何时需要速度、分析或谨慎处理。
Anthropic 最终可能会自动化更多路由决策。不过,自动切换需要清楚说明:为何更换模型、使用量如何计算,以及所选模型能否访问相同的工具。
目前,手动选择提供了一个有用的测试场。Anthropic 可以观察语音用户是否会主动在不同模型系列间切换,也能了解哪些任务会让人们接受较慢的响应,以换取更深入的推理。
最强的信号将是用户持续使用 Claude Opus voice 处理复杂工作。这将表明,用户重视模型深度,足以容忍任何额外延迟或使用量压力。若频繁切回 Haiku,则意味着速度才是决定因素。
Sonnet 可能会成为默认的折中选择。它介于快速检索和最复杂分析之间。如果 Claude Sonnet voice 能够可靠处理已连接的工作任务,许多用户可能认为没有必要在日常对话中管理模型选择。
这种路由策略也保护了不同交互模式之间的连续性。用户不需要一个拥有独立记忆和能力的专用语音助手。他们可以通过当下最适合的输入方式,继续同一段 Claude 对话。
这一设计契合了从聊天机器人转向持久化工作界面的更广泛趋势。助手成为任务在消息、文件、工具和多种交互方式间持续发展的场所。语音加入这个界面,而不是取代它。
这种区别很重要,因为语音很少适合完整的知识工作流。它非常适合捕捉想法、讨论不确定性和请求快速更新,但不擅长精确修改措辞、审阅引用和比较结构化信息。
Anthropic 的混合模式承认了这种分工。用户可以口述完成草稿、切换到文本进行精确修改,再回到语音获取批评意见。对话会在这些转换中持续保留此前的上下文。
OpenAI 和 Google 同样支持在不同交互方式之间切换,因此连续性本身并非持久优势。Anthropic 必须证明,其模型系列能成为用户选择 Claude 来完成底层工作的理由。
这正是为何此次更新的战略意义大于表面修饰。它确保语音不再阻碍用户访问吸引他们使用 Claude 的能力。该界面现在可以参与 Anthropic 的核心模型战略。
风险在于,模型选择会成为改善语音系统本身的替代品。用户仍会评判打断处理、识别效果、响应速度和情感节奏。更强的模型无法无限期弥补不够流畅的对话体验。
Anthropic 必须同时推进这两个层面。它既需要在交互背后提供强大的推理能力,也需要打造一种融入背景的语音体验。此次更新显然加强了第一层,而第二层仍有待比较。
三个信号将表明这项升级是否重要
接下来的考验是采用情况,而非功能可用性。Anthropic 必须证明,人们会将更强模型、已连接工具和语音连续性用于真实工作。
第一个信号是语音会话中的模型选择。Anthropic 尚未公布采用数据,说明用户选择 Haiku、Sonnet 或 Opus 的频率。这一分布将揭示新能力是否改变了用户行为。
大量使用 Sonnet 或 Opus,将强化 Anthropic 的论点:人们希望通过语音完成更深入的工作。使用有限则表明,语音仍主要用于快速提问,此时 Haiku 的速度可能比额外推理更重要。
第二个信号是已连接工具的可靠性。用户必须看到 Claude 检索到正确的电子邮件、日历条目、文档或 Slack 线程。他们还必须在依赖结果前获得足够可见的上下文来验证它。
Anthropic 应以成功完成任务的能力来接受评判,而非可用连接器的数量。如果权限让用户感到困惑、检索遗漏关键记录,或多工具请求造成过度延迟,再长的应用列表也意义不大。
独立测试应考察真实的操作序列。一个有用测试是要求 Claude 总结一个线程、将其与文档进行比较,并识别对日历的影响。评测者随后可对来源准确性、遗漏、延迟以及从模糊措辞中恢复的能力进行评分。
第三个信号是 Anthropic 对实时竞争对手的回应。OpenAI 的全双工模型为打断处理和对话节奏树立了明确标准。Google 的视觉和设备集成为多模态上下文树立了另一项标准。
据报道,Anthropic 表示,此次发布重点强调智能能力与工具访问。未来的更新还需证明,它能否在不牺牲 Claude Opus 语音背后推理质量的前提下,缩小对话体验上的差距。
若能更快地处理打断,将强化当前策略。扩展视觉输入也可能有所帮助,尤其是对希望讨论屏幕内容或实物的用户而言。支持本次发布的材料中,并未承诺这两项改进。
Claude Code 和 Cowork 尚未提供 Claude 语音模式,也是另一个值得关注的边界。Anthropic 帮助中心称,这些产品支持听写,但不提供完整的双向语音体验。语音功能也无法访问 Cowork 中配置的项目或技能。
这种分离限制了开发者和高级知识工作者的连续工作体验。用户可以在 Claude 中讨论一般工作内容,却无法将同一段语音会话直接带入 Anthropic 的所有专用环境。
如果能在这些产品之间实现整合,将更有力地支持这样一种观点:语音正成为通用的 Claude 交互界面。若持续保持分离,则可能表明 Anthropic 主要将语音视为面向消费者和通用工作的功能。
语言质量同样值得审视。英语以外的支持扩大了潜在用户范围,但 Beta 标签表明相关工作尚未完成。对比测试应覆盖混合语言语音、口音、人名以及领域术语。
结果不会由单个发布周决定。用户需要时间了解语音在哪些场景能改善工作、又会在哪些场景增加核查负担。组织则需要更长时间测试权限、记录和管理控制。
目前,Anthropic 的这一进展弥补了一个显眼的能力缺口。Claude 最知名的模型系列不再被锁在键盘之后,已连接的工作内容也能进入同一段语音对话。
这并未让 Anthropic 获得无可争议的领先地位。ChatGPT 为实时对话节奏设定了很高的标准。Gemini 则展示了语音如何与屏幕、摄像头、Android 以及广泛的已连接服务层结合。
Anthropic 的押注更聚焦,也更可信:当回答的实质内容比对话表现力更重要时,用户会选择 Claude。Opus、Sonnet 以及已连接的工作上下文,让这一立场更容易成立。
决定性的问题在于,Claude 能否让深入的语音工作自然到足以让人反复使用。可以先尝试一项涉及可验证材料的只读任务,再将结果与文本模式比较。如果 Claude 能保留细微含义、检索到正确上下文,并且不会产生干扰性的延迟,那么这次升级就具有实际价值。若你花在纠正识别错误或核查来源上的时间更多,再强的模型也没有解决交互界面的问题。关注模型使用情况、连接器可靠性以及 Anthropic 下一次语音更新。这些信号共同将表明,此次是一次功能扩展,还是一项持久语音战略的开端。


