top of page

Anthropic 通过更强模型和应用操作升级 Claude Voice

7月26日
讀畢需時 14 分鐘

Anthropic 在 Claude voice mode 推出不到一年后对其进行了升级,新增更强的模型和应用操作能力,但底层语音系统并未改变。这则关于 Anthropic 的 TechCrunch 报道之所以重要,是因为 Claude 如今不只能维持语音对话。它还可以通过已连接的服务协助调整会议、准备邮件草稿,或创建 Notion 文档。

这种组合改变了与 OpenAI 的竞争格局。ChatGPT 一直着重让语音交流听起来流畅、响应迅速且更具人性。Anthropic 则选择了另一条路径:将口头请求连接到 Gmail、Google Calendar、Slack、Canva 和 Notion 中的实际工作。

结果是一项明确的取舍。Claude 承诺提供更深入的推理和更实用的操作,但在被打断或快速对话时,体验可能仍不够自然。这使得此次更新与其说是在寻找最逼真的 AI 声音,不如说是在界定语音助手应该完成什么。

Anthropic 的 TechCrunch 更新改变了 Claude 的“大脑”

Claude voice mode 现在可以使用 Anthropic 的 Opus、Sonnet 和 Haiku 模型系列,而不再只依赖 Haiku。

根据这篇语音模式更新,Anthropic 于 2026 年 7 月 23 日宣布了这一变化。新版本仍处于测试阶段,可在受支持的平台上使用。

此前,语音模式运行在 Anthropic 更快、更轻量的 Haiku 模型系列上。这种设计支持快速回答,但不太适合复杂讨论或长链推理。

新系统会遵循用户在文本聊天中最近选择的模型系列。当用户进入语音模式时,Claude 默认会从该系列中选择可用的最快版本。

这带来了三种大致选择。Haiku 优先考虑速度,Sonnet 平衡能力与响应性,Opus 则面向要求更高的工作。Anthropic 尚未发布它们之间针对语音的性能比较。

当一项口头任务不只是检索简单事实时,模型选择就显得重要。用户可能会在散步时演练客户演示、请求详细反馈,或探讨相互竞争的产品创意。

这些工作要求 Claude 能在多个回合中跟随一条论证。它必须保留上下文、识别薄弱假设,并在不把讨论简化为泛泛鼓励的前提下作出回应。

Anthropic 表示,更强的模型支持更长的对话和要求更高的使用场景。该公司以沟通辅导、客户提案准备和产品市场研究为例。

这些例子表明 Anthropic 希望 Claude voice 扮演的角色。它将语音定位为进入同一推理系统的另一种入口,而不是一个能力有限的独立助手。

这一区别对现有 Claude 用户很重要。用户可以先在文本中开始一个详细项目,选择 Sonnet 或 Opus,然后通过语音继续讨论。

这种连续性消除了语音助手的一项常见限制。许多系统将语音视为简化界面,无法获得文本模式中提供的完整能力。

Claude 的方法旨在缩小这一差距。语音界面会继承用户的模型偏好,并可利用对话中已有的上下文。

不过,模型升级并不意味着每个回答都会像 Haiku 的回应一样迅速。能力更强的模型通常需要额外计算,尤其是在请求涉及工具或较长上下文时。

Anthropic 通过在所选模型系列中选择最快版本来应对这一矛盾。不过,实际响应速度仍取决于模型、网络状况、对话长度和已连接服务。

因此,这次更新改变 Claude 的推理能力多于其声音表现。用户获得了更强的分析能力,却没有得到重新设计的语音引擎。

这一区别定义了整个发布。Anthropic 改进了 Claude 能思考和采取行动的内容,但并未彻底改造 Claude 的倾听或说话方式。

对于重视实质内容的用户而言,这可能是合理的优先级。如果助手无法完成请求的任务或理解更广泛的上下文,自然的语音价值有限。

对于经常打断、更正或重新引导助手的用户来说,对话机制仍同样重要。通过别扭交流交付的强大回应,依然可能让产品令人沮丧。

与模糊地宣称对话质量提升相比,模型选择的变化也更容易评估。用户可以用 Haiku、Sonnet 和 Opus 测试同一项任务,再比较速度和实用性。

这让新的 Claude voice 模型成为一项实用的界面设计实验。Anthropic 正在询问:更好的推理能否弥补尚未获得同等升级的语音层。

已连接的应用将语音转化为工作

重要的变化不在于 Claude 说得更好,而在于口头请求现在可以在已连接的应用中触发工作。

Claude voice 可以访问包括 Gmail、Google Calendar、Slack、Canva 和 Notion 在内的服务。这些连接让该功能超越了对话,迈向任务执行。

以需要调整的会议为例。用户可以要求 Claude 检查空闲时间、更新活动并处理细节,无需打开日历界面。

Anthropic 当前的日历连接器可以读取和写入日历数据。它可以查找共同空闲时间、创建邀请、更新活动、管理参与者并回复邀请。

措辞上的实际差别很小,结果却大不相同。“我的下一个会议是什么时候?”是在检索信息,而“调整我的会议”则会改变外部状态。

电子邮件提供了另一个有用例子。用户可以口头说明目的、受众和期望语气,然后要求 Claude 准备草稿。

Anthropic 的Workspace 指南称,Claude 可以搜索邮件、读取相关上下文并创建格式化的 Gmail 草稿。它不能直接发送这些草稿。

这一边界保留了人工审阅步骤。用户必须打开 Gmail、检查邮件,然后自行发送。

审阅要求或许显得不便,但也能限制误解指令造成的损害。有问题的草稿比发给错误收件人的邮件更容易修正。

Notion 提供了第三类操作。一场口头头脑风暴可以变成书面文档,而不是在对话结束后消失。

这一工作流对习惯边说边想的人很重要。产品经理可以捕捉早期研究问题,销售团队则可以把通话准备转化为结构化简报。

设计师可以在讨论创意后要求 Claude 将其收集到 Notion 页面中。团队也可以在协作会议期间不停下来打字,就创建工作文档。

更广泛的模式连接了语音、推理和软件操作。每一层都为体验贡献了不同内容。

语音降低了表达想法所需的成本。强大的模型可以理解不完整的语言、回忆上下文,并形成有用回应。

连接器提供了对用户工作环境的访问。它们让 Claude 能检索私有上下文,或在另一项服务中请求获批的更改。

这种组合让语音更接近智能体,即能够朝着既定目标选择和使用工具的软件。不过,Claude 仍在权限和审批要求范围内运行。

Anthropic 表示,涉及 Google Workspace 的操作需要用户明确批准。Claude 只访问已连接账户,并且应为每项请求检索所需的最少信息。

据该公司称,连接器数据会与 Anthropic 服务器上的聊天记录关联。用户可以通过删除相关对话来移除这些检索数据。

Anthropic 还表示,它不会使用通过 Gmail、Calendar 或 Drive 连接器检索的数据训练模型。符合条件的消费者聊天中复制的内容可能遵循单独的训练偏好设置。

这些细节值得关注,因为语音会让授权显得随意。说一句“处理一下那个会议”,可能比逐一点击多个确认界面显得后果更轻。

底层操作依然重要。它可能改变他人的日历、暴露邮件上下文,或创建一份后来被同事视为权威的文档。

用户应审阅确认界面,尤其是在请求会影响他人时。错误的日期或参与者名单可能造成真实的运营问题。

同样的谨慎也适用于邮件草稿。Claude 可以从现有邮件线程中推断语气,但它无法了解每段对话背后的所有政治或人际细节。

语音也可能产生转录错误。当姓名、日期、项目代码和不常见术语成为工具参数时,尤其敏感。

设计良好的助手应在执行前展示这些细节。用户必须能够在不重新开始整段对话的情况下进行更正。

这就是为什么连接器比模型选择器更重要。模型选择改善推理过程,但已连接的操作决定 Claude 是否能节省有意义的时间。

新流程也支持个人知识工作。已经维护AI 第二大脑的人,可能会在将内容整理到其他地方之前使用语音捕捉上下文。

Claude 并未取代该工作流中的每个界面。它是在选定服务中提供一层语音控制,而用户仍负责最终批准。

Claude Voice 在“操作”而非“人格”上向 ChatGPT 施压

Anthropic 通过强调实用操作与 ChatGPT 竞争,而 OpenAI 则专注于提升口语对话的质量和节奏。

这篇关于 Anthropic 的 TechCrunch 报道直接对比了 OpenAI 最近的语音更新。OpenAI 改进了对话行为,但其语音体验在发布时并未获得相当的工具访问能力。

这一区别构成了文章的主要竞争框架。Claude 试图成为能够完成工作的语音助手,而 ChatGPT 则旨在变得更容易交谈。

两种策略都不必然更优。正确的选择取决于用户最初为什么打开语音模式。

练习困难对话的人,可能会看重自然的节奏、快速处理打断的能力,以及情感上恰当的回应。这些功能让演练不会显得脚本化。

管理繁忙工作日的人,可能更关心已连接的上下文。助手必须找到正确的邮件线程、理解日历冲突,并准备所需产物。

Anthropic 押注于:面向工作的用户会接受一定的对话摩擦,以换取更深入的执行能力。其示例聚焦于提案、沟通反馈和市场研究。

OpenAI 的侧重点反映了不同的产品信念。当用户可以自然打断、改变方向,并相信系统能理解口语细微差别时,语音系统会变得更有用。

因此,竞争并不只是 Claude 对阵 ChatGPT。至少在这一发布周期中,它是操作深度与对话流畅度之间的较量。

Anthropic 在一项任务跨越多个互联服务时具有优势。用户可能先讨论一个项目,查看相关 Slack 消息,确认会议安排,然后起草一封电子邮件。

其价值在于能在这些步骤之间保留上下文。助手可以将它们视为同一项请求的组成部分,而不是几条彼此割裂的命令。

这种工作流更接近人们实际处理知识工作的方式。一个日程安排问题往往取决于电子邮件、文档以及分散在团队应用中的信息。

语音让这种编排显得更直接。用户无需在多个窗口之间复制细节,只需用自然语言描述期望的结果。

不过,这一优势取决于连接器的可靠性。Claude 必须选择正确的工具、检索正确的信息,并呈现准确的拟议操作。

任何一个环节出错,都可能抹去节省下来的时间。更糟的是,如果助手过于自信地总结其工作,用户可能不会察觉错误。

对于主要想进行轻松聊天、语言练习或免手持提问的用户,ChatGPT 面临的即时风险可能更小。在这些场景中,工具访问的重要性较低。

Google 仍然是核心竞争对手。Gemini 在 Android 和 Google Workspace 中拥有天然的分发优势,许多相关任务原本就发生在这些环境中。

Apple 对操作系统层也拥有类似的控制力。Siri 可以访问原生应用和设备功能,不过这些操作的深度与一致性各不相同。

Anthropic 并不拥有移动操作系统或大型生产力套件。连接器是其弥合这一结构性差距的方式。

这条路径可以支持更广泛的服务范围。但它也会形成对外部 API、权限、配额和不断变化的平台政策的依赖。

原生助手可能提供更紧密的设备集成。基于连接器的助手可以在不同工具之间提供更大的灵活性,但每一项连接也增加了一个潜在故障点。

竞争结果将取决于已完成的任务,而不是功能清单。用户会注意到会议是否被正确调整,以及草稿是否捕捉到了相关上下文。

他们也会注意到延迟。一个耗时过长的多步骤操作在语音场景中可能感觉更糟,因为用户缺少传统界面所提供的视觉反馈。

这使响应设计变得重要。Claude 应说明自己正在检查哪项服务、找到了什么信息,以及哪项操作仍需批准。

无声的延迟会让人感觉像是失败。简洁的状态更新可以在助手使用多个工具时维持用户信任。

Anthropic 目前的定位似乎最适合已经通过文本使用 Claude 的知识工作者。他们可以将既有工作流延伸到语音,而无需更换助手。

该公司不需要赢得每一个语音类别。它需要让 Claude 成为那些结合推理、私密上下文与行动的任务的首选入口。

这比打造最像人类的助手是一个更狭窄的目标。对于企业用户而言,也许更容易通过具体结果来评估。

更强大的模型无法修复语音层

Anthropic 并未改变 Claude 底层的语音模型,因此,更好的推理能力不应被等同于更好的听辨或表达能力。

这是此次发布的核心局限。Claude 可能给出更强的回答,但对话仍通过同一套语音技术栈处理。

Anthropic 尚未公开详细说明这套完整技术栈。该术语包括语音识别、轮次检测、打断处理,以及将回答转换为音频的系统。

每个组件都会影响可用性。语音识别决定 Claude 听到什么,而轮次检测决定用户何时说完。

打断处理让用户能够停止或重新引导助手。文本转语音则决定最终回答被播放时听起来如何。

更强的语言模型位于这些阶段之间。它可以更有效地理解转写文本,但无法找回转写过程中丢失的每一个词。

它也无法保证自然的轮流对话。如果系统等待过久,或过早开始说话,再好的回答也无法消除这种摩擦。

TechCrunch 的报道特别指出,用户不应假定打断处理有所改善。OpenAI 最近的工作则更强调这一体验环节。

这可能造成预期与现实之间的不匹配。模型选择器暗示语音产品得到了升级,但大部分可听体验仍未改变。

因此,用户应分别测试两个维度。首先,应评估 Opus 或 Sonnet 是否比 Haiku 提供更有用的推理能力。

其次,应观察识别准确率、响应延迟、打断和纠正情况。这些品质决定了用户在移动或多任务处理时,这段会话是否真正可用。

长时间对话带来另一项挑战。更大的上下文可以帮助 Claude 记住早先的细节,但无关内容也可能随着时间积累。

助手必须判断哪些陈述仍然重要。早先随口提到的想法不应自动成为稍后日历操作的指令。

当口头探索转为执行时,确认变得至关重要。系统应区分头脑风暴与修改外部数据的请求。

例如,“也许我们应该调整周五的评审”并不等同于“调整周五的评审”。人类会通过语气和上下文理解这种差别。

语音助手可能会误读它。更安全的行为是在采取影响他人的操作前请求确认。

Anthropic 表示,所有 Google Workspace 操作都需要明确批准。这种控制可以降低风险,但其有效性取决于 Claude 是否清晰展示拟议变更。

模糊的批准请求几乎无法提供保护。界面应展示事件、原定时间、新时间、参会者以及任何取消影响。

当 Claude 在一次对话中使用多项服务时,隐私也会变得更加显眼。助手可能结合日历、电子邮件和聊天上下文来回答单一请求。

这种组合可能很有用,但也会提高最终对话的敏感性。一段摘要可能泄露原本因某种原因而分散在不同应用中的信息。

Anthropic 表示,其连接器会反映现有权限。Claude 无法检索用户本来无权访问的信息。

权限继承并不能解决所有治理问题。员工可能合法拥有某些信息的访问权限,但这些信息未必应被汇总到另一个渠道中。

组织需要为连接器使用、数据保留和批准制定明确规则。管理员还应决定用户可以将哪些服务连接到 Claude。

Beta 标签在这里很重要。它表明 Anthropic 评估产品期间,行为、可用性和可靠性都可能发生变化。

免费用户获得的是功能较窄的版本。根据公告,他们仅限使用 Haiku 和一个已连接的应用。

这项限制提供了有用的试用体验,但并不能代表完整产品。仅测试 Haiku 可能低估此次更新所宣传的推理优势。

多语言支持带来了另一项限定。Claude 语音支持 Anthropic 列出的英语、法语、德语、印地语、印尼语、意大利语、日语、韩语、葡萄牙语和西班牙语变体。

用户必须手动选择语言。本次发布似乎并未重点解决语言之间的自动切换。

对于有计划的会话,手动选择可能可以接受。但对于自然地交替使用多种语言,或在工作中使用外语名称的多语言用户而言,这会变得不那么方便。

最稳妥的解读是,Claude 语音获得了更强的推理和行动层。它并未迎来一次完整的对话式重构。

这仍是有意义的进展。只是它解决的是与“语音升级”这一表述可能暗示的不同系统部分。

三个信号将决定 Claude Voice 是否奏效

接下来的考验在于,Claude 能否足够可靠地完成真实任务,以抵消其仍存在的对话摩擦。

第一个信号是连接器执行的准确性。用户需要观察 Claude 是否能持续选择正确服务、检索当前上下文,并准备预期的操作。

日历变更提供了清晰的基准。请求要么定位到正确事件、尊重参会者的可用时间并保留必要细节,要么没有做到。

电子邮件草稿是较为柔性的测试,因为写作质量带有主观性。但当 Claude 识别收件人、日期、承诺事项和引用文档时,准确性仍然重要。

Anthropic 应公布更清晰的信息,包括操作成功率、常见失败情况和取消批准的比例。这些指标比笼统的参与度数据更能说明问题。

较高的取消率可能表明 Claude 误解了请求,或呈现了不合适的操作。低取消率只有在用户认真审查每一项提议时才有意义。

第二个信号是 Anthropic 是否改进语音技术栈本身。更好的打断处理将使较长的讨论更容易,并降低纠正回答的成本。

自动语言检测也会增强多语言使用体验。它可以让用户自然切换语言,而无需在每次会话前调整设置。

延迟是另一项重要指标。即使调用多个已连接工具,Sonnet 和 Opus 也必须足够快地响应,才能适用于语音交互。

用户在复杂工作中可以容忍比轻松聊天更长的延迟。不过,产品应在较长等待期间说明自己正在做什么。

未来的语音更新若能将行动深度与对话流畅性结合,将强化 Anthropic 的战略。若持续停滞,OpenAI 将有空间捍卫其优势。

第三个信号是竞争性的工具访问能力。OpenAI、Google 和 Apple 不会放任任务执行领域毫无竞争。

如果 ChatGPT 在其语音界面中加入广泛的工具使用能力,Claude 当前的差异化将会缩小。OpenAI 可以将更流畅的对话与可比的外部操作结合起来。

Google 可以加深 Gemini 对 Workspace 和 Android 的访问。Apple 可以扩展其设备平台上的原生操作能力。

因此,Anthropic 必须在不牺牲可靠性的情况下扩大连接器覆盖范围。每项新服务只有在其权限、操作和失败状态仍然可理解时才有价值。

企业采用将在这三个信号中提供额外线索。组织将测试批准机制和管理控制是否满足其安全要求。

员工可能会比雇主更早接受这项功能。说出一个请求很容易,而批准访问电子邮件、日历和内部聊天系统则需要更严格的审查。

这一差距可能塑造采用路径。Claude 语音可能首先在治理需求较简单的个人用户和小型团队中普及。

大型组织会期待可审计性。他们需要知道 Claude 访问了哪些数据、提出了哪些操作,以及每项变更由谁批准。

这次 anthropic techcrunch 更新为 Claude 提供了一条从对话走向执行的可信路径。但它并未证明这条路径始终安全、快速或准确。

用户可以用低风险任务来测试这一主张。让 Claude 查找一个日历空档、准备一份草稿,或创建一份私密规划文档。

然后检查每一个步骤。在批准前核对源上下文、拟议操作、目标位置和保留的数据。

对于更深入的知识工作,请将重要笔记和源材料保存在可搜索的系统中。结构化的个人知识库可以让任何助手都更容易得到验证。

最有价值的问题,不是 Claude 听起来是否像人类,而是与 Claude 交谈能否减少工作量,同时不增加新的审核负担。

不妨连续几天尝试一项重复性工作流程,并记录每一次修正。如果 Claude 节省的精力超过验证结果所消耗的精力,那么 Anthropic 的策略就正在奏效。

如果这款助手反复听错细节、选错上下文,或需要大量后续清理,那么更强大的模型并没有解决界面问题。未来几个月应能显示,哪一种结果会成为常态。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page