top of page

ChatGPT 移动应用获得基于语音的智能体功能,但工作仍需要屏幕

1天前
讀畢需時 13 分鐘

ChatGPT 移动应用首次获得基于语音的智能体功能,将 OpenAI 的 Work 环境从键入提示词扩展到手机上的语音指令。Plus 和 Pro 用户可以要求 ChatGPT 起草文档、准备演示文稿、总结 Slack 对话,或操作其云端浏览器。这一变化让语音从对话界面变成了多步骤工作的起点。

这一转变也暴露出一个基本矛盾。语音让任务更容易启动,但完成任务仍需要文本、视觉审阅和明确批准。用户可以在步行或通勤时描述预期结果,但仍必须在屏幕上检查生成的文档、核实敏感细节,并批准具有重要影响的操作。

OpenAI 做出了与 Anthropic 不同的界面选择。Anthropic 已将其 Cowork 和 Chat 体验结合,而 OpenAI 仍将普通对话与 Work 环境分开。因此,竞争的核心不止于语音质量,而在于哪种界面能让 AI 主导的工作在不同设备间变得可理解、可迁移且安全。

ChatGPT 移动应用在 Work 中获得基于语音的智能体功能

重要的变化并非 ChatGPT 能听到请求,而是口头请求如今可以启动带有工具的任务。

据最初的移动端 Work 报道称,OpenAI 于 9 月 23 日宣布扩展移动端功能。此次推出让符合条件的用户能够在手机的 Work 标签页中使用语音。Work 是 ChatGPT 面向任务的环境,用于创建交付成果,并协调超出标准回答范围的操作。

用户可以要求 Work 创建文档、演示文稿或电子表格。系统还可以与已连接的应用交互或使用浏览器,具体取决于账户权限。即使语音对话结束后,仍处于活动状态的任务也可以通过文本继续进行。

最后一点很重要。手机成为工作的入口,而不是工作必须完成的唯一地点。用户可以在通勤途中描述一份演示文稿,稍后查看其书面进度,并从桌面设备恢复对话。

该界面支持在语音回复之外呈现更丰富的文本。用户可以在语音和键入之间切换,而无需放弃当前对话。这种安排承认,语音适合表达意图,而文本更适合准确的名称、链接、计算和编辑。

OpenAI 的Work 说明解释称,移动端用户可先选择 Work,再启用 Voice 控件。随后,Work 可以使用该账户已具备的工具。这些工具可能包括已连接应用、文档创建、演示文稿、电子表格和浏览器访问。

该功能并未授予不受限制的权限。现有的应用权限、工作区规则和网络控制仍然适用。智能体不能仅仅因为请求通过语音发出,就合法获得对公司服务的访问权限。

免费和 Go 用户获得的体验版本较为有限。他们可以通过符合条件的插件和已连接应用使用语音,而更完整的 Work 功能仍与支持的付费访问权限绑定。功能可用性还可能取决于地区、应用版本、账户设置和组织政策。

此次发布延续了此前的桌面端方向。OpenAI 推出了作为对话模型的 GPT-Live,并将语音连接到面向任务的桌面体验。移动端发布将这种交互模式带到 iOS 和 Android 上,在这些平台上,说话通常比输入长提示词更自然。

在一个普通场景中,实际差异会变得清晰。一位刚离开会议的销售经理可以要求 ChatGPT 总结已连接的笔记,并准备一封后续邮件。在经理回到笔记本电脑前,系统就可以完成草稿。

此前,这一工作流需要多个刻意操作。用户必须打开应用、找到相关材料、构思提示词,并停留在界面附近。语音降低了开始工作的门槛,但并未免除用户检查结果的责任。

语音正在成为 AI 工作的控制层

OpenAI 正在将语音定位为智能体的命令通道,而不只是向聊天机器人提问的另一种方式。

传统语音助手通常处理简短且边界明确的指令。它们可以设置计时器、获取事实、播放媒体或发送口述消息。智能体系统则接受预期结果,并协调多个步骤、工具或信息来源来完成它。

ChatGPT 移动应用获得基于语音的智能体功能之际,AI 公司正在竞争完整工作流的主导权。一个有用的助手不再只需要给出令人信服的回答;它还必须找到相关信息,将其转化为成品,并在不同设备间保留任务状态。

语音降低了表达未成形想法的成本。用户可以自然说话,在句子中途修改请求,并通过后续问题补充背景。GPT-Live 专为这种实时交流而设计,包括打断和对话轮次切换。

OpenAI 的语音文档称,Live 是一种将语音与文本、图像、网络搜索、记忆、插件和已连接应用结合的体验。可用功能仍因套餐和工作区而异。Live 也缺少一些旧版语音模式具备的功能,包括视频和屏幕共享。

语音与持久文本的结合,有助于解决口语界面的一项结构性弱点。音频即时,但难以快速浏览。用户无法通过再次听完每个词,高效比较五项推荐或核实一长串列表。

更丰富的书面输出为对话提供了可审阅的记录。用户可以检查系统的推理、输出和确认请求。当专有名词或技术术语被错误转写时,他们也可以通过输入进行修正。

这种混合界面对无障碍使用和情境便利性十分重要。用户可能在搬运设备、往返会议之间,或处理另一项任务时开始工作。语音可提供快速访问,无需长时间坐在键盘前。

不过,更快的输入并不自动意味着更快的完成速度。智能体仍可能需要搜索来源、打开网站、等待已连接应用响应,或请求澄清。节省的时间主要来自减少启动和协调工作的成本。

移动端连续性可能成为更持久的优势。ChatGPT 能在用户从手机切换到桌面设备时保留对话。这种连续性减少了重新建立背景、转移笔记或再次解释任务的需要。

它也提高了将工作保留在同一系统内的价值。一个在多台设备上启动任务、保存背景并审阅结果的用户,会积累实际的切换成本。竞争助手若要取代这一工作流,必须提供的不只是一个能力出色的模型。

这正是个人信息管理变得相关的地方。语音可以快速捕捉指令,但生成的文档仍需要可用的背景和组织方式。可靠的个人知识系统可帮助用户保存来源,并在对话结束后重新审视决策。

因此,这项功能代表的是一种界面策略,而不仅是模型更新。OpenAI 希望 ChatGPT 能在意图形成的那一刻随时可用。随后,Work 会将这一意图转化为可在其他地方审阅的成品。

OpenAI 和 Anthropic 正在押注不同的界面

核心竞争在于分离式工作区与统一助手之间,而不仅仅是两个语音模型之间。

OpenAI 目前将 Chat 和 Work 分开。Chat 支持普通对话、头脑风暴和提问。Work 则为使用工具、创建成品或持续超过一次回复的任务提供了更具目的性的环境。

这种分离可以让权限更容易理解。进入 Work 表明 ChatGPT 可能会使用已连接资源或执行多项操作。专用界面也可帮助组织对普通聊天和智能体工作应用不同权限。

代价则是界面碎片化。用户必须理解所需能力位于哪种模式中。一个开始时只是提问的请求可能演变为任务,迫使用户识别何时应使用不同界面。

Anthropic 则采取了相反方向,使其 Cowork 和 Chat 体验更加接近。这种做法减少了用户必须导航的模式数量,但也让界面承担更多责任,须清楚传达对话何时转变为行动。

两种设计都不会自动胜出。统一界面在用户需要检查权限、监控多个任务或区分讨论与执行时,会显得不那么简单。分离界面在用户反复打开错误模式时,则会显得不那么安全。

移动端语音使这一选择更加突出。由于用户关注的是对话而非菜单,语音交互会隐藏界面结构。助手必须通过提示、文本和确认屏幕清晰传达自身状态。

OpenAI 的架构将语音视为选定环境内的一种控制方式。用户先进入 Work,再开始 Live 对话。系统继承与该环境相关的工具和限制。

这一设计可能使企业管理员受益。OpenAI 表示,工作区所有者可以分别管理云端 Work、本地 Work 和 Codex 的访问权限。浏览器和网络权限仍是独立控制项。

这种安排也带来了学习负担。用户必须知道普通 Chat 中的语音与 Work 中的语音不同。他们还必须理解,为何一个对话可以访问云端浏览器,而另一个不能。

Anthropic 的统一方向通过提供更简单的心智模型施加压力。如果用户能在不切换空间的情况下从讨论转向行动,OpenAI 就必须证明其分离设计增加了有意义的控制。否则,Work 可能会变成用户容忍而非重视的组织层。

Google 则通过集成生产力应用代表了另一条竞争路径。嵌入电子邮件、文档、日历和存储服务的助手,可以在相关信息原本所在的位置执行操作。相比之下,OpenAI 更依赖已连接应用、插件及其自身的工作环境。

因此,竞争问题不在于哪个助手能生成文档。多个系统都可以做到。问题在于,哪一个能为用户提供从口头意图到经过审阅、获得授权并可复用输出的清晰路径。

OpenAI 的优势在于 ChatGPT 广泛的消费者认知度和跨设备存在感。其挑战在于将这种熟悉感转化为可信赖的执行能力。语音让进入 Work 更容易,但这种分离式设计仍是一项明确的产品押注。

口头指令并不能取代视觉批准

手机可以启动智能体任务,但具有重要影响的工作仍会将用户带回屏幕。

OpenAI 要求在网页或移动端执行需要确认的操作时,必须进行屏幕上的批准。语音批准不受支持。这一限制或许看起来不够方便,但它在对话与授权之间建立了一道重要边界。

语音系统可能会听错姓名、金额、日期、地址,或否定表达。背景噪音还可能进一步扭曲请求。当代理能够操作浏览器或使用已连接的业务数据时,一句被错误转录的话会带来更严重的后果。

视觉确认让用户有机会检查系统打算执行的操作。它也减少了这样的歧义:一句随意的口头回应是否真的构成授权。对于敏感操作而言,这种摩擦正是一项安全特性。

这一限制改变了人们使用基于语音的代理任务的方式。低风险的起草、总结和研究是自然的起点。发送外部沟通内容、编辑重要记录或提交表单,则值得进行更仔细的审查。

OpenAI 的云端浏览器指南称,Work 可以读取页面、点击控件、填写信息,并在受支持的网站上执行步骤。当需要用户输入、登录或确认时,它也可以暂停。

部分网站可能会阻止自动化浏览器流量。另一些网站则可能出现身份验证挑战或界面变更,从而中断任务。用户可能需要通过链接接管操作,并手动完成部分流程。

这意味着,诸如“更新账户详情”这样的语音请求并不保证一定能完成。代理必须正确识别目标位置、理解相关字段、在服务中完成导航,并在自己缺乏权限时加以识别。

准确性仍是另一个悬而未决的问题。OpenAI 尚未发布针对移动端的公开基准,说明由语音发起的 Work 任务在嘈杂环境、不同口音、专业术语和复杂网站中的完成可靠性。

缺少这些基准并不意味着该功能表现不佳。它意味着用户应区分产品可用性与经过验证的任务可靠性。一场精致的演示无法证明其在数千种真实工作流程中的表现。

在手机上进行监控也更加困难。长时间运行的工作可能涉及多个中间决策或来源核查。紧凑的屏幕提供的空间更少,不利于比较输出、检查浏览器状态,以及追溯代理如何得出结果。

最佳移动工作流程很可能会将启动与审查分开。用户可以通过语音描述目标,让任务继续推进,并在使用交付成果前进行检查。这种模式将代理视为产出草稿的协作者,而非无人监督的代表。

组织还面临额外的治理问题。员工可能连接包含机密对话、客户细节或内部文档的服务。管理员必须决定哪些角色可以获得 Work 访问权限,以及哪些已连接应用应继续可用。

语音不会改变这些底层权限。它只是让工具使用显得更随意,从而可能掩盖请求的重要性。说“总结客户频道”比有意识地选择数据源并提交书面指令,感觉上更轻松。

因此,用户应让自主程度与后果相匹配。创建一份私密大纲的风险有限;发送法律通知、更改财务信息或发布公开内容,则需要人工检查。

一种实用的工作流程可以用语音捕捉目标,用文本细化约束,并通过屏幕批准最终操作。这种组合不如完全自主的助手那样“神奇”,却更符合可追责的工作方式。

基于语音的代理任务如何改变移动办公

最强的使用场景始于模糊的意图,终于用户可以检查的成果。

设想一位产品经理刚结束客户访谈。经理可以要求 ChatGPT 总结已连接的笔记、识别反复出现的异议,并创建一份简报文档。语音指令能在细节淡忘前捕捉任务。

随后,经理可以在笔记本电脑上审阅书面输出。这一步依然至关重要,因为系统可能错误归类投诉、将两位发言者混为一谈,或遗漏重要背景。语音加快了交接,但并未取代判断。

顾问可以要求 Work 根据已批准的材料准备演示文稿。请求可以指定受众、结构、语气和必需章节。顾问在不同预约之间奔波时,ChatGPT 就可以开始组装幻灯片。

开发者在离开办公桌时,可以描述一个小型网站或原型。OpenAI 的移动端培训材料展示了 Work 创建文档、幻灯片、网站以及由浏览器驱动的任务。开发者仍需检查生成的代码并测试其行为。

销售代表可以根据已连接的会议摘要请求一封邮件草稿。代理可能会整理要点并建议下一步。代表在发送任何内容前,必须核实客户姓名、承诺事项和截止日期。

这些案例具有共同模式。语音负责初始描述,因为它快速且灵活。系统生成可编辑的成果,用户则在审阅中运用领域知识。

语音也有助于迭代指引。用户可以要求更短的引言、打断不合适的方法,或补充缺失的约束。自然对话能让修订不再像是在构建一条完美提示词。

然而,对话的轻松感也可能鼓励定义不足的请求。“让这份演示文稿更好”几乎没有说明受众、证据或希望促成的行动。代理可能会产出精致的内容,却解决了错误的问题。

用户可以通过说明预期结果、来源边界、受众和批准要求来降低这种风险。这些元素能为 Work 提供更清晰的操作框架,而无需撰写冗长的技术提示词。

云端浏览器扩展了可能的任务集合,但也引入了外部依赖。网站会变化、访问权限会过期,自动化流量也可能受到限制。可靠的工作流程需要在代理无法完成浏览器步骤时提供替代方案。

已连接的应用也带来类似权衡。它们提供了通用模型所缺乏的上下文,但每一项连接都会扩大系统可获得的信息范围。用户和管理员必须理解所授予的权限范围。

跨设备续接能让这些工作流程更加实用。手机非常适合捕捉紧迫性和上下文;桌面设备则更适合审阅细节、比较来源和编辑完成的交付成果。

这种分工可能会成为移动代理的决定性特征。手机并不取代工作站,而是让工作能够在工作站可用之前就开始。

这一区别解释了为何这次发布的重要性不止于语音识别。ChatGPT 正尝试让一项任务跨越不同地点、界面和注意力时段持续存在。成功与否取决于用户返回时,任务状态是否依然易于理解。

对知识工作者而言,益处不只是免手操作,而是缩短从发现需求到开始有效工作的距离。风险在于,便利性可能会在可靠性尚未确立前就促使人们信任系统。

三个信号将表明移动办公能否兑现承诺

采用情况将取决于可靠的交接、易于理解的批准流程和竞争对手的反应,而不只是新鲜感。

第一个信号是任务在移动端与桌面端之间转移的一致性。用户应能通过语音开始任务,看到准确的书面记录,并在无需重新构建上下文的情况下继续。若这一环节反复失败,将削弱跨设备模式的核心论点。

关注 OpenAI 是否改进任务历史、进度可见性和通知。长时间运行的工作需要清晰的状态信息,尤其是在用户离开语音对话之后。更好的连续性将表明 Work 正成为一个持久的工作环境,而不只是另一种聊天模式。

第二个信号是批准和接管流程的表现。移动用户需要了解代理计划执行什么操作、将访问哪项服务,以及会提交哪些信息。确认界面必须保持可读性,不能将关键操作掩埋其中。

OpenAI 还应让失败原因清晰可辨。用户需要知道任务停止是因为权限缺失、网站无法访问、指令含糊,还是模型错误。笼统的失败提示几乎无济于事,还会鼓励用户反复进行高风险尝试。

第三个信号是竞争对手如何回应这一界面选择。Anthropic 可以强化其统一的 Cowork 和 Chat 方案,而生产力平台则可以在现有应用中深化助手功能。每一条路线都会以不同方式挑战 OpenAI 独立的 Work 标签页。

如果用户偏好单一对话界面,OpenAI 可能会面临缩短 Chat 与 Work 距离的压力。如果组织重视明确边界,独立环境则可能成为优势。采用数据和产品变化将揭示哪种考量更为重要。

ChatGPT 移动应用在行业尚未就手机上应具备多少自主性达成共识之前,就推出了基于语音的代理功能。这次发布通过展示复杂工作可以从语音开始,回答了一个问题;但可靠性、监督和界面清晰度仍未有定论。

对用户而言,合理的测试应从可逆工作开始。让 ChatGPT 生成一份私密草稿、总结你能够核实的材料,或将想法整理成文档。然后检查任务从语音转为文本后,内容是否仍然准确。

留意专有名词、来源选择、隐含承诺和所请求的操作。检查系统是否清晰识别每一项权限和确认。这些细节比对话听起来多么自然更重要。

语音 AI 的下一阶段不会以助手说话是否令人信服来评判,而会以口头意图能否转化为可靠、可审阅的工作来评判。今天,你会信任手机开始哪项任务?又有哪些任务仍会坚持亲自检查?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page