Baidu DuMate 凭借跨设备 Agent 挑战进入科技新闻视野
Baidu DuMate 新增了跨设备任务交接和内置浏览器,为本周的科技新闻带来了一个具体的执行故事。据称,当工作在手机和电脑之间切换时,这一 Agent 能够保留上下文和进度。Baidu 还表示,智能路由已将平均任务耗时缩短 20%。
这一组合的重要性超过了又一次聊天机器人升级。DuMate 正试图将一台设备上的提示词转化为跨多个界面完成的工作。用户可以在手机上开始研究,在电脑上继续,并让桌面 Agent 打开网站或下载文件。
最直接的比较对象是 ChatGPT agent,它同样通过虚拟浏览器执行在线任务,并覆盖网页、移动端和桌面应用。战略上的差异在于连续性。Baidu 将设备交接本身作为 Agent 的一部分来推广,而非把每个客户端视为通往同一段对话的另一扇窗口。
Baidu DuMate 现可在设备间携带进行中的任务
此次更新的核心是持久化执行,而非简单同步对话。
Baidu 于 2026 年 7 月 10 日在成都举办的一场聚焦 DuMate 的 AI Day 上展示了这些升级。该活动结合了产品发布和公开市集,访客可以试用 AI 工具。一则本地活动报道称,此次发布包含智能路由、共享记忆、浏览器控制和演示文稿生成。
DuMate 的中文名称为“搭子”,于 3 月作为 Baidu 的通用生产力 Agent 推出。Baidu 在其季度业绩报告中将其描述为一个可跨应用和文件自主执行多步骤工作流的系统。
最新版本将这一前提扩展到电脑和手机之间。共享记忆会保留相关任务上下文,而同步进度会告知第二台设备执行在何处停止。这比同步聊天记录要求更高,因为一个进行中的任务还包含计划、中间输出、已打开的资源和未完成的操作。
以一项市场研究任务为例。用户可以在通勤时要求 DuMate 在手机上比较多家供应商。之后,桌面客户端可以继续同一任务,打开多个页面、收集文档并准备演示文稿,无需重新构建提示词。
桌面应用的内置浏览器是这一流程的关键。它为 Agent 提供了受控环境,使其能够打开多个页面,执行研究或下载操作。浏览器访问能力让该系统从文本生成器转变为可以操控人们已在使用的界面的软件。
Baidu 还表示,移动客户端可以远程指挥基于云端的执行。手机不必在本地完成每一项操作;它可以成为在云环境中持续进行工作的控制界面,从而减少对保持桌面会话开启的依赖。
这种架构为跨设备 AI 提供了更实用的定义。Agent 不只是同时可在两台设备上使用;它还负责维护足够的状态,让同一项工作能在两者之间持续推进。
这一差别很容易被忽略,因为即时通信应用多年来一直在同步对话。不过,聊天记录只记录说过什么;执行状态还必须追踪尝试过什么、哪些成功、哪些失败,以及哪些操作仍需批准。
因此,连续性既是工程问题,也是界面功能。Agent 需要持久的任务记录、共享权限、可恢复的检查点,以及规定哪台设备控制下一步操作的规则。每个组件都可能决定恢复的任务是感觉连续,还是开始出现不可预测的行为。
因此,此次发布让 Baidu 提出了更鲜明的产品论点。DuMate 不再仅被描述为能处理文件和应用的助手;它正被定位为一个其运行上下文会随用户而动的持久化工作者。
为何这则科技新闻会给浏览器 Agent 带来压力
Baidu 正迫使浏览器 Agent 厂商同时在连续性、成本和任务完成度上展开竞争。
浏览器使用已成为对话式 AI 转向行动的一条常见路径。Agent 无需等待每项服务都开放应用程序编程接口,而是可以检查页面并操作其可见控件。这种方式拓宽了访问范围,但也继承了网页的不一致性和安全风险。
OpenAI 在 2025 年 1 月通过 Operator 确立了一个早期参照点。其计算机使用模型会解读截图,并通过点击、滚动和输入来控制浏览器。Operator 后来被整合进 ChatGPT agent,如今后者结合了浏览、研究、文件处理和已连接服务。
OpenAI 表示,其虚拟浏览器允许用户在任务执行期间中断或接管操作。对于涉及凭据、支付和人机验证挑战的敏感步骤,该 Agent 也会请求人工介入。这些控制措施承认,浏览器自主操作仍需要边界。
Google 通过 Project Mariner 采取了类似方向。Google 将 Mariner 描述为一个可与网页交互并完成任务的实验性计算机使用 Agent。其Agent 路线图也将这项工作与 Gemini 更广泛的 Agent mode 联系起来。
Anthropic 则通过向开发者开放计算机使用能力采取了另一条路线。Claude 可以检查截图,并在受控环境中发出鼠标或键盘操作指令。这一模式给予软件构建者更多自由,但他们必须自行构建周边界面、权限和安全控制。
DuMate 以集成式产品而非独立模型能力进入这一领域。Baidu 控制着应用、云基础设施、搜索服务、基础模型以及大部分路由层。这种垂直技术栈有助于协调任务交接和资源分配。
对于宣传长时间运行任务的消费级和职场 Agent 而言,压力最为明显。启动一项工作已不再足够。用户越来越期待 Agent 能经受中断、跨设备移动、在出错后恢复,并说明当前状态。
跨设备连续性也改变了竞争单位。厂商此前比较模型质量、回答速度、工具支持和基准分数。DuMate 新增了任务可移植性这一维度:用户能否离开一台设备,而不放弃 Agent 的工作状态?
这个问题具有商业分量。许多知识工作者在手机上发现任务,却在电脑上完成它们。消息、会议请求、文档和研究提示会在一天中不断到来。能衔接这些时刻的 Agent,可减少之后重新构建上下文的摩擦。
不过,连续性本身并不保证实用性。一个被完美保留的糟糕计划,仍然是糟糕计划。Agent 必须延续经过验证的进展,同时不能将用户锁定在早先的错误或过时假设中。
竞争对手可以通过多种方式应对。他们可以深化现有应用之间的同步、改进云端执行,或提供更清晰的任务历史。他们也可以强调能够避免操控视觉界面模糊性的集成方式。
因此,这并不是一场简单的 Baidu 对 OpenAI 的竞争。主要对手是碎片化的 Agent 模式,即每台设备或每个会话都像一次全新开始。DuMate 的更新主张,持久状态应成为核心产品层。
这一论点会引起那些已在构建可搜索知识库的团队共鸣。研究连续性取决于证据和决策都能被保留,尤其是在工作跨越工具、文件和多个会话时。
真正的机制是路由、记忆与浏览器控制
DuMate 的承诺取决于协调三个通常被分别评估的系统。
第一个系统是共享记忆。在此语境中,记忆指的是 Agent 可在后续执行中检索的已存储任务信息。它可以包括原始目标、用户偏好、选定来源、中间文件以及已完成步骤的记录。
有用的记忆必须具备选择性。将所有过往消息和页面都重新送入模型,会增加处理成本并引入无关信息。系统需要为下一次决策检索最小但有用的一组细节。
第二个系统是智能路由。路由器会检查请求,并选择适合该工作的执行模式、模型或工具链。简单改写不应消耗与涉及多个网站和演示文稿的长篇研究任务相同的资源。
Baidu 表示,其升级后的路由器将平均任务时长缩短了 20%,并将 token 利用率提高了 25%。Token 是模型在读取和生成内容时处理的单位。更高的利用率通常意味着系统能以相同的模型输入和输出完成更多有用工作。
这些数字是公司宣称,并非独立基准测试结果。Baidu 尚未公开足够的方法论细节,无法将其与其他 Agent 直接比较。任务组合、基线版本、成功标准和重试策略都会影响结果。
第三个系统是浏览器控制。内置浏览器为 DuMate 提供了打开页面、在来源之间导航和下载材料的环境。据称,它可以作为一项任务的一部分执行多项网页操作,而不是返回需要用户自行遵循的指示。
这些系统相互强化。记忆告诉浏览器任务需要什么;浏览器产生观察结果和文件;路由器决定由哪个模型或模式来解读这些结果并规划下一步行动。
任何薄弱环节仍可能使整个工作流脱轨。如果记忆检索到了错误指令,浏览器可能访问无关页面。如果路由为困难任务选择了轻量模式,Agent 可能产生肤浅的计划。如果浏览器控制失败,更强的推理能力也无法完成操作。
Baidu 报告称,简单任务的完成率为 100%,复杂任务的高交付率为 94%。该公司还表示,部分工作负载最多可少消耗 75% 的额度。这些说法听起来分量十足,但在买家能够将其与外部评估比较之前,这些类别仍需要更清晰的定义。
“完成”可能意味着 Agent 到达终止状态、产出可接受的成果,或满足每一项要求。“高交付”则更缺乏标准化定义。它可能反映人工评分、自动检查或内部质量门槛。
这一区别很重要,因为 Agent 评估对任务设计异常敏感。浏览器 Agent 可能在稳定网站上表现良好,却会在页面变化、出现弹窗,或下载需要陌生确认步骤时遇到困难。
OpenAI 公布的计算机使用结果说明了受控基准测试与通用可靠性之间的差距。该模型发布时在 OSWorld 上取得了 38.1%,而人类结果据报道为 72.4%。同一模型在范围更窄的浏览器基准测试中表现更好,显示出环境复杂度如何改变结果。
因此,DuMate 最有力的主张在于架构。Baidu 正在一个面向用户的工作流中整合路由、持久上下文和浏览器执行能力。这些百分比提供了佐证,但尚不足以证明其优于竞争对手的智能体。
对用户而言,实际检验很直接:DuMate 能否在无需反复解释的情况下恢复真实任务、使用合适的资源,并交付正确的成果?这一结果比任何单个组件是否领先某项基准测试更重要。
持久型智能体同样受益于有序的源材料。一个个人知识系统能为智能体提供可稳定检索的信息,而不是迫使每项任务都从开放网络探索开始。
持久型智能体也带来持久风险
跨设备跟随用户的智能体,既可能像保留有用上下文那样保留错误与暴露风险。
浏览器智能体处于一个对抗性信息环境中。网页可能包含面向人类访客、自动化系统或 AI 模型的指令。智能体必须区分有用内容与意在重定向其行为的文本。
提示注入是最明显的例子。攻击者可以在页面中放置隐藏或具有误导性的指令,要求智能体忽略原始任务。如果智能体服从,这可能导致信息泄露、工作流被更改,或导航到用户从未要求访问的地点。
Anthropic 将此描述为计算机使用系统的核心风险。其计算机使用研究指出,连接互联网的模型可能会在截图或网页中遇到恶意指令。该公司仍在持续开发分类器及其他防御机制。
跨设备运行扩大了信任边界的数量。一个任务可能在个人手机上开始,在云端浏览器中继续,并在工作电脑上完成。每个环境都可能拥有不同的账户、权限、存储文件和安全策略。
Baidu 表示,其企业产品会记录 AI 调用、数据访问和关键操作,以便审计。这对受管理部署而言很重要,但消费者用户同样需要易于理解的控制机制。他们应当清楚任务状态存储在哪个环境中,以及哪些数据会随之转移到另一台设备。
共享记忆带来另一个问题:持久性可能比相关性延续得更久。某项任务中保存的偏好,之后可能变得不再合适。用于研究的文档可能包含机密细节,不应被纳入未来的任务。
因此,良好的记忆系统需要具备删除、修正、过期和溯源控制。溯源记录信息的来源。没有它,用户可能难以判断智能体是在依据当前指令、旧对话,还是执行过程中遇到的网页行动。
远程移动控制引出了授权问题。产品必须可靠识别哪些用户可以恢复任务,以及哪些操作需要重新确认。被盗或无人看管的手机不应成为敏感浏览器会话的远程控制器。
云端执行带来了并行的取舍。它使任务能够在本地电脑不可用时继续运行,但也将工作转移至用户无法直接检查的基础设施中。企业买家会希望了解加密、留存、区域处理和管理员控制等细节。
嵌入式浏览器同样需要清晰的人工介入点。购买、发布、发送消息、删除文件和提交表单都可能产生难以逆转的后果。最安全的智能体未必是那个不经中断便完成每一步的智能体。
Baidu 公布的性能主张并未回答这些治理问题。更快的路由器可以缩短任务时间,却未必提升安全性。如果智能体过于激进地推进具有后果的操作,更高的完成率甚至可能增加风险。
还有一种更普通的产品风险:不可靠的交接。任务可能看似已经同步,却在无声中丢失文件引用、登录状态或中间决策。第二台设备可能会从不完整的工作表示中继续执行。
用户需要可见的检查点来发现这类失败。一次良好的交接应总结目标、已完成步骤、未解决问题、活跃来源和后续操作。当新环境改变了智能体可访问的内容时,系统应请求确认。
独立测试将在这里发挥重要作用。Baidu 的指标由该公司自行展示,现有公开材料并未说明是否经过第三方审计。这些数字应被视为早期产品指标,而非定论性的衡量结果。
这并不意味着此次更新不重要。它界定了 DuMate 现在必须达到的标准。Baidu 已从承诺多步骤自动化,转向承诺持续、跨设备自动化,这为价值与失败都创造了更大的作用面。
科技新闻读者接下来应关注什么
三个信号将表明 DuMate 的跨设备设计会成为持久优势,还是仅停留在精致的演示。
第一个信号是真实世界中的任务保留能力。在接下来的数次产品更新中,用户应检验 DuMate 是否能在切换设备后可靠保留目标、来源、文件和审批记录。反复提示或状态丢失会削弱 Baidu 的连续性主张。
成功的保留能力将强化这样一种观点:任务状态应成为消费级智能体的标准层。它也会迫使竞争对手公开更清晰的交接记录,而不是只同步对话历史。
第二个信号是透明评估。Baidu 应公布简单任务完成率、复杂任务高质量交付、token 利用率和积分减少量的定义。它还应说明任务数量、基线、重试、人类审查和失败处理方式。
详细的方法论会让所报告的 100% 和 94% 结果更有意义。缺乏可比证据将使买家无法区分更好的执行能力与有利的任务选择。
第三个信号是围绕浏览器和云端操作的安全模型。应关注权限控制、确认策略、记忆管理、审计功能,以及针对恶意网页指令的防御机制。这些细节将决定企业能否将跨设备智能体部署到受控试点之外。
竞争对手的回应将提供另一项间接衡量。OpenAI、Google 和 Anthropic 已支持浏览器或计算机交互。如果它们让活跃任务的交接更可见,Baidu 就发现了真正的产品缺口,即使竞争对手最终会填补它。
对开发者而言,启示在于智能体层正在超越单个模型。路由、记忆、状态恢复、权限和界面控制日益决定用户体验。更好的推理能力固然有帮助,但编排决定了这种推理能否经受长工作流的考验。
企业买家不应在没有共同定义的情况下比较醒目的完成率。他们应测试具有代表性的任务,记录人工介入频率,衡量修正成本,并审查系统如何处理过时或冲突的指令。
知识工作者可以采用更简单的测试:在手机上启动研究任务,在电脑上恢复,检查保留下来的证据,并验证最终成果。这一工作流可以在一次连续操作中检验整个 DuMate 命题。
Baidu 已将跨设备连续性变成科技新闻中一项具体的竞争主张,而不再只是背景便利。现在,它必须证明这种连续性保留的是判断、权限和证据,而不只是进度指示器。
下一个问题属于用户和评估者:当 AI 智能体跨设备跟随工作时,它究竟能减少重建工作并交付值得信赖的结果,还是只会将未解决的错误带得更远?答案将决定持久型智能体会成为日常基础设施,还是又一项在人们第一次付出高昂代价后便会关闭的功能。



