top of page

Meta Muse AI Assistant 能用,但其个人知识让人感觉过于亲密

9月12日
讀畢需時 15 分鐘

Meta 推出了首款专注于生产力的智能体,而 Meta Muse AI 助手呈现出的核心矛盾,比又一次聊天机器人的发布更为鲜明。

Muse 可以清理收件箱、在线购物、填写表单、规划旅行,并在用户关闭应用后继续工作。这些能力使它比只能起草指令的助手更实用,但也要求它访问电子邮件、购物账户、日历、支付系统和个人兴趣信息。

The Verge 的一次上手测试让这种交换变得令人不安。Muse 在获得批准后,成功删除了不需要的电子邮件,并完成了一笔 Amazon 购物。随后,它展示了测试者无法通过 Meta 常规账户设置轻松查看的详细兴趣和位置线索。

这正是 Meta 推进生产力服务背后的核心张力。Muse 之所以有效,是因为它能够整合通常彼此分离的服务信息。同样,这种整合也使每一项成功完成的任务,都在展示该智能体能够观察、记住和推断多少内容。

OpenAI、Google 和 Anthropic 也在将聊天机器人转变为能够完成任务的智能体。Meta 凭借其社交平台多年积累的行为数据进入这场竞争,这既是不同寻常的优势,也是负担。

因此,问题不只是 Muse 是否好用,而是人们是否愿意让 Meta 将私密知识转化为自动化行动。

Meta Muse AI Assistant 从回答问题转向采取行动

Muse 将 Meta AI 从人们咨询的对象,变成了能够代用户操作账户的软件。

Meta 于 2026 年 9 月 8 日在美国推出 Muse。它可通过专用的移动端和网页应用使用,用户也可以通过 WhatsApp 与其交流。

该服务在发布时仅限成年人使用。Meta 表示,计划将该智能体带到其 AI 眼镜上,让 Muse 的使用范围从手机和电脑进一步延伸。

Muse 属于通常被称为个人 AI 智能体的一类产品。智能体不只是生成答案或文档;它可以选择步骤、使用软件、观察结果,并持续工作直至完成任务。

根据 Meta 的 Muse 介绍,该智能体可以打开网站、填写表单、发送电子邮件、协商账单和预订旅行。即使关闭交互界面后,它也能继续工作。

用户可以逐一连接服务,而不是在设置时授予全局访问权限。Meta 将电子邮件、日历、社交账户、支付、健康服务、智能家居系统、购物平台和娱乐应用列为潜在连接对象。

如果某项服务提供应用程序编程接口,Muse 就可以通过该接口进行通信。API 是软件交换数据或请求操作的既定通道。

当存在兼容的 API 或命令行界面时,Muse 也可以创建连接器。如果两者都不可用,其浏览器则可以像人一样浏览该服务。

这种浏览器能力很重要,因为消费者的日常事务很少局限于一家公司的软件中。预订旅行可能涉及电子邮件、日历、航空公司网站、支付信息,以及与其他旅客的消息往来。

Muse 在名为 Muse Secure VM 的专用云计算机中运行这些工作流。虚拟机是一种隔离的软件环境,其行为类似于一台独立电脑。

该环境包括浏览器、存储、处理能力,以及 Muse 开展持续工作所需的文件。它还保存了智能体关于用户的记忆。

Meta 表示,Muse 可以生成文档、图像、视频,以及称为 artifacts 的交互式页面。它可以设置提醒、追踪长期目标,并在没有收到新提示时主动提供建议。

这些功能使 Muse 不只是通往 Meta AI 的更快入口,也让该公司直接进入了数字劳动委托市场。

在智能体作出重要选择之前,这一区别很容易被忽略。聊天机器人可以推荐一件衬衫;Muse 则可以找到它、放入购物车,并请求购买许可。

这种转变让此次发布值得关注,也使 Meta 更接近用户数字生活中最敏感的部分。

Muse 的实用部分已经成为现实

最初的上手证据表明,Muse 可以完成许多竞争智能体仍难以顺畅处理的日常任务。

The Verge 的 Emma Roth 将 Muse 连接到 Gmail,并要求它删除自己不再需要的邮件。最初的 Google 登录流程在移动端多次失败,迫使她改在笔记本电脑上完成连接。

连接成功后,Muse 删除了数千封促销邮件和更新通知。结果很实用,尽管所需权限包括读取和删除邮件。

这种区别很重要。许多智能体演示展示的是开发者选定的理想路径,而收件箱清理发生在一个包含多年真实通信记录的杂乱账户中。

Roth 还连接了一个 Amazon 账户,并请求寻找符合指定颜色、款式和尺码的运动上衣。Muse 找到了合适的产品,但注意到购物车里已有无关商品。

该智能体没有默默删除或购买这些商品,而是询问应如何处理。随后,它只在 Roth 批准交易后购买了所请求的服装。

这是一个虽小却有意义的情境感知案例。僵化的购物脚本可能会将购物车中的每件商品都视为订单的一部分。Muse 识别出了其中的歧义,并将决定权交还给用户。

Muse 上手体验 也展现了它在媒体生成方面不那么稳定的表现。该智能体拒绝了描述熟悉卡通角色、但未直接点名的提示。

不过,Muse 为一场虚构的 Apple 产品活动生成了图像和视频。尽管它拒绝生成 Apple 首席执行官,这些输出仍展示了 Apple 标志和可识别的产品设计。

生成的界面标签存在明显错误。Muse 将 App Store 称为“Photos”,还拼错了“Calendar”,说明能够胜任行动任务并不意味着生成错误会消失。

这种反差捕捉了 Meta Muse 在实际使用中的表现:它可以推理购物车中的情境,同时生成带有荒谬界面文字的图像。

这种不均衡在智能体系统中并不陌生。当任务类似于受支持的工作流时,模型表现良好;一旦接近政策或感知边界,其行为就可能变得不可预测。

Muse 持续维护的目标和想法列表,似乎比其图像实验更有前景。该智能体可以建议比较产品、追踪发布动态,或识别用户遗忘的订阅服务。

此类建议将一次对话变成持久化工作流,也降低了记住未完成任务所需的精力。

对知识工作者而言,这类似于 个人知识库 的自动化延伸。两者都依赖于保留上下文、关联信息,并在需要时检索信息。

Muse 更进一步,因为它能够基于保留的上下文采取行动。它不只是提醒某人购买某件商品,还可以重新查看产品、监测变化,并准备交易。

这项实用性解释了为何隐私问题不能被当作普通的怀疑态度而轻易忽视。如果 Muse 每项任务都失败,拒绝授权会很容易。

真正令人不安的是 Meta 已经推出的版本。Muse 看起来足够实用,足以让用户考虑他们原本会拒绝的权限。

Meta Muse 如何在友好界面背后运作

Muse 将执行任务的智能体,与限制该智能体行为的系统分离开来。

Meta 的架构在每位用户的虚拟机内部采用了两个安全域。主运行环境包含完成任务所需的智能体、文件、工具和工作区。

一个名为 Sentinel 的独立系统负责评估 Muse 与外部服务之间的通信。Meta 表示,除非该控制层允许,否则任何内容都不会到达互联网。

这种分离解决了 AI 智能体的一个核心问题:负责决定行动的模型,不应拥有不受限制地执行每项决定的权限。

Muse 可以提议发送邮件或完成购买。Sentinel 可以允许该操作、阻止该操作,或要求用户批准。

Meta 还表示,该智能体不能直接读取已存储的密码或支付凭据。这些秘密信息保留在隔离存储中,只有通过受控流程才能使用。

据 Meta 称,浏览器接收的是网页的无障碍表示,而非对其底层代码的不受限制访问。Muse 无法在页面内运行任意 JavaScript。

该公司介绍了数个检查浏览器活动的分类器。它们会寻找无关的个人数据传输、危险表单、恶意指令和提示注入尝试。

提示注入是指恶意内容试图命令智能体忽略原始任务或泄露信息。这类指令可以隐藏在网页、图像、文档或下载文件中。

对于后台运行的智能体而言,这种威胁尤其严重。聊天机器人通常会返回可疑文本供人审核,而自主智能体可能会在拥有账户和工具访问权限时遇到这些文本。

对于购买行为,Meta 表示 Muse 在结账时需要获得批准。其支付集成可以生成与单一商家、单一金额和有限期限绑定的临时卡号。

该临时号码让底层卡片信息对智能体和商家都保持隐藏,也限制了攻击成功后被盗凭据的价值。

用户会收到一份审计记录,显示已完成和计划中的操作。该记录应有助于识别错误,尽管其价值取决于 Muse 能否清晰解释复杂序列。

Meta 已开放涵盖智能体攻击的漏洞赏金计划,其中包括成功的提示注入攻击。其安全文档称,符合条件的报告最高可获得 30 万美元奖励。

这一数字表明 Meta 预计外部研究人员会发现具有实际意义的漏洞,但并不能证明发布系统已经抵御了所有重要攻击。

Meta 也直接承认了这一点。其研究人员写道,Muse 并非免疫于攻击,并且有时会犯错。

这种承认比宣称绝对安全更有价值。智能体安全仍是一个关于限制损害、检测滥用,以及在敏感操作周围设置审批关口的问题。

然而,技术隔离只解决了 Meta Muse 隐私问题的一部分。它可以降低一个被攻破的智能体访问另一名用户数据的可能性。

它并未回答 Meta 是否应当接收、处理、保留,或从 Muse 合法访问的信息中学习。

真正的信任问题是合法访问

Muse 在正常运行中变得令人不安,并非因为攻击者攻破了它的防护措施。

完成购物测试后,Roth 要求 Muse 创建个性化新闻流。其摘要包含了她正在探亲的州附近发生的事件。

Muse 解释说,它是从与 Amazon 购买相关联的收货地址中获得该位置的。该地址与结账有关,但智能体将其重新用于个性化。

这种行为体现了权限与预期之间的差异。用户可能预期购物助手能够看到收货地址,但未必会认为该地址会影响无关的新闻推荐。

随后,Roth 询问 Muse 能从注册时使用的 Facebook 和 Instagram 账户中了解什么。该代理生成了一份详细的兴趣列表。

其中包括动漫、CrossFit、拉布拉多犬、佛罗里达野生动物,以及与 1990 年代和 2000 年代相关的怀旧内容。这些兴趣与她 Instagram Reels 信息流中展示的主题高度相似。

据报道,Muse 表示它通过 Instagram 的 API 数据读取了这些兴趣。它还声称,该 API 提供的信息比 Instagram 可见界面展示的更多。

该账户的广告设置显示了更广泛的主题,包括健身、音乐和电子产品,但并未提供 Muse 所描述的同等详细画像。

The Verge 向 Meta 询问 Muse 可以访问 Facebook 和 Instagram 中的哪些数据。截至 9 月 10 日这篇上手体验文章发布时,该公司尚未回应。

这一验证缺口的重要性超过了一条令人不安的推荐。用户需要知道,Muse 是检索了明确的内部标签、独立推断出兴趣,还是结合了两种方法。

每种解释都会带来不同的隐私问题。直接检索会引发对用户不可见数据的透明度担忧。

独立推断则说明,代理能够多么轻易地从零散活动中重建个人画像。结合两种方法会使边界更加难以理解。

Meta 表示,对话和虚拟机数据不会与其广告系统共享。不过,其安全说明解释称,Muse 的网页活动可能会间接影响广告。

商家可能会记录一次由 Muse 发起的访问,随后通过 Instagram 向该用户投放广告。餐厅预订或 Marketplace 搜索也可能产生类似的后续信号。

Meta 还表示,在使用交互历史训练模型更新前,会先对其进行清理。这些历史记录包括对话、工具调用以及代理之间的交接。

据该公司称,用户可以选择退出该训练。不过,默认设置仍要求用户理解存储、模型训练、广告和外部追踪之间复杂的区别。

当 Meta 认为出于运营、安全或支持需要访问用户数据时,Muse 的发布架构并未在技术上阻止该公司进行访问。

Meta 计划推出一种保密虚拟机,通过加密控制阻止公司访问。该公司表示,打算在 2026 年晚些时候发布这一选项。

在此之前,Meta Muse 的隐私保障部分依赖于运营政策和公司承诺。隔离可以保护用户彼此不受影响,但无法将用户完全与 Meta 隔离。

这一缺口使得上手测试结果尤为重要。这项令人不安的发现并不需要恶意软件、被盗凭据或遭入侵的模型。

Muse 只是使用了它认为自己获准使用的信息。问题也因此更棘手,因为每增加一项限制,也可能让助手的效率变低。

Meta 相较竞争对手代理的优势,也是其负担

Meta 可以凭借竞争对手难以复制的社交数据基础为 Muse 提供个性化服务,但这一优势也加重了其信任负担。

OpenAI、Google 和 Anthropic 已经提供了能够浏览网页、使用已连接服务或执行计算机任务的系统。它们的产品建立了一个基本预期:助手应当不止于回答问题。

Google 拥有强势地位,因为 Gmail、Calendar、Maps、Search、Android 和旅行信息已覆盖许多日常工作流程。其服务既能提供上下文,也能提供行动路径。

OpenAI 围绕 ChatGPT 建立了消费者认知,并扩展了连接器和代理功能。Anthropic 则通过 Claude 高度聚焦于工具使用、编程和计算机交互。

Meta 的差异化之处不只是又一个能力出色的语言模型。它掌控着 Facebook、Instagram、Messenger 和 WhatsApp——人们在这些平台上维系关系并透露偏好。

因此,Muse 进入市场时,可能已经掌握社交兴趣、对话、收藏帖子、活动和经常联系人的信息。Meta 还可以将该代理置于数十亿用户已经熟悉的消息界面中。

该公司将 Muse 描述为服务于其更广泛“个人超级智能”愿景的早期产品。首席执行官 Mark Zuckerberg 曾表示,每个人都应拥有一名持续服务于生活和工作的代理。

发布报道指出,Zuckerberg 希望这类系统能协助处理人际关系、职业、财务、健康和家庭管理。

这一范围要求模型对用户拥有比文档助手更丰富的理解。当模型误解某人,或在错误场景中应用上下文时,后果也会随之出现。

一段收藏的健身视频或许能改善训练计划,但也可能暴露用户从未打算与购物、保险或工作任务关联的健康兴趣。

家庭住址可以帮助完成购买,但将其用于个性化新闻推荐,即便底层访问已经获得授权,也跨越了场景边界。

Meta 过去曾因隐私表述问题面临重大处罚。2019 年,该公司与美国联邦贸易委员会达成创纪录的 50 亿美元和解。

这项隐私和解在监管机构指控 Facebook 违反此前命令后施加了新的监督措施。这段历史影响了消费者如何理解 Meta 最新的保证。

技术防护措施无法抹去机构记忆。决定是否连接 Gmail 或信用卡的人,会评估该公司本身,也会评估其架构。

这正是 Meta 与较小型代理创业公司不同的地方。新公司必须说服用户,它能够保护他们的数据。

Meta 则必须说服用户,它能够保护数据、尊重场景边界,并克制地使用其更广泛的信息优势。

其规模仍可能使 Muse 成为领先的消费级代理。WhatsApp 的分发降低了学习门槛,而 Instagram 和 Facebook 则能提供即时个性化。

然而,采用情况将取决于用户是将这种个性化体验为有帮助的理解,还是隐蔽的监控。

Muse 的早期上手测试同时体现了这两面。它清理了收件箱杂乱内容,也正确处理了一个存在歧义的购物车;但它也暴露出一份比用户可用界面所呈现内容更详细的个人画像。

这比又一个模型分数更具决定性。Meta 需要证明,其代理不仅理解自己可以访问什么,也理解哪些信息应当被重复使用。

Meta Muse 隐私控制仍需独立测试

Meta 设计了严肃的防护措施,但最重要的大多数主张仍是等待持续外部审查的公司声明。

Muse 的专用虚拟机、隔离的凭据存储、批准关卡和受限浏览器,构成了比不受限制的浏览器自动化更周全的架构。

其审计记录让用户能够检查相关操作。各个连接器也支持最小访问原则,即用户只授权完成任务所需的服务。

这些决策降低了风险,但并未消除风险。提示注入仍未解决,Meta 也明确承认该代理会犯错。

实际问题在于,故障在压力环境下会如何表现。一项有价值的评估必须测试 Muse 在遇到误导性网站、损坏文件和相互冲突的指令后,是否仍能尊重批准边界。

研究人员还应检验 Sentinel 是否能在长工作流程中理解意图。有害行为在被拆解为多个普通步骤时,可能看起来无害。

删除操作尤其值得严格审查。Roth 有意要求 Muse 清除促销信息,而该代理成功删除了数千条。

错误分类可能会删除收据、法律通知、医疗信息或账户警告。备份或许可以恢复,但恢复并不能防止错过截止日期或造成混乱。

购买行为则承载另一类风险。临时卡号可以限制凭据被盗,但无法保证 Muse 选对了产品或商家。

人工批准仅在审核界面准确传达决策时才有帮助。习惯于频繁批准提示的用户,可能会不再检查细节。

记忆系统带来了一种更隐蔽的风险。Muse 可以保留个人事实,并将其用于未来建议,通过连续性创造价值。

用户需要直接控制查看、编辑和删除这些记忆。Meta 表示,虚拟机文件和 Muse 的记忆均可检查和编辑,但这些控制是否重要,将取决于其易用性。

保密虚拟机是另一项关键测试。Meta 表示,未来系统将通过加密手段阻止公司访问该环境内的信息。

在用户将这一点视为既定事实之前,外部审计人员应先验证该主张。他们还应检查哪些元数据、推理请求和遥测数据仍会离开受保护环境。

监管机构可能会像关注架构一样关注披露。访问请求在法律上可能有效,但对授权者而言仍可能难以理解。

标注为“读取账户数据”的权限,无法说明代理可能会检索常规界面中无法获得的详细兴趣信息,也无法说明这些信息可能如何在不同任务间被复用。

Meta 需要基于用途的控制,而不仅是基于服务的控制。用户应能够允许将地址用于结账,而不允许它影响新闻推荐。

他们还应能够将社交兴趣限制在内容发现中,同时将其排除在健康、就业、财务或购物决策之外。

这些边界难以实现,因为模型会跨数据推断关系。然而,这种困难不能成为隐藏其行为的理由。

最强版本的 Muse 应展示每项个性化行动由哪些事实驱动。它还应允许用户删除某项事实,并阻止其在选定场景中被再次使用。

当前审计记录聚焦于代理做了什么以及计划做什么。一个有用的信任界面还必须解释它为何选择每项行动。

没有这一层,用户在遇到意外结果后只能询问 Muse。该代理自身的解释也可能不完整或有误,就像任何其他生成式回答一样。

正因这种不确定性,详细的 Instagram 画像尚不足以支持关于 Meta 内部数据的确定性结论。它仍是一种需要 Meta 解释的已报道行为。

当 Muse 的防护措施成功避免伤害时,它值得肯定。当普通、获准的访问产生意料之外的个人认知时,它也应受到同等审查。

三项信号将决定 Muse 能否赢得信任

Muse 的未来取决于可观察的行为、独立安全发现,以及在新鲜感消退后,人们是否仍会持续连接敏感账户。

第一项信号是 Meta 对 The Verge 测试中描述的 Instagram 数据作出的解释。该公司应说明 Muse 访问了什么、推断了什么,以及为何这些信息对用户而言并非同样可见。

具体的回答将增强 Meta 关于 Muse 透明运行的论据。模糊回应则会加深这样的担忧:个性化依赖于不可见的数据路径。

第二个信号来自对 Sentinel 和 Muse Secure VM 的外部测试。Meta 的漏洞赏金计划邀请研究人员测试提示注入、凭证处理、浏览器限制以及审批机制。

公开的研究结果将比精心打磨的发布演示更重要。少量得到控制的漏洞将表明,该架构能够通过常规安全实践持续改进。

若攻击能够跨越服务边界,或暴露无关的个人数据,整个设计都会受到削弱。这将说明,仅隔离每台虚拟机还不够。

机密虚拟机也属于这第二个信号的一部分。独立审计必须明确 Meta 无法访问哪些数据,以及仍有哪些信息会离开该环境。

第三个信号是账户连接能否持续存在。下载量和早期排名可以衡量好奇心,却无法说明人们是否愿意信任 Muse 来处理重要工作。

真正有意义的行为,是用户是否会连接电子邮件、支付、日历和社交账户,并持续保持这些连接处于启用状态。反复完成任务比一次试用更重要。

留存率还会揭示审批提示带来的负担。过多的打断会让 Muse 与手动操作相比好不了多少;过少则会增加有害自主行为发生的风险。

竞争对手的回应将进一步明确 Meta 的定位。Google 可以深化其生产力服务中的代理访问能力,而 OpenAI 和 Anthropic 则可以强调自己独立于广告业务。

Meta 必须证明,社交语境能够带来更好的协助体验,同时不让用户感到被监视。这比单纯追平另一款模型的能力,是一个更窄也更难实现的目标。

对个人用户而言,谨慎的做法很直接:为一项明确任务连接一项服务,检查审计记录,然后查看代理事后存储的记忆。

避免一开始就连接同时包含金融、医疗、法律或不可替代信息的账户。测试在权限受限的情况下,这项服务是否仍有实质价值。

希望实现自动化工作流的人,也应将重要源材料整理并保存在任何单一代理之外。一套可搜索的知识库能够保留上下文,同时避免赋予每个工具不受限制的操作权限。

Meta Muse AI 助手已经跨过了首个产品门槛:它能够完成有用的工作。更困难的考验将在新鲜感消退后开始。

Meta 会在用户不得不开口询问前,就解释出人意料的数据访问情况吗?独立研究人员会确认 Sentinel 能够抵御真实攻击吗?人们会继续信任 Muse,将那些定义其日常生活的账户交给它吗?

这些答案将决定 Muse 会成为可靠的助手,还是一场令人印象深刻、却让人犹豫是否继续连接的演示。在把收件箱交给它之前,先选择一项低风险任务,并仔细观察它究竟学到了什么。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page