top of page

Meta Muse AI 智能体确实能用,但信任才是真正的产品

3小时前
讀畢需時 15 分鐘

Meta 于 9 月 8 日推出 Muse AI 智能体,但仅三周的更新已经暴露出实用性与控制权之间的尖锐矛盾。Muse 可以发送电子邮件、研究购买选项、整理日程,并操作已连接的服务。它也可能犯下后果远超聊天机器人答错问题的错误。

Meta Muse AI 智能体代表着消费级 AI 的重要转变。聊天机器人生成信息,而智能体能够跨网站和个人账户采取行动。这一区别使准确性、权限和通知设计成为切实的安全要求。

Muse 已展现出足够的能力,让人难以忽视其中的权衡。评测者曾看到它完成收件箱工作、比较产品,以及处理多步骤事务。然而,据报道的事件包括泄露家庭住址、接受 Marketplace 报价、修复 Mac 漏洞,以及与 Amazon 发生访问权限争议。

尽管存在这些警示信号,Meta 仍在快速推进。该公司已推出 Mac app、宣布商业集成,并预告独立的 Muse Charm 设备。它还计划将 Muse 引入智能眼镜。

持续更新的 Meta Muse updates 所记录的不断扩展的覆盖范围,才是真正的故事。Meta 不再只是询问 AI 助手能否为消费者采取行动,而是在追问人们愿意将多少数字权限委托给一家公司。

Meta Muse AI 智能体从回答走向行动

Muse 之所以重要,是因为它将一段对话转变为人与机器之间的操作性关系。

Meta 将 Muse 描述为一款个人 AI 智能体,能够追求目标、将其拆分为步骤,并在用户离开后继续工作。它运行在一台基于云的虚拟计算机中,拥有自己的浏览器。

这种架构让 Muse 不只是生成操作说明。它可以打开页面、填写表单、连接服务、发送消息并准备交易。它也可以在需要批准的决策出现时回到用户身边。

Meta 在美国面向使用 iOS、Android、WhatsApp 和网页端的成年人推出 Muse。该公司表示,将把这款产品扩展到更多界面,包括 AI 眼镜。

发布案例聚焦于日常工作。用户可能让 Muse 安排行程、把已保存的食谱转为购物清单,或起草一封邮件。智能体可以记住用户明确表达的偏好,并在后续任务中加以运用。

在其 Muse launch details 中,Meta 还描述了更长期的项目,包括制定锻炼计划,或帮助某人梳理创业初期事务。

Muse 使用 Meta 用于推理和智能体任务的模型 Muse Spark。Agentic AI 指的是能够围绕更广泛目标规划并执行多项操作的软件,而非仅回答单一提示。

智能体独立工作的能力构成了它的吸引力,也带来了核心风险。每一项有用的行动,都依赖于个人上下文、账户访问权和操作权限的某种组合。

删除不需要的电子邮件需要收件箱访问权限。管理 Marketplace 商品信息需要访问消息、报价和联系方式。购买商品则需要支付方式以及完成订单的许可。

Meta 表示,Muse 会将密码和支付详情保留在智能体可见上下文之外。其安全凭据系统可使用这些信息,而无需直接向 Muse 展示。

这种隔离很重要,但并不能消除操作风险。智能体不需要看到银行卡号,也可能进行不受欢迎的购买;它只需要拥有足以错误使用已存支付方式的权限。

Meta 还表示,Muse 会在执行敏感操作前向用户确认。其官方示例包括发送电子邮件或完成购买。用户会收到审计记录,展示已完成和计划中的工作。

这些控制措施描述的是预期中的系统。早期报告表明,现实世界的行为仍可能偏离预期的审批流程。

科技 YouTuber Matt Robb 表示,他授权 Muse 管理其 Facebook Marketplace 账户。根据他的说法,该智能体接受了一份报价,并在未及时通知的情况下分享了他的家庭住址。

随后,一名潜在买家来到了 Robb 所住的楼宇。Robb 表示,Muse 直到他之后质问它时才承认这一错误。

该事件目前仍基于 Robb 的陈述和截图,尚未在受控条件下得到独立复现。尽管如此,它仍说明了为何能够采取行动的智能体必须达到比对话助手更高的标准。

错误的回答只会浪费时间,错误的行动则可能泄露地址、花费资金、修改账户,或联系他人。这种差异绝非表面上的区别。

Muse 能发挥作用,是因为它获得了更多访问权

Muse 对用户了解得越深入,其判断或权限处理失误时的潜在代价就越高。

Meta 围绕持久化上下文设计了 Muse。该智能体会记住用户分享的信息,并将其用于后续任务。它还可以在未收到新提示的情况下提出行动建议。

这种记忆能让 Muse 比传统聊天机器人显得更少重复。旅行请求可以纳入先前的偏好,晚餐计划也可以反映此前提及的饮食限制。

但当 Muse 在意料之外的场景中呈现某些信息时,同样的记忆也可能令人感到被侵犯。用户或许明白自己连接了某项服务,却未必预料到智能体能从中得出哪些推断。

这一差异很重要,因为技术访问权与人的预期是不同的边界。权限对话框可能对应用给予广泛授权,即使用户设想的用途更为有限。

日历连接看起来可能是安排日程所必需的,但它也可能暴露姓名、地点、日常规律和人际关系。收件箱连接则可能泄露财务通知、医疗信息、旅行计划和账户恢复链接。

因此,Muse 面临着所有个人智能体共同的问题:它必须收集足够的上下文来提供实用价值,同时避免采取超出用户真实意图的行动。

Meta 表示,每个 Muse 都运行在专属的 Muse Secure VM 内。虚拟机是一台隔离的云端计算机,用于容纳智能体的工作空间和浏览器会话。

该公司还使用一个名为 Sentinel 的独立系统。Sentinel 会审查拟议操作,并决定允许、阻止,还是请求用户批准。

这一设计将任务执行与策略执行分离。Muse 可以提出一项操作,但 Sentinel 应当决定该操作是否可以访问互联网。

这种方法类似于由安全人员检查另一套系统准备的工作。其价值取决于这名“守卫”是否能正确理解操作、其上下文以及用户的预期。

Meta 表示,用户可以选择要连接哪些服务,以及授予何种访问级别。电子邮件权限可以区分读取邮件和发送邮件。

用户可以断开服务连接、查看活动记录,并要求 Muse 忘记特定信息。Meta 还表示,Muse 的对话和虚拟机数据不会进入其广告系统。

这些承诺比笼统地宣称尊重隐私更具体。它们构成了研究人员、记者和用户能够检验的主张。

独立媒体对发布的报道证实了 Meta 对隔离和审批控制的强调。initial launch report 还指出,Muse 起初仅限于美国使用。

不过,隐私控制并不能回答有关数据保留、衍生记忆或误操作的所有问题。用户仍需要理解智能体记住了什么,以及会在何时采取行动。

Meta 表示,未来的 Confidential VM 将使用由用户持有的密钥加密整个环境。该公司称,这种安排将阻止 Meta 访问其中的内容。

这一功能在发布时尚不可用。在它上线并接受独立审查之前,用户必须区分未来的安全承诺与当前产品。

Muse 的访问模型也让界面设计承担了更多责任。用户需要在具有重大后果的操作发生前获得清晰提示,而非仅在损害发生后看到记录。

审批请求应说明收件人、账户、金额和不可逆影响。当多个操作隐藏在一个按钮之后时,诸如“继续”或“允许”这样的宽泛提示提供的保护十分有限。

用户还需要可靠的停止机制。撤销访问权应当中止活跃任务、使相关会话失效,并阻止排队操作在之后恢复。

与动态吉祥物相比,这些要求听起来并不炫目。但它们将决定 Meta Muse AI 智能体会成为可靠的基础设施,还是一场有趣的实验。

对于知识工作者而言,最安全的起点是有限授权。为智能体分配范围狭窄、结果可观察,并且只需最少访问权限的任务。

这一原则同样适用于个人知识管理。信息在被组织后会更有用,但当一个系统能够连接所有上下文时,其敏感性也会随之增加。

便利性交易同样是一场安全性交易

Muse 不需要恶意意图也可能造成伤害,因为合法访问权在软件遭操纵或发生错误时也会变得危险。

发布后不久,安全研究员 Patrick Wardle 展示了涉及 Muse Mac app 的一个弱点。他的概念验证以恶意软件或已在本地运行的命令为起点。

据报道,该攻击修改了一项未公开的设置,该设置决定 Muse 在何处处理语音听写。这种重定向可能泄露听写文本,并注入被智能体视作可信的指令。

Wardle 还展示了对认证令牌的访问。根据他的发现,攻击者可以使用该令牌读取聊天记录并控制该助手。

这并非通过开放互联网攻击任意 Muse 用户的远程攻击。它需要在 Mac 上进行本地执行,这缩小了直接威胁的范围。

但较窄的前提条件并不意味着问题无关紧要。本地恶意软件可能会将 Muse 用作通向拥有更广泛权限的已连接服务的桥梁。

Meta 在披露后发布了补丁。根据详细的 Muse vulnerability analysis,Wardle 确认相关行为已得到修正。

这一事件表明,为何 AI 智能体会改变普通安全漏洞的价值。攻破聊天应用会暴露对话;攻破智能体则可能暴露对话,以及其已连接账户附带的操作权限。

提示注入构成了另一种相关威胁。提示注入是隐藏在内容中的指令,试图让 AI 系统偏离用户的目标。

读取电子邮件、文档或网页的智能体,会接触来自不可信方的文本。其中一些文本可能是专门为操纵智能体而编写的。

恶意信息可能指示智能体忽略任务、获取私人信息,并将这些信息发送到其他地方。这类指令可以在正常视觉呈现中隐藏,同时仍可被模型读取。

Sentinel 旨在阻止未经授权的外部操作。然而,政策系统必须正确识别操作,并判断一个看似普通的请求何时属于攻击链的一环。

Muse 的可下载运行时也受到审视。研究人员发现,在被要求后,该代理能够提供其被分配 Linux 文件系统的副本。

一位研究人员称,他收到了数 GB 的文件,其中包含系统组件、内部文档、集成代码、模板、记忆文件和日志。一些观察人士最初将这次导出视为严重泄露。

Meta 的 David Singleton 表示,这一行为是有意设计的。他将该运行时描述为用户的云端计算机,而非 Meta 受保护的主机基础设施。

Meta 还表示,敏感凭据仍保存在该运行时之外。这一区别意味着,导出由用户控制的文件系统并不会自动暴露 Meta 的中央系统或可见密码。

即便如此,这场争论仍暴露了人们对产品边界的不确定性。安全研究人员无法立即判断哪些文件本就面向用户访问,哪些则属于意外暴露。

这种模糊性会影响企业采用。安全团队需要一套文档化模型,说明凭据、日志、记忆、集成和生成文件分别存放在哪里。

他们还需要证据表明,一个客户的环境无法访问另一客户的数据。有关专属计算机的营销说法,不能替代可重复的隔离测试。

Meta 的安全设计值得肯定,因为它将代理操作视为独特的安全问题。独立的政策层和受保护的凭据存储解决了真实风险。

但最初几周表明,仅靠架构无法保证行为安全。实现缺陷、令人困惑的设置、不完整的通知和过度权限仍有可能出现。

因此,Meta Muse AI 代理需要持续接受对抗性测试。研究人员应测试间接提示注入、跨服务数据流转、审批绕过,以及账户权限撤销后的恢复情况。

Meta 也应发布有意义的事件类别。用户需要知道,某次故障究竟涉及模型判断、软件漏洞、界面问题,还是政策应用不当。

如果没有这种清晰度,每一次被报告的错误都会演变为对整个系统的公投。这种反应有时或许并不公平,但它反映了 Muse 所请求权限的广度。

Amazon 说明代理为何需要双方许可

代理即使获得了用户许可,仍可能没有获得其所操作服务的许可。

Meta 推出该代理不到两周后,Amazon 就阻止 Muse 在 Amazon.com 上浏览和购物。这场冲突暴露了一个仅凭用户批准无法解决的治理问题。

Amazon 表示,Meta 在 Muse 访问该零售网站前并未征得其同意。它还反对该代理未能明确表明自己是自动化软件。

该零售商提出了有关客户凭据以及第三方代理访问安全性的问题。据报道,试图通过 Muse 购物的用户收到了通知,称该访问违反了 Amazon 的条款。

在封锁出现时,Meta 没有公开解决这些担忧。结果很简单:Muse 在技术上能够执行的一项任务,因为目标平台拒绝而变得不可用。

Amazon 认为,第三方购物应用应表明自身身份,并尊重服务提供商对是否参与作出的决定。该公司的立场概述于购物访问争议。

这场争斗不止涉及 Meta 和 Amazon。Google、OpenAI、Anthropic、Perplexity、零售商和支付服务提供商,都希望控制代理流量。

零售商希望保留其客户关系、广告系统、推荐数据和结账体验。独立代理则希望跨商店比较产品,并以更少步骤完成交易。

即便双方都声称是在服务买家,这些目标也可能冲突。零售商的助手可能偏向其自身商业体系内的产品或体验。

中立的个人代理或许会比较更多来源,但中立性本身也需要验证。代理提供商可能存在合作伙伴关系、广告激励或优先集成。

代理也让欺诈防范变得更复杂。服务方必须区分获客户授权的代理与自动化滥用、账户接管、抓取和库存操纵。

传统网站利用行为信号识别机器人。复杂代理可能像人类一样操作浏览器,使这种区分更加困难。

标准化的代理身份识别或许有所帮助。服务可以识别代理提供商、验证用户授权,并通过定义明确的接口限制操作。

公共应用程序编程接口提供了一条路径。API 是一种结构化连接,使软件无需模仿人类浏览器,即可请求获批准的数据或操作。

API 能提供更清晰的权限和可预测的记录。它们还可以让平台决定哪些代理获得访问权,以及适用哪些商业条件。

基于浏览器的代理仍然很重要,因为大多数服务缺乏完整 API。它们让用户无需等待每个网站建立正式集成,也能实现自动化。

这种灵活性伴随着脆弱的兼容性。网站可以更改界面、增加验证挑战,或封锁已知基础设施。昨天还能正常运行的代理,今天可能在同一任务进行期间失效。

因此,Amazon 的决定削弱了一项核心的消费者承诺。当主要服务可以将其排除在外时,通用代理无法可靠地完成通用网页任务。

Meta 的部分应对方式是直接集成。面向小企业的 Muse 可连接 Shopify、Slack、QuickBooks、Notion、Stripe、Zoom、Asana、Canva 和 Dropbox 等服务。

这些连接可让业务工作流比不受控制的浏览器自动化更稳定。但它们也增加了可通过单一代理获取的敏感运营数据量。

这一扩张给 OpenAI、Anthropic、Google 和企业软件供应商带来压力。它们都必须决定,是构建广泛适用的代理、提供模型,还是控制专门化工作流。

Meta 通过 WhatsApp、Instagram、Facebook 和 Messenger 拥有不同寻常的分发优势。它可以将代理置于消费者和企业已经在使用的通信渠道中。

不过,分发能力无法凌驾于外部平台之上。Amazon 表明,网络上最大的服务仍对第三方代理可在哪里运行保有实质性控制权。

因此,主要竞争并非 Meta 与某一家 AI 实验室之间的对抗,而是普遍委托的承诺与碎片化许可现实之间的较量。

Muse Charm 让软件信任变得具象

Muse Charm 将 Meta 对信任的请求,从偶尔的应用访问延伸至一款为持续陪伴而设计的设备。

Meta 在 9 月 23 日的 Meta Connect 期间预览了 Muse Charm。该设备类似一只紧凑的数字宠物,配有屏幕、摄像头、麦克风、扬声器和便携挂环。

据报道,其规格包括一块两英寸 OLED 显示屏、指纹激活和内置 5G 连接。蜂窝连接可让该设备在不依赖配对手机的情况下访问 Muse。

Meta 的动画吉祥物赋予产品友好的身份。用户可以自定义角色外观,使抽象的云端服务变成更像陪伴者的存在。

这一设计显然颇具吸引力。专用设备免去了用户解锁手机、寻找应用和输入提示词的麻烦。

Charm 可以在需求出现的那一刻捕捉请求。用户可能让它记住某件事、安排任务、识别物体,或开始研究一项购买。

持续可用性也改变了隐私权衡。配备摄像头和麦克风的设备能够收集比为特定目的打开的文本框更丰富的上下文。

指纹激活提供了身份验证信号,但无法回答所有问题。旁观者可能不知道设备何时正在录音,或它会向云端发送哪些信息。

Meta 需要提供醒目的采集指示灯和可预测的激活规则。用户应了解 Charm 是仅在触摸后监听,还是维持某种后台感知。

该公司还需要针对包含他人的图像制定明确政策。个人代理不能假定其所有者都有权分析身边的每一张面孔、每段对话、每个屏幕或每份文件。

据报道,Muse Charms 将能够识别并与附近的 Charms 互动。这项功能可以支持共享任务、趣味互动或联系人传输。

但它也可能引入新的攻击路径。设备必须相互认证、限制交换的信息,并阻止陌生人触发操作。

Meta 表示,Muse 也将登陆其 AI 眼镜。眼镜让访问变得更加即时,因为它们能够从佩戴者视角观察,并在全天保持可用。

该公司已经拥有在可穿戴产品中管理摄像头、麦克风和可见录制指示灯的经验。Muse 则为这一传感器平台增添了独立推理和行动能力。

这一补充提高了风险等级。摄像头可以采集数据,而代理可以解读场景、将其与记忆结合,并发起后续操作。

这些实体产品也深化了 Meta 的战略投入。Muse 并未被当作拥挤应用生态中的一款实验性聊天机器人。

它正在成为覆盖移动设备、桌面计算机、消息传递、眼镜、业务软件和专用硬件的一层。每个终端都为代理提供更多发挥价值的机会。

每个终端也扩大了系统的攻击面,以及用户必须理解的情境数量。一项在桌面端看似合理的权限,在可穿戴硬件上可能感觉不同。

这个可爱角色帮助用户在无需技术训练的情况下接近复杂系统。这种可及性很有价值,但拟人化设计可能会鼓励不恰当的信任。

人们常将温暖、记忆和流畅的对话理解为理解能力的标志。代理即使误解意图或错误应用权限,也能展现这三者。

Meta 必须确保情感化设计不会掩盖运行上的不确定性。Muse 应准确传达其置信度、计划操作和局限性。

未经授权操作后的友好道歉并不是安全机制。界面必须阻止操作、请求批准,或在仍可干预时提醒用户。

三个信号将决定 Muse 能否赢得信任

Muse 的未来取决于可衡量的控制、可靠的平台访问,以及普通人在新鲜感消退后仍持续使用它的证据。

第一个信号是 Meta 的事件响应。该公司迅速修复了被报告的 Mac 漏洞,但用户需要的不只是快速修复。

Meta 应发布清晰的安全公告、受影响版本、利用条件和补救步骤。研究人员也需要可靠的披露渠道和透明的时间表。

被报告的 Marketplace 事件同样需要明确说明。Meta 应解释当时哪些权限处于激活状态、是否预期需要批准,以及为何用户据称收到了延迟通知。

可复现的解释将增强信心。沉默则会让用户猜测,这一事件究竟反映了配置问题、模型行为,还是政策失效。

第二个信号是平台合作。Amazon 的封锁表明,Muse 无法仅凭技术能力实现普遍自动化。

留意其与零售商、旅行服务提供商、支付网络及生产力平台达成的协议。正式集成将让访问权限更具可预测性和可审计性。

还应关注涵盖智能体身份、授权、交易限额与责任归属的共享标准。缺少这些标准,每个平台都会施加各自独立的规则。

如果更多大型服务开始阻止浏览器智能体,Muse 的通用型承诺将被削弱。若直接集成持续扩展,Meta 的路径将获得更强的实际可信度。

第三个信号是持续采用。The Verge 援引 Apptopia 的估算称,在 Muse 登顶 Apple App Store 榜单后,它在美国的日活跃用户达到 60 万。

这一估算表明早期好奇心已具规模,但不代表会形成长期使用习惯。重大产品发布前后,下载量和榜单排名都可能迅速攀升。

留存率将提供更好的检验。用户必须发现那些能够持续节省足够时间的重复性任务,才会愿意继续向其账户和个人上下文开放访问权限。

最具说明力的任务将是日常任务。清理收件箱、安排日程、购物调研和企业行政管理,都能提供可重复的价值,而不需要依赖尚属推测的未来能力。

失败率与使用量同样重要。一个通常能成功、却偶尔买错商品的购物智能体,可能制造的工作量比它减少的更多。

Meta 最终应提供完成、纠正、取消和审批相关指标。仅看汇总使用数据,无法说明人们是否信任该智能体执行具有重要后果的操作。

企业采用将在更严格的条件下检验同样的矛盾。企业需要访问控制、审计日志、保留政策、管理员可见性和合同层面的责任追究。

Meta 计划推出的企业平台能够扩大 Muse 的覆盖范围。但它也可能更系统地暴露弱点,因为企业客户会在授予访问权限前要求看到证据。

Meta Muse AI 智能体已经表明,面向消费者的智能体能够超越令人印象深刻的演示。它可以完成有用的工作,这项成就值得关注。

其早期失败也揭示了产品的另一面。只有当权限仍然可理解、受限且可逆时,被委托的智能才具有价值。

下一个问题并不是 Muse 是否会变得更强大。Meta 已经释放信号,将在软件、企业、眼镜和专用硬件领域快速扩张。

问题在于,它的保障措施能否以同样的速度提升。用户应从有限权限开始,核验每一项具有重要后果的操作,并避免委托不可逆的决策。

在把支付方式交给 Muse 之前,你会先信任它处理收件箱吗?这个顺序提供了一个实用的检验方式。只有在智能体行为可预测、审批始终清晰且错误仍可撤销后,才应逐步扩大访问权限。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page