top of page

Meta Muse AI Agent 开放更多用户使用,但信任才是产品考验

9月10日
讀畢需時 16 分鐘

尽管主流消费者是否会信任其处理个人数据仍存在疑问,Meta 本周还是将其 Muse AI agent 向更多用户开放。这次扩大访问范围紧随 Muse 于 9 月 8 日在美国通过网页、iOS、Android 和 WhatsApp 推出之后。

Meta 首席 AI 官 Alexandr Wang 通过一则链接至 Muse 注册页面的 X 帖文 宣传了新增访问权限。他还感谢早期用户的反馈,并强调团队在产品上投入了大量心力。

该帖文重点展示了一则充满热情的早期评测,称赞 Muse 的设计、速度、浏览器控制能力及更广泛的 agent 工作流。这份评测也指出了术语令人困惑、信息流相关性不足这两个问题,而它们远不只是表面打磨的问题。

这些细节让 Muse 比又一次助手产品发布更值得关注。Meta 正在测试,它在 Instagram、WhatsApp 及未来 AI 眼镜上的分发能力,能否让自主 agent 成为消费者的日常习惯。

OpenAI、Anthropic 和 Google 已将其大量 agent 工作聚焦于浏览器、研究、编程和专业工作流。Meta 则带着不同的优势入场:现有的社交语境,以及用户全天使用的消费级应用。

但这一优势也构成了 Muse 的核心矛盾。agent 获得的语境越多,可能就越有用;但每增加一项连接,用户就必须向 Meta 交付更多信任。

Meta Muse AI Agent 的访问范围扩展至发布之后

此次访问扩展让 Muse 从一场精致的产品发布,转向检验普通消费者是否需要持续存在的个人 agent 的真实测试。

Meta 将 Muse 定位为不止能生成回答的个人 AI agent。根据公司的 Muse 公告,它可以操作浏览器、填写表单、发送电子邮件、预订旅行,以及在获得批准后完成购买。

AI agent 与聊天机器人的区别在于,它能通过多项行动追求一个目标。agent 不只是起草电子邮件,还可以识别收件人、准备信息,并请求发送许可。

Muse 也可以处理更长期的项目。Meta 表示,即使用户关闭应用,它仍可继续工作;当情况发生变化或需要用户批准时,再返回通知用户。

该产品最初面向美国成年用户推出,覆盖独立移动应用、网页界面和 WhatsApp。Meta 表示,对其 AI 眼镜的支持将随后推出,将 agent 延伸至另一类产品中。

新近推广的注册渠道让更多人有机会进入这一体验。不过,这并不代表已实现不受限制的全球可用性,访问权限仍可能取决于账户资格及推送进度。

这一区别很重要,因为早期产品反馈很少能够代表主流用户的行为。首批测试者往往理解 agent 概念、愿意容忍不熟悉的控件,并会主动寻找新的 AI 产品。

更广泛的消费者群体有不同期待。人们希望日历、购物工具和消息应用无需了解 agent 配置文件,也能自行清晰地说明其用途。

Wang 的回应表明,Meta 正密切关注定性反馈。被重点展示的反馈称赞了 Muse 的视觉设计、运行速度以及基于浏览器的工作流表现。

根据 Wang 帖文中汇总的反馈,Meta 原生产品之间的连接也是另一项显著优势。Instagram 集成让 Muse 能够触及独立 agent 公司无法如此直接复现的使用场景。

Meta 给出了一个具体示例:用户可以在 Instagram 上收藏一条食谱 Reel,然后要求 Muse 将其转换为购物清单并规划一顿晚餐。

该 agent 还可以记住此前对话中提到的饮食限制。在用户授予相应权限的前提下,它可以在推荐菜单或准备邀请时使用这些信息。

这一场景体现了 Meta 预期的产品闭环:消费者活动产生语境,Muse 将语境转化为计划,再由其浏览器或连接器执行计划的一部分。

同一份早期反馈也指出了阻碍。soul.md 这样的标签显然与 agent 的身份或行为配置有关,对技术型 agent 用户而言具有特定含义。

但对于主流用户而言,这个术语远不够直观。它无法立刻说明该设置控制的是语气、记忆、个人偏好、运行规则,还是其他内容。

信息流也因内容相关性不足而受到批评。主动式 agent 信息流比社交信息流的要求更高,因为它的建议暗示自己了解用户的优先事项。

无关的视频推荐只是浪费注意力。无关的 agent 建议则可能制造额外工作、触发不必要的行动,或削弱用户对系统记忆能力的信心。

因此,Meta 同时获得了两类证据。Muse 看起来速度很快、设计周到,但其部分心智模型仍然过于技术化,或个性化程度不足。

这对早期推送阶段而言是有价值的反馈,也揭示出 Meta 在分发能力成为持久优势之前必须解决的产品挑战。

Meta 的分发优势改变了 agent 竞争格局

Muse 从用户已经积累有价值个人语境的通信和社交产品内部起步,因而给独立 agent 带来了压力。

多数消费级 agent 都面临冷启动问题。它们必须说服用户安装另一个应用、连接多个账户、描述自己的偏好,并以足够高的频率回来使用,让系统得以学习。

Meta 已运营 Instagram、Facebook、Messenger 和 WhatsApp。每项服务都占据用户社交和信息生活中的不同部分。

Muse 可以潜在地横跨这些环境,而非要求用户在新界面中重新构建自己的生活。这是实质性的产品优势,不过权限和地区规则将决定整合能够推进到何种程度。

Instagram 食谱示例说明了原生访问为何重要。相关输入并非正式文档或精心撰写的提示词,而是在既有娱乐信息流中进行的一项随意操作。

独立 agent 可能要求用户复制链接、上传截图、解释活动内容并提供宾客名单。如果 Meta 能够以负责任的方式连接周边语境,Muse 就可以减少这些步骤。

WhatsApp 提供了另一个重要入口。Meta 将 Muse 设计得像与另一个人发消息一样互动,而非操作复杂的自动化仪表板。

这一选择降低了可见的学习门槛。用户已经熟悉对话线程、通知、附件和批准消息。

Meta 还可以将 Muse 引入其 AI 眼镜。可穿戴 agent 可以获得即时的视觉或语音语境,不过 Meta 尚未说明这些能力将以多大范围发挥作用。

这一策略不同于以专业桌面环境为中心的 agent。Anthropic 的计算机与编程工具、OpenAI 的 agent 产品以及 Google 的 Gemini 服务,通常从研究或工作场景任务切入。

这些竞争对手仍拥有重要优势:既有用户、成熟模型、开发者生态,以及横跨生产力软件的集成能力。

Meta 并不会仅仅因为把 agent 放在 Instagram 旁边就获胜。Muse 必须足够可靠地完成任务,用户才会更愿意委托它,而不是亲自完成工作。

该公司还需要建立坚实的控制边界。社交语境可以改善 agent 的建议,但其中也可能包含玩笑、过时的兴趣、私密对话和含义模糊的信号。

收藏一条 Reel 并不总意味着有购买或烹饪意图。关于旅行的消息也不一定授权进行预订搜索。

Muse 必须区分观察与指令。如果它将每个信号都视为活跃目标,主动式协助很快就会显得具有侵扰性。

因此,竞争压力落在两类参与者身上。独立 agent 公司必须找到 Meta 无法原生获取的语境;而 Meta 则必须证明原生语境能带来更好的行动结果。

分发也改变了获客经济性。Meta 可以在用户已经使用的产品中引入 Muse,而非完全依赖广告或应用商店发现。

不过,仅靠入口位置并不能带来留存。Meta 曾在其平台上推出许多功能,用户也经常忽略那些无法立即提供价值的功能。

Muse 需要持续创造一些时刻,让委托显得比手动操作更快。预订旅行、研究购买选择、组织活动和管理重复计划,都是显而易见的候选场景。

这些任务同样很难。它们涉及不断变化的网站、不确定的偏好、支付详情、时间限制,以及操作失误带来的后果。

理解 Meta 的优势,最好的方式是将其视为获得起点的能力,而不是对结果的保证性掌控。Muse 可以捕捉更多信号,但仍必须将其转化为可靠的工作成果。

对于知识工作者而言,这种区别并不陌生。收集信息很容易,相比之下,维护准确语境并产出决策要困难得多。

个人 AI 知识库 可以支持回忆,但自主 agent 增加了执行风险。系统从帮助用户思考,转变为在外部服务中采取行动。

这一转变让 Muse 与所有承诺浏览器控制能力的 agent 直接竞争。Meta 的社交应用令其入场方式独具特色,但执行质量将决定这种特色是否真正重要。

浏览器自动化既是 Muse 的机制,也是其薄弱环节

当 Muse 能跨越应用边界时,它才真正有用;但这些浏览器操作也形成了产品最大的可靠性与安全性风险面。

Meta 表示,Muse 运行在名为 Muse Secure VM 的专用虚拟机中。虚拟机是一台隔离的云端计算机,容纳 agent、其浏览器及已连接的数据。

内置浏览器让 Muse 能与缺乏直接软件集成的服务协作。它可以代表用户浏览页面、输入信息并完成多步骤工作流。

在可用时,直接连接器仍然更可取。它们提供明确的操作和可预测的数据结构,而浏览器自动化则必须理解为人类设计的界面。

网站经常变化。按钮会移动、对话框会出现、登录会话会过期,反自动化系统也可能中断任务。

agent 必须识别这些变化,同时不能混淆相似的控件。研究过程中误点一次只是麻烦,但结账过程中误点则可能带来财务后果。

Meta 的产品设计试图将规划与授权分开。该公司表示,Muse 会在发送电子邮件或完成购买等敏感操作之前请求许可。

系统还提供覆盖已完成及计划中操作的审计记录。这份记录应能帮助用户理解 agent 如何得出某个结果。

名为 Sentinel 的独立组件会评估 Muse 向互联网发送的内容。根据 Meta 的说法,Sentinel 可以允许、阻止操作,或将其升级为需要用户批准的操作。

这种分离至关重要,因为追求目标的代理不应是唯一评判自身行为的系统。独立检查可以减少错误推理或恶意网页内容造成的损害。

Meta 还表示,Muse 无法查看已存储的密码或支付凭据。关联的秘密信息仍保存在受保护的存储空间中,系统可以使用它们,但不会将原始值暴露给代理。

支付可通过 Link 使用一次性卡片信息。Meta 表示,这种安排让用户的底层银行卡信息不被 Muse 获取,同时仍支持符合条件的购买保障。

这些控制措施听起来经过深思熟虑,但大多数仍只是公司的说法。独立研究人员需要时间和技术访问权限,以测试隔离边界、审批规则以及抵御提示注入的能力。

提示注入是指敌对内容试图通过隐藏在网页、文档或消息中的指令操纵代理。此类攻击针对的是代理的决策过程,而非传统的登录表单。

浏览器代理会持续接触不可信内容。它必须将完成任务所需的信息,与试图改变任务方向的指令区分开来。

如果 Sentinel 能够独立评估外发数据和敏感操作,它可能成为一项有意义的防御措施。其价值取决于产品描述无法证明的实施细节。

审批提示带来了另一种权衡。每一步操作都要求许可会让代理变得繁琐,但过少请求批准则会增加潜在危害。

频繁的警告还可能导致审批疲劳。由于每次中断看起来都很常规,用户会开始自动接受提示。

Meta 高管在发布报道中承认了这种平衡。Muse 的设计目标是在敏感操作时打断用户,同时让已获授权、风险较低的工作继续进行。

这项政策必须保持易于理解。用户需要知道哪些权限适用于单项任务、单项服务、一段时间,还是持续性的操作类别。

早期对 Muse 可见浏览器的好评表明,Meta 已让代理工作过程更容易被追踪。可见性让用户能够检查进度,而不是等待一个神秘的最终结果。

速度在这里很重要,因为缓慢的自动化会促使用户介入。如果代理还没打开第二个页面,用户就已经能手动完成任务,委托给代理就失去了吸引力。

然而,表面上的速度不能取代正确性。一个迅速朝错误方向行动的代理,造成的收尾工作会比缓慢而谨慎的系统更多。

因此,Muse 的浏览器既是实现机制,也是测试场。它让系统能够广泛执行操作,而无需等待每家公司都构建集成。

它也让 Muse 面对不可预测的界面、对抗性内容、过期凭据和模糊的确认页面。这些恰恰是区分产品演示与可靠基础设施的条件。

早期好评揭示了主流可用性缺口

Muse 的首批评测表明,Meta 打造了一个颇具吸引力的代理界面,但并非每个概念都已被转化为非技术用户能够理解的形式。

Wang 强调的积极反馈,聚焦于实际体验而非抽象的模型智能。设计、响应速度、浏览器性能和工作流执行,都是用户能立即感受到的特性。

这种侧重令人鼓舞。消费级代理不会因为人们欣赏基准测试分数而成功;它们会在产品能从真实任务中减少步骤时成功。

围绕 soul.md 的批评同样很有价值,因为它指出了一个术语问题。技术代理社区经常使用 Markdown 文件来定义人格、价值观、偏好和运行行为。

普通用户不会通过配置文件来组织个人助理。他们会想到沟通风格、偏好、优先事项、记忆和边界等概念。

如果 Muse 暴露出一种技术隐喻,却不解释其后果,用户可能会配置错误的设置,或干脆完全避开它。

这个标签还引出了更深层的问题。代理的“灵魂”控制听起来很有表现力,但用户需要理解,它影响的是语气,还是实际决策。

这些类别应当保持区分。友好的写作风格不应在无声无息间改变购买规则、隐私权限或请求批准的标准。

Meta 可以通过更清晰的语言解决部分问题。它可以为语音、个人上下文、目标和行动边界分别提供独立控制项。

该公司还需要易于理解的默认设置。主流产品不能要求每位用户在完成一项有用任务前,都先设计一套代理架构。

早期采用者可能会喜欢给代理命名、选择头像并塑造其人格。其他用户则希望立即获得帮助,例如处理日历冲突或制定旅行计划。

信息流相关性问题则更为棘手。Meta 在内容信息流排序方面拥有数十年经验,但代理信息流承载着不同的期待。

娱乐信息流优化的是注意力和互动。个人代理信息流则应优先提供及时、可执行且可解释的建议。

这意味着,相关性需要考虑的不只是预测兴趣。它还应纳入紧迫性、置信度、节省的工作量、权限范围以及出错成本。

建议用户重新查看一份已保存的食谱,风险较低。建议重新安排预约或联系某人,则需要更有力的依据。

Muse 还应解释为何呈现某个项目。一段简短的理由可帮助用户在错误假设影响未来操作前纠正它。

例如,产品可能会说明,它建议创建购物清单,是因为用户保存了一份食谱,并且此前提到要招待客人。用户随后可以确认或否定这种关联。

反馈机制不能只用于隐藏不想看到的卡片。它们应能区分无关主题、错误时机、过时上下文,以及用户从不希望委托的操作。

这些区分有助于代理构建准确记忆。没有它们,负面反馈就会变成模糊信号,无法揭示究竟哪里出了问题。

Meta 表示,Muse 会记住对话中的信息,并可以主动提出建议。这项功能进一步凸显了记忆控制的重要性。

用户需要有清晰方式检查、纠正和删除代理对他们形成的认知。Meta 表示,人们可以要求 Muse 忘记特定信息,但功能是否容易被发现将很关键。

该公司还表示,用户可以选择退出将互动用于训练 Meta AI 模型。Meta 称,Muse 对话和虚拟机数据不会与 Meta 的广告系统共享。

这些承诺将受到严密审视,因为 Muse 要求获取异常私密的访问权限。代理可能接触到健康计划、私人消息、财务偏好、旅行安排和家庭日常。

发布报道正确地将重点放在消费者信任上,而不是原始能力。Meta 的隐私历史塑造了用户对每一次权限请求的解读方式。

美国联邦贸易委员会于 2019 年与 Facebook 达成了一项重大的隐私和解协议。该机构后来指控 Meta 违反了与该命令相关的要求。

历史执法并不能证明 Muse 的保护措施必然会失败。但它解释了为何仅靠技术保证可能无法说服持怀疑态度的消费者。

Meta 计划推出一个 Confidential VM,用用户持有的密钥加密整个虚拟机。该公司表示,即使是 Meta 也无法访问该环境内的活动。

该版本预计将在 2026 年晚些时候推出,因此不应将其视为当前的保护措施。其最终架构和局限性将需要独立审查。

可用性与信任挑战汇聚于同一点:一项用户无法理解的隐私控制,其实际保护力度会低于技术设计所暗示的水平。

Meta 必须让权限、记忆、个性化和审批边界清晰易懂。否则,Muse 最快速的工作流可能仍主要吸引那些本就习惯使用自主代理的人。

真正的竞争是便利与信任之争

Meta 必须说服用户:Muse 节省的精力,足以证明关联实现有用自动化所需的账户、上下文和服务是合理的。

美联社直截了当地概括了尚未解决的采用问题:人们真的会使用这款产品吗?

这个问题不能仅凭注册人数回答。一项被广泛推广的免费体验可以吸引好奇心,却未必会成为任何人日常生活的一部分。

更有力的信号将是重复委托。用户必须带着新任务回来,连接更多服务,并允许 Muse 在更长时间内持续工作。

每一步都需要更高的信心。让代理总结晚餐选项,与让它联系宾客、使用日历并完成购买,是截然不同的事。

Meta 的权限模型似乎是为渐进式扩展而设计的。用户可以逐一选择服务,并区分读取数据和写入更改。

据报道,权限可被限制在某项任务、交易、服务或时间段内。如果用户理解并正确应用,这些控制可以减少暴露风险。

粒度也会带来复杂性。一长串技术权限可能像移动端同意页面一样,用户未经阅读便直接批准。

Muse 需要用任务语言传达后果。“为这次旅行使用我的日历”比抽象的范围标识符更有意义。

信任还取决于恢复能力。每个功能强大的代理最终都会误解请求、遇到意外网站,或给出糟糕建议。

用户需要知道哪些操作可撤销、哪些需要确认,以及自动操作造成损失时由谁承担责任。

审计记录有助于诊断错误,但并不会自动修复它们。Meta 将需要有效的取消、更正、争议处理和支持流程。

商业功能让这些问题变得更紧迫。Meta 表示,该代理可能会比较产品、协商并完成结账。

Meta 表示,Muse 在发布时不含广告。Wang 曾表示,公司正在探索将商业机会作为可能的收入来源。

这带来了一个值得关注的未来冲突。用户期望个人代理代表自己的利益,而商业平台通常从交易或产品植入中获利。

Meta 尚未证明 Muse 的推荐会受到商业关系影响。不过,如果变现进入其决策循环,产品将需要透明的规则。

个人代理不能悄然从中立助手转变为销售渠道。用户必须能够区分基于偏好的推荐,与赞助或收入关联的建议。

当 Muse 无需新的提示便采取行动时,这个问题会变得更重要。只有当用户信任系统动机时,主动建议才会让人感到有帮助。

Meta 现有的广告业务使这种信任更难获得,即便 Muse 数据仍与广告系统分离。除技术数据边界外,产品激励同样重要。

竞争对手也面临类似冲突。搜索公司、商业平台、设备制造商和订阅服务都有可能塑造代理行为的商业模式。

Meta 的优势并非独有地受到损害,但它的问题格外显眼。消费者对该公司如何处理个人信息早已有既定看法。

独立安全审查可以验证部分技术叙述。长期表现将决定用户是否相信更广泛的产品关系。

Muse 最有力的论据是具体的实用性。如果它能持续节省时间、尊重用户修正并解释自身行动,用户可能会逐步授予它更广泛的访问权限。

如果它的信息流始终不相关,或用语依然晦涩,用户就不会走到那一步。在价值变得清晰之前,他们会先遇到阻力。

这正是早期反馈褒贬不一的重要原因。对速度和设计的赞赏表明,Muse 能够留下强烈的第一印象。

对术语和相关性的批评则显示,这种印象可能在哪里破裂。当产品依赖反复建立的信任时,这些并非次要细节。

三个信号将揭示 Meta Muse 是否奏效

下一阶段应通过持续使用情况、独立安全测试,以及 Muse 个性化控制能力的改进来评判。

第一个信号是,用户是否会在初步试用后扩展已连接的服务。一个愿意回访并授予经过谨慎限定的访问权限的人,体现的是实际信任。

Meta 无需披露私有用户数据,也能提供有意义的采用证据。它可以汇总披露留存率、已完成任务、批准率、撤销情况以及服务连接模式。

任务完成需要审慎定义。一项操作即使到达结账页面、但仍需人工补救,也不应与成功完成购买同等计入。

第二个信号是对 Muse Secure VM 和 Sentinel 的独立分析。安全研究人员需要获得足够的文档和访问权限,以测试隔离机制、提示注入防御措施和出站数据控制。

Meta 的安全设计展示了一种分层架构,但架构主张必须经受住对抗性测试。清晰的漏洞披露和快速修复将强化该公司的论证。

Confidential VM 的推出将带来另一项考验。如果 Meta 能提供由用户控制、且明确说明限制条件的加密,它将回应围绕敏感代理上下文的最大担忧之一。

任何延迟都不能证明现有系统不安全,但会让 Meta 最有力的隐私承诺在更长时间内无法落地到产品中。

第三个信号是围绕相关性和通俗语言控制的产品改进。Meta 应澄清诸如代理人格、记忆和运行边界等概念。

信息流建议应变得更及时、更容易理解。用户还需要精确的反馈控制,以区分错误主题、错误假设和不受欢迎的操作。

这些变化将表明,Meta 是将早期批评视为界面润色问题,还是将其视为有关代理与用户之间根本关系的证据。

竞争对手的回应同样重要,但只是辅助证据。OpenAI、Anthropic 和 Google 将继续增加集成、浏览器控制、记忆功能和主动式工作流。

Meta 的独特押注在于,消费者上下文和现有通信渠道能够打造更好的个人代理。如果 Muse 的表现只像另一个拥有浏览器访问权限的独立聊天机器人,这一论点就会被削弱。

如果 Instagram、WhatsApp 和未来的眼镜集成能够持续减少操作步骤,又不制造令人不适的意外,这一论点就会得到强化。

Meta Muse AI 代理已来到一个阶段:精心打磨的演示已不足以说明问题。现在有更多用户可以测试,它的浏览器、记忆和集成功能是否能够带来可靠的结果。

评估 Muse 的读者应从边界明确的任务和有限权限开始。他们应在连接更敏感的服务前,检查其计划、批准请求、审计记录和已记住的上下文。

关键问题不在于 Muse 能否一次完成令人印象深刻的工作流,而在于经过数周的日常生活后,这个代理是否仍然有用、易于理解并与用户保持一致。

这正是 Meta 在将 Muse 称为个人代理时为自己设定的标准。未来几个月将显示,其分发优势能否克服公司面临的更棘手的信任问题。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page