top of page

Instagram Muse 图像生成器在全球 AI 竞赛中落后

Instagram 在主应用和 WhatsApp 中推出了其新的 AI 图像生成器 Muse。该功能在 Meta 内部测试数月后,于 2026 年 7 月初推出。

用户现在可以输入提示,并获得符合风格和细节设置的图像。此举使 Meta 直接与 OpenAI、Google 和 Midjourney 的工具展开竞争。

Meta 构建 Muse 的目的是让日常活跃用户留在自有应用内,而非前往其他地方进行图像创作。

早期测试结果喜忧参半。部分提示能生成干净的输出,其他提示在面部和手部仍会出现瑕疵。在并排对比中,质量仍落后于顶级竞争对手。

发布细节与即时用户反应

Meta 于 7 月 7 日通过更新向选定地区推送了 Muse 公告,链接为 official engineering announcement。该生成器基于授权和公开数据训练的模型运行,支持最多 500 个字符的文本提示,并提供基本风格控制。推广优先采用移动优先集成,用户无需离开 Instagram 动态或 WhatsApp 聊天。工程师在故事创作器上方直接嵌入了一个浮动“创建”按钮,将操作简化为一次点击。

在最初 48 小时内,工程师报告生成了超过 4000 万张图像。其中部分图像出现在公开的故事和动态帖子中。许多用户在其他平台分享结果,为该功能创造了免费营销。区域分析显示,英语市场接受度最高,巴西和印度在本地化提示模板可用后增长迅速。

Instagram 产品负责人 Naomi Gleit 表示,目标很简单。团队希望图像创作像应用滤镜一样日常。推广首先在美国、加拿大和欧洲部分地区开始,之后逐步扩展。内部遥测数据显示,62% 的首次用户在 24 小时内返回,但当输出需要大量编辑时,重复使用率急剧下降。

进一步的区域数据显示,在公司添加泰语、印尼语和越南语的特定提示建议后,东南亚的采用率出现意外激增。在雅加达的一个记录案例中,一位当地旅游影响者在三天内为赞助酒店活动生成了 1200 多张图像,几乎只使用电影预设。这些故事的互动率达到了该账号平均水平的 4.7 倍,证明即使质量不完美,在消除分发摩擦的情况下也能推动短期互动。

Meta 还披露,首个公开版本包含一个选择加入开关,用于将生成内容分享回公开训练池。18–24 岁用户中的早期选择加入率达到 38%,表明年轻群体更愿意用数据换取潜在更快的模型改进。

用户论坛迅速充满混合反应。摄影爱好者赞赏无缝访问,但抱怨对构图的控制有限。普通用户发布了从宠物肖像到抽象背景的早期实验,通常在手动大量清理前后分享。Meta 内部营销团队追踪到,在第一周至少生成一张图像的用户中,平均会话时长增加了 19%。

技术规格与模型架构

Muse 基于一个大约 38 亿参数的潜在扩散主干进行构建。Meta 结合了授权库存图像、公开网络数据以及由其自有 Llama 3 变体生成的合成字幕,具体描述见 Meta AI technical overview。训练过程中强调安全过滤器,可在推理时阻止名人肖像和暴力画面。

该模型接受 500 字符的提示,并提供四种风格预设:photorealistic、illustration、cinematic 和 sticker。推理在区域数据中心的 Meta 定制 MTIA 芯片上运行,在中端 Android 设备上的平均生成时间为 3.2 秒。工程师实现了一个两阶段精炼流程,初始低分辨率草稿会先进行放大,然后再进行最终合成。该架构使系统能够高效处理基本的构图请求,但在需要更深层上下文理解的复杂多对象交互方面仍有不足。

Meta 还将 Muse 与其现有的内容审核堆栈集成,在将生成的图像渲染给用户之前自动扫描每张图像是否存在政策违规。该公司开源了部分字幕生成流程以鼓励外部研究,但保留了核心权重。

更多架构细节显示,该模型采用专为移动端提示长度优化的 12 层交叉注意力机制。训练数据集混合了 12 亿张授权库存照片和 8.4 亿张经 Llama 3 字幕过滤的网络抓取图像。安全分类器在三个独立阶段应用:提示摄入、潜在空间采样和最终像素输出。尽管有这些层级,内部红队报告指出,当提示结合多个负面约束(如“no text, no hands, no logos”)时,仍存在残余泄漏。

Meta 还开始在封闭测试中尝试“style reference”上传功能。早期参与者可以上传现有照片,并要求 Muse 匹配色彩分级或光照,这项功能已在 DALL-E 4 和 Midjourney v7 中存在。该功能目前仅限于每个区域 50 名测试者,预计仅在模型下一次检查点发布后才会扩大可用范围。

工作流细节体现了移动优先的定位:点击 Create 按钮后,用户选择预设并直接在编辑字段中输入提示。系统会在轮播中返回四种变体,允许快速迭代而无需打开新标签页。这种设计降低了与 Midjourney 基于 Discord 的工作流相比的门槛,但缺少 seed 控制或 aspect-ratio 滑块等高级参数,迫使用户接受模型选择的默认构图。

与领先工具的性能差距

当前基准测试显示 Muse 在标准指标上落后于多个竞争对手。独立测试测量了提示遵循度、皮肤纹理准确性和图像内文本渲染。Muse 在大多数类别中得分低于 DALL-E 4 和 Imagen 3。在 PartiPrompts 基准上,根据 early comparison reporting,Muse 达到 71% 的保真度,而 DALL-E 4 为 88%。

摄影论坛上的用户指出复杂场景存在持续问题。包含多个人物或精细细节的提示往往会产生扭曲元素。手部经常显示六指,生成的标志中的文本即使在 1.1 补丁后仍显示为乱码。单主体肖像是该模型最强的类别。

独立创作者进行的并排评估显示,Midjourney v7 在艺术连贯性和氛围光照方面仍领先,而 Google 的 Imagen 3 在事实场景构图(如准确的建筑和产品模型)方面表现优异。Muse 在美学精炼和事实依据两方面均落后。

AI 评估非营利组织 Hugging Face 进行的另一项评估显示,在来自 12,000 名众包评测者的偏好排名中,Muse 在 19 个公开基准模型中位列第 14。该模型在“白色背景上的简单产品”提示上表现最佳,但在评测“黄昏时分有清晰标牌的拥挤城市街道”时跌至第 19。

具体例子凸显了差距。当被要求渲染“夜晚繁忙的东京十字路口,广告牌上有霓虹灯汉字”时,Muse 产生了连贯的霓虹灯颜色,但将日文字符渲染为随机的拉丁字母。DALL-E 4 渲染了清晰的标牌,而 Imagen 3 正确放置了地铁入口。这些反复的失败限制了 Muse 在需要可识别城市细节的基于位置的广告活动中的实用性。

DrawBench 套件上的进一步正面交锋测试显示,Muse 在构图准确性上落后 Imagen 3 17 分,在色彩和谐上落后 DALL-E 4 12 分。当创作者在不同工具上测试同一提示 50 次时,Muse 显示出输出质量的最高方差,迫使用户在达到可接受迭代之前丢弃超过一半的结果。

为什么 Meta 现在进入图像竞赛

Meta 已经拥有最大的照片分享网络。在同一界面中添加生成工具可以将注意力与广告浏览保持在一个地方。高管将此步骤描述为防御性的。没有此功能,年轻用户可能会迁移到围绕更新的 AI 模型构建的应用程序。

监管文件显示,Meta 在上个季度将 AI 基础设施支出增加了 34%。额外的容量支持更大的图像模型和日常活跃用户的更快推理时间。泄露给 The Information 的内部备忘录显示,到 2026 年第四季度,每月生成目标为 5 亿次,这是广告领导团队每周跟踪的指标。

竞争格局与市场定位

2026 年全球 AI 图像市场估值达到约 150 亿美元,由 OpenAI 的 DALL-E 系列和 Midjourney 的订阅平台主导。Meta 决定将 Muse 直接嵌入 Instagram 和 WhatsApp,代表了一种分发优先而非纯质量优先的策略。虽然竞争对手要求用户切换应用或访问独立网站,但 Muse 受益于零摩擦访问,这些信息流已捕获数十亿每日会话。这种方法与 Meta 早期在 Instagram Reels 上的成功如出一辙,原生集成允许快速扩展,即使底层技术最初落后于 TikTok。

然而,仅靠分发并未缩小质量差距。在 Meta 发布的受控用户研究中,参与者对 Muse 生成图像的整体满意度评分比相同提示输入 DALL-E 4 低 23%。差距在专业场景中扩大:平面设计师报告称,纠正 Muse 输出中的瑕疵所花费的时间大约是其他工具的两倍。这种摩擦降低了严肃创作者采用该功能的动力,限制了原本可通过真实反馈循环加速改进的网络效应。

Sensor Tower 的市场份额数据显示,Midjourney 在 2026 年第二季度保留了 41% 的付费创意用户份额,而 DALL-E 占据 34%。尽管 Instagram 的用户基数庞大得多,Muse 在同期仅注册了 8%,这凸显了当质量期望未满足时,仅靠可及性并不能保证采用。

对内容创作者的实际影响

日常 Instagram 用户获得了一种无需离开应用即可尝试视觉想法的便捷方式,但持续的质量短板意味着专业工作流仍依赖外部工具来完成最终交付。品牌测试 Muse 用于故事广告时,经常发现生成的素材在符合平台赞助内容指南之前,需要在 Photoshop 中手动修饰或使用外部放大服务。这种混合工作流增加了隐藏成本和时间,削弱了承诺的效率提升。

然而,对于专注于快速内容周期的影响者而言,Muse 提供了有用的草稿,可通过滤镜和标题进行精炼。生活方式细分领域的早期采用者已记录使用该工具在五分钟内原型化十种不同的视觉方向,然后再拍摄真实摄影。净效应是更快的构思,而非取代传统摄影工作。

没有付费 Midjourney 席位的小型创作者尤其受益于 Muse 的免费层级。一位拥有 18 万粉丝的 TikTok 创作者报告称,在 2026 年第三季度,她使用 Muse 生成的背景占其过渡视频的 40%,每周大约节省八小时的库存图像搜索时间。相比之下,较大的机构继续为客户交付许可 Midjourney 或 Adobe Firefly,同时保留 Muse 用于内部情绪板制作。

局限性与风险

尽管安全过滤器经过训练以阻止名人肖像,但早期泄露测试表明,对抗性提示仍可能生成可识别的公众人物。Meta 随后发布了补丁,降低了但并未消除该漏洞。该事件引发了隐私倡导者的重新审视,他们认为任何基于公开网络图像训练的模型都会大规模继承同意和肖像问题。

另一个局限涉及训练数据中的文化偏见。描述非西方服装或建筑的提示经常默认采用通用西方美学,这一问题在内部审计的多语言中均有记录。解决这些偏见需要持续的策展投入,而 Meta 迄今仅部分披露了相关信息。

其他风险包括新手用户的过度依赖,他们可能将生成图像视为最终资产,而不验证事实或风格准确性。当生成视觉内容无意中包含通过自动过滤器的文化不敏感元素时,这可能导致品牌错位。

用户体验与移动工作流比较

与基于网页的替代方案相比,Muse 的四种变体轮播鼓励快速实验,但缺乏高级用户期望的精细控制。Midjourney 允许负提示和宽高比指定;Muse 仅限制用户使用预设选项。这种简洁性吸引初学者,却让习惯于用精确参数迭代的专业人士感到沮丧。

未来展望与值得关注的事项

Meta 已表示计划在 2027 年初推出更大的 120 亿参数继任者,直接将用户反馈纳入微调。关键变量仍是质量改进是否足够迅速,以在用户转向更高保真外部工具之前保持势头。观察者将关注两个信号:月度生成目标轨迹,以及与第三方创意软件宣布的任何合作,以将 Muse 接入专业管道。

快速 FAQ

Muse 是否存储我的提示?

根据其隐私政策,Meta 会保留提示 30 天以进行安全审查,之后删除。

我可以使用 Muse 创建的图像进行销售吗?

当前条款授予 Meta 广泛许可;在进一步政策更新前,商业销售权仍受限制。

Muse 会出现在 discussions 或 Facebook 上吗?

工程文档显示,计划扩展到其他 Meta 表面,但尚未安排。

关注快速发展的技术故事的团队通常需要一个地方来保存源笔记、会议上下文和后续问题。一个轻量级的 AI 知识库 可以让这些移动的部分在新闻周期变化后更容易重新访问。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page