RoboNeo推出3D导演控制台,覆盖AI短片全流程制作
- Martin Chen

- 2天前
- 讀畢需時 16 分鐘
据 2026 年 7 月 24 日发布的 RSSHub 36Kr 快讯,RoboNeo 推出了配备专业 3D 导演控制台的新版本。此次更新让 Meitu 的视觉 AI agent 超越了孤立的生成工具,转向受管理的短片制作环境。
据报道,该控制台让创作者能够在生成视频之前,更好地控制摄像机位置、场景构图以及其他空间决策。RoboNeo 还新增了项目资产、端到端工作流、升级后的脚本与分镜生成、字幕移除、图像增强、灯光调整和背景优化功能。
其中的矛盾很直接。AI 视频系统能够生成越来越精致的片段,但多镜头制作仍需要连续性、反复修改和有意识的导演控制。RoboNeo 押注的是:一个持久化的制作工作区,比又一个提示词输入框更有价值。
这使它参与竞争的对象变成了更广义的工作流模式,而非某个特定生成器。产品可以提供对 Seedance、Kling、Sora、Veo 及其他模型的访问。更难的任务在于,让脚本、角色、地点、摄像机和修改贯穿整个项目,并始终保持关联。
RSSHub 36Kr 称 RoboNeo 发生了哪些变化
此次更新将 RoboNeo 从一组视觉工具,转变为面向 AI 短片的结构化制作系统。
最初的 RoboNeo update 内容十分简短。报道称,Meitu 的 AI agent 已在最新版本中正式引入专业 3D 导演控制台。
报道没有介绍该控制台的界面或底层架构,也没有提供基准测试、客户案例或详细的版本说明。这些缺失限制了外界对其性能作出独立判断的可能性。
不过,已公布功能的组合仍揭示了 Meitu 的产品方向。该公司正将前期制作、生成、资产管理和后期制作整合到同一个工作环境中。
3D 导演控制台是最明确的信号。导演控制台通常允许创作者在要求视频模型渲染最终结果之前,以空间方式定义场景。摄像机位置、主体位置、取景和灯光可以成为明确的选择,而不是交由提示词来解释。
这一点很重要,因为文本提示词是不精确的控制方式。一个低机位特写的要求,可能生成多个视觉上合理的结果,但无法保证整个序列中的摄像机关系保持一致。
空间控制台在语言与生成之间增加了另一层控制。用户可以通过场景表示规划镜头,然后将这一布局传入渲染流程。
RoboNeo 新增的项目资产库也支持这一策略。资产可以包括角色参考、环境、道具、视觉风格、生成帧和已批准片段。将它们保存在项目中,可以减少重复上传和彼此割裂的生成过程。
升级后的脚本与分镜系统则扩展了上游工作流。创作者不必再为一个片段输入一个提示词,而是可以从故事概念开始。系统随后能够将这一概念拆分为场景和单个镜头。
后期制作工具则处理生成之后的问题。字幕移除、分辨率增强、灯光校正和背景优化,都是针对生成或导入后的素材。
这些功能共同构成了一条更长的制作链路:
创作者编写脚本,并将其转换为镜头。
项目资产提供可重复使用的视觉参考。
3D 控制台定义空间构图和摄像机意图。
视频模型根据这些决策生成素材。
后期制作工具修复或调整生成的片段。
已批准的输出可供后续镜头和修改继续使用。
这比基础的文本生成视频提出了更广泛的产品主张。它希望用户将 RoboNeo 视为短片的存放和制作之所,而不仅仅是生成单个片段的工具。
不过,RSSHub 36Kr 的内容并未确认每个环节是否都能自动运行,也没有说明 3D 控制台生成的是原生 3D 资产,还是使用轻量级场景代理。
这一差异可能会影响该功能的实际价值。原生几何体能够提供精确变换和可预测的摄像机运动。视觉近似方案可能更容易使用,但在复杂修改过程中可靠性较低。
目前最稳妥的结论较为有限:RoboNeo 引入了导演式控制层,并将其连接到更完整的短片工作流中。关于控制能力、一致性和制作质量的详细证据仍然有限。
Meitu 为什么现在要打造制作工作区
随着使用量和营收信号支持其进一步押注 AI 辅助视觉制作,Meitu 正在扩展 RoboNeo。
RoboNeo 于 2025 年 7 月 14 日首次上线。Meitu 将其描述为一款 AI 视觉设计 agent,可用于修图、品牌设计、电商素材、营销视频、网站和特效预览等场景。
最初的 product launch 面向图片编辑者、设计师、内容创作者、网店卖家和社交媒体运营者。移动端和桌面端版本均在上线时提供。
最初的应用范围很广,但核心仍是视觉任务。新版本则为短片创作提供了更明确的项目结构。
在 3D 控制台出现之前,Meitu 已经开始了这一转型。2026 年 4 月,RoboNeo 推出了 Agent Teams,这一系统会为多个协作 agent 分配专门角色。
根据 Meitu 的 Agent Teams overview,这些角色涵盖脚本创作、设计、编辑和内容策略。该系统旨在让 agent 之间传递工作,而不是让用户手动协调每个工具。
公司将短剧、社交媒体制作和电商视频列为早期应用场景,同时还推出了可复用技能,以及用于保存偏好和品牌资产的项目记忆。
7 月的版本则为这一协作模型加入了直接的导演控制。Agent 协作可以负责规划和执行工作流,而控制台则为人类创作者提供了介入视觉决策的空间。
这种平衡很重要。完全自动化的视频生成听起来效率很高,但创意团队很少会接受所有初始输出。他们需要保留已通过审核的元素,同时替换表现不佳的部分。
持久化的项目结构支持选择性修改。如果某个镜头失败,创作者不应该需要从头重建脚本、角色和视觉参考。
Meitu 的业绩也有助于解释这一时机。该公司称,截至 2026 年 3 月,其全球付费订阅用户超过 1790 万,同比增长 30.2%。
第一季度,其图片、视频和设计产品收入达到 8.52 亿元人民币,同比增长 34.3%。
生产力应用约占该业务收入的 18%。这部分收入增长 45.4%,付费订阅用户增长 52.9%,达到 234 万。
Meitu 还表示,RoboNeo 的 AI 积分消耗量在 3 月较 2025 年 12 月增长 316%。这些数据来自公司发布的 first-quarter disclosure,并非独立的使用量审计。
这些数字并不能证明新的导演控制台会吸引专业电影制作人,但它们表明,Meitu 有充分的财务理由深化 AI 工作流,并提高用户的重复使用频率。
一次图片编辑可能只需要一次交易。一个短片项目则可能涉及脚本、分镜、参考素材生成、多次视频尝试、修复和最终导出,从而创造更多持续使用的机会。
这也让 Meitu 能够利用其既有的影像技术。该公司在修图、增强、背景编辑和视觉特效方面已经积累了多年经验。
当这些能力被置于一条制作链路中时,其价值会进一步提升。生成的视频往往需要修复,尤其是在不同片段的字幕、灯光、背景或原始分辨率不一致时。
Meitu 的核心企业业务已经与这一机会相契合。2025 年,其图片、视频和设计业务收入达到 29.5 亿元人民币,同比增长 41.6%。
该业务占持续经营收入的 76.6%。Meitu 还表示,RoboNeo 在 26 个国家和地区的应用商店中,整体排名或品类排名处于领先位置。
公司的数据证明了增长势头,但不能证明其已被专业用户采用。消费者排名和积分消耗并不能说明工作室是否能借助该系统完成可发布的项目。
这正是此次发布的核心空白。Meitu 已经证明市场对 AI 视觉工具存在需求。接下来,它需要证明 RoboNeo 能够支持更长期、更高要求的制作工作。
真正的竞争是提示词生成与导演式工作流之争
RoboNeo 主要面对的竞争对手,是将每次视频生成都视为孤立请求的、以片段为中心的工作流。
现代视频模型可以根据文本、图像或参考素材生成令人印象深刻的短片段。然而,单个片段的视觉质量只是电影制作的一部分。
叙事序列还需要连续性。同一个角色必须始终保持可识别,道具应当处于合理位置,灯光应当符合场景,摄像机选择也应当服务于故事。
以片段为中心的工具往往将这些责任留给用户。创作者需要维护参考文件夹、复制提示词、重命名输出,并在单独的剪辑软件中组装结果。
对于一条社交媒体内容,这一流程或许可行。但当项目包含多个场景、反复出现的角色以及多轮审核时,它就会变得脆弱。
RoboNeo 的导演控制台通过明确的规划来处理这一问题。创作者可以在渲染前建立空间布局,而不是反复用文字描述同一布局。
更广泛的 RoboNeo 工作区则会将这一布局与脚本、分镜和项目资产保持关联。生成之后,后期制作工具负责处理修正工作。
学术研究也支持这一机制的重要性。一篇关于 cinematic AI agents 的 2026 年论文指出,许多视频系统仍然以片段为中心。它们更重视局部视觉质量,而不是相邻镜头之间的连贯叙事规划。
研究人员构建了一个多 agent 框架,其中包括导演 agent、摄影 agent 和视频生成 agent。递归式分镜生成会将上下文从一个镜头传递到下一个镜头。
这项研究并不能证明 RoboNeo 采用了相同的设计,但它说明了为什么制作系统正在加入专门化 agent 和结构化镜头规划。
另一个 2026 年的研究项目 editable 3D storyboards,则从一致性和可编辑性的角度界定了这一问题。作者认为,当前方案很少能同时实现这两种特性。
二维生成器可以制作生动的画面,但角色身份和几何结构可能发生漂移。传统 3D 工具提供了明确的控制,却要求用户具备较高专业能力并投入大量手动劳动。
3D 导演控制台试图占据这两种方案之间的空间。它可以提供摄像机和场景控制,同时不要求每位创作者都掌握完整的动画制作流程。
考虑一个设定在厨房中的简短广告场景。产品位于前景附近,一名演员从右侧进入并伸手去拿。
提示词可以描述这种安排。然而,每次生成都可能让产品位置发生变化、反转入场方向,或改变摄像机高度。
空间导向的工作流可以在生成运动之前锁定产品位置和摄像机关系。这样,创作者就能改变演员的动作,而不必舍弃其他已经确定的选择。
戏剧性场景也会面临类似挑战。开场的广角镜头交代了房间两侧的两名角色。接下来的特写必须保持他们在画面中的方向和潜在位置关系。
如果第二个镜头与第一个镜头矛盾,剪辑就会变得令人困惑。更高的画质无法解决这种连续性错误。
这正是导演控制台比其“3D”标签更重要的原因。它的价值取决于能否在不同镜头和修改之间保留已有决策。
RoboNeo 的后期处理功能同样服务于这种有明确导向的工作流。当源素材包含不需要的文字时,字幕移除功能会很有帮助。增强功能则可以减少导入素材与生成素材之间的明显差异。
光照调整可以让不同片段看起来更像属于同一个场景。背景优化则可以修复分散注意力的细节,或让素材与已获批准的项目参考保持一致。
这些功能本身都并非独一无二。它们的重要性在于能够在同一个制作环境中使用。
这种方法在一个有用的方面类似于可搜索的知识库。随着项目积累越来越多的决策、素材和修改记录,持久化上下文的价值也会不断提升。
短片工作区需要记住的是视觉知识,而不是技术文档。角色、道具、镜头目标和获批画面会成为项目的事实来源。
这些上下文可以减少意外变更。它们也能让协作更容易,因为每位参与者都可以查看相同的素材和镜头历史。
因此,竞争并不是 RoboNeo 对阵某一个基础模型。RoboNeo 可以整合多个模型,同时在更高一层的工作流层面展开竞争。
模型提供商将继续改进分辨率、运动、音频和提示词遵循能力。工作流产品则必须决定每项任务适合使用哪个模型,并在多次调用之间保持创作意图。
如果 RoboNeo 成功,用户就不会那么在意打开某个特定的生成器。他们更关心的是能否在不丢失连续性或控制力的情况下完成项目。
这种结果会给那些能够生成优秀片段、但项目管理能力薄弱的独立界面带来压力。它也会迫使传统编辑工具加入智能体规划和可复用的生成式上下文。
专业标签需要专业证据
最大的不确定性在于,当创作者超越演示和简单场景后,RoboNeo 的新控制功能是否仍能保持可靠。
RSSHub 36Kr 的报道使用了“专业”一词,但没有对其作出定义。专业用户通常要求可重复性、灵活的导出能力、可预测的修改结果,以及清晰的权利管理。
视觉效果令人印象深刻的演示,并不能证明这些品质。冗长的功能列表同样不能。
RoboNeo 需要展示导演控制台如何处理复杂的制作案例,包括拥挤场景、遮挡、协同运动、反光表面,以及穿着相似服装的重复角色。
摄像机控制也需要仔细检验。控制台或许允许用户选择角度或移动虚拟摄像机。更难的问题是,最终视频能否准确遵循这些设置。
细微的偏差就可能破坏精心设计的构图。主体可能会漂移到画面之外,渲染出的镜头也可能与计划中的透视关系不一致。
系统如何表示场景在这里十分关键。如果 RoboNeo 维护的是真实几何关系,创作者就应该能够调整位置,而无需重新构建图像。
如果它依赖生成式近似,空间编辑就可能触发更大范围的视觉变化。公司尚未在所引用的报道中公开详细说明这一机制。
跨镜头的一致性是另一个考验。项目素材库可以存储参考内容,但仅仅存储并不能保证忠实复用。
系统必须将正确的角色、服装、道具和环境绑定到每个镜头上。摄像机发生变化时,它还必须保留这些元素。
脚本和分镜生成会带来另一类风险。智能体可以快速将故事拆分成镜头,但自动生成的方案可能采用重复的构图,或忽略叙事重点。
创作者需要简单直接的方式来覆盖原有方案。他们也需要能够只重新生成某个元素,而不改变其他已经获批的内容。
后期制作工具可以修复部分错误,但也可能掩盖上游环节的不足。频繁替换背景或进行增强,可能意味着生成阶段缺乏足够的控制力。
质量增强可以提升清晰度,但无法恢复从未被生成出来的有意表演。光照校正也无法修复前后不一致的角色身份。
工作流是否完整同样需要证据。Meitu 将 RoboNeo 描述为端到端系统,但在不同产品中,“端到端”可能意味着不同的范围。
一种解释是涵盖从规划到生成片段的流程。另一种解释则还包括音频、时间安排、转场、色彩管理、字幕、协作和最终交付。
报道提到了全链路工作流能力,但没有列出每个受支持的阶段。买家不应默认它等同于成熟的编辑或 3D 制作套件。
集成能力也是一个尚未明确的问题。专业团队已经在使用编辑、合成、素材管理和审片系统。如果素材无法在这些系统之间顺畅流转,封闭式工作区就可能带来阻力。
有用的导出不应只保留扁平化视频。团队可能还需要独立片段、干净画面、音轨、镜头元数据、参考素材,或可编辑的场景信息。
此次更新公告没有说明这些选项。公告也没有描述项目版本管理、共享审阅、权限控制或审批历史。
模型透明度同样值得关注。RoboNeo 的网站展示了对多种图像和视频能力的访问,但具体可用性和表现可能因模型、地区和产品配置而异。
创作者需要知道每项素材由哪个模型生成。当某个模型不可用,或其输出特征发生变化时,他们也需要获得可预测的处理结果。
Meitu 早期材料称,RoboNeo 将自研视觉模型与开源模型结合使用。公司也曾将该产品描述为承载多种视觉能力的容器。
这种架构提供了灵活性,但也增加了编排复杂度。每个模型接受不同的输入、支持不同的控制方式,并生成不同的产物。
工作流智能体必须将项目意图转化为针对具体模型的指令。随后,它还必须对结果进行标准化,同时保留重要的元数据。
训练数据、上传的参考素材和生成内容的权利问题也仍未得到解决。36Kr 的报道没有讨论与此次更新相关的任何政策变化。
处理客户项目或尚未发布的知识产权时,团队应仔细查看适用条款。他们还应测试项目素材在整个工作流中是否始终保持私密并可控。
这些问题并不意味着此次发布无关紧要。它们定义了“专业 3D 导演控制台”这一表述所带来的标准。
Meitu 已经宣布了一个可信的产品方向。现在需要由独立评测来判断,这个控制台提供的究竟是持久稳定的控制力,还是又一层自动化建议。
如果工作流奏效,谁会面临压力
一个可靠的 RoboNeo 工作流会同时给独立 AI 生成器和传统创意软件带来压力,但原因各不相同。
独立生成器面临用户留存问题。用户可能因为某个特定模型访问它们,生成几个片段;一旦需求发生变化,就转向其他工具。
以项目为中心的工作区可以留住周边上下文。即使底层模型发生变化,脚本、参考素材、镜头规划和获批资产仍会保留在同一个环境中。
这使工作流层成为一个战略位置。它可以将不同任务分配给不同模型,同时维系用户关系。
RoboNeo 的公开网站已经展示了多个视频模型和编辑功能。公司称,其智能体可以选择工具、生成场景、优化转场、添加音乐并处理素材。
新的控制台为人类导演提供了更明确的介入位置。这或许能让 RoboNeo 区别于那些主要暴露模型设置和提示词输入框的界面。
传统编辑和设计套件面临的是相反的挑战。它们已经拥有项目时间线、素材组织和精确控制能力。
然而,用户仍然需要手动完成许多步骤。智能体工作区可以压缩规划、首轮生成、常规修复和格式适配等环节。
成熟工具可以通过加入自己的智能体来应对,也可以将生成能力更紧密地连接到用户熟悉的时间线、图层和协作系统中。
它们的优势在于信任。专业用户了解这些工具的导出格式、审阅方式和制作表现。
RoboNeo 的优势在于可以从一开始就围绕生成式制作进行设计。它无需将 AI 功能附加到一个原本为手动采集素材而构建的工作流上。
短剧平台构成了另一类竞争者。这些产品正逐步将脚本、角色、分镜、声音和生成视频连接到同一个项目中。
它们的专业化可以带来更强的叙事模板和系列化制作工具。RoboNeo 则拥有 Meitu 更广泛的视觉编辑背景,以及对更大规模消费级产品组合的支持。
最终结果将取决于执行,而不是功能数量。大多数厂商都可以列出脚本生成、分镜、可复用素材和视频编辑。
真正困难的是管理依赖关系。更改一个角色参考后,应当更新正确的镜头,而不能破坏已经获批的场景。
替换一个视频模型后,应当保留摄像机意图。修改对白后,应当更新时间安排和音频,而不必重建所有视觉素材。
这正是智能体配得上这个称呼的地方。它必须理解项目状态,选择受影响的步骤,并避免不必要的变更。
Meitu 还拥有分发优势。公司报告称,截至 2025 年底,其旗下产品的全球月活跃用户总数达到 2.76 亿。
这一数字并不代表 RoboNeo 的使用量,但它确实为 Meitu 提供了多个渠道,可以向已经使用其视觉应用的创作者推出智能体能力。
Meitu 曾表示,计划将 RoboNeo 技术整合到其产品组合中。这种整合可以把轻量级创作与更结构化的制作工作流连接起来。
用户可能会先在某个应用中使用特效或增强图像。随后,RoboNeo 可以将该素材转化为一场营销活动、一段短叙事,或一系列视频。
公司必须避免让这种体验变得令人困惑。过多相互重叠的应用、智能体和点数系统,可能会让用户不清楚项目究竟归属于哪里。
它还需要服务不同技能水平的用户。初学者可能希望自动规划镜头,而经验丰富的创作者则需要直接控制和可预测的覆盖操作。
设计良好的导演控制台应该同时支持这两种模式。自动化功能可以创建初始场景,而手动控制则让用户进一步调整构图和摄像机表现。
如果这些模式彼此冲突,产品可能无法真正满足任何一方的需求。初学者可能会觉得界面令人望而生畏,而专业人士则可能认为控制选项过于浅显。
因此,这次发布也给 Meitu 内部带来了压力。公司必须在面向消费者的易用性与专业制作所要求的精确度之间取得平衡。
三个信号将显示 RoboNeo 是否已经超越演示阶段
下一阶段是验证,三个具体信号将决定这套新工作流是否值得专业用户采用。
第一个信号是详细的产品文档或完整的延伸演示。Meitu 应该展示创作者如何构建场景、放置资产、定义摄像机,以及修改某个镜头。
最有说服力的演示,应当展示角色和几何结构在多次摄像机变换中的持续一致性。同时,还应将最终生成的视频素材与预先规划的 3D 构图并列展示。
如果输出能够紧密遵循这些决策,RoboNeo 的主张就会更有说服力。如果控制台只能提供宽泛的视觉指导,其专业价值就会更加有限。
第二个信号是独立的多镜头测试。评测者应当创建一段包含重复出现的角色、道具、环境以及受控画面方向的短片段。
随后,他们应提出有针对性的修改要求。一项有价值的测试是只改变一个摄像机角度,同时保持服装、光线、物体位置以及相邻镜头不变。
如果测试成功,将支持 Meitu 关于这套工作流的判断。如果画面反复漂移,或系统只能进行大范围重新生成,就说明资产库与导演控制之间仍然缺乏紧密连接。
第三个信号是来自制作用户的可衡量采用数据。目前,Meitu 披露的主要是企业订阅、收入、排名和积分消耗等数据。
未来的披露应将 RoboNeo 的项目使用情况与整体 AI 活动区分开来。有参考价值的指标包括已完成项目数、重复使用的创作者数量、每个项目生成的镜头数,以及留存的团队账户数。
客户案例也能提供更多背景,尤其是当案例说明节省了多少时间,以及生成后需要进行多少人工修正时。经过精心剪辑的展示视频所能提供的证据则相对较弱。
竞争对手的回应同样值得关注,但它们属于次要因素。核心判断取决于 RoboNeo 能否将创作意图转化为可重复执行的项目状态。
RSSHub 36Kr 记录了这次发布,但这则快讯并未回答核心技术问题。Meitu 现在需要展示实际控制能力,而不仅仅是描述这种能力。
对于开发者而言,这次发布展现了视觉智能体的发展方向。模型路由、持久化状态、资产关系以及选择性重新生成,正逐渐成为产品的核心问题。
对于企业买家而言,评估重点应放在治理和互操作性上。在投入重要资产之前,应测试导出能力、权限管理、项目历史、模型披露和数据处理方式。
对于创作者而言,最简单的问题是:RoboNeo 能否只修改一个镜头,而不让你重新修复整个片段?
请使用真实项目进行测试,而不是使用宣传性质的提示词。记录角色出现漂移的频率、摄像机与规划的一致程度,以及生成后还需要完成多少工作。
如果 RoboNeo 能够在这些修改中保留既有决策,那么这款 3D 控制台就代表着工作流上的重大进步。如果不能,它仍然只是围绕熟悉的生成限制整合起来的一组实用工具。
未来几个月应当会让这一差异变得清晰。关注演示、独立测试和生产指标,最终应根据已经完成的影片,而不是功能名称,来评判这套工作空间。


