top of page

智绘科学技术拆解:Qwen 与 Manim 挑战一键式 AI 视频模型

7月19日
讀畢需時 14 分鐘

已更新:7月20日

智绘科学通过一套五阶段 AI 工作流,将课程主题转化为可编辑动画,并在乡村教育赛道中荣获一等奖。本篇智绘科学技术拆解将分析这一成果背后的公开系统,包括 Qwen3.5、Manim、专业智能体和自动代码修复。

该项目诞生于首届“小友·科威”AI 开源公益创新挑战赛。大赛汇聚了近 800 支团队,共收到涵盖四个公益类别的 455 个参赛项目。智绘科学参加的是乡村课堂 AI 助教类别。

它真正的重要对手并非另一项参赛作品,而是人们熟悉的一键式生成模型:教师提交提示词,便会收到一个控制能力有限、内部机制不透明的视频。智绘科学选择了另一条路线,通过生成方案、脚本、代码、审核决策和可编辑的场景文件来完成制作。

这一选择使该项目不再只是又一个 AI 生成媒体的演示。它检验了结构化智能体工作流能否让教育内容更易于检查、修改和维护。

智绘科学究竟改变了什么

智绘科学将 AI 视频生成重新定义为一套受监督的制作流程,而非一次性的创意请求。

该项目由中国科学院大学塔山跨学科创新协会打造。据现有赛事报道,项目获得了该赛事乡村教育类别一等奖。

挑战赛于 2025 年 9 月启动,并于 12 月 29 日在杭州举行决赛。据报道,共有 42 个项目进入最终评审,16 个项目在四个公益赛道中获奖。

这些细节很重要,因为智绘科学是作为一个针对明确课堂问题的解决方案接受评估的,而不仅仅被视为一个实验性动画生成器。

大赛聚焦乡村教育、老年人服务、孤独症儿童支持和无障碍辅助。其他获奖项目包括 AI 回忆录工具、儿童绘本项目和开源辅助眼镜。

一篇赛事报道将智绘科学描述为连接远方数字资源与乡村课堂的桥梁。这一定位明确了项目的目标用户:需要教学材料,却没有专业动画团队的教师。

随后,Qwen 团队发布的一篇技术文章据称详细介绍了该架构。文章主要围绕 Qwen3.5-397B-A17B、Manim 动画引擎和多个协作智能体展开。

现有摘要介绍了五个制作阶段:规划、起草、实现、审核和合成。每个阶段都会将前一阶段的输出转化为更具体的成果。

流程从一个知识主题开始,而非完整的分镜脚本。规划智能体理解主题、识别概念,并将讲解内容拆分为多个场景。

起草阶段随后将方案转化为视觉叙事。它决定应该呈现什么内容、需要强调哪些关系,以及每个场景应如何推进。

实现阶段生成 Manim 代码。Manim 是一款 Python 动画引擎,可将视觉元素和运动表示为可编程对象。

审核阶段评估生成结果或其底层规范。合成阶段随后将通过审核的场景组装成最终教学视频。

这种阶段拆分是最核心的改变。一步式生成器将大多数决策隐藏在模型响应之中,而据报道,智绘科学会展示中间方案和代码,供人们检查。

项目还在渲染环节加入了修复循环。当 Manim 运行失败时,系统会提取错误信息并将其送回,以便诊断和修正。

因此,最终输出不只是一个视频文件,还包括一条从主题到场景的结构化路径,以及可以继续编辑和重新渲染的代码。

这一区别构成了本文的核心张力。更强的控制能力需要更多工程投入,但教育媒体往往恰恰需要这种控制。

乡村教师为何让这套工作流面临更大压力

课堂动画系统只有在教师无需重做整堂课程便能修正内容时,才算真正成功。

乡村教育为该项目提供了极具社会意义的应用场景,但也带来了严苛的产品约束。不同学校在人员配置、网络连接、设备条件和技术支持方面可能存在巨大差异。

一个精美的演示无法消除这些差异。该系统最终必须能够适应日常课程、有限的备课时间和不稳定的基础设施。

传统内容制作流程首先承受了压力。教师通常只能在静态材料、通用网络视频和耗时较长的定制资源之间作出选择。

通用视频或许能够讲解正确的学科内容,却可能偏离某个班级的具体学习目标。它们可能使用学生不熟悉的符号,以错误的顺序引入概念,或默认学生已经掌握其实际并不具备的知识。

定制动画能提供更多控制,但编写动画代码需要专业技能。手动编辑视频则会带来素材、时间轴、旁白和修改等另一系列成本。

文生视频系统减少了部分制作工作。然而,它们通常优先优化视觉合理性,而不是精确的符号关系。

这种取舍在数学和科学领域尤为明显。图示必须在不同画面中保持标签、几何形状、顺序、比例和因果关系的一致性。

一个视觉上赏心悦目的错误可能比朴素的幻灯片危害更大。学生或许会记住动画,却同时吸收了错误的关系。

智绘科学的应对方式是将教师的请求视为规范。智能体会先将该规范转化为中间文档,再生成最终动画。

这种方法无法保证准确性,但它确实提供了多个干预节点,教师、审核人员或未来的验证系统都可以在这些节点介入。

规划成果可以暴露缺失的概念,场景草稿可以揭示令人困惑的讲解,代码可以显示错误的公式或视觉变换。

这使可编辑性不再只是一种便利,而是成为控制教学风险的方法。

智绘科学也对一键式教育媒体工具形成了压力,因为它的输出仍然是可编程的。教师或开发者可以修改标签、时长、颜色、公式或顺序,而无需重新生成所有场景。

程序化输出也能支持复用。经过审核的场景模板可以用于相关课程,同时保留已获认可的视觉逻辑。

不过,这一优势仍然取决于界面设计。大多数教师并不希望调试 Python 或查看原始场景类。

成功的部署必须隐藏不必要的复杂性,同时保留有意义的控制能力。困难的设计问题在于如何划定这条边界。

教师可以通过表单编辑学习目标、术语、场景顺序和节奏,而技术人员则可以继续访问生成的代码和渲染日志。

网络连接有限的学校还会带来另一项约束。据报道,该系统使用了一个拥有 3970 亿参数的模型,这意味着生成过程很可能需要托管推理服务或规模庞大的远程基础设施。

该模型在处理每个词元时激活 170 亿参数,而非同时使用全部参数。与总参数量相同的稠密模型相比,这能减少计算量,但并不意味着部署会变得轻而易举。

更重要的是,智绘科学并未消除制作基础设施,而是围绕面向教师的工作流重新组织了这些基础设施。

这仍然意义重大。教育团队本就需要管理源文档、课程方案、示例、评估资料和审核意见。

结构化知识工作流可以让这些材料保持关联。用于构建可搜索知识库的工具,提供了一种保存来源和修订记录的相关模式。

因此,这种竞争压力将长期存在。AI 视频产品需要支持来源追溯、修正和复用,而不能将生成视为最后一步。

智绘科学技术拆解:围绕一个渲染器运行的五个智能体

该项目的核心机制,是将创意工作拆分为边界明确、输出可由机器检查的多个阶段。

现有资料使用了多智能体系统这一术语。这里的智能体是指由模型驱动的软件组件,每个组件都被分配了特定任务、工具和预期输出。

这并不一定意味着使用五个独立模型。多个智能体可以采用同一个底层模型,只是使用不同的提示词、工具、上下文和验证规则。

据报道,Qwen3.5-397B-A17B 提供语言和推理层。其官方模型卡显示,该模型总计拥有 3970 亿参数,推理期间激活 170 亿参数。

该模型采用混合专家架构。这种设计会将每个词元路由到选定的专家网络,而非激活完整参数集。

模型卡还显示,该模型拥有 512 个专家,其中会激活十个路由专家和一个共享专家。其原生上下文窗口为 262,144 个词元。

这些规格能够支持包含源材料、规划笔记、场景描述、代码和错误日志的长制作上下文,但并不能单独证明生成内容在教育层面的准确性。

据报道,第一个智能体负责规划。它将宽泛的主题转化为一系列学习目标和视觉单元。

以抛体运动课程为例,一份有效的方案必须决定应该从速度分量、坐标轴、方程还是物理实例开始讲解。

这一决定会影响之后的每个场景。如果方案在定义视觉参照系之前就引入公式,那么再出色的动画质量也无法修复教学顺序。

第二个智能体负责生成草稿。该阶段将教学方案转化为视觉动作、旁白构思和场景级结构。

规划与起草之间的区别,类似于课程意图与媒体执行之间的分离。前者定义学生应该理解什么,后者则决定如何将其展示出来。

第三个智能体使用 Manim 实现场景。根据官方 Manim 快速入门,脚本会在 Scene 类及其 construct 方法中组织动画。

视觉元素会被转化为数学对象,通常称为 mobjects。开发者可以通过代码创建形状、方程、标签、图表和变换。

这种表示方式为工作流的部分环节带来了确定性。代码中定义的圆始终是圆,而公式的位置也可以通过明确的坐标进行设置。

它还使输出具备可编辑性。修改动画时长或标签位置,无需通过提示词重新构建完整视频。

随后,Manim 既作为执行环境,也作为早期验证层。代码要么成功运行,要么产生错误,供外围系统捕获。

这种区别非常重要,因为大型语言模型生成的代码看起来可能合理,却无法正确执行。语法错误、缺少导入、无效的对象引用和不兼容的调用仍是常见的失败模式。

据报道,智绘科普通过自动修复来应对这些故障。系统收集渲染日志,识别可能的故障原因,修改代码,然后再次尝试。

这个循环将被动的模型响应转化为迭代式软件流程。模型不再只是回答一次;它会接收来自外部工具的反馈。

与泛泛要求提高质量相比,渲染错误也更具可操作性。它可以定位故障涉及的文件、操作或代码行。

因此,自动修复可以处理一类范围有限但很实用的问题。它能够纠正执行故障,而不必让教师解读堆栈跟踪。

第四阶段对输出进行审核。公开摘要没有提供足够的细节,无法确定该审核检查的是代码、渲染帧、教学逻辑,还是三者全部。

这种不确定性很重要。成功渲染只能说明动画执行成功,并不能说明讲解在科学上是正确的。

审核智能体可以将脚本与源材料进行对照,检查必需概念,或使用视觉能力分析渲染帧。每种方法能够发现不同类型的错误。

文本审核可以验证公式和解说。代码审核可以发现实现问题。视觉审核可以检测元素碰撞、文字难以辨认和令人困惑的运动效果。

第五阶段对通过审核的场景进行合成。合成环节可以管理场景顺序、转场、音频和最终渲染包。

将合成作为独立环节有助于实现局部重新生成。某个失败或质量欠佳的场景可以单独修改,无须丢弃所有已通过的场景。

这种模块化是智绘科普技术解析中最突出的工程理念。每个智能体都会生成可供下一阶段处理和评估的产物。

它还会形成审计轨迹。团队可以保留初始请求、规划、草稿、生成的代码、审核结果、修复历史和最终输出。

当教育工作者质疑某项表述或提出修改要求时,这些记录会非常有价值。开发者可以将错误追溯到具体的制作阶段。

该系统类似于面向媒体的持续集成流水线。代码生成、执行、检查、纠正和组装以相互连接的操作形式完成。

不过,这种类比也有局限。软件测试可以断言精确的输出,而教学清晰度和概念理解则更难以自动衡量。

因此,当该架构将确定性验证与人工审核相结合时,效果最为理想。渲染测试负责处理执行问题,而教育工作者则判断教学方法和适用性。

成功渲染并不等于课程正确

自动修复可以修好损坏的代码,但无法证明动画内容的真实性或教学质量。

现有报道证实了比赛结果并描述了系统架构,但没有提供涵盖准确性、教师工作量、学生学习成果或部署可靠性的公开基准。

在评估该项目时,应当考虑这种验证缺口。智绘科普是一个很有前景的工程案例,但尚不足以证明由智能体生成的动画能够改善学习效果。

最明显的风险是事实错误。模型可能生成一个有效的 Manim 场景,却展示了错误的方程、颠倒了某种关系,或遗漏了必要条件。

渲染器仍会接受这个场景。由于代码完全按照编写内容正常运行,自动修复不会介入。

审核智能体可以降低这种风险,但它们可能与生成智能体存在相同的盲区。基于同一模型构建的智能体可能会自信地强化同一种错误理解。

因此,外部依据至关重要。工作流应将论断、公式、定义和示例与经过批准的教材或教师提供的参考资料关联起来。

教师在审核时也应当能够看到这些来源。出处信息不能隐藏在检索服务或系统提示词之中。

视觉质量带来了第二种风险。程序化动画可以提供精确控制,但生成的布局仍可能过于拥挤、节奏不佳或难以阅读。

公式可能是正确的,却消失得太快。移动的标签可能与另一个对象重叠。颜色在教室投影仪上可能缺乏足够的对比度。

这些并非无关紧要的外观缺陷。呈现方式会影响学生能否跟上屏幕所展示的推理过程。

本地化也带来了另一项挑战。乡村课堂并非单一类型的受众,教学内容可能需要使用区域术语、本地案例或提供语言支持。

基于广泛互联网数据训练的模型,可能会默认采用与学生日常生活相距甚远的示例。它还可能对专业术语给出不一致的翻译。

隐私同样值得关注。据报道,该工作流以知识主题作为起点,因此与处理可识别学生记录的系统相比,风险较低。

不过,未来版本可能会接收学生问题、评估数据、课堂录音或教师文档。这些输入需要明确的数据保留和访问政策。

UNESCO 的教育指南呼吁对生成式 AI 进行以人为本的验证、隐私保护以及符合年龄特征的使用。

该指南与这个项目最可信的部署路径相契合。教师应继续对课程负责,而智能体则加速备课和修改工作。

基础设施仍是一个现实问题。尽管混合专家架构只会激活网络的一部分,但旗舰 Qwen 模型的规模依然很大。

远程推理会产生对网络连接、服务可用性和数据传输政策的依赖。本地推理则需要许多学校并不具备的硬件和运维专业能力。

因此,面向教育资源不足地区课堂的项目必须区分内容制作与课堂播放。教师可以在具备网络连接的地方生成材料,然后导出视频和源文件包,供离线使用。

源文件包尤其重要。普通 MP4 可以离线播放,但当教师发现问题时,很难对其进行修正。

分发可编辑项目也会带来相应的维护负担。Manim 版本、字体、媒体资源和软件依赖项都可能随时间变化。

团队需要可复现的环境、带版本控制的模板和可靠的导出格式。否则,昨天还可编辑的课程,明天就可能变成无法运行的项目。

目前也没有公开证据表明,这套五阶段工作流能够持续优于更简单的“模型加模板”系统。更多智能体会增加纠错机会,但也会增加延迟和故障点。

规划智能体可能误解主题。起草智能体可能扭曲规划。实现智能体可能错误地简化草稿。

审核智能体可能产生误报,也可能放过细微错误。修复循环可能在解决一个缺陷的同时引入另一个缺陷。

该架构需要在每个阶段边界进行测量。团队应跟踪规划通过率、首次渲染成功率、修复成功率、事实纠正次数、人工编辑时间和最终教师批准率。

学生学习成果需要单独评估。更快地创建内容并不会自动带来更深入的理解或更持久的记忆。

可信的试点项目应当比较采用相同教学目标、由背景相近的教师教授的课程。随后衡量备课时间、错误率、理解程度和延迟回忆表现。

这些限制并不会否定该项目。它们界定了项目从竞赛获奖原型发展为可靠教育系统所需完成的工作。

关键在于避免将可控性与正确性混为一谈。可编辑代码使纠正成为可能,而合格的审核人员和经过验证的来源则让纠正真正有意义。

判断该模式能否推广的三个信号

接下来的考验是,智绘科普能否将令人信服的架构转化为可重复的课堂内容制作流程。

第一个信号是公开的实现包。其中可以包括源代码、智能体提示词、架构定义、示例项目、评估脚本和部署说明。

该竞赛强调开源的公益创新。可用的公开版本能让独立开发者检查各智能体之间如何转移职责。

它还能明确哪些组件可以复用。团队可以判断修复循环是只能与 Manim 配合使用,还是也支持其他代码驱动的媒体工具。

公开的实现包可以证明该系统是一种工程模式,而非经过编排的演示,从而强化其核心主张。

不完整的公开版本则会削弱这一主张。截图和最终视频无法揭示生成失败的频率,也无法说明过程中进行了多少人工干预。

第二个信号是教师持续使用的证据。最有价值的数据应涵盖已完成课程数量、重复使用者数量、编辑时间、拒绝率和支持的学科。

一次性研讨会可以说明教师理解了这个概念。重复使用则能说明该工作流是否适合常规期限下的备课工作。

教师的修改行为尤其值得关注。如果教育工作者经常重写规划,却很少改动生成的代码,产品就应优先增强规划控制功能。

如果代码修复占据工作流的大部分,团队可能需要采用更严格的模板或受约束的生成方式。如果事实纠正占据主导,则应优先加强外部依据。

使用证据还应包括离线和低带宽环境。乡村教育系统不能只依赖在稳定云端访问条件下进行的演示。

第三个信号是独立的教育质量评估。审核人员应评估事实准确性、课程标准一致性、可读性、节奏、无障碍性和年龄适宜性。

该评估应同时检查已通过的输出和被拒绝的尝试。只查看已发布的示例,会掩盖系统真实的错误分布。

如果教师只需有限修改就能批准大部分输出,独立审核将强化该项目的主张。如果仍需专家大量干预,则会削弱这一主张。

这些信号的意义超越单次竞赛。五阶段模式可以推广到科学可视化、公共卫生科普、无障碍材料和其他结构化媒体领域。

它的可移植性来自各阶段之间的接口。规划、起草、实现、审核和合成都是通用的制作职能。

具体工具可以替换。另一套工作流可能会用图表渲染器、幻灯片框架、仿真引擎或网页组件库取代 Manim。

同样的修复原则也可以推广。当 AI 系统操作确定性工具时,执行反馈可以指导其再次尝试。

不过,每个新领域都需要定义自己的正确性标准。代码修复循环无法取代医学审核、无障碍测试或课程标准验证。

从这一约束出发审视智绘科普,最能体现它的价值。它并不是试图用一个更大的模型解决教育内容生成问题。

相反,它将大型模型置于一个流程之中,使规划、代码、日志和修改都成为可见的产物。

对于 AI 辅助的知识工作而言,这是一个更现实的方向。模型执行多项边界明确的任务,而外部工具和人工审核人员则提供反馈。

对于开发者而言,眼下最直接的启示是在增加更多智能体之前,先设计好中间产物。每个阶段都需要明确的输入、输出、验证方法和恢复路径。

对于教育采购者,正确的问题关乎控制与证据。应询问谁负责审批内容、哪些内容仍可编辑、哪些来源为相关主张提供依据,以及如何记录故障。

对于教师而言,决定性标准则更为简单。系统应减少备课工作,同时避免将技术故障排查转移到课堂中。

因此,Zhihui Science 的技术解析最终归结为三项具体检验:可供审查的发布版本、教师的持续采用,以及独立的教育评审。

在这些信号出现之前,该项目应被视为一个结构完善、具备重要工程理念的原型。可编辑式生成可能比不透明的生成方式更安全,但前提是学校能够验证系统所创建的内容。

下一步取决于教育工作者与实施人员。在你的实际环境中,哪一点更重要:更快完成初稿、更清晰地追踪来源,还是在生成后更容易修正?从这一约束出发,再评估分阶段的智能体工作流是否真正减少了与之相关的工作。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page