top of page

通义实验室发布 Wan-Streamer v0.2,端到端延迟达 550ms,但由更多 GPU 承担负载

已更新:7月20日

通义实验室发布 Wan-Streamer v0.2,在将输出分辨率从 192×336 提高到 640×368 的同时,实现了 550ms 的端到端延迟。Alibaba 的 Wan 团队表示,该模型仍能以每秒 25 帧生成视频。最引人注目的改进是视频更加清晰,而报告的响应时间并未延长。

这一成果并非源于高分辨率生成成本的降低。相反,通义将延迟敏感型工作隔离在一个 GPU 上,并将计算成本高昂的视频生成任务分配给另一个独立的 GPU 组。此次升级通过在界面背后投入更多并行算力来保持响应速度。

这使 Wan-Streamer v0.2 成为对交互式 AI 两种竞争路线的一次检验。级联系统将专门的语音、推理、动画和渲染组件连接起来。Wan-Streamer 则将感知与生成置于同一条因果时间线上,然后通过精心划分的服务流水线使其持续运行。

通义实验室发布 Wan-Streamer v0.2,端到端延迟达 550ms

此次发布在保持第一版所设延迟目标的同时,提升了 Wan-Streamer 在视觉层面的实用性。

通义的 Wan 团队于 2026 年 7 月 5 日发布了 Wan-Streamer v0.2。随附的 v0.2 论文将其描述为一次面向实时视听交互、保持延迟不变的升级。

输出分辨率从 v0.1 的 192×336 像素提高到 v0.2 的 640×368 像素。据团队介绍,两个版本都以每秒 25 帧运行。

这意味着每帧的输出像素数增加到约 3.6 倍。它为模型提供了更多空间来呈现姿态、目光、手部、附近物体和环境细节。

Wan-Streamer v0.1 主要适合视频通话式的近景构图。在更宽广的场景中,人物身体和周围物体会被压缩到很小的画面里。当说话者面部以外的动作十分重要时,这限制了模型的实用性。

Wan 团队表示,v0.2 支持以场景为基础的中景镜头,这意味着生成的角色在清晰可辨的周围环境中仍然可见。其发布演示包括室内外场景中的教师、动物、虚构角色和类人智能体。

这些演示首先通过自然语言提示词设定角色和场景。团队报告称,提示词预填充可在约半秒内完成。此后,角色便可参与持续的视听对话。

更重要的数字是报告中的 200ms 模型端信号到信号延迟。通义将这段间隔定义为:从用户输入单元可用,到对应视听响应完成解码的时间。

被广泛引用的 550ms 数字还包括单独预留的 350ms 双向网络延迟。因此,它是一个远程交互总时延的建模值,并非适用于每位用户、每种连接或每项部署的通用测量结果。

带宽限制同样不包含在报告的模型端延迟之内。生产服务必须可靠地传输更高分辨率的视频,这可能带来论文处理时间测量之外的延迟。

该系统以 160ms 的流式单元运行。每个单元承载持续交互中的一个短片段,而不是等待完整问题或整个对话轮次结束。

这一点十分重要,因为感知到的响应速度并不只取决于文本生成有多快。交互式角色必须能够倾听、说话、移动、保持视觉身份一致,并在被打断时作出反应,同时不破坏同步。

Wan-Streamer 尝试将这些行为作为一个连续过程来学习。用户视频、用户音频、生成的语音、生成的动作以及内部语言状态,都会共同参与不断演进的交互历史。

通义实验室发布 Wan-Streamer v0.2,实现 550ms 端到端延迟,但分辨率的提升也带来了本文的核心矛盾:对用户而言,体验看起来更轻快、更即时,底层系统却变得更加沉重。

为什么端到端模型对级联式 AI 智能体构成挑战

Wan-Streamer 的核心观点是:实时交互应当作为一种统一的因果行为来学习,而不是等多个独立模型分别完成工作后再组装起来。

传统的视听智能体通常采用级联架构。语音活动检测识别说话内容,自动语音识别生成文本,语言模型再决定如何回答。

随后,文本转语音系统生成音频。独立的虚拟形象或视频模型负责为面部和身体制作动画。其他软件则将唇部动作与生成的语音对齐。

每个边界都可能增加等待时间。在流水线前期产生的错误,也可能延续至之后的每一个阶段。

错误的转录可能导致答非所问。延迟的语音可能造成口型错位。独立的动画系统甚至可能在智能体已经决定回应后,仍然显示中性的倾听姿势。

级联架构依然具有吸引力,因为其组件可以替换,也更容易检查。团队无需重新训练渲染器就能升级语音识别。他们还可以对文本、音频和视频应用不同的安全控制措施。

Wan-Streamer 采用了相反的路线。最初的 v0.1 架构将输入与输出的文本、音频和视频表示为交错的 token,并由一个 Transformer 进行处理。

Transformer 是一种利用注意力机制连接序列中不同信息的神经网络架构。Wan-Streamer 引入了分块因果注意力,将每个流式数据块能够访问的信息限制为当时已经可用的内容。

这可以防止系统依赖尚不存在的未来帧。它能够处理一个传入单元、更新交互状态,并以增量方式生成下一个响应单元。

这一设计还移除了用于语音识别、语言生成、语音合成、虚拟形象动画和视频生成的外部模块。通义表示,这些功能在同一个模型内进行联合学习。

“端到端”不应被误解为“单次操作”。Wan-Streamer 仍然要对信号进行编码、更新状态、生成潜在表示并解码输出。区别在于这些阶段如何接受训练和相互协调。

生成的输出也会返回模型的交互历史。下一次响应可以取决于智能体先前的语音、表情、位置和动作。

这种反馈循环对于全双工通信十分重要。全双工意味着双方可以同时发送和接收信号,就像人们在倾听、打手势、说话和打断对方时一样。

基于轮次的助手通常会等到一个停止点才开始回应。它们可能在产品层面支持打断,但其内部工作流仍然类似于交替进行的请求与回答。

Wan-Streamer 将可见的倾听行为视为响应的一部分。智能体可以在生成自己的语音和动作时继续观察用户。

这种方式给使用一系列专业服务构建数字人的开发者带来了压力。统一系统有望实现更紧密的时间协调,因为它不需要反复在相互割裂的表示之间转换交互信息。

然而,模块化系统仍具有实际优势。其日志能够展示中间转录和模型输出。企业可以审计各个阶段、更换供应商,或让敏感数据通过范围更受限的组件进行处理。

因此,这场竞争并不只是统一智能与传统软件之间的较量,而是统一的时间协调能力与模块化控制、可调试性及运营灵活性之间的较量。

Wan-Streamer v0.2 通过提高视觉输出的实用性,增强了统一系统这一方的竞争力。低分辨率的说话人脸可能会被视为研究演示,而清晰可辨的中景镜头则让教学、客服、娱乐和引导式交互距离实际部署更近一步。

该模型仍需提供精选场景之外的证据。各类组织会想知道,它能否应对口音、打断、光线不佳、背景噪声、长时间会话和意外视觉事件。

这些问题无法仅凭延迟指标回答。它们需要对完整视听闭环开展行为评估,而这恰恰是统一模型更难诊断的地方。

思考者与执行者的分工掩盖了更高分辨率的成本

Wan-Streamer v0.2 通过保护紧凑的控制路径,并将高分辨率生成转移到多个 GPU 上来保持响应时间。

通义将这两种服务角色称为 Thinker 和 Performer。它们是同一个已训练模型中的部署角色,而不是两个独立训练的助手。

Thinker 仍运行在一个 GPU 上。它负责因果音频与视频编码、短时语言和状态更新、键值缓存构建以及最终解码。

键值缓存存储来自先前 token 的注意力信息。重复使用这些信息,可以让模型继续生成序列,而无需重新计算完整的历史记录。

Performer 负责计算成本高昂的潜在视频生成。潜在表示是一种压缩的内部表示,之后由解码器将其转换为可见帧。

Wan-Streamer v0.1 使用单 GPU Performer。v0.2 则将该组件改为使用 Ulysses 式上下文并行技术的多 GPU 组。

上下文并行将长序列分配给多个处理器。每台设备负责其中一部分,同时通过通信操作交换注意力计算所需的信息。

在 v0.2 中,Performer 将较长的高分辨率视频潜在序列分配到不同 GPU rank 上。各部分并行去噪,随后汇总结果用于解码。

音频序列要短得多。通义表示,拆分音频所增加的通信开销会超过其加速收益,因此音频潜在表示不会被分片。

Thinker 将紧凑的缓存切片发送给 Performer 组。独立的语言序列不会通过该 GPU 组传输,因为其状态已体现在缓存中。

这一边界至关重要。在每台设备之间传输大型中间序列,可能会抵消并行计算获得的延迟优势。

服务调度会让相邻流式单元中的多项操作重叠执行。Thinker 可以在解码前一个输出的同时感知当前输入。与此同时,Performer 会生成下一个潜在视频片段。

通义表示,只要 Performer 的计算和通信能够在一个 160ms 单元内完成,系统就能保持实时吞吐量。完整的模型端信号路径仍约为 200ms。

这区分了吞吐量与响应延迟。吞吐量关注系统能否以所需速率持续生成单元。响应延迟则衡量某个特定输入需要多长时间才能影响已发出的输出。

当各项工作有效重叠时,流水线可以同时保持较高吞吐量和较低响应延迟。如果某个阶段超过分配的时间窗口并形成不断增长的队列,系统也可能突然失效。

因此,Thinker-Performer 架构的重要性超过了分辨率数字本身。至少在报告的配置下,它将新增硬件转化为并行的视觉计算工作,而没有延长控制循环。

其代价是基础设施强度的增加。Wan-Streamer v0.2 需要一个 GPU 运行 Thinker,并需要多个 GPU 组成 Performer 组,不过论文并未指定通用的部署配置。

团队也没有发布与级联式替代方案的完整成本对比。现有材料未提供能耗、并发会话容量、内存需求或每分钟交互成本等数据。

这些缺失的信息妨碍了公平的商业比较。550ms 的演示可以证明技术可行性,却不能证明其能够以经济合理的方式大规模提供服务。

多 GPU 通信也会带来运维限制。该方法依赖高速互连,以及各个 Performer rank 之间可预测的同步。

如果部署在速度较慢或资源高度共享的基础设施上,可能无法满足 160ms 的时间窗口。用户与服务之间的网络拥塞还会在模型之外增加延迟。

Tongyi Lab 发布 Wan-Streamer v0.2,通过保持 Thinker 精简并横向扩展 Performer,实现了 550ms 的端到端延迟。延迟之所以保持不变,是因为硬件拓扑发生了变化,而不是因为提高分辨率不再需要成本。

这一模式的应用范围不只限于数字人。未来的多模态服务可以为感知与决策预留快速路径,同时由并行系统生成计算成本高昂的媒体内容。

风险在于,视觉响应迅速的智能体可能只有在高端或严格受控的部署环境中才具备经济可行性。在 Tongyi 公布容量和硬件数据之前,这仍是一个悬而未决的问题。

550ms 声明未能证明什么

在 Tongyi 定义的协议范围内,其报告的延迟是可信的,但这尚未成为经过独立复现的产品基准。

论文清楚解释了其响应边界。当一个 160ms 的用户单元可供 Thinker 处理时,测量开始;在对应的视听响应单元完成解码、准备输出后,测量结束。

按照这一定义,Tongyi 报告的模型侧延迟约为 200ms。随后再加上 350ms 的双向网络预算,得出约 550ms 的远程交互总延迟。

这一计算很直观,但在解读时需要谨慎,因为竞品系统通常采用不同的测量端点。

一种服务可能报告首个音频数据包的到达时间,另一种可能测量首个可见画面的出现时间,第三种则可能将端点检测、缓冲、传输和应用渲染全部计入。

Wan 论文承认了这一测量问题。当不同产品对响应起点和终点的定义不同时,直接比较可能产生误导。

350ms 的网络项也是一种假设,而非保证。距离较近且连接稳定的用户可能经历更低的传输延迟,而距离较远或带宽受限的用户则可能经历高得多的延迟。

更高的分辨率会增加需要编码和传输的输出数据量。模型侧结果并未涵盖所有与带宽相关的传输影响。

与延迟相比,视觉质量获得的量化支持较少。研究人员描述了对面部细节、视线、嘴部动作、手部、姿态、物体和场景布局的定性检查。

论文没有提供大规模第三方偏好测试,也缺少针对身份稳定性、口型同步、动作质量、事实性回答准确率或长时间会话一致性的标准化评分。

精心筛选的演示可以展示系统在特定条件下能够生成什么,却无法揭示完整的失败分布。

角色可能在短时间对话中保持稳定,却在长时间会话中发生漂移。手部在某个场景中可能看起来清晰,但在快速移动或操纵物体时可能出现变形。

同样的不确定性也适用于对话行为。一个令人信服的虚拟形象必须能够理解打断、情绪线索、视觉指代以及用户意图的变化。

低延迟让这些交互成为可能,但低延迟并不能证明回答是正确的。一个迅速给出的错误可能感觉更自然,但它仍然是错误。

安全评估是另一个缺口。生成同步语音和类人视频的系统,会带来超出文本助手范畴的身份冒充、操纵和信息披露风险。

研究材料没有描述完整的生产环境安全政策,也没有说明已部署的服务将如何标注合成角色或防止未经授权的身份使用。

统一模型让审核变得更加复杂,因为有害行为可能跨越多种模态。一段看似无害的文字记录,可能伴随着误导性手势、视觉符号或冒充他人的外貌。

级联系统可以分别对文本、音频和渲染结果应用过滤器。Wan-Streamer 的集成式行为可能需要同样集成式的监控,而这仍是一个尚不成熟的运维领域。

隐私同样值得关注。全双工交互会持续处理麦克风和摄像头输入。企业用户在将此类系统用于敏感场景之前,需要明确的数据保留、访问和部署控制。

评估视听智能体的团队应将测试录像、提示词、延迟追踪数据和故障记录保存在可搜索的 AI 知识库中。汇总指标本身可能掩盖反复出现的交互故障。

版本发布也推进得很快。Tongyi 于 7 月 16 日发布了 v0.3,距离 v0.2 论文投稿仅十一天。

v0.3 论文沿用了相同的 640×368、25 FPS、160ms 单元和所报告的延迟目标,并围绕持久存在的“世界”和不断变化的“事件流”重新阐释了模型。

快速迭代并不意味着 v0.2 已经失去意义。v0.2 确立了 v0.3 继续沿用的服务拓扑和更高分辨率运行点。

但这确实意味着,读者应将 v0.2 视为一个快速演进的研究里程碑,而不是稳定的产品世代。在组织完成采购或集成之前,评估结果可能已经过时。

最有力的结论其实很有限。Tongyi 提出了一种特定架构,据报告,该架构在提高视觉分辨率的同时维持了此前的延迟测量结果。

更广泛的主张仍无定论。公开证据尚未证明其生产成本、在不可控条件下的可靠性、延迟的独立复现结果或大规模安全运行能力。

决定 Wan-Streamer 是否重要的三个信号

下一阶段取决于独立复现、真实的部署经济性,以及其他实时多模态系统的竞争性回应。

第一个信号是在公开硬件和网络条件下可复现的延迟。研究人员或客户需要足够详细的实现信息,才能复现 200ms 的模型侧结果。

一项有参考价值的测试应明确 GPU 型号、Performer 组规模、互连方式、批量大小、会话并发量、编码设置和地理距离。它还应报告延迟百分位数,而不仅是一个近似的中间值。

持续性能比一次短暂的成功交互更重要。系统必须能够在长时间对话中维持其流式调度节奏,而不会不断累积延迟。

如果独立测试结果接近 Tongyi 的目标,就会增强其架构核心主张的可信度。如果差异很大,则可能说明该演示依赖专用基础设施或有利条件。

第二个信号是会话经济性。Tongyi 需要说明单次部署能够支持多少个并发对话,以及共享负载下的质量如何变化。

Thinker-Performer 拆分将高分辨率工作集中到一个 GPU 组上。这种设计对降低延迟是合理的,但容量决定了它能否在演示之外发挥作用。

商业服务必须在视觉保真度、并发能力、模型大小、传输带宽和正常运行时间之间取得平衡。需求上升时,运营方可能会降低分辨率或帧率。

如果 Tongyi 能够在并发会话中保持 640×368 输出和较低的尾部延迟,Wan-Streamer 用于客户支持、辅导、娱乐和互动媒体的可行性将更具可信度。

如果系统需要为每位用户配置专属的多 GPU 组,其应用范围就会缩小。这种体验或许仍适合高端角色,但不会成为通用界面。

第三个信号是竞争对手将如何回应统一因果模型。实时语音系统已经展示了快速且可打断的语音能力,而虚拟形象平台也越来越多地采用同步视频流。

关键在于,这些提供商会继续保持模块化,还是将更多感知和生成能力整合到共享状态中。它们也可能保留级联架构,同时改进调度和跨模态同步。

竞品系统不必完全照搬 Wan-Streamer。它只需在可比的测量标准下,在对话时序、视觉一致性、可控性和成本方面达到相当水平。

标准化评估会有所帮助。市场需要为信号到信号延迟、首段音频、首帧画面、打断响应、视听对齐和长时间会话漂移制定统一定义。

如果缺乏统一端点,每家提供商都可以报告一个对自己有利、却描述不同体验的数字。买家无法仅凭醒目的延迟数字做出有理有据的比较。

Tongyi 自身的发布节奏也是一个实际指标。v0.3 已经在改变训练框架的同时,保留了 v0.2 的性能目标。

未来更新应揭示团队能否在不增加延迟或基础设施投入的情况下,改善场景稳定性和行为表现。团队还应公开更有力的量化评估。

对于开发者而言,眼下的启示在于架构:媒体生成可以消耗更多并行计算资源,同时由一条更小的路径保障交互时序。

对于企业买家而言,启示在于流程:应要求使用真实用户、现实网络连接、长时间会话和并发负载进行端到端测试。

对于 AI 用户而言,变化体现在体验上。一个能够持续聆听、说话和移动的角色,与每轮对话后才生成动画回复的助手给人的感觉截然不同。

这种差异可以改善辅导、无障碍服务、远程指导、娱乐和角色扮演练习。它也可能增强错误或欺骗性输出的说服力。

Tongyi Lab 发布了端到端延迟为 550ms 的 Wan-Streamer v0.2,但这个数字应该成为评估的起点,而不是终点。值得关注的是可复现的尾部延迟、公开的会话容量,以及可供比较的竞品测量结果。

如果这些信号出现,Wan-Streamer 的统一因果方法将展现出成为长期平台方向的潜力。如果没有,v0.2 仍将只是一次令人印象深刻的演示,展示集中式并行硬件能够在一张响应迅速的面孔背后隐藏多少复杂性。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page