top of page

USask 更快的视频 AI 降低了计算量,但基准测试差距依然存在

8月11日
讀畢需時 14 分鐘

Google News 重点报道了 University of Saskatchewan 的一套系统:在受控测试中,其处理视频的速度最高可达一种领先研究方法的 20 倍。该系统名为 Learnable Motion-Focused Tokenization,会在视觉模型分析前过滤低运动图像块。这带来了一个颇具吸引力的反差:更好的动作识别或许需要“看得更少”,而不是处理每一个可用像素。

这项研究聚焦于一个范围较窄但影响重大的问题,即视频无监督领域自适应。该过程将动作识别模型从带标签的训练视频迁移到在不同条件下拍摄的无标签视频中。例如,一个在阳光明媚街道上的跑步视频上训练的模型,可能难以识别昏暗公园中的跑步者。

USask 的研究人员认为,静态场景往往会放大这种领域偏移。他们的 LMFT 视频分析方法试图消除这一干扰,同时减少进入 Vision Transformer 的 token 数量。这里相关的对比并非人类注意力与机器注意力之间的比较,而是选择性、运动感知处理与保留所有视频 token 的模型之间的比较。

Google News 报道了 USask 视频 AI 的哪些内容

重要事件是可量化效率结果的发布,而不是围绕它的“人类聚焦”比喻。

USask 的研究公告发布于 2026 年 7 月 8 日。公告介绍了该校计算机科学系 Tzu-Ling Liu、Ian Stavness 和 Mrigank Rochan 的研究工作。他们的论文发表于 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition,通常称为 CVPR。

这篇论文更早便已进入公开研究记录。其 LMFT 论文于 2026 年 4 月 10 日提交至 arXiv。这一时间顺序很重要,因为后来的 Google News 报道普及了读者可在原始研究中查验的发现。

LMFT 是 Learnable Motion-Focused Tokenization 的缩写。Tokenization 将每一帧视频划分为更小的图像块,供 transformer 作为独立单元处理。该方法测量相邻帧中对应图像块之间的像素变化。

低运动图像块很可能包含未变化的墙壁、道路、地板或其他背景细节。LMFT 会丢弃低于学习得到的运动阈值的图像块,保留运动更明显、因此更可能呈现动作的图像块。

这不是传统的视频压缩。该系统并非只是为了存储或传输而缩小文件,而是决定动作识别模型内部哪些视觉单元值得投入计算资源。

该研究聚焦于视频无监督领域自适应,即 VUDA。VUDA 系统接收来自源环境的带标签样本,以及来自目标环境的无标签样本。即使场景、光照、摄像机位置或录制风格发生变化,它仍必须识别相同的动作。

这种情形类似于常见的部署难题:模型在开发阶段表现良好,却会在发布后面对不同的摄像机和周边环境。为每种环境重新收集标签成本高昂,有时也并不可行。

团队在三个既有基准和 21 种适应设置中评估了 LMFT。根据论文,其完整框架在 Daily-DA 上比此前报告的方法高出 5.3 个百分点;在 UCF-HMDB 上高出 1.8 个百分点,在 ActorShift 上则高出 12 个百分点。

这些对比衡量的是作者的完整框架,其中不止包含 token 过滤。系统还采用 CLIP 生成的伪标签和基于置信度的过滤。在这一更广泛的设计中,LMFT 带来了额外收益,并降低了计算需求。

这种区分有助于避免一种轻易出现的夸大表述。结果并不表明单个过滤模块带来了全部准确率提升;它们表明,以运动为中心的 token 选择强化了一个本已具备竞争力的自适应框架。

USask 还表示,该研究获得了 CVPR Computer Gold Star Award。该校称,在超过 16,000 份投稿中,有 18 篇论文获得这一认可。这是值得关注的外部认可,但不能替代部署证据。

Google News 让这项工作获得了更广泛的关注。不过,真正的变化发生在动作识别流程内部:一个学习得到的阈值如今决定多少静态视觉信息能够传入 transformer。

为什么处理每一个视频 token 会带来压力

视频 transformer 面临结构性的成本问题,因为随着 token 数量增加,注意力机制的计算成本会变得更高。

Vision Transformer 将图像转换为图像块 token,并比较这些 token 之间的关系。视频加入了时间维度,会在多个帧中产生图像块。因此,模型可能在识别出关键动作之前,就已累积了很长的 token 序列。

Self-attention,即 transformer 用于比较 token 的机制,其计算成本会随序列长度呈二次方增长。token 数量翻倍,token 之间的关系数量大约会增加四倍。实际运行时间仍取决于硬件和实现方式。

静态背景使这种负担更难以合理化。一面在 16 帧中始终不变的墙,可以生成许多视觉 token,却几乎不贡献运动证据。然而,标准 transformer 仍会将这些 token 与移动的手、工具、车辆或人体一同处理。

背景还可能成为误导性的捷径。假设一个模型在明亮的室内泳池中看到了大多数游泳样本,它可能会将瓷砖图案和蓝色水面与该动作关联起来,而非学习游泳者的运动。

当目标视频来自室外泳池、湖泊或更昏暗的摄像机时,这种捷径可能失效。动作依然相似,但周边外观已经改变。领域自适应方法试图保留可迁移的动作信号,同时降低对场景的依赖。

LMFT 将准确率和效率问题结合起来。研究人员将静态图像块视为计算开销和领域不匹配的来源。移除它们可以缩短 token 序列,并减少模型接触环境特定细节的机会。

论文称,LMFT 在 token 进入主 Vision Transformer 前便将其丢弃。系统通过强化学习学习得到的阈值来进行选择。强化学习利用奖励调整策略,在这里奖励平衡了识别性能与 token 减少量。

阈值十分重要,因为固定规则在不同视频中会有不同表现。固定摄像机的安防视频与手持拍摄的体育视频具有不同的运动模式。学习得到的策略可以在训练期间调整边界,而不是套用一个通用阈值。

在推理时,该方法采用根据训练后策略估计出的确定性阈值。这避免了在部署期间反复采样阈值。论文称,阈值准备完成后,其计算不会带来持续的部署开销。

这给标准的全 token 处理方式带来了压力。如果动作识别系统能够安全地丢弃大量静态信息,那么保留每个图像块就更难以辩护。开发者将把计算资源花在可能削弱不同环境间迁移能力的证据上。

这种压力也延伸至既有的 token 缩减技术。随机丢弃会在不评估内容的情况下移除 token。Token 合并会结合相似表征,而剪枝方法通常通过注意力或多样性信号对 token 排序。

LMFT 则以时间维度上的运动作为选择线索。这种选择使过滤规则与目标任务保持一致,即跨越变化环境识别动作。运动成为判断一个图像块是否值得进一步处理的首要标准。

Google 此前曾通过 TokenLearner 研究探索自适应视觉 token 选择。TokenLearner 从图像和视频中生成一组紧凑的学习型 token。这项工作为用依赖内容的选择取代统一的视觉处理奠定了更广泛的先例。

USask 的贡献针对的是不同问题。它将动态 token 移除与运动证据及跨领域动作识别联系起来。因此,主要竞争是选择性运动处理与不加区分地保留 token 之间的竞争,而不是 USask 与 Google 之间的竞争。

LMFT 视频分析通过“看得更少”实现加速

LMFT 的核心机制是一个受控的信息瓶颈:奖励有用的运动,同时惩罚不必要的计算。

每段输入视频首先会在多个帧中转化为空间图像块网格。系统比较连续帧中处于相同空间位置的图像块,并利用其像素差异估计局部运动强度。

低于阈值的图像块会被移除,高于阈值的图像块则保留给 transformer。保留下来的序列应将计算集中在移动的人、物体或活动中相关的部分。

选择阈值会带来一个困难的优化问题。离散的 token 选择不像普通的可微神经网络操作那样容易处理。因此,研究人员使用策略梯度方法 REINFORCE 来学习阈值。

奖励包含源数据和目标数据的分类损失,也考虑被丢弃 token 的比例。这种设计避免策略为了准确率保留一切,或为了速度移除一切。

在学习步骤中,只采样一个标量阈值。该策略会更新描述其分布的两个参数。作者称,与处理视频 transformer 本身相比,这部分开销可以忽略不计。

更广泛的模型还需要目标环境的标签。由于 VUDA 假设这些标签不可获得,研究人员使用 CLIP 生成伪标签。伪标签是模型生成的类别,在训练期间代替人工标注。

CLIP 将每段目标视频的表征与可用动作类别的文本提示进行比较。该框架仅在预测超过置信度阈值时保留目标样本。在报告的实验中,0.8 的阈值取得了最佳平衡。

这一细节使“LMFT 像人类视觉一样工作”的简单叙事变得复杂。人类不会计算相邻像素差异、运行 CLIP 提示,或通过策略梯度优化标量阈值。这个比喻描述的是选择性注意力,而非实际实现。

可量化结果比这个比喻更有价值。在一个 Daily-DA 方向上,标准 ViT-B/16 基线的准确率为 72.1%,训练耗时 3,810 秒。LMFT 在 2,784 秒内达到 74.2%。

在相反方向上,基线在 1,211 秒内达到 57.5% 的准确率。LMFT 则在 890 秒内达到 60%。两项对比均报告,相较标准 tokenization,训练速度提升了 1.4 倍。

推理结果显示,计算量虽有所下降,但幅度仍然有限且具有相关性。标准分词方式在评估视频片段上需要 266 GFLOPs。LMFT 在一个方向上使用了 217 GFLOPs,在另一个方向上使用了 218 GFLOPs。

一个 GFLOP 代表十亿次浮点运算。这是一项架构层面的估算,并非电费账单或有保证的延迟指标。较低的 GFLOPs 通常意味着更少的计算量,但硬件利用率仍决定实际性能。

在一个方向上,吞吐量从每秒 3.8 个片段变为 3.9 个。在反向任务中,则从每秒 3.5 个片段升至 3.7 个。这些数据并不支持其推理速度相较标准基线出现显著提升的说法。

更大幅度的速度对比涉及 UNITE,另一种视频适应方法。在第一个 Daily-DA 方向中,UNITE 训练需要 27,426 秒,准确率为 71.7%。USask 框架耗时 2,784 秒,准确率达到 74.2%。

第二个方向中,UNITE 耗时 22,070 秒,新框架则为 890 秒。UNITE 的准确率为 49%,USask 方法为 60%。作者将这些结果概括为训练速度大约提升 10 至 20 倍。

这一比较仍应限定在测试所用代码和硬件条件之内。由于竞争论文没有报告可比的效率测量数据,研究人员采用了公开实现。重新实现时的选择可能影响训练时间。

在团队选定的准确率与速度对比中,LMFT 也优于随机 token 丢弃、ToMe、PruMerge 和 DivPrune。一些替代方案降低了理论运算量,却引入了自身的选择开销。例如,DivPrune 在两个报告方向上的处理速度均只有每秒 0.2 个片段。

这些证据支持一个明确结论:低成本地选择 token 与减少其最终数量同样重要。复杂的剪枝算法可能节省 Transformer 运算,却又在 token 评估过程中消耗掉这些收益。

对开发者而言,这一实践经验不限于动作识别。任何视频流水线都应问:其过滤方法的成本是否低于它移除的计算量?答案必须包括预处理、内存搬运以及实际设备吞吐量。

基准测试结果并不能证明其已具备道路部署条件

尚未解决的问题是:当关键证据移动缓慢、短暂或以间接方式呈现时,以运动为重点的过滤是否仍然可靠。

这项研究评估的是学术动作识别基准测试。它并未报告在医院、自动驾驶车辆、工厂或公共安全系统中的生产部署。大学公告中的这些例子描述的是潜在应用,而非已验证的产品。

这种差异在安全敏感场景中尤为重要。缓慢变化的交通灯、静止的警示标志或不动的手术器械都可能承载关键信息。如果周围模型无法恢复这些信息,以运动为中心进行优化的系统可能低估这类上下文。

LMFT 并不会盲目消除每一个静态图像块。其学习到的阈值会在训练目标上平衡准确率与 token 缩减。不过,基准测试中的奖励只反映所选数据集和标签所衡量的内容。

这三个基准测试提供了有用的多样性,但无法代表所有摄像机、天气条件、动作或运行故障。ActorShift 专门测试演员和环境的变化。Daily-DA 和 UCF-HMDB 则结合了具有不同视觉风格的成熟动作数据集。

这些结果也来自系统自身的作者。CVPR 的发表和效率奖提升了对研究过程的信心。独立复现将为其在不同实现和计算平台上的可移植性提供更有力的证据。

另一个不确定性与摄像机运动有关。LMFT 通过对应图像块位置上的时间差异估计运动。即使重要主体只占据很小区域,移动的摄像机也会让画面的大部分区域看起来处于活动状态。

论文的视觉分析称,尽管视角存在变化,LMFT 仍选择了与动作相关的区域。这在展示的案例中令人鼓舞。更广泛的测试应单独考察手持拍摄的运动、快速摇镜、变焦、稳定化伪影和滚动快门畸变。

遮挡带来了相关挑战。相关人员或物体可能暂时消失在另一个物体后方。以运动信息为主的过滤必须保留足够的时间与空间上下文,才能在这种中断后识别完整动作。

细微动作值得进行单独测试。打字、测量脉搏、操作小型部件或改变面部表情,涉及的明显运动比跑步更少。当动作证据仅覆盖极少数图像块时,像素差异阈值可能难以应对。

伪标签流水线增加了另一项依赖。CLIP 生成的标签可能出错,尤其是在类别差异主要体现为细微运动而非可见物体时。置信度过滤会移除较弱的预测,但也可能排除部署中重要的困难样本。

论文报告称,其准确率相较早期 VUDA 方法有显著提升。不过,即使不使用 LMFT,该框架本身也已受益于高质量伪标签。读者应区分过滤模块的贡献与完整训练方案带来的改进。

比较结果还显示,更高的基准准确率并不总会带来显著的吞吐量变化。在报告的 Daily-DA 测试中,相较标准分词,LMFT 将理论计算量降低了约 18%。每秒片段数仅略有增加。

这种差距可能源于固定的系统成本。当注意力机制接收更少 token 时,数据加载、图像块生成、token 选择和 GPU 同步并不会消失。更小的模型或边缘设备可能暴露出不同的瓶颈。

Rochan 将更低的计算需求与本地托管 AI 联系起来。这种可能性契合了日益增长的趋势:在敏感信息来源附近处理数据。然而,论文并未证明其在边缘硬件上的内存、电池、散热或延迟表现。

本地处理可能适用于私密的工作场所或研究视频。它也可在不将每一帧发送到远程服务的情况下支持可搜索的记录。相关系统仍必须实施访问控制、保留政策和有意义的同意机制。

处理研究视频的知识工作者可以在分析后受益于结构化检索。一个 知识融合 工作流可以将提取出的观察结果与笔记和文档关联起来。LMFT 本身并不提供该存储或检索层。

因此,AI 学会像人类一样聚焦的说法应被视为便于理解的简化表述。该模型学习到了一种运动阈值,可改善选定的适应测试。它并未获得人类的视觉注意力、情境判断或语义理解能力。

这一更狭义的成果仍然有价值。良好的工程实践往往来自识别系统能够安全忽略哪些信息。悬而未决的问题是,LMFT 对不重要信息的定义能否在其基准测试之外的环境中成立。

Google News 读者接下来应关注什么

三个信号将决定 LMFT 是成为可复用的视频组件,还是仅停留在强劲的基准测试结果。

第一个信号是独立复现。研究人员需要在相同基准上运行该框架,然后报告准确率、训练时间、推理吞吐量、内存使用量和 GFLOPs。若能匹配已发表结果,将增强人们对其核心效率主张的信心。

复现应包括相同硬件和更广泛的设备类别。服务器 GPU 与笔记本电脑、嵌入式加速器或汽车硬件对选择开销的掩盖方式可能不同。为效率设计的方法必须证明这些节省会在哪里以实际形式显现。

第二个信号是超越传统动作基准的评估。测试应包括移动摄像机、小幅动作、长视频、杂乱场景、遮挡以及与安全相关的静态线索。在未见数据集上的结果将表明,运动选择是否能泛化到原始训练方案之外。

一个特别有用的实验是改变 LMFT 保留的静态 token 数量。研究人员随后可以测量上下文信息何时会成为准确决策的必要条件。这将揭示有益过滤与破坏性信息丢失之间的边界。

第三个信号是与更大型视频系统的整合。LMFT 目前面向动作识别的无监督领域适应。若被纳入视频语言模型、机器人流水线或流媒体分析系统,将检验其机制能否迁移至不同目标。

这种整合不应假定每项任务都以运动为中心。视频问答可能依赖文本、物体、地点和保持静态的事件。通用系统可能需要以运动为重点的 token,同时保留较小样本的上下文 token。

未来工作还可以比较学习式运动过滤与语义剪枝。运动选择回答的是帧之间发生了什么变化。语义选择回答的是对所请求任务而言什么更重要。结合两种信号,或许能在减少冗余计算的同时保留关键上下文。

研究人员的视频适应论文提供了更多方法学细节。它也将 LMFT 置于一项更长期的努力中:通过多模态学习和高效 token 化改进适应能力。

这项工作属于向动态视觉 token 化转变的更广泛趋势。固定图像网格实现简单,但会对不等量的信息投入相同的初始注意力。自适应方法试图让 token 预算与内容和任务相匹配。

LMFT 为这一讨论提供了明确立场。运动不仅是动作识别特征,也可以作为计算资源的早期分配规则。

Google News 读者不应将这一发现夸大为有关视频 AI 的普遍主张。该研究并未证明每个模型都应忽略静态场景。它表明,一个运动感知过滤器在明确界定的适应测试中提升了效率和准确率。

最具影响力的结果可能在于方法学层面。论文在报告准确率的同时报告效率,并直接比较训练时间、推理运算量、吞吐量和内存。随着模型走向资源受限设备,计算机视觉研究需要这种多维度报告。

评估这一思路的开发者应提出三个实际问题。目标任务是否主要依赖运动?token 选择的成本是否低于它移除的处理成本?系统能否检测静态上下文何时仍然重要?

企业买家应要求提供来自自身摄像机环境的证据。一个精致的基准平均值无法预测其在每个仓库、诊所、道路或办公室中的表现。试点测试应涵盖实际涉及的光照、运动、硬件和故障成本。

研究人员也应发表负面案例。展示 LMFT 移除了必要证据的实例,将明确其安全运行范围。这些案例可以指导混合方法,保留选定的静态图像块,或使过滤适应任务指令。

Google News 的标题提供了一个令人难忘的描述:AI 学会了更像人一样聚焦。研究支持的是一个更精确的结论。USask 教会了一个视频适应系统,在低运动图像块上投入更少计算。

这一结果意义重大,因为它将效率与准确性联系在一起,而非将二者视为天然对立。不过,这尚不足以证明其能够在真实世界中可靠部署。接下来的独立测试将决定这种平衡能否在实验室之外延续。

值得关注的是可复现的时序测试结果、更广泛的域外评估,以及其是否被集成到真实的视频产品中。如果三者都能出现,以运动为核心的令牌化将成为一种可迁移的设计模式。如果未能实现,Google News 则将获得一项出色的研究成果,但其实际应用范围仍有待确定。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page