USaskの高速ビデオAI、計算量を削減もベンチマーク間の差はなお残る
Google Newsは、統制されたテストで主要な研究手法の一つより最大20倍高速に動画を処理したサスカチュワン大学のシステムを取り上げた。Learnable Motion-Focused Tokenizationと呼ばれるこのシステムは、視覚モデルが解析する前に、動きの少ない画像パッチを除外する。ここには興味深い逆説がある。より優れた行動認識には、利用可能なすべてのピクセルを処理することではなく、見る情報を減らすことが必要かもしれない。
この研究が扱うのは、ビデオ教師なしドメイン適応と呼ばれる限定的ながら重要な問題だ。このプロセスでは、ラベル付きの学習動画から行動認識モデルを、異なる条件で撮影されたラベルなし動画へと移転する。例えば、晴れた街路で撮影された走行動画で学習したモデルは、暗い公園を走る人の認識に苦戦する可能性がある。
USaskの研究者らは、静的な景観がこのドメインシフトをしばしば増幅させると主張する。LMFTのビデオ解析手法は、Vision Transformerに入力されるトークン数を減らしながら、このノイズを取り除こうとする。比較すべきなのは人間の注意と機械の注意ではない。動きを認識した選択的処理と、あらゆるビデオトークンを保持するモデルとの比較である。
Google Newsが取り上げたUSaskのビデオAI
重要な出来事は、人間の焦点に関する比喩ではなく、測定可能な効率結果が公表されたことだ。
USaskの研究発表は2026年7月8日に公開された。サスカチュワン大学コンピュータサイエンス学科のTzu-Ling Liu、Ian Stavness、Mrigank Rochanによる研究を紹介している。論文は、一般にCVPRとして知られる2026 IEEE/CVF Conference on Computer Vision and Pattern Recognitionで発表された。
論文はそれ以前に公開研究記録へ加わっていた。LMFT論文は2026年4月10日にarXivへ投稿された。この時系列は重要だ。後のGoogle Newsによる報道は、読者が元の研究で確認できる知見を広く知らしめたからである。
LMFTはLearnable Motion-Focused Tokenizationの略だ。トークン化では、各動画フレームを、Transformerが個別の単位として処理できる小さなパッチに分割する。この手法は、隣接フレーム内で対応するパッチ同士のピクセル変化を測定する。
動きの少ないパッチには、変化しない壁、道路、床、その他の背景の詳細が含まれている可能性が高い。LMFTは、学習された動きのしきい値を下回るパッチを捨てる。より強い動きを含み、行動を表している可能性が高いパッチを保持する。
これは従来の動画圧縮ではない。単に保存や送信のためにファイルを縮小するのではない。行動認識モデル内部で、どの視覚単位に計算資源を割くべきかを判断する。
研究の焦点は、VUDAとも呼ばれるビデオ教師なしドメイン適応だ。VUDAシステムは、ソース環境からラベル付きの例を、ターゲット環境からラベルなしの例を受け取る。景観、照明、カメラ位置、撮影スタイルが変化しても、同じ行動を認識しなければならない。
この設定は、よくある実運用上の問題に似ている。モデルは開発中には良好に機能しても、リリース後には異なるカメラや周辺環境に直面する可能性がある。あらゆる環境で新たにラベルを収集するのは高コストで、実現が難しい場合もある。
チームはLMFTを、3つの確立されたベンチマークと21の適応設定で評価した。論文によると、その完全なフレームワークはDaily-DAで従来報告された手法を5.3ポイント上回った。UCF-HMDBでは1.8ポイント、ActorShiftでは12ポイントの差だった。
これらの比較は、トークンのフィルタリング以上の要素を含む、著者らの完全なフレームワークを対象としている。このシステムはCLIPが生成した疑似ラベルと、信頼度に基づくフィルタリングも使用する。LMFTは、このより広い設計の中で、追加的な性能向上と計算負荷の低減に寄与している。
この区別は、安易な誇張を避けるために重要だ。結果は、単一のフィルタリングモジュールがすべての精度向上を生んだことを示しているわけではない。動きに焦点を当てたトークン選択が、すでに競争力のある適応フレームワークを強化したことを示している。
USaskは、この研究がCVPR Computer Gold Star Awardも受賞したと述べている。同大学によれば、16,000件を超える投稿のうち18件の論文がこの評価を得た。これは注目すべき外部からの評価だが、実運用での証拠に代わるものではない。
Google Newsはこの研究の認知を広げた。しかし根本的な変化は、行動認識パイプラインの内部で起きている。学習されたしきい値が、どれだけの静的視覚情報をTransformerへ到達させるかを決めるようになった。
すべてのビデオトークンを処理することが生む負荷
ビデオTransformerは、トークン数の増加に伴って注意機構のコストが高まるため、構造的なコスト問題を抱えている。
Vision Transformerは、画像をパッチトークンに変換し、それらのトークン間の関係を比較する。動画では時間軸が加わり、複数フレームにわたってパッチが生成される。そのため、モデルは重要な行動を特定する前に、長いトークン列を蓄積する可能性がある。
トークンを比較するTransformerの仕組みである自己注意は、系列長に対して二乗で増加する計算コストを持つ。トークン数を2倍にすると、トークン間の関係はおおむね4倍になる可能性がある。実際の実行時間は、ハードウェアや実装上の選択にも依存する。
静的な背景は、この負荷を正当化しにくくする。16フレームにわたって変化しない壁は、動きの証拠にほとんど寄与しないにもかかわらず、多数の視覚トークンを生み出しうる。それでも標準的なTransformerは、動く手、道具、車両、身体と並行して、これらのトークンを処理し続ける。
背景は誤解を招く近道にもなりうる。例えばモデルが、明るい屋内プールの映像で泳ぐ例の大半を見ていたとする。すると、泳者の動きを学習する代わりに、タイルの模様や青い水を行動と関連付けるかもしれない。
その近道は、ターゲット映像が屋外プール、湖、あるいはより暗いカメラ映像から来た場合に失敗しうる。行動自体は似ていても、周囲の見た目が変化するためだ。ドメイン適応手法は、景観への依存を抑えながら、移転可能な行動シグナルを保持しようとする。
LMFTは、こうした精度と効率の問題を組み合わせて扱う。研究者らは静的パッチを、計算上のオーバーヘッドであると同時に、ドメイン不一致の原因として捉えている。これらを除去すれば、トークン列を短縮し、環境固有の詳細にモデルが触れる量を減らせる可能性がある。
論文によると、LMFTはメインのVision Transformerへ入る前にトークンを削減した。選択には、強化学習で学習したしきい値を用いている。強化学習は報酬を用いて方策を調整する手法で、ここでは認識性能とトークン削減のバランスを取る。
動画ごとに固定ルールを適用すると、しきい値の振る舞いは異なる。固定カメラの監視映像には、手持ち撮影のスポーツ映像とは異なる動きのパターンが含まれる。学習された方策なら、単一の普遍的なカットオフを適用するのではなく、学習中に境界を調整できる。
推論時には、この手法は学習済み方策から推定した決定論的なしきい値を使用する。これにより、デプロイ時にしきい値を繰り返しサンプリングする必要がない。論文によれば、しきい値の計算は準備後、継続的なデプロイ上のオーバーヘッドを生じさせない。
これは標準的な全トークン処理に問いを投げかける。行動認識システムが大量の静的情報を安全に捨てられるのであれば、あらゆるパッチを保持することは擁護しにくくなる。開発者は、環境間の移転を弱めうる証拠に計算資源を費やすことになる。
この圧力は、既存のトークン削減技術にも及ぶ。ランダムドロップは内容を評価せずにトークンを除去する。トークンマージは類似した表現を統合し、枝刈り手法はしばしば注意や多様性のシグナルを通じてトークンを順位付けする。
対してLMFTは、時間的な動きを選択の手がかりとして用いる。この選択は、変化する環境間で行動を認識するという対象タスクに、フィルタリング規則を整合させている。動きが、パッチをさらに処理する価値があるかを判断する最初の基準となる。
Googleは以前、TokenLearner researchを通じて、適応的な視覚トークン選択を探究していた。TokenLearnerは、画像や動画からコンパクトな学習済みトークンの集合を生成した。この研究は、一律の視覚処理をコンテンツ依存の選択に置き換えるための、より広い先例を確立した。
USaskの貢献は異なる問題を対象とする。動的なトークン除去を、動きの証拠とクロスドメイン行動認識に結び付けている。したがって主な対比は、選択的な動き処理と無差別なトークン保持の間にあり、USaskとGoogleの対立ではない。
LMFTのビデオ解析は、見る情報を減らすことで高速化する
LMFTの中心的な仕組みは、有用な動きに報い、不必要な計算にペナルティを課す、制御された情報ボトルネックだ。
各入力動画はまず、複数フレームにまたがる空間パッチのグリッドへ変換される。システムは、連続するフレーム内の同じ空間位置にあるパッチを比較する。そのピクセル差を使って、局所的な動きの強度を推定する。
しきい値を下回るパッチは除去される。上回るパッチはTransformerで処理できる状態に残される。残った系列では、動く人物、物体、または活動に関連する部分に計算を集中できるはずだ。
しきい値の選択は難しい最適化問題を生む。離散的なトークン選択は、通常の微分可能なニューラルネットワーク演算ほど容易には扱えない。そのため研究者らは、方策勾配法であるREINFORCEを用いてしきい値を学習している。
報酬には、ソースとターゲットのデータから得られる分類損失が含まれる。また、捨てられたトークンの割合も考慮する。この設計は、精度のためにすべてを保持する方策や、速度のためにすべてを除去する方策を抑制する。
学習ステップでサンプリングされるのは、1つのスカラーしきい値だけだ。方策は、その分布を表す2つのパラメータを更新する。著者らは、このオーバーヘッドをビデオTransformer自体の処理と比べて無視できるほど小さいと説明している。
より広いモデルには、ターゲット環境向けのラベルも必要だ。VUDAではこれらのラベルが利用できないと仮定するため、研究者らはCLIPを使って疑似ラベルを生成する。疑似ラベルとは、学習中に人間による注釈の代わりとなる、モデルが生成したカテゴリである。
CLIPは、各ターゲット動画の表現を、利用可能な行動クラス向けのテキストプロンプトと比較する。フレームワークは、予測が信頼度しきい値を超えたターゲット例のみを保持する。報告された実験では、0.8のしきい値が最も良いバランスをもたらした。
この詳細は、LMFTが人間の視覚のように機能するという単純な説明を複雑にする。人間は隣接するピクセル差を計算したり、CLIPプロンプトを実行したり、方策勾配を通じてスカラーしきい値を最適化したりはしない。この比喩が表すのは選択的注意であり、実際の実装ではない。
測定可能な結果は、その比喩より有用だ。Daily-DAの一方向では、標準的なViT-B/16ベースラインは精度72.1%を記録し、学習に3,810秒を要した。LMFTは2,784秒で74.2%に到達した。
逆方向では、ベースラインは1,211秒で精度57.5%を達成した。LMFTは890秒で60%に到達した。どちらの比較でも、標準的なトークン化に対して1.4倍の学習高速化が報告された。
推論結果は、より小さいながらも依然として意味のある計算量削減を示している。標準的なトークン化では、評価対象のクリップに266 GFLOPsを要した。LMFTは一方の方向で217 GFLOPs、もう一方で218 GFLOPsを使用した。
GFLOPは10億回の浮動小数点演算を表す。これはアーキテクチャレベルの推定値であり、電気料金や保証されたレイテンシの指標ではない。GFLOPsが低いほど一般に計算量が少ないことを示すが、実際の性能は依然としてハードウェア利用率によって左右される。
スループットは、一方の方向で毎秒3.8クリップから3.9クリップへ変化した。逆方向では毎秒3.5クリップから3.7クリップに上昇した。これらの数値は、標準ベースラインを大幅に上回る推論高速化を主張する根拠にはならない。
より大きな速度比較では、別の動画適応手法であるUNITEが対象となった。最初のDaily-DA方向では、UNITEは学習に27,426秒を要し、71.7%の精度を記録した。USaskのフレームワークは2,784秒で74.2%に到達した。
2つ目の方向では、UNITEが22,070秒、新フレームワークが890秒だった。精度はUNITEが49%、USask手法が60%だった。著者らはこれらの結果を、およそ10倍から20倍高速な学習として要約している。
この比較は、テストされたコードおよびハードウェア条件と切り離すべきではない。競合論文が同等の効率測定を報告していなかったため、研究者らは公開実装を実行した。再実装における選択は学習時間に影響し得る。
LMFTは、チームが選定した精度・速度比較において、ランダムなトークン削減、ToMe、PruMerge、DivPruneも上回った。一部の代替手法は理論上の演算量を削減したものの、独自の選択オーバーヘッドを導入した。たとえばDivPruneは、報告された両方向で毎秒0.2クリップしか処理しなかった。
この証拠は、特定の結論を裏付けている。トークンを低コストで選択できるかどうかは、最終的なトークン数を減らすことと同じくらい重要になり得る。複雑なプルーニングアルゴリズムはTransformerの演算を節約しても、トークン評価の過程でその節約分を消費する可能性がある。
開発者にとって、この実務上の教訓は行動認識にとどまらない。どの動画パイプラインでも、そのフィルタリング手法のコストが削減する計算量を下回るかを問うべきだ。その答えには、前処理、メモリ移動、実際のデバイススループットを含める必要がある。
ベンチマーク結果は実環境での導入準備を証明しない
未解決の問題は、重要な証拠がゆっくり、短時間、あるいは間接的に動く場合でも、動きに焦点を当てたフィルタリングが信頼性を維持できるかどうかだ。
この研究は学術的な行動認識ベンチマークを評価している。病院、自動運転車、工場、公共安全システムでの本番導入は報告していない。大学の発表で挙げられた例は、検証済みの製品ではなく、潜在的な応用を説明したものだ。
この違いは、安全性が重視される環境で特に重要になる。ゆっくり変化する信号機、静止した警告標識、動かない手術器具には、不可欠な情報が含まれることがある。周辺モデルがその情報を補えない場合、動きに最適化されたシステムはこうした文脈を過小評価するおそれがある。
LMFTは、すべての静的パッチを無差別に排除するわけではない。学習された閾値は、学習目的において精度とトークン削減のバランスを取る。それでも、ベンチマークの報酬が捉えるのは、選ばれたデータセットとラベルが測定するものだけだ。
3つのベンチマークは有用な多様性を提供するが、あらゆるカメラ、気象条件、行動、運用上の失敗を代表することはできない。ActorShiftは、出演者と環境の変化を特にテストする。Daily-DAとUCF-HMDBは、確立された行動データセットを異なる視覚スタイルで組み合わせている。
結果はシステムの著者自身によるものでもある。CVPRでの発表と効率性賞は、研究プロセスへの信頼を高める。独立した再現実験は、実装や計算プラットフォームをまたぐ移植性について、より強い証拠を提供するだろう。
別の不確実性はカメラ移動に関するものだ。LMFTは、対応するパッチ位置における時間差分を通じて動きを推定する。カメラが動くと、重要な被写体が小さな領域しか占めていない場合でも、フレームの大部分がアクティブに見える可能性がある。
論文の視覚分析では、LMFTは視点の変化にもかかわらず行動に関連する領域を選択したとされる。これは提示された事例の範囲では有望だ。より広範なテストでは、手持ち撮影の動き、急速なパン、ズーム、手ブレ補正アーティファクト、ローリングシャッター歪みを切り分けるべきだ。
オクルージョンも関連する課題を生む。関連する人物や物体は、別の物体の背後に一時的に隠れることがある。動きの多い領域を重視するフィルタリングでは、その中断後に完全な行動を認識できるだけの時間的・空間的文脈を保持しなければならない。
微妙な行動は別途テストに値する。タイピング、脈拍の確認、小さな部品の操作、表情の変化には、走る動作よりも明白でない動きが含まれる。行動の証拠がごく少数のパッチしか占めない場合、ピクセル差分の閾値は苦戦するかもしれない。
疑似ラベルのパイプラインは別の依存関係も加える。CLIPが生成するラベルは、特にクラスの違いが可視的な物体ではなく微細な動きにある場合、誤ることがある。信頼度フィルタリングは弱い予測を除去するが、導入時に重要となる難しい例も除外する可能性がある。
論文は、従来のVUDA手法を上回る大幅な精度向上を報告している。しかしLMFTなしのフレームワーク自体も、すでに高品質な疑似ラベルの恩恵を受けていた。読者はフィルタリングモジュールの寄与と、完全な学習レシピによる改善を区別すべきだ。
比較はまた、ベンチマーク精度の向上が常に大幅なスループット変化を生むわけではないことも示している。LMFTは、報告されたDaily-DAテストにおいて標準トークン化と比べて理論上の計算量を約18%削減した。毎秒クリップ数の性能向上はわずかだった。
この隔たりは固定的なシステムコストから生じ得る。データ読み込み、パッチ生成、トークン選択、GPU同期は、Attentionに渡すトークン数が減ってもなくならない。より小さなモデルやエッジデバイスでは、異なるボトルネックが表面化する可能性がある。
Rochanは、計算需要の低下とローカルでホストされるAIを結び付けた。この可能性は、機微な情報をその発生源の近くで処理することへの関心の高まりに合致する。しかし論文は、エッジハードウェアにおけるメモリ、バッテリー、熱、レイテンシ性能を実証していない。
ローカル処理は、プライベートな職場や研究用の動画に関係するだろう。すべてのフレームをリモートサービスに送信せずに、検索可能な記録を支えることもできる。関連システムには依然として、アクセス制御、保持ポリシー、意味のある同意が必要だ。
研究動画を扱うナレッジワーカーは、分析後の構造化検索から恩恵を得られる。knowledge blendingワークフローは、抽出された観察結果をノートや文書と結び付けられる。LMFT自体は、その保存・検索レイヤーを提供しない。
したがって、AIが人間のように注目することを学んだという主張は、分かりやすい略表現として扱うべきだ。モデルが学習したのは、選定された適応テストを改善する動きの閾値である。人間の視覚的注意、状況判断、意味理解を獲得したわけではない。
このより限定的な成果にも価値はある。優れたエンジニアリングは、多くの場合、システムが安全に無視できる情報を見極めることから生まれる。未解決の問いは、LMFTが重要でないと定義する情報が、ベンチマークの外の環境でも通用するかどうかだ。
Google Newsの読者が次に注目すべきこと
LMFTが再利用可能な動画コンポーネントになるのか、それとも強力なベンチマーク結果にとどまるのかは、3つのシグナルによって決まる。
最初のシグナルは独立した再現実験だ。研究者は同じベンチマークでフレームワークを実行し、精度、学習時間、推論スループット、メモリ使用量、GFLOPsを報告する必要がある。公表結果と一致すれば、中核となる効率性の主張への信頼が強まる。
再現実験には、同一ハードウェアとより広範なデバイスクラスを含めるべきだ。サーバーGPUでは、ノートPC、組み込みアクセラレータ、自動車向けハードウェアとは異なる形で選択オーバーヘッドが隠れる可能性がある。効率性を目的に設計された手法は、その節約が物理的にどこに現れるかを示さなければならない。
2つ目のシグナルは、従来型の行動ベンチマークを超えた評価だ。テストには、移動するカメラ、小さな動き、長時間動画、雑然とした環境、オクルージョン、安全性に関係する静的な手掛かりを含めるべきだ。未知のデータセットでの結果は、動きの選択が元の学習レシピを超えて一般化するかを示すだろう。
特に有用な実験は、LMFTが保持する静的トークン数を変化させるものだ。研究者はその上で、正確な判断に文脈情報が必要となる時点を測定できる。これは、有益なフィルタリングと破壊的な情報損失の境界を明らかにするだろう。
3つ目のシグナルは、より大規模な動画システムとの統合だ。LMFTは現在、行動認識のための教師なしドメイン適応を対象としている。動画言語モデル、ロボティクスパイプライン、ストリーミング分析への採用は、その仕組みが異なる目的に移転できるかを検証するだろう。
こうした統合では、すべてのタスクが動きを中心にするとは想定すべきではない。動画質問応答は、静止したままのテキスト、物体、場所、イベントに依存することがある。汎用システムでは、動きに焦点を当てたトークンと、より少数の文脈トークンのサンプルを併用する必要があるかもしれない。
将来の研究では、学習された動きフィルタリングと意味的プルーニングを比較することもできる。動きの選択は、フレーム間で何が変化したかを問う。意味的選択は、要求されたタスクにとって何が重要かを問う。両方のシグナルを組み合わせれば、冗長な計算を減らしながら重要な文脈を維持できる可能性がある。
研究者らのvideo adaptation thesisは、追加の方法論的詳細を提供している。また、マルチモーダル学習と効率的なトークン化を通じて適応を改善する、より長期的な取り組みの中にLMFTを位置付けている。
この研究は、動的な視覚トークン化へのより広範な移行の一部だ。固定的な画像グリッドは実装が簡単だが、不均等な情報に等しい初期注意を割り当てる。適応型手法は、トークン予算をコンテンツとタスクに合わせようとする。
LMFTは、この議論に明確な立場を加える。動きは行動認識の特徴であるだけではない。計算資源を早期に配分するためのルールとしても機能し得る。
Google Newsの読者は、この知見を動画AI全般に関する普遍的な主張へと変換することを避けるべきだ。この研究は、すべてのモデルが静的な風景を無視すべきだとは示していない。定義された適応テスト全体で、ある動き認識フィルタが効率と精度を改善したことを示している。
最も重要な結果は方法論的なものかもしれない。論文は精度とともに効率を報告し、学習時間、推論演算、スループット、メモリを直接比較している。コンピュータビジョン研究には、モデルが制約のあるデバイスへ移行する中で、このような多次元の報告が必要だ。
この考え方を評価する開発者は、3つの実務的な質問をすべきだ。対象タスクは主に動きに依存しているか。トークン選択のコストは、削減する処理コストより低いか。静的な文脈が依然として重要である場合をシステムは検出できるか。
エンタープライズの購入者は、自社のカメラ環境における証拠を求めるべきだ。洗練されたベンチマーク平均は、すべての倉庫、診療所、道路、オフィスにわたる性能を予測できない。パイロットテストでは、実際の照明、動き、ハードウェア、関連する失敗コストを捉えるべきだ。
研究者はネガティブな事例も公表すべきだ。LMFTが必要な証拠を除去する例は、その安全な動作範囲を明確にする。それらは、選択された静的パッチを保持するハイブリッド手法や、タスク指示に応じてフィルタリングを適応させる手法の指針となり得る。
Google Newsの見出しは記憶に残る表現を提示している。AIは人間のように、より焦点を合わせることを学んだ。研究が裏付けるのは、より正確な結論だ。USaskは、低動作のパッチに費やす計算量を減らすよう、動画適応システムを訓練した。
この結果は、効率性と精度を自動的に対立するものとしてではなく、両立しうるものとして結び付けている点で意義深い。ただし、実環境で信頼して導入できることを示す証拠には、まだなっていない。次の独立した検証によって、この均衡が研究室の外でも維持されるかどうかが決まる。
再現された処理時間の結果、より幅広いドメイン外評価、そして実際の動画製品への統合に注目したい。3つすべてが現れれば、動きに着目したトークン化は転用可能な設計パターンとして見えてくるだろう。そうでなければ、Google Newsは優れた研究成果を捉えたことになるが、その実用的な広がりは依然として定まらない。



