Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
Abstractの概要
本論文では、マルチモーダル大規模言語モデルにおける時空間ビデオグラウンディング(STVG)を対象とし、時間軸に沿って密なバウンディングボックストラジェクトリを自己回帰的に生成する際の非効率性に対処しています。著者らは、クエリされたイベントの時間間隔を最初に予測し、その後すべての時間条件付き空間ボックスを並列かつ同時にデコードするParallel Tube Decoding(PTD)を提案し、チューブの長さに関係なく逐次デコードの深度を2ラウンドに削減しました。さらに、ボックス間の自己回帰的な干渉なしに並列ボックス予測を可能にするため、時間的および空間的報酬を用いた位置特定対応の方策最適化とともにDecoupled Block Attentionを導入しています。VidSTGおよびHC-STVGでの評価により、生成速度とグラウンディング精度の双方が大幅に向上することが示され、獲得された位置特定能力は時間的グラウンディング、グラウンデッドVideoQA、および参照ビデオオブジェクトトラッキングへとゼロショットで転移します。
新規性
主な新規性は、生成プロセスを時間ブロックとそれに続く並列な時間条件付き空間ブロックへと分解することで、トークンレベルおよびトラジェクトリレベルの自己回帰依存性を排除した生成型STVGデコーディングパラダイムであるParallel Tube Decodingにあります。また本手法は、共有されたマルチモーダルコンテキストを維持しながら空間ボックスブロック間を相互に分離するDecoupled Block Attentionを導入し、位置特定を考慮した方策最適化によってそれを補強しています。
成果
VidSTGにおいて、PTDは標準的な非量子化自己回帰デコーディングと比較してチューブ完了レイテンシを79倍削減し、空間デコーディングスループットを92倍向上させ、チューブ長が拡大してもほぼ一定のレイテンシを維持しました。外部の空間デコーダやトラッキングモジュールを用いない4Bバックボーンに基づく本モデルは、VidSTGおよびHC-STVGで最先端またはそれに匹敵するグラウンディング精度を達成しています。さらに、Charades-STAやActivityNetでの時間的グラウンディング、ReXTimeでのグラウンデッドVideoQA、Ref-DAVIS、Ref-YT-VOS、ReasonVOSにわたるビデオオブジェクトトラッキングに対してもゼロショットで汎化します。
論文の注目点
- Parallel Tube DecodingはSTVG生成を時間的位置特定と全空間ボックスの並列デコードへと再定式化し、トラジェクトリ長に依存せず逐次デコード深度を2ラウンドに固定する。
- Decoupled Block Attentionは各時間アンカーに対する共有マルチモーダルコンテキストを保持しつつ、ボックス間依存性を排除してトラジェクトリに沿ったエラー伝播を防止する。
- 4Bモデルは逐次ベースラインと比べて推論スループットを大幅に加速しグラウンディング精度を向上させ、時間的グラウンディング、グラウンデッドVideoQA、ビデオオブジェクトトラッキングへの強力なゼロショット転移を実証した。