論文の概要: Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
- arxiv url: http://arxiv.org/abs/2608.28192v1
- Date: Fri, 28 Aug 2026 11:05:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.297109
- Title: Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
- Title(参考訳): ビデオのロケート:効率的な生成時空間ビデオグラウンドの再考
- Abstract要約: マルチモーダルな言語モデルは通常、トラジェクトリを自動回帰的にシリアライズする。
時間ブロックにグラウンドを分解する生成式であるParallel Tube Decoding (PTD)を導入する。
VidSTGでは、PTDチューブはコンプリートを79倍に減らし、空間デコーディングを92倍に向上させる。
- 参考スコア(独自算出の注目度): 80.10744910189997
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spatio-temporal video grounding (STVG) requires models to identify when a referred event occurs and localize the target entity throughout that interval. Existing multimodal large language models typically serialize dense localization trajectories autoregressively, causing decoding latency to grow with tube length and allowing localization errors to propagate across time. We introduce Parallel Tube Decoding (PTD), a generative formulation that decomposes grounding into a temporal block followed by time-conditioned spatial blocks decoded simultaneously. This removes both token-level and trajectory-level dependencies, reducing the sequential decoding depth to a fixed $1 + 1$ rounds, independent of tube length. To enable parallel spatial generation, we introduce Decoupled Block Attention, which preserves access to shared video-query context while eliminating cross-box dependencies, together with localization-aware policy optimization for temporal boundaries and spatial geometry. On VidSTG, PTD reduces Tube Completion Latency by 79x and increases spatial decoding throughput by 92x over standard autoregressive decoding, while also improving grounding accuracy. With a compact 4B backbone, our model performs favorably well on VidSTG and HC-STVG, and generalizes zero-shot to temporal grounding, grounded VideoQA, and referring video object tracking. Our results show parallel tube generation is an efficient and effective alternative to autoregressive localization in videos.
- Abstract(参考訳): 時空間ビデオグラウンドティング(STVG)では、参照イベントがいつ発生したかを特定し、その間隔を通して対象エンティティをローカライズする必要がある。
既存のマルチモーダルな大言語モデルは通常、高密度なローカライゼーショントラジェクトリを自動回帰的にシリアライズし、デコード遅延は管長とともに増大し、ローカライズエラーは時間とともに伝播する。
時間条件付き空間ブロックを同時にデコードした時空間ブロックにグラウンドを分解する生成式であるParallel Tube Decoding (PTD)を導入する。
これによりトークンレベルとトラジェクトリレベルの両方の依存関係が排除され、シーケンシャルデコード深度は管長に依存しない固定1 + 1$ラウンドに削減される。
並列な空間生成を実現するために、時間境界と空間幾何学のための局所化対応ポリシー最適化とともに、ボックス間の依存関係を排除しつつ、共有ビデオクエリのコンテキストへのアクセスを保存するDecoupled Block Attentionを導入する。
VidSTGでは、PTDはチューブコンプリートレイテンシを79倍に削減し、標準の自己回帰デコードよりも空間デコードスループットを92倍に向上すると同時に、グラウンド化精度も向上する。
コンパクトな4Bバックボーンでは、VidSTGとHC-STVGで良好に動作し、ゼロショットから時間的グラウンド、グラウンドドビデオQA、参照ビデオオブジェクト追跡を一般化する。
ビデオにおける自己回帰的局所化の代替として, 並列管生成が効率的かつ効果的であることを示す。
関連論文リスト
- Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification [11.171207895220578]
長いビデオの時間的接地には、正確な時間的局所化と、自然言語クエリで条件付けられた頑健なオブジェクト追跡が必要である。
本稿では,フレームレベルから第2レベルのトラッキングへ移行し,シーケンス長を低減しつつ連続性を保ちながら秒間アノテーションを実行する実用的なパイプラインを提案する。
論文 参考訳(メタデータ) (2026-06-27T17:42:32Z) - Towards Long-Form Spatio-Temporal Video Grounding [37.582576273199955]
長期的なビデオは、より長い時間的スパンを含み、より無関係な情報を含んでいる。
ビデオシーケンス全体を一度に予測する従来のSTVG法とは異なり、ART-STVGは動画をストリーミング入力フレームとして扱い、順次処理する。
異なるモーメントからのメモリは必ずしも現在のフレームに関係しないため、単純かつ効果的なメモリ選択戦略を導入する。
論文 参考訳(メタデータ) (2026-02-26T18:04:09Z) - LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation [44.62533878314138]
ローカライズドセマンティックアライメント(Localized Semantic Alignment、LSA)は、トレーニング済みのビデオ生成モデルを微調整するためのフレームワークである。
LSAは、接地木と生成されたビデオクリップ間の意味的特徴を整列することで、時間的一貫性を高める。
nuScenesとKITTIデータセットの実験は、我々のアプローチの有効性を示している。
論文 参考訳(メタデータ) (2026-02-05T18:21:02Z) - Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers [95.68243351895107]
我々はtextbfVideo textbfFrame textbfInterpolation (LDF-VFI) のための textbfLocal textbfDiffusion textbfForcing for textbfVideo textbfFrame textbfInterpolation (LDF-VFI) という包括的でビデオ中心のパラダイムを提案する。
我々のフレームワークは、ビデオシーケンス全体をモデル化し、長距離時間的コヒーレンスを確保する自動回帰拡散変換器上に構築されている。
LDF-VFIは、挑戦的なロングシーケンスベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-21T12:58:52Z) - Towards Robust and Generalizable Continuous Space-Time Video Super-Resolution with Events [71.2439653098351]
連続時空ビデオスーパーSTVSRは、高解像度で高フレームのビデオを任意の時間スケールで再構成する能力への関心が高まっている。
EvEnhancerは、イベントストリームにカプセル化された高時間および高ダイナミックレンジのユニークな特性を結合する新しいアプローチである。
提案手法は,OODスケールでの一般化性を維持しつつ,合成および実世界の両方のデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2025-10-04T15:23:07Z) - Exploiting Temporal State Space Sharing for Video Semantic Segmentation [53.8810901249897]
ビデオセマンティックセグメンテーション(VSS)はシーンの時間的進化を理解する上で重要な役割を担っている。
従来の手法では、ビデオはフレーム単位で、あるいは短い時間ウィンドウで分割されることが多く、時間的コンテキストや冗長な計算、重いメモリ要求に繋がる。
本研究では,時間的特徴共有にマンバ状態空間モデルを活用するための時間的ビデオ状態空間共有アーキテクチャを提案する。
本モデルでは,映像フレーム間の関連情報を効率的に伝播する選択的ゲーティング機構を特徴とし,メモリ量の多い機能プールの必要性を解消する。
論文 参考訳(メタデータ) (2025-03-26T01:47:42Z) - Spatial Decomposition and Temporal Fusion based Inter Prediction for
Learned Video Compression [59.632286735304156]
学習ビデオ圧縮のための空間分解と時間融合に基づく相互予測を提案する。
SDDに基づく動きモデルと長時間の時間的融合により,提案した学習ビデオはより正確な相互予測コンテキストを得ることができる。
論文 参考訳(メタデータ) (2024-01-29T03:30:21Z) - Temporally Consistent Transformers for Video Generation [80.45230642225913]
正確なビデオを生成するには、アルゴリズムは世界の空間的および時間的依存関係を理解する必要がある。
時間依存性のあるビデオ生成を厳格に評価するために、複雑なデータに関する確立されたベンチマークは存在しない。
本稿では,長期間の一貫性を著しく向上し,サンプリング時間を短縮するTemporally Consistent Transformer(TECO)を提案する。
論文 参考訳(メタデータ) (2022-10-05T17:15:10Z) - TubeDETR: Spatio-Temporal Video Grounding with Transformers [89.71617065426146]
与えられたテキストクエリに対応するビデオにおいて、アテンポラルチューブをエンコーダでローカライズする問題について考察する。
この課題に対処するために,テキスト条件付きオブジェクト検出における近年の成功に触発された変換器アーキテクチャであるTubeDETRを提案する。
論文 参考訳(メタデータ) (2022-03-30T16:31:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。