論文の概要: REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding
- arxiv url: http://arxiv.org/abs/2608.04480v1
- Date: Wed, 05 Aug 2026 06:08:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.735585
- Title: REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding
- Title(参考訳): REZE:ビデオ時間グラウンドのための認識に基づくゼロショット抽出
- Authors: Boyang Li, Chenhui Gou, Jianfei Cai,
- Abstract要約: ビデオ時間グラウンド(英語: Video temporal grounding、VTG)とは、ある自然言語クエリに対応するビデオ中の時間間隔を識別するタスクである。
一般的なゼロショット戦略は、モデルに開始と終了のタイムスタンプを直接生成するように要求するので、結果はモデルの設計とトレーニングに依存する。
映像を短いクリップに分割する簡単なトレーニング不要な手法として,認識に基づくゼロショット抽出(R)を提案する。
- 参考スコア(独自算出の注目度): 29.737473206424877
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video temporal grounding (VTG) refers to the task of identifying the time interval in a video that corresponds to a given natural-language query. A common zero-shot strategy asks a large vision-language model (VLM) to generate the start and end timestamps directly, so the result depends heavily on the design and training of the model, and grounding accuracy differs widely from one VLM to another. We therefore propose REcognition-based Zero-shot Extraction (REZE), a simple training-free method that splits the video into short clips, asks the model for a clip-level confidence score for the query, and uses a deterministic algorithm to convert the resulting score curve into the output required by the task. Because temporal aggregation is performed outside the model, REZE adapts to different task outputs, from single- and multi-interval moment retrieval to highlight detection. On QVHighlights, REZE improves the best reported training-free moment-retrieval mAP from 38.23 to 40.32, while on highlight detection it reaches 44.18 mAP and 73.41 HIT@1, establishing a new state of the art among training-free methods. Its HIT@1 also outperforms all fully supervised SoTAs on the QVHighlights test split. We evaluate REZE on seven backbones from three model families. On Charades-STA and QVHighlights, it outperforms direct timestamp generation in every available comparison. We further observe that with REZE an earlier-generation model can approach the native performance of a newer model in its family.
- Abstract(参考訳): ビデオ時間グラウンド(英語: Video temporal grounding、VTG)とは、ある自然言語クエリに対応するビデオ中の時間間隔を識別するタスクである。
共通ゼロショット戦略は、大きな視覚言語モデル(VLM)に開始時と終了時のタイムスタンプを直接生成するよう要求するので、結果はモデルの設計と訓練に大きく依存する。
そこで,認識に基づくゼロショット抽出 (REZE) を提案する。これは,映像を短いクリップに分割し,クエリに対するクリップレベルの信頼度スコアをモデルに求め,結果のスコア曲線をタスクが要求する出力に変換するための決定論的アルゴリズムである。
時間的アグリゲーションはモデル外で実行されるため、REZEは単一区間と複数区間のモーメント検索からハイライト検出まで、様々なタスク出力に適応する。
QVHighlightsでは、REZEは最高のトレーニングフリーのモーメント検索mAPを38.23から40.32に改善し、ハイライト検出では44.18 mAPと73.41 HIT@1に到達し、トレーニングフリーメソッドの新たな最先端技術を確立した。
そのHIT@1は、QVHighlightsテストスプリットで完全に教師されたSoTAを全て上回っている。
3つのモデル家系の7つの背骨についてREZEを評価した。
Charades-STAとQVHighlightsでは、利用可能なすべての比較において、直接タイムスタンプ生成よりも優れています。
さらに、REZEにより、より新しいモデルが家族のネイティブパフォーマンスにアプローチできることを観察する。
関連論文リスト
- GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding [8.196520511153368]
ビデオ時間グラウンド(VTG)はビデオにおいて重要なタスクであり、大規模な言語モデル(Vid-LLM)を広範囲のアプリケーションに拡張するための重要な能力を理解する。
既存のVid-LLMは、一様フレームサンプリングに頼って映像情報を抽出し、キーフレームの疎分布と重要な時間的手がかりの喪失をもたらす。
我々は,最も情報性の高い時間セグメントに着目したVid-LLMアーキテクチャであるGroundVTSを提案する。
論文 参考訳(メタデータ) (2026-04-02T14:19:58Z) - Enrich and Detect: Video Temporal Grounding with Multimodal LLMs [60.224522472631776]
ED-VTGは,マルチモーダルな大言語モデルを用いた微細なビデオ時間的グラウンド化手法である。
提案手法は,テキストと動画を共同処理するマルチモーダルLLMの機能を利用する。
我々は,時間的ビデオグラウンドと段落グラウンドの設定において,様々なベンチマークにおいて最先端の結果を示す。
論文 参考訳(メタデータ) (2025-10-19T22:12:45Z) - Aligning Moments in Time using Video Queries [9.64582196551555]
ビデオからビデオまでのモーメント検索 (Vid2VidMR) は、クエリービデオを用いて、未確認のイベントやモーメントをターゲットビデオにローカライズするタスクである。
意味的コンテキストをキャプチャするトランスフォーマーモデルであるMATR(Moment Alignment TRansformer)を紹介する。
また,MATRはR@1で13.1%,mIoUで8.1%の顕著な性能向上を実現している。
論文 参考訳(メタデータ) (2025-08-21T11:01:13Z) - TimeRefine: Temporal Grounding with Time Refining Video LLM [75.99665302872901]
ビデオの時間的接地は、テキストのプロンプトが与えられたビデオの中で、関連する時間的境界をローカライズすることを目的としている。
我々は時間的接地タスクを時間的精錬タスクとして再構成する。
我々は、予測セグメントが基底真理からさらに逸脱した場合、モデルをよりペナルティ化する補助予測ヘッドを組み込む。
論文 参考訳(メタデータ) (2024-12-12T18:59:11Z) - PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning [78.23573511641548]
視覚言語事前学習は、幅広い画像言語アプリケーションで性能を大幅に向上させた。
しかし、ビデオ関連タスクの事前学習プロセスは、非常に大きな計算とデータリソースを必要とする。
本稿では,映像理解のための既存の画像言語事前学習モデルに適用するための,ストレートフォワード,高効率,資源光のアプローチについて検討する。
論文 参考訳(メタデータ) (2024-04-25T19:29:55Z) - Multi-Sentence Grounding for Long-term Instructional Video [63.27905419718045]
大規模インストラクショナルデータセットを記述するための,自動でスケーラブルなパイプラインを確立することを目的としている。
複数の記述ステップを監督する高品質なビデオテキストデータセット、HowToStepを構築した。
論文 参考訳(メタデータ) (2023-12-21T17:28:09Z) - DiffusionVMR: Diffusion Model for Joint Video Moment Retrieval and
Highlight Detection [38.12212015133935]
DiffusionVMRという新しいフレームワークは、2つのタスクを統一された条件記述生成プロセスとして再定義するために提案されている。
5つの広く利用されているベンチマークで実施された実験は、提案されたDiffusionVMRの有効性と柔軟性を示している。
論文 参考訳(メタデータ) (2023-08-29T08:20:23Z) - Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in
Vision-Language Models [76.410400238974]
モデル出力を補正し、モデルが盲目的に自信を持たないようにするためのフィードバック付きTTAを提案する。
CLIPモデルは、TTA中に報酬モデルとして採用され、VLMにフィードバックを提供する。
提案したCLIPフィードバック(RLCF)フレームワークによるテキスト強化学習は非常に柔軟で普遍的である。
論文 参考訳(メタデータ) (2023-05-29T11:03:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。