論文の概要: Investigating Query-Insensitive Behavior in Spatio-Temporal Video Grounding
- arxiv url: http://arxiv.org/abs/2610.06018v1
- Date: Mon, 05 Oct 2026 09:17:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 19:24:39.408467
- Title: Investigating Query-Insensitive Behavior in Spatio-Temporal Video Grounding
- Title(参考訳): 時空間ビデオグラウンディングにおけるクエリ非感性行動の検討
- Abstract要約: S-temporal video groundingは、自然言語クエリによって記述されたオブジェクトやイベントを、空間と時間の両方でローカライズすることを目的としている。
既存のSTVGモデルは、通常、各クエリが入力ビデオに関連すると仮定して訓練され、評価される。
本研究では,無関係なクエリとテキスト入力の欠如に対して,最先端のSTVGモデルの動作について検討する。
- 参考スコア(独自算出の注目度): 0.8679678575739304
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spatio-temporal video grounding (STVG) aims to localize objects or events described by natural language queries in both space and time. Existing STVG models are typically trained and evaluated under the assumption that each query is relevant to the input video. In this work, we challenge this assumption by studying the behavior of state-of-the-art STVG models under irrelevant queries and missing textual input. Our experiments show that current models can still produce plausible spatio-temporal predictions even when the query is unrelated to the video or removed entirely. We further analyze HCSTVG-v2 and VidSTG to identify dataset regularities that may encourage such query-insensitive behavior. Our study highlights an underexplored limitation of STVG models and motivates negative-aware evaluation protocols and architectures that explicitly assess query relevance.
- Abstract(参考訳): 時空間ビデオグラウンドティング(STVG)は、空間と時間の両方で自然言語クエリによって記述されたオブジェクトやイベントをローカライズすることを目的としている。
既存のSTVGモデルは、通常、各クエリが入力ビデオに関連すると仮定して訓練され、評価される。
本研究では,非関係なクエリとテキスト入力の欠如の下での最先端のSTVGモデルの挙動を研究することで,この仮定に挑戦する。
実験の結果,クエリがビデオと無関係であったり,完全に削除されたりしても,現在のモデルでは時空間予測が可能であることがわかった。
さらに,HCSTVG-v2 と VidSTG を解析し,このようなクエリ不感な振る舞いを助長する可能性のあるデータセットの正規性を同定する。
本研究は,STVGモデルの過度な限界を浮き彫りにして,クエリ関連性を明確に評価する負の認識評価プロトコルとアーキテクチャを動機づけるものである。
関連論文リスト
- AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models [15.610649996654876]
我々は,STVG評価を静的ゼロショットテストから厳密なドメイン適応に移行するためのベンチマークであるAnyGroundBenchを紹介する。
5つの専門分野(動物、産業、スポーツ、手術、治安)をターゲットにしています。
我々は15の最先端VLMを評価し,そのゼロショット一般化とインコンテクスト学習能力を評価した。
論文 参考訳(メタデータ) (2026-07-02T14:52:45Z) - V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning [40.18308199837137]
これらの問題点に対処するために,ビデオS-テンポラル推論(V-STa)ベンチマークを導入する。
我々は,ビデオLLMの時空間推論プロセスを実現するためのデータセットを構築した。
14のビデオ-LLMによる実験では、現在のビデオ-LLMと、堅牢で一貫性のある推論の必要性の間に大きなギャップが示されている。
論文 参考訳(メタデータ) (2025-03-14T15:21:44Z) - Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding [20.906378094998303]
既存のTransformerベースのSTVGアプローチは、単に0を使用するオブジェクトクエリのセットを利用することが多い。
単純さにもかかわらず、これらのゼロオブジェクトクエリは、ターゲット固有の手がかりが欠如しているため、識別対象情報の学習が困難である。
STVG (Target-Aware Transformer for STVG) を新たに導入し,ビデオテキストペアからターゲット固有のキューを探索することで,オブジェクトクエリを適応的に生成する手法を提案する。
論文 参考訳(メタデータ) (2025-02-16T15:38:33Z) - Described Spatial-Temporal Video Detection [33.69632963941608]
空間時間ビデオグラウンドティング(STVG)は、各フレーム内の1つの既存のオブジェクトのみを検出するように定式化される。
本研究では,STVGを空間時空間ビデオ検出(DSTVD)と呼ばれるより実用的な環境に進める。
DVD-STは、クェリに応答してビデオ上のオブジェクトから多数のオブジェクトへのグラウンドングをサポートする。
論文 参考訳(メタデータ) (2024-07-08T04:54:39Z) - SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding [52.98133831401225]
時間的グラウンドディング(英: Temporal grounding、ビデオモーメント検索(英語版))は、所定のクエリ文に対応するビデオセグメントを特定することを目的としている。
本稿では, GPT-3.5-Turbo を用いた負のクエリ構築のための大規模言語モデル駆動手法を提案する。
本稿では,ビデオと階層的負のクエリ間の多粒度意味的関係を学習するモデルを提案する。
論文 参考訳(メタデータ) (2024-07-06T16:08:17Z) - Video Referring Expression Comprehension via Transformer with
Content-conditioned Query [68.06199031102526]
ビデオ参照表現(REC)は、検索された自然言語に基づいて対象物をビデオにローカライズすることを目的としている。
ビデオRECの最近の改良は、学習可能なクエリを持つTransformerベースの手法を用いてなされている。
論文 参考訳(メタデータ) (2023-10-25T06:38:42Z) - QVHighlights: Detecting Moments and Highlights in Videos via Natural
Language Queries [89.24431389933703]
Query-based Video Highlights (QVHighlights) データセットを提示する。
これは1万本以上のYouTubeビデオで構成され、幅広いトピックをカバーしている。
データセット内の各ビデオには、(1)人書き自由形式のNLクエリ、(2)クエリに関するビデオw.r.t.の関連モーメント、(3)クエリに関連するすべてのクリップに対する5ポイントスケールのサリエンシスコアが注釈付けされている。
論文 参考訳(メタデータ) (2021-07-20T16:42:58Z) - Deconfounded Video Moment Retrieval with Causal Intervention [80.90604360072831]
本研究は,ビデオ中の特定のモーメントをテキストクエリに従ってローカライズすることを目的とした,ビデオモーメント検索(VMR)の課題に取り組む。
既存の手法は主に複雑な相互モーダル相互作用によるクエリとモーメントのマッチング関係をモデル化する。
本稿では,クエリとビデオコンテンツが予測に与える影響を捉えるために,構造因果モデルを構築する因果性に着想を得たVMRフレームワークを提案する。
論文 参考訳(メタデータ) (2021-06-03T01:33:26Z) - Where Does It Exist: Spatio-Temporal Video Grounding for Multi-Form
Sentences [107.0776836117313]
STVGは、トリミングされていないビデオと宣言的/解釈的な文が与えられた場合、クエリされたオブジェクトの時間管をローカライズすることを目的としている。
既存の手法では、非効率なチューブ前世代と新しいオブジェクト関係モデリングの欠如により、STVGタスクに対処できない。
本稿では,この課題に対する宣言型時間グラフ推論ネットワーク(STGRN)を提案する。
論文 参考訳(メタデータ) (2020-01-19T19:53:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。