論文の概要: AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.02269v1
- Date: Thu, 02 Jul 2026 14:52:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.877213
- Title: AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models
- Title(参考訳): AnyGroundBench:視覚言語モデルにおけるビデオグラウンドのための特別なドメインベンチマーク
- Authors: Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo Hachiuma,
- Abstract要約: 我々は,STVG評価を静的ゼロショットテストから厳密なドメイン適応に移行するためのベンチマークであるAnyGroundBenchを紹介する。
5つの専門分野(動物、産業、スポーツ、手術、治安)をターゲットにしています。
我々は15の最先端VLMを評価し,そのゼロショット一般化とインコンテクスト学習能力を評価した。
- 参考スコア(独自算出の注目度): 15.610649996654876
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Vision-Language Models (VLMs) have demonstrated immense promise in Spatio-Temporal Video Grounding (STVG). However, current evaluation protocols are largely confined to zero-shot assessments on general, daily-life benchmarks. This creates a critical disconnect from real-world applications in specialized fields, where models inevitably encounter rare visual concepts and complex spatio-temporal dynamics. Since exhaustive pre-training across infinite data distributions is infeasible, the ability to adapt to novel domains is essential. To bridge this gap, we introduce AnyGroundBench, a domain-adaptation benchmark designed to shift the STVG evaluation paradigm from static zero-shot testing to rigorous domain adaptation. Targeting five specialized domains (animal, industry, sports, surgery, and public security), AnyGroundBench pairs newly captured videos such as expert-annotated mouse behaviors with established datasets, unifying them through dense, high-fidelity spatio-temporal annotations. Crucially, the benchmark provides dedicated training subsets to systematically measure domain adaptability. We extensively evaluate 15 state-of-the-art VLMs, assessing their zero-shot generalization and In-Context Learning (ICL) capabilities under practical computational constraints. Ultimately, our findings reveal that current models fail in both zero-shot and ICL-based adaptation when confronted with specialized domains, exposing critical flaws in spatio-temporal reasoning that future research must address.
- Abstract(参考訳): VLM(Vision-Language Models)は、STVG(Spatio-Temporal Video Grounding)において大きな可能性を証明している。
しかし、現在の評価プロトコルは概ねゼロショット評価に限られている。
これは、モデルが必然的に稀な視覚概念や複雑な時空間力学に遭遇する特殊な分野における現実世界のアプリケーションから重要な切り離しを生み出す。
無限のデータ分布にまたがる徹底的な事前学習は不可能であるため、新しい領域に適応する能力は不可欠である。
このギャップを埋めるために、我々はSTVG評価パラダイムを静的ゼロショットテストから厳密なドメイン適応に移行するために設計されたドメイン適応ベンチマークであるAnyGroundBenchを紹介した。
AnyGroundBenchは5つの専門ドメイン(動物、産業、スポーツ、手術、公衆の安全)をターゲットにして、専門家が注釈付けしたマウスの振る舞いと確立したデータセットを組み合わせ、密集した高忠実な時空間アノテーションを通じてそれらを統一する。
重要な点として、このベンチマークはドメイン適応性を体系的に測定する専用のトレーニングサブセットを提供する。
我々は15の最先端のVLMを評価し、そのゼロショット一般化とインコンテクスト学習能力(ICL)を実用的な計算制約下で評価した。
究極的には、現在のモデルは、特殊ドメインに直面する場合、ゼロショットとICLベースの適応の両方で失敗し、将来の研究が解決すべき時空間的推論に重大な欠陥を露呈する。
関連論文リスト
- SpatialBench: Is Your Spatial Foundation Model an All-Round Player? [92.031716744172]
空間ベンチ(SpatialBench)は、決定論的サンプリングを伴う空間基盤モデルのための、クロスパラダイムなドメインディバースベンチマークである。
6つのパラダイムにまたがる41のモデルを4つの異なる入力密度設定の下で5つのタスクスイートで包括的に評価する。
厳密なドメインアライメントと高いデータ品質が、単純なデータセットスケーリングよりもパフォーマンスに極めて重要であることを示す。
論文 参考訳(メタデータ) (2026-05-26T17:59:20Z) - MEMTS: Internalizing Domain Knowledge via Parameterized Memory for Retrieval-Free Domain Adaptation of Time Series Foundation Models [51.506429027626005]
Memory for Time Series (MEMTS) は、時系列予測における検索不要領域適応のための軽量かつプラグアンドプレイ方式である。
MEMTSの鍵となるコンポーネントは知識永続化モジュール(KPM)であり、ドメイン固有の時間力学を内部化する。
このパラダイムシフトにより、MEMTSは定数時間推論とニアゼロレイテンシによる正確なドメイン適応を実現することができる。
論文 参考訳(メタデータ) (2026-02-14T14:00:06Z) - It's TIME: Towards the Next Generation of Time Series Forecasting Benchmarks [87.7937890373758]
時系列基礎モデル(TSFM)は,特定のデータセットモデルから一般化可能なタスク評価に至るまで,予測環境に革命をもたらしている。
我々は、50の新しいデータセットと98の予測タスクからなる次世代タスク中心のベンチマークであるTIMEを紹介する。
静的なメタラベルに基づく従来のデータセットレベルの評価を超える新しいパターンレベルの評価視点を提案する。
論文 参考訳(メタデータ) (2026-02-12T16:31:01Z) - Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models [15.709482146201283]
現代のビジョン・ファンデーション・モデル(Vision Foundation Models)の凍結した特徴に基づいて訓練された単純な線形分類器は、新しい最先端技術を確立している。
この基準線は標準ベンチマーク上の特別な検出器と一致し、また、ウィジェット内のデータセット上では決定的に優れていることを示す。
我々は、AIの法医学におけるパラダイムシフトを提唱し、静的ベンチマークの過度な適合から、ファンデーションモデルの進化する世界の知識を現実の信頼性に活用することへと移行した。
論文 参考訳(メタデータ) (2026-02-02T07:20:02Z) - TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs [81.78017865436816]
我々は,映像の時間的接地能力の強いMLLMを体系的に構築するTimeLensを提案する。
まず,既存のVTGベンチマークにおける重要な品質問題を明らかにし,TimeLens-Benchを導入する。
また、自動再アノテーションパイプラインを通じてノイズの多いトレーニングデータに対処し、大規模で高品質なトレーニングデータセットであるTimeLens-100Kを出力します。
論文 参考訳(メタデータ) (2025-12-16T18:59:58Z) - Deep Unsupervised Domain Adaptation for Time Series Classification: a Benchmark [3.3729129351734266]
Unsupervised Domain Adaptation (UDA)は、ラベル付きソースデータを利用してラベルなしターゲットデータのモデルをトレーニングすることを目的としている。
本稿では,時系列分類のためのUDA手法の評価ベンチマークを提案する。
さまざまなドメインシフトと時間的ダイナミクスをカバーする7つの新しいベンチマークデータセットを提供する。
論文 参考訳(メタデータ) (2023-12-15T15:03:55Z) - Unsupervised Domain Adaptation for Spatio-Temporal Action Localization [69.12982544509427]
S時間動作の局所化はコンピュータビジョンにおいて重要な問題である。
本稿では、エンドツーエンドの教師なしドメイン適応アルゴリズムを提案する。
空間的特徴と時間的特徴を別々にあるいは共同的に適応した場合に,顕著な性能向上が達成できることを示す。
論文 参考訳(メタデータ) (2020-10-19T04:25:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。