論文の概要: SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning
- arxiv url: http://arxiv.org/abs/2608.07932v1
- Date: Sat, 08 Aug 2026 05:39:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.571292
- Title: SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning
- Title(参考訳): SportsGrounder:Dense Sports Video Reasoningのためのインターリーブグラウンドの提案
- Authors: Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang,
- Abstract要約: スポーツビデオ分析はスポーツ分析と放送の強化に不可欠である。
現在のLMM(Large Multimodal Models)は、本質的にこのような密集した視覚的複雑さに苦しむ。
オープン語彙のビジュアルエキスパートを利用したインターリーブ接地支援フレームワークである textbfSportsGrounder を提案する。
SportsGrounderは細粒度推論を大幅に改善し、最先端の精度を実現している。
- 参考スコア(独自算出の注目度): 46.575904751578236
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sports video analysis is crucial for athletic analytics and broadcasting enhancement. Dense sports video reasoning, however, demands a fine-grained understanding of numerous small-scale, highly interactive, and visually homogeneous entities (e.g., players sharing identical uniforms, the ball) across long temporal contexts. Current Large Multimodal Models (LMMs) inherently struggle with such dense visual complexities. Due to the lack of fine-grained visual details, these models often over-rely on textual priors to guess answers, especially when distinguishing visually similar actions and players. To address this, we propose \textbf{SportsGrounder}, a framework that leverages an open-vocabulary visual expert to aid interleaved grounding specifically for dense sports video reasoning. To achieve precise spatial localization, we extract domain-guided object proposals and introduce an Interleaved Grounding Fusion (IGF) mechanism. The IGF frame-by-frame integrates explicit bounding box coordinates and implicit visual semantics with global grid features. This design preserves strict temporal alignment and prevents sequence length explosion. Furthermore, we design an Action-Aware Supervision (AAS) module that directly regularizes the model's hidden states, forcing the network to learn accurate motion representations rather than relying on language bias. Optimized with Mixed Preference Optimization (MPO) to better distinguish deceptive distractors, our extensive experiments on newly curated dense sports VQA datasets (derived from SoccerNet and FineSports) demonstrate that SportsGrounder significantly improves fine-grained reasoning and achieves state-of-the-art accuracy.
- Abstract(参考訳): スポーツビデオ分析はスポーツ分析と放送の強化に不可欠である。
しかし、Dense Sports Video reasoningは、多くの小さな、対話的で、視覚的に均質な実体(例えば、同じユニフォームを共有している選手、ボール)を、長い時間的文脈で詳細に理解する必要がある。
現在のLMM(Large Multimodal Models)は、本質的にこのような密集した視覚的複雑さに苦しむ。
細かな視覚的詳細が欠如しているため、これらのモデルは、特に視覚的に類似したアクションやプレイヤーを区別する場合、答えを推測するためにテキストの先行に過度に頼っていることが多い。
これを解決するために, オープン語彙のビジュアルエキスパートを活用して, 密集したスポーツビデオ推論のためのインターリーブグラウンドディングを支援するフレームワークである, textbf{SportsGrounder}を提案する。
正確な空間的ローカライゼーションを実現するため、ドメイン誘導オブジェクトの提案を抽出し、Interleaved Grounding Fusion (IGF) 機構を導入する。
IGFフレーム・バイ・フレームは、明示的な境界ボックス座標と暗黙的な視覚的意味論とグローバルグリッド機能を統合している。
この設計は厳密な時間的アライメントを保持し、シーケンス長の爆発を防ぐ。
さらに,隠れ状態を直接正規化するAAS(Action-Aware Supervision)モジュールを設計する。
提案手法をMPO(Mixed Preference Optimization)で最適化し,新たにキュレートされた高密度スポーツVQAデータセット( SoccerNet と FineSports から派生した)に対する広範な実験により,SportsGrounder がきめ細かな推論を著しく改善し,最先端の精度を実現することを示した。
関連論文リスト
- Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding [21.581174236498196]
マルチビュースポーツ映像理解のためのベンチマークであるSportMV-Benchを紹介する。
解析の結果,現在のMLLMはマルチビュー情報を効果的に活用できないことがわかった。
本研究では,アクティブなビュー選択,認識ツールの実行,エビデンスに基づく推論の反復ループを編成するエージェントフレームワークであるSportMV-Agentを提案する。
論文 参考訳(メタデータ) (2026-07-13T17:34:36Z) - SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy [52.09081885158698]
ビジョン言語モデル(VLM)は近年,サッカービデオ理解において大きな可能性を示している。
既存の評価プロトコルは分類精度に重点を置いており、視覚的グラウンドの評価は行わない。
サッカービデオ理解のためのベンチマークである SoccerLens を紹介する。
論文 参考訳(メタデータ) (2026-05-10T15:18:08Z) - Learning Sparse Temporal Video Mapping for Action Quality Assessment in
Floor Gymnastics [26.717033245063092]
体操フロアルーチンを組み込んだ新しいデータセットAGF-Olympicsを導入する。
本稿では,密集した特徴空間を複素結合を解離してスパース表現にマッピングする識別的注意モジュールを提案する。
論文 参考訳(メタデータ) (2023-01-15T14:13:03Z) - Sports Video Analysis on Large-Scale Data [10.24207108909385]
本稿では,スポーツビデオにおける自動機械記述のモデル化について検討する。
スポーツビデオ分析のためのNBAデータセット(NSVA)を提案する。
論文 参考訳(メタデータ) (2022-08-09T16:59:24Z) - Learning Commonsense-aware Moment-Text Alignment for Fast Video Temporal
Grounding [78.71529237748018]
自然言語クエリで記述された時間的ビデオセグメントを効果的かつ効率的にグラウンド化することは、視覚・言語分野において必須の能力である。
既存のほとんどのアプローチでは、接地性能を改善するために、厳密に設計されたクロスモーダルな相互作用モジュールを採用しています。
本稿では,コモンセンスの視覚とテキストの表現を補完的なコモンスペースに組み込んだ,コモンセンス対応のクロスモーダルアライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2022-04-04T13:07:05Z) - Exploring Motion and Appearance Information for Temporal Sentence
Grounding [52.01687915910648]
本研究では、時間的文のグラウンド化を解決するために、MARN(Motion-Appearance Reasoning Network)を提案する。
動作誘導と外見誘導のオブジェクト関係を学習するために,動作分岐と外見分岐を別々に開発する。
提案するMARNは,従来の最先端手法よりも大きなマージンで優れていた。
論文 参考訳(メタデータ) (2022-01-03T02:44:18Z) - Temporally-Aware Feature Pooling for Action Spotting in Soccer
Broadcasts [86.56462654572813]
私たちは、サッカーの試合の主なアクションを一時的にローカライズするサッカー放送におけるアクションスポッティングの分析に焦点を当てています。
時間的知識を組み込んだNetVLAD++という,NetVLADに基づく新たな機能プーリング手法を提案する。
我々は最近の大規模データセット SoccerNet-v2 の方法論をトレーニングし、評価し、アクションスポッティングのための平均平均mAP 53.4% に達した。
論文 参考訳(メタデータ) (2021-04-14T11:09:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。