論文の概要: Learning Consistent Temporal Grounding between Related Tasks in Sports Coaching
- arxiv url: http://arxiv.org/abs/2603.18453v1
- Date: Thu, 19 Mar 2026 03:32:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:05.940212
- Title: Learning Consistent Temporal Grounding between Related Tasks in Sports Coaching
- Title(参考訳): スポーツコーチングにおける関連課題間の一貫性のある時間的接地学習
- Authors: Arushi Rai, Adriana Kovashka,
- Abstract要約: ビデオLLMは、しばしば無関係なフレームに出席するが、これは特に正確な時間的接地を必要とするスポーツコーチングタスクに有害である。
我々は、生成や検証といった関連するタスクが同じフレームに従わなければならないという観察を活用することで、追加アノテーションなしで時間的接地を改善する。
目的とするトレーニングでは,3つのスポーツコーチングタスクにおける教師付き微調整により,+3.0%,+14.1%の精度,+0.9 BERTScoreが得られた。
- 参考スコア(独自算出の注目度): 27.82932642584153
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video-LLMs often attend to irrelevant frames, which is especially detrimental for sports coaching tasks requiring precise temporal grounding. Yet obtaining frame-level supervision is challenging: expensive to collect from humans and unreliable from other models. We improve temporal grounding without additional annotations by exploiting the observation that related tasks, such as generation and verification, must attend to the same frames. We enforce this via a self-consistency objective over select visual attention maps of tightly-related tasks. Using VidDiffBench, which provides ground-truth keyframe annotations, we first validate that attention misallocation is a significant bottleneck. We then show that training with our objective yields gains of +3.0%, +14.1% accuracy and +0.9 BERTScore over supervised finetuning across three sports coaching tasks: Exact, FitnessQA, and ExpertAF, even surpassing closed-source models.
- Abstract(参考訳): ビデオLLMは、しばしば無関係なフレームに出席するが、これは特に正確な時間的接地を必要とするスポーツコーチングタスクに有害である。
しかし、フレームレベルの監視を得ることは難しい。人間から収集することは高価で、他のモデルから信頼できない。
我々は、生成や検証といった関連するタスクが同じフレームに従わなければならないという観察を活用することで、追加アノテーションなしで時間的接地を改善する。
我々は、厳密なタスクの視覚的注意マップの選択に対して、自己整合性目標を用いてこれを実施する。
基調的なキーフレームアノテーションを提供するVidDiffBenchを使って、注意のずれが重大なボトルネックであることを最初に検証します。
次に,3つのスポーツコーチングタスク(Exact, FitnessQA, ExpertAF)における教師付き微調整において,目標値+3.0%,+14.1%の精度,+0.9 BERTScoreが,クローズドソースモデルを超えていることを示す。
関連論文リスト
- VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting [58.508924874097715]
VisonCoach は,(1) ビデオと質問に対して適切なプロンプト型を予測する Visual Prompt Selector と,(2) 視覚的プロンプトガイダンスとオブジェクトグラウンド報酬の下で RL で最適化された Spatio-Reasoner の2つのコンポーネントから構成される。
この結果から,トレーニング中の視覚的プロンプトが映像推論を改善するのに対し,注意散布センスは推論時にプロンプトを必要とせず,この能力を実現することが示唆された。
論文 参考訳(メタデータ) (2026-03-15T23:32:02Z) - SportR: A Benchmark for Multimodal Large Language Model Reasoning in Sports [21.410115837645318]
SportRは、スポーツインテリジェンスに必要な基本的な理由に基づいてMLLMを訓練し、評価するために設計された最初のマルチスポーツ大規模ベンチマークである。
私たちのベンチマークでは,5,017枚の画像と2,101本のビデオのデータセットが提供されている。
罰則の決定や戦術の説明など,多段階の推論を必要とする最も先進的なタスクに対して,我々は7,118の高品質な人間による思考の連鎖(Chain of Thought)アノテーションを提供する。
論文 参考訳(メタデータ) (2025-11-09T18:55:20Z) - Video-LLMs with Temporal Visual Screening [59.18455762289321]
テンポラル・ビジュアル・スクリーニング (TVS) はビデオ質問応答とチューニングデータを処理する新しいタスクである。
TVSは、ビデオインストラクションチューニング(トレーニング)とビデオ質問回答(推論)パイプラインの両方にシームレスに統合可能な、モジュール化されたフロントエンドアダプタタスクとして定式化されている。
実験により、TVSを取り入れた場合、相対利得は7.33%(トレーニング)、34.6%(推論)となることが示された。
論文 参考訳(メタデータ) (2025-08-27T14:33:32Z) - Temporal Correlation Meets Embedding: Towards a 2nd Generation of JDE-based Real-Time Multi-Object Tracking [52.04679257903805]
共同検出・埋め込み(JDE)トラッカーは多目的追跡(MOT)タスクにおいて優れた性能を示した。
TCBTrackという名前のトラッカーは、複数の公開ベンチマークで最先端のパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2024-07-19T07:48:45Z) - DropMAE: Learning Representations via Masked Autoencoders with Spatial-Attention Dropout for Temporal Matching Tasks [77.84636815364905]
本稿では,種々の時間的マッチングに基づくダウンストリームタスクに対して,マスク付きオートエンコーダ(MAE)ビデオの事前学習を行う。
そこで我々は,映像における時間的対応学習を容易にするために,フレーム再構成において空間的アテンション・ドロップアウトを適応的に行うDropMAEを提案する。
論文 参考訳(メタデータ) (2023-04-02T16:40:42Z) - More Than Just Attention: Learning Cross-Modal Attentions with
Contrastive Constraints [63.08768589044052]
本稿では,コントラストコンテンツリソーシング (CCR) とコントラストコンテンツスワッピング (CCS) の制約を提案する。
CCRとCCSの制約は、明示的な注意アノテーションを必要とせず、対照的な学習方法で注意モデルのトレーニングを監督する。
Flickr30kとMS-COCOのデータセットの実験は、これらの注意制約を2つの最先端の注意ベースモデルに統合することで、モデルのパフォーマンスが向上することを示した。
論文 参考訳(メタデータ) (2021-05-20T08:48:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。