論文の概要: TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos
- arxiv url: http://arxiv.org/abs/2608.12920v1
- Date: Thu, 13 Aug 2026 08:01:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.434657
- Title: TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos
- Title(参考訳): TennisVAR: テニスビデオにおける戦術推論のためのマルチモーダル言語モデル
- Authors: Yifan Mei, Qingling Shi, Changli Wu, Jiayuan Rao, Jiayi Ji, Liujuan Cao,
- Abstract要約: 我々は、オープンエンドの回答、階層的戦術ラベル、順序付けられたサポートストローク列、決定的なキーアクションをモデルが共同で予測することを要求する新しいラリーレベルタスクを開発する。
さらに,11,189件の集会ビデオ,41,485件のストロークイベント,25,429件の質問応答対,11,189件の質問応答対を含む大規模な専門家注釈付きベンチマークであるTRACEを紹介する。
TRACE 上に構築した Tennis VARI (Tennis Video Action-chain Reasoner) は,エビデンスに基づくマルチモーダルな大規模言語モデルである。
- 参考スコア(独自算出の注目度): 38.69856460966809
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sports-video understanding is moving beyond event recognition toward explaining how actions collectively shape match progression, however, existing tennis-video methods either perceive individual strokes without modeling their tactical dependencies or generate high-level analyses without grounding them in the underlying events. To bridge this perception-to-understanding gap, we formulate stroke-evidence-grounded tactical reasoning, a new rally-level task that requires models to jointly predict an open-ended answer, a hierarchical tactic label, an ordered sequence of supporting strokes, and decisive key actions, with each evidence stroke anchored to its racket-ball contact frame. We further introduce TRACE (Tactical Reasoning with Action-Chain Evidence in Tennis), a large-scale expert-annotated benchmark containing 11,189 rally videos, 41,485 stroke events, 25,429 tactical units, and 11,189 question-answer pairs, which unifies fine-grained stroke attributes, cross-stroke tactical relations, hierarchical tactic annotations, and evidence-grounded questions across factual perception, tactical understanding, and decision reasoning. Building on TRACE, we propose TennisVAR (Tennis Video Action-chain Reasoner), an evidence-grounded multimodal large language model that follows an "event-relation-evidence-tactic" reasoning paradigm, where an Event Parsing Module converts continuous rallies into explicit stroke-event sequences while a Tactical Graph-Guided Temporal Reasoner jointly models rally progression and same-player decision dependencies to identify question-relevant evidence and decisive actions.
- Abstract(参考訳): スポーツビデオの理解は、イベント認識を超えて、行動が集合的に進行する過程をどのように形成するかを説明するようになっているが、既存のテニスビデオ手法は、戦術的依存関係をモデル化せずに個々のストロークを知覚するか、下位のイベントに基礎を置かずにハイレベルな分析を生成するかのいずれかである。
この認識と理解のギャップを埋めるために、我々は、ラケットボールの接触フレームに各エビデンスストロークが固定された状態で、オープンエンドの回答、階層的な戦術ラベル、順序付けられた支持ストロークのシーケンス、決定的なキーアクションをモデルが共同で予測する必要がある新しいラリーレベルタスクである、ストロークエビデンス・グラウンドの戦術推論を定式化する。
さらに,11,189件のラリービデオ,41,485件のストロークイベント,25,429件の戦術単位,11,189件の質問応答ペアを含む大規模専門家注釈付きベンチマークであるTRACE(Tactical Reasoning with Action-Chain Evidence in Tennis)を紹介した。
TRACE 上に構築した TennisVAR (Tennis Video Action-chain Reasoner) は,イベントパーシングモジュールが連続ラリーを明示的なストロークアントシーケンスに変換し,Tactical Graph-Guided Temporal Reasoner が連立モデルと同一プレイヤー決定に依存して,質問関連エビデンスと決定的アクションを識別する,「イベントリレーション・エビデンス・戦術」推論パラダイムに従って,エビデンスベースのマルチモーダル言語モデルである。
関連論文リスト
- A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding [69.31609753061137]
マルチモーダルな大規模言語モデルはシングルビデオ理解において高いパフォーマンスを達成しているが、複数のビデオにまたがる推論能力は依然として限られている。
既存のアプローチでは、複数のビデオを1つの入力にまとめて直接推論を行い、トレーニングと推論のミスマッチを導入する。
現在のマルチビデオベンチマークでは、主にイベントレベルの比較を強調しており、アイデンティティレベルのマッチング、きめ細かい識別、構造化されたマルチステップ推論が過小評価されている。
視覚ツール,タスク固有のスキル,コンフリクト対応検証機構を統合した,多視点理解のためのスキル強化型エージェントフレームワークSAMAを提案する。
論文 参考訳(メタデータ) (2026-03-16T02:09:48Z) - TennisExpert: Towards Expert-Level Analytical Sports Video Understanding [16.625250626542208]
テニスは最も広くフォローされているスポーツの1つであり、プロのアナリティクス、自動コーチング、リアルタイムの解説に強い可能性を持つ広範な放送映像を生み出している。
しかし、詳細な注釈と専門家レベルの注釈を付けた大規模なベンチマークが欠如しているため、自動テニス理解はいまだ探索されていない。
これらの課題に対処するため、200以上のプロの試合(471.9時間)と4万以上のラリーレベルのクリップからなる大規模なテニスベンチマークであるTennisVLを紹介した。
Qwen3-VL-8B上に構築されたメモリ拡張モデルとビデオセマンティクスを統合するマルチモーダルテニス理解フレームワークであるTennisExpertを提案する。
論文 参考訳(メタデータ) (2026-03-11T15:12:10Z) - STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training [87.58996020705258]
Video Large Language Models (Video-LLMs) は近年,ビデオ理解タスクに強い派生性を示している。
ビデオLLMは、多段階の明示的時間的推論を必要とする構成的推論と、オブジェクトの関係、相互作用、イベントに苦労する。
本稿では,ビデオLLMが生ビデオから推論に富んだ微調整データを生成し,自己改善を実現するための,グラフ誘導型自己学習手法STEPを提案する。
論文 参考訳(メタデータ) (2024-11-29T11:54:55Z) - Harnessing Temporal Causality for Advanced Temporal Action Detection [53.654457142657236]
本稿では,因果的注意と因果的マンバを組み合わせたCausalTADを提案する。
Ego4D Challenge 2024では,EPIC-Kitchens Challenge 2024では行動認識,行動検出,音声によるインタラクション検出トラックで1位,Ego4D Challenge 2024ではMoment Queriesトラックで1位にランクインした。
論文 参考訳(メタデータ) (2024-07-25T06:03:02Z) - ViSTec: Video Modeling for Sports Technique Recognition and Tactical
Analysis [19.945083591851517]
ViSTecは、人間の認知にインスパイアされたビデオベースのスポーツ技術認識モデルである。
提案手法は,ストロークシーケンスにおける戦略的知識を明示的にモデル化するグラフを統合し,文脈的帰納バイアスによる技術認識を強化する。
中国の卓球チームの専門家によるケーススタディは、分析を自動化するモデルの能力を検証する。
論文 参考訳(メタデータ) (2024-02-25T02:04:56Z) - Where Will Players Move Next? Dynamic Graphs and Hierarchical Fusion for
Movement Forecasting in Badminton [6.2405734957622245]
我々は、どのタイプのリターンストロークが作られるか、またプレイヤーが以前のストロークに基づいてどこに移動するかを予測することに重点を置いている。
既存のシーケンスベースのモデルはプレイヤー間の相互作用の影響を無視し、グラフベースのモデルは依然として多面的視点に悩まされている。
本稿では,対話型抽出器を用いた動的グラフと階層型移動予測モデル(DyMF)を提案する。
論文 参考訳(メタデータ) (2022-11-22T12:21:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。