論文の概要: Entity-Aware Sequence Transduction for Player-Centric Ball Action Spotting
- arxiv url: http://arxiv.org/abs/2608.01696v1
- Date: Mon, 03 Aug 2026 04:48:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.329731
- Title: Entity-Aware Sequence Transduction for Player-Centric Ball Action Spotting
- Title(参考訳): プレーヤー中心球アクションスポッティングのためのエンティティ対応シーケンストランスダクション
- Abstract要約: プレーヤー中心のボールアクションスポッティングは、アクターの属性とともに時間的に正確なイベント検出を必要とする。
既存のDenoising Sequence Transduction (DST)ベースラインは、プレーヤロール次元をフラットなフレームレベルの表現の一部として扱う。
符号化全体にわたってロールスロット次元を維持するために,ME-DST(Multi-Entity Denoising Sequence Transduction)を提案する。
- 参考スコア(独自算出の注目度): 3.422845160588969
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Player-centric ball action spotting requires temporally precise event detection together with actor attribution in crowded, partially observed multi-agent sports videos. Existing Denoising Sequence Transduction (DST) baselines treat the player-role dimension as part of a flattened frame-level representation, which weakens the inductive bias for modeling player-specific temporal evolution and inter-player interactions. To address this limitation, we propose Multi-Entity Denoising Sequence Transduction (ME-DST). ME-DST keeps the role-slot dimension throughout encoding. It uses temporal attention to model the history of each role slot, and spatial attention to exchange information across role slots at each frame. This factorized design gives the model a direct structure for separating within-player evolution from inter-player context. We also add learnable role embeddings, tracking-derived tactical features, and fused visual predictions from X3D-L and Swin3D-S. Experiments on the FOOTPASS dataset show that ME-DST reaches a Micro F1 of 0.778. This improves the strongest official TAAD+DST baseline by 10.3 percentage points. Controlled ablations show that preserving the entity axis and encoding role identity are central to this gain. These results suggest that explicit entity modeling is an effective inductive bias for player-centric sports event understanding.
- Abstract(参考訳): プレイヤー中心のボールアクションスポッティングは、混み合った部分的に観察されるマルチエージェントスポーツビデオにおけるアクターの属性とともに、時間的に正確なイベント検出を必要とする。
既存の Denoising Sequence Transduction (DST) ベースラインは、プレイヤー・ロール次元をフラットなフレームレベルの表現の一部として扱い、プレイヤー固有の時間的進化とプレイヤー間相互作用をモデル化するための誘導バイアスを弱める。
この制限に対処するため,Multi-Entity Denoising Sequence Transduction (ME-DST)を提案する。
ME-DSTはエンコーディング全体を通してロールスロット次元を保持する。
時間的注意を用いて各ロールスロットの歴史をモデル化し、空間的注意を各フレームのロールスロット間で情報交換する。
この因子化設計は、プレイヤー間のコンテキストからプレイヤー内部の進化を分離するための直接的な構造を与える。
また、学習可能なロール埋め込み、追跡から得られる戦術的特徴、X3D-LとSwin3D-Sの融合した視覚的予測も追加する。
FOOTPASSデータセットの実験では、ME-DSTがマイクロF1に達する確率は0.778である。
これにより、TAAD+DSTベースラインが10.3%向上した。
制御されたアブレーションは、エンティティ軸の保存とロールのアイデンティティの符号化がこの利得の中心であることを示している。
これらの結果は,選手中心のスポーツイベント理解において,明示的な実体モデリングが効果的な帰納的バイアスとなることを示唆している。
関連論文リスト
- DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation [58.47973015036709]
DisPOSEは、本質的に離散的な多視点人物割り当て問題を近似する自己教師型フレームワークである。
特定可能なシンクホーン射影を用いることにより、本モデルは有効かつ実現可能な課題への解の導出を学ぶ。
提案手法は、標準データセット上での最先端の自己教師手法よりも優れている。
論文 参考訳(メタデータ) (2026-06-05T16:14:39Z) - EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026 [69.56534058291463]
EgoActionは、統合された分離された検出と融合パイプラインである。
パイプラインはEPICに精細化されたVideoMAE-L機能を使用し、因果時間モデルを用いて名詞と動詞の時間的検出器を分離する。
EgoActionは、エゴセントリックな時間的行動検出のためのコンパクトで再現可能なシステムを提供する。
論文 参考訳(メタデータ) (2026-05-23T10:05:56Z) - Decoding Defensive Coverage Responsibilities in American Football Using Factorized Attention Based Transformer Models [0.22485007639406518]
本稿では,NFLマルチエージェントプレイトラッキングデータに適用した因子化アテンションベーストランスフォーマモデルを提案する。
本モデルにより,各プレイヤの代入とマッチアップのダイナミクスの予測モデリングが可能となる。
我々のモデルは全てのタスクに対して約89%以上の精度を達成し、真の精度は基底真理ラベルにおけるアノテーションの曖昧さを考慮に入れられる可能性がある。
論文 参考訳(メタデータ) (2026-03-26T20:43:30Z) - Masked Temporal Interpolation Diffusion for Procedure Planning in Instructional Videos [32.71627274876863]
本稿では,授業ビデオにおけるプロシージャ計画の課題に対処し,開始と終了の視覚的観察から協調的かつタスクに沿ったアクションシーケンスを生成することを目的とする。
これまでの研究は主に、観察された状態と観察されていない行動の間のギャップを埋めるためにテキストレベルの監督に依存してきたが、行動間の複雑な時間的関係を捉えるのに苦労した。
本研究では,拡散モデル内に潜時空間時間モジュールを導入した仮設仮設時間補間拡散モデルを提案する。
論文 参考訳(メタデータ) (2025-07-04T08:54:59Z) - Neural Attention Field: Emerging Point Relevance in 3D Scenes for One-Shot Dexterous Grasping [34.98831146003579]
被写体と文脈のバリエーションのある新しいシーンに、巧妙なつかみをワンショットで移動させることは、難しい問題である。
本稿では,3次元空間における意味認識型高次特徴体を表現するためのテクスチュラルアテンション場を提案する。
論文 参考訳(メタデータ) (2024-10-30T14:06:51Z) - TranSPORTmer: A Holistic Approach to Trajectory Understanding in Multi-Agent Sports [28.32714256545306]
TranSportmerは、これらすべてのタスクに対処できる統合トランスフォーマーベースのフレームワークである。
時間的ダイナミクスと社会的相互作用を同変的に効果的に捉える。
プレイヤー予測、プレイヤー予測・インプット、ボール推論、ボールインプットにおいて、最先端のタスク固有モデルより優れている。
論文 参考訳(メタデータ) (2024-10-23T11:35:44Z) - Grounding 3D Scene Affordance From Egocentric Interactions [52.5827242925951]
接地型3Dシーンアベイランスは、3D環境におけるインタラクティブな領域を見つけることを目的としている。
我々は,エゴセントリックなインタラクションから3Dシーンの空き時間を確保するという,新しい課題を紹介した。
論文 参考訳(メタデータ) (2024-09-29T10:46:19Z) - Temporal Action Localization with Enhanced Instant Discriminability [66.76095239972094]
時間的行動検出(TAD)は、すべての行動境界とその対応するカテゴリを、トリミングされていないビデオで検出することを目的としている。
本稿では,既存の手法による動作境界の不正確な予測を解決するために,TriDetという一段階のフレームワークを提案する。
実験結果から,複数のTADデータセット上でのTriDetの堅牢性と最先端性能が示された。
論文 参考訳(メタデータ) (2023-09-11T16:17:50Z) - Exploring Optical-Flow-Guided Motion and Detection-Based Appearance for
Temporal Sentence Grounding [61.57847727651068]
テンポラルな文グラウンドディングは、与えられた文クエリに従って、意図しないビデオのターゲットセグメントをセマンティックにローカライズすることを目的としている。
これまでのほとんどの研究は、ビデオ全体のフレーム全体のフレームレベルの特徴を学習することに集中しており、それらをテキスト情報と直接一致させる。
我々は,光フロー誘導型モーションアウェア,検出ベース外観アウェア,3D認識オブジェクトレベル機能を備えた,動き誘導型3Dセマンティック推論ネットワーク(MA3SRN)を提案する。
論文 参考訳(メタデータ) (2022-03-06T13:57:09Z) - Spatial-Temporal Correlation and Topology Learning for Person
Re-Identification in Videos [78.45050529204701]
クロススケール空間時空間相関をモデル化し, 識別的, 堅牢な表現を追求する新しい枠組みを提案する。
CTLはCNNバックボーンとキーポイント推定器を使用して人体から意味的局所的特徴を抽出する。
グローバルな文脈情報と人体の物理的接続の両方を考慮して、多スケールグラフを構築するためのコンテキスト強化トポロジーを探求する。
論文 参考訳(メタデータ) (2021-04-15T14:32:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。