論文の概要: GRAZE: Grounded Refinement and Motion-Aware Zero-Shot Event Localization
- arxiv url: http://arxiv.org/abs/2604.01383v1
- Date: Wed, 01 Apr 2026 20:41:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-03 14:21:09.970586
- Title: GRAZE: Grounded Refinement and Motion-Aware Zero-Shot Event Localization
- Title(参考訳): GRAZE: グラウンドリファインメントとモーション対応ゼロショットイベントローカライゼーション
- Authors: Syed Ahsan Masud Zaidi, Lior Shamir, William Hsu, Scott Dietrich, Talha Zaidi,
- Abstract要約: ラベル付きタックルトリミングの例を必要としないFPOCローカライゼーションのためのトレーニングフリーパイプラインを提案する。
738のタックル・プラクティス・ビデオでは、GRAZEは97.4%のクリップの有効出力を生成し、全クリップの77.5%と全クリップの82.7%で$pm$10フレームと$pm$20フレームでFPOCをローカライズする。
- 参考スコア(独自算出の注目度): 0.4306143768014156
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: American football practice generates video at scale, yet the interaction of interest occupies only a brief window of each long, untrimmed clip. Reliable biomechanical analysis, therefore, depends on spatiotemporal localization that identifies both the interacting entities and the onset of contact. We study First Point of Contact (FPOC), defined as the first frame in which a player physically touches a tackle dummy, in unconstrained practice footage with camera motion, clutter, multiple similarly equipped athletes, and rapid pose changes around impact. We present GRAZE, a training-free pipeline for FPOC localization that requires no labeled tackle-contact examples. GRAZE uses Grounding DINO to discover candidate player-dummy interactions, refines them with motion-aware temporal reasoning, and uses SAM2 as an explicit pixel-level verifier of contact rather than relying on detection confidence alone. This separation between candidate discovery and contact confirmation makes the approach robust to cluttered scenes and unstable grounding near impact. On 738 tackle-practice videos, GRAZE produces valid outputs for 97.4% of clips and localizes FPOC within $\pm$ 10 frames on 77.5% of all clips and within $\pm$ 20 frames on 82.7% of all clips. These results show that frame-accurate contact onset localization in real-world practice footage is feasible without task-specific training.
- Abstract(参考訳): アメリカンフットボールの練習は大規模にビデオを生成するが、興味の相互作用は、長い、トリミングされていない各クリップの短い窓しか占めていない。
したがって、信頼性の高い生体力学解析は、相互作用する物質と接触の開始の両方を識別する時空間的局在に依存する。
プレイヤーがタックルダミーに物理的に触れる最初のフレームとして定義されるFPOC(First Point of Contact)を、カメラモーション、クラッタ、複数の同様の装備のアスリート、衝撃に関する迅速なポーズ変化を含む非拘束の練習映像で検討した。
本稿では,FPOCローカライゼーションのためのトレーニングフリーパイプラインであるGRAZEについて述べる。
GRAZEはグラウンディング・ディノ(英語版)を用いてプレイヤーとダミーの相互作用の候補を発見し、動きを認識する時間的推論でそれらを洗練し、SAM2を検出信頼のみに頼るのではなく、明示的なピクセルレベルの接触検証として利用する。
この候補発見と接触確認の分離により、このアプローチは散らばったシーンと不安定な衝突付近の接地に対して堅牢になる。
738のタックル実践ビデオでは、GRAZEは97.4%のクリップの有効出力を生成し、全クリップの77.5%、全クリップの82.7%の20フレームでFPOCを$\pm$10フレームでローカライズする。
これらの結果から,実写映像におけるフレーム精度の高いコンタクトオンセットの定位化は,タスク固有の訓練を使わずに実現可能であることが示された。
関連論文リスト
- Predicting Penalty Kick Direction Using Multi-Modal Deep Learning with Pose-Guided Attention [0.0]
本研究では,ボール接触前のペナルティキックの方向を予測するためのリアルタイム・マルチモーダル深層学習フレームワークを提案する。
755ペナルティキックイベントのカスタムデータセットは、実際のマッチビデオから作成され、オブジェクト検出、シューターキーポイント、ファイナルボール配置のためのフレームレベルのアノテーションが提供されている。
このモデルはホールドアウトテストセットで89%の精度を達成し、視覚のみのベースラインとポーズのみのベースラインを14-22%上回った。
論文 参考訳(メタデータ) (2025-09-30T11:02:59Z) - KASportsFormer: Kinematic Anatomy Enhanced Transformer for 3D Human Pose Estimation on Short Sports Scene Video [4.653030985708889]
スポーツのための新しい3Dポーズ推定フレームワークであるKASportsFormerを紹介する。
提案手法は,MPJPEの誤差を58.0mm,34.3mmとした。
論文 参考訳(メタデータ) (2025-07-28T12:17:40Z) - FACTS: Fine-Grained Action Classification for Tactical Sports [4.810476621219244]
フェンシングやボクシングのような速いペースで密着したスポーツにおけるきめ細かいアクションの分類は、固有の課題である。
我々は、生のビデオデータを直接処理する、きめ細かいアクション認識のための新しいアプローチであるFACTSを紹介する。
本研究は, トレーニング, パフォーマンス分析, スペクタエンゲージメントを向上し, 戦術スポーツにおける行動分類のための新しいベンチマークを設定した。
論文 参考訳(メタデータ) (2024-12-21T03:00:25Z) - PMI Sampler: Patch Similarity Guided Frame Selection for Aerial Action
Recognition [52.78234467516168]
本稿では、隣接フレーム間の動きバイアスを定量化するために、パッチ相互情報(PMI)スコアの概念を導入する。
シフトリークReLuと累積分布関数を用いた適応フレーム選択方式を提案する。
本手法は,UAV-Humanの2.2~13.8%,NEC Droneの6.8%,Diving48データセットの9.0%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2023-04-14T00:01:11Z) - PACE: Data-Driven Virtual Agent Interaction in Dense and Cluttered
Environments [69.03289331433874]
PACEは,高密度で散らばった3Dシーン全体と対話し,移動するために,モーションキャプチャーされた仮想エージェントを改良する新しい手法である。
本手法では,環境中の障害物や物体に適応するために,仮想エージェントの動作シーケンスを必要に応じて変更する。
提案手法を先行動作生成技術と比較し,本手法の利点を知覚的研究と身体的妥当性の指標と比較した。
論文 参考訳(メタデータ) (2023-03-24T19:49:08Z) - P2ANet: A Dataset and Benchmark for Dense Action Detection from Table Tennis Match Broadcasting Videos [64.57435509822416]
この作品は、ワールド・テーブルテニス選手権とオリンピアードのプロの卓球試合の放送ビデオから収集された2,721本のビデオクリップで構成されている。
強調局所化と強調認識という2つのアクション検出問題を定式化する。
その結果、TheNameは依然として困難なタスクであり、ビデオからの高密度なアクション検出のための特別なベンチマークとして使用できることを確認した。
論文 参考訳(メタデータ) (2022-07-26T08:34:17Z) - Shot Contrastive Self-Supervised Learning for Scene Boundary Detection [7.4262338683231155]
ショットコントラスト学習アプローチ(ShotCoL)は、近くのショット間の類似性を最大化するショット表現を学習する。
シーン境界検出のタスクにShotCoLを適用する方法を示し、MovieNetデータセット上で最先端のパフォーマンスを提供する。
われわれは、ビデオ広告を挿入できる映画やテレビ番組のタイムスタンプを見つけながら、最小限の破壊的な視聴体験を提供する。
論文 参考訳(メタデータ) (2021-04-28T02:35:09Z) - Enhancing Unsupervised Video Representation Learning by Decoupling the
Scene and the Motion [86.56202610716504]
アクションカテゴリは、アクションが発生するシーンと非常に関連しているため、モデルが、シーン情報のみを符号化したソリューションに分解する傾向がある。
本稿では,シーンと動き(DSM)を2つの簡単な操作で分離し,動き情報に対するモデル注意がより高いようにすることを提案する。
論文 参考訳(メタデータ) (2020-09-12T09:54:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。