論文の概要: Probing Identity-Specific Motion Signatures: A Controlled Diagnostic Study
- arxiv url: http://arxiv.org/abs/2607.03633v1
- Date: Fri, 03 Jul 2026 23:17:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.669569
- Title: Probing Identity-Specific Motion Signatures: A Controlled Diagnostic Study
- Title(参考訳): アイデンティティに特有な動作シグナチャの探索:制御診断による検討
- Authors: Yingtie Lei, Fangxun Liu, Baicheng Wu, Colin Lee, Ziheng Zhang, Junke Yang, Zhiyuan Tao, Xuyan Huang, Shuheng Wang, William Koran, Kyle Park, Elijah H Buckwalter, Cheng-Hsuan Chiang, Tejas Naik, Daniel Yi, Wei-Lun Chao,
- Abstract要約: アイデンティティ認識は伝統的に静的な外観に大きく依存してきた。
しかし、動きに一貫性があり、個人固有の力学は相補的でより堅牢なシグネチャを提供することができる。
これは基本的な疑問を提起する: アイデンティティ固有のモーションキューが明らかに存在するとき、現代のビデオモデルでは認識にどの程度使われているのか?
- 参考スコア(独自算出の注目度): 22.975364118260956
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Identity recognition (e.g., person, animal re-identification) has traditionally relied heavily on static appearance cues. Yet motion--consistent, individual-specific dynamics--can provide a complementary and potentially more robust signature, especially when appearance is weak or variable. This raises a fundamental question: when identity-specific motion cues are clearly present, to what extent do modern video models use them for recognition? To investigate this question, we conduct a systematic diagnostic study and introduce BALLER120, a controlled benchmark of 120 professional basketball players performing free-throws. By focusing on the same multi-phase action across individuals, BALLER120 reduces action-level variation and identity-correlated acquisition biases, enabling fine-grained analysis of identity-specific kinematic patterns. We find that modern video models can predict identity accurately from RGB videos, but often rely on static appearance cues such as faces and jersey regions, even when informative motion cues are available. Strikingly, when appearance is suppressed through silhouette-only or skeleton-only inputs, the same model architectures shift toward motion micro-patterns (e.g., foot placement and elbow bending). Despite containing less visual information, appearance-suppressed representations achieve competitive accuracy and stronger robustness to appearance shifts. Our qualitative analyses further show that appearance-suppressed models attend to distinctive motion patterns across individuals. Overall, our study demonstrates that identity-specific motion signatures are present, informative, and learnable, but modern video models may overlook them in favor of easier static shortcuts unless appearance cues are explicitly suppressed.
- Abstract(参考訳): アイデンティティ認識(例えば、人、動物の再識別)は、伝統的に静的な外観の手がかりに大きく依存してきた。
しかし、動き-一貫性があり、個人固有のダイナミクス-は、特に外見が弱い場合、補完的で、より堅牢なシグネチャを提供することができる。
これは基本的な疑問を提起する: アイデンティティ固有のモーションキューが明らかに存在するとき、現代のビデオモデルでは認識にどの程度使われているのか?
そこで本研究では,120人のプロバスケットボール選手がフリースローでプレーするベンチマークBALLER120を紹介する。
BALLER120は、個人間で同じマルチフェーズアクションに焦点を当てることで、アクションレベルの変動とアイデンティティ関連取得バイアスを低減し、アイデンティティ固有の運動パターンのきめ細かい分析を可能にする。
現代のビデオモデルは、RGBビデオから正確なアイデンティティを予測できるが、情報的なモーションキューが利用可能であっても、顔やジャージー領域のような静的な外観の手がかりに頼っていることが多い。
興味深いことに、シルエットのみまたは骨格のみの入力によって外観が抑制されると、同じモデルアーキテクチャが動きのマイクロパターン(例えば、足の配置と肘の曲げ)へと移行する。
視覚情報が少ないにもかかわらず、外観抑圧された表現は、外観シフトに対する競争精度と強い堅牢性を達成する。
さらに質的な分析により、外見に抑圧されたモデルが個人間の独特の動きパターンに寄与していることが判明した。
本研究は, 個人固有の動作シグネチャの存在, 情報的, 学習可能であることを実証するが, 外観が明示的に抑制されない限り, 最新のビデオモデルでは, より容易な静的ショートカットが好まれる可能性がある。
関連論文リスト
- SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models [53.82339966194578]
動きの絡み合い(英: Motion entanglement)は、カメラの動きや物体の動きのような独立した動き源の意図しない結合である。
本稿では,自作ビデオから学習できるSIFT(Self-Imagination Fine-Tuning)パラダイムを提案する。
論文 参考訳(メタデータ) (2026-06-26T05:39:40Z) - Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision [80.2787127430925]
視覚的に類似した物体を動きによって識別することは、コンピュータビジョンにおいて重要な課題である。
予め訓練したビデオ拡散モデルでは,タスク固有の訓練を伴わないトラッキングに適した動作表現が本質的に学習されていることがわかった。
提案手法は,最近確立されたベンチマークに対する自己教師型アプローチよりも6ポイント向上した。
論文 参考訳(メタデータ) (2025-12-02T02:17:34Z) - CourtMotion: Learning Event-Driven Motion Representations from Skeletal Data for Basketball [45.88028371034407]
CourtMotionはプロバスケットボールにおけるゲームイベントやプレーの分析と予測のためのテンポラリなモデリングフレームワークである。
2段階のアプローチでは、まず、グラフニューラルネットワークを通じて骨格追跡データを処理し、ニュアンスした動きパターンをキャプチャします。
選手の動きを、パス、ショット、ステルスなどのバスケットボールイベントに明示的に結びつけるイベントプロジェクションヘッドを導入し、物理的な動きパターンと目的を関連付けるためにモデルを訓練する。
論文 参考訳(メタデータ) (2025-12-01T09:58:24Z) - Stable Video-Driven Portraits [52.008400639227034]
アニメーションは、ドライビングビデオから表現とポーズを再現することで、単一のソースイメージから写真リアルなビデオを生成することを目的としている。
拡散モデルを用いた最近の進歩は品質の向上を示しているが、弱い制御信号やアーキテクチャ上の制約によって制約されている。
本研究では, 眼, 鼻, 口などのマスク付き顔面領域を, 強力な動き制御手段として活用する新しい拡散型枠組みを提案する。
論文 参考訳(メタデータ) (2025-09-22T08:11:08Z) - X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention [52.94097577075215]
X-NeMoはゼロショット拡散ベースのポートレートアニメーションパイプラインである。
異なる人物の運転ビデオから顔の動きを使って、静的な肖像画を撮影する。
論文 参考訳(メタデータ) (2025-07-30T22:46:52Z) - Learning golf swing signatures from a single wrist-worn inertial sensor [0.0]
単一手首センサを用いたゴルフスイング分析のためのデータ駆動型フレームワークを構築した。
我々は、技術的欠陥の検出と可視化を容易にする動きプリミティブの合成、離散的な語彙を学習する。
本システムでは,手首データから全身運動とスイングイベントを正確に推定し,実験室での動作解析を行う。
論文 参考訳(メタデータ) (2025-06-20T22:57:59Z) - MIMAFace: Face Animation via Motion-Identity Modulated Appearance Feature Learning [30.61146302275139]
動作レベルと同一性レベルの両方でCLIP特徴を変調する動き入出力学習モジュール(MIA)を導入する。
また、クリップ間の時間関係をモデル化するICA(Inter-Clip Affinity Learning Module)を設計する。
提案手法は, 表情と視線を正確に制御し, 忠実なアイデンティティを保存し, クリック内時間的整合性を維持するアニメーション映像を生成する。
論文 参考訳(メタデータ) (2024-09-23T16:33:53Z) - MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion [22.62170098534097]
人間の2次元ポーズと表情の拡散に基づくモデルであるMagicPoseを提案する。
画像拡散モデルの事前の知識を活用することで、MagicPoseは目に見えない人間のアイデンティティや複雑なポーズをうまく一般化する。
提案したモデルは使いやすく、安定拡散に対するプラグインモジュール/拡張と見なすことができる。
論文 参考訳(メタデータ) (2023-11-18T10:22:44Z) - Mitigating and Evaluating Static Bias of Action Representations in the
Background and the Foreground [59.916365866505636]
静的特徴のショートカットは、運動特徴の学習を妨げる可能性があるため、分布外一般化が不十分になる。
本稿では,ビデオの静的および移動部分からの信号に矛盾するテストビデオを作成することにより,前景の静的バイアスの存在を実証的に検証する。
StillMixは、2D参照ネットワークを使ってバイアスを誘発するビデオフレームを特定し、トレーニング用のビデオと混ぜることで、効果的なバイアス抑制を提供する。
論文 参考訳(メタデータ) (2022-11-23T11:40:02Z) - Masked Motion Encoding for Self-Supervised Video Representation Learning [84.24773072241945]
Masked Motion MMEは、外観情報と動作情報の両方を再構成し、時間的手がかりを探索する新しい事前学習パラダイムである。
物体の位置変化や形状変化を追跡することで、人間が行動を認識することができるという事実を動機として、マスク領域におけるこれらの2種類の変化を表す運動軌跡を再構築することを提案する。
我々のMMEパラダイムで事前訓練されたモデルでは、長期的かつきめ細かな動きの詳細を予測できる。
論文 参考訳(メタデータ) (2022-10-12T11:19:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。