論文の概要: Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach
- arxiv url: http://arxiv.org/abs/2607.00716v1
- Date: Wed, 01 Jul 2026 10:03:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.841178
- Title: Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach
- Title(参考訳): 行動認識のための部分骨格可視性:視野制約によるアプローチ
- Authors: Yingjie Dai, Tianyang Xu, Yanglin Deng, Xiao-Jun Wu, Josef Kittler,
- Abstract要約: partialVisGraphは、制約されたフィールド・オブ・ビューの下で、堅牢なスケルトンベースのアクション認識のための新しいフレームワークである。
部分的な可視性の下では、最先端の精度を一貫して達成し、厳しいFoV制限のあるサブセットでは68.8%まで上昇する。
提案手法は,非拘束環境下でのスケルトンに基づく行動理解を実現するための,原則的かつ実践的な経路を提供する。
- 参考スコア(独自算出の注目度): 60.596944437968524
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Skeleton-based action recognition has achieved remarkable success by exploiting joint coordinates and their topological connections, yet prevailing methods overwhelmingly assume complete and clean skeleton inputs. In real-world deployments, such as egocentric vision, crowded surveillance, wearable devices, or edge robotics, limited field-of-view (FoV) frequently causes substantial joint visibility dropout, leading to severe performance degradation that existing models are largely unprepared to handle. To bridge this critical yet underexplored gap, we introduce PartialVisGraph, a novel hypergraph framework tailored for robust skeleton action recognition under constrained FoV. We first construct highly expressive hypergraphs by introducing learnable virtual hyperedges that form a soft incidence matrix, capturing flexible high-order dependencies beyond conventional pairwise graphs. We then propose the Single-Head Sample-Adaptive Transformer, which adaptively aggregates joint features onto hyperedges while explicitly incorporating a visibility prior. This prior selectively gates information flow, preventing occluded or out-of-view joints from corrupting reliable feature propagation. We further establish rigorous evaluation protocols with realistic FoV simulation benchmarks on NTU RGB+D 60 and 120. Extensive experiments demonstrate that PartialVisGraph consistently achieves state-of-the-art accuracy under partial visibility, with gains of up to 68.8\% on subsets with severe FoV restrictions compared to recent strong baselines, while remaining superior on full-visibility settings. Our approach offers a principled and practical pathway toward deployable skeleton-based action understanding in unconstrained environments.
- Abstract(参考訳): 骨格をベースとした行動認識は、関節座標とそのトポロジカルな接続を利用して顕著な成功を収めたが、完全な骨格入力とクリーンな骨格入力を圧倒的に仮定する手法が一般的であった。
エゴセントリック・ビジョン、密集した監視、ウェアラブル・デバイス、エッジ・ロボティクスといった現実世界の展開では、視野の制限(FoV)がしばしば関節の視界の低下を引き起こし、既存のモデルに対処する準備がほとんど整っていないという深刻なパフォーマンス低下を引き起こす。
この重要かつ未探索のギャップを埋めるために、制約されたFoV下での堅牢なスケルトン動作認識に適した、新しいハイパーグラフフレームワークであるPartialVisGraphを導入する。
まず,ソフトインシデント行列を形成する学習可能な仮想ハイパーエッジを導入し,従来のペアワイズグラフを超える柔軟な高次依存関係をキャプチャすることで,高表現性ハイパーグラフを構築する。
次に,単一頭部サンプル適応変換器を提案する。これは,視認性を事前に明確に取り入れつつ,関節機能をハイパーエッジに適応的に集約する。
これにより、情報フローを選択的にゲートし、閉塞または外関節が信頼性の高い特徴伝搬を損なうのを防止する。
さらに,NTU RGB+D 60および120のFoVシミュレーションベンチマークを用いて,厳密な評価プロトコルを確立する。
大規模な実験により、PartialVisGraphは部分的な可視性の下で一貫して最先端の精度を達成し、最近の強力なベースラインよりも厳しいFoV制限を持つサブセットでは最大68.8 %のゲインを達成している。
提案手法は,非拘束環境下でのスケルトンに基づく行動理解を実現するための,原則的かつ実践的な経路を提供する。
関連論文リスト
- Pose Anything Anywhere:Model-free Object Poses from Arbitrary References [64.58017857473774]
RGBとRGB-Dの両方の入力をシームレスにサポートするモデルフリーフレームワークであるPANYを提案する。
1つまたはスパースなポーズフリー参照ビューで動作し、新しいオブジェクトに効果的に一般化する。
複数のベンチマークで最先端のパフォーマンスを実現し、既存のモデルフリーメソッドを大幅に上回っている。
論文 参考訳(メタデータ) (2026-06-22T17:23:57Z) - Bridging the Morphology Gap: Adapting VLA Models to Dexterous Manipulation via Intent-Conditioned Fine-Tuning [7.018869512628755]
InDexは、クロスモルフォロジーのセマンティック継承に根ざした、新しいデータ効率適応フレームワークである。
InDexは、最小限のデモデータで複雑なスキルを習得し、モノリシックなベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2026-06-10T14:03:52Z) - LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination [66.06027569507403]
textbfViewpoint Imagination (VIM) は、観測された証拠と想像された証拠の両方について、隠蔽された一次観測と条件の行動予測から補完的な視点を生成する。
VIMは、追加のカメラをデプロイ時に必要とせずに、タスクスイート、オクルージョンタイプ、重大度レベルの堅牢性を改善する。
論文 参考訳(メタデータ) (2026-06-09T13:39:49Z) - Hybrid Robustness Verification for Spatio-Temporal Neural Networks [19.026662893450425]
既存の検証方法は、過度に保守的な近似や不正な計算コストに依存している。
実際には、対向摂動は、低次元、意味論的に意味のある部分空間に制約された、構造化された空間的および時間的相関を示す。
動作認識(UCF-101)、自律運転(Udacity)、医用画像(MedMNIST)の用途を対象として、3次元CNNによる映像入力のロバスト性検証を行う。
論文 参考訳(メタデータ) (2026-06-08T17:06:51Z) - When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection [12.446807294893638]
本稿では,視線方向の相互コヒーレンス,頭部アライメント,対人関係の瞳孔配置として定義された高レベルの意味的キューであるソーシャル・ゲイズ・コンシステンシーを紹介する。
既存の低レベルパラダイムに対して,これまで未利用であった検出軸を構成することを示す。
4ステップのアカウントでは、単一インパインター(FLUX.1-Fill)のトレーニングがマルチジェネレータスイートに移行した理由が説明されている。
論文 参考訳(メタデータ) (2026-05-26T17:50:17Z) - StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models [98.72926158261937]
本稿では,Visual AutoRegressive モデルのためのトレーニングフリートークン解析フレームワークを提案する。
我々は局所的なテクスチャの詳細を捉えるために軽量なハイパスフィルタを使用し、グローバルな構造情報を保存するために主成分分析(PCA)を活用している。
スパーストークンの下で有効な次世代の予測を維持するために,近接した特徴伝達戦略を導入する。
論文 参考訳(メタデータ) (2026-03-02T11:35:05Z) - Neighbor-Aware Calibration of Segmentation Networks with Penalty-Based
Constraints [19.897181782914437]
本稿では,ロジット値の等式制約に基づく基本的かつ単純な解を提案し,強制制約と罰則の重みを明示的に制御する。
我々のアプローチは、広範囲のディープセグメンテーションネットワークのトレーニングに利用できる。
論文 参考訳(メタデータ) (2024-01-25T19:46:57Z) - Peeking into occluded joints: A novel framework for crowd pose
estimation [88.56203133287865]
OPEC-NetはイメージガイドされたプログレッシブGCNモジュールで、推論の観点から見えない関節を推定する。
OCPoseは、隣接するインスタンス間の平均IoUに対して、最も複雑なOccluded Poseデータセットである。
論文 参考訳(メタデータ) (2020-03-23T19:32:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。