論文の概要: Unsupervised Keypoints for Real-Time Fall Detection: Comparative Analysis Under Real-world Conditions with Predictive Bandwidth Reduction
- arxiv url: http://arxiv.org/abs/2607.15400v2
- Date: Mon, 20 Jul 2026 12:20:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.70263
- Title: Unsupervised Keypoints for Real-Time Fall Detection: Comparative Analysis Under Real-world Conditions with Predictive Bandwidth Reduction
- Title(参考訳): リアルタイム転倒検出のための教師なしキーポイント:予測帯域幅削減と実世界の条件下での比較分析
- Abstract要約: ビデオは転倒に関連する姿勢と動きをキャプチャするが、デプロイはプライバシ、計算、帯域幅によって制限される。
本稿では,教師なしキーポイントと予測時間モデルに基づいて,RGB伝送をコンパクトな動作表現に置き換えるプライバシー保護フレームワークを提案する。
ur Fall DetectionとHuman Fallのデータセットのフレームワークを,ランダム,主観的分離,オクルージョンに基づく分割を用いて評価した。
- 参考スコア(独自算出の注目度): 0.5959007032504439
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Falls among older adults are a major safety challenge, but continuous monitoring is difficult to sustain. Video captures fall-related posture and motion, yet deployment is limited by privacy, computation, and bandwidth. Supervised pose estimation is anatomically interpretable but vulnerable to occlusion and partial body visibility. We propose a privacy-preserving framework that replaces RGB transmission with compact motion representations based on unsupervised keypoints and predictive temporal modeling. Local processing performs segmentation and keypoint extraction; variational recurrent prediction and sequence classification then detect falls from observed and forecasted motion. We evaluate the framework on the UR Fall Detection and Human Fall datasets using random, subject-disjoint, and occlusion-based splits. Under random splits, neither representation consistently dominates, suggesting that standard protocols may hide meaningful differences. Under subject-disjoint evaluation, supervised keypoints show a statistically significant advantage, but performance varies by subject: they perform better when anatomical landmarks are visible, whereas unsupervised keypoints are more robust to occlusion and partial visibility, though they produce more false positives for complex activities. Under occlusion-based evaluation, supervised keypoints miss nearly half of all falls, while unsupervised keypoints retain strong sensitivity and substantially outperform them. Their anatomical independence allows spatial anchors to adapt to visible body structure rather than fail on absent landmarks. The gap widens under bandwidth constraints, where supervised localization errors compound through the temporal model. These findings show that representation choice should reflect expected visual conditions and that unsupervised keypoints offer an advantage when body visibility is compromised.
- Abstract(参考訳): 高齢者の転倒は大きな安全上の課題であるが、継続的に監視することは困難である。
ビデオは転倒に関連する姿勢と動きをキャプチャするが、デプロイはプライバシ、計算、帯域幅によって制限される。
監視されたポーズ推定は解剖学的に解釈可能であるが、咬合と部分的な身体視認に弱い。
本稿では,教師なしキーポイントと予測時間モデルに基づいて,RGB伝送をコンパクトな動作表現に置き換えるプライバシー保護フレームワークを提案する。
局所処理はセグメンテーションとキーポイント抽出を行い、変動の繰り返し予測とシーケンス分類を行い、観測された動きと予測された動きからフォールを検出する。
ur Fall DetectionとHuman Fallのデータセットのフレームワークを,ランダム,主観的分離,オクルージョンに基づく分割を用いて評価した。
ランダムな分割の下では、どちらの表現も一貫して支配せず、標準プロトコルが意味のある違いを隠蔽する可能性があることを示唆している。
教師なしキーポイントは、包括的および部分的可視性が高いが、複雑な活動に対してより偽陽性を生じさせるが、教師なしキーポイントはより堅牢である。
オクルージョンに基づく評価では、教師なしキーポイントは全てのフォールのほぼ半分を見逃し、教師なしキーポイントは強い感度を保持し、かなり優れています。
彼らの解剖学的独立性により、空間的なアンカーは、欠落したランドマークに失敗するのではなく、目に見える身体構造に適応することができる。
ギャップは帯域幅の制約の下で拡大し、時間モデルを通して局所化誤差が複雑になる。
これらの結果から, 表現選択は視覚条件を反映すべきであり, 教師なしキーポイントは身体の視認性が損なわれる場合に有利であることがわかった。
関連論文リスト
- Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach [60.596944437968524]
partialVisGraphは、制約されたフィールド・オブ・ビューの下で、堅牢なスケルトンベースのアクション認識のための新しいフレームワークである。
部分的な可視性の下では、最先端の精度を一貫して達成し、厳しいFoV制限のあるサブセットでは68.8%まで上昇する。
提案手法は,非拘束環境下でのスケルトンに基づく行動理解を実現するための,原則的かつ実践的な経路を提供する。
論文 参考訳(メタデータ) (2026-07-01T10:03:11Z) - See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs [81.71384150441163]
大規模視覚言語モデル(LVLM)のためのコンテキスト認識注意介入(CAI)を提案する。
CAIは必要なときのみ2軸選択によってシーズを強制する。
複数のLVLMバックボーンとベンチマークの実験は、CAIが最先端の幻覚緩和を達成することを示している。
論文 参考訳(メタデータ) (2026-06-29T06:35:47Z) - LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination [66.06027569507403]
textbfViewpoint Imagination (VIM) は、観測された証拠と想像された証拠の両方について、隠蔽された一次観測と条件の行動予測から補完的な視点を生成する。
VIMは、追加のカメラをデプロイ時に必要とせずに、タスクスイート、オクルージョンタイプ、重大度レベルの堅牢性を改善する。
論文 参考訳(メタデータ) (2026-06-09T13:39:49Z) - Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models [29.66841995436342]
現代の視覚言語モデル(VLM)は、計量距離クエリでは信頼できないままである。
我々は,Hypersim,ScanNet,KITTI360から構築したマルチビュー評価プロトコルであるtextbfViewDiagを紹介する。
安定な予測は、証拠に敏感な推論よりも先駆的な崩壊を反映している可能性が示唆された。
論文 参考訳(メタデータ) (2026-06-01T18:06:08Z) - A Systematic Failure Analysis of Vision Foundation Models for Open Set Iris Presentation Attack Detection [6.472008340680056]
本研究は、近視画像を用いたオープンセット虹彩PADのための汎用視覚基盤モデルの系統的故障解析を行う。
その結果、基礎モデルは、類似したセンシング特性を持つデータセット間で転送可能であるが、未知の攻撃機器に対して確実に一般化できないことが示唆された。
これらの結果から,強いクローズドセットやクロスデータセットのパフォーマンスは,堅牢なオープンセットセキュリティの証拠として扱うべきではないことが示唆された。
論文 参考訳(メタデータ) (2026-05-18T18:41:26Z) - Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - Bridging the Visual-to-Physical Gap: Physically Aligned Representations for Fall Risk Analysis [3.1812226135012467]
PHARLは臨床出力ラベルを必要とせずに物理的に意味のある転倒表現を学習する。
実験により、PHARLはリスク対応の表現品質を目視のみのベースラインで継続的に改善することが示された。
論文 参考訳(メタデータ) (2026-03-12T11:29:54Z) - Rebenchmarking Unsupervised Monocular 3D Occupancy Prediction [18.187675837847667]
単一の画像から、特に隠された領域から3D構造を推定することは、視覚中心の自律運転において、根本的な課題でありながら未解決の課題である。
既存の教師なしアプローチは、通常、神経放射場を訓練し、評価中にネットワーク出力を占有確率として扱う。
本稿では,教師なし単分子3次元占有予測のための改良されたベンチマークを提案する。
論文 参考訳(メタデータ) (2026-02-06T08:30:26Z) - Spatial regularisation for improved accuracy and interpretability in keypoint-based registration [5.286949071316761]
教師なしキーポイント検出に基づく最近のアプローチは、解釈可能性に非常に有望である。
本稿では,特徴量の空間分布を正規化するための3倍の損失を提案する。
我々の損失は特徴の解釈可能性を大幅に改善し、現在では正確で解剖学的に意味のあるランドマークに対応しています。
論文 参考訳(メタデータ) (2025-03-06T14:48:25Z) - Spatial-Frequency Discriminability for Revealing Adversarial Perturbations [53.279716307171604]
敵の摂動に対するディープニューラルネットワークの脆弱性は、コンピュータビジョンコミュニティで広く認識されている。
現在のアルゴリズムは、通常、自然および敵対的なデータの識別的分解を通じて、敵のパターンを検出する。
空間周波数Krawtchouk分解に基づく識別検出器を提案する。
論文 参考訳(メタデータ) (2023-05-18T10:18:59Z) - Exploring Robustness of Unsupervised Domain Adaptation in Semantic
Segmentation [74.05906222376608]
クリーンな画像とそれらの逆の例との一致を、出力空間における対照的な損失によって最大化する、逆向きの自己スーパービジョンUDA(ASSUDA)を提案する。
i) セマンティックセグメンテーションにおけるUDA手法のロバスト性は未解明のままであり, (ii) 一般的に自己スーパービジョン(回転やジグソーなど) は分類や認識などのイメージタスクに有効であるが, セグメンテーションタスクの識別的表現を学習する重要な監視信号の提供には失敗している。
論文 参考訳(メタデータ) (2021-05-23T01:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。