論文の概要: STEP: Score-Based Temporal Energy for Human Pose Video Anomaly Detection
- arxiv url: http://arxiv.org/abs/2608.19987v1
- Date: Thu, 20 Aug 2026 13:02:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.567806
- Title: STEP: Score-Based Temporal Energy for Human Pose Video Anomaly Detection
- Title(参考訳): STEP:人間の視点ビデオ異常検出のためのスコアベース時間エネルギー
- Abstract要約: Skeletonベースのビデオ異常検出(VAD)は、異常な振る舞いを識別するための堅牢でプライバシー保護のソリューションを提供する。
最近のDSM(Denoising Score Matching)によるエネルギーベースモデル(EBM)の訓練方法
しかし、トレーニングに必要なノイズを直接生の関節座標に注入すると、物理的に不可能なポーズが生じる。
本稿では、主成分分析(PCA)を利用して、コンパクトで白化されたPC空間にポーズ列を投影するシンプルなフレームワークSTEPを紹介する。
- 参考スコア(独自算出の注目度): 13.87765205634944
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Skeleton-based Video Anomaly Detection (VAD) offers a robust, privacy-preserving solution for identifying abnormal behaviors. To model the distribution of normal static and moving poses, recent methods train Energy-Based Models (EBMs) via Denoising Score Matching (DSM). However, directly injecting noise, required for training, into raw joint coordinates creates physically impossible poses, and this structural collapse severely worsens as the temporal window expands. To address this, we introduce STEP, a simple framework that utilizes Principal Component Analysis (PCA) to project pose sequences into a compact, whitened PC-space. Learning the data density within this well-behaved PC-space ensures that the injected noise translates into physically plausible variations, which allows the model to process longer video sequences without the performance collapse of raw coordinate baselines. Additionally, to mitigate inherent pose estimation inaccuracies arising from occlusions or motion blur, we integrate a sequence-level weighting mechanism based on the estimator's confidence scores. Operating at real-time computational efficiency, our simple and lightweight framework outperforms the previous skeleton-based state-of-the-art by 12.2% (90.1% AUROC) on the challenging UBnormal dataset and achieves highly competitive results by improving on the ShanghaiTech benchmark.
- Abstract(参考訳): Skeletonベースのビデオ異常検出(VAD)は、異常な振る舞いを識別するための堅牢でプライバシー保護のソリューションを提供する。
通常の静的ポーズと移動ポーズの分布をモデル化するため、最近の手法ではDenoising Score Matching (DSM)を介してEnergy-Based Models (EBM)を訓練している。
しかし、トレーニングに必要なノイズを直接注入すると、物理的に不可能なポーズが生じ、時間窓が広がるにつれて構造的崩壊が悪化する。
そこで本研究では,PCA(Principal Component Analysis)を利用したコンパクトなPC空間にポーズ列を投影するシンプルなフレームワークSTEPを紹介する。
この良好なPC空間内でのデータ密度を学習することで、注入されたノイズが物理的に妥当な変化に変換されることが保証され、モデルが生の座標ベースラインのパフォーマンスを損なうことなく、より長いビデオシーケンスを処理できるようになる。
さらに、オクルージョンや動きのぼかしから生じる固有ポーズ推定の不正確さを軽減するために、推定器の信頼度スコアに基づくシーケンスレベルの重み付け機構を統合する。
我々のシンプルで軽量なフレームワークは、UB正規データセットの課題に対して、従来のスケルトンベースの状態を12.2%(90.1% AUROC)向上させ、上海Techベンチマークの改善によって高い競争力を発揮する。
関連論文リスト
- Hierarchical Policy Learning via Spectral Decomposition [58.65543693788772]
ロボットの動作シーケンスにおける意味的分解を識別し,タスクレベルの動作意図と実行レベルの改善を分離する。
本稿では, 因果的粗大化過程として行動生成をモデル化した因果スペクトルポリシー(CSP)を提案する。
CSPは、精度に敏感な操作タスクにおいて、強いベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-28T19:22:40Z) - Hybrid Robustness Verification for Spatio-Temporal Neural Networks [19.026662893450425]
既存の検証方法は、過度に保守的な近似や不正な計算コストに依存している。
実際には、対向摂動は、低次元、意味論的に意味のある部分空間に制約された、構造化された空間的および時間的相関を示す。
動作認識(UCF-101)、自律運転(Udacity)、医用画像(MedMNIST)の用途を対象として、3次元CNNによる映像入力のロバスト性検証を行う。
論文 参考訳(メタデータ) (2026-06-08T17:06:51Z) - Domain-Incremental Continual Learning for Robust and Efficient Keyword Spotting in Resource Constrained Systems [0.0]
キーワード エッジデバイスにデプロイされる小さなフットプリントモデルを備えたスポッティングシステムは、かなりの精度と堅牢性に直面する。
計算効率を維持しつつ,新しい領域に適応する継続的学習のための包括的フレームワークを提案する。
提案したパイプラインは、Mel Frequency Cepstral Coefficients(MFCC)とMel-spectrogram機能の両方を利用して、デュアルインプットの畳み込みニューラルネットワークを統合する。
論文 参考訳(メタデータ) (2026-01-22T17:59:31Z) - Real-Time Learning of Predictive Dynamic Obstacle Models for Robotic Motion Planning [7.819710421921815]
我々は,他のエージェントの動きの非線形予測モデルをリアルタイムで学習するオンラインフレームワークを開発した。
Cadzowプロジェクションは構造化された低ランクの一貫性を強制し、デノーズされた軌道と局所的なノイズ分散の推定を導出する。
ガウス型および重尾型雑音下でのシミュレーションにおけるアプローチの有効性を検証し, 動的クレーン試験台で実験的に検証した。
論文 参考訳(メタデータ) (2025-11-02T05:54:30Z) - RoHOI: Robustness Benchmark for Human-Object Interaction Detection [84.78366452133514]
ヒューマン・オブジェクト・インタラクション(HOI)検出は、コンテキスト認識支援を可能にするロボット・ヒューマン・アシストに不可欠である。
HOI検出のための最初のベンチマークを導入し、様々な課題下でモデルのレジリエンスを評価する。
我々のベンチマークであるRoHOIは、HICO-DETとV-COCOデータセットに基づく20の汚職タイプと、新しいロバストネスにフォーカスしたメトリクスを含んでいる。
論文 参考訳(メタデータ) (2025-07-12T01:58:04Z) - Bisimulation metric for Model Predictive Control [44.301098448479195]
Bisimulation Metric for Model Predictive Control (BS-MPC) は、目的関数にbisimulation metric lossを組み込んでエンコーダを直接最適化する新しい手法である。
BS-MPCは、トレーニング時間を削減することにより、トレーニング安定性、入力ノイズに対する堅牢性、および計算効率を向上させる。
我々は,DeepMind Control Suiteから連続制御および画像ベースタスクのBS-MPCを評価する。
論文 参考訳(メタデータ) (2024-10-06T17:12:10Z) - Video Dynamics Prior: An Internal Learning Approach for Robust Video
Enhancements [83.5820690348833]
外部トレーニングデータコーパスを必要としない低レベルの視覚タスクのためのフレームワークを提案する。
提案手法は,コヒーレンス・時間的テストの重み付けと統計内部統計を利用して,破損したシーケンスを最適化することでニューラルモジュールを学習する。
論文 参考訳(メタデータ) (2023-12-13T01:57:11Z) - Incremental Outlier Detection Modelling Using Streaming Analytics in Finance & Health Care [0.0]
リアルタイムデータの時代において、従来の手法はストリーミング環境の動的な性質に追従するのに苦労することが多い。
本稿では,モデルを一度構築し,リアルタイム環境下で評価するハイブリッドフレームワークを提案する。
我々は、一級サポートベクターマシン(OCSVM)、孤立林適応型スライドウィンドウアプローチ(IForest ASD)、正確な嵐(ES)、角度ベース外乱検出(ABOD)、局所外乱係数(LOF)、Kitsunesオンラインアルゴリズム(KitNet)、K-nearest近隣の8種類の最先端外乱検出モデルを採用した。
論文 参考訳(メタデータ) (2023-05-17T02:30:28Z) - MAPS: A Noise-Robust Progressive Learning Approach for Source-Free
Domain Adaptive Keypoint Detection [76.97324120775475]
クロスドメインキーポイント検出方法は、常に適応中にソースデータにアクセスする必要がある。
本稿では、ターゲット領域に十分に訓練されたソースモデルのみを提供する、ソースフリーなドメイン適応キーポイント検出について考察する。
論文 参考訳(メタデータ) (2023-02-09T12:06:08Z) - Score-Based Generative Modeling through Stochastic Differential
Equations [114.39209003111723]
複素データ分布を雑音を注入することによって既知の事前分布に変換する微分方程式を提案する。
対応する逆時間SDEは、ノイズを緩やかに除去し、先行分布をデータ分布に戻す。
スコアベース生成モデリングの進歩を活用することで、これらのスコアをニューラルネットワークで正確に推定することができる。
スコアベース生成モデルから1024×1024画像の高忠実度生成を初めて示す。
論文 参考訳(メタデータ) (2020-11-26T19:39:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。