論文の概要: VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection
- arxiv url: http://arxiv.org/abs/2608.05069v1
- Date: Wed, 05 Aug 2026 17:12:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.04075
- Title: VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection
- Title(参考訳): VQ-VAD:人中心ビデオ異常検出のためのベクトル量子化動作表現学習
- Authors: Narges Rashvand, Ghazal Alinezhad Noghre, Shanle Yao, Gabriel Maldonado, Hamed Tabkhi,
- Abstract要約: ビデオ異常検出(VAD)は、監視映像における異常の欠如と大きな視覚的変動のために本質的に困難である。
本稿では,Vector-Quantized Video Anomaly Detection (VQ-VAD)を提案する。
- 参考スコア(独自算出の注目度): 9.506999074910238
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video Anomaly Detection (VAD) is inherently challenging due to the scarcity of anomalies and the large visual variability in surveillance footage, including changes in lighting, viewpoint, and human appearance. To mitigate visual noise and address privacy concerns, recent work has shifted to pose-based VAD, which focuses on motion dynamics rather than raw video data. However, existing pose-based approaches model human behavior in continuous latent spaces, limiting their ability to learn compact motion patterns necessary for robust behavior analysis. We address this by proposing Vector-Quantized Video Anomaly Detection (VQ-VAD), a novel human-centric anomaly detection framework that learns discrete motion representations. VQ-VAD adapts Vector-Quantized GAN (VQ-GAN), originally developed for image generation, to operate on keypoint sequences and construct a motion codebook of normal behavior. Trained exclusively on normal motion sequences, VQ-VAD detects anomalies by identifying high reconstruction errors when an observed motion sequence cannot be mapped to the learned codebook. We conduct extensive experiments across three complementary evaluation settings, including in-domain, cross-domain, and cross-dataset generalization, on four anomaly detection benchmarks. VQ-VAD achieves strong in-domain accuracy (81.83% on HR-SHT [15]), effective cross-domain transfer from CMU Panoptic [14] (76.69% on HR-SHT [15] without retraining), and competitive cross-dataset robustness. The code base for this work is available at https://github.com/TeCSAR-UNCC/VQ-VAD.
- Abstract(参考訳): ビデオ異常検出(VAD)は、監視映像における異常の欠如と、照明、視点、外見の変化を含む大きな視覚的変動のために本質的に困難である。
視覚ノイズを緩和し、プライバシー問題に対処するため、最近の研究は、生のビデオデータではなくモーションダイナミクスに焦点を当てたポーズベースのVADに移行した。
しかし、既存のポーズに基づくアプローチは、連続的な潜在空間における人間の振る舞いをモデル化し、ロバストな行動解析に必要なコンパクトな動きパターンを学習する能力を制限する。
本稿では,Vector-Quantized Video Anomaly Detection (VQ-VAD)を提案する。
VQ-VADは、もともと画像生成のために開発されたVector-Quantized GAN (VQ-GAN) を適応させ、キーポイントシーケンスを動作させ、正常な動作の動作コードブックを構築する。
VQ-VADは、正常な動作シーケンスを専門に訓練し、観察された動作シーケンスを学習したコードブックにマッピングできない場合に、高い再構成誤差を識別して異常を検出する。
我々は4つの異常検出ベンチマークにおいて、ドメイン内、ドメイン間、データセット間の一般化を含む3つの相補的評価設定に対して広範な実験を行った。
VQ-VADは、強いドメイン内精度(HR-SHT [15]で81.83%)、CMU Panoptic [14]からの効果的なクロスドメイン転送(HR-SHT [15]で76.69%)、競争力のあるクロスデータセットロバスト性を実現する。
この作業のコードベースはhttps://github.com/TeCSAR-UNCC/VQ-VADで公開されている。
関連論文リスト
- Autoregressive Denoising Score Matching is a Good Video Anomaly Detector [36.96911195723131]
ビデオ異常検出(VAD)はコンピュータビジョンの重要な問題である。
雑音条件付きスコア変換器を導入し、スコアマッチングを復調する。
次に,シーン依存型,動き認識型スコア関数を提案する。
我々は、新しい自己回帰型聴覚スコアマッチング機構を介して、影響を受けない視覚情報を統合する。
論文 参考訳(メタデータ) (2025-06-29T15:14:32Z) - Track Any Anomalous Object: A Granular Video Anomaly Detection Pipeline [63.96226274616927]
Track Any Anomalous Object (TAO)と呼ばれる新しいフレームワークでは、詳細なビデオ異常検出パイプラインが導入されている。
各画素に異常スコアを割り当てる手法とは異なり、我々の手法は問題から異常オブジェクトの画素レベルの追跡に変換する。
実験の結果、TAOは新しいベンチマークを精度と堅牢性で設定した。
論文 参考訳(メタデータ) (2025-06-05T15:49:39Z) - Dual Conditioned Motion Diffusion for Pose-Based Video Anomaly Detection [12.100563798908777]
コンピュータビジョン研究にはビデオ異常検出(VAD)が不可欠である。
既存のVADメソッドは、再構築ベースのフレームワークまたは予測ベースのフレームワークを使用する。
ポーズに基づくビデオ異常検出に対処し、Dual Conditioned Motion Diffusionと呼ばれる新しいフレームワークを導入する。
論文 参考訳(メタデータ) (2024-12-23T01:31:39Z) - Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts [57.01985221057047]
本稿では、事前学習された視覚言語モデル(VLM)に基づく、弱教師付きビデオ異常検出および局所化のための時間的プロンプト埋め込み(WSVADL)を学習する新しい手法を提案する。
提案手法は,WSVADLタスクの3つの公開ベンチマークにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2024-08-12T03:31:29Z) - Occlusion-Aware 3D Motion Interpretation for Abnormal Behavior Detection [10.782354892545651]
我々は,メッシュ頂点とヒト関節の3次元座標をモノクロビデオから再構成し,運動異常を識別するOAD2Dを提案する。
動作特徴の定量化にVQVAEを用いるM2Tモデルと組み合わせることで、異常姿勢推定を再構成する。
本研究は, 重度・自己閉塞性に対する異常行動検出のロバスト性を示すものである。
論文 参考訳(メタデータ) (2024-07-23T18:41:16Z) - Self-Supervised Masked Convolutional Transformer Block for Anomaly
Detection [122.4894940892536]
本稿では, 自己監督型マスク型畳み込み変圧器ブロック (SSMCTB) について述べる。
本研究では,従来の自己教師型予測畳み込み抑止ブロック(SSPCAB)を3次元マスク付き畳み込み層,チャンネルワイドアテンション用トランスフォーマー,およびハマーロスに基づく新たな自己教師型目標を用いて拡張する。
論文 参考訳(メタデータ) (2022-09-25T04:56:10Z) - Differentiable Frequency-based Disentanglement for Aerial Video Action
Recognition [56.91538445510214]
ビデオにおける人間の行動認識のための学習アルゴリズムを提案する。
我々のアプローチは、主に斜めに配置されたダイナミックカメラから取得されるUAVビデオのために設計されている。
我々はUAV HumanデータセットとNEC Droneデータセットについて広範な実験を行った。
論文 参考訳(メタデータ) (2022-09-15T22:16:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。