論文の概要: Real-Time Video Anomaly Detection Using YOLO Pose Estimation and CLIP-Based Semantic Scoring
- arxiv url: http://arxiv.org/abs/2608.31074v1
- Date: Mon, 31 Aug 2026 16:47:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:31.52253
- Title: Real-Time Video Anomaly Detection Using YOLO Pose Estimation and CLIP-Based Semantic Scoring
- Title(参考訳): YOLOポス推定とCLIPに基づくセマンティックスコーリングを用いたリアルタイムビデオ異常検出
- Abstract要約: 本稿では,リアルタイムビデオ異常検出のための軽量な2段階フレームワークを提案する。
第1段では、YOLO v11n-poseを使用して人物を検出し、単一の前方パスで17個の骨格キーポイントを抽出する。
第2段階は、CLIP ViT-B/32を介して、収穫された各人領域を符号化し、コサイン類似性を計算する。
- 参考スコア(独自算出の注目度): 0.3784545047113015
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose a lightweight two-stage framework for real-time video anomaly detection. The first stage employs YOLO v11n-pose to detect persons and extract seventeen skeletal keypoints in a single forward pass. The second stage encodes each cropped person region through CLIP ViT-B/32 and computes cosine similarity against predefined textual descriptions of anomalous behaviors. This architecture eliminates the need for optical flow, standalone pose estimators, and density-based scoring modules. Experiments on CUHK Avenue, ShanghaiTech Campus, and a custom indoor dataset collected at Chulalongkorn University demonstrate an end-to-end throughput of approximately 51 FPS on an NVIDIA Titan XP GPU, a 3.36x speedup over the multi-feature baseline, while maintaining frame-level AUROC values of 89.26%, 70.26%, and 84.13%, respectively.
- Abstract(参考訳): 本稿では,リアルタイムビデオ異常検出のための軽量な2段階フレームワークを提案する。
第1段では、YOLO v11n-poseを使用して人物を検出し、単一の前方パスで17個の骨格キーポイントを抽出する。
第2段階は、CLIP ViT-B/32を介して、収穫された各領域を符号化し、異常な振る舞いのテキスト記述に対してコサイン類似性を計算する。
このアーキテクチャは、光学フロー、スタンドアローンのポーズ推定器、密度に基づくスコアリングモジュールの必要性を排除している。
Chulalongkorn Universityで収集されたCUHK Avenue、上海工科大学キャンパス、およびカスタム屋内データセットの実験では、NVIDIA Titan XP GPUで約51 FPSのエンドツーエンドスループット、多機能ベースラインでの3.36倍のスピードアップを示し、フレームレベルのAUROC値は89.26%、70.26%、84.13%である。
関連論文リスト
- LEADER: Lightweight End-to-End Attention-Gated Dual Autoencoder for Robust Minutiae Extraction [0.05978532290288763]
本稿では,生の指紋画像を微細な記述子にマッピングするニューラルネットワークであるLEADER(Lightweight End-to-end Attention-gated Dual autoencodER)を紹介する。
新しく作られた"Castle-Moat-Rampart"のグラウンドトルースエンコーディングと、アテンションゲーティング機構を介して相互接続されたデュアルオートコーダ構造を採用している。
NIST SD27データセットでF1スコアが34%高い。
論文 参考訳(メタデータ) (2026-02-17T11:02:28Z) - T*: Re-thinking Temporal Search for Long-Form Video Understanding [66.72243342954823]
現在の時間探索法は、Longvideobenchサブセットで2.1%の時間F1スコアしか達成していない。
画像中の視覚探索に触発されて,空間探索として高価な時間探索を再構成する軽量な時間探索フレームワークT*を提案する。
大規模な実験により、T*と既存の方法を統合することにより、SOTAの長めのビデオ理解が大幅に向上することが示された。
論文 参考訳(メタデータ) (2025-04-03T04:03:10Z) - 8-Calves Image dataset [0.8233028449337972]
マルチアニマル検出、追跡、識別のための挑戦的なベンチマークである8-Calvesデータセットを紹介した。
バーに8匹のホルスタイン・フリーズ人の子牛の1時間のビデオが映し出され、頻繁にオクルージョン、動きのぼやけ、さまざまなポーズが収められている。
微調整されたYOLOv8検出器とByteTrackを使った半きめのパイプラインと手作業による修正により、537,000以上のバウンディングボックスと時間的アイデンティティラベルが提供される。
論文 参考訳(メタデータ) (2025-03-17T23:47:52Z) - Practical Video Object Detection via Feature Selection and Aggregation [18.15061460125668]
ビデオオブジェクト検出(VOD)は、オブジェクトの外観における高いフレーム間変動と、いくつかのフレームにおける多様な劣化を懸念する必要がある。
現代のアグリゲーション法のほとんどは、高い計算コストに苦しむ2段階検出器用に調整されている。
この研究は、特徴選択と集約の非常に単純だが強力な戦略を考案し、限界計算コストでかなりの精度を得る。
論文 参考訳(メタデータ) (2024-07-29T02:12:11Z) - SimulFlow: Simultaneously Extracting Feature and Identifying Target for
Unsupervised Video Object Segmentation [28.19471998380114]
教師なしビデオオブジェクトセグメンテーション(UVOS)は、人間が介在することなく、所定のビデオシーケンス内の一次オブジェクトを検出することを目的としている。
既存のほとんどの手法は、ターゲットを識別してオブジェクトマスクを生成する前に、外観と動き情報を別々に符号化する2ストリームアーキテクチャに依存している。
特徴抽出とターゲット識別を同時に行うSimulFlowと呼ばれる新しいUVOSモデルを提案する。
論文 参考訳(メタデータ) (2023-11-30T06:44:44Z) - Self-Distilled Masked Auto-Encoders are Efficient Video Anomaly
Detectors [117.61449210940955]
ビデオフレームレベルで適用された軽量マスク付きオートエンコーダ(AE)に基づく効率的な異常事象検出モデルを提案する。
動き勾配に基づく重みトークンへのアプローチを導入し、静的背景シーンから前景オブジェクトへ焦点を移す。
トレーニングビデオの強化のために合成異常事象を生成し,マスク付きAEモデルを用いてオリジナルのフレームを共同で再構築する。
論文 参考訳(メタデータ) (2023-06-21T06:18:05Z) - TAPIR: Tracking Any Point with per-frame Initialization and temporal
Refinement [64.11385310305612]
本稿では,ビデオシーケンスを通して任意の物理面上の問合せ点を効果的に追跡する,TAP(Tracking Any Point)の新しいモデルを提案する。
提案手法では,(1)他のフレームの問合せ点に対する適切な候補点マッチングを独立に特定するマッチング段階と,(2)局所的相関に基づいてトラジェクトリと問合せの両方を更新する改良段階の2段階を用いる。
結果として得られたモデルは、DAVISにおける平均約20%の絶対平均ジャカード(AJ)改善によって示されるように、TAP-Vidベンチマークにおける大きなマージンで、すべてのベースライン手法を上回ります。
論文 参考訳(メタデータ) (2023-06-14T17:07:51Z) - Exploring Object-Centric Temporal Modeling for Efficient Multi-View 3D
Object Detection [20.161887223481994]
マルチビュー3Dオブジェクト検出のための長周期モデリングフレームワークStreamPETRを提案する。
StreamPETRは、単一フレームのベースラインと比較して、無視可能なコストでのみ、大幅なパフォーマンス向上を実現している。
軽量版は45.0%のmAPと31.7のFPSを実現し、2.3%のmAPと1.8倍の高速FPSを達成している。
論文 参考訳(メタデータ) (2023-03-21T15:19:20Z) - Negative Frames Matter in Egocentric Visual Query 2D Localization [119.23191388798921]
最近リリースされたEgo4Dデータセットとベンチマークは、一人称視覚知覚データを大幅にスケールし、多様化している。
Visual Queries 2Dローカライゼーションタスクは、1対1の視点で記録された過去に存在するオブジェクトを検索することを目的としている。
本研究は,Epsodic Memoryベンチマークで導入された3段階ベースラインに基づく。
論文 参考訳(メタデータ) (2022-08-03T09:54:51Z) - Encoder-decoder with Multi-level Attention for 3D Human Shape and Pose
Estimation [61.98690211671168]
本稿では,マルチレベルアテンション・デコーダ・ネットワーク(MAED)を提案する。
3DPWのトレーニングセットにより、MAEDはPA-MPJPEの6.2、7.2、2.4mmの従来の最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2021-09-06T09:06:17Z) - Real-time Face Mask Detection in Video Data [0.5371337604556311]
本稿では,リアルタイムビデオストリームから正解と誤用を識別可能な,堅牢なディープラーニングパイプラインを提案する。
2つのアプローチを考案し,その性能と実行時間効率を評価した。
論文 参考訳(メタデータ) (2021-05-05T01:03:34Z) - Spatiotemporal Contrastive Video Representation Learning [87.56145031149869]
ラベルのないビデオから視覚的表現を学習するための,自己指導型コントラスト映像表現学習(CVRL)法を提案する。
我々の表現は、コントラスト時間的損失を用いて学習され、同じ短いビデオから2つの強化されたクリップが埋め込み空間にまとめられる。
本研究では,ビデオ自己教師型学習におけるデータ向上の要因について検討し,空間的情報と時間的情報の両方が重要であることを明らかにする。
論文 参考訳(メタデータ) (2020-08-09T19:58:45Z) - Tracking Objects as Points [83.9217787335878]
同時に検出と追跡を同時に行うアルゴリズムは,最先端技術よりもシンプルで,高速で,高精度である。
トラッカーであるCenterTrackは、前のフレームから一対のイメージと検出に検出モデルを適用します。
CenterTrackはシンプルで、オンライン(未来を覗くことはない)で、リアルタイムだ。
論文 参考訳(メタデータ) (2020-04-02T17:58:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。