論文の概要: Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms
- arxiv url: http://arxiv.org/abs/2607.09114v1
- Date: Fri, 10 Jul 2026 05:58:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.797416
- Title: Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms
- Title(参考訳): イベントストリームに基づくマルチモードビデオ異常検出:ベンチマークデータセットとアルゴリズム
- Abstract要約: ビデオ異常検出(VAD)は自動監視には不可欠だが、困難な状況下では脆弱である。
本稿では,従来のビデオストリームとイベントストリームを併用したイベント拡張VADフレームワークであるEVADを提案する。
EVODは、実世界のシナリオにおいて、イベントベースのVAD検出の有効性を検証し、メソッドを一貫して上回る。
- 参考スコア(独自算出の注目度): 12.625916611891947
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video anomaly detection (VAD) is critical for automated surveillance but remains fragile under challenging conditions such as illumination variations, fast motion, and complex backgrounds when relying solely on visible light videos. To address these limitations, we propose EVAD, an event enhanced VAD framework that jointly exploits conventional video and event streams captured by bio inspired event cameras. Event sensors asynchronously capture brightness changes with high temporal resolution, offering robustness to motion blur and extreme lighting, and providing motion salient cues complementary to video based visual information. To support multi modal VAD research, we construct a large scale visible event benchmark comprising 6.3 billion events and 376,368 video frames collected under diverse illumination levels, motion patterns, and background complexities, filling the gap of realistic and scalable datasets for event based anomaly detection. Building upon this dataset, we design a contrastive multi modal pretraining framework to learn discriminative event representations by aligning semantic embeddings across event streams, visible videos, and textual descriptions. An adaptive fusion module then dynamically integrates event based temporal cues with video based spatial semantics, improving robustness to environmental disturbances. Experiments on benchmarks and the proposed TJUTCM Pha dataset demonstrate that E VAD consistently outperforms methods, validating the effectiveness of event-based sensing for VAD in real world scenarios.
- Abstract(参考訳): 自動監視にはビデオ異常検出(VAD)が不可欠だが、可視光ビデオのみに依存する場合、照明のバリエーションや高速な動き、複雑な背景といった困難な条件下では脆弱である。
これらの制約に対処するために,バイオインスパイアされたイベントカメラによってキャプチャされた従来のビデオとイベントストリームを共同で活用するイベント拡張VADフレームワークであるEVADを提案する。
イベントセンサは、高時間分解能で輝度の変化を非同期にキャプチャし、動きのぼやけや極端な照明に頑健さを提供し、動画ベースの視覚情報と相補的な動きの聖な手がかりを提供する。
マルチモーダルVAD研究を支援するため、様々な照明レベル、動きパターン、背景複雑さに基づいて収集された63億のイベントと376,368の動画フレームからなる大規模可視イベントベンチマークを構築し、イベントベースの異常検出のための現実的でスケーラブルなデータセットのギャップを埋める。
このデータセットに基づいて、イベントストリーム、可視ビデオ、テキスト記述にセマンティック埋め込みをアライメントすることで、差別的なイベント表現を学習するための、コントラッシブなマルチモーダル事前学習フレームワークを設計する。
適応的な融合モジュールは、イベントベースの時間的手がかりとビデオベースの空間意味論を動的に統合し、環境障害に対する堅牢性を改善する。
ベンチマーク実験と提案したTJUTCM Phaデータセットにより、実世界のシナリオにおけるイベントベースセンシングの有効性を検証し、EVODがメソッドを一貫して上回ることを示した。
関連論文リスト
- EventGait: Towards Robust Gait Recognition with Event Streams [50.890621860023]
イベントカメラは、マイクロ秒時間分解能と高ダイナミックレンジを提供し、自然にロバストなダイナミックキューをキャプチャし、静的ノイズを抑制する。
イベントの利点を保ちながら、動きと形状を別々にモデル化する、エンドツーエンドのデュアルストリームフレームワークである textbfEventGait を提案する。
当社のアプローチでは,イベント駆動歩行分析の堅牢性と可能性を強調し,合成および実世界の歩行ベンチマークに新たな技術状況が設定されている。
論文 参考訳(メタデータ) (2026-05-21T08:12:04Z) - Dynamic Pondering Sparsity-aware Mixture-of-Experts Transformer for Event Stream based Visual Object Tracking [44.11576998237289]
RGBベースのトラッカーは、低照度や高速モーションなどの困難な撮像条件に対して脆弱である。
イベントカメラは、ピクセルワイドの明るさ変化を捉え、高いダイナミックレンジと高時間分解能を提供することで、有望な代替手段を提供する。
複数の時間スケールにまたがるイベント密度変動を明示的にモデル化するイベント空間認識追跡フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-07T12:25:03Z) - Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets [71.53287557600177]
イベントベースの異常検出を統一研究の方向性として確立するための第一歩を踏み出す。
まず、同期イベントとRGB記録を特徴とする、ビデオ異常検出のための複数のイベントストリームベースのベンチマークを構築した。
次に,EVent中心のビデオ異常検出フレームワークであるEWADを提案する。
論文 参考訳(メタデータ) (2026-03-26T03:33:33Z) - EPRBench: A High-Quality Benchmark Dataset for Event Stream Based Visual Place Recognition [54.55914886780534]
イベントストリームに基づく視覚的位置認識(VPR)は、従来の可視光カメラの不安定性に対して、低照度、過剰露光、高速モーションといった困難な条件下で魅力的な解決策を提供する、新たな研究方向である。
イベントストリームベースのVPR用に特別に設計された高品質なベンチマークであるEPRBenchを紹介する。
EPRBenchは10Kのイベントシーケンスと65Kのイベントフレームで構成され、ハンドヘルドと車載のセットアップを使用して収集され、さまざまな視点、気象条件、照明シナリオで現実世界の課題を包括的にキャプチャする。
論文 参考訳(メタデータ) (2026-02-13T13:25:05Z) - EGVD: Event-Guided Video Diffusion Model for Physically Realistic Large-Motion Frame Interpolation [16.22243283808375]
Event-Guided Video Diffusion Model (EGVD) は、事前訓練された安定したビデオ拡散モデルの強力な先行性を活用する新しいフレームワークである。
提案手法は,RGBフレームとイベント信号とを効果的に統合して拡散過程を導出するマルチモーダル運動条件生成器(MMCG)を特徴とする。
実データとシミュレーションデータの両方の実験により、EGVDは大きな動きを扱う既存の手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2025-03-26T06:33:32Z) - Implicit Event-RGBD Neural SLAM [54.74363487009845]
神経性SLAMは近年顕著な進歩を遂げている。
既存の手法は、非理想的なシナリオにおいて重大な課題に直面します。
本稿では,最初のイベントRGBD暗黙的ニューラルSLAMフレームワークであるEN-SLAMを提案する。
論文 参考訳(メタデータ) (2023-11-18T08:48:58Z) - Dual Memory Aggregation Network for Event-Based Object Detection with
Learnable Representation [79.02808071245634]
イベントベースのカメラはバイオインスパイアされたセンサーで、各ピクセルの明るさ変化を非同期に捉える。
イベントストリームは、正極性と負極性の両方のためにx-y-t座標の格子に分割され、3次元テンソル表現として柱の集合が生成される。
長メモリは適応型convLSTMの隠れ状態に符号化され、短メモリはイベントピラー間の空間的時間的相関を計算することによってモデル化される。
論文 参考訳(メタデータ) (2023-03-17T12:12:41Z) - A Unified Framework for Event-based Frame Interpolation with Ad-hoc Deblurring in the Wild [72.0226493284814]
本稿では,デブロリングアドホックを行うイベントベースフレームの統一フレームワークを提案する。
我々のネットワークは、フレーム上の従来の最先端の手法、単一画像のデブロアリング、および両者のジョイントタスクを一貫して上回ります。
論文 参考訳(メタデータ) (2023-01-12T18:19:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。