論文の概要: ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding
- arxiv url: http://arxiv.org/abs/2609.07941v2
- Date: Wed, 09 Sep 2026 07:11:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.508059
- Title: ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding
- Title(参考訳): ReactVAU: ビデオ異常理解のストリーミングのための低速分離フレームワーク
- Authors: Chia-Hui Chen, Shih-Ying Yeh, Fu-En Yang, Min-Hung Chen, Shang-Hong Lai,
- Abstract要約: ReactVAUは、リアルタイムストリーミングビデオ異常理解のためのSlow-Fast Decoupled Frameworkである。
厳密なストリーミング制約の下で動作し、異常検出と因果推論の両方で競合性能を同時に達成する。
- 参考スコア(独自算出の注目度): 28.369763959259597
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we propose ReactVAU, a Slow-Fast Decoupled Framework for real-time streaming Video Anomaly Understanding (VAU). Existing VAU methods rely on offline inference with global temporal sampling, which violates causality and prevents deployment in live surveillance streams. Conversely, general streaming video models satisfy causal access but dilute rare transient anomalies during memory compression and often invoke heavyweight MLLMs uniformly over long normal intervals. React VAU addresses this gap with three synergistic components: a lightweight Fast Detection Module based on Spatial Grid Folding (SGF) for continuous anomaly filtering; an Anomaly-Aware Persistent Memory (AAPM) that protects critical visual cues from temporal decay; and a heavyweight Slow Reasoning Module that remains dormant during normal streams and is awakened only by suspicious events for semantic verification and causal description. Extensive experiments on multiple benchmarks demonstrate that ReactVAU operates under strict streaming constraints while simultaneously achieving competitive performance in both anomaly detection and causal reasoning, alongside significantly enhanced computational efficiency by minimizing heavyweight MLLM invocations. Project page is available at https://huiyuiui.github.io/ReactVAU/
- Abstract(参考訳): 本稿では,ビデオ異常理解(VAU)をリアルタイムにストリーミングするSlow-Fast Decoupled FrameworkであるReactVAUを提案する。
既存のVAUメソッドは、グローバルな時間的サンプリングによるオフライン推論に依存しており、因果関係に反し、ライブ監視ストリームへの展開を妨げている。
逆に、一般的なストリーミングビデオモデルは因果アクセスを満足するが、メモリ圧縮時に希少な過渡的異常を希薄にし、長い通常の間隔でヘビーウェイトMLLMを均一に呼び出す。
React VAUは、3つのシナジスティックなコンポーネントでこのギャップに対処する: 連続的な異常フィルタリングのための空間グリッドフォールディング(SGF)に基づく軽量な高速検出モジュール、重要な視覚的手がかりを時間的劣化から保護する異常認識永続メモリ(AAPM)、通常のストリーム中に休眠状態のままで、セマンティック検証や因果記述のための疑わしいイベントによってのみ起動される重いスロー推論モジュール。
複数のベンチマークでの大規模な実験により、ReactVAUは厳密なストリーミング制約の下で動作し、異常検出と因果推論の両方において競合性能を同時に達成し、重いMLLM呼び出しを最小限にすることで計算効率を大幅に向上することを示した。
プロジェクトページはhttps://huiyuiui.github.io/ReactVAU/で公開されている。
関連論文リスト
- Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation [58.40817037271021]
DiTTA(Distillation-assisted Test-Time Adaptation)は、ISSモデルをアノテーション付きビデオなしで時間的に認識されたVSSモデルに変換する新しいフレームワークである。
完全教師付きVSS法と比較して,DITTAの有効性を示す。
論文 参考訳(メタデータ) (2026-04-13T03:47:08Z) - ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions [27.912128185225054]
オープンワールドビデオ異常検出(OWVAD)は、異なる異常定義の下で異常事象を検出し、説明することを目的としている。
最近のMLLMベースの手法は、将来有望なオープンワールドの一般化を示しているが、それでも3つの大きな制限に悩まされている。
本稿では,トレーニング不要な効率的なストリーミングOWVADモデルであるESOMを提案する。
論文 参考訳(メタデータ) (2026-04-09T03:51:14Z) - FASTER: Rethinking Real-Time Flow VLAs [82.58822112377923]
VLA(Vision-Language-Action)モデルを物理世界に展開するには、リアルタイム実行が不可欠である。
反応時間は、TTFA(Time to First Action)と実行地平線によって決定される一様分布に従っていることを示す。
即時反応のための高速動作サンプリング(FASTER)を提案し,この問題を克服する。
論文 参考訳(メタデータ) (2026-03-19T17:51:37Z) - EventVAD: Training-Free Event-Aware Video Anomaly Detection [19.714436150837148]
EventVADはイベント対応のビデオ異常検出フレームワークである。
調整された動的グラフアーキテクチャとマルチモーダル・イベント推論を組み合わせる。
トレーニング不要な環境での最先端(SOTA)を実現し、7B以上のMLLMを使用する強力なベースラインを上回ります。
論文 参考訳(メタデータ) (2025-04-17T16:59:04Z) - SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model [52.47816604709358]
ビデオ異常検出(VAD)は、ビデオ内の予期せぬ事象を識別することを目的としており、安全クリティカルドメインに広く応用されている。
視覚言語モデル(VLM)は強力なマルチモーダル推論能力を示し、異常検出の新しい機会を提供している。
SlowFastVADは高速異常検出器と低速異常検出器を統合したハイブリッドフレームワークである。
論文 参考訳(メタデータ) (2025-04-14T15:30:03Z) - Event Signal Filtering via Probability Flux Estimation [58.31652473933809]
イベントは、非同期センシングを通じてシーンダイナミクスをキャプチャするための新しいパラダイムを提供するが、その固有のランダム性は、しばしば劣化した信号品質につながる。
したがって、イベント信号フィルタリングは、この内部ランダム性を低減し、多様な取得条件をまたいだ一貫した出力を確保することで、忠実性を高めるために不可欠である。
本稿ではイベント密度フローフィルタ(EDFilter)と呼ばれる生成オンラインフィルタリングフレームワークを紹介する。
実験では、イベントフィルタリング、スーパーレゾリューション、イベントベースの直接追跡といったタスクでEDFilterのパフォーマンスを検証する。
論文 参考訳(メタデータ) (2025-04-10T07:03:08Z) - ANMS: Asynchronous Non-Maximum Suppression in Event Stream [15.355579943905585]
非最大抑圧(NMS)は、フレームベースのタスクにおいて重要な後処理アルゴリズムとして広く使われている。
本稿では、汎用非同期非最大抑圧パイプライン(ANMS)を提案する。
提案したパイプラインは、元の検出器の出力から微細な特徴ストリームを抽出し、動きの速度に適応する。
論文 参考訳(メタデータ) (2023-03-19T05:33:32Z) - ProgressiveMotionSeg: Mutually Reinforced Framework for Event-Based
Motion Segmentation [101.19290845597918]
本稿では,動作推定 (ME) モジュールとイベントデノイング (ED) モジュールを相互に強化された方法で共同最適化する。
時間的相関をガイダンスとして、EDモジュールは各イベントが実活動イベントに属するという信頼度を算出し、MEモジュールに送信し、ノイズ抑制のための運動セグメンテーションのエネルギー関数を更新する。
論文 参考訳(メタデータ) (2022-03-22T13:40:26Z) - Deconfounded Video Moment Retrieval with Causal Intervention [80.90604360072831]
本研究は,ビデオ中の特定のモーメントをテキストクエリに従ってローカライズすることを目的とした,ビデオモーメント検索(VMR)の課題に取り組む。
既存の手法は主に複雑な相互モーダル相互作用によるクエリとモーメントのマッチング関係をモデル化する。
本稿では,クエリとビデオコンテンツが予測に与える影響を捉えるために,構造因果モデルを構築する因果性に着想を得たVMRフレームワークを提案する。
論文 参考訳(メタデータ) (2021-06-03T01:33:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。