論文の概要: Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning
- arxiv url: http://arxiv.org/abs/2608.11260v1
- Date: Fri, 07 Aug 2026 17:07:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 19:07:54.312052
- Title: Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning
- Title(参考訳): Glance, Scrutinize, and Think:Advanced Video Anomaly Detection from Training-free to Agentic Reasoning
- Authors: Shibo Gao, Peipei Yang, Xu-Yao Zhang, Linlin Huang,
- Abstract要約: ビデオ異常検出(VAD)は、異常事象を特定し、時間間隔をローカライズすることを目的としている。
従来の手法は異常が発生した時に局所化するが、意味的な理解が欠如している。
Glance then Scrutinize (GtS) は静的および動的テキストガイダンスを用いたトレーニング不要のフレームワークである。
実験の結果、GtSはトレーニング不要のベースラインを大幅に超え、エージェントモデルは高い精度と高速な推論を提供することがわかった。
- 参考スコア(独自算出の注目度): 27.676141768874732
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video Anomaly Detection (VAD) aims to identify anomalous events and localize their temporal intervals. Existing approaches exhibit a "when-what" dissociation: traditional DNN-based methods localize when anomalies occur but lack semantic understanding, whereas LLM-based methods explain what happens but neglect precise temporal grounding. We attribute this to the absence of a unified reasoning paradigm. Inspired by how humans inspect surveillance videos - glancing globally to form temporal hypotheses, scrutinizing suspicious segments, and thinking iteratively to correct errors - we study this global-to-local paradigm from two perspectives. We first propose Glance then Scrutinize (GtS), a training-free framework using static and dynamic textual guidance for coarse-to-fine anomaly grounding and understanding, balancing accuracy and speed. To break the ceiling imposed by frozen external modules, we further propose a tool-augmented agentic VAD method, where a multimodal large language model learns to invoke a video cropping tool, inspect densely resampled frames, and self-correct mislocalized hypotheses, via cold-start supervised fine-tuning followed by reinforcement learning with a joint answer-grounding reward. For training and evaluation, we extend our prior VAGU benchmark into VAGU-T (Video Anomaly Grounding, Understanding, and Thinking), comprising 7,567 real-world videos over 21 anomaly categories with human-validated grounding, explanations, QA pairs, and chain-of-thought tool-calling traces. We further introduce JeAUG, a metric jointly evaluating semantic interpretability and temporal precision. Experiments show that GtS substantially surpasses training-free baselines, while the agentic model delivers both higher accuracy and faster inference.
- Abstract(参考訳): ビデオ異常検出(VAD)は、異常事象を特定し、時間間隔をローカライズすることを目的としている。
従来のDNNベースの手法では、異常が発生した時に局所化されるが、意味的理解が欠如している。
これは統一的な推論パラダイムが存在しないためです。
人間が監視ビデオの検査方法 – 時間的仮説の形成,疑わしい部分の精査,エラーの修正を反復的に考える – に触発された私たちは,このグローバルからローカルへのパラダイムを2つの視点から検討しています。
まず,Glance then Scrutinize (GtS)を提案する。これは静的および動的テキストガイダンスを用いて,粗い粒度の異常なグラウンドと理解,精度と速度のバランスをとるためのトレーニングフリーフレームワークである。
凍結した外部モジュールが課す天井を壊すため,マルチモーダルな大規模言語モデルでビデオクロップングツールの起動,高密度再サンプリングフレームの検査,自己修正ミスローカライズされた仮説を,冷間開始による教師付き微調整および共同応答型グラウンド報酬による強化学習によって学習する,ツール拡張型エージェントVAD手法を提案する。
トレーニングと評価のために、VAGUベンチマークをVAGU-T (Video Anomaly Grounding, Understanding, and Thinking) に拡張し、21のアノマライズされたグラウンド、説明、QAペア、チェーンオブ思考ツールコールトレースを備えた実世界の7,567の動画で構成された。
さらに,意味的解釈可能性と時間的精度を共同評価する指標であるJeAUGを紹介する。
実験の結果、GtSはトレーニング不要のベースラインを大幅に超え、エージェントモデルは高い精度と高速な推論を提供することがわかった。
関連論文リスト
- CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection [0.14323566945483493]
CoReVADは、トレーニング不要なビデオ異常検出のためのコンテキスト推論フレームワークである。
生成出力のノイズを軽減するために,ローカル応答クリーニング(LRC)モジュールを導入する。
UCF-CrimeとXD-Violenceの実験は、CoReVADがトレーニング不要の手法間の競争性能を達成することを示した。
論文 参考訳(メタデータ) (2026-05-22T00:32:46Z) - Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding [86.37002814396674]
ビデオ時間グラウンドのためのフォアシー・ツー・グラウンド(F2G)を提案する。
F2Gは予測的時間知覚とエビデンス駆動推論を統合している。
さまざまなベンチマークでグラウンド化の精度を一貫して向上させる。
論文 参考訳(メタデータ) (2026-05-21T04:03:25Z) - SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere [90.85001795656633]
ビデオ異常検出(VAD)は、トリミングされていない監視ビデオの通常のパターンから逸脱するイベントを自動的に識別することを目的としている。
SphereVADはトレーニング不要でゼロショットのVADフレームワークで、単位超球面上の準比測地線推定をvon Mises-Fisher (vMF) と再放送する。
論文 参考訳(メタデータ) (2026-05-08T16:57:38Z) - Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models [54.76242207842981]
我々は,Vid-LLMが正解し,否定に基づくガス灯下での判断を視覚的に下す失敗モードであるビデオサイファーシーを同定した。
モデルは単に答えを変更するのではなく、しばしば不正確な修正を正当化するために時間的または空間的な説明を作る。
GasVideo-1000は,視覚的根拠と時間的推論の要求を明確化して,ビデオの時間的サイコフィケーシーを探索するためのベンチマークである。
論文 参考訳(メタデータ) (2026-04-20T06:35:26Z) - Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models [2.8529525624646492]
ビデオ異常検出(VAD)は、伝統的にバイナリ分類または外れ値検出としてフレーム化されてきた。
本稿では,異常分類,空間的接地,思考の連鎖的推論を統一するフレームワークであるVANGUARDを提案する。
UCF-Crimeでは、VANGUARDは94%のROC-AUCを84%のF1で達成し、同時に解釈可能な連鎖説明と異常物体の空間的接地を生成する。
論文 参考訳(メタデータ) (2026-04-07T20:15:15Z) - Agentic Spatio-Temporal Grounding via Collaborative Reasoning [80.83158605034465]
時間的ビデオグラウンド(Temporal Video Grounding)は、テキストクエリが与えられたビデオ内の対象物または人の時間的チューブを検索することを目的としている。
本稿では,STVGの課題に対して,オープンワールドおよびトレーニングフリーシナリオに向けたエージェント時空間グラウンド(ASTG)フレームワークを提案する。
具体的には、現代多言語モデル(MLLM)を活用した2つの特殊エージェントSRA(Spatial Reasoning Agent)とTRA(Temporal Reasoning Agent)である。
人気のあるベンチマークの実験は、既存の弱教師付きおよびゼロショットアプローチをマージンで上回る提案手法の優位性を実証している。
論文 参考訳(メタデータ) (2026-02-10T10:16:27Z) - Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models [56.851611990473174]
動的ビジュアルコンテンツに対する推論は、大きな言語モデルにとって依然として中心的な課題である。
本稿では,時間的精度と推論一貫性を両立させる強化学習手法を提案する。
結果のモデルであるVideo R2は、複数のベンチマークでTAC、VAS、精度を一貫して向上させる。
論文 参考訳(メタデータ) (2025-11-28T18:59:58Z) - A Unified Reasoning Framework for Holistic Zero-Shot Video Anomaly Analysis [64.42659342276117]
ビデオの異常な研究のほとんどは、フレームワイド検出で停止し、なぜイベントが異常なのかについての洞察はほとんど得られない。
近年の動画の局所化と映像の異常理解手法は、説明可能性を改善するが、データに依存し、タスク固有のままである。
本稿では,時間的検出,空間的局所化,テキスト的説明のギャップを埋める統一的推論フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-02T14:49:08Z) - Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting [17.850029260662648]
本稿では,ビデオ異常検出のための構造化プロンプトフレームワークであるASK-Hintを提案する。
提案手法は, セマンティック・コヒーレントなグループにプロンプトを整理し, きめ細かい案内質問を定式化する。
UCF-CrimeとXD-Violenceの実験では、ASK-Hintは以前のベースラインよりも一貫してAUCを改善している。
論文 参考訳(メタデータ) (2025-10-02T16:06:31Z) - VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding [22.43740206690383]
ビデオ異常検出(VAD)は、ビデオ内の異常事象を特定し、その時間間隔を正確に決定することを目的としている。
VAGUは、異常理解と接地を統合する最初のベンチマークである。
Glance then Scrutinize (GtS) はテキストプロンプトでガイドされるトレーニング不要のフレームワークである。
また,意味的解釈可能性と時間的精度を共同で評価するJeAUG指標を提案する。
論文 参考訳(メタデータ) (2025-07-29T05:17:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。