論文の概要: Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization
- arxiv url: http://arxiv.org/abs/2607.00622v1
- Date: Wed, 01 Jul 2026 08:41:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.812557
- Title: Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization
- Title(参考訳): Learning to Watch:Interleaved Policy Optimizationによるアクティブビデオ異常理解
- Abstract要約: ビデオ異常理解(VAU)は、スパースでコンテキストに依存した手がかりに依存している。
本稿では,映像理解をアクティブな逐次意思決定プロセスとして再認識するクローズドループフレームワークである$Anomtext-$を提案する。
人間のビデオレビュー行動に触発されたこのフレームワークは、内部の認知的推論と戦略的エビデンスを、インターリーブされたポリシーに統一する。
- 参考スコア(独自算出の注目度): 56.150184676745205
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video anomaly understanding (VAU) relies on sparse, context-dependent cues. However, existing passive paradigms suffer from observational aliasing, where static sampling fails to disambiguate semantically distinct events. To overcome this, we propose $Anom\text{-}π$, a closed-loop framework that reconceptualizes video understanding as an active sequential decision-making process within a dynamic environment. Inspired by human video-reviewing behavior, this framework unifies internal cognitive reasoning and strategic evidence acquisition into an interleaved policy, utilizing temporal atomic operators such as local backtracking, temporal expansion, and fine-grained sampling to endow the model with perceptual proactivity. To learn such complex interaction strategies under video-level weak supervision, we design Interactive Direct Preference Optimization (iDPO) to achieve trajectory-level policy alignment, guided by an Active Evidence Inquiry (AEI) utility that balances task success, informative evidence acquisition, and interaction cost. This approach enables the agent to learn to actively disambiguate hypotheses while suppressing redundant exploration. Extensive experiments demonstrate that our framework, with only 2B parameters, achieves highly competitive performance, significantly outperforming state-of-the-art large-scale VAU models in complex scenarios.
- Abstract(参考訳): ビデオ異常理解(VAU)は、スパースでコンテキストに依存した手がかりに依存している。
しかし、既存の受動的パラダイムは観察的エイリアスに悩まされ、静的サンプリングは意味的に異なる事象を曖昧にしない。
そこで我々は,映像理解を動的環境内での逐次的意思決定プロセスとして再認識するクローズドループフレームワークである$Anom\text{-}π$を提案する。
人間のビデオレビュー行動に触発されたこの枠組みは、内的認知的推論と戦略的エビデンス獲得をインターリーブされたポリシーに統合し、局所的バックトラック、時間的拡張、きめ細かいサンプリングなどの時間的アトミック演算子を活用して、知覚的積極性を持つモデルを実現する。
映像レベルの弱い監督下でこのような複雑なインタラクション戦略を学習するために,タスク成功,情報的証拠獲得,相互作用コストのバランスをとるアクティブエビデンス・クエリー(AEI)ユーティリティによって導かれる軌道レベルのポリシーアライメントを実現するために,インタラクティブなダイレクト・プレフレクション・最適化(iDPO)を設計する。
このアプローチにより、エージェントは冗長な探索を抑えながら仮説を積極的に曖昧にすることができる。
大規模な実験により、我々のフレームワークは2Bパラメータしか持たず、非常に競争力のある性能を達成し、複雑なシナリオにおいて最先端の大規模VAUモデルよりもはるかに優れていることが示された。
関連論文リスト
- Endogenous Exploration in Reinforcement Learning with Intrinsic Curiosity [0.2734499144137758]
本研究では,本質的な好奇心によって探索が促される強化学習フレームワークを提案する。
中心的な仮説は、効果的な探検は中間レベルの不整合で現れるというものである。
また,同一解析条件下では,好奇性ウィンドウがアクティブ推論エージェントでは復元されないことを示す。
論文 参考訳(メタデータ) (2026-09-04T18:30:41Z) - Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild [49.77540427384148]
本稿では,基礎モデルの汎用的マルチモーダル推論能力を野生でのHOI検出に伝達する,訓練不要なエージェント型フレームワークであるAgenHoIを提案する。
不完全な相互作用発見と複雑な場面におけるあいまいな局所化の課題に対処するために,2つの重要なメカニズムを導入する。
AgentHOIは、リアルタイム設定において、最先端の教師付きおよび弱教師付きメソッドよりも優れたパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-07-15T14:30:20Z) - ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning [53.17987412112712]
強化学習(Reinforcement Learning, RL)は、複雑な操作タスクにおけるビジョン・ランゲージ・アクション(VLA)モデルを改善する重要な可能性を示している。
本稿では,現在のVLA-RLフレームワークにおける探索の停滞ボトルネックについて検討する。
本稿では,VLA ポリシーを個別の行動事前に規定する簡易かつ汎用的なフレームワークである RL Exploration Token (ExToken) を紹介する。
論文 参考訳(メタデータ) (2026-07-14T16:04:41Z) - AIPO: Learning to Reason from Active Interaction [54.10819421625103]
AIPOは、ポリシーモデルが、推論ボトルネックに遭遇するときに、3つの機能的協調エージェントを積極的に相談することを可能にする。
AIPOは推論性能を継続的に改善し、異なるポリシーモデルとRLVRアルゴリズムをまたいで堅牢に一般化し、ポリシーモデルの推論能力境界を効果的に拡張する。
論文 参考訳(メタデータ) (2026-05-08T19:06:55Z) - Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision [11.159231524113764]
マルチモーダル大規模言語モデル(MLLM)の複雑な推論能力を高めるための重要なメカニズムとして強化学習(RL)が登場した。
本稿では,これらの構造的制約に対処する textbfGuided Verifier フレームワークを提案する。
我々は,マルチモーダル幻覚をターゲットとした特殊なデータ合成パイプラインを開発し,プロセスレベルの負の textbfCoRe データセットとtextbfCorrect-guide textbfReasoning トラジェクトリを構築し,ガイド付き検証器を訓練する。
論文 参考訳(メタデータ) (2026-02-04T07:38:42Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Generative Model-Based Feature Attention Module for Video Action Analysis [12.406387678107759]
本稿では,特徴意味論の関係を学習するための新しい生成的注意ベースモデルを提案する。
本モデルでは,時間的行動特徴セマンティクスのフレーム依存性とセグメント依存性を同時に学習する。
我々は,広く認識されているデータセットに対する包括的検証を通じて,アプローチの優位性を実証する。
論文 参考訳(メタデータ) (2025-08-19T06:56:02Z) - ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding [71.654781631463]
ReAgent-Vは、新しいエージェントビデオ理解フレームワークである。
推論中に効率の良いフレーム選択とリアルタイムの報酬生成を統合する。
12のデータセットに対する大規模な実験は、一般化と推論において大きな成果を上げている。
論文 参考訳(メタデータ) (2025-06-02T04:23:21Z) - Active Sensing with Predictive Coding and Uncertainty Minimization [0.0]
2つの生物学的計算から着想を得たエンボディード探索のためのエンドツーエンドの手法を提案する。
まず,迷路ナビゲーションタスクによるアプローチを実演し,環境の遷移分布と空間的特徴を明らかにする。
本モデルでは,視覚シーンを効率的に分類するための探索によって,教師なし表現を構築する。
論文 参考訳(メタデータ) (2023-07-02T21:14:49Z) - Efficient Empowerment Estimation for Unsupervised Stabilization [75.32013242448151]
エンパワーメント原理は 直立位置での 力学系の教師なし安定化を可能にする
本稿では,ガウスチャネルとして動的システムのトレーニング可能な表現に基づく代替解を提案する。
提案手法は, サンプルの複雑さが低く, 訓練時より安定であり, エンパワーメント機能の本質的特性を有し, 画像からエンパワーメントを推定できることを示す。
論文 参考訳(メタデータ) (2020-07-14T21:10:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。