論文の概要: EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection
- arxiv url: http://arxiv.org/abs/2607.00867v2
- Date: Wed, 08 Jul 2026 15:54:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 16:11:06.588267
- Title: EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection
- Title(参考訳): EFlow: 適応反射によるロングビデオ推論のためのエビデンスフローの学習
- Authors: Wenhao Zhang, Kuanwei Lin, Xuyi Yang, Wei Gao, Ge Li,
- Abstract要約: 本稿では,Qwen3-VL上に構築されたエビデンスファーストビデオ推論フレームワークであるEFlowを提案する。
EFlowは時間的接地と論理的推論をCoT for Temporal GroundingとCoT for Reasoningで明確に分離する。
さらに、EFlowは、証拠の取得時に全ビデオを再評価する信頼性を意識したメカニズムを導入している。
- 参考スコア(独自算出の注目度): 23.05273486779092
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-video reasoning is fundamentally constrained by how models acquire and utilize visual evidence. Existing tool-augmented video frameworks often interleave temporal grounding and answer reasoning within a single trajectory, causing early semantic hypotheses to bias evidence localization. We term this failure mode premature semantic commitment, where biased grounding retrieves incomplete evidence and incomplete evidence further reinforces incorrect reasoning. To address this issue, we propose EFlow, an evidence-first video reasoning framework built upon Qwen3-VL. EFlow explicitly separates temporal grounding and logical reasoning through CoT for Temporal Grounding and CoT for Reasoning, enabling the model to retrieve relevant evidence before answer inference. In addition, EFlow introduces a confidence-aware reflection mechanism that re-evaluates the full video when retrieved evidence is potentially insufficient. We further construct dedicated trajectory datasets and train EFlow through supervised fine-tuning, reinforcement learning, and reinforcement fine-tuning. Extensive experiments across five video understanding benchmarks demonstrate that EFlow consistently improves long-video reasoning performance.
- Abstract(参考訳): ロングビデオ推論は、モデルがどのように視覚的証拠を取得し、活用するかによって根本的に制約される。
既存のツール拡張ビデオフレームワークは、時間的根拠と1つの軌道内での答え推論をインターリーブすることが多く、初期の意味論的仮説はバイアス証拠の局所化を引き起こす。
我々は、この障害モードの早期セマンティックコミットメントを、偏見が不完全な証拠を回収し、不完全な証拠がさらに不完全な推論を補強する、と表現する。
本稿では,Qwen3-VL上に構築されたエビデンスファーストビデオ推論フレームワークであるEFlowを提案する。
EFlowは、時間的根拠と論理的推論をCoT for Temporal GroundingとCoT for Reasoningで明確に分離し、モデルが応答推論の前に関連する証拠を検索できるようにする。
さらに、EFlowでは、証拠の取得時に全ビデオを再評価する信頼性を意識したリフレクション機構を導入している。
さらに、専用トラジェクトリデータセットを構築し、教師付き微調整、強化学習、強化微調整を通してEFlowを訓練する。
5つのビデオ理解ベンチマークにわたる大規模な実験は、EFlowが長ビデオ推論のパフォーマンスを一貫して改善していることを示している。
関連論文リスト
- Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding [37.607009528052565]
この研究は、長いビデオ理解のための最初のEvidence-Driven Self-correctionフレームワークであるReflect-R1を提案する。
このフレームワークは直感、検証、調停からなる3段階のパイプラインを構成する。
本手法は真正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正
論文 参考訳(メタデータ) (2026-06-26T10:15:36Z) - STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models [81.32710031596591]
ビデオ推論タスクには、動きの追跡、時間順、フレーム全体の視覚状態の進化が必要である。
視覚言語モデル(LVLM)上に構築された既存の手法はしばしば、チェーン・オブ・ソート(CoT)を通じて推論を外部化することでこの問題に対処する。
STORMSは,LVLMに明示的なテキストCoTではなく,有界な連続的な潜在軌道を推論する2段階のフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T16:33:00Z) - Structured Causal Video Reasoning via Multi-Objective Alignment [102.61829546891543]
そこで本稿では,解析段階に先立って,構造化イベントファクト (Structured Event Facts) と命名した,健全なイベントとその因果関係のコンパクトな表現を提案する。
この構造化された事前は、簡潔で因果的根拠のある推論を促進するための明示的な制約として機能する。
我々はCausalFact-60Kと4段階のトレーニングパイプラインを紹介し、事実のアライメント、フォーマットのウォームスタート、思考のウォームスタート、強化学習に基づくポストトレーニングを含む。
論文 参考訳(メタデータ) (2026-04-06T04:49:30Z) - StreamReady: Learning What to Answer and When in Long Streaming Videos [28.99829321053373]
我々は、Answer Readiness Score (ARS) を用いたストリーミングビデオ理解の可読性を考慮した定式化を導入する。
ARSは、モデルが正しいかどうかではなく、適切なタイミングで答えられるかどうかを測定する効果的な精度を定義します。
この定式化に基づいて、リアルタイム応答と時間的推論を統一するフレームワークStreamReadyを導入します。
論文 参考訳(メタデータ) (2026-03-09T17:02:44Z) - Process-of-Thought Reasoning for Videos [33.74677144833003]
Process-of-Thought (PoT) Reasoning for Videosは、ビデオ推論を軽量で検証可能なステップのシーケンスに構造化することで、推論プロセスを明確にするフレームワークである。
PoT は (i) 時間的エビデンス選択、 (ii) ステップワイズ状態更新、 (iii) 制限された応答合成をインターリーブし、ビデオエビデンスのトレーサビリティを維持しながら仮説を段階的に洗練することを可能にする。
論文 参考訳(メタデータ) (2026-02-07T20:25:46Z) - When Thinking Drifts: Evidential Grounding for Robust Video Reasoning [68.75730050161219]
CoT(Chain-of-Thought)メカニズムは、テキストベースのタスクにおける推論を強化した。
CoTはビデオ推論のパフォーマンスを劣化させ、冗長だが内部のモノローグを誤解させる。
ビジュアルエビデンス・リワード(Visual Evidence Reward、VER)は、ビジュアルエビデンスに根ざした推論トレースの生成に明示的に報いる強化学習フレームワークである。
論文 参考訳(メタデータ) (2025-10-07T16:03:33Z) - VideoExplorer: Think With Videos For Agentic Long-Video Understanding [117.68219930263153]
ロングビデオ理解はコンピュータビジョンにおいて難しい問題である。
ビデオによる思考の原則に基づくフレームワークであるVideoExplorerを提案する。
静的なコンテキストを推論する代わりに、VideoExplorerは、サブクエストを反復的に定式化し、関連するモーメントを特定し、タスク指向で時間的にスケーラブルなビデオ理解を実行する。
論文 参考訳(メタデータ) (2025-06-12T15:39:10Z) - V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning [40.18308199837137]
これらの問題点に対処するために,ビデオS-テンポラル推論(V-STa)ベンチマークを導入する。
我々は,ビデオLLMの時空間推論プロセスを実現するためのデータセットを構築した。
14のビデオ-LLMによる実験では、現在のビデオ-LLMと、堅牢で一貫性のある推論の必要性の間に大きなギャップが示されている。
論文 参考訳(メタデータ) (2025-03-14T15:21:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。