論文の概要: Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding
- arxiv url: http://arxiv.org/abs/2606.27922v2
- Date: Mon, 29 Jun 2026 13:16:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 15:56:39.065225
- Title: Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding
- Title(参考訳): Reflect-R1:ロングビデオ理解における自己補正のためのエビデンス駆動反射
- Abstract要約: この研究は、長いビデオ理解のための最初のEvidence-Driven Self-correctionフレームワークであるReflect-R1を提案する。
このフレームワークは直感、検証、調停からなる3段階のパイプラインを構成する。
本手法は真正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正
- 参考スコア(独自算出の注目度): 37.607009528052565
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current multimodal reflection mechanisms for long video understanding predominantly rely on closed-loop self-reflection within internal parameters. Lacking objective external evidence, models are frequently trapped in blind confidence and often fail to correct errors. Furthermore, applying reinforcement learning to multi-stage reflection pipelines introduces severe policy coupling, which is exacerbated by a critical scarcity of dedicated training data. To address these limitations, this work proposes Reflect-R1, the first Evidence-Driven self-correction framework for long video understanding. The framework constructs a three-stage pipeline consisting of intuition, verification, and arbitration. By dynamically retrieving objective visual evidence to verify initial intuitions and autonomously executing multiple temporal searches to resolve conflicts, it completely breaks the hallucination loop. To overcome policy coupling, we design a stage-decoupled reinforcement learning algorithm named SD-GRPO that independently computes advantage functions across different reasoning stages. Concurrently, we construct a dataset of 120K samples to bridge the training data gap. Extensive experiments on benchmarks such as VideoMME and LongVideoBench demonstrate that Reflect-R1 achieves state-of-the-art performance. Our method significantly improves the genuine rectification rate and enables authentic self-correction strictly grounded in objective evidence.
- Abstract(参考訳): 長いビデオ理解のための現在のマルチモーダル反射機構は、内部パラメータ内の閉ループ自己反射に大きく依存している。
客観的な外部証拠が欠如しているため、モデルはしばしば盲目の自信の中に閉じ込められ、しばしば誤りを訂正する。
さらに、多段階反射パイプラインに強化学習を適用することで、厳密なポリシー結合がもたらされ、専用のトレーニングデータの致命的不足により悪化する。
これらの制限に対処するため、この研究は、長いビデオ理解のための最初のEvidence-Driven Self-correctionフレームワークであるReflect-R1を提案する。
このフレームワークは直感、検証、調停からなる3段階のパイプラインを構成する。
客観的な視覚的証拠を動的に取得し、初期直観を検証し、紛争を解決するために複数の時間探索を自律的に実行することにより、幻覚ループを完全に破壊する。
政策結合を克服するため,SD-GRPOと呼ばれる段階分離型強化学習アルゴリズムを設計した。
同時に、トレーニングデータギャップをブリッジするために120Kサンプルのデータセットを構築します。
VideoMMEやLongVideoBenchといったベンチマークに関する大規模な実験は、Reflect-R1が最先端のパフォーマンスを達成することを実証している。
本手法は真正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正正
関連論文リスト
- VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models [30.792102059830274]
Video-Adaptive Debiasing via Evidence Reweighting (VADER)は、2つの補完モジュールを持つトレーニング不要のフレームワークである。
Visual Focus Reallocation (VFR)は、ビデオ検索の各入力に対する介入ポリシーを自動的にインスタンス化する。
SEE(Selective Evidence Erasure)は、フレーム毎に高重要性の視覚トークンを隠蔽する。
論文 参考訳(メタデータ) (2026-08-09T10:09:11Z) - CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding [17.497595783869745]
CADER(Confidence-Aware Dynamic Evidence Reasoning)は、適応的で信頼性の高い長ビデオ推論のためのトレーニングフリーフレームワークである。
高信頼度サンプルのStage2をバイパスしながら,CADERは長ビデオ推論を改善した。
論文 参考訳(メタデータ) (2026-07-27T15:49:42Z) - Find, Fix, Reason: Context Repair for Video Reasoning [45.021693494492666]
強化学習は、大規模なマルチモーダルモデルにおいて高度なビデオ推論を持つ。
凍結したツール統合された教師は、時間的依存の欠如を認識し、最小限のエビデンスパッチを提供する。
本稿では,正解による結果の妥当性と依存性の整合性という2つの目標に最適化を整合させるロバスト改善リワード(RIR)を提案する。
論文 参考訳(メタデータ) (2026-04-17T17:04:19Z) - Relaxing Anchor-Frame Dominance for Mitigating Hallucinations in Video Large Language Models [22.554751069064906]
最近のビデオ大言語モデル(ビデオ-LLM)は、ビデオ理解において強力な能力を示しているが、幻覚に悩まされている。
モデルが時間的に不均衡な濃度パターンを示すデコーダ側現象について検討する。
そこで本稿では,Decoder-side Temporal Rebalancing (DTR)を提案する。
論文 参考訳(メタデータ) (2026-04-14T11:05:42Z) - VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting [58.508924874097715]
VisonCoach は,(1) ビデオと質問に対して適切なプロンプト型を予測する Visual Prompt Selector と,(2) 視覚的プロンプトガイダンスとオブジェクトグラウンド報酬の下で RL で最適化された Spatio-Reasoner の2つのコンポーネントから構成される。
この結果から,トレーニング中の視覚的プロンプトが映像推論を改善するのに対し,注意散布センスは推論時にプロンプトを必要とせず,この能力を実現することが示唆された。
論文 参考訳(メタデータ) (2026-03-15T23:32:02Z) - VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning [42.22791607763693]
VideoVeritasは、きめ細かい認識と事実に基づく推論のためのフレームワークだ。
共同知覚選好と知覚Pretext Reinforcement Learningが使用される。
論文 参考訳(メタデータ) (2026-02-09T16:00:01Z) - Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection [71.8243083897721]
視覚言語モデルは、しばしば詳細を幻覚させ、既存のオブジェクトを生成するか、出力信頼性を損なう不正確な属性を生成する。
本稿では、長文応答と短文応答の自己整合性を利用して、学習のための選好ペアを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T10:37:11Z) - Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning [54.56271651170667]
既存の方法は、しばしば固いテンプレートに過度に適合し、偽りのコンテンツに対する深い推論を欠いている。
FakeVVは10万以上のビデオテキスト対と微粒で解釈可能なアノテーションからなる大規模ベンチマークである。
また、深い推論と協調ルールに基づく強化学習を統合するフレームワークであるFact-R1を提案する。
論文 参考訳(メタデータ) (2025-05-22T16:05:06Z) - ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning [68.76048244253582]
ビデオ理解におけるフレーム選択の最適化にルールベース強化学習(RL)を利用する最初のフレームワークであるViaRLを紹介する。
ViaRLは、下流モデルの応答精度を報奨信号として利用し、試行錯誤によってフレームセレクタを訓練する。
ViaRLは、多様なビデオ理解タスクに対して、時間的基盤性能と堅牢な一般化を一貫して提供します。
論文 参考訳(メタデータ) (2025-05-21T12:29:40Z) - Self-Supervised Multi-Object Tracking For Autonomous Driving From
Consistency Across Timescales [53.55369862746357]
自己管理型マルチオブジェクトトラッカーは、生のドメイン固有データから学習できるという大きな可能性を秘めている。
しかし、その再識別精度は、監督対象よりも低い。
本稿では,複数の連続フレームから再同定特徴を自己教師付きで学習できる学習目標を提案する。
論文 参考訳(メタデータ) (2023-04-25T20:47:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。