論文の概要: Evidence-RL: Towards Evidence-intensive Visual Reasoning
- arxiv url: http://arxiv.org/abs/2608.08021v1
- Date: Sat, 08 Aug 2026 09:02:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.606998
- Title: Evidence-RL: Towards Evidence-intensive Visual Reasoning
- Title(参考訳): Evidence-RL:Evidence-Intensive Visual Reasoningを目指して
- Authors: Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu,
- Abstract要約: VLM(Vision-Language Models)は、言語やデータセットのショートカット、あるいは無関係な視覚的コンテキストよりも、具体的な画像証拠から答えるべきである。
本稿では,VLM接地のための訓練時間的エビデンス監査であるCED(Courerfactual Evidence Disentanglement)を提案する。
CEDはオブジェクト中心のエビデンス領域を中和し、その結果の非エビデンス領域に対するサポートドロップを比較する。
- 参考スコア(独自算出の注目度): 42.129341199654654
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language Models (VLMs) should answer from concrete image evidence rather than language priors, dataset shortcuts, or irrelevant visual context. Existing perception-aware post-training methods encourage image use through global perturbations or attention proxies, but they do not test whether a sampled answer causally depends on the local evidence that supports it. We propose Counterfactual Evidence Disentanglement (CED), a training-time evidence audit for VLM grounding. For each response, CED neutralizes an object-centric Evidence Region and compares the resulting support drop against matched non-evidence Regions. We combine this signal with answer correctness inside GRPO, rewarding correct answers that rely on the evidence path rather than shortcut or nuisance paths. CED uses weak object-level proposals, requires no question-specific evidence annotations, and adds no inference-time overhead. Across nine public benchmarks and four backbones, CED outperforms prior RL-based post-training methods, with targeted analyses verifying its object-centric signal.
- Abstract(参考訳): VLM(Vision-Language Models)は、言語やデータセットのショートカット、あるいは無関係な視覚的コンテキストよりも、具体的な画像証拠から答えるべきである。
既存の知覚認識ポストトレーニング手法は、グローバルな摂動や注意プロキシを通じて画像の使用を促進するが、サンプル回答がそれを支持する局所的な証拠に因果的に依存するかは検証していない。
本稿では,VLM接地のための訓練時間的エビデンス監査であるCED(Courerfactual Evidence Disentanglement)を提案する。
各応答について、CEDはオブジェクト中心のエビデンス領域を中和し、その結果の非エビデンス領域に対するサポートドロップを比較する。
我々はこの信号とGRPO内の答えの正しさを組み合わせ、ショートカットやニュアンスパスではなくエビデンスパスに依存する正解を報いる。
CEDは弱いオブジェクトレベルの提案を使用し、疑問固有のエビデンスアノテーションを必要とせず、推論時のオーバーヘッドを追加しない。
9つの公開ベンチマークと4つのバックボーンで、CEDはRLベースのポストトレーニング手法よりも優れており、対象分析が対象中心の信号を検証する。
関連論文リスト
- Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models? [22.988311596447435]
ビジュアル検索強化生成(RAG)は、通常、検索されたエビデンスを拡張して、回答ページのカバレッジを改善する。
この仮定は拡散言語モデル(DLM)に当てはまらないことを示す。
トレーニング不要なエビデンス・アドミッションフレームワークであるEntropy-Based Candidate Filter (ECF)を提案する。
論文 参考訳(メタデータ) (2026-08-07T09:20:40Z) - Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning [42.17614767170884]
そこで本研究では,入力からテキストを推論トレースに広範囲にコピーする手法を提案する。
各プロンプトをタスク関連キーエビデンスと無関係インタプタコンテキストに分離することにより,根本原因が不十分であることを示す。
この診断に触発されたGEARは,キーエビデンスと重複するグラウンドング報酬と無関係な文脈と重複するイントラクタペナルティを付与し,精度を向上する報酬形成手法である。
論文 参考訳(メタデータ) (2026-07-21T17:59:21Z) - EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence [48.314554375516366]
本稿では,Evidence-Grounded Video Question Answering Benchmark (EG-VQA)を紹介する。
EG-VQAは2,067本の動画と11,838本のQAペアで構成されている。
強力なプロプライエタリモデルでさえ、予測を正確に下ろすのに苦労しています。
我々は,明示的な監督によって訓練されたエビデンス基底推論モデルEG-Reasonerを提案する。
論文 参考訳(メタデータ) (2026-06-23T16:49:28Z) - SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards [8.705689021755221]
制約されたタスクとしてRLを改革するためのセマンティックエビデンス・リワード(SER)を提案する。
ピクセルレベルのアノテーションを計算する代わりに、SERはVLMを拡張したレフェリーを使用してモデル生成のエビデンスのクレームを評価する。
VLMベンチマークでは、SERは49.6%を獲得し、強いエビデンスベースラインよりも3.0ポイント向上した。
論文 参考訳(メタデータ) (2026-06-23T15:50:33Z) - Look As You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning [55.232400251303794]
Look As You Think (LAT)は、モデルをトレーニングし、一貫した帰属性を持った検証可能な推論パスを生成するための強化学習フレームワークである。
LATはシングルイメージとマルチイメージの両方でバニラモデルを一貫して改善し、平均ゲインは8.23%、IoU@0.5では47.0%となる。
論文 参考訳(メタデータ) (2025-11-15T02:50:23Z) - NeoQA: Evidence-based Question Answering with Generated News Events [53.85274258429368]
この問題に対処するために設計されたベンチマークであるNeoQAを紹介します。
我々は,エビデンスに基づく質問応答を評価するための新しいプラットフォームとして,データセットを提案する。
論文 参考訳(メタデータ) (2025-05-09T10:51:29Z) - From Relevance to Utility: Evidence Retrieval with Feedback for Fact Verification [118.03466985807331]
我々は、FVの関連性よりも、クレーム検証者が取得した証拠から導出する実用性に焦点を当てる必要があると論じる。
本稿では,エビデンス検索プロセスの最適化に,クレーム検証器からのフィードバックを取り入れたフィードバックベースのエビデンス検索手法(FER)を提案する。
論文 参考訳(メタデータ) (2023-10-18T02:59:38Z) - Distantly-Supervised Evidence Retrieval Enables Question Answering
without Evidence Annotation [19.551623461082617]
オープンドメインの質問応答は、大きなコーパスから取得した証拠に基づいて質問に答える。
本稿では,大規模コーパスからモデルが証拠の発見を学べるかどうかを,モデル学習のための回答ラベルからのみ遠ざかって検討する。
我々は,最新のモデルから証拠を交互に発見し,最も可能性の高い証拠を学習するよう促すことにより,弱いレトリバーよりも反復的に改善する新しいアプローチ(DistDR)を提案する。
論文 参考訳(メタデータ) (2021-10-10T20:01:27Z) - REM-Net: Recursive Erasure Memory Network for Commonsense Evidence
Refinement [130.8875535449478]
REM-Netは、答えを説明できない低品質な証拠を消去することで証拠を洗練するためのモジュールを備えている。
既存の知識ベースから証拠を取得する代わりに、REM-Netは事前訓練された生成モデルを利用して、質問用にカスタマイズされた候補証拠を生成する。
結果はREM-Netの性能を示し、洗練された証拠が説明可能であることを示します。
論文 参考訳(メタデータ) (2020-12-24T10:07:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。