論文の概要: Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?
- arxiv url: http://arxiv.org/abs/2608.07006v1
- Date: Fri, 07 Aug 2026 09:20:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.447234
- Title: Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?
- Title(参考訳): 拡散言語モデルを用いた視覚的検索強化生成を支援する証拠の検索
- Abstract要約: ビジュアル検索強化生成(RAG)は、通常、検索されたエビデンスを拡張して、回答ページのカバレッジを改善する。
この仮定は拡散言語モデル(DLM)に当てはまらないことを示す。
トレーニング不要なエビデンス・アドミッションフレームワークであるEntropy-Based Candidate Filter (ECF)を提案する。
- 参考スコア(独自算出の注目度): 22.988311596447435
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual retrieval-augmented generation (RAG) commonly expands the retrieved evidence set to improve answer-page coverage, implicitly assuming that all available evidence should be passed to the generator. We show that this assumption does not hold for diffusion language models (DLMs): retrieving more pages increases answer-page recall, whereas unconditionally passing all retrieved pages to the generator often reduces answer accuracy, primarily because of semantic conflict. A latent-source analysis explains this mismatch through source-coherence loss in parallel denoising, where position-wise proposals can combine incompatible visual sources into unsupported answers. We further find that such interference is already visible in the first-step answer-block distribution, making it possible to assess evidence before decoding. To preserve retrieval coverage while limiting harmful visual exposure, we propose the Entropy-Based Candidate Filter (ECF), a training-free evidence-admission framework. To reduce irrelevant content within individual candidates, ECF constructs multi-granularity evidence units; to identify beneficial additional evidence, it uses blank-controlled block confidence and retrieval rank to determine whether and which candidate should enter the final context. Across three multimodal DLMs and five visual QA benchmarks, ECF improves answer accuracy by 2.62 percentage points on average over the strongest fixed top-$k$ input and, with LLaDA2.0-Uni, by 2.37 percentage points on average over the best competing training-free result for each dataset. These results show that broader retrieval benefits visual DLM-RAG through selective evidence admission rather than unconditional evidence expansion. Code is publicly available at https://github.com/wjkuser/ECF.
- Abstract(参考訳): 視覚的検索強化生成(RAG)は一般的に、検索された証拠を拡張して回答ページのカバレッジを改善し、利用可能な証拠をジェネレータに渡すべきであると暗黙的に仮定する。
この仮定は拡散言語モデル (DLM) に当てはまらないことを示す: より多くのページを検索すると解答ページのリコールが増加し、一方、無条件で検索したページをジェネレータに渡すと、主に意味的衝突のために解答精度が低下する。
遅延ソース分析では、ソースコヒーレンス損失によるこのミスマッチを並列denoisingで説明しています。
さらに、この干渉は第1段階の応答ブロック分布で既に見えており、復号化前に証拠を評価することができる。
有害な視覚的露出を抑えつつ検索範囲を維持するため,トレーニング不要なエビデンス・アドミッション・フレームワークであるEntropy-Based Candidate Filter (ECF)を提案する。
個別候補内の無関係な内容を減らすため、ECFは多粒性証拠単位を構築し、有意義な追加証拠を特定するために、空白制御ブロックの信頼度と検索ランクを用いて最終文脈にどの候補を入力すべきかを決定する。
3つのマルチモーダルDLMと5つの視覚的QAベンチマークで、ECFは、最強の固定トップ値の入力に対して平均2.62ポイント、LLaDA2.0-Uniで平均2.37ポイント、各データセットに対して最も競合するトレーニングフリーな結果に対して平均2.62ポイント改善している。
これらの結果から, 視覚的DLM-RAGは, 無条件の証拠拡張よりも選択的証拠付与により広い範囲の検索が有効であることが示唆された。
コードはhttps://github.com/wjkuser/ECF.comで公開されている。
関連論文リスト
- Navigating Sparse Evidence: Agentic Visual RAG via Explicit Context Selection and Consolidation [50.92223196290564]
明示的な証拠選択と統合のための統一エージェントループを提案する。
探索中、SCoREはクエリ関連観測とソースポインタのみを保守されたテキスト台帳に保持する。
終了時には、参照された元のイメージを再ロードし、答えの視覚的証拠を統合し、論理的なシーケンスにアレンジする。
論文 参考訳(メタデータ) (2026-09-14T16:11:35Z) - Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos [50.28847179290796]
PACEは、長期的な証拠取得のためのファクター誘導フレームワークである。
オープンソースのQwen3-VLバックボーンを持つMMR-Vでは、PACEは42.6%の精度を達成している。
論文 参考訳(メタデータ) (2026-08-26T19:38:17Z) - SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering [8.538563236020947]
SAFE-Gは構造対応のFiveence-Guided Generationフレームワークである。
正確な証拠のローカライズと信頼できる推論を可能にする。
従来の手法を8.9%と3.5%で上回っている。
論文 参考訳(メタデータ) (2026-08-22T06:34:53Z) - Evidence-RL: Towards Evidence-intensive Visual Reasoning [42.129341199654654]
VLM(Vision-Language Models)は、言語やデータセットのショートカット、あるいは無関係な視覚的コンテキストよりも、具体的な画像証拠から答えるべきである。
本稿では,VLM接地のための訓練時間的エビデンス監査であるCED(Courerfactual Evidence Disentanglement)を提案する。
CEDはオブジェクト中心のエビデンス領域を中和し、その結果の非エビデンス領域に対するサポートドロップを比較する。
論文 参考訳(メタデータ) (2026-08-08T09:02:10Z) - CQC-RAG: Robust Retrieval-Augmented Generation via Cross-Query Consistency [9.50454647525075]
CQC-RAGは,クエリレベルの多様性注入とクエリ間の一貫性の評価を共同設計するフレームワークである。
CQC-RAGは、元の質問を多様だが意味を保ったクエリに書き換える。
根拠に基づくプロトコルを適用して、回答と証拠のペアを抽出し、信頼性の安定性に応じて回答を選択する。
論文 参考訳(メタデータ) (2026-06-11T15:01:49Z) - Align Documents to Questions: Question-Oriented Document Rewriting for Retrieval-Augmented Generation [51.55755193937205]
提案するQREAMは,検索した文書を事実を保存しながら質問指向のスタイルで整列するスタイル制御リライタである。
本フレームワークは,(1) 反復的書き換え探索にスタイリスティックシードを用いたQREAM-ICL,(2) ICL出力から抽出した軽量学生モデルQREAM-FTの2段階からなる。
論文 参考訳(メタデータ) (2026-04-19T08:39:21Z) - Benchmarking Deflection and Hallucination in Large Vision-Language Models [25.176271096443482]
既存のベンチマークでは、視覚的証拠とテキスト的証拠の衝突を見落としている。
多様なマルチモーダル検索設定にまたがる2,775個のサンプルのベンチマークであるVLM-DeflectionBenchを紹介する。
私たちの結果は、モデルが知っていることだけでなく、そうでないときにどのように振る舞うかを評価する必要性を強調します。
論文 参考訳(メタデータ) (2026-04-13T20:22:22Z) - Rethinking the Reranker: Boundary-Aware Evidence Selection for Robust Retrieval-Augmented Generation [64.09110141948693]
Retrieval-Augmented Generation (RAG) システムは、現実的な検索ノイズの下でも不安定である。
そこで我々は,BAR-RAGを提案する。このBAR-RAGは,発電機のGoldilocks Zoneをターゲットとした境界認識型エビデンスセレクタである。
Bar-RAGはノイズ検索において、エンドツーエンドのパフォーマンスを一貫して改善する。
論文 参考訳(メタデータ) (2026-02-03T16:08:23Z) - GRACE: Reinforcement Learning for Grounded Response and Abstention under Contextual Evidence [9.80421132842862]
Retrieval-Augmented Generation (RAG)は、外部知識を統合してLarge Language Models (LLM)を強化する
RAGは、明確な根拠のない正しい答えを提供することと、検索された文脈が不十分な場合に製造された応答を生成するという2つの重大な欠陥に感受性がある。
本稿では,両方の欠陥を同時に軽減する強化学習フレームワークGRACEを提案する。
論文 参考訳(メタデータ) (2026-01-08T02:47:33Z) - ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering [54.72902502486611]
ReAG(Reasoning-Augmented Multimodal RAG)は、粗い部分ときめ細かい部分の検索と、無関係な通路をフィルタリングする批評家モデルを組み合わせた手法である。
ReAGは従来の手法よりも優れており、解答精度が向上し、検索された証拠に根ざした解釈可能な推論を提供する。
論文 参考訳(メタデータ) (2025-11-27T19:01:02Z) - Look As You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning [55.232400251303794]
Look As You Think (LAT)は、モデルをトレーニングし、一貫した帰属性を持った検証可能な推論パスを生成するための強化学習フレームワークである。
LATはシングルイメージとマルチイメージの両方でバニラモデルを一貫して改善し、平均ゲインは8.23%、IoU@0.5では47.0%となる。
論文 参考訳(メタデータ) (2025-11-15T02:50:23Z) - VeriCite: Towards Reliable Citations in Retrieval-Augmented Generation via Rigorous Verification [107.75781898355562]
証拠を厳格に検証し,回答の帰属性を高めるために設計された,VeriCiteと呼ばれる新しいフレームワークを紹介する。
我々は,5つのオープンソースLCMと4つのデータセットを対象とした実験を行い,VeriCiteが回答の正しさを維持しつつ,引用品質を大幅に向上できることを実証した。
論文 参考訳(メタデータ) (2025-10-13T13:38:54Z) - DiffusionRet: Generative Text-Video Retrieval with Diffusion Model [56.03464169048182]
既存のテキストビデオ検索ソリューションは、条件付き可能性、すなわちp(candidates|query)の最大化に焦点を当てている。
我々は、このタスクを生成的視点から創造的に取り組み、テキストとビデオの相関関係を共同確率p(candidates,query)としてモデル化する。
これは拡散に基づくテキストビデオ検索フレームワーク(DiffusionRet)によって実現され、ノイズから徐々に関節分布を生成するプロセスとして検索タスクをモデル化する。
論文 参考訳(メタデータ) (2023-03-17T10:07:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。