論文の概要: CLIMB: Confidence-Guided Complementary Evidence for Multimodal Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2610.03421v1
- Date: Fri, 02 Oct 2026 15:09:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.435348
- Title: CLIMB: Confidence-Guided Complementary Evidence for Multimodal Retrieval-Augmented Generation
- Title(参考訳): CLIMB:Multimodal Retrieval-Augmented Generationのための信頼性ガイド付き補完エビデンス
- Abstract要約: MLLM(Multimodal large language model)は、視覚的推論能力の強いモデルである。
知識集約的な視覚的質問応答は、しばしば、画像とモデルのパラメトリック知識を超えた外部のテキストによる証拠を必要とする。
マルチモーダルRAGのためのトレーニング不要な推論時間フレームワークである textit CLIMB を提案する。
- 参考スコア(独自算出の注目度): 47.0324702589979
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) have shown strong visual reasoning abilities, but knowledge-intensive visual question answering often requires external textual evidence beyond the image and the model's parametric knowledge. Existing multimodal RAG systems commonly rely on Top-$K$ retrieval or reranking, which may return redundant passages and provide limited control over whether an answer update is sufficiently supported by the retrieved evidence. We propose \textit{CLIMB}, a training-free inference-time framework for multimodal RAG. CLIMB first constructs a compact complementary evidence pool using an MMR-style objective that balances query relevance and passage-level redundancy. It then performs confidence-controlled refinement within this fixed pool: an R/E/C critic scores passages by relevance, evidence specificity, and cross-modal alignment, while an evidence-grounded confidence estimator accepts an updated answer only when the estimated confidence increases. This design provides a simple stopping criterion and reduces unnecessary refinement without modifying the underlying retriever or MLLM. Experiments on Encyclopedic-VQA and InfoSeek show that CLIMB consistently improves over retrieval-augmented multimodal baselines. Ablations further indicate that complementary pooling, critic-based scoring, and iterative confidence-controlled refinement each contribute to the final performance.
- Abstract(参考訳): マルチモーダルな大言語モデル(MLLM)は、強力な視覚的推論能力を示しているが、知識集約的な視覚的質問応答は、画像やモデルのパラメトリック知識を超えた外部のテキストによる証拠を必要とすることが多い。
既存のマルチモーダルRAGシステムは、通常、Top-K$検索または再ランクに依存しており、冗長なパスを返却し、検索された証拠によって回答更新が十分にサポートされているかどうかを限定的に制御することができる。
マルチモーダルRAGのためのトレーニング不要な推論時間フレームワークである「textit{CLIMB}」を提案する。
CLIMBは、クエリ関連性とパスレベルの冗長性のバランスをとるMMRスタイルの目的を用いて、まず、コンパクトな補完エビデンスプールを構築する。
R/E/C批評家は、関連性、エビデンス特異性、およびクロスモーダルアライメントによってパスをスコアし、エビデンス基底の信頼推定器は、推定された信頼度が増加する場合にのみ更新された回答を受け入れる。
この設計は、単純な停止基準を提供し、基盤となるレトリバーやMLLMを変更することなく不要な改善を減らす。
Encyclopedic-VQAとInfoSeekの実験では、CLIMBは検索強化マルチモーダルベースラインよりも一貫して改善されている。
さらにアブレーションは、補完的なプーリング、批判に基づくスコアリング、反復的な信頼制御された洗練が、それぞれ最終的なパフォーマンスに寄与していることを示している。
関連論文リスト
- Reason What Matters: Retrieval-Grounded Reasoning for Universal Multimodal Embeddings [18.705254311226565]
Retrieval-Aware Self-Distillation (RASD) は、入力支援された証拠から特権化されたガイダンスを構築し、正の項目を検索された強陰性と区別する。
検索適応推論(RAI)は、部分CoTの残りの検索ユーティリティを推定するために、検索信頼ヘッドを使用する。
ReWAMは、競合する明示的CoT UME法の推論スループットを最大5倍にし、最先端の検索性能を実現する。
論文 参考訳(メタデータ) (2026-09-14T09:48:05Z) - Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails [6.708653593551749]
我々は,MLLMの継続的な適応が,その答えだけでなく,視覚的,テキスト的,OCR,チャート,文書的エビデンスをいかに活用するかを考察する。
モデルが異なるあるいは根拠のないエビデンスチャネルに静かに移行している間に、解答精度を保ちながら、エンフィデントエビデンス利用の忘れを識別する。
我々は,リプレイ不要な依存制約付き連続学習フレームワークであるtextscRCLを提案する。
論文 参考訳(メタデータ) (2026-07-02T10:50:37Z) - MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering [73.47440561592556]
トレーニング不要な属性生成手法であるMultAttnAttribを紹介する。
MultAttnAttribは、様々な属性生成方法よりも一貫して優れていることを示す。
提案手法は直接推論遅延の最大7分の1の属性を生成する。
論文 参考訳(メタデータ) (2026-07-01T19:29:19Z) - V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval [32.5242219186118]
本稿では,視覚検査に基づくエージェント推論プロセスとしてマルチモーダル検索を再構成するエビデンス駆動検索フレームワークであるV-Retrverを提案する。
V-Retrverは、MLLMが外部視覚ツールを介して推論中に視覚的エビデンスを選択的に取得し、仮説生成と対象の視覚的検証を交互に行うマルチモーダル・インターリーブド推論プロセスを実行することを可能にする。
論文 参考訳(メタデータ) (2026-02-05T18:59:21Z) - Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains [16.357026482329232]
マルチモーダルLSMは、流動的で信頼性の低い推論を生成する。
SR-MCRは軽量でラベルのないフレームワークであり、推論を整合させる。
SR-MCRは、幅広いビジュアルベンチマークで解答精度と推論コヒーレンスを改善する。
論文 参考訳(メタデータ) (2025-12-27T10:14:14Z) - Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models [4.064135211977999]
大規模言語モデル (LLMs) と視覚言語モデル (LVLMs) は複雑で多段階のクロスモーダルな常識推論タスクに苦しむ。
我々は,LVLMの共通感覚推論能力を高める新しいアプローチであるコヒーレント・マルチモーダル推論フレームワーク(CMRF)を提案する。
CMRFは複雑なクエリを分解し、ステップバイステップの推論を生成し、エラーを自己修正することで人間の問題解決を模倣する。
論文 参考訳(メタデータ) (2025-08-04T20:33:58Z) - ConCISE: Confidence-guided Compression in Step-by-step Efficient Reasoning [64.93140713419561]
大型推論モデル (LRM) は、Chain-of-Thought (CoT) による複雑な推論タスクで強く機能するが、しばしば冗長な出力に悩まされる。
既存の微調整ベースの圧縮手法は、ポストホックプルーニングを動作させるか、コヒーレンスを推論する破壊を危険にさらすか、サンプリングベースの選択に依存するかのいずれかである。
ConCISEは、簡潔な推論連鎖を生成するために設計されたフレームワークであり、信頼注入を統合して推論の信頼性を高める。
論文 参考訳(メタデータ) (2025-05-08T01:40:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。