論文の概要: Layers, Sinks, and Scaling: Adaptive Evidence Selection for Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2609.16795v1
- Date: Tue, 15 Sep 2026 08:02:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.398912
- Title: Layers, Sinks, and Scaling: Adaptive Evidence Selection for Multimodal Large Language Models
- Title(参考訳): レイヤ,シンク,スケーリング:マルチモーダル大言語モデルの適応的エビデンス選択
- Abstract要約: マルチモーダル大言語モデル(MLLM)は、画像からの視覚的証拠と外部ソースから取得した事実を組み合わせることで、知識集約的な視覚的疑問に答えることができる。
MLLMは、両方のモダリティにおいて関連する証拠を見落とし、正しい回答に必要な文章や視覚領域に弱い参加をすることができる。
近年の取り組みでは、検索したテキストをハイライトし、生成前の視覚領域をマークすることでこの問題に対処しているが、固定されたワンショットポリシーを適用している。
本稿では,アダプティブアロケーション(Adaptive Relevance-Guided Evidence Allocation, AREA)について述べる。
- 参考スコア(独自算出の注目度): 17.809800994999225
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) can answer knowledge-intensive visual questions by combining visual evidence from images with facts retrieved from external sources. However, MLLMs may overlook relevant evidence in both modalities, attending weakly to the textual sentences or visual regions needed for the correct answer. Recent efforts address this by highlighting retrieved text and marking visual regions before generation, but apply a fixed, one-shot policy that cannot adapt to three sources of variation: whether highlighting is necessary, how much evidence different examples require, and when different textual evidence becomes relevant as the answer unfolds. We introduce Adaptive Relevance-guided Evidence Allocation (AREA), a training-free inference-time method that formulates evidence highlighting as adaptive allocation. AREA generates a single probe token to read visual and textual relevance from fixed backbone layers, then makes three decisions: i) whether to intervene (controlled by natural attention coverage and visual sink contamination), ii) how much evidence to expose (determined by relevance entropy), and iii) when to refresh text during generation (triggered by causal context-attention peaks). Across four KB-VQA and seven standard multimodal benchmarks with nine frozen MLLM checkpoints, establishes the best performance among training-free highlighting methods.
- Abstract(参考訳): マルチモーダル大言語モデル(MLLM)は、画像からの視覚的証拠と外部ソースから取得した事実を組み合わせることで、知識集約的な視覚的疑問に答えることができる。
しかし、MLLMは両方のモダリティにおいて関連する証拠を見落とし、正しい答えに必要な文章や視覚領域に弱い参加をすることができる。
近年の取り組みでは、検索したテキストをハイライトし、生成前に視覚領域をマークすることでこの問題に対処するが、3つの変化源に適応できない固定されたワンショットポリシーを適用している。
本稿では,アダプティブアロケーション(Adaptive Relevance-Guided Evidence Allocation, AREA)について述べる。
AREAは、固定されたバックボーン層から視覚的およびテキスト的関連性を読み取るために単一のプローブトークンを生成し、次に3つの決定を行う。
一 介入するか否か(自然の注意力及び視覚的シンク汚染により管理されていること。)
二 暴露する証拠の量(関連エントロピーによる決定)及び
三 世代ごとにテキストを更新する時(因果的文脈意図のピークによってトリガーされるとき。)
4つのKB-VQAと7つの標準マルチモーダルベンチマークに9つのフリーズされたMLLMチェックポイントがあり、トレーニング不要のハイライト手法の中で最高のパフォーマンスを確立している。
関連論文リスト
- Look Twice: Training-Free Evidence Highlighting in Multimodal Large Language Models [27.14308995992974]
事前訓練されたMLLMがマルチモーダルなエビデンスをどのように利用するかを改善するトレーニング不要な推論時間フレームワークであるLook Twice(LoT)を紹介する。
LoTは、どの視覚領域と検索されたテキスト要素がクエリに関連するかを推定し、このハイライトされたエビデンスに条件付けられた回答を生成する。
複数の知識に基づくVQAベンチマークによる実験では、ゼロショットMLLMよりも一貫した改善が見られた。
論文 参考訳(メタデータ) (2026-04-01T18:00:08Z) - MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering [51.19392014547221]
検索型マルチモーダル文書QAは,視覚的にリッチな文書から複雑なマルチモーダル構造を持つ関連情報を識別し,統合することを目的としている。
現在のアプローチは、サージェントなコンテンツを見渡すクエリに依存しないドキュメント表現に依存しています。
本稿では,クエリ適応生成を導入したMultimodal Adaptive Retrieval-Augmented (MARA)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-01T12:27:40Z) - Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs [17.56537230934894]
Vision-Language Models (VLM)は、Visual-Question-Answering (VQA)ベンチマークで強力なマルチモーダル推論能力を示している。
これらのモデルが、誤解を招くテキストのプロンプトに対して脆弱であることを示し、しばしば矛盾するテキストを支持する明確な視覚的証拠をオーバーライドしている。
論文 参考訳(メタデータ) (2026-01-27T05:04:38Z) - DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection [6.225860651499494]
多モーダル偽ニュース検出は、敵対的誤報の軽減に不可欠である。
進化的,エビデンス駆動推論パラダイムに基づくフレームワークであるDIVER(Dynamic Iterative Visual Evidence Reasoning)を提案する。
Weibo、Weibo21、GossipCopの実験では、DIVERは最先端のベースラインを平均2.72%上回っている。
論文 参考訳(メタデータ) (2026-01-12T04:01:33Z) - ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering [54.72902502486611]
ReAG(Reasoning-Augmented Multimodal RAG)は、粗い部分ときめ細かい部分の検索と、無関係な通路をフィルタリングする批評家モデルを組み合わせた手法である。
ReAGは従来の手法よりも優れており、解答精度が向上し、検索された証拠に根ざした解釈可能な推論を提供する。
論文 参考訳(メタデータ) (2025-11-27T19:01:02Z) - MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering [44.41273615523289]
マルチモーダルソース属性システムを評価するための最初のベンチマークであるMAVISを紹介する。
我々のデータセットは157Kの視覚的QAインスタンスで構成されており、各回答にはマルチモーダル文書を参照したファクトレベルの引用が注釈付けされている。
本研究では,情報性,接地性,流感の3次元に沿って細粒度自動測定値を作成し,人間の判断と強い相関関係を示す。
論文 参考訳(メタデータ) (2025-11-15T10:14:59Z) - Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering [60.062194349648195]
Document Visual Question Answering (DocVQA)は、長いマルチモーダル文書の処理において2つの課題に直面している。
現在の文書検索拡張生成法(DocRAG)はテキスト中心のアプローチによって制限されている。
MMDocRAGは,多ページのクロスモーダルエビデンスチェーンを持つ4,055のエキスパートアノテーション付きQAペアを特徴とする総合ベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T09:52:57Z) - VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought [51.43082554363725]
textbfVLM-R$3$ (textbfVisual textbfLanguage textbfModel with textbfRegion textbfRecognition and textbfReasoning) はMLLMに付加的な視覚的証拠が必要な場合にエフェクトを決定する機能を提供するフレームワークである。
MathVista、ScienceQA、その他のベンチマークの実験は、VLM-R$3$が新しいものを設定することを示している
論文 参考訳(メタデータ) (2025-05-22T03:50:13Z) - MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs [61.56904387052982]
本稿では,マルチコンテキストの視覚的グラウンド化という新しい視覚的グラウンド化タスクを提案する。
オープンなテキストプロンプトに基づいて、複数の画像にまたがる関心のインスタンスをローカライズすることを目的としている。
我々は20以上の最先端MLLMと基盤モデルをベンチマークし、潜在的にマルチコンテキストの視覚的グラウンド化機能を有する。
論文 参考訳(メタデータ) (2024-10-16T07:52:57Z) - Multimodal Misinformation Detection using Large Vision-Language Models [7.505532091249881]
大規模言語モデル(LLM)は、様々なタスクにおいて顕著なパフォーマンスを示している。
誤情報検出の一部として証拠検索を考えるアプローチはほとんどない。
マルチモーダルエビデンス検索のための新しい手法を提案する。
論文 参考訳(メタデータ) (2024-07-19T13:57:11Z) - Debiasing Multimodal Large Language Models via Penalization of Language Priors [38.97645845493758]
MLLM(Multimodal Large Language Models)は、コンピュータビジョンや自然言語処理において欠かせないツールとなっている。
生成されたコンテンツは、入力画像よりも、基礎となるLarge Language Models (LLMs) の本質的な先行性によって駆動されることが多い。
本稿では、これらのバイアスを補正し、視覚情報に対するモデルの焦点をリダイレクトするための、単純でトレーニングのない2つの戦略を提案する。
論文 参考訳(メタデータ) (2024-03-08T12:35:07Z) - Contextual Object Detection with Multimodal Large Language Models [66.15566719178327]
本稿では,コンテキストオブジェクト検出の新たな研究課題について紹介する。
言語クローゼテスト,視覚キャプション,質問応答の3つの代表的なシナリオについて検討した。
本稿では、視覚的コンテキストのエンドツーエンドの微分可能なモデリングが可能な統合マルチモーダルモデルContextDETを提案する。
論文 参考訳(メタデータ) (2023-05-29T17:50:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。