論文の概要: Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence
- arxiv url: http://arxiv.org/abs/2605.30698v1
- Date: Fri, 29 May 2026 00:45:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.314198
- Title: Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence
- Title(参考訳): アグリゲーションの前に見る:視覚的エビデンスによるマルチエージェント合意の調整
- Abstract要約: 視覚言語モデル(VLM)は視覚的質問応答(VQA)において高い性能を達成している
個々人の幻覚や盲点を緩和するために、多エージェントコラボレーションによる多様な視点を集約することが、有望なパラダイムとして浮上した。
本稿では,複数のVLMエージェントをコーディネートするためのトレーニング不要なエビデンス中心フレームワークを提案する。
- 参考スコア(独自算出の注目度): 13.363363690089407
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) have achieved strong performance on visual question answering (VQA). To mitigate individual hallucinations and blind spots, aggregating diverse perspectives via multi-agent collaboration has emerged as a promising paradigm. While this approach has shown great success in textual QA, its potential in the multimodal domain remains under-explored. Existing multi-agent VQA methods predominantly adapt text-centric protocols, focusing on textual discussions while ignoring the alignment of visual information. In this work, we reveal a key insight: answer-level agreement is insufficient for reliable multi-agent VQA; \textit{aligned visual evidence} -- shared support from the image regions agents rely on -- is essential for trustworthy consensus. To leverage this insight, we propose EAGLE (\textbf{E}vidence-\textbf{A}ligned \textbf{G}rounded mu\textbf{L}ti-agent r\textbf{E}asoning), a training-free evidence-centered framework for coordinating multiple VLM agents. EAGLE explicitly exposes each agent's grounding regions as visual evidence, enables mutual verification over the evidence, and uses evidence consistency to guide final decision-making. Experiments on six VQA benchmarks show that EAGLE achieves best average performance across domains while remaining lightweight, interpretable, and practical for deployment.
- Abstract(参考訳): 視覚言語モデル (VLM) は視覚的質問応答 (VQA) において高い性能を達成している。
個々人の幻覚や盲点を緩和するために、多エージェントコラボレーションによる多様な視点を集約することが、有望なパラダイムとして浮上した。
このアプローチはテキストQAにおいて大きな成功を収めてきたが、マルチモーダル領域におけるそのポテンシャルはいまだ探索されていない。
既存のマルチエージェントVQA手法は、主にテキスト中心のプロトコルを適応し、視覚情報のアライメントを無視しながらテキストによる議論に焦点を当てている。
回答レベル合意は信頼性の高いマルチエージェントVQAには不十分である; \textit{aligned visual evidence} -- イメージ領域エージェントが依存するイメージ領域からの共有サポートは、信頼できるコンセンサスには不可欠である。
この知見を活用するために、複数のVLMエージェントをコーディネートするためのトレーニング不要なエビデンス中心のフレームワークであるEAGLE (\textbf{E}vidence-\textbf{A}ligned \textbf{G}rounded mu\textbf{L}ti-agent r\textbf{E}asoning)を提案する。
EAGLEは、各エージェントの接地領域を視覚的証拠として明示的に公開し、証拠の相互検証を可能にし、証拠の整合性を利用して最終的な意思決定を導く。
6つのVQAベンチマークの実験では、EAGLEは軽量で解釈可能で、デプロイに実用的でありながら、ドメイン間で最高の平均パフォーマンスを達成している。
関連論文リスト
- UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery [69.87589293875112]
無人航空機(UAV)は、タスク関連ターゲットのローカライズに視覚的な接地機能に依存している。
既存の参照式理解ベンチマークとメソッドは、主にテキストのみのクエリと単一オブジェクトの出力に基づいて構築されている。
本稿では,一般的なUAV参照タスクであるemphUniversal Referringを導入する。
論文 参考訳(メタデータ) (2026-07-09T09:09:31Z) - VILLAIN at AVerImaTeC: Verifying Image-Text Claims via Multi-Agent Collaboration [10.712719361607753]
VILLAINは画像テキストのクレームを検証するマルチモーダルなファクトチェックシステムである。
私たちのシステムは、すべての評価指標でトップボードにランクインしました。
論文 参考訳(メタデータ) (2026-02-04T14:12:55Z) - Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding [49.26132236798123]
視覚言語モデル(VLM)は、文書理解における主要なアプローチになりつつある。
本稿では,粗いプロセスにおいて,検索者と4つの協調エージェントを編成するマルチエージェントフレームワークSLEUTHを提案する。
このフレームワークは、検索したページ内の重要なテキストおよび視覚的手がかりを特定し、テーブルやチャートなどの健全な視覚的エビデンスをフィルタし、クエリを分析して推論戦略を考案する。
論文 参考訳(メタデータ) (2025-11-28T03:09:40Z) - ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering [54.72902502486611]
ReAG(Reasoning-Augmented Multimodal RAG)は、粗い部分ときめ細かい部分の検索と、無関係な通路をフィルタリングする批評家モデルを組み合わせた手法である。
ReAGは従来の手法よりも優れており、解答精度が向上し、検索された証拠に根ざした解釈可能な推論を提供する。
論文 参考訳(メタデータ) (2025-11-27T19:01:02Z) - ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answering [30.65960340061612]
プロトタイプに基づくモデリングは意味論的意味のある領域における予測を基礎にすることで解釈可能性を示す。
本稿では,推論アンカーとして機能する質問認識型プロトタイプを学習する統合フレームワークであるProtoVQAを紹介する。
提案手法は,視覚言語的アライメントスコア (VLAS) を用いて, モデルに付随する領域が地中真実とどのように一致しているかを測るものである。
論文 参考訳(メタデータ) (2025-09-20T13:12:08Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - Describe Anything Model for Visual Question Answering on Text-rich Images [7.618388911738171]
DAMの領域認識機能を利用するフレームワークであるDAM-QAを,テキストリッチな視覚質問応答問題に適用する。
我々のアプローチは、DocVQAで注目すべき7以上のポイントゲインで、ベースラインDAMを一貫して上回ります。
その結果、効率的な使用法と統合戦略を組み合わせれば、テキストリッチで広範なVQAタスクのためのDAMライクなモデルの可能性が浮き彫りになる。
論文 参考訳(メタデータ) (2025-07-16T17:28:19Z) - Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering [60.062194349648195]
Document Visual Question Answering (DocVQA)は、長いマルチモーダル文書の処理において2つの課題に直面している。
現在の文書検索拡張生成法(DocRAG)はテキスト中心のアプローチによって制限されている。
MMDocRAGは,多ページのクロスモーダルエビデンスチェーンを持つ4,055のエキスパートアノテーション付きQAペアを特徴とする総合ベンチマークである。
論文 参考訳(メタデータ) (2025-05-22T09:52:57Z) - VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation [100.06122876025063]
本稿では,マルチドキュメント設定でQAシステムを評価するために設計された,初の総合ベンチマークであるVisDoMBenchを紹介する。
視覚とテキストのRAGを同時に利用する新しいマルチモーダル検索拡張生成(RAG)手法であるVisDoMRAGを提案する。
論文 参考訳(メタデータ) (2024-12-14T06:24:55Z) - Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering [47.668572102657684]
本稿では,視覚言語モデル(VLM)の能力を高めるために,LLM(Large Language Models)の拡張的知識を活用することで,新しいマルチエージェントコラボレーションフレームワークを導入する。
論文 参考訳(メタデータ) (2023-11-29T03:10:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。