論文の概要: ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence
- arxiv url: http://arxiv.org/abs/2605.13034v1
- Date: Wed, 13 May 2026 05:39:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.832202
- Title: ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence
- Title(参考訳): ViDR:マルチモーダル・ディープ・リサーチ・レポートをソース・ビジュアル・エビデンスに
- Authors: Zhuofan Shi, Peilun Jia, Baoqin Sun, Haiyang Shen, Sixiong Xie, Yun Ma, Xiang Jing,
- Abstract要約: 情報源の長文レポートを基盤とするフレームワークであるViDRを提示する。
ViDRは、ソースフィギュアを検索可能、解釈可能、未確認、検証可能なエビデンスオブジェクトとして扱う。
また,深部研究報告における視覚的エビデンス評価のベンチマークであるMMR Bench+についても紹介する。
- 参考スコア(独自算出の注目度): 1.6789785654745923
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent deep research systems have improved the ability of large language models to produce long, grounded reports through iterative retrieval and reasoning. However, most text-centered systems rely mainly on textual evidence, while multimodal systems often retrieve images only weakly or generate charts themselves, leaving source figures underused as evidence. We present ViDR, a multimodal deep research framework that grounds long-form reports in source figures. ViDR treats source figures as retrievable, interpretable, routable, and verifiable evidence objects, while still generating analytical charts when needed. It builds an evidence-indexed outline linking claims to textual and visual evidence, refines noisy web images into source-figure evidence atoms through context-aware filtering, outline-aware reranking, and VLM-based visual analysis, and generates each section with section-specific evidence. ViDR further validates visual references to reduce hallucinated or misplaced figures. We also introduce MMR Bench+, a benchmark for evaluating visual evidence use in deep research reports, covering source-figure retrieval, placement, interpretation, verifiability, and analytical chart generation. Experiments show that ViDR improves overall report quality, source-figure integration, and verifiability over strong commercial and open-source baselines. These results suggest that source visual evidence is important for multimodal deep research, as it strengthens evidential grounding, visual support, and report verifiability.
- Abstract(参考訳): 近年のディープ・リサーチ・システムは、反復的検索と推論により、大規模言語モデルによる長い基礎的なレポート作成能力を改善している。
しかし、ほとんどのテキスト中心システムは主にテキストによる証拠に依存しているが、マルチモーダルシステムは画像のみを弱く検索したり、グラフ自体を生成したりすることが多く、情報源の数字は証拠として過小評価されている。
情報源の長文レポートを基盤としたマルチモーダルディープリサーチフレームワークであるViDRを提案する。
ViDRは、ソースフィギュアを検索可能、解釈可能、不確実、検証可能なエビデンスオブジェクトとして扱い、必要な時に分析チャートを生成する。
クレームとテキストと視覚的エビデンスをリンクするエビデンス付きアウトラインを構築し、コンテキスト対応のフィルタリング、アウトライン対応のリグレード、VLMベースのビジュアル分析を通じて、ノイズの多いWebイメージをソースフィギュアのエビデンス原子に洗練し、セクション固有のエビデンスで各セクションを生成する。
ViDRはさらに視覚的参照を検証し、幻影や誤配置を減少させる。
また,MMR Bench+は深層研究報告における視覚的エビデンスの評価のためのベンチマークであり,情報源の検索,配置,解釈,妥当性,分析チャート生成について紹介する。
実験によると、ViDRは、強力な商用およびオープンソースベースラインよりも、全体的なレポート品質、ソースフィギュア統合、検証性を改善している。
以上の結果から,マルチモーダルディープリサーチにおいては,根拠的根拠,視覚的支援,報告の妥当性を高めるため,情報源の視覚的証拠が重要であることが示唆された。
関連論文リスト
- MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents [37.98503734345155]
MMDR-Bench(MMDR-Bench)は、21のドメインにまたがる140の専門的なタスクのベンチマークである。
MMDR-Benchは以前の設定と比較して、明確な証拠を用いたレポートスタイルの合成を強調している。
報告品質のためのF-LLM適応評価(FLAE)、引用的根拠のアライメントのためのTRACE(Trustworthy Retrieval-Aligned Citation Evaluation)、テキスト・視覚的整合性のためのMOSAIC(Multimodal Support-Aligned Integrity Check)を提案する。
論文 参考訳(メタデータ) (2026-01-18T10:41:33Z) - DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection [6.225860651499494]
多モーダル偽ニュース検出は、敵対的誤報の軽減に不可欠である。
進化的,エビデンス駆動推論パラダイムに基づくフレームワークであるDIVER(Dynamic Iterative Visual Evidence Reasoning)を提案する。
Weibo、Weibo21、GossipCopの実験では、DIVERは最先端のベースラインを平均2.72%上回っている。
論文 参考訳(メタデータ) (2026-01-12T04:01:33Z) - VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation [64.82775032985485]
視覚検索強化世代(VRAG)は視覚言語モデル(VLM)を外的視覚知識で拡張し、基礎推論を行い幻覚を減らす。
しかし、現在のVRAGシステムは、複数の画像に対して確実な認識と証拠の統合に失敗し、根拠の弱さと誤った結論に繋がることが多い。
EVisRAGは,エビデンス誘導型マルチイメージで推論を学習し,この問題に対処するエンド・ツー・エンドのフレームワークである。
論文 参考訳(メタデータ) (2025-10-10T13:34:23Z) - WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research [73.58638285105971]
本稿では,AIエージェントが膨大なWebスケール情報を洞察に富むレポートに合成しなければならない複雑な課題であるtextbfopen-ended Deep Research (OEDR) に取り組む。
人間の研究プロセスをエミュレートする新しいデュアルエージェントフレームワークである textbfWebWeaver を紹介する。
私たちのフレームワークは、DeepResearch Bench、DeepConsult、DeepResearchGymなど、主要なOEDRベンチマークにまたがる最先端の新たなベンチマークを確立しています。
論文 参考訳(メタデータ) (2025-09-16T17:57:21Z) - Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework [22.366142327629486]
マルチモーダルDeepResearcherは、タスクを調査、文書化、計画、マルチモーダルレポート生成という4つの段階に分解する。
ベースライン方式よりも82%の総合的な勝利率を達成する。
論文 参考訳(メタデータ) (2025-06-03T05:18:19Z) - Unstructured Evidence Attribution for Long Context Query Focused Summarization [53.08341620504465]
固定粒度の場合よりも、より関連性が高く一貫した証拠を得るために、非構造的(すなわち任意の長さのスパン)な証拠を抽出することを提案する。
既存のシステムが、非構造的証拠をコピーし、適切に引用するのにどのように苦労しているかを示す。
論文 参考訳(メタデータ) (2025-02-20T09:57:42Z) - VISA: Retrieval Augmented Generation with Visual Source Attribution [100.78278689901593]
RAGの既存のアプローチは主に生成されたコンテンツをドキュメントレベルの参照にリンクする。
本稿では,視覚的ソース属性と解答生成を組み合わせた新しい手法として,視覚的ソース属性を用いた検索補助生成(VISA)を提案する。
本手法の有効性を評価するため,ウィキペディアのWebページスクリーンショットをクロールしたWiki-VISAとPubLayNetから派生したPaper-VISAの2つのデータセットを作成した。
論文 参考訳(メタデータ) (2024-12-19T02:17:35Z) - Multimodal Misinformation Detection using Large Vision-Language Models [7.505532091249881]
大規模言語モデル(LLM)は、様々なタスクにおいて顕著なパフォーマンスを示している。
誤情報検出の一部として証拠検索を考えるアプローチはほとんどない。
マルチモーダルエビデンス検索のための新しい手法を提案する。
論文 参考訳(メタデータ) (2024-07-19T13:57:11Z) - RED-DOT: Multimodal Fact-checking via Relevant Evidence Detection [17.107961913114778]
本稿では,各証拠が関連しているかどうかを識別するために,関連証拠検出(RED)モジュールを提案する。
RED-DOTは、VERITEベンチマークの最先端(SotA)を最大33.7%改善した。
RED-DOT は NewsCLIPings+ で SotA を最大3% 上回った。
論文 参考訳(メタデータ) (2023-11-16T14:43:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。