論文の概要: PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers
- arxiv url: http://arxiv.org/abs/2604.11307v1
- Date: Mon, 13 Apr 2026 11:07:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.491367
- Title: PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers
- Title(参考訳): PaperScope: 大規模科学論文を対象としたエージェントディープリサーチのためのマルチモーダルマルチドキュメントベンチマーク
- Authors: Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou,
- Abstract要約: 本稿ではエージェントディープリサーチのベンチマークであるPaperScopeを紹介する。
3年にわたる2000以上のAI論文の知識グラフ上に構築されている。
意味的に関連するキー情報ノードを統合し、最適化されたランダムウォーク記事セレクタを使用する。
- 参考スコア(独自算出の注目度): 52.97586643334384
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Leveraging Multi-modal Large Language Models (MLLMs) to accelerate frontier scientific research is promising, yet how to rigorously evaluate such systems remains unclear. Existing benchmarks mainly focus on single-document understanding, whereas real scientific workflows require integrating evidence from multiple papers, including their text, tables, and figures. As a result, multi-modal, multi-document scientific reasoning remains underexplored and lacks systematic evaluation. To address this gap, we introduce PaperScope, a multi-modal multi-document benchmark designed for agentic deep research. PaperScope presents three advantages: (1) Structured scientific grounding. It is built on a knowledge graph of over 2,000 AI papers spanning three years, providing a structured foundation for research-oriented queries. (2) Semantically dense evidence construction. It integrates semantically related key information nodes and employs optimized random-walk article selector to sample thematically coherent paper sets, thereby ensuring adequate semantic density and task complexity. (3) Multi-task evaluation of scientific reasoning. It contains over 2,000 QA pairs across reasoning, retrieval, summarization, and problem solving, enabling evaluation of multi-step scientific reasoning. Experimental results show that even advanced systems such as OpenAI Deep Research and Tongyi Deep Research achieve limited scores on PaperScope, highlighting the difficulty of long-context retrieval and deep multi-source reasoning. PaperScope thus provides a rigorous benchmark alongside a scalable pipeline for constructing large-scale multi-modal, multi-source deep research datasets.
- Abstract(参考訳): 先進的な科学研究を加速するためにMLLM(Multi-modal Large Language Models)を活用することは有望である。
既存のベンチマークは主に単一文書の理解に焦点を当てているが、実際の科学的ワークフローでは、テキスト、表、数字を含む複数の論文から証拠を統合する必要がある。
その結果,マルチモーダル・マルチドキュメントの科学的推論は未熟であり,体系的評価が欠如している。
このギャップに対処するために,エージェントディープリサーチ用に設計されたマルチモーダルマルチドキュメントベンチマークであるPaperScopeを紹介する。
PaperScopeには3つの利点がある。
3年間にわたる2000以上のAI論文の知識グラフ上に構築されており、研究指向のクエリのための構造化された基盤を提供する。
2) セマンティックに密集した証拠構築。
セマンティック関連キー情報ノードを統合し、最適化されたランダムウォーク記事セレクタを使用して、セマンティックコヒーレントな紙集合をサンプリングし、適切なセマンティック密度とタスク複雑性を確保する。
(3)科学的推論のマルチタスク評価
推論、検索、要約、問題解決にまたがる2000以上のQAペアを含み、多段階の科学的推論の評価を可能にする。
実験の結果,OpenAI Deep Research や Tongyi Deep Research といった先進的なシステムでも PaperScope のスコアは限定的であり,長文検索の難しさと深層多元推論の難しさを浮き彫りにした。
このようにPaperScopeは、大規模マルチモーダルでマルチソースのディープリサーチデータセットを構築するためのスケーラブルなパイプラインとともに、厳密なベンチマークを提供する。
関連論文リスト
- Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework [82.66443886385125]
ペーパーサークル(Paper Circle)は、学術文献の発見、評価、整理、理解に必要な労力を減らすために設計された発見・分析システムである。
1)複数のソースからのオフラインおよびオンライン検索を統合するディスカバリパイプライン,多エージェントスコアリング,多様性対応ランキング,構造化アウトプット,2)個々の論文を概念,メソッド,数値などの型付きノードで構造化された知識グラフに変換する分析パイプライン,の2つの補完パイプラインで構成されている。
論文 参考訳(メタデータ) (2026-04-07T17:59:58Z) - EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents [38.845762856105175]
簡単な研究をインスタンス化するエピソードなマルチターンベンチマークであるEpiBenchを紹介する。
調査タスクが与えられた場合、エージェントは複数のターンで論文をナビゲートし、数字や表から証拠を整理し、メモリに蓄積された証拠を使って客観的な疑問に答えなければならない。
実験の結果,主モデルの精度は29.23%程度であり,改善の余地があることが示唆された。
論文 参考訳(メタデータ) (2026-04-07T07:58:55Z) - SciMDR: Benchmarking and Advancing Scientific Multimodal Document Reasoning [59.93568326270048]
集中セグメント上での忠実で孤立したQAペアを生成する合成合成フレームワークを提案する。
クロスモーダル理解のための大規模トレーニングデータセットであるSciMDRを構築した。
実験により、SciMDRモデルは複数の科学的QAベンチマークで大幅に改善されていることが示された。
論文 参考訳(メタデータ) (2026-03-12T17:57:52Z) - Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research [31.973886754355547]
Doc-Researcherは、テキストのみ、ビジョンのみ、ハイブリッドパラダイム間のギャップを埋める統一システムである。
マルチモーダル,マルチホップ,マルチドキュメント,マルチターンディープリサーチの最初のベンチマークであるM4DocBenchを紹介する。
Doc-Researcherの精度は50.6%で、最先端のベースラインよりも3.4倍高い。
論文 参考訳(メタデータ) (2025-10-24T16:07:54Z) - Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines [63.22096609916707]
M$2$RAG(Multi-modal Retrieval Augmented Multi-modal Generation)は、基礎モデルのマルチモーダルWebコンテンツ処理を可能にする新しいタスクである。
潜在的な影響にもかかわらず、M$2$RAGは、包括的な分析と高品質なデータリソースを欠いている。
論文 参考訳(メタデータ) (2024-11-25T13:20:19Z) - M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models [27.910693214922052]
基礎モデル評価のためのマルチモーダル・マルチドキュメント科学質問応答ベンチマークであるM3SciQAを紹介する。
M3SciQAは、70の自然言語処理用紙クラスタにまたがる1,452のエキスパート注釈付き質問からなる。
以上の結果から, 現状の基盤モデルは, マルチモーダル情報検索や複数の学術文献における推論において, 人的知識に比べ, 依然として著しく劣っていることが示唆された。
論文 参考訳(メタデータ) (2024-11-06T17:52:01Z) - SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers [43.18330795060871]
SPIQAは、科学研究論文の文脈内で複雑な図形や表を解釈するために設計されたデータセットである。
データセット作成には自動および手動のキュレーションを使用します。
SPIQAは270Kの質問をトレーニング、検証、3つの異なる評価分割に分割する。
論文 参考訳(メタデータ) (2024-07-12T16:37:59Z) - UniDoc: A Universal Large Multimodal Model for Simultaneous Text
Detection, Recognition, Spotting and Understanding [93.92313947913831]
テキスト検出と認識機能を備えた新しいマルチモーダルモデルUniDocを紹介する。
我々の知る限りでは、これはテキストの検出、認識、スポッティング、理解を同時に行うことができる最初の大規模マルチモーダルモデルである。
論文 参考訳(メタデータ) (2023-08-19T17:32:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。