論文の概要: Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities
- arxiv url: http://arxiv.org/abs/2601.21937v1
- Date: Thu, 29 Jan 2026 16:26:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-30 16:22:49.987158
- Title: Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities
- Title(参考訳): Retrieval-Infused Reasoning Sandbox:RetrievalとReasoning能力の分離のためのベンチマーク
- Abstract要約: DeR2(DeR2)は、ドキュメント基底推論を分離する制御されたディープ検索サンドボックスである。
DeR2は、推論から4つのレシエーション(命令のみ、概念のみ、関連のみ、フルセット)を通じてアクセスする証拠を分離する。
さまざまな最先端の基礎モデルに対する実験は、かなりのバリエーションと重要なヘッドルームを明らかにしている。
- 参考スコア(独自算出の注目度): 32.33778290254852
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Despite strong performance on existing benchmarks, it remains unclear whether large language models can reason over genuinely novel scientific information. Most evaluations score end-to-end RAG pipelines, where reasoning is confounded with retrieval and toolchain choices, and the signal is further contaminated by parametric memorization and open-web volatility. We introduce DeR2, a controlled deep-research sandbox that isolates document-grounded reasoning while preserving core difficulties of deep search: multi-step synthesis, denoising, and evidence-based conclusion making. DeR2 decouples evidence access from reasoning via four regimes--Instruction-only, Concepts (gold concepts without documents), Related-only (only relevant documents), and Full-set (relevant documents plus topically related distractors)--yielding interpretable regime gaps that operationalize retrieval loss vs. reasoning loss and enable fine-grained error attribution. To prevent parametric leakage, we apply a two-phase validation that requires parametric failure without evidence while ensuring oracle-concept solvability. To ensure reproducibility, each instance provides a frozen document library (drawn from 2023-2025 theoretical papers) with expert-annotated concepts and validated rationales. Experiments across a diverse set of state-of-the-art foundation models reveal substantial variation and significant headroom: some models exhibit mode-switch fragility, performing worse with the Full-set than with Instruction-only, while others show structural concept misuse, correctly naming concepts but failing to execute them as procedures.
- Abstract(参考訳): 既存のベンチマークの性能は高いが、大きな言語モデルが真に新しい科学的情報を引き継ぐことができるかどうかは不明だ。
ほとんどの評価はエンドツーエンドのRAGパイプラインをスコアし、推論は検索とツールチェーンの選択と組み合わせられ、信号はパラメトリック記憶とオープンウェブのボラティリティによってさらに汚染される。
深層探索の難易度を保ちながら文書的推論を分離する制御された深層検索サンドボックスであるDeR2について紹介する。
DeR2は、命令のみ、概念(文書のない金のコンセプト)、関連するドキュメントのみ)、フルセット(関連ドキュメントとトポロジ関連イントラクタ)の4つの規則による推論からアクセスする証拠を分離する。
パラメトリック・リークを防止するため, オラクル・コンセプタビリティを確保しつつ, 証拠のないパラメトリック・フェールを要求される2相検証を適用した。
再現性を確保するため、各インスタンスは、専門家による注釈付き概念と検証された合理性を備えた凍結文書ライブラリ(2023-2025理論論文から引用)を提供する。
いくつかのモデルはモードスイッチの脆弱さを示し、インストラクションのみよりもフルセットでパフォーマンスが悪く、他のモデルは構造的概念の誤用を示し、概念を正しく命名するが、プロシージャとして実行できない。
関連論文リスト
- Interpreting Object-Dependent Concept Brittleness in Text-to-Image Diffusion Models [105.53190946111586]
我々はこの現象をオブジェクト依存概念の脆さと呼ぶ。
これらの障害を監査し、最小限に修正する、解釈可能性指向のフレームワークを提案する。
複数の拡散バックボーンにまたがるスタイルと属性の故障事例について,提案手法の評価を行った。
論文 参考訳(メタデータ) (2026-09-09T09:07:40Z) - Towards Safer RAG: Only Agents Capable of System 2 Thinking may Access Untrusted Documents [0.0]
Retrieval-Augmented Generation (RAG) は大規模言語モデルの性能を大幅に向上させた。
RAGは、検索された文書の誤報がモデルの最終的な出力に影響を与えるような、知識汚染攻撃に弱い。
我々は,信頼性の低い文書にアクセス可能なシステム2推論能力を持つエージェントにのみ,厳格なセキュリティ原則を提案する。
論文 参考訳(メタデータ) (2026-08-17T21:37:20Z) - DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark [48.84943754804533]
マルチモーダル文書には、テーブル、フィギュア、レイアウトなど、さまざまな要素が含まれている。
現在のアプローチでは、高精度の検索を実現するために、高密度の視覚埋め込みモデルと教師付きリランカを組み合わせるのが一般的である。
本稿では,レイアウトを意識したスパース埋め込み技術による視覚検索を支援するプラグイン・アンド・プレイフレームワークDocRetrieverを提案する。
論文 参考訳(メタデータ) (2026-05-28T14:50:53Z) - AuthTrace: Diagnosing Evidence Construction in Thematically Dense Single-Author Corpora [6.956097396264084]
AuthTraceは,主題的に密集した単一著者コーパスに基づいて構築された診断ベンチマークである。
AuthTraceは明示的な引用されたエビデンス、正確なファンインアノテーション、エビデンスリコール、エビデンス精度、答えの正当性を測定する統一パックレベルのプロトコルを提供する。
論文 参考訳(メタデータ) (2026-05-25T03:10:52Z) - Verifiable Reasoning for LLM-based Generative Recommendation [106.7765000777685]
大規模言語モデル(LLM)における推論は、最近、生成的レコメンデーションの強化に強い可能性を示している。
本稿では,信頼性の高いフィードバックを提供するために,検証と推論をインターリーブする新しいTextbftextitreason-verify-recommendパラダイムを提案する。
4つの実世界のデータセットの実験は、VRecが効率を損なうことなく、推奨の有効性とスケーラビリティを大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-03-08T16:55:45Z) - VAR: Visual Attention Reasoning via Structured Search and Backtracking [49.427842994857635]
構造化された検索としてグラウンドド推論をリキャストするフレームワークであるVisual Attention Reasoningを紹介する。
VARは、推論プロセスを2つの重要な段階に分解する。
我々は、我々の7BモデルであるVAR-7Bが、幻覚と安全性のベンチマークの包括的なスイートに新しい最先端を設定していることを示します。
論文 参考訳(メタデータ) (2025-10-21T13:18:44Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research [73.58638285105971]
本稿では,AIエージェントが膨大なWebスケール情報を洞察に富むレポートに合成しなければならない複雑な課題であるtextbfopen-ended Deep Research (OEDR) に取り組む。
人間の研究プロセスをエミュレートする新しいデュアルエージェントフレームワークである textbfWebWeaver を紹介する。
私たちのフレームワークは、DeepResearch Bench、DeepConsult、DeepResearchGymなど、主要なOEDRベンチマークにまたがる最先端の新たなベンチマークを確立しています。
論文 参考訳(メタデータ) (2025-09-16T17:57:21Z) - CRAVE: A Conflicting Reasoning Approach for Explainable Claim Verification Using LLMs [15.170312674645535]
CRAVE は、説明可能なクレーム VErification に対する Conflicting Reasoning Approach である。
大規模な言語モデルによって推論される矛盾する理性に基づいて、複雑なクレームを検証することができる。
CRAVEは最先端の手法よりもはるかに優れた性能を実現している。
論文 参考訳(メタデータ) (2025-04-21T07:20:31Z) - Learning Refined Document Representations for Dense Retrieval via Deliberate Thinking [58.69615583599489]
Deliberate Thinking based Retriever (Debater) は、段階的な思考プロセスを導入することで文書表現を強化する新しいアプローチである。
Debaterは、いくつかのベンチマークで既存のメソッドよりも大幅に優れています。
論文 参考訳(メタデータ) (2025-02-18T15:56:34Z) - Unsupervised dense retrieval with conterfactual contrastive learning [16.679649921935482]
そこで本研究では,高密度検索モデルの高感度化により,高密度検索モデルのロバスト性を向上させることを提案する。
この文脈での感度を達成するモデルは、クエリとの関連性を決定するドキュメントのキーパスが修正されたときに高いばらつきを示すべきである。
因果関係と反事実分析に動機付け, 一連の反事実正則化手法を提案する。
論文 参考訳(メタデータ) (2024-12-30T07:01:34Z) - Prototype-based Aleatoric Uncertainty Quantification for Cross-modal
Retrieval [139.21955930418815]
クロスモーダル検索手法は、共通表現空間を共同学習することにより、視覚と言語モダリティの類似性関係を構築する。
しかし、この予測は、低品質なデータ、例えば、腐敗した画像、速いペースの動画、詳細でないテキストによって引き起こされるアレタリック不確実性のために、しばしば信頼性が低い。
本稿では, 原型に基づくAleatoric Uncertainity Quantification (PAU) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:41:19Z) - GERE: Generative Evidence Retrieval for Fact Verification [57.78768817972026]
本稿では,ジェネレーション方式で証拠を検索する最初のシステムであるGEREを提案する。
FEVERデータセットの実験結果は、GEREが最先端のベースラインよりも大幅に改善されていることを示している。
論文 参考訳(メタデータ) (2022-04-12T03:49:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。