論文の概要: Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations
- arxiv url: http://arxiv.org/abs/2608.06305v1
- Date: Thu, 06 Aug 2026 17:23:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.81218
- Title: Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations
- Title(参考訳): トップKを超える: 解釈可能なエージェント操作でブラックボックス検索をリプレース
- Authors: Sagar Tamang, Ayush Vyas, Tabarakul Hazarika,
- Abstract要約: 長いドキュメントに対する検索拡張生成は、テキストをチャンクし、チャンクを埋め、クエリの最も近い隣人にサーフェスする、という1つの設計によって支配されている。
我々は、財務報告、監査報告、規制リターンといった重要な文書のクラスにとって、この設計は構造的に不正確であると主張する。
本稿では,READ(Reliable Embedding-free Agentic Document-search)を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Retrieval-augmented generation over long documents is dominated by one design: chunk the text, embed the chunks, and surface the top-k nearest neighbours of the query. We argue that for an important class of documents -- financial statements, audit reports, regulatory returns -- this design is structurally unsound, and we make the argument measurable. On a 780-page government financial report, 86.8% of content lines are table rows, thousands of near-identical figures compete in one embedding space, and a figure inherits its unit from a header a median of 13 lines above it -- so a chunk boundary routinely separates a number from whether it is in lakh or crore, an error of two orders of magnitude. A table-aware chunker built as a steelman fixes the unit problem but leaves 27-30% of numeric chunks with no fiscal-year header at every chunk size we tried. We propose READ (Reliable Embedding-free Agentic Document-search), in which an agent reads the raw document through three deterministic operations -- normalized lexical search, structural navigation, and bounded span reads -- exposed over the Model Context Protocol, so a trajectory is a replayable audit trail, not an opaque similarity score. On 51 verified questions READ answers 58.8% against dense retrieval's 15.7% (p_Holm = 2 x 10^-5) -- or 35.3% tuned, which READ still leads by 23.5 points (p_Holm = 0.017). An agent given the same loop but a top-k tool reaches only 27.5%, locating the gain in the interface rather than in iteration. We also report what the evidence does not support: BM25 is statistically indistinguishable from READ, so our result separates embedding-based from embedding-free retrieval, not agentic from lexical search.
- Abstract(参考訳): 長いドキュメントに対する検索拡張生成は、テキストをチャンクし、チャンクを埋め、クエリの最も近い隣人にサーフェスする、という1つの設計によって支配されている。
我々は、重要な文書のクラス -- 財務報告、監査報告、規制リターン -- に対して、この設計は構造的に不正確であり、議論を計測可能にする。
780ページの政府財務報告では、コンテンツラインの86.8%がテーブル行であり、何千もの身近な人物が1つの埋め込みスペースで競い合い、数字はヘッダーから13行の中央値の単位を継承する。
スチールマンとして作られたテーブルを意識したチャンカーは、ユニットの問題を修正するが、数値チャンクの27~30%を、私たちが試したチャンクサイズごとに、会計年度のヘッダーなしで残している。
本稿では,READ(Reliable Embedding-free Agentic Document-search)を提案する。正規化語彙探索,構造ナビゲーション,有界スパン読み込みという3つの決定論的操作を通じて,エージェントが生文書を読み取り,モデルコンテキストプロトコル上に公開することにより,トラジェクトリは不透明な類似性スコアではなく再生可能な監査パスとなる。
51の質問に対して、READは15.7%(p_Holm = 2 x 10^-5)、または35.3%のチューンに対して58.8%の回答を出し、READは23.5ポイント(p_Holm = 0.017)を導いた。
同じループを与えられたエージェントだが、トップkツールが27.5%に達すると、繰り返しではなくインターフェイスの利得がわかる。
BM25はREADと統計的に区別できないため,組込み型検索と組込み型検索を分離する。
関連論文リスト
- Structure-Aware Semantic Chunking with Title-Chain Prefixes: A 1600-Query Evaluation and the Measurement Trap in Text-Transform Ablations [4.342406076796542]
3段階のチャンク側のみのセマンティックチャンクパイプラインを提示する。
タイトルチェーンは、生成された要約ではなく、文書のヘッダ階層を再利用する。
パイプラインは完全なセットでMRR@5を0.374から0.463に、答え可能なサブセットで0.828から0.925に改善する。
論文 参考訳(メタデータ) (2026-08-01T19:01:46Z) - Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search [3.976291254896486]
検索システムは、有用性の静的なアイデアに基づいて訓練され、評価される。
言語モデルが検索エージェントとして機能し、いくつかのクエリを発行し、ターンにまたがる推論を行うとき、それは壊れる。
私たちは1000の開発質問をリプレイし、エージェントが読んだすべてのドキュメントに対して、それを削除し、その時点から残りのトラジェクトリを再実行します。
論文 参考訳(メタデータ) (2026-07-16T17:48:29Z) - GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents [0.12430801435092285]
GDP_pdfは、ドキュメントAI機能を直接測定するベンチマークである。
これは10分野の作業専門家によって書かれた質問文書対で構成されている。
100-itemベンチマークで17のフロンティアモデルの結果を報告する。
論文 参考訳(メタデータ) (2026-07-13T07:44:07Z) - LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents [2.3651168422805027]
エージェントはこれまでに収集された証拠を観察し、検査のために次の文書の断片を選び、証拠が十分であれば停止する。
このエージェントは、閲覧、読み、検索ツールを使用してベクトルレス文書ツリー上で動作し、動的知識グラフ(KG)を状態として保持する。
NuScale Final Safety Analysis Report (FSAR) の文書に対する200クエストベンチマークでは、システムは81.5%の精度で0.93の忠実さを達成している。
論文 参考訳(メタデータ) (2026-06-28T13:45:59Z) - AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning [52.23991730630292]
大規模言語モデルは、パラメトリックな知識から答えるのではなく、文書を推論するエージェントとして、ますます多くデプロイされている。
大規模な、散らかった職場ファイルの集合にスパース証拠を配置し、一貫性のない用語、単位、時間規則を調整し、答えを計算する。
私たちは、362の質問と9,664の認証ドキュメントと372Mのトークンの8つのドメインコレクションをペアリングするベンチマークであるAgoraを紹介します。
論文 参考訳(メタデータ) (2026-06-23T12:57:18Z) - Novelty-Aware Agentic Retrieval: Comparing Research Contributions Through Structured Multi-Step Reasoning [0.0]
ノベルティ・アウェア・リサーチ・エージェント(英: Novelty-Aware Research Agent)は、エージェント検索システムのプロトタイプである。
RAGパイプライン上の多段階推論を6つのタイプドコントラクトコンポーネントを通じて階層化する。
論文毎のコントリビューション記録、紙レベルのオーバーラップ、問題xメソッドギャップマトリックスなど、構造化された比較アーティファクトを生成する。
論文 参考訳(メタデータ) (2026-06-20T17:04:02Z) - Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation [59.438696079345426]
DICEは、ドキュメントをチャンクに分割し、凍結したモデルで独立してエンコードし、それらを単一のベクタに集約する、トレーニング不要のドキュメントサイド戦略である。
LongEmbedでは、DICEは4つのバックボーン間の検索を改善し、4kトークンを超えるスライスで最大の利益を上げている。
12,779個のフィルターサンプルのうち、DICEは92.8%のケースで単一ベクトルベースラインよりも低いEDIが得られる。
論文 参考訳(メタデータ) (2026-06-17T07:44:04Z) - Towards Retrieving Interaction Spaces for Agentic Search [62.666902610940525]
最近の直接コーパス(DCI)の研究は、エージェントが5.4のインタラクションやファイル読み取りといったシェルツールを通じて生コーパスと対話できることを示している。
エージェント検索における検索の役割は, LLMコンテキストウィンドウに適合する文書を選択することだけではなく, インタラクション空間を構築することにある。
論文 参考訳(メタデータ) (2026-06-05T03:47:40Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - ImpliRet: Benchmarking the Implicit Fact Retrieval Challenge [50.93758649363798]
Impliretは、推論の課題をドキュメント側処理にシフトするベンチマークである。
我々は,この環境下で苦戦している,疎水・密集したレトリバーの幅を評価した。
論文 参考訳(メタデータ) (2025-06-17T11:08:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。