論文の概要: Agentic Context Cracking: Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data
- arxiv url: http://arxiv.org/abs/2608.31082v2
- Date: Fri, 04 Sep 2026 07:11:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 13:53:00.429715
- Title: Agentic Context Cracking: Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data
- Title(参考訳): エージェントコンテキストクラック:非構造化データの適応的構造化によるトークン効率の良いデータ推論エージェント
- Authors: Milad Rezaei Hajidehi, Qitong Wang, Stratos Idreos,
- Abstract要約: エージェントデータクラッキングは、非構造化データを適応的に投機的に推論の副産物として構成する手法である。
エージェントデータクラッキングは、非構造化データに対するエージェント推論のための次世代データインフラストラクチャに向けた第一歩である。
- 参考スコア(独自算出の注目度): 6.315002304107694
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Valuable data remains embedded in unstructured sources: web pages, reports, contracts, filings, earnings calls, and PDFs. The big bet in enterprise AI is deploying LLM agents that reason over this data to answer complex questions for every knowledge worker. Agents can do this today, but at prohibitive cost. Each question repeatedly opens large documents to recover scattered evidence, consuming up to a million tokens. However, if the data were already structured, the same question would reduce to a cheap database lookup. For example, on FanOutQA benchmark, reasoning over an ideal pre-structured store is 28X cheaper, and the gap grows to orders of magnitude as questions fan out over more documents. Yet structuring everything in advance is not viable: documents hold vastly more possible structure than any workload will use, and the useful structure and documents are unknown until queries arrive. We propose agentic data cracking, a method that structures unstructured data adaptively and speculatively as a byproduct of reasoning itself. Structuring is adaptive because observed queries decide when it happens and what matters, and speculative because it goes beyond the current question. Whenever the agent opens a document to answer, a cracking sub-agent forks from the already-loaded context at marginal cost and extracts grounded structure likely to serve related future queries. Over time, an increasing share of queries is fully covered by structured data and answered without opening a document, keeping agentic accuracy at close to RAG cost. On FanOutQA, extended with merely one related question per test question, cracking cuts cost by 53% while preserving accuracy. Agentic data cracking is a first step toward next-generation data infrastructure for agentic reasoning over unstructured data: a shared substrate beneath the model where knowledge that reasoning already paid to uncover accumulates.
- Abstract(参考訳): 有意義なデータは、Webページ、レポート、契約書、申請書、収支報告、PDFなど、構造化されていないソースに埋もれている。
エンタープライズAIにおける大きな賭けは、すべての知識労働者の複雑な質問に答えるために、このデータを推論するLLMエージェントを配置することである。
エージェントは今日これを行うことができるが、禁止費用はかかる。
各質問は、散らばった証拠を回収するために、大きな文書を何度も開いており、最大100万個のトークンを消費する。
しかし、もしデータが既に構造化されているなら、同じ質問は安価なデータベースのルックアップに還元されるだろう。
例えば、FanOutQAベンチマークでは、理想的な事前構造化されたストアに対する推論は28倍安くなり、より多くのドキュメントが出てくると、そのギャップは桁違いに大きくなる。
ドキュメントはどのワークロードよりもはるかに多くの構造を持ち、有用な構造とドキュメントはクエリが到着するまで不明です。
本稿では,非構造化データを推論の副産物として適応的に投機的に構造化する手法であるエージェントデータクラッキングを提案する。
構造化は、観測されたクエリがいつ発生し、何が重要かを判断し、現在の質問を超えた投機的であるため適応的である。
エージェントが答えるために文書を開くと、既にロードされているコンテキストからクラックするサブエージェントフォークが限界コストで取得され、関連する将来的なクエリを提供する可能性のある接地された構造を抽出する。
時間が経つにつれ、クエリのシェアは構造化データによって完全にカバーされ、ドキュメントを開かずに答えられ、エージェントの精度はRAGコストに近くなる。
FanOutQAでは、テスト毎の質問が1つだけ拡張され、クラックは精度を維持しながらコストを53%削減する。
エージェントデータクラックは、非構造化データに対するエージェント推論のための次世代データインフラストラクチャに向けた第一歩である。
関連論文リスト
- Trace Only What You Need: Structure-Aware On-Demand Hypergraph Memory for Long-Document Question Answering [11.17007249581283]
長い文書の質問応答は、長い文書に散在する証拠を推論するために大きな言語モデルを必要とする。
既存の構造化RAG手法には,コストのかかるクエリ非依存の知識組織,オリジナルドキュメント構造の使用不足,歴史的推論経験の再利用の3つの制限がある。
本稿では、問合せトリガードナレッジ組織、文書構造認識、経験誘導推論をサポートする長期文書QAのためのマルチエージェントRAGフレームワークDocTraceを提案する。
論文 参考訳(メタデータ) (2026-06-09T14:29:06Z) - Deep Reasoning in General Purpose Agents via Structured Meta-Cognition [58.185853639335896]
構造化メタ推論を用いてタスク固有の足場を構築するための推論時アプローチを提案する。
我々は、より制御された推論スレッドに複雑なタスクを分散する汎用エージェントでこのアプローチをインスタンス化する。
論文 参考訳(メタデータ) (2026-05-12T01:21:37Z) - Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data Lakes [5.276278723196607]
Agentic DAG-Orchestrated Transformer (A.DOT) Plannerはマルチモーダル・マルチホップ質問応答のためのフレームワークである。
A.DOTは、ユーザNLクエリを構造化および非構造化の両方にまたがる有向非巡回グラフ(DAG)実行計画にコンパイルする。
System Decomposes query into parallelizable sub-queries, includess schema-aware reasoning, and applied both structure and semantic validation。
論文 参考訳(メタデータ) (2026-03-15T05:34:16Z) - FS-Researcher: Test-Time Scaling for Long-Horizon Research Tasks with File-System-Based Agents [53.03492387564392]
我々はFS-Researcherを紹介した。FS-Researcherはファイルシステムベースのフレームワークで、永続的なワークスペースを通じてコンテキストウィンドウを超えて深い研究をスケールする。
Context Builderエージェントはインターネットを閲覧し、構造化されたノートを書き、ソースを階層的な知識ベースにアーカイブする。
その後、レポートライターエージェントが最終レポートセクションをセクションごとに構成し、知識ベースを事実のソースとして扱う。
論文 参考訳(メタデータ) (2026-02-02T03:00:19Z) - Query Decomposition for RAG: Balancing Exploration-Exploitation [83.79639293409802]
RAGシステムは複雑なユーザ要求に対処し、それらをサブクエリに分解し、それぞれに関連する可能性のあるドキュメントを取得し、それを集約して回答を生成する。
クエリの分解とドキュメントの検索をエクスプロレーション探索設定で定式化し、一度に1つのドキュメントを検索すると、与えられたサブクエリの有用性についての信念が構築される。
我々の主な発見は、ランク情報と人的判断を用いた文書関連性の推定により、文書レベルの精度が35%向上し、α-nDCGが15%向上し、長文生成の下流タスクの性能が向上するということである。
論文 参考訳(メタデータ) (2025-10-21T13:37:11Z) - Hierarchical Retrieval with Evidence Curation for Open-Domain Financial Question Answering on Standardized Documents [9.173952465423966]
標準化されたドキュメントは、反復的なボイラープレートテキストや同様のテーブル構造など、同様のフォーマットを共有している。
この類似性により、従来のRAGメソッドは、ほぼ重複したテキストを誤識別し、精度と完全性を損なう重複検索につながる。
本稿では,これらの問題に対処するためのEvidence Curationフレームワークを用いた階層検索手法を提案する。
論文 参考訳(メタデータ) (2025-05-26T11:08:23Z) - PDFTriage: Question Answering over Long, Structured Documents [60.96667912964659]
構造化文書をプレーンテキストとして表現することは、これらの文書をリッチな構造でユーザ精神モデルと矛盾する。
本稿では,構造や内容に基づいて,モデルがコンテキストを検索できるPDFTriageを提案する。
ベンチマークデータセットは,80以上の構造化文書に900以上の人間が生成した質問からなる。
論文 参考訳(メタデータ) (2023-09-16T04:29:05Z) - Dual Reader-Parser on Hybrid Textual and Tabular Evidence for Open
Domain Question Answering [78.9863753810787]
世界の知識は構造化データベースに保存されている。
クエリ言語は、複雑な推論を必要とする質問に答えるだけでなく、完全な説明可能性を提供することができる。
論文 参考訳(メタデータ) (2021-08-05T22:04:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。