論文の概要: RAG Deserves an Index: Why Ingest-Time Compilation Beats Query-Time Interpretation
- arxiv url: http://arxiv.org/abs/2608.20845v1
- Date: Fri, 21 Aug 2026 08:08:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.471133
- Title: RAG Deserves an Index: Why Ingest-Time Compilation Beats Query-Time Interpretation
- Title(参考訳): RAGがインデックスを保存する:なぜインジェスト時間コンパイルがクエリ時間解釈に勝るのか
- Authors: Kyle Wild, Yusuke Takahashi, Asako Uraki,
- Abstract要約: 私たちはこのパラダイムをISC(Ingest-time semantic compilation)と呼んでいる。
独自のDDL、メンテナンス契約、移行契約、コストモデルを備えたファーストクラスのデータベースオブジェクトを構築します。
収集ペイロードが32の予算単位のセルすべてに勝つと、500の放送閲覧書き起こしの保持されたサンプルで、クレームがコンパイルされた。
- 参考スコア(独自算出の注目度): 0.3887079592126372
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Nearly every retrieval-augmented question-answering system in production ships with a hidden interpreter: on each query a language model re-derives the meaning of raw corpus text and then throws that work away. Cheaper models do not close the gap: per-token prices have fallen by orders of magnitude while inference spend has risen, because context volume grows faster than prices fall. This is the modern equivalent of the full-table scan, and the remedy is the one databases found fifty years ago: do the expensive work once, at write time, into a maintained structure that makes reads cheap. A corpus whose read pattern is known before it ever meets a user can and should be indexed too. We call the paradigm ingest-time semantic compilation (ISC): compile a corpus's meaning into a queryable substrate with two coupled layers - incrementally maintained embeddings, and atomic claims whose provenance is validated at compile time - and treat that substrate as a first-class database object with its own DDL, maintenance contract, migration contract, and cost model. Two existence proofs support it. Substrate upkeep scales with change rather than corpus size: incremental updates run 33.7x cheaper than reconstruction while tracking it to floating-point precision. And on a held-out sample of 500 broadcast-interview transcripts, compiled claims as the retrieval payload win all 32 budget-by-model cells: 85.2% correct from roughly 2.2k reader tokens against 72.5% from 16.3k for the best chunk configuration anywhere. The only baseline that keeps pace is a contextualized-chunk pipeline with hybrid retrieval and reranking, statistically indistinguishable from compiled claims at roughly twenty-one times the query-path tokens - and it reaches that parity, we argue, precisely because it has itself begun to compile. We close with the systems agenda this opens, from compilation planners to read planning.
- Abstract(参考訳): 各クエリでは、言語モデルが生のコーパステキストの意味を再定義し、それを捨てます。
価格下落よりも文脈の容積が速く成長するため、投機当たりの価格は桁違いに下落し、投機費は上昇している。
これは現在のフルテーブルスキャンに相当するもので、50年前に見つかったデータベースの治療法のひとつです。
読み取りパターンが分かっているコーパスは、ユーザとのマッチングが可能であり、インデックス化もすべきである。
私たちはこのパラダイムをISC(Ingest-time semantic compilation)と呼んでいる: コーパスの意味をクエリ可能な基板にコンパイルし、2つの結合された層 – 漸進的に保守された埋め込みと、コンパイル時に証明されたアトミッククレーム – にコンパイルし、その基質を独自のDDL、メンテナンス契約、マイグレーション契約、コストモデルでファーストクラスのデータベースオブジェクトとして扱う。
2つの証明がそれを裏付ける。
増分更新はリコンストラクションよりも33.7倍安く、浮動小数点精度まで追跡する。
また、500本の放送閲覧文字起こしのサンプルでは、検索ペイロードが32の予算単位のセルすべてに勝利し、85.2%が約2.2kのリーダートークンから、72.5%が16.3kのベストチャンク構成から、それぞれ正しい。
ペースを維持する唯一のベースラインは、ハイブリッド検索と再ランク付けを備えたコンテキスト化されたチャンクパイプラインで、クエリパストークンの約21分の1のクレームと統計的に区別できない。
私たちは、コンパイルプランナーからリードプランニングまで、このオープンなシステムアジェンダに近づきます。
関連論文リスト
- Cost Scales with Change, Not Corpus Size: Incrementally Maintaining an Evolving Semantic Substrate [0.3887079592126372]
コーパスがあらゆる質問に何を意味するかを再定義する代わりに、文書が到着すると一度だけ作業が行われ、その後単に相談される。
もう一つの方法は、一度その意味を取り込みながら、コンパクトでクエリ可能なセマンティック基質にコンパイルし、コーパスが進化するにつれてそれを維持することである。
私たちは、メンテナンスコストはコーパスサイズではなく、変化の量とともにスケールする、と実証的に主張し、示す。
論文 参考訳(メタデータ) (2026-08-17T14:21:15Z) - Structure then Query: Enabling Precise Analytical Queries over Unstructured Documents [11.689256498133446]
構造化されていないドキュメントは、エンタープライズおよびWebデータの大部分を構成する。
主流検索法はベクトル類似性に基づくファジィマッチングに依存している。
AnnoIndexは、散在した構造化されていないテキストを、低コストなフィルタリングとクエリを可能にする、実体化された構造化されたインデックスに変換する。
論文 参考訳(メタデータ) (2026-08-13T15:46:20Z) - SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents [0.0]
提案するSodaMemは,FactEvents型を出力スパンで抽出する,エビデンス基底の時間グラフメモリである。
LongMemEval-Sでは、記録の保存構成が92.8%の精度 (464/500; Best of Nseek) で、平均0.00161/questionです。
私たちは、APIコストを見積もったパブリックシステムを、コストテーブルとコスト精度マップにコンパイルします。
論文 参考訳(メタデータ) (2026-08-08T10:42:31Z) - Towards Researcher Agents for Knowledge-Graph Question Answering [0.0]
本稿では,静的なツール利用エージェントを超えたエージェント型テキスト・ツー・SPARQLシステムを提案する。
我々はDBpediaのループをインスタンス化し、低コストの推論モデルによって駆動されるエージェントの9つの連続バージョンを進化させ、最高のパフォーマンス構成をデプロイする。
論文 参考訳(メタデータ) (2026-08-07T18:42:53Z) - Inject or Navigate? Token-Efficient Retrieval for LLM Analysis of Transactional Legal Documents [0.0]
フルコーパス注入は検索リコールを最大化するが、トークンのフットプリントは問題ではなくコーパスとスケールする。
NAVINDEXは全18機に1.61倍のトークンフットプリント、56倍の回答コンテキスト、25%のコストで接続されたと判断された。
キャッシュインジェクションは、コーパスが検索ペイロードの約10倍以下にとどまっている間のみ、ドルで安価である。
論文 参考訳(メタデータ) (2026-07-07T02:42:06Z) - Towards Retrieving Interaction Spaces for Agentic Search [62.666902610940525]
最近の直接コーパス(DCI)の研究は、エージェントが5.4のインタラクションやファイル読み取りといったシェルツールを通じて生コーパスと対話できることを示している。
エージェント検索における検索の役割は, LLMコンテキストウィンドウに適合する文書を選択することだけではなく, インタラクション空間を構築することにある。
論文 参考訳(メタデータ) (2026-06-05T03:47:40Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - $G^2$-Reader: Dual Evolving Graphs for Multimodal Document QA [53.491241153213565]
G2$-Readerはマルチモーダルな質問応答のためのデュアルグラフシステムである。
Qwen3-VL-32B-Instructによる$G2$-Readerの平均精度は66.21%に達し、強力なベースラインとスタンドアローンのGPT-5(53.08%)を上回った。
5つのマルチモーダルドメインにわたるVisDoMBenchでは、Qwen3-VL-32B-Instructを使った$G2$-Readerが平均精度66.21%に達し、強力なベースラインとスタンドアロンのGPT-5(53.08%)を上回っている。
論文 参考訳(メタデータ) (2026-01-29T17:52:54Z) - Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls [83.89771461061903]
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
検証者による木探索アルゴリズムの最近の進歩は、大規模言語モデル(LLM)の推論能力を大幅に向上させた。
意味論的に等価なコンテンツを持つ冗長な状態による$textitover-Exploration$と、検証器のスコアリングにおける高いばらつきに起因する$textitunder-Exploration$である。
各種木探索アルゴリズムに適合するフレキシブルなプラグアンドプレイシステムであるFETCHを提案する。
論文 参考訳(メタデータ) (2025-02-16T16:12:01Z) - Injecting Domain Adaptation with Learning-to-hash for Effective and
Efficient Zero-shot Dense Retrieval [49.98615945702959]
我々は,TAS-B高密度検索器の下流ゼロショット検索精度を向上させるためのLTHおよびベクトル圧縮技術を評価する。
以上の結果から, 従来の研究とは異なり, LTH法はゼロショットTAS-B高密度レトリバーを平均14%のnDCG@10で過小評価できることがわかった。
論文 参考訳(メタデータ) (2022-05-23T17:53:44Z) - Improving language models by retrieving from trillions of tokens [50.42630445476544]
大規模コーパスから取得した文書チャンクを条件付けすることで,自動回帰言語モデルを強化する。
2兆ドルのトークンデータベースで、Retrieval-Enhanced Transformer (RETRO)は、PileのGPT-3とJurassic-1に匹敵するパフォーマンスを得る。
論文 参考訳(メタデータ) (2021-12-08T17:32:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。