論文の概要: Metadata, Structure, or Strategy? A Decomposition of RAG Context Enrichment
- arxiv url: http://arxiv.org/abs/2606.29645v1
- Date: Sun, 28 Jun 2026 23:26:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.996364
- Title: Metadata, Structure, or Strategy? A Decomposition of RAG Context Enrichment
- Title(参考訳): メタデータ, 構造, 戦略 : RAGコンテキスト強化の分解
- Abstract要約: 検索可能な生成システムは、品質メタデータを付加し、明示的なレコードに構造化し、ステップ間で証拠を蓄積するマルチホップ検索戦略を採用することで、検索されたパスを豊かにする傾向にある。
これらの変更は、よりリッチなコンテキストがより良い回答をもたらすと仮定するが、既存の評価では、これらを一度に3つの要因すべてを変えるため、テストすることはできない。
我々は,6つのベンチマーク,3つのファミリーの4つのモデル,5つのエンリッチメントレベルのコントロール実験において,各因子を分離し,合計24,000以上の回答を得た。
回答の品質を決定するのは、コンテキストがどれだけメタデータを持ち込むかではなく、与えられたタスクに対してモデルがそれを実行できるかどうかです。
- 参考スコア(独自算出の注目度): 3.2058241360543254
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation (RAG) systems increasingly enrich retrieved passages by attaching quality metadata, structuring them into explicit records, and adopting multi-hop retrieval strategies that accumulate evidence across steps. These changes assume that richer context yields better answers, yet existing evaluations cannot test this because they vary all three factors at once. We isolate each factor in a controlled experiment across six benchmarks, four models from three families, and five enrichment levels, totaling over 24,000 evaluated responses. The assumption does not hold. Most enrichment reduces accuracy. Models prompted to use confidence scores comply correctly yet produce worse answers, a gap between utilization and accuracy that no prior work has measured. What determines answer quality is not how much metadata the context carries but whether the model can act on it for the given task. When metadata and retrieval strategy are aligned with model capabilities, a smaller model outperforms a frontier model by 19 F1 points. These findings motivate a processability hierarchy that predicts, from pre-training properties alone, which metadata a model can productively use, reframing RAG design as a question of model-context alignment rather than metadata accumulation.
- Abstract(参考訳): Retrieval-augmented Generation (RAG) システムは、品質メタデータを付加し、明示的なレコードに構造化し、ステップ間で証拠を蓄積するマルチホップ検索戦略を採用することで、検索されたパスを豊かにする。
これらの変更は、よりリッチなコンテキストがより良い回答をもたらすと仮定するが、既存の評価では、これらを一度に3つの要因すべてを変えるため、テストすることはできない。
我々は,6つのベンチマーク,3つのファミリーの4つのモデル,5つのエンリッチメントレベルのコントロール実験において,各因子を分離し,合計24,000以上の回答を得た。
その仮定は成り立たない。
ほとんどの豊かさは正確さを低下させる。
信頼度スコアを使用するように促されたモデルは、正しく準拠するが、悪い答えをもたらす。
回答の品質を決定するのは、コンテキストがどれだけメタデータを持ち込むかではなく、与えられたタスクに対してモデルがそれを実行できるかどうかです。
メタデータと検索戦略がモデル機能と一致している場合、より小さなモデルはフロンティアモデルよりも19F1ポイント向上する。
これらの知見は、モデルが生産的に使用できるメタデータを事前学習したプロパティのみから予測するプロセス可能性階層を動機付け、メタデータの蓄積よりもモデル-コンテキストアライメントの問題としてRAG設計を再検討する。
関連論文リスト
- Benchmarking Deflection and Hallucination in Large Vision-Language Models [25.176271096443482]
既存のベンチマークでは、視覚的証拠とテキスト的証拠の衝突を見落としている。
多様なマルチモーダル検索設定にまたがる2,775個のサンプルのベンチマークであるVLM-DeflectionBenchを紹介する。
私たちの結果は、モデルが知っていることだけでなく、そうでないときにどのように振る舞うかを評価する必要性を強調します。
論文 参考訳(メタデータ) (2026-04-13T20:22:22Z) - Imbalanced Regression Pipeline Recommendation [5.863538874435322]
本稿では,不均衡回帰(Meta-IR)フレームワークのメタラーニングを提案する。
メタ分類器をトレーニングして、タスクごとの再サンプリング戦略と学習モデルで構成される最高のパイプラインを推奨する。
AutoMLフレームワークと比較して、Meta-IRはより良い結果を得た。
論文 参考訳(メタデータ) (2025-07-16T04:34:02Z) - Maximally-Informative Retrieval for State Space Model Generation [59.954191072042526]
テスト時に特定のクエリに対するモデル不確実性を最小化するために、Retrieval In-Context Optimization (RICO)を導入する。
文書検索に外部に依存した従来の検索強化生成(RAG)とは異なり,本手法はモデルから直接のフィードバックを利用する。
モデル勾配を用いた標準のトップ$kの検索は、最適化手順を近似し、残余損失への接続を提供することを示す。
論文 参考訳(メタデータ) (2025-06-13T18:08:54Z) - Chain-of-Retrieval Augmented Generation [91.02950964802454]
本稿では,o1-like RAGモデルを学習し,最終回答を生成する前に段階的に関連情報を抽出・推論する手法を提案する。
提案手法であるCoRAGは,進化状態に基づいて動的にクエリを再構成する。
論文 参考訳(メタデータ) (2025-01-24T09:12:52Z) - Exploring Strategies for Generalizable Commonsense Reasoning with
Pre-trained Models [62.28551903638434]
モデルの一般化と精度に及ぼす3つの異なる適応法の影響を計測する。
2つのモデルを用いた実験では、微調整はタスクの内容と構造の両方を学習することで最もうまく機能するが、過度に適合し、新しい答えへの限定的な一般化に苦しむ。
我々は、プレフィックスチューニングのような代替適応手法が同等の精度を持つのを観察するが、解を見落とさずに一般化し、対数分割に対してより堅牢である。
論文 参考訳(メタデータ) (2021-09-07T03:13:06Z) - Meta-Learned Confidence for Few-shot Learning [60.6086305523402]
数ショットのメトリックベースのアプローチのための一般的なトランスダクティブ推論手法は、最も確実なクエリ例の平均で、各クラスのプロトタイプを更新することである。
本稿では,各クエリの信頼度をメタラーニングして,ラベルのないクエリに最適な重みを割り当てる手法を提案する。
4つのベンチマークデータセットに対してメタ学習の信頼度で、少数ショットの学習モデルを検証した。
論文 参考訳(メタデータ) (2020-02-27T10:22:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。