論文の概要: Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale
- arxiv url: http://arxiv.org/abs/2607.01538v1
- Date: Wed, 01 Jul 2026 23:38:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.616925
- Title: Can Language Models Actually Retrieve In-Context? Drowning in Documents at Million Token Scale
- Title(参考訳): 言語モデルは実際にインコンテキストを検索できるのか?
- Authors: Siddharth Gollapudi, Nilesh Gupta, Prasann Singhal, Sewon Min,
- Abstract要約: 本研究は,2つのスケールの実践的検索者に対する文脈内検索に関する最初の体系的研究である。
最初にBlockSearchを紹介した。これは0.6BのLMレトリバーで、以前のLMベースラインよりもアーキテクチャとトレーニングが改善されている。
この分析により,注目ソフトマックスと文書レベルのスパースアテンションに長さ認識の調整を導入する。
- 参考スコア(独自算出の注目度): 22.13186135187399
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models (LMs) raise an intriguing alternative to vector-based retrieval: conditioning on an in-context corpus and directly generating a relevant answer. However, prior work has largely focused on proprietary systems or the smaller-scale reranking task, leaving corpus-scale in-context retrieval largely unexplored. In this work, we present the first systematic study of in-context retrieval on two scales practical retrievers demand: million-token corpora and length-generalization far beyond training-time sizes. We first introduce BlockSearch, a 0.6B LM retriever whose architectural and training modifications improve over prior LM baselines and length-generalize up to 10 times beyond its training regime. Nevertheless, retrieval still collapses under more extreme extrapolation. We trace this failure to an attention dilution effect: as the corpus grows, irrelevant documents dominate the softmax denominator, reducing the normalized mass on the gold document even when its pre-softmax score stays high. Motivated by this analysis, we introduce length-aware adjustments to the attention softmax and document-level sparse attention. With these modifications, at the million-token scale, our model matches dense retrieval on widely studied benchmarks (e.g, MS MARCO and NQ), while outperforming the concurrent model MSA despite being 7 times smaller. Furthermore, it significantly outperforms dense retrieval on tasks requiring entirely different notions of similarity, such as LIMIT, achieving a 3 times higher score. Together, our results position in-context retrieval a promising alternative to classical retrieval while emphasizing attention control under extreme context growth as a new challenge.
- Abstract(参考訳): 言語モデル(LM)は、ベクトルベースの検索の興味深い代替手段である、コンテキスト内コーパスの条件付けと、関連する回答を直接生成する。
しかし、以前の作業はプロプライエタリなシステムや小規模のリグレードタスクに重点を置いており、コーパススケールのインコンテキスト検索はほとんど探索されていない。
本研究は,2種類の実践的検索者に対する文脈内検索に関する最初の体系的研究である。
最初にBlockSearchを紹介した。これは0.6BのLMレトリバーで、従来のLMベースラインよりもアーキテクチャとトレーニングの修正が改善され、トレーニング体制を超えて最大10倍まで一般化される。
それでも、より極端な外挿の下では、回収は依然として崩壊している。
コーパスが大きくなるにつれて、無関係な文書がソフトマックス分母を支配し、ソフトマックス前のスコアが高い場合でも、ゴールド文書上の正規化質量を減少させる。
この分析により,注目ソフトマックスと文書レベルのスパースアテンションに長さ認識の調整を導入する。
これらの修正により、MARCO や NQ など、広く研究されているベンチマークの高密度な検索に匹敵するが、MSA は7倍小さいにもかかわらず、並列モデルよりも優れていた。
さらに、LIMITのような全く異なる類似性の概念を必要とするタスクにおいて、密度の高い検索を著しく上回り、3倍のスコアを得る。
また,本研究の結果は,コンテキスト内検索を従来の検索の代替として有望な位置づけとして位置づけるとともに,極端な文脈成長下でのアテンションコントロールを新たな課題として強調した。
関連論文リスト
- Surface-Form Neural Sparse Retrieval: Robust Fuzzy Matching for Industrial Music Search [6.820455959856271]
クエリは、ミススペル、トランスポジション、音声のバリエーションによるインデックス付きメタデータから頻繁に逸脱する。
既存の学習・検索システムであるHigh Confidence Index (HCI)は、顧客の行動からクエリ・エンティティ・アソシエーションを学習する。
従来のn-gramマッチングは、この探索を可能にするが、セマンティックロバスト性や高雑音に悩まされる。
本稿では,探索効率を最大化するために,テキストフロバスト型ニューラルスパース検索システムを提案する。
論文 参考訳(メタデータ) (2026-05-18T02:29:25Z) - MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning [74.07254720088926]
長文の視覚的質問応答に対処するために,エージェント型視覚認識ワークフローを利用する新しいフレームワークMM-Doc-R1を紹介する。
GRPOのような既存のマルチターン強化学習(RL)アルゴリズムにおけるベースライン推定バイアスに対処する、類似性に基づくポリシー最適化(SPO)を提案する。
MMLongbench-Docベンチマークの実験では、MM-Doc-R1が以前のベースラインを10.4%上回る結果となった。
論文 参考訳(メタデータ) (2026-04-15T07:39:08Z) - MARAG-R1: Beyond Single Retriever via Reinforcement-Learned Multi-Tool Agentic Retrieval [50.30107119622642]
大規模言語モデル(LLM)は推論と生成において優れているが、本質的には静的事前学習データによって制限されている。
Retrieval-Augmented Generation (RAG)は、LLMを外部知識に基盤を置くことでこの問題に対処する。
MarAG-R1は、LLMが複数の検索機構を動的に調整できる強化学習型マルチツールRAGフレームワークである。
論文 参考訳(メタデータ) (2025-10-31T15:51:39Z) - LLM-guided Hierarchical Retrieval [54.73080745446999]
LATTICEは階層的な検索フレームワークであり、LLMは対数探索の複雑さで大きなコーパスを推論し、ナビゲートすることができる。
LLM誘導探索における中心的な課題は、モデルの関連性判断がノイズが多く、文脈に依存し、階層性に気付かないことである。
我々のフレームワークは、推論集約型BRIGHTベンチマークで最先端のゼロショット性能を実現する。
論文 参考訳(メタデータ) (2025-10-15T07:05:17Z) - SitEmb-v1.5: Improved Context-Aware Dense Retrieval for Semantic Association and Long Story Comprehension [77.93156509994994]
本研究では,検索性能を向上させるために,より広いコンテキストウインドウに条件付きで短いチャンクを表現する方法を示す。
既存の埋め込みモデルは、そのような場所のコンテキストを効果的にエンコードするのに十分な装備がない。
我々の手法は、最先端の埋め込みモデルよりも大幅に優れている。
論文 参考訳(メタデータ) (2025-08-03T23:59:31Z) - FrugalRAG: Learning to retrieve and reason for multi-hop QA [10.193015391271535]
RAGメトリクスを改善するために大規模な微調整は必要ない。
監督されたRLベースの微調整は、粗悪さの観点からRAGに役立つ。
論文 参考訳(メタデータ) (2025-07-10T11:02:13Z) - ELITE: Embedding-Less retrieval with Iterative Text Exploration [5.8851517822935335]
大規模言語モデル(LLM)は自然言語処理において顕著な進歩を遂げた。
長期のコンテキスト制約を維持する能力は、ドキュメントレベルやマルチターンタスクのパフォーマンスを制限します。
論文 参考訳(メタデータ) (2025-05-17T08:48:43Z) - How Does Generative Retrieval Scale to Millions of Passages? [68.98628807288972]
各種コーパス尺度における生成的検索手法の実証的研究を行った。
我々は8.8Mパスのコーパスで数百万のパスに生成検索をスケールし、モデルサイズを最大11Bパラメータまで評価する。
生成的検索は、小さなコーパス上の最先端のデュアルエンコーダと競合するが、数百万のパスへのスケーリングは依然として重要で未解決の課題である。
論文 参考訳(メタデータ) (2023-05-19T17:33:38Z) - Overcoming Classifier Imbalance for Long-tail Object Detection with
Balanced Group Softmax [88.11979569564427]
本報告では, 長期分布前における最先端モデルの過小評価に関する最初の体系的解析を行う。
本稿では,グループワイドトレーニングを通じて検出フレームワーク内の分類器のバランスをとるための,新しいバランス付きグループソフトマックス(BAGS)モジュールを提案する。
非常に最近の長尾大語彙オブジェクト認識ベンチマークLVISの大規模な実験により,提案したBAGSは検出器の性能を著しく向上することが示された。
論文 参考訳(メタデータ) (2020-06-18T10:24:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。