論文の概要: It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.00638v1
- Date: Tue, 01 Sep 2026 03:17:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.264901
- Title: It Takes Two to Match: Co-Evolving Generative Retriever with Reinforcement Learning
- Title(参考訳): マッチングに2つの方法:強化学習によるジェネレーティブリトリバーの共進化
- Authors: Runpeng Dai, Kaili Huang, Changsung Kang, Ciya Liao,
- Abstract要約: CoGRはジェネレータを訓練し、クエリとアイテムの両側で検索表現を構築する。
各ジェネレータは、逆インデックスを通じて直接マッチする、コンパクトなキーワードセットを生成する。
CoGRは、内部のAPP MarketplaceデータセットとパブリックなWANDSベンチマークの両方で最高のパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 3.106071998555287
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval is the first stage of modern search and advertising systems, selecting a candidate set from a large item universe for downstream ranking and auction. Recent work increasingly leverages LLMs to improve retrieval through query expansion, data synthesis, and retrieval-feedback training. However, the generative component is typically used for query-side augmentation, while final matching is still delegated to a downstream retriever. We introduce CoGR, a retrieval framework that instead trains LLMs to directly construct retrieval representations on both query and item sides. Each generator produces a compact set of keywords, which are matched directly through an inverted index, preserving compatibility with existing keyword-based retrieval infrastructure. CoGR uses a two-stage training pipeline. Supervised fine-tuning first establishes an aligned keyword space, after which co-evolving reinforcement learning alternately optimizes the query- and item-side generators with GRPO against the opposite side's frozen index. Both sides optimize the same query-to-item retrieval $F_1$ objective: the query side receives retrieval $F_1$ directly, while the item side receives a counterfactual marginal reward measuring the change in query-side $F_1$ caused by its generated keywords. Across 10 representative sparse, dense, and generative baselines, CoGR achieves the best performance on both an internal APP Marketplace dataset and the public WANDS benchmark, improving $F_1$ over the strongest baseline by $10.9\%$ and $36.1\%$, respectively. Further analysis shows stable co-evolution and increasingly aligned query--item keyword spaces over training.
- Abstract(参考訳): Retrievalは現代の検索と広告システムの最初の段階であり、下流のランキングとオークションのために、大きなアイテムの宇宙から設定された候補を選択する。
最近の研究は、LLMを活用して、クエリ拡張、データ合成、検索フィードバックトレーニングを通じて検索を改善する。
しかしながら、生成コンポーネントは通常、クエリ側の拡張に使用され、最終的なマッチングは、ダウンストリームレトリバーに委譲される。
検索フレームワークであるCoGRを導入し,クエリ側とアイテム側の両方で直接検索表現を構築するようにLCMを訓練する。
それぞれのジェネレータは、逆インデックスを通じて直接一致し、既存のキーワードベースの検索インフラとの互換性を保つ、コンパクトなキーワードセットを生成する。
CoGRは2段階のトレーニングパイプラインを使用している。
改良された微調整は、まず整列したキーワード空間を確立し、その後、強化学習の共進化によって、GRPOとクエリとアイテムサイドジェネレータを、反対側の凍結インデックスに対して交互に最適化する。
クエリ側は直接$F_1$を受け取り、アイテム側は生成したキーワードによるクエリ側$F_1$の変化を測定する反ファクト的な限界報酬を受け取る。
10の代表的なスパース、密度、生成ベースラインに対して、CoGRは内部のapp MarketplaceデータセットとパブリックなWANDSベンチマークの両方で最高のパフォーマンスを達成し、最強ベースラインよりもF_1$をそれぞれ$0.9\%と$36.1\%で改善した。
さらなる分析では、トレーニングよりも安定した共進化と、ますます整列するクエリ-イテムキーワード空間が示される。
関連論文リスト
- TSGR: Taobao Search Generative Retrieval [32.4338892898415]
アイテム表現と候補ランキングの両方に価値意識を組み込んだ統合生成検索フレームワークを提案する。
$textbfT$aobao $textbfS$earch $textbfG$enerative $textbfR$etrieval$textbfTSGR$
GRで構築され、共同で最適化された$textbfVRM$により、単一のモデルをレトリバーとプリランカの両方としてシームレスに機能させることができる。
論文 参考訳(メタデータ) (2026-07-21T07:17:43Z) - GrepSeek: Training Search Agents for Direct Corpus Interaction [66.69568141699311]
GrepSeekは、コンパクトな検索エージェントを訓練し、大きなテキストコーパスから証拠を見つけ、フィルタリングし、構成する、最適化された直接コーパスインタラクション(DCI)検索エージェントである。
DCIを大規模に実用化するためには、シェルコマンドのシーケンシャルな実行とバイトエクササイズ等価性を保ちながら、シェルベースの検索を最大7.6タイムで高速化するセマンティックス保存のシャード並列実行エンジンを使用する。
論文 参考訳(メタデータ) (2026-05-28T03:37:33Z) - Subtraction Gets You More: Gap-Aware Retrieval for Multimodal Multi-Hop QA [11.316299961548415]
本稿では,埋め込みレベルで直接暗黙的なクエリ書き換えを行うパラダイムを提案する。
コンテクスト・サブトラクティブなクエリ・ステアリングにより、GRAILはコンストラクショナル・クロスモーダルな推論において優れている。
タスクタイプに基づいたクエリを動的にルーティングすることで、MultimodalQA上で40.3%のマクロ平均パフォーマンス向上を実現しています。
論文 参考訳(メタデータ) (2026-05-27T15:46:21Z) - CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search [51.911048955965136]
CoSearchは多段階推論エージェントと生成ドキュメントランキングモデルを共同でトレーニングするフレームワークである。
この結果から, 推論エージェントと検索システムの協調訓練は, 実現可能であり, 性能も高いことが示唆された。
論文 参考訳(メタデータ) (2026-04-19T17:48:17Z) - AlignCoder: Aligning Retrieval with Target Intent for Repository-Level Code Completion [55.21541958868449]
リポジトリレベルのコード補完フレームワークであるAlignCoderを提案する。
我々のフレームワークは、初期クエリとターゲットコードのセマンティックギャップを橋渡しする拡張クエリを生成する。
我々は、拡張クエリにおける推論情報を活用してより正確な検索を行うAlignRetrieverのトレーニングに強化学習を採用する。
論文 参考訳(メタデータ) (2026-01-27T15:23:14Z) - Rethinking On-policy Optimization for Query Augmentation [49.87723664806526]
本稿では,様々なベンチマークにおいて,プロンプトベースとRLベースのクエリ拡張の最初の体系的比較を示す。
そこで我々は,検索性能を最大化する擬似文書の生成を学習する,新しいハイブリッド手法 On-policy Pseudo-document Query Expansion (OPQE) を提案する。
論文 参考訳(メタデータ) (2025-10-20T04:16:28Z) - Can Query Expansion Improve Generalization of Strong Cross-Encoder Rankers? [72.42500059688396]
本稿では,拡張されたクエリのランク付け結果を融合により高速化し,エンジニアリングの迅速化と集約を行うことにより,強力なニューラルネットワークローカの一般化を向上できることを示す。
BEIR と TREC Deep Learning の実験では,MonoT5 と RankT5 の nDCG@10 スコアがこれらのステップに従って改善された。
論文 参考訳(メタデータ) (2023-11-15T18:11:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。