論文の概要: When Should Multi-Round RAG Stop? Structured Stopping Judgments and Retrieval Reduction in Search-R1
- arxiv url: http://arxiv.org/abs/2608.13237v1
- Date: Thu, 13 Aug 2026 13:42:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.54577
- Title: When Should Multi-Round RAG Stop? Structured Stopping Judgments and Retrieval Reduction in Search-R1
- Title(参考訳): マルチトラックRAGはいつ停止すべきか? 構造的停止判断と検索R1の検索量削減
- Authors: Weimeng Luo,
- Abstract要約: マルチラウンド検索強化世代(RAG)は、証拠が蓄積されるにつれていつ検索を止めるかを決定する必要がある。
我々は,S2G-RAGの構造的充足性判定をフリーズしたサーチ-R1パイプラインに適用する。
我々は900のHotpotQA質問から3,009の州でQwen3.5-2B判事を訓練する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-round retrieval-augmented generation (RAG) must decide when to stop searching as evidence accumulates. Because the deployed policy is determined by the first STOP on each trajectory, this is a sequential selection problem rather than an independent state-classification task. We adapt S2G-RAG's structured sufficiency-and-gap judgment to a frozen Search-R1 pipeline and train a Qwen3.5-2B judge on 3,009 states from 900 disjoint HotpotQA questions. Search-R1's reasoner, retriever, corpus, prompt, and search budget remain unchanged, while the judge checkpoint and stopping threshold are selected on grouped validation and frozen before confirmatory evaluation. On the confirmatory test set, the resulting policy reduces retrieval calls by 77 (3.70\%) relative to Native Search-R1, while Official Exact Match decreases by 0.625 percentage points. Thus, the trained S2G-style structured judge reduces retrieval while broadly preserving answer accuracy. The result does not imply unchanged or improved accuracy, safe stopping, or lower total inference cost.
- Abstract(参考訳): マルチラウンド検索強化世代(RAG)は、証拠が蓄積されるにつれていつ検索を止めるかを決定する必要がある。
展開されたポリシーは各軌道上の最初のSTOPによって決定されるので、これは独立した状態分類タスクではなく、連続的な選択問題である。
900のHotpotQA質問から3,009状態のQwen3.5-2B判定を学習し,S2G-RAGの構造的満足度判定を凍結探索R1パイプラインに適用する。
判定チェックポイントと停止閾値は、グループ検証時に選択され、確認評価の前に凍結される。
確認テストセットでは、結果のポリシにより、Native Search-R1に対する検索コールが77(3.70\%)削減され、Offic Exact Matchは0.625ポイント削減される。
これにより、訓練されたS2Gスタイルの構造化判定器は、解答精度を広く保ちながら、検索を低減する。
その結果、精度、安全停止、総推論コストの低下を示唆または改善することができない。
関連論文リスト
- BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries [82.41764922522565]
BOUNDは、永続的な探索ドリフトのための短いガイド付き修正選好蒸留フレームワークである。
Trajectory SFT は Bamboogle で 5.6 EM 、BrowseComp-Plus で 4.8 の精度で上回っている。
論文 参考訳(メタデータ) (2026-08-09T15:32:16Z) - Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation [10.60293484295824]
適応RAGをキャリブレーションした検索予算配分として定式化する。
シーケンスログの確率とプレフィックスログの不確実性信号を正しさの確率に調整する。
シーケンスログの確率については、TriviaQAでは0.275から0.062に、NQでは0.643から0.009に、MS MARCOでは0.711から0.031に低下する。
論文 参考訳(メタデータ) (2026-06-29T08:36:33Z) - R$^2$-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search [59.034878430183305]
R$2$-Searcherは、検索と推論の境界を明示的に探索し、校正する。
R$2$-Searcherは,解答精度と検索品質において,最先端のエージェント検索法よりも優れていることを示す。
論文 参考訳(メタデータ) (2026-06-26T19:44:34Z) - When Retrieval Metrics Mislead: Measuring Policy Signal in Long-Horizon Tool-Use Agents [13.484205922478163]
Exact-matchリコールは、検索者が下流決定モデルに有用なポリシーコンテキストを提供するかどうかのプロキシとしてしばしば使用される。
本プロキシは,Qwen2.5-3B/7B分類器を用いて,タウベンチにおける事前行動ポリシー分類を行う。
論文 参考訳(メタデータ) (2026-06-22T20:57:11Z) - TASR: Training-Free Adaptive Stopping for Iterative Retrieval [12.177557521540082]
反復的検索拡張生成エージェントは、モデルが解答に収束した後も検索を続けることで、一般的にオーバースペンドされる。
TASR(Training-Free Adaptive Stopping Rule)は,モデルが前ラウンドの正規化を繰り返すと発火する一行述語である。
論文 参考訳(メタデータ) (2026-06-11T18:35:14Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation [6.604874054866016]
本稿では,証拠満足度がセットレベル特性であることを示す,透過的なアグリゲーションプロトコルSURE-RAGを提案する。
共有ペアレベルのクレームエビデンス検証器は、SURE-RAGが集約した局所的関係分布を解釈可能な応答レベル信号に生成する。
制御されたマルチホップベンチマークであるHotpotQA-RAG v3をアーティファクト・アウェア・プロトコルで評価した。
論文 参考訳(メタデータ) (2026-05-05T09:05:40Z) - Controlling Authority Retrieval: A Missing Retrieval Objective for Authority-Governed Knowledge [0.0]
私たちはこれを CAR と呼び、セマンティックアンカー q、すなわち front(cl(A_k(q))) に対して現在アクティブな権限を取得する。
我々は、セキュリティアドバイザリ、SCOTUSオーバーラリングペア、FDA薬物記録の3つの実世界のデータセットを評価した。
GPT-4ominiの実験では、RAGは、パッチが存在するクエリの39%に対して、明示的な"パッチなし"のクレームを生成する。
論文 参考訳(メタデータ) (2026-04-15T23:56:35Z) - PAR$^2$-RAG: Planned Active Retrieval and Reasoning for Multi-Hop Question Answering [57.89576196160413]
大規模言語モデル (LLM) はマルチホップ質問応答 (MHQA) において脆弱のままである。
textbfPlanned Active Retrieval and Reasoning RAG (PAR$2-RAG)を提案する。
論文 参考訳(メタデータ) (2026-03-30T23:52:54Z) - ReFIT: Relevance Feedback from a Reranker during Inference [109.33278799999582]
Retrieve-and-Rerankは、ニューラル情報検索の一般的なフレームワークである。
本稿では,リランカを利用してリコールを改善する手法を提案する。
論文 参考訳(メタデータ) (2023-05-19T15:30:33Z) - Certified Error Control of Candidate Set Pruning for Two-Stage Relevance
Ranking [57.42241521034744]
本稿では、妥当性ランキングのための候補セットプルーニングの認証エラー制御の概念を提案する。
提案手法は,第1段階から抽出した候補集合を抽出し,第2段階の復位速度を向上する。
論文 参考訳(メタデータ) (2022-05-19T16:00:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。