論文の概要: LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
- arxiv url: http://arxiv.org/abs/2607.13501v2
- Date: Thu, 16 Jul 2026 15:39:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 14:53:42.221988
- Title: LOTAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
- Title(参考訳): LOTAPO:マルチTurn Search Reasoningにおける自己生成プロセスリワードに対するLeave-One-Turn属性
- Abstract要約: LOTAPOは、後戻り一ターン属性に基づく自己生成プロセススーパービジョン手法である。
各検索ターンに対して、LOTAPOはターンとその検索観察を固定[DELETE]プレースホルダーで置き換える。
このAnswer-Likelihood Gainは、すべての下流相互作用を保存しながらターンの寄与を推定する。
- 参考スコア(独自算出の注目度): 12.013691798765594
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning for multi-turn search reasoning typically relies on terminal outcome rewards, which cannot distinguish useful, redundant, and harmful intermediate interactions. We propose LOTAPO , a self-generated process-supervision method based on backward leave-one-turn attribution. For each search turn, LOTAPO replaces the turn and its retrieval observation with a fixed [DELETE] placeholder and measures the resulting change in the current policy's mean log-likelihood of the gold answer. This Answer-Likelihood Gain estimates the turn's contribution while preserving all downstream interactions, allowing early evidence to be evaluated in the complete reasoning context. LOTAPO further applies sign-consistency gating, retaining only normalized process advantages whose directions agree with their raw attribution scores. The method requires no additional reward model, teacher, verifier, or LLM-as-a-Judge. Across seven knowledge-intensive question-answering datasets with local retrieval, LOTAPO achieves an average exact-match score of 0.326, outperforming the strongest step-reward baseline, IGPO, by 0.053. Ablations show complementary benefits from backward attribution and sign-consistency gating, demonstrating that policy-derived retrospective attribution can provide effective process supervision for multi-turn search agents.
- Abstract(参考訳): マルチターン探索推論のための強化学習は、一般的に、有用で冗長で有害な中間的相互作用を区別できない、終末結果の報酬に依存している。
後戻り一ターン属性に基づく自己生成プロセススーパービジョン法であるLOTAPOを提案する。
各探索ターンに対して、LOTAPOは、ターンとその検索観察を固定[DELETE]プレースホルダーで置き換え、現在のポリシーの平均ログライクなゴールド回答の変化を測定する。
このAnswer-Likelihood Gainは、すべての下流相互作用を保存しながらターンの寄与を推定し、初期の証拠を完全な推論コンテキストで評価することを可能にする。
LOTAPOはさらに、サイン一貫性ゲーティングを適用し、正規化されたプロセスの利点のみを保持し、その方向は彼らの生の属性スコアと一致する。
この方法は、追加の報酬モデル、教師、検証者、LLM-as-a-Judgeを必要としない。
LOTAPOは7つの知識集約型問合せデータセットのうち,平均精度0.326を達成し,最強のステップリワードベースラインであるIGPOを0.053で上回った。
アブレーションは、裏向きの帰属とサイン一貫性のゲーティングの相補的な利点を示し、ポリシーに基づくレトロスペクティブの帰属が、マルチターン検索エージェントに効果的なプロセス監視を提供することを示す。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization [13.354353071601379]
我々は、特権付き監督を成果ベースアクションクレジットに変換するTASPOを紹介する。
3つのエージェントベンチマークで、TASPOはGRPOよりも10.6%改善し、目に見えないタスクを一般化する。
論文 参考訳(メタデータ) (2026-08-31T16:51:50Z) - RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning [10.917273110894469]
エージェント強化学習では、環境に配慮した行動にクレジットを割り当てる必要がある。
標準GRPOは全てのアクショントークンに対する一様優位性として最終検証結果を使用する。
本稿では,ロール型クレジット代入フレームワークであるTRIAGEを提案する。
論文 参考訳(メタデータ) (2026-06-30T17:48:07Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure [23.021647176206972]
報酬モデルバイアスの単一軸緩和は、最適化圧力をそれを取り除くのではなく、相関したプロキシに回転させることができる。
この障害は、監査と政策によって引き起こされる分布の計測と最適化のギャップによって実現される。
我々は緩和の結果を制度分類に定式化し、緩和、偏見置換、過補正が同じ観測結果を生み出すことを証明した。
論文 参考訳(メタデータ) (2026-05-27T05:40:22Z) - RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents [37.33108522642245]
本稿では,検索インタラクションを局所的な学習信号に変換する,批判のないポリシー最適化フレームワークであるRICE-POを提案する。
BRIGHTとBEIRでは、RICE-POはプロンプトベースのエージェントとグループベースのRLベースラインを同じレシーバー設定で一貫して上回る。
論文 参考訳(メタデータ) (2026-05-25T21:56:29Z) - The Reciprocity Gradient [52.35929743862925]
コミュニケーションは、戦略的相互作用における相互性と協力を維持するための基本である。
学習エージェントに特有の集中的最適化の難しさとして,影響帰属問題を同定し,定式化する。
これを解決するために、公衆の観察から訓練された相手の政策の個人推定器を通して、報酬勾配を明示的に逆伝搬する相互性勾配を導入する。
論文 参考訳(メタデータ) (2026-05-08T16:29:52Z) - Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers [26.97849381770806]
自己誘導型アウトカム電位は、最終回答のセマンティッククラスタを、ポテンシャルに基づくターンレベルのクレジット割り当てのための潜在的な将来の結果状態として扱う。
我々は,このフレームワークを形式化し,監督対象のゴールド・アンサー・リミットを特徴付けるとともに,SIOPが検証自由な結果レベルベースラインよりも平均性能を向上させることを示す。
論文 参考訳(メタデータ) (2026-05-06T14:38:48Z) - Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization [47.7937991619078]
本稿では,プロセスの監督をグループ相対的な政策最適化に統合するフレームワークであるコントリビューション重み付きGRPOを提案する。
CW-GRPOは、LLM判定器を用いて、検索ラウンド毎の検索ユーティリティと推論精度を評価し、ラウンド毎のコントリビューションスコアを生成する。
複数の知識集約型ベンチマークの実験では、CW-GRPOはQwen3-8Bでは5.0%、Qwen3-1.7Bでは6.3%、標準GRPOより優れていた。
論文 参考訳(メタデータ) (2026-04-15T17:37:59Z) - Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation [50.696688705287755]
我々は、強化学習におけるスパース報酬課題を克服するために、相互情報自己評価を提案する。
MISEにより、エージェントは、疎外的信号を補う高密度な内部報酬から自律的に学習することができる。
我々は、後見自己評価報酬を利用することは、政策と代行報酬政策の間のKL分散項と相互情報を組み合わせた目的を最小化することと等価であることを示す。
論文 参考訳(メタデータ) (2026-04-13T15:18:51Z) - Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning [52.144281362465996]
本稿では,強化学習を長期シナリオに適用するためのEAPO(Evidence-Augmented Policy Optimization)を提案する。
最初にEvidence-Augmented Reasoningパラダイムを確立し、Tree-Structued Evidence Smplingを介して検証する。
次に、報酬モデルがグループ相対エビデンス・リワードを計算する特殊なRLアルゴリズムを導入する。
トレーニングを通して正確な監視を維持するため、適応的リワード・ポリティ共進化機構をさらに取り入れる。
論文 参考訳(メタデータ) (2026-01-15T11:40:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。