論文の概要: CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents
- arxiv url: http://arxiv.org/abs/2607.16244v1
- Date: Fri, 26 Jun 2026 11:50:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.053511
- Title: CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents
- Title(参考訳): CIGPO:マルチTurnエビデンス対応LLMエージェントのコンテキスト情報ゲインポリシー最適化
- Abstract要約: 結果のみの強化学習によるマルチターンエビデンス読解エージェントのトレーニングは、中間旋回が直接クレジットをほとんど受け取らないため不安定である。
Qwen2.5-3B-InstructによるHotpotQA実験では、GRPOは最初(標準F1 0.430)改善されたが、その後100%フォーマット違反の出力に崩壊する。
本研究では,各ターン当たりの報酬を中間的エビデンス読解ターンに割り当てることで,グループ報酬分布が1つの値に崩壊するのを防ぐ,分散テキスト戦略を提案する。
- 参考スコア(独自算出の注目度): 1.4298580363875282
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training multi-turn evidence-reading agents with outcome-only reinforcement learning is unstable because intermediate turns receive little direct credit. In HotpotQA experiments with Qwen2.5-3B-Instruct, GRPO initially improves (standard F1 0.430) but subsequently collapses to 100% format-violating outputs. Training-log diagnosis reveals a zero-advantage lock-in mechanism: all sampled trajectories receive the minimum format penalty (-2.0), group-relative advantages vanish, and the policy-gradient loss becomes zero--an optimization deadlock. We propose a variance-injection strategy: by assigning per-turn rewards to intermediate evidence-reading turns, we prevent the group reward distribution from collapsing to a single value--preserving the variation that GRPO's group-relative advantage requires. Contextual Information-Gain Policy Optimization (CIGPO) implements this strategy using the marginal increase in the frozen reference model's log-likelihood of the ground-truth answer as the per-turn signal. With separate normalization of IG and F1 rewards and an IG-weight curriculum, CIGPO reaches a standard F1 of 0.518 on HotpotQA at the 3B scale (from 0.252 base; +105%), compared with 0.430 for the best GRPO checkpoint and 0.000 for the final GRPO checkpoint. CIGPO maintains meaningful reward variance and avoids zero-advantage lock-in throughout training. These results identify reward-variance collapse as a concrete failure mode of outcome-only GRPO and show that turn-level IG rewards can prevent it in this HotpotQA setting.
- Abstract(参考訳): 結果のみの強化学習によるマルチターンエビデンス読解エージェントのトレーニングは、中間旋回が直接クレジットをほとんど受け取らないため不安定である。
Qwen2.5-3B-InstructによるHotpotQA実験では、GRPOは最初(標準F1 0.430)改善されたが、その後100%フォーマット違反の出力に崩壊する。
トレーニングログの診断では、ゼロアドバンテージロックイン機構が明らかにされている: すべてのサンプルトラジェクトリは、最小フォーマットペナルティ(-2.0)を受け取り、グループ相対的なアドバンテージが消滅し、ポリシーの段階的な損失がゼロになる。
本研究では,各ターン当たりの報酬を中間的エビデンス・リード・ターンに割り当てることで,GRPOの集団相対的優位性が要求する変動を保存するために,グループ報酬分布が1つの値に崩壊することを防ぐ。
コンテクスト情報ゲインポリシー最適化(CIGPO)は,凍結参照モデルの対数類似度をターン毎の信号として使用することにより,この戦略を実装している。
CIGPOはIGとF1の報酬の正規化とIG-weightのカリキュラムを別々に行い、3Bスケール(0.252ベース+105%)でHotpotQAの0.518の標準F1に達し、GRPOチェックポイントは0.430、最終GRPOチェックポイントは0.000に達した。
CIGPOは有意義な報酬分散を維持し、トレーニングを通じてゼロアドバンテージロックインを避ける。
これらの結果から,報奨分散崩壊は結果のみのGRPOの具体的な失敗モードであり,このHotpotQA設定ではターンレベルのIG報酬が防止可能であることが示された。
関連論文リスト
- OR Else: A Differentiable Trust Region for Policy Optimization [2.51067108081605]
我々は、スムーズな片側飽和ルールである出力リセット(OR)が、大規模言語モデルのポストトレーニングに有用な代替手段であるかどうかを問う。
PPO-Clip と PPO-OR をGAE で比較し,GRPO-OR とGRPO-OR をグループ相対的優位性で比較した。
論文 参考訳(メタデータ) (2026-07-20T17:07:40Z) - VeriGate: Verifier-Gated Step-Level Supervision for GRPO [51.26100506256885]
グループ相対政策最適化は、検証者に基づく結果報酬を伴う推論モデルをトレーニングするための効果的なレシピである。
GRPO の検証子付き拡張である VeriGate を提案し,これらの制限を3つの設計選択で解決する。
We show that VeriGate improves average accuracy around 20% and 12% for 1.5B and 7B models respectively。
論文 参考訳(メタデータ) (2026-05-28T18:20:32Z) - Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation [13.272542054938258]
非効率な勾配でトレーニングバッチの割合を定量化する最初の指標であるAdvantage Collapse Rate (ACR)を導入する。
次に、仮想報酬サンプルを注入するGRPOの軽量拡張であるAdaptive Virtual Sample Policy Optimization (AVSPO)を提案する。
AVSPOはGRPOに対して58~63%の利害崩壊を減少させ、すべてのモデルスケールで4~6ポイントの一貫した精度向上をもたらす。
論文 参考訳(メタデータ) (2026-05-20T12:57:37Z) - Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning [53.42577591449649]
グループ協力政策最適化は、トレーニングパラダイムをロールアウト競争からチーム協力へとシフトさせる。
GCPOは独立したロールアウトスコアをチームレベルのクレジット割り当てに置き換える。
チームへの平均的な限界貢献に従って、各ロールアウトに対して、グループチームの報酬を再分配する。
論文 参考訳(メタデータ) (2026-05-12T03:20:24Z) - Gradient Starvation in Binary-Reward GRPO: Why Group-Mean Centering Fails and Why the Simplest Fix Works [19.92945464084119]
Group Relative Policy Optimization (GRPO) は、検証可能な報酬からの強化学習のための標準アルゴリズムである。
我々は、真の退化率は、常にジェンセンの不等式によるベルヌーイ予想を超えることを証明している。
固定参照符号の利点である$A=2r-1$は、グループ内の少なくとも1つのサンプルが成功する確率を高めて、pass@$G$失敗降下を実行することを示す。
論文 参考訳(メタデータ) (2026-05-08T12:58:06Z) - RVPO: Risk-Sensitive Alignment via Variance Regularization [13.192921543523283]
本稿では, 利便集約時のリワード間分散をペナルティ化するリスクセンシティブなフレームワークであるReward-Variance Policy Optimization (RVPO)を提案する。
我々はTaylor拡張を通して、LogSumExp(SoftMin)オペレータがスムーズな分散ペナルティとして効果的に働くことを示す。
モデルがより簡単な目的を活かすために難しい制約を無視しないようにすることで、RVPOはHealthBenchの全体的なスコアを改善する。
論文 参考訳(メタデータ) (2026-05-07T06:43:05Z) - EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training [69.32453275232662]
学習した評論家は、利点のばらつきを減らさずに、取得した状態信号を超える推定ノイズを注入できることを示す。
本稿では,各トレーニングステップでバッチレベルのEVを監視し,批判ベースとバッチ平均の利点推定を適応的に切り替えるEVPOを提案する。
論文 参考訳(メタデータ) (2026-04-21T14:07:39Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization [50.91849555841057]
グループ相対政策最適化は大規模推論モデル(LRM)の強化学習手法である
差別学習の原則を基礎として, LRMの強化のための新たな差別的制約付き最適化フレームワークを導入する。
DisCO は GRPO と DAPO などの改良型を著しく上回り、GRPO の7%、DAPO の6% を平均的に上回っている。
論文 参考訳(メタデータ) (2025-05-18T11:08:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。