論文の概要: Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection
- arxiv url: http://arxiv.org/abs/2609.10221v2
- Date: Thu, 10 Sep 2026 01:52:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 14:47:34.308961
- Title: Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection
- Title(参考訳): なぜ列挙できるのか? ゲノムツール選択のための厳密なポリシー最適化
- Abstract要約: 凍結した推論子による強化学習は、外部ツールが呼び出すポリシーを教える一般的なレシピとなっている。
本手法は, ツール・サブセット空間の完全化が可能な専門的な科学的環境において, 構造的に不一致となることを示す。
FGPOを導入し、すべてのツールサブセットをスコアし、正確なアクション期待を最適化します。
- 参考スコア(独自算出の注目度): 23.92446384027772
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning over a frozen reasoner has become a common recipe for teaching a policy which external tools to invoke. We show that this recipe becomes structurally mismatched in specialist scientific settings where the complete tool-subset space is enumerable. There, a small set of recurring computational capabilities covers the domain, so the space of tool subsets is combinatorial yet small enough to enumerate, and GRPO still estimates an action expectation from a handful of sampled rollouts. Worse, the approximation degrades as training succeeds: as the policy concentrates on preferred subsets it resamples them, sampled rewards collide, and the group-normalized advantage vanishes. On genomic reasoning the fraction of questions yielding no reward signal rises from 0.2% under a uniform reference policy to 20.8% after GRPO training. As a remedy, we introduce FGPO (Full-Group Policy Optimization), which (1) scores every tool subset and optimizes the exact action expectation, so each update sees the complete action space, and (2) precomputes the reward of each question--subset pair into an exhaustive table, removing frozen-reasoner calls from the training loop entirely. Across five frozen reasoners and three genomic benchmarks, FGPO outperforms GRPO in all 15 settings by 6.75 points on average and up to 14.20, while a standard on-demand GRPO schedule would require 2.4 times as many frozen-reasoner reward evaluations and, on GenomeQA, FGPO cuts invoked tools per question from 2.36 to 1.40.
- Abstract(参考訳): 凍結した推論子による強化学習は、外部ツールが呼び出すポリシーを教える一般的なレシピとなっている。
本手法は, ツール・サブセット空間の完全化が可能な専門的な科学的環境において, 構造的に不一致となることを示す。
ここでは、連続する計算能力の小さなセットがドメインをカバーしているため、ツールサブセットの空間は、列挙できるほど小さいが、GRPOは、少数のサンプルロールアウトからのアクション期待を推定している。
さらに悪いことに、トレーニングが成功するにつれて近似は劣化し、ポリシーが望ましい部分集合に集中すると、それらを再サンプリングし、サンプル化された報酬が衝突し、グループ正規化された優位性が消滅する。
ゲノム推論では、報酬信号が得られない質問の割合は、統一参照ポリシーの下で0.2%からGRPOトレーニング後の20.8%に上昇する。
FGPO(Full-Group Policy Optimization)を導入し、(1)ツールサブセットのスコアを取得し、正確なアクション期待を最適化し、各更新が完全なアクション空間を見ることができるようにし、(2)各質問-サブセットペアの報酬を徹底したテーブルにプリコンパイルし、トレーニングループからフリーズ・レゾナー呼び出しを完全に除去する。
5つの凍結推論器と3つのゲノムベンチマークで、FGPOは平均で6.75ポイント、最大14.20ポイントでGRPOを上回り、標準のオンデマンドGRPOスケジュールでは2.36から1.40までのフリーズ・リーソンの報酬評価の2.4倍の時間を要する。
関連論文リスト
- Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning [21.43528083212271]
自己回帰的なロールアウト生成は、強化学習における大きな計算コストである。
PNPOは累積比を、各因果接頭辞に沿った確率比の平均に置き換える。
PNPOは1つのエポックでGSPOを一貫して上回るわけではない。
4エポックのPNPOは150回のロールアウトの後に49.66のAvg@32に到達し、1エポックの600回の後に到達した49.56に匹敵する。
論文 参考訳(メタデータ) (2026-08-02T18:02:03Z) - CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents [1.4298580363875282]
結果のみの強化学習によるマルチターンエビデンス読解エージェントのトレーニングは、中間旋回が直接クレジットをほとんど受け取らないため不安定である。
Qwen2.5-3B-InstructによるHotpotQA実験では、GRPOは最初(標準F1 0.430)改善されたが、その後100%フォーマット違反の出力に崩壊する。
本研究では,各ターン当たりの報酬を中間的エビデンス読解ターンに割り当てることで,グループ報酬分布が1つの値に崩壊するのを防ぐ,分散テキスト戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T11:50:29Z) - Agent Explorative Policy Optimization for Multimodal Agentic Reasoning [97.64835302176056]
エージェント推論は2つの行動と構造的非対称性(思考と道具の使用)をインターリーブする。
GRPOのような標準的なRLレシピでは、ギャップはトレーニング中に2つの診断症状として現れる。
AXPO (Agent eXplorative Policy Optimization) を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:36:39Z) - Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation [13.272542054938258]
非効率な勾配でトレーニングバッチの割合を定量化する最初の指標であるAdvantage Collapse Rate (ACR)を導入する。
次に、仮想報酬サンプルを注入するGRPOの軽量拡張であるAdaptive Virtual Sample Policy Optimization (AVSPO)を提案する。
AVSPOはGRPOに対して58~63%の利害崩壊を減少させ、すべてのモデルスケールで4~6ポイントの一貫した精度向上をもたらす。
論文 参考訳(メタデータ) (2026-05-20T12:57:37Z) - Beyond Mode Collapse: Distribution Matching for Diverse Reasoning [69.88237286885065]
GRPOのようなオンライン強化学習手法はモード崩壊に悩まされる。
このことは、逆KL最小化のモード探索行動に由来することを示す。
KL最小化の原理的近似によりモード崩壊を防止するDMPOを提案する。
論文 参考訳(メタデータ) (2026-05-19T07:13:00Z) - Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL [6.435733307123974]
GRPO(Group-relative RL Training)は、トレーニングプロンプト毎に少数の並列ロールアウトをサンプリングする。
グループ内の報酬を拡大して、軌道ごとの利点を計算する。
プロンプトのロールアウトが同じ報酬で終わるとき、群は報酬の分散をゼロとし、勾配を持たない。
論文 参考訳(メタデータ) (2026-05-07T07:41:09Z) - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing [79.88256756334327]
自己蒸留政策最適化(SDPO)は、より密集したロジットレベルの監視を提供することによってこの問題に対処する。
サンプル制御ポリシー最適化(SRPO)を提案する。
SRPOは、試料をGRPOの報酬整合強化に向け、サンプルをSDPOの目標ロジットレベルの補正に向ける。
論文 参考訳(メタデータ) (2026-04-02T17:29:18Z) - iGRPO: Self-Feedback-Driven LLM Reasoning [88.83313431248473]
大規模言語モデル(LLM)は複雑な数学的問題を解く上で有望であるが、正確で一貫したソリューションを生み出すには至っていない。
IGRPO(Iterative Group Relative Policy Optimization)は、モデル生成ドラフトを通じて動的自己条件を追加するGRPOの2段階拡張である。
一致するロールアウト予算の下では、iGRPOはGRPOをベースモデルで一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-09T18:45:11Z) - Self-Hinting Language Models Enhance Reinforcement Learning [37.311361929798714]
我々は、権限付き監督(SAGE)を備えた自己隠れ型GRPOを提案する。
SAGEはトレーニング中に特権付きヒントを注入し、同じ端末検証者報酬の下でロールアウト分布を再生成する。
3つのLSMを持つ6つのベンチマーク実験の結果、SAGEはGRPOを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-03T05:56:20Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models [77.16976971950785]
本稿では、推論モデルの学習を高速化するために、CPPO(Completion Pruning Policy Optimization)を提案する。
CPPOは絶対的なアドバンテージを低く保ち、勾配計算や更新に必要な数を大幅に削減する。
実験の結果、CPPOはGSM8Kで最大7.98タイム、Mathで3.48タイムで最大7.48タイム、オリジナルのGRPOと比較して精度を保っている。
論文 参考訳(メタデータ) (2025-03-28T11:30:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。