論文の概要: Follow the Winners: Conservative Policy Improvement with the Cross-Entropy Method for Critic-Free RFT
- arxiv url: http://arxiv.org/abs/2610.03361v1
- Date: Fri, 02 Oct 2026 14:24:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.414558
- Title: Follow the Winners: Conservative Policy Improvement with the Cross-Entropy Method for Critic-Free RFT
- Title(参考訳): Follow the Winners: The Cross-Entropy Method for Critic-free RFT
- Abstract要約: エージェント型大規模言語モデルに対する批判のない強化微調整(RFT)は、GRPOスタイルの手法によって行われることが多い。
批判のないポリシー学習アルゴリズムであるtextitFollow the Winners (FTW) を提案する。
FTWは、グループロールアウトをリプレイバッファサンプルの順序付きフィルタに置き換え、リターンの順序統計で濃度を得る。
- 参考スコア(独自算出の注目度): 3.293184808542474
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Critic-free reinforcement fine-tuning (RFT) for agentic large language models is often done through GRPO-style methods, which compute a group baseline over repeated rollouts to reduce target variance. However, this setup is ill-suited to agents acting in stateful environments such as live services or security sandboxes, where repeated rollouts are impractical to obtain and aggressive updates entrench the noise of long, sparsely verified trajectories. We propose \textit{Follow the Winners} (FTW), a critic-free policy-learning algorithm that adapts the cross-entropy method to RFT, replacing group rollouts with an ordinal filter on replay-buffer samples that yields polynomial concentration in the order statistic of returns. We derive FTW through a control-as-inference lens, which also recovers GRPO and DPO as specific modelling choices, identifying GRPO as risk-neutral while DPO and FTW share a bounded risk-seeking offset that FTW controls. We identify this offset as an inherent trade-off of variance reduction through ordinal filters on samples, whereas a critic model induces a different trade-off between bias and variance. Scaled to agentic LLM post-training, FTW matches GRPO and PPO on Sokoban and Search-R1 baselines, showing a viable trade-off from a value model or group rollouts to CPU memory.
- Abstract(参考訳): エージェント型大規模言語モデルに対する批判のない強化微調整(RFT)はGRPOスタイルの手法によって行われることが多い。
しかし、このセットアップは、ライブサービスやセキュリティサンドボックスのようなステートフルな環境で働くエージェントには適していない。
本稿では,RFT にクロスエントロピー法を適用した批判のないポリシー学習アルゴリズムである \textit{Follow the Winners} (FTW) を提案する。
DPOとFTWはFTWが制御する有界リスク探索オフセットを共有しているのに対して、FTWは特定のモデリング選択としてGRPOとDPOを復元し、GRPOをリスク中立とみなす。
我々は、このオフセットを、サンプル上の順序フィルタによる分散低減の本質的にのトレードオフとみなし、一方、批判モデルはバイアスと分散のトレードオフを誘導する。
エージェントLDMのポストトレーニングにスケールして、FTWはSokobanとSearch-R1のベースライン上でGRPOとPPOとをマッチングし、値モデルやグループロールアウトからCPUメモリへのトレードオフを可能にする。
関連論文リスト
- Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training [15.04239819634502]
顕著なタスク分布シフトの下では、代表的RFTアルゴリズムをまたいで忘れることが急速にエスカレートする。
本稿では,リスク対応政策最適化(RAPO)を提案する。
RAPOは、新しいタスクの競争力を保ちながら、RLOOのバックボーンに対する最後の忘れを79.8%削減する。
論文 参考訳(メタデータ) (2026-08-04T13:40:03Z) - Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models [61.74572554094633]
比クリッピングは流れモデルに不適であると主張する。
本稿では,比クリッピングを分岐近位制約に置き換えるFlow-DPPOを提案する。
実験により,フローDPPOはKL近位効率が向上し,高い報酬が得られることが示された。
論文 参考訳(メタデータ) (2026-06-09T15:59:57Z) - BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization [23.13988703785064]
大規模言語モデル(LLM)における社会的バイアスの緩和は、異なるアライメントの課題を示す。
直接選好最適化(DPO)は、オフライントレーニングに固有の探索の欠如によって制限される。
PPO(Proximal Policy Optimization)は、潜在的に信頼性の低い批評家の推定により、トレーニング不安定につながる可能性がある。
論文 参考訳(メタデータ) (2026-06-03T12:31:42Z) - One-Way Policy Optimization for Self-Evolving LLMs [63.8638342097375]
RLVR(Reinforcement Learning with Verifiable Rewards)は,Large Language Models(LLMs)の推論能力を拡張するための,有望なパラダイムとなっている。
本稿では,最適化方向を更新等級から切り離す手法である1-Way Policy Optimization (OWPO)を提案する。
実験の結果,OWPOはDAPO,OPD,MOPDなどの強いベースラインより優れていた。
論文 参考訳(メタデータ) (2026-05-21T08:25:27Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - Flow Matching Policy with Entropy Regularization [16.47598359293598]
Flow Matching Policy with Entropy Regularization (FMER)は、通常の微分方程式(ODE)ベースのオンラインRLフレームワークである。
FMERは、フローマッチングを通じてポリシーをパラメータ化し、最適な輸送によって動機付けられたストレートな確率経路に沿ってアクションをサンプリングする。
スパースマルチゴールのFrankaKitchenベンチマークの実験は、FMERが最先端の手法より優れていることを示した。
論文 参考訳(メタデータ) (2026-03-18T13:00:20Z) - When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO [18.988527161000203]
グループ相対政策最適化(GRPO)は、推論モデルを訓練するための効果的な方法として登場した。
本稿では,GRPOの目的が正解率と正解率とのマージンを暗黙的に最大化することを示す。
本稿では,モデルが相互参照を成功させる機構であるバイラテラルコンテキストコンディショニング(BICC)を提案する。
論文 参考訳(メタデータ) (2026-03-13T16:25:02Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization [60.87651283510059]
Group Relative Policy Optimization (GRPO) はLLM推論を効果的にスケールするが、計算コストは禁じている。
本研究では,非バイアス勾配推定を保ちながら動的プルーニングを可能にする動的プルーニングポリシー最適化(DPPO)を提案する。
刈り込みによって引き起こされるデータの空間性を軽減するため,ウィンドウベースの欲求戦略であるDense Prompt Packingを導入する。
論文 参考訳(メタデータ) (2026-03-04T14:48:53Z) - G$^2$RPO: Granular GRPO for Precise Reward in Flow Models [74.21206048155669]
本稿では,サンプリング方向の高精度かつ包括的な報酬評価を実現する新しいグラニュラー-GRPO(G$2$RPO)フレームワークを提案する。
複数の拡散スケールで計算された利点を集約するマルチグラニュラリティ・アドバンテージ・インテグレーション・モジュールを導入する。
G$2$RPOは既存のフローベースGRPOベースラインを著しく上回る。
論文 参考訳(メタデータ) (2025-10-02T12:57:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。