論文の概要: The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and What Actually Works
- arxiv url: http://arxiv.org/abs/2607.21273v1
- Date: Thu, 23 Jul 2026 12:50:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.414917
- Title: The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and What Actually Works
- Title(参考訳): The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and really working
- Authors: Yu Wang,
- Abstract要約: 群正規化RLの下では、ポテンシャルに基づく予測報酬が全てのランを退化吸収状態に駆動することを示す。
単一エピソードアブレーションは原因を和らげる -- GRPOの正規化だけを取り除くことで、破滅からベースラインパリティへと同じ報酬が変わる。
我々の中心的な洞察はこれを一般化している: z-scoring amplify は、全フェイル群が支配的である間、高密度信号の群内分散である。
- 参考スコア(独自算出の注目度): 3.040305634723913
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dense per-step supervision is an appealing remedy for sparse-reward, long-horizon LLM agents: reward the agent for predicting its next observation, and memory should follow. We show that under group-normalized RL (GRPO), this recipe does not merely fail -- it destroys the policy. Across Qwen3-1.7B/4B/8B on ALFWorld, a potential-based prediction reward drives every run into a degenerate absorbing state (prediction accuracy -> 1.0, task success -> 0,episode length pinned at the horizon): the "dark room" pathology, built automatically by the optimizer. A single-factor ablation localizes the cause -- removing only GRPO's std normalization turns the same reward from catastrophic (0%) into baseline parity -- and a two-line proposition explains why: in all-fail groups the z-scored advantage is invariant to the shaping coefficient, so bounded rewards become unbounded pressure and annealing cannot help. Our central insight generalizes this: what z-scoring amplifies is a dense signal's within-group variance while all-fail groups dominate, so signals whose variance decays by mastery are structurally amplifier-safe.This variance-profile criterion retrodicts our collapses, carries preregistered predictions for arms that had not yet run, and is consistent with published reward-channel successes (a compatibility check, not an independent test). Finally, a controlled signal-delivery matrix (identical signal, varying only the consumption mechanism) shows the reward channel is at best neutral while the auxiliary-loss channel gains ~20 points -- and a shuffled-gold placebo matches the true-gold arm, so the gap survives without correct labels. Endpoints are single-seed; seed replication and group-size controls are preregistered and in progress.
- Abstract(参考訳): デンス・パー・ステップ(Dense per-step)は、スパース・リワード(sparse-reward)、ロングホライゾン(long-horizon)のLSMエージェントに対して魅力的な治療法である。
グループ正規化RL(GRPO)の下では、このレシピは単に失敗するだけでなく、ポリシーを破壊します。
ALFWorld上のQwen3-1.7B/4B/8Bをまたいで、ポテンシャルに基づく予測報酬は、全ての実行を縮退した吸収状態(予測精度 -> 1.0、タスク成功 -> 0、水平線に固定されたエピソード長)に駆動する。
単一要素のアブレーションは原因をローカライズする -- GRPOのstd正規化のみを除去すると破滅的(0%)からベースラインパリティへと同じ報酬が変換される。
我々の中心的な洞察はこれを一般化している: z-scoring Amplifyは、高密度信号の内集団分散であり、全フェイル群が支配するので、マスターによる分散減衰が構造的にアンプセーフである信号は、我々の崩壊を再現し、まだ実行されていない腕の事前登録予測を行い、発行された報酬チャネルの成功(互換性チェック、独立テストではない)と一致している。
最後に、制御された信号配信行列(ID信号、消費機構のみの変更)は、報酬チャネルが最も中立であることを示し、補助損失チャネルは20点まで上昇し、シャッフル金のプラセボは真金の腕と一致するため、ギャップは正確なラベルなしで存続する。
エンドポイントはシングルシードで、シードレプリケーションとグループサイズのコントロールは事前に登録され、進行中である。
関連論文リスト
- Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair [36.31472731207028]
このようなフィードバックの下で,標準GRPOの信号再構成について検討する。
完全な信号整形GRPOは、厳密なコンパイルとシーケンスの精度を改善する。
論文 参考訳(メタデータ) (2026-05-08T05:41:25Z) - Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime [28.346931878148524]
Prefix Sampling (PS)は、自己生成した軌跡の接頭辞を再生し、スキュードグループをこの体制に向けて操る。
PSは評価変数のベースラインのハイスコア状態に達し、2.01xと1.55xのエンドツーエンドのウォールクロックスピードアップを提供する。
AIME 2025は4Bと8Bで同じパスレート制御パターンを示した。
論文 参考訳(メタデータ) (2026-05-06T16:44:38Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - A Nonasymptotic Theory of Gain-Dependent Error Dynamics in Behavior Cloning [4.822598110892847]
位置制御ロボットの動作クローニングポリシーは、基礎となるPDコントローラの閉ループ応答を継承する。
我々は、ゲイン依存閉ループ力学により、ガウス以下の独立な動作誤差が伝播することを示す。
論文 参考訳(メタデータ) (2026-04-15T23:53:09Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning [60.00161035836637]
グループ相対政策最適化は、推論タスクのための有望な批判のない強化学習パラダイムとして登場した。
我々は,各トークンがモデルの最終回答にどの程度影響するかに基づいて,利益を再分配する,きめ細かい信用割当機構であるOutcome-grounded Advantage Reshaping (OAR)を紹介した。
OAR-Gは計算オーバーヘッドを無視して同等のゲインを達成し、どちらも強力なGRPOベースラインをはるかに上回っている。
論文 参考訳(メタデータ) (2026-01-12T10:48:02Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Quantile Advantage Estimation for Entropy-Safe Reasoning [44.192277495613695]
RLVRによる強化学習はLLM推論を強化するが、エントロピー崩壊とエントロピー爆発の間のトレーニングはしばしば振動する
いずれのハザードも値のないRLで使われる平均ベースラインに辿り着くが、これは不適切に報酬のアウトリージの下で負のアドバンテージサンプルをペナルティ化する。
本稿では,平均値をグループ単位のK量子基底線に置き換えた量子アドバンテージ推定(QAE)を提案する。
論文 参考訳(メタデータ) (2025-09-26T17:37:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。