論文の概要: Zero Collapse: A Failure Mode of Policy Gradient Methods in Discontinuous Reward Environments
- arxiv url: http://arxiv.org/abs/2605.30896v1
- Date: Fri, 29 May 2026 06:29:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.421323
- Title: Zero Collapse: A Failure Mode of Policy Gradient Methods in Discontinuous Reward Environments
- Title(参考訳): ゼロ崩壊:不連続リワード環境における政策勾配手法の失敗モード
- Abstract要約: 例えば、第1価格のオークションでは、入札者は特定の閾値を越えるまでゼロ報酬を受け取り、その後、入札が増加するにつれて報酬が減少する。
これにより、鋭い境界で区切られた平坦でゼロ逆領域の風景が生まれる。
探索と勾配に基づく更新は、最適な高逆領域をオーバーシュートし、平坦でゼロ逆のレジームに入る政策を引き起こす可能性があることを示す。
- 参考スコア(独自算出の注目度): 6.893876756714993
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Bidding in repeated auctions is a central challenge for reinforcement learning (RL), combining continuous control with the strategic complexities of digital advertising. While policy gradient and value-based methods seem well-suited for these settings, they often struggle with the discontinuous, "cliff-like" nature of auction reward landscapes. In a first-price auction, for example, a bidder receives zero reward until they cross a specific threshold, after which the reward decreases as the bid increases. This creates a landscape of flat, zero-reward regions separated by sharp boundaries. We identify a fundamental failure mode in this setting termed "zero collapse." We show that stochastic exploration and gradient-based updates can cause policies to overshoot optimal high-reward regions and enter flat, zero-reward regimes. Once there, the lack of an informative gradient signal makes recovery extremely sample-inefficient, effectively trapping the agent. We find that actor-critic methods are particularly susceptible, as biased value estimates can accelerate this movement toward unstable regions. Our contributions include: (1) a mechanistic explanation of how discontinuous rewards lead to vanishing signals and zero collapse; (2) an analysis of the interaction between policy stochasticity and step size; and (3) an empirical demonstration of this phenomenon across REINFORCE and actor-critic variants. We propose practical mitigation strategies involving initialization and architectural choices to improve stability. Finally, we introduce a formal RL framework for auction environments highlighting their unique structural properties.
- Abstract(参考訳): 繰り返しオークションでの入札は、デジタル広告の戦略的複雑さと継続的な制御を組み合わせた強化学習(RL)における中心的な課題である。
政策の勾配と価値に基づく手法はこれらの設定に適しているように見えるが、しばしばオークションの報酬景観の不連続で「クリフのような」性質に苦しむ。
例えば、第1価格のオークションでは、入札者は特定の閾値を越えるまでゼロ報酬を受け取り、その後、入札が増加するにつれて報酬が減少する。
これにより、鋭い境界で区切られた平坦でゼロ逆領域の風景が生まれる。
この設定では、"ゼロ崩壊"と呼ばれる基本的な障害モードを特定します。
確率的探索と勾配に基づく更新は、最適な高逆領域をオーバーシュートし、平坦でゼロ逆のレジームに入る政策を引き起こす可能性があることを示す。
すると、情報的勾配信号の欠如が、回復を極めて非効率にし、エージェントを効果的にトラップする。
バイアス値の推定により不安定な領域への移動が促進されるため,アクター批判手法は特に影響を受けやすい。
コントリビューションには,(1)不連続報酬が信号の消失とゼロ崩壊にどう影響するか,(2)政策確率性とステップサイズとの相互作用の分析,(3)REINFORCEとアクター・クリティカル・バリアントをまたいだこの現象の実証的な実演などが含まれる。
本稿では,安定性向上のための初期化とアーキテクチャ選択を含む実用的緩和戦略を提案する。
最後に,そのユニークな構造特性を強調したオークション環境のための公式なRLフレームワークを提案する。
関連論文リスト
- Across the Loss Landscape with Progressive Growth [51.366966420881646]
成長を漸進的緩和と見なして、より平坦な地域に向けての訓練戦略がいかに成長・最適化されるかを示す。
制御されたおもちゃの流域や現実的なResNet/CI-100環境でこれらの予測を実証的に検証する。
プログレッシブな部分空間成長は、より平坦な解を確実に生成するが、曲率の低減は、普遍的にテスト性能の向上に変換されず、平坦性一般化接続における微妙さを強調している。
論文 参考訳(メタデータ) (2026-08-25T13:50:48Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - Critic-Driven Voronoi-Quantization for Distilling Deep RL Policies to Explainable Models [5.417332705560665]
批判駆動型ボロノイ状態分割法(Critical-Driven Voronoi State Partitioning)と呼ばれる新しいモデルに依存しない手法を提案する。
原方針の批判的価値ネットワークを活用することで、我々は、価値の低い地域において、新しいサブポリスを導入する。
いくつかのよく知られたベンチマークにアプローチを検証し、この蒸留が線形関数の合理的な大きさの集合を用いて元の方針に近づくことを証明した。
論文 参考訳(メタデータ) (2026-05-14T14:38:56Z) - Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic [13.674509321097311]
エージェントが共通の線形部分空間表現を共有する,連合型アクター批判フレームワークについて考察する。
エージェントは、共通部分空間、地域批評家の頭、および地域政策(アクター)を反復的に見積もる。
批判誤差は $tildemathcalO (1/()6sqrtTK)$ で 0 に収束し、ポリシー勾配ノルムは $tildemathcalO (1/()6sqrtTK) で 0 に収束することを示す。
論文 参考訳(メタデータ) (2026-05-14T06:10:31Z) - The Reciprocity Gradient [52.35929743862925]
コミュニケーションは、戦略的相互作用における相互性と協力を維持するための基本である。
学習エージェントに特有の集中的最適化の難しさとして,影響帰属問題を同定し,定式化する。
これを解決するために、公衆の観察から訓練された相手の政策の個人推定器を通して、報酬勾配を明示的に逆伝搬する相互性勾配を導入する。
論文 参考訳(メタデータ) (2026-05-08T16:29:52Z) - On Training in Imagination [69.97419830683606]
最先端のモデルに基づく強化学習手法は、想像上のロールアウトに関するポリシーを訓練する。
学習力学と報酬モデルにおける誤差が回帰や政策最適化に与える影響について検討する。
論文 参考訳(メタデータ) (2026-05-07T12:51:32Z) - Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models [68.45272703833209]
現状のPRMは、逆最適化圧力下で体系的に利用可能であることを示す。
これらの脆弱性を定量化するために、敵の圧力を増大させる3段階の診断フレームワークを導入する。
我々は、PRM-BiasBenchと診断ツールキットをリリースし、デプロイ前にロバストネスの評価を可能にする。
論文 参考訳(メタデータ) (2026-02-20T23:38:03Z) - Proximal Action Replacement for Behavior Cloning Actor-Critic in Offline Reinforcement Learning [22.17044827069627]
安定なアクターによって生成される高価値なアクションに置き換える,プラグアンドプレイのトレーニングサンプル置換器を提案する。
実験の結果、PARはパフォーマンスを継続的に改善し、基礎的なTD3+BCと組み合わせることで最先端にアプローチすることがわかった。
論文 参考訳(メタデータ) (2026-02-07T08:44:27Z) - Catoni-Style Change Point Detection for Regret Minimization in Non-Stationary Heavy-Tailed Bandits [31.212504858546232]
ヘビーテールの片側定常バンディット問題に対処する。
重み付き分布に適した新しいカタニスタイル変化点検出戦略を提案する。
本稿では,この変化点検出戦略と楽観的アルゴリズムを組み合わせたロバストCPD-UCBを提案する。
論文 参考訳(メタデータ) (2025-05-26T14:40:47Z) - Handling Cost and Constraints with Off-Policy Deep Reinforcement
Learning [2.793095554369282]
政治外学習の最も一般的な方法は、学習された状態アクション(Q$)値関数が選択されたデータのバッチに対して最大化されるポリシー改善ステップである。
我々は、この戦略を「混合符号」報酬関数を持つ環境で再考する。
この2つ目のアプローチは、混合符号の報酬を持つ連続的な行動空間に適用した場合、リセットによって拡張された最先端の手法よりも一貫して、著しく優れる。
論文 参考訳(メタデータ) (2023-11-30T16:31:04Z) - Autoregressive Bandits [58.46584210388307]
本稿では,オンライン学習環境であるAutoregressive Banditsを提案する。
報酬プロセスの軽微な仮定の下では、最適ポリシーを便利に計算できることが示される。
次に、新しい楽観的後悔最小化アルゴリズム、すなわちAutoRegressive Upper Confidence Bound (AR-UCB)を考案し、$widetildemathcalO left( frac(k+1)3/2sqrtnT (1-G)のサブ線形後悔を被る。
論文 参考訳(メタデータ) (2022-12-12T21:37:36Z) - Corruption-robust exploration in episodic reinforcement learning [76.19192549843727]
本研究は, システムにおける報酬と遷移確率の両面において, 敵対的腐敗下での多段階・多段階・多段階強化学習について検討した。
我々の枠組みは、汚職の欠如をほぼ最適に後悔する効率的なアルゴリズムをもたらす。
特に,本研究は,根本的強化学習のためのBandit-Feedbackモデルにおいて,純粋にI.d.遷移からの逸脱を保証した最初のサブ線形後悔の保証を提供する。
論文 参考訳(メタデータ) (2019-11-20T03:49:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。