論文の概要: When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game
- arxiv url: http://arxiv.org/abs/2610.03598v1
- Date: Fri, 02 Oct 2026 17:03:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.499115
- Title: When a Correct Reward Is Not Enough: Diagnosing and Guiding PPO in an Analytically Solved Broker-Trader Game
- Title(参考訳): 正解したブローカー・トレーダゲームにおけるPPOの診断と誘導
- Abstract要約: 強化学習は、金融最適制御問題にますます利用されている。
本稿では,ポリシー最適化エージェントがブローカーを置き換え,取引速度を選択する,連続時間ブローカー-トレーダゲームを提案する。
我々は、ブローカーの継続的な支払いから有限ステップの報酬を導き、グリッドリファインメントを通じてその個別の実装を検証する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning (RL) is increasingly used for financial optimal-control problems when complex dynamics make analytical strategies difficult to obtain. There are financial mathematics literactures which provides many solved models whose equations and controls could evaluate and guide learning; we ask whether RL can exploit these results. We place a proximal policy optimisation (PPO) agent in an analytically solved continuous-time broker--trader game. PPO replaces the broker and chooses its trading speed while interacting with an informed trader and stochastic uninformed order flow. We derive a finite-step reward from the broker's continuous-time payoff and verify its discrete implementation through grid refinement and an exact one-step identity. With zero uninformed flow, a validation-selected PPO--FFNN approaches the reference action. With stochastic uninformed flow, the tested PPO--FFNN and PPO--LSTM remain inaccurate, although supervised learning confirms that their actors can represent the action. Monte Carlo diagnostics show that their critics do not reliably rank nearby actions; potential-based reward shaping also gives no reliable improvement. Under partial information, a causal certainty-equivalent controller based on the broker's observable history remains close to the reference, while PPO has larger errors and lower payoffs. Finally, we freeze the analytical policy and train PPO to adjust it after the execution cost changes. Halving the cost yields a repeatable improvement that closes \(2.22\%\) of the gap to the changed-cost reference. The analytical solution therefore provides both a benchmark for diagnosing RL and a useful starting policy for adaptation.
- Abstract(参考訳): 強化学習(RL)は、複雑な力学が解析的戦略を得るのを難しくするときに、金融最適制御問題に益々用いられる。
金融数学のリテラクチャは、方程式や制御が学習を評価・誘導できる多くの解決されたモデルを提供しており、RLがこれらの結果を活用できるかどうかを問う。
我々は、分析的に解決された実時間ブローカー-トレーダゲームにPPOエージェントを配置する。
PPOはブローカーをリプレースし、情報トレーダーと確率的非インフォームド・オーダーフローと相互作用しながら取引速度を選択する。
我々は、ブローカーの継続的な時間支払いから有限ステップの報酬を導き、グリッドリファインメントと正確に1ステップのアイデンティティを通じて、その個別の実装を検証する。
ゼロインフォームドフローでは、検証選択されたPPO-FFNNが参照アクションに近づく。確率的未インフォームドフローでは、テストされたPPO-FFNNとPPO-LSTMは不正確なままであるが、教師付き学習はアクターがアクションを表現できることを確認した。
モンテカルロの診断は、彼らの批評家が近隣の行動を確実にランク付けしていないことを示している。
部分的な情報の下では、ブローカーの観測可能な履歴に基づく因果的確実性等価コントローラが参照に近づき、PPOはより大きなエラーと低いペイオフを持つ。
最後に、解析ポリシーを凍結し、PPOを訓練し、実行コストが変化した後で調整する。
コストのハービングは、変更したコスト参照とのギャップの(2.22\%\)を閉じる繰り返し可能な改善をもたらす。
したがって、解析解は、RLの診断のためのベンチマークと、適応のための有用な開始ポリシーの両方を提供する。
関連論文リスト
- EasyPPO: Stabilizing the Critic Is Key [57.76826550536797]
PPO(Proximal Policy Optimization)の主な強みは、その学習的批判である。
批判は、大規模言語モデルの強化学習における不安定性の主要な原因でもある。
EasyPPOはフルトレーニングの地平線を通して安定しており、バニラPPO、VAPO、HL-GaussPPOより一貫して優れている。
論文 参考訳(メタデータ) (2026-09-29T06:15:00Z) - ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy [45.28312869386833]
モードローカル・サロゲート・エントロピーに基づくトークンレベルの信用割当フレームワークを提案する。
ACPOは、成功したロールアウトにおける不確実な決定と失敗したロールアウトにおける過信トークンを強調して、ポリシー更新を非対称に調整する。
AIME 2025やHumanEvalProなどの数学的推論とコーディングベンチマークの実験は、ACPOが強いRLベースラインよりも一貫して改善していることを示している。
論文 参考訳(メタデータ) (2026-07-03T09:14:27Z) - When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming [0.0]
近似ポリシ最適化(PPO)を用いたコンパクトRLHFパイプラインの失敗モードに関する実証的研究について述べる。
我々は、学習した報酬の方向、判定スコア、および平均判定スコアを用いて、チェックポイント間の一致した遷移を分類する。
ROC-AUC 0.821による将来の行レベルの報酬ハッキングを予測し、行レベルの分析では、チェックポイント平均が12の3つの設定で見逃すような局所的な報酬ハックが見つかる。
論文 参考訳(メタデータ) (2026-06-02T06:55:52Z) - GAE Falls Short in Imperfect-Information Self-Play Reinforcement Learning [37.42112473325871]
不完全な情報ゲームにおけるセルフプレイ強化学習では、エージェントは部分的な観察可能性の下で行動する必要がある。
PPO(Proximal Policy Optimization)は、経験的成功を強く達成しているが、今後の行動のサンプリングにより、さらなるばらつきに悩まされている。
Q$-boosting, a variance-reduced advantage estimator based on a central action-value critic, and proposed Variance-reduced Policy Optimization (VRPO)。
VRPOは、Dou DizhuやHeads-Up No-Limit Texas Hold'emといった中規模から大規模まで、一貫して強力なパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-05-19T01:07:39Z) - $φ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models [58.217707070069885]
本稿では,LMMにおける連続学習のためのFairness Direct Preference Optimization (FaiDPO, $-DPO) フレームワークを提案する。
まず,直接選好最適化(DPO)に基づく新たな連続学習パラダイムを提案する。
大規模な実験とアブレーション研究は、提案された$-DPOが複数のベンチマークでステート・オブ・ザ・アートのパフォーマンスを達成することを示している。
論文 参考訳(メタデータ) (2026-02-26T04:14:33Z) - Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models [68.45272703833209]
現状のPRMは、逆最適化圧力下で体系的に利用可能であることを示す。
これらの脆弱性を定量化するために、敵の圧力を増大させる3段階の診断フレームワークを導入する。
我々は、PRM-BiasBenchと診断ツールキットをリリースし、デプロイ前にロバストネスの評価を可能にする。
論文 参考訳(メタデータ) (2026-02-20T23:38:03Z) - WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning [67.45237332694025]
グループ相対政策最適化は、複雑な推論に基づいて言語モデルを訓練するのに効果的である。
Weakly Supervised GRPOを提案し、端末報酬を正当性を考慮したガイダンスに変換することにより、ロールアウト効率を向上させる。
論文 参考訳(メタデータ) (2026-02-19T02:43:35Z) - Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning [59.76691952347156]
強化学習(RL)は,大規模言語モデル(LLM)の推論能力向上のための強力なフレームワークとして登場した。
既存のRLアプローチの多くは疎結果報酬に依存しており、部分的に成功した解では正しい中間段階を信用できない。
本稿では、PRMを用いてRL中の最初のエラーをローカライズする検証済み事前修正ポリシー最適化(VPPO)を提案する。
論文 参考訳(メタデータ) (2026-01-26T21:38:20Z) - VinePPO: Refining Credit Assignment in RL Training of LLMs [66.80143024475635]
我々は,言語環境の柔軟性を利用してモンテカルロをベースとした推定値を計算する,簡単なアプローチであるVinePPOを提案する。
本手法は,MATHおよびGSM8Kデータセット間のPPOおよび他のベースラインをウォールクロック時間以下で連続的に上回る。
論文 参考訳(メタデータ) (2024-10-02T15:49:30Z) - Explainable Post hoc Portfolio Management Financial Policy of a Deep Reinforcement Learning agent [44.99833362998488]
我々はポートフォリオ管理のための新しい説明可能な深層強化学習(XDRL)アプローチを開発した。
方法論を実践することにより、エージェントの行動を予測する時間内に解釈し、投資政策の要件に従うかどうかを評価することができる。
論文 参考訳(メタデータ) (2024-07-19T17:40:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。