論文の概要: PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading
- arxiv url: http://arxiv.org/abs/2610.01325v1
- Date: Thu, 01 Oct 2026 08:49:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.01928
- Title: PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading
- Title(参考訳): PPO-HRAP:リスク制御トレーディングのためのハイブリッドレジーム対応ポリシによるポリシー最適化
- Abstract要約: 本稿では,PPO-HRAPについて提案する。
2020-2022年のSPYテストウィンドウでは、PPO-HRAPは27.62%のリターン、8.48%のリターン、0.6447シャープ比、0.4592カルマー比を達成した。
- 参考スコア(独自算出の注目度): 2.571080266714288
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization with an interpretable regime prior. The agent observes both market features and portfolio-state variables, receives a reward combining portfolio log return, VIX-conditioned drawdown-increase penalty, target-exposure deviation, and turnover cost, and executes a blended action between the PPO actor output and a regime-derived target exposure. On the held-out 2020-2022 SPY test window, PPO-HRAP achieves 27.62% total return, 8.48% annualized return, 0.6447 Sharpe ratio, 0.8588 Sortino ratio, and 0.4592 Calmar ratio, while reducing maximum drawdown from 34.10% for Buy and Hold to 18.47%. Across five SPY seeds, PPO-HRAP remains stable with mean total return $0.2725 \pm 0.0109$ and mean Sharpe ratio $0.6219 \pm 0.0565$. Single-run cross-asset tests on QQQ and DIA further show that the proposed method ranks first on total return and Sharpe ratio for all three reported assets. These results suggest that blending learned actions with a volatility-aware regime prior is a practical way to improve risk-adjusted trading behavior, although the current policy still incurs high turnover and cross-asset robustness beyond SPY remains limited to single-run evidence.
- Abstract(参考訳): トレーディングのための強化学習は、しばしばドローダウンコントロールと逆の参加のバランスをとるのに苦労する。
利益のみの政策は上向きの資産に対する長期の受動的露出に向けて崩壊する可能性がある一方、積極的なリスク報酬は不安定な期間に過度に防御的になる可能性がある。
本稿では,PPO-HRAPについて提案する。
エージェントは、市場特徴とポートフォリオ状態変数の両方を観察し、ポートフォリオログリターン、VIX条件のドローダウンインクリエーションペナルティ、ターゲット露光偏差、ターンオーバーコストを組み合わせた報酬を受け取り、PPOアクタ出力とレギュラー由来のターゲット露光とのブレンドアクションを実行する。
2020-2022年のSPYテストウィンドウでは、PPO-HRAPは総リターンが27.62%、年間リターンが8.48%、シャープ比が0.6447、ソルティーノ比が0.8588、カルマー比が0.4592となり、購入とホールドの34.10%から18.47%に減少している。
5つのSPY種全体で、PPO-HRAPは平均戻り値が0.2725 \pm 0.0109$であり、シャープ比が0.6219 \pm 0.0565$である。
さらに、QQQとDIAの単ランクロスアセスト試験により、提案手法は、報告された3つの資産の総リターンとシャープ比に優先的にランク付けされることを示した。
これらの結果は、学習行動とボラティリティを意識した事前の体制を融合させることは、リスク調整された取引行動を改善するための実践的な方法であることを示しているが、現在の政策は依然として高いターンオーバーを引き起こし、SPYを超えるクロスアセスメントの堅牢性は、単発の証拠に限られている。
関連論文リスト
- Financially Guided Deep Portfolio Optimization [2.9121235632815607]
我々は、主要な金融指標の差別化可能なサロゲートを直接最適化するエンドツーエンドフレームワークを提案する。
当社のフレームワークは,同種のポートフォリオ,S&P 500,従来の手法を一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-16T22:30:15Z) - Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback [1.2362187555287152]
ファイナンスにおける予測評価は、ポイント予測エラーに基づく集計精度測定と予測精度テストに依存している。
本稿では,中間決定プロセス自体を評価することによって,精度試験を補完する行動予測評価手法を提案する。
論文 参考訳(メタデータ) (2026-05-07T06:31:34Z) - Near-Future Policy Optimization [51.760544033045726]
検証可能な報酬(RLVR)による強化学習は、学習後の中核的なレシピとなっている。
textbfNear-Future textbfPolicy textbfOptimization (textbfNPO)を提案する。
論文 参考訳(メタデータ) (2026-04-22T16:20:41Z) - Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing [79.88256756334327]
自己蒸留政策最適化(SDPO)は、より密集したロジットレベルの監視を提供することによってこの問題に対処する。
サンプル制御ポリシー最適化(SRPO)を提案する。
SRPOは、試料をGRPOの報酬整合強化に向け、サンプルをSDPOの目標ロジットレベルの補正に向ける。
論文 参考訳(メタデータ) (2026-04-02T17:29:18Z) - When Alpha Breaks: Two-Level Uncertainty for Safe Deployment of Cross-Sectional Stock Rankers [0.0]
横断的なランキングモデルは、ポイント予測が十分であるかのように配置されることが多い。
非定常状態では、ランキングは政権交代時に失敗することがある。
我々は,ランクずれの予測により,直接てんかん不確かさ予測をランキングに適応させる。
論文 参考訳(メタデータ) (2026-02-24T14:02:24Z) - Explainable Regime Aware Investing [0.0]
本稿では,厳密な因果関係を持つ Wasserstein Hidden Markov Model に基づくレシック・アウェア・ポートフォリオ構築フレームワークを提案する。
ワッサーシュタインHMMレジームは、等重量およびSPXの買いと持ち株のベンチマークと対照的に、非常に高いリスク調整性能を達成している。
論文 参考訳(メタデータ) (2026-02-21T00:33:16Z) - Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning [48.34492357368989]
本稿では,安定なオン・ポリティクス学習をサポートし,オフ・ポリティクスデータの再利用を原則とするプリミティブ・デュアル・フレームワークを提案する。
R2VPO$は、強いクリッピングベースのベースラインよりも17%の平均的な相対的なゲインで優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-01-06T14:01:42Z) - Reinforcement Learning from Probabilistic Forecasts for Safe Decision-Making via Conditional Value-at-Risk Planning [41.52380204321823]
本稿では,ベイズ予測,後方サンプリング強化学習,計画とを結合した統一的枠組みである不確実性認識マルコフ決定プロセス(UAMDP)を提案する。
構造的不確実性と経済のボラティリティを特徴とする2つのドメインの高頻度株式取引と小売在庫管理において,UAMDPを評価した。
論文 参考訳(メタデータ) (2025-10-09T13:46:32Z) - Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model [56.92219181993453]
本稿では,PPOやGRPOなどのオンラインRFT手法をオフ・ポリティクスデータに活用するために,Reincarnating Mix-policy Proximal Policy Gradient (ReMix)を提案する。
ReMix は,(1) 効率的なトレーニングのための更新データ(UTD)比が増大した混成政策勾配,(2) 安定性と柔軟性のトレードオフのバランスをとるためのKL-Convex 政策制約,(3) 効率的な早期学習から安定した改善へのシームレスな移行を実現するための政策再編成の3つの主要な構成要素から構成される。
論文 参考訳(メタデータ) (2025-07-09T14:29:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。