論文の概要: Adaptive Finite-Budget Training for CVaR Risk-Aware Q-Learning
- arxiv url: http://arxiv.org/abs/2608.04305v1
- Date: Wed, 05 Aug 2026 00:26:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.664927
- Title: Adaptive Finite-Budget Training for CVaR Risk-Aware Q-Learning
- Title(参考訳): CVaRリスクを考慮したQ-Learningのための適応的有限予算トレーニング
- Authors: Yifan Wu, Junjie Lei, Wenjie Huang,
- Abstract要約: リスク対応Q-ラーニング(RaQL)は、動的リスク目標に対するモデルフリーで2時間スケールの推定手段を提供する。
本稿では,CVaR(Conditional Value-at-Risk) RaQLの適応型トレーニングコントローラを提案し,これを日々のBitcoin取引タスクで評価する。
- 参考スコア(独自算出の注目度): 7.373349445059511
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Risk-aware Q-learning (RaQL) provides a model-free, two-timescale estimator for dynamic risk objectives, but its finite-budget behavior remains fragile: fixed inner-loop hyperparameters can produce unstable value estimates, persistent Bellman residuals, and inefficient sample reuse. This paper proposes an adaptive training controller for Conditional Value-at-Risk (CVaR) RaQL and evaluates it on a daily Bitcoin trading task. The controller preserves the original CVaR estimator and Bellman fixed point; instead, it redesigns the training procedure through six coordinated mechanisms: per-cell inner-step sizing, outer-rate-matched decay synchronization, a short early correction for the VaR-like inner variable, a coverage-first-then-greedy sample allocation rule, progressive suffix aggregation of mature inner estimates, and data-driven calibration of key scales from online-observable quantities. Across 20 random seeds and 856,000 inner-transition samples, the controller reduces the mean empirical CVaR Bellman residual by approximately 85% relative to the fixed-parameter baseline (MeanBEQ: 1.2202 to 0.1854; MeanBEV: 1.1624 to 0.0535) and maintains stability across CVaR levels, discount factors, and training budgets. On the chronological out-of-sample test set, the learned policy attains a Sharpe ratio of 0.9281 with a maximum drawdown of 6.46% after transaction costs. Although buy-and-hold yields a higher cumulative return (35.43% vs. 23.61%), the adaptive policy achieves far lower volatility (9.57% vs. 47.93%), drawdown, and CVaR loss. These results demonstrate that adaptive finite-budget training design, applied solely to the training procedure without altering the risk objective, can materially improve the reliability and risk-adjusted performance of risk-aware Q-learning in financial applications.
- Abstract(参考訳): リスクを意識したQ-ラーニング(RaQL)は、動的リスク目標に対するモデルフリーで2時間スケールの見積もりを提供するが、有限予算の振る舞いは脆弱であり、固定された内部ループハイパーパラメータは不安定な値推定、永続的なベルマン残差、非効率なサンプル再利用を生成することができる。
本稿では,CVaR(Conditional Value-at-Risk) RaQLの適応型トレーニングコントローラを提案し,これを日々のBitcoin取引タスクで評価する。
コントローラは、元のCVaR推定器とベルマン固定点を保存し、代わりに、セルごとのインナーステップサイズ、アウターレート整合崩壊同期、VaRのようなインナー変数の短い早期補正、カバレッジファーストのグレードのサンプル割り当てルール、成熟したインナー推定のプログレッシブサフィックスアグリゲーション、オンライン観測可能な量からキースケールのデータ駆動キャリブレーションという6つの調整されたメカニズムを通じてトレーニング手順を再設計する。
20個のランダムな種子と856,000個の内部移行サンプルで、制御器は、固定パラメータベースライン(MeanBEQ: 1.2202 - 0.1854; MeanBEV: 1.1624 - 0.0535)と比較して平均的なCVaRベルマン残留率を約85%削減し、CVaRレベル、割引係数、トレーニング予算の安定性を維持する。
時間外テストセットでは、学習されたポリシーはシャープ比0.9281に達し、トランザクションコストの後に最大6.46%のダウンダウンとなる。
バイヤー・アンド・ホールディングスは累積リターン(35.43%対23.61%)が高いが、アダプティブ・ポリシーはより低いボラティリティ(9.57%対47.93%)、ドローダウン、CVaR損失を達成する。
これらの結果は、リスク目標を変更することなくトレーニング手順にのみ適用される適応的有限予算トレーニング設計が、金融アプリケーションにおけるリスク対応Q-ラーニングの信頼性とリスク調整性能を大幅に向上することを示した。
関連論文リスト
- SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Traffic-Aware Randomized Smoothing for LLM-Based Network Intrusion Detection [1.4915002678801434]
本稿では,侵入検知システムに対するTA-RS(Traffic-Aware Randomized Smoothing)を提案する。
ガウスノイズを制御可能部分空間(DC)にのみ注入する認証された防御法である。
2つのデータセットに対して、55-100%の認証精度を達成する。
論文 参考訳(メタデータ) (2026-07-15T13:08:19Z) - When Can Conformal Risk Control Certify LLM Outputs? Bounds, Impossibility, and Adaptation for Structured Generation [0.11280931253550518]
構造化世代 (NER, 抽出, QA, 分類) にデプロイされる大規模言語モデル (LLM) には、正式な信頼性保証がない。
我々は、共形リスク制御(CRC)が構造化LLM出力を証明でき、かつ、それが証明不可能な場合に特徴付ける。
論文 参考訳(メタデータ) (2026-06-27T19:25:07Z) - Sharpness Aware Surrogate Training for Spiking Neural Networks [0.0]
サロゲート勾配はスパイキングニューラルネットワーク(SNN)を訓練するための標準ツールである
しかし、従来のハードフォワードまたはサロゲート後方トレーニングは、偏りのある推定器を備えた非滑らかなフォワードモデルである。
後方プロパゲーションにより訓練した前方SNNに対して,シャープネス・アウェア・サロゲート・トレーニング(SAST)を適用し,シャープネス・アウェア・サロゲート・トレーニング(SAM)を適用した。
論文 参考訳(メタデータ) (2026-03-14T01:26:26Z) - $V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts [81.48669089692189]
一般値モデル(例えば$V_0.5$)は、コンテキスト内のモデル機能を明示的にエンコードすることで、事前訓練された値推定を実現する。
本稿では,このような値モデルにより予測されるベースラインと,スパースロールアウトから導出される経験的平均とを適応的に融合する$V_0.5$を提案する。
V_0.5$はGRPOとDAPOを大きく上回り、より高速な収束と約10%のパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-11T14:57:41Z) - Calibrated Credit Intelligence: Shift-Robust and Fair Risk Scoring with Bayesian Uncertainty and Gradient Boosting [0.0]
Calibrated Credit Intelligence(CCI)は、リスクスコアリングのためのデプロイメント指向のフレームワークである。
CCIは、現実的な展開条件下で、正確で信頼性があり、より公平なリスクスコアを生成する。
論文 参考訳(メタデータ) (2026-03-06T04:40:18Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction [55.04308051033549]
RLVR(Reinforcement Learning with Verifiable Rewards)は、LLM(Large Language Models)推論を向上するための主要なパラダイムとして登場した。
モデル固有の信頼性を活用して外部検証から独立したカリキュラムを構築するフレームワークであるVerifier-Independent Curriculum Reinforcement Learning (VI-CuRL)を紹介する。
論文 参考訳(メタデータ) (2026-02-13T03:40:52Z) - Safe Langevin Soft Actor Critic [10.683491090059867]
拘束強化学習における報酬と安全性のバランスをとるために,安全ランゲヴィン・ソフト・アクター・クリティカル(SL-SAC)を導入した。
SL-SACは10タスク中7タスクで最低コストを達成し,競争的リターンを維持していることを示す。
Safety-Gymnasiumでは、SL-SACは最先端のベースラインと比較して、速度タスクの19-63%のコスト削減を実現している。
論文 参考訳(メタデータ) (2026-01-31T08:06:35Z) - Human-in-the-loop Online Rejection Sampling for Robotic Manipulation [55.99788088622936]
Hi-ORSは、オンライン微調整中に負の報酬を得たサンプルをフィルタリングすることで、値推定を安定化する。
Hi-ORSは、わずか1.5時間でコンタクトリッチな操作をマスターするためのpiベースのポリシーを微調整する。
論文 参考訳(メタデータ) (2025-10-30T11:53:08Z) - Decision from Suboptimal Classifiers: Excess Risk Pre- and Post-Calibration [52.70324949884702]
バッチ二分決定における近似的後続確率を用いた余剰リスクの定量化を行う。
我々は、再校正のみが後悔のほとんどに対処する体制と、後悔が集団的損失に支配される体制を識別する。
NLP実験では、これらの量によって、より高度なポストトレーニングの期待値が運用コストに値するかどうかが分かる。
論文 参考訳(メタデータ) (2025-03-23T10:52:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。