論文の概要: Mitigating Bias in Low-SNR Financial Reinforcement Learning via Quantum Representations
- arxiv url: http://arxiv.org/abs/2606.10448v1
- Date: Tue, 09 Jun 2026 05:55:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-10 15:40:58.339812
- Title: Mitigating Bias in Low-SNR Financial Reinforcement Learning via Quantum Representations
- Title(参考訳): 量子表現による低SNR財務強化学習におけるバイアスの緩和
- Authors: Zeyu Liu, Xuanzhi Feng, Sing Kwong Lai, Yuanchen Gao, Xiaoyi Pang, Hualei Zhang, Jingcai Guo, Jie Zhang, Song Guo,
- Abstract要約: 金融市場は典型的な低信号-雑音比(SNR)の設定であり、ソフトアクター-臨界(SAC)のような最大エントロピー法を不安定化することが多い。
本稿では,アクタと批評家ネットワークの前に,効率よく有界な量子回路(PQC)であるFPQC-SACを提案する。
実世界のポートフォリオ管理タスクに関する実証的な評価は、FPQC-SACがサンプル外安定性と累積リターンを大幅に向上させることを示している。
- 参考スコア(独自算出の注目度): 32.164152251693565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The financial market is a typical low signal-to-noise ratio (SNR) setting, which often destabilizes off-policy maximum-entropy methods like Soft Actor-Critic (SAC). Specifically, noisy state representations may produce unreliable Q-value estimates, and bootstrapping amplifies these errors, forming a failure mode we call the "Financial Entropy Trap". In this paper, we propose FPQC-SAC, an efficient and plug-and-play SAC variant that places a compact and bounded Parameterized Quantum Circuit (PQC) before the actor and critic networks to constrain feature propagation at the representation level, rather than filtering raw inputs or regularizing Q-values after bootstrapping. Notably, FPQC-SAC reduces the impact of extreme market fluctuations on Bellman target estimation, while trainable quantum entanglement preserves flexible cross-asset interactions. Empirical evaluations on real-world portfolio management tasks demonstrate that FPQC-SAC substantially enhances out-of-sample stability and cumulative returns by achieving a 66.89% relative gain in cumulative return over standard unconstrained SAC and outperforms the best continuous-control deep reinforcement learning baseline by approximately 27%. Open-source code is available at https://github.com/ZeyuLIU-UST/FPQC-SAC-main.
- Abstract(参考訳): 金融市場は典型的な低信号対雑音比 (SNR) の設定であり、ソフトアクター・クリティカル (SAC) のような政治外の最大エントロピー法を不安定にすることが多い。
具体的には、ノイズのある状態表現は信頼できないQ値の推定を生成し、ブートストラッピングはこれらのエラーを増幅し、"Financial Entropy Trap"と呼ばれる障害モードを形成する。
本稿では,アクタと批評家ネットワークの前にコンパクトで有界なパラメータ化量子回路(PQC)を配置し,ブートストラップ後の生入力のフィルタリングやQ値の正規化ではなく,表現レベルでの特徴伝搬を制約する,効率的かつプラグアンドプレイなSACバリアントであるFPQC-SACを提案する。
特に、FPQC-SACはベルマン目標推定に対する極端な市場の変動の影響を減らし、トレーニング可能な量子絡み合いはフレキシブルなクロスアセット相互作用を保存する。
実世界のポートフォリオ管理タスクに関する実証評価では、FPQC-SACは標準制約のないSACに対する累積リターンの66.89%を達成して、サンプル外安定性と累積リターンを大幅に向上させ、最高の継続的制御深層強化学習ベースラインを約27%上回った。
オープンソースコードはhttps://github.com/ZeyuLIU-UST/FPQC-SAC-mainで公開されている。
関連論文リスト
- Trust Region Q Adjoint Matching [54.05514246126841]
本稿では,経路空間KLを予め訓練されたフローポリシーで適応的に制御する安定なオフポリチック微調整アルゴリズムであるTrust Region Q-Adjoint Matching (TRQAM)を紹介する。
TRQAMは、オフラインRLとオフライン-オフラインRLの両方において、常に先行技術を上回っている。
論文 参考訳(メタデータ) (2026-05-26T14:28:43Z) - Amortized-Precision Quantization for Early-Exit Vision Transformers [14.001192614503807]
本稿では,Amortized-Precision Quantization (APQ)について紹介する。
提案するMultual Adaptive Quantization with Early Exiting (MAQEE)は,予測安定性を向上させるために,明示的なリスク制御の下で,出口閾値とビット幅を協調的に最適化するバイレベルフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T06:27:04Z) - GSC-QEMit: A Telemetry-Driven Hierarchical Forecast-and-Bandit Framework for Adaptive Quantum Error Mitigation [2.3449366241547813]
量子エラー軽減(QEM)は、短期量子デバイスから信頼性の高い結果を抽出するために不可欠である。
我々は,emphGSC-QEMitというテレメトリ駆動型,textbf-adaptive-forecast-banditフレームワークを紹介した。
我々は、Qiskit Aerでシミュレートされた非定常雑音条件下で、ベンチマーク回路ファミリ(GHZ, Quantum Fourier Transform, Grover Search)のGSC-QEMitを評価する。
論文 参考訳(メタデータ) (2026-04-27T14:44:36Z) - RE-SAC: Disentangling aleatoric and epistemic risks in bus fleet control: A stable and robust ensemble DRL approach [19.34848029403215]
交通量と旅客需要のため、バスの保有管理は困難である。
標準的なアクター批判アルゴリズムは揮発性環境におけるQ値不安定性に悩まされる。
本研究では,不確実性を解消するために,頑健なアンサンブル・ソフトアクター・クリティック・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-19T01:37:45Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Rethinking the Trust Region in LLM Reinforcement Learning [72.25890308541334]
PPO(Proximal Policy Optimization)は、大規模言語モデル(LLM)のデファクト標準アルゴリズムとして機能する。
より原則的な制約でクリッピングを代用する多変量確率ポリシー最適化(DPPO)を提案する。
DPPOは既存の方法よりも優れたトレーニングと効率を実現し、RLベースの微調整のためのより堅牢な基盤を提供する。
論文 参考訳(メタデータ) (2026-02-04T18:59:04Z) - Continual Quantum Architecture Search with Tensor-Train Encoding: Theory and Applications to Signal Processing [68.35481158940401]
CL-QASは連続的な量子アーキテクチャ検索フレームワークである。
振幅のエンコードと変分量子回路の忘れを犠牲にすることの課題を緩和する。
制御可能なロバスト性表現性、サンプル効率の一般化、およびバレンプラトーを使わずに滑らかな収束を実現する。
論文 参考訳(メタデータ) (2026-01-10T02:36:03Z) - End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost [53.25965863436039]
量子化対応トレーニング(QAT)は、より原則化されたソリューションを提供するが、バックプロパゲーションに依存しているため、メモリコストは禁じられている。
重み付けとアクティベーション量子化の両方をサポートするゼロオーダー最適化ベースのQATフレームワークであるZeroQATを提案する。
実験の結果、ZeroQATはPTQとQATのベースラインを一貫して上回り、メモリは大幅に削減された。
論文 参考訳(メタデータ) (2025-08-21T01:18:27Z) - DR-SAC: Distributionally Robust Soft Actor-Critic for Reinforcement Learning under Uncertainty [21.542065840791683]
深層強化学習(英語版)(RL)は大きな成功を収めているが、実世界のシナリオにおけるその応用は、環境の不確実性に対する堅牢性の欠如によってしばしば妨げられている。
本研究では,最新技術であるSoft Actor-Critic(SAC)アルゴリズムのロバスト性を高めるために,分散ロバストなSoft Actor-Critic(DR-SAC)を提案する。
論文 参考訳(メタデータ) (2025-06-14T20:36:44Z) - FIMA-Q: Post-Training Quantization for Vision Transformers by Fisher Information Matrix Approximation [55.12070409045766]
ポストトレーニング量子化(PTQ)は近年,費用対効果と有望なモデル圧縮パラダイムとして注目されている。
ビジョン変換器(ViT)の現在のPTQ法は、特に低ビット量子化において、精度が著しく低下している。
論文 参考訳(メタデータ) (2025-06-13T07:57:38Z) - Distributional Soft Actor-Critic: Off-Policy Reinforcement Learning for
Addressing Value Estimation Errors [13.534873779043478]
本稿では,Q値過大評価を緩和し,ポリシー性能を向上させるための分散型ソフトアクター・クリティック(DSAC)アルゴリズムを提案する。
我々は,MuJoCo連続制御タスクのスイート上でDSACを評価し,最先端の性能を実現する。
論文 参考訳(メタデータ) (2020-01-09T02:27:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。