論文の概要: Self-Supervised Auxiliary Task Discovery for Stable Reinforcement Learning in Stock Trading
- arxiv url: http://arxiv.org/abs/2608.15841v1
- Date: Sun, 16 Aug 2026 16:20:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.440557
- Title: Self-Supervised Auxiliary Task Discovery for Stable Reinforcement Learning in Stock Trading
- Title(参考訳): ストックトレーディングにおける安定強化学習のための自己監督補助タスク発見
- Authors: Arishi Orra, Himanshu Choudhary, Manoj Thakur,
- Abstract要約: 株式取引における強化学習を支援するための補助的タスクを自動的に発見する自己教師型フレームワークを提案する。
提案手法は、DJI、FTSE、Sensex、TAIEXの4つの主要な株式指標にまたがって評価する。
- 参考スコア(独自算出の注目度): 4.042562775811427
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning has gained increasing attention as a data-driven approach for stock trading. However, learning a policy that is both profitable and stable remains challenging due to non-stationary market behaviour and noisy reward signals. Auxiliary tasks are often used to improve representation learning and stabilize training, yet they are usually designed manually and depend heavily on prior assumptions about targets and prediction horizons. Such fixed designs may not remain suitable across changing market regimes. In this work, we propose a self-supervised framework that automatically discovers auxiliary tasks to support reinforcement learning for stock trading. The auxiliary tasks are formulated as General Value Functions so that their predictions enrich the learned state representation and assist policy optimization. The framework consists of two networks. The main network learns the trading policy along with the auxiliary predictions, while the secondary network generates the definitions of auxiliary tasks through learned cumulants and discount factors. These tasks are updated using a meta gradient mechanism that accounts for their long-term impact on trading performance and improves training stability. We evaluate the proposed approach across four major equity indices: DJI, FTSE, Sensex, and TAIEX. The empirical results demonstrate that automatically discovered auxiliary tasks lead to more robust learning and improved trading performance compared to existing baselines.
- Abstract(参考訳): ストックトレーディングにおけるデータ駆動型アプローチとして、強化学習が注目を集めている。
しかし、非定常的な市場行動と騒々しい報奨信号のために、利益と安定の両方の政策を学ぶことは依然として困難である。
補助的なタスクは、しばしば表現学習の改善や訓練の安定化に使用されるが、通常は手動で設計され、目標や予測地平線に関する前提に大きく依存する。
このような固定デザインは、変化する市場体制に適合しないかもしれない。
本研究では,ストックトレーディングにおける強化学習を支援するための補助的タスクを自動的に発見する自己教師型フレームワークを提案する。
補助タスクは、学習した状態表現を豊かにし、ポリシー最適化を支援するために、一般値関数として定式化される。
フレームワークは2つのネットワークで構成される。
メインネットワークは、補助予測とともに取引ポリシーを学習し、セカンダリネットワークは、学習した累積と割引係数によって補助タスクの定義を生成する。
これらのタスクは、トレーディングパフォーマンスに対する長期的な影響を考慮し、トレーニングの安定性を向上させるメタグラデーションメカニズムを使用して更新される。
提案手法は、DJI、FTSE、Sensex、TAIEXの4つの主要な株式指標にまたがって評価する。
実験の結果, 自動検出された補助タスクは, 既存のベースラインと比較して, より堅牢な学習と取引性能の向上につながることが示された。
関連論文リスト
- Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - On Evaluating Loss Functions for Stock Ranking: An Empirical Analysis With Transformer Model [0.0]
トランスフォーマーモデルは金融時系列を理解することを約束している。
しかし、異なるトレーニング損失関数が株のランク付け能力にどのように影響するかは、まだ完全には理解されていない。
論文 参考訳(メタデータ) (2025-10-15T23:06:02Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z) - Combining Deep Learning on Order Books with Reinforcement Learning for
Profitable Trading [0.0]
本研究は,注文フローを用いた複数地平線におけるリターン予測と,5つの金融機器を対象とした3つの時間差不均衡学習モデルを訓練することに焦点を当てる。
この結果は潜在的な可能性を証明しているが、小売取引コスト、滑り込み、スプレッド・揺らぎを完全に処理するためには、一貫した黒字取引のためのさらなる最小限の修正が必要である。
論文 参考訳(メタデータ) (2023-10-24T15:58:58Z) - MERMAIDE: Learning to Align Learners using Model-Based Meta-Learning [62.065503126104126]
本研究では,先見のつかない学習エージェントの報酬を効率よく効果的に介入し,望ましい結果を導き出す方法について検討する。
これはオークションや課税のような現実世界の多くの設定に関係しており、プリンシパルは学習行動や実際の人々の報酬を知らないかもしれない。
モデルに基づくメタ学習フレームワークであるMERMAIDEを導入し,配布外エージェントに迅速に適応できるプリンシパルを訓練する。
論文 参考訳(メタデータ) (2023-04-10T15:44:50Z) - Continual Auxiliary Task Learning [24.165583481949827]
補助課題の収集を学習するために設計された強化学習システムについて検討し,それらの補助的予測を改善するための行動政策学習を行う。
非定常的な報酬の下での追跡を容易にする後継機能に基づくアルゴリズムを開発し、学習後継機能への分離を証明し、報酬が収束率の向上をもたらす。
論文 参考訳(メタデータ) (2022-02-22T19:17:12Z) - Can Interpretable Reinforcement Learning Manage Assets Your Way? [0.0]
マシンラーニングは、顧客のニーズや好みを深く理解し、調整する、という約束を守ります。
我々は、本質的に解釈可能な強化学習エージェントを訓練し、プロトタイプの財務的性格特性に合わせた投資アドバイスを行う。
我々は、訓練されたエージェントのアドバイスが、意図した特性に固執していること、そして、明確な言及なしに、リスクの概念と、政策の収束性の改善を観察する。
論文 参考訳(メタデータ) (2022-02-18T07:59:08Z) - Diverse Distributions of Self-Supervised Tasks for Meta-Learning in NLP [39.457091182683406]
非ラベルテキストから自動的に提案される自己教師型タスクを考慮し,メタラーニングのためのタスク分布の提供を目指す。
分析の結果,これらすべての要因がタスク分布を有意に変化させることが示され,メタ学習モデルの下流における数ショット精度の大幅な改善がもたらされた。
論文 参考訳(メタデータ) (2021-11-02T01:50:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。