論文の概要: CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach
- arxiv url: http://arxiv.org/abs/2607.16028v1
- Date: Fri, 17 Jul 2026 15:01:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.879498
- Title: CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- An Alpha-Reward Approach
- Title(参考訳): CLaC@FinMMEval 2026 Task 3: Sentiment-Augmented Deep Reinforcement Learning for Active Trading -- Alpha-Reward Approach
- Authors: Andrei Neagu, Eeham Khan, Leila Kosseim,
- Abstract要約: 本稿では,ニュースおよび歴史的市場データを用いて,Bitcoin(BTC)とTesla(TSLA)の1日あたりの長期・フラット・短距離取引決定を必要とするCLEF 2026 FinMMEval Labのタスク3について述べる。
離散的なマルコフ決定過程として問題を定式化し、政策グラディエント(PG)、近似政策最適化(PPO)、深部Qラーニング(DQL)、深部決定主義政策グラディエント(PGPG)の4つの深部強化学習アルゴリズムを比較した。
BTCの場合、DDPGは1.58%のプラスリターンを達成し、買いと持ち株は-34.27%減少する
- 参考スコア(独自算出の注目度): 0.0509780930114934
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper presents our system for Task 3 of the CLEF 2026 FinMMEval Lab, which requires daily long, flat, or short trading decisions for Bitcoin (BTC) and Tesla (TSLA) using news and historical market data. We formulate the problem as a discrete-action Markov Decision Process and compare four deep reinforcement learning algorithms: Policy Gradient (PG), Proximal Policy Optimization (PPO), Deep Q-Learning (DQL), and Deep Deterministic Policy Gradient (DDPG). The agents use technical indicators, cyclical calendar encodings, and daily news sentiment scores produced by LLaMA 3.2 1B. To reduce overfitting and align training with the objective of outperforming buy-and-hold, we introduce an alpha reward based on excess market return and randomize episode start dates. Hyperparameters are optimized with Ray Tune over 180 trials per algorithm-asset pair, with early stopping and model selection based on validation Sharpe ratio. On the CLEF Task 3 test set, DDPG achieves the strongest overall performance. DQL was selected a priori for the live endpoint because it obtained the highest validation Sharpe ratio, with selection performed without access to the test period. For TSLA, DDPG and DQL achieve cumulative returns of 54.96% and 52.62%, respectively, compared with 16.45% for buy-and-hold. For BTC, DDPG achieves a positive return of 1.58% while buy-and-hold declines by -34.27%. The results also reveal a substantial validation-to-test generalization gap, highlighting the difficulty of transferring policies selected in bull-market conditions to a bear-market regime.
- Abstract(参考訳): 本稿では,ニュースおよび歴史的市場データを用いて,Bitcoin(BTC)とTesla(TSLA)の1日あたりの長期・フラット・短距離取引決定を必要とするCLEF 2026 FinMMEval Labのタスク3について述べる。
この問題を離散的なマルコフ決定過程として定式化し、政策グラディエント(PG)、近似政策最適化(PPO)、深部Qラーニング(DQL)、深部決定主義政策グラディエント(PGPG)の4つの深部強化学習アルゴリズムを比較した。
エージェントは、LLaMA 3.2 1Bによって生成される技術指標、循環カレンダーエンコーディング、および日々のニュース感情スコアを使用する。
そこで我々は,過剰な市場リターンに基づくアルファ報酬を導入し,エピソード開始日をランダム化する。
ハイパーパラメータはアルゴリズムとアセットのペアあたり180以上の試行で最適化されており、早期停止と検証シャープ比に基づいたモデル選択が可能である。
CLEF Task 3テストセットでは、DDPGは全体的なパフォーマンスが最も高い。
DQLがライブエンドポイントのプリオリに選ばれたのは、テスト期間にアクセスできることなく選択できる、最高のバリデーションシャープ比を得たからだ。
TSLAではDDPGとDQLがそれぞれ54.96%、52.62%の累積リターンを達成した。
BTCでは、DDPGは1.58%、買いと持ち株は-34.27%減少する。
結果はまた、牛市場において選択された政策を熊市場体制に移すことの難しさを浮き彫りにした、実質的な検証とテストの一般化のギャップも浮き彫りにした。
関連論文リスト
- Signal or Noise in Multi-Agent LLM-based Stock Recommendations? [0.0]
本稿では,デプロイされたマルチエージェントLLM株式システムであるMarketSenseAIのポートフォリオレベルの検証について紹介する。
このシステムは、4人のスペシャリストを1人のエージェントに誘導し、月々の株式に関する論文を発行し、そのカバー宇宙における各株式の合成を行う。
購入勧告は受動的ベンチマークとランダム選択の両方に価値を加え、内部エージェント構造はエッジのソースについて何を明らかにするのか?
論文 参考訳(メタデータ) (2026-04-19T08:43:31Z) - FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization [84.58281577727566]
本稿では,大規模言語モデルにおける推論ボトルネックを克服する強化学習アルゴリズムであるFuture-KL Influenced Policy Optimization (FIPO)を提案する。
FIPOは、割引先KLの分岐をポリシー更新に組み込むことでこの問題に対処し、その後の軌道行動への影響に基づいてトークンを再重み付けする密集した有利な定式化を作成する。
Qwen2.5-32Bで評価され、FIPOは平均チェーン長を約4,000から10,000以上のトークンに拡張し、AIME 2024 Pass@1の精度を50.0%から58.0%に向上させた。
論文 参考訳(メタデータ) (2026-03-20T10:24:50Z) - Verified Critical Step Optimization for LLM Agents [67.05296684575445]
クリティカルステップ最適化は、検証されたクリティカルステップに優先学習を集中する。
メソッドは、専門家のデモンストレーションではなく、失敗するポリシーの軌道から始まります。
GAIA-Text-103とXBench-DeepSearchの実験では、CSOはSFTベースラインよりも37%、相対的に26%改善している。
論文 参考訳(メタデータ) (2026-02-03T11:41:02Z) - Can Artificial Intelligence Trade the Stock Market? [0.0]
本稿では,Double Deep Q-Network (DDQN) と Proximal Policy Optimization (PPO) の2つのアルゴリズムに着目し,市場取引におけるDeep Reinforcement Learning (DRL) の利用について検討する。
S&P500指数とBitcoinの3つの通貨ペアにまたがるアルゴリズムを、2019-2023年の日々のデータに基づいて評価している。
その結果,貿易におけるDRLの有効性と,不利な条件下での貿易を戦略的に回避することでリスク管理能力が示された。
論文 参考訳(メタデータ) (2025-06-05T05:59:10Z) - Deep Reinforcement Learning Algorithms for Option Hedging [0.20482269513546458]
動的ヘッジの文脈における8つのDeep Reinforcement Learning (DRL)アルゴリズムの性能を比較した。
MCPGはブラック・スコイルズ・デルタ・ヘッジ・ベースラインを計算予算で上回る唯一のアルゴリズムである。
論文 参考訳(メタデータ) (2025-04-07T21:32:14Z) - Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning [55.65738319966385]
我々は、新しいオンラインアルゴリズム、反復的ナッシュポリシー最適化(INPO)を提案する。
従来の方法とは異なり、INPOは個々の応答に対する期待される勝利率を推定する必要性を回避している。
LLaMA-3-8BベースのSFTモデルで、INPOはAlpacaEval 2.0で42.6%、Arena-Hardで37.8%の勝利率を達成した。
論文 参考訳(メタデータ) (2024-06-30T08:00:34Z) - Deep Reinforcement Learning for Optimal Stopping with Application in
Financial Engineering [1.52292571922932]
金融工学の2つのアプリケーションにおいて、最適な停止ポリシー(オプション価格、最適オプションエクササイズ)を学ぶために、深層強化学習を採用しています。
最先端RLアルゴリズムの3つの状態によって同定された最適停止ポリシーの品質に関する総合的な実証的評価を初めて提示する。
論文 参考訳(メタデータ) (2021-05-19T01:52:04Z) - Deep Reinforcement Learning for Active High Frequency Trading [1.6874375111244329]
我々は、株式市場におけるアクティブな高周波取引のための、最初のエンドツーエンドのDeep Reinforcement Learning(DRL)ベースのフレームワークを紹介する。
我々はDRLエージェントを訓練し、Pximal Policy Optimizationアルゴリズムを用いてIntel Corporation株の1ユニットを取引する。
論文 参考訳(メタデータ) (2021-01-18T15:09:28Z) - ADAHESSIAN: An Adaptive Second Order Optimizer for Machine Learning [91.13797346047984]
本稿では,2次最適化アルゴリズムであるADAHESSIANを紹介する。
ADAHESSIANは、他の適応最適化手法と比較して、新しい最先端の成果を大きなマージンで達成することを示す。
論文 参考訳(メタデータ) (2020-06-01T05:00:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。