論文の概要: Can Reinforcement Learning Efficiently Discover Price Manipulation?
- arxiv url: http://arxiv.org/abs/2607.06121v1
- Date: Tue, 07 Jul 2026 10:29:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.137328
- Title: Can Reinforcement Learning Efficiently Discover Price Manipulation?
- Title(参考訳): 強化学習は価格操作を効果的に発見できるか?
- Authors: Ioanna-Yvonni Tsaknaki, Andrea Macrì, Fabrizio Lillo,
- Abstract要約: 非直線的恒久的な影響と線形的一時的な影響を伴うアルムグレン・クリスフレームワークに従って価格が上昇する単一資産市場を考える。
まず、離散時間における価格操作戦略の確立と、逐次最小二乗二次計画法(Sequential Least Squares Quadratic Programming)を用いた最適なベンチマーク戦略の算出を行う。
次に、シミュレーションされた実行データから影響パラメータを推定するモデルベースプロシージャと、同じ量のデータに基づいて直接訓練されたDeep Deterministic Policy Gradientに基づくRLアプローチの2つの有限サンプル学習手法を比較した。
- 参考スコア(独自算出の注目度): 0.254890465057467
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this paper, we investigate whether a model-free RL agent can identify and exploit price manipulation opportunities more effectively than a traditional model-based approach that assumes correct specification of the data-generating process but relies on noisy parameter estimates. We consider a single-asset market in which prices evolve according to an Almgren-Chriss framework with non-linear permanent impact and linear temporary impact. We first establish the existence of price-manipulative strategies in discrete time and compute the optimal benchmark strategy using Sequential Least Squares Quadratic Programming under full information. We then compare two finite-sample learning approaches: a model-based procedure that estimates impact parameters from simulated execution data and an agnostic RL approach based on Deep Deterministic Policy Gradient, trained directly on the same amount of data. For intermediate volatility, the RL agent successfully discovers profitable manipulative strategies without explicit knowledge of the underlying model, even when training data are quite limited. More importantly, RL consistently outperforms the model-based approach when parameter estimates are affected by sampling error, despite the latter benefiting from the correct model specification. For large volatility, all methods are unable to identify manipulation opportunities, while for small volatility, the model based approach outperforms RL. These findings highlight both the effectiveness of RL in complex control problems and the risks associated with deploying learning algorithms in financial markets without appropriate safeguards.
- Abstract(参考訳): 本稿では,モデルフリーなRLエージェントが,データ生成プロセスの正確な仕様を前提とした従来のモデルベースアプローチよりも,より効果的に価格操作の機会を特定し,活用できるかどうかを検討する。
非直線的恒久的な影響と線形的一時的な影響を伴うアルムグレン・クリスフレームワークに従って価格が上昇する単一資産市場を考える。
まず、離散時間における価格操作戦略の確立と、逐次最小二乗二次計画法(Sequential Least Squares Quadratic Programming)を用いた最適なベンチマーク戦略の算出を行う。
次に、シミュレーションされた実行データから影響パラメータを推定するモデルベースプロシージャと、同じ量のデータに基づいて直接訓練されたDeep Deterministic Policy Gradientに基づく非依存的RLアプローチの2つの有限サンプル学習手法を比較した。
中間ボラティリティにおいて、RLエージェントは、トレーニングデータがかなり制限されている場合でも、基礎となるモデルの明示的な知識を必要とせずに、利益の出る操作戦略をうまく発見する。
さらに重要なのは、RLが正しいモデル仕様の恩恵を受けているにもかかわらず、パラメータ推定がサンプリングエラーの影響を受ければ、モデルベースのアプローチを一貫して上回ります。
大きなボラティリティでは、すべての手法が操作の機会を特定することができず、小さなボラティリティの場合、モデルベースのアプローチはRLよりも優れています。
これらの知見は、複雑な制御問題におけるRLの有効性と、適切な保護を伴わない金融市場における学習アルゴリズムの展開に伴うリスクの両方を浮き彫りにした。
関連論文リスト
- Uncertainty-Aware Strategies: A Model-Agnostic Framework for Robust Financial Optimization through Subsampling [0.7916373508978822]
本稿では,定量的ファイナンスにおけるモデル不確実性の問題に対処する。
ポートフォリオ割り当て、デリバティブ価格、リスク管理の決定は、限られたデータからモデルを推定することに依存する。
従来の金融リスク対策によって動機付けられた外的「不確実性尺度」をモデル空間に重ね合わせます。
論文 参考訳(メタデータ) (2025-06-08T21:55:00Z) - VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning [15.796963385626846]
VIPOは、価値推定から自己教師付きフィードバックを取り入れて、モデルトレーニングを強化する、新しいモデルベースのオフラインRLアルゴリズムである。
VIPOは、既存の手法より効率的かつ一貫して優れたモデルを学ぶことができることを示す。
論文 参考訳(メタデータ) (2025-04-16T10:23:44Z) - Commodities Trading through Deep Policy Gradient Methods [0.0]
商品取引問題を連続的な離散時間力学系として定式化する。
アクターベースとアクタークリティカルベースの2つのポリシーアルゴリズムが導入された。
先月末の天然ガス先物試験では、DRLモデルのシャープ比が買いと持ち株ベースラインと比較して83%高くなることが示されている。
論文 参考訳(メタデータ) (2023-08-10T17:21:12Z) - Conservative Bayesian Model-Based Value Expansion for Offline Policy
Optimization [41.774837419584735]
オフライン強化学習(英語版) (RL) は、ある行動ポリシーに従って収集された固定されたデータのバッチからパフォーマンスポリシーを学習する問題に対処する。
モデルベースのアプローチは、環境のモデルを学ぶことによって、ログ化されたデータセットからより多くの学習信号を抽出できるため、特に魅力的である。
論文 参考訳(メタデータ) (2022-10-07T20:13:50Z) - Leveraging Unlabeled Data to Predict Out-of-Distribution Performance [63.740181251997306]
実世界の機械学習デプロイメントは、ソース(トレーニング)とターゲット(テスト)ディストリビューションのミスマッチによって特徴づけられる。
本研究では,ラベル付きソースデータとラベルなしターゲットデータのみを用いて,対象領域の精度を予測する手法を検討する。
本稿では,モデルの信頼度をしきい値として学習し,精度をラベルなし例のごく一部として予測する実践的手法である平均閾値保持信頼度(ATC)を提案する。
論文 参考訳(メタデータ) (2022-01-11T23:01:12Z) - On Effective Scheduling of Model-based Reinforcement Learning [53.027698625496015]
実データ比率を自動的にスケジュールするAutoMBPOというフレームワークを提案する。
本稿ではまず,政策訓練における実データの役割を理論的に分析し,実際のデータの比率を徐々に高めれば,より優れた性能が得られることを示唆する。
論文 参考訳(メタデータ) (2021-11-16T15:24:59Z) - DEALIO: Data-Efficient Adversarial Learning for Imitation from
Observation [57.358212277226315]
観察ifoからの模倣学習において、学習エージェントは、実演者の生成した制御信号にアクセスせずに、実演行動の観察のみを用いて実演エージェントを模倣しようとする。
近年、逆模倣学習に基づく手法は、ifO問題に対する最先端のパフォーマンスをもたらすが、データ非効率でモデルなしの強化学習アルゴリズムに依存するため、サンプルの複雑さに悩まされることが多い。
この問題は、サンプルの収集が時間、エネルギー、およびリスクの面で高いコストを被る可能性がある現実世界の設定に展開することは非現実的です。
よりデータ効率の高いifOアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-03-31T23:46:32Z) - COMBO: Conservative Offline Model-Based Policy Optimization [120.55713363569845]
ディープニューラルネットワークのような複雑なモデルによる不確実性推定は困難であり、信頼性が低い。
我々は,サポート外状態動作の値関数を正規化するモデルベースオフラインRLアルゴリズムCOMBOを開発した。
従来のオフラインモデルフリーメソッドやモデルベースメソッドと比べて、comboは一貫してパフォーマンスが良いことが分かりました。
論文 参考訳(メタデータ) (2021-02-16T18:50:32Z) - MOPO: Model-based Offline Policy Optimization [183.6449600580806]
オフライン強化学習(英語: offline reinforcement learning, RL)とは、以前に収集された大量のデータから完全に学習ポリシーを学習する問題を指す。
既存のモデルベースRLアルゴリズムは,すでにオフライン設定において大きな利益を上げていることを示す。
本稿では,既存のモデルに基づくRL法を,力学の不確実性によって人為的に罰せられる報酬で適用することを提案する。
論文 参考訳(メタデータ) (2020-05-27T08:46:41Z) - How Training Data Impacts Performance in Learning-based Control [67.7875109298865]
本稿では,トレーニングデータの密度と制御性能の関係を考察する。
データセットの品質尺度を定式化し、$rho$-gap と呼ぶ。
フィードバック線形化制御法に$rho$-gapを適用する方法を示す。
論文 参考訳(メタデータ) (2020-05-25T12:13:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。