論文の概要: AlphaRJM: Reward-Jump Memory for Stochastic Return-Guided Alpha Discovery
- arxiv url: http://arxiv.org/abs/2609.08581v1
- Date: Tue, 08 Sep 2026 11:17:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.633842
- Title: AlphaRJM: Reward-Jump Memory for Stochastic Return-Guided Alpha Discovery
- Title(参考訳): AlphaRJM:確率的リターン誘導アルファディスカバリのためのリワードジャンプメモリ
- Abstract要約: Reward-Jump Memoryはイベント駆動の潜在状態であり、トークン構築時に固定され、端末評価イベントのみで更新される。
また,動作条件付きSDEリターン評論家として,粒子を用いた将来のディスカウント発見リターンを示す。
経験的に、AlphaRJMは複数のエクイティ宇宙に強く安定した利得をもたらす。
- 参考スコア(独自算出の注目度): 0.42970700836450487
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Formulaic alpha discovery is a pool-dependent symbolic search problem in which informative feedback is observed primarily when a complete expression is evaluated. This delayed feedback creates two coupled difficulties: the retained alpha pool does not preserve the full history of realized evaluation feedback, and the value of an intermediate construction action is uncertain because its consequence depends on the formula eventually completed. We introduce AlphaRJM, which addresses these difficulties through Reward-Jump Memory, an event-driven latent state that remains fixed during token construction and updates only at terminal evaluation events using the realized pool reward and evaluation outcome, and an action-conditioned SDE return critic that represents future discounted discovery returns with stochastic particles. The particles guide action selection through their mean and uncertainty and are learned using a distributional Bellman objective combining energy-distance matching, mean calibration, and jump regularization. Empirically, AlphaRJM delivers strong and stable gains across multiple equity universes, forecasting horizons, and random seeds, while ablations confirm the complementary roles of persistent evaluation history, stochastic return modeling, and distributional supervision.
- Abstract(参考訳): フォーミュラ的アルファ発見はプール依存の記号探索問題であり、完全な表現を評価する際に主に情報的フィードバックが観察される。
この遅延フィードバックは、保持されたアルファプールが実現された評価フィードバックの完全な履歴を保存せず、その結果が最終的に完了した公式に依存するため、中間的な構成動作の値が不確かである。
本稿では,これらの問題に対処するAlphaRJMを紹介する。Reward-Jump Memoryはトークン構築中に固定されたイベント駆動の潜伏状態であり,実際のプール報酬と評価結果を用いた端末評価イベントのみに更新される。
粒子は平均および不確実性を通じて行動選択を誘導し,エネルギー距離マッチング,平均校正,ジャンプ正則化を組み合わせた分布ベルマン目標を用いて学習する。
経験的に、AlphaRJMは複数のエクイティ宇宙をまたいで強く安定したゲインをもたらし、水平線を予測し、ランダムな種を発生させ、一方アブレーションは持続的な評価履歴、確率的回帰モデリング、分布的監督の相補的な役割を裏付ける。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - TwistedMerge: Certified Higher-Order Diagnostics and Abstention for Model Merging [0.48086260459837454]
我々は、チェックポイントが局所対象、アライメントマップが遷移、サイクル積が残留する有限降下問題としてマージを定式化する。
提案手法は, 定数エッジのNo-go結果, フリーズ・コンプレックスの3方向およびプレファミリーの誤差制御定理, 比較・複雑感度の精査試験である。
訓練された低ランク適応型監査では, 平均化係数は選択したGLr代表に依存するが, 大域的因子同期と高密度デルタSVDは安定である。
論文 参考訳(メタデータ) (2026-07-23T03:24:50Z) - Backbone-Agnostic Stochastic Perturbation Learning for End-to-End Real-World Image Dehazing [2.3013099757243056]
Backbone-Agnostic Perturbation Learningを提案する。
BSPLは連続的に複数のバックボーン代表を改良し、余分な追加の推論オーバーヘッドのみを発生させる。
論文 参考訳(メタデータ) (2026-07-13T14:44:12Z) - Fitted Occupancy-Ratio Evaluation without Bellman Completeness [40.322273308230606]
職業比は、オフライン強化学習における分布シフトを正す。
本稿では, 占有率の低下を特徴付ける固定点配置法である, 占有率評価 (FORE) を提案する。
経験的再帰について、KL における収束を対数比近似誤差に導く有限サンプル後悔境界を確立する。
論文 参考訳(メタデータ) (2026-07-06T17:53:32Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - Beyond Bellman: High-Order Generator Regression for Continuous-Time Policy Evaluation [28.490321270040727]
離散閉ループ軌道からの連続時間政策評価を時間的不均一な力学の下で検討する。
我々は,低次乱数項をキャンセルするモーメントマッチング係数を用いて,多段階遷移から時間依存ジェネレータを推定する。
論文 参考訳(メタデータ) (2026-04-21T01:53:11Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - SELF-REDRAFT: Eliciting Intrinsic Exploration-Exploitation Balance in Test-Time Scaling for Code Generation [12.241337921137259]
インタプリタのフィードバックなしにテスト時のスケーリングは、現実のコード生成シナリオに不可欠である。
SELF-REDRAFTはSelf-Refine上に構築されたフレームワークで、根本的な欠陥のあるソリューションのための新しいドラフトの提案を促進する。
論文 参考訳(メタデータ) (2025-10-31T06:30:47Z) - Intra-Trajectory Consistency for Reward Modeling [67.84522106537274]
軌道内整合性正則化を開発し、より高い次トーケン生成確率を持つプロセスがより一貫した報酬を維持することを強制する。
提案した正規化でトレーニングした報酬モデルにより、より優れたDPO整合ポリシーが導出され、より優れたベスト・オブ・N(BON)検証結果が得られることを示す。
論文 参考訳(メタデータ) (2025-06-10T12:59:14Z) - Time-series Generation by Contrastive Imitation [87.51882102248395]
モーメントマッチングの目的によってモチベーションされ、複合的エラーを軽減し、局所的(しかし前方的な)遷移ポリシーを最適化する。
推論において、学習されたポリシーは反復的なサンプリングのジェネレータとして機能し、学習されたエネルギーはサンプルの品質を評価するための軌道レベル尺度として機能する。
論文 参考訳(メタデータ) (2023-11-02T16:45:25Z) - Robust and Adaptive Temporal-Difference Learning Using An Ensemble of
Gaussian Processes [70.80716221080118]
本稿では、時間差学習(TD)による政策評価の世代的視点について考察する。
OS-GPTDアプローチは、状態-逆ペアのシーケンスを観測することにより、与えられたポリシーの値関数を推定するために開発された。
1つの固定カーネルに関連する限られた表現性を緩和するために、GP前の重み付けアンサンブル(E)を用いて代替のスキームを生成する。
論文 参考訳(メタデータ) (2021-12-01T23:15:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。