論文の概要: Eliciting ESG Preferences for Reinforcement Learning-Based Portfolio Optimization
- arxiv url: http://arxiv.org/abs/2609.02677v1
- Date: Wed, 02 Sep 2026 14:48:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.420066
- Title: Eliciting ESG Preferences for Reinforcement Learning-Based Portfolio Optimization
- Title(参考訳): 強化学習に基づくポートフォリオ最適化のためのESG選好の緩和
- Authors: Giovanni Dispoto, Marcello Restelli, Carmine Ventre,
- Abstract要約: 本稿では,多目的強化学習(MORL)問題としてESG対応ポートフォリオ最適化を定式化する。
高次元のアルゴリズムトレードオフと人間の意思決定のギャップを埋めるために、Preference Elicitationフレームワークを統合する。
- 参考スコア(独自算出の注目度): 37.7469110349782
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern portfolio management increasingly demands a balance between traditional risk-adjusted returns and strict Environmental, Social, and Governance (ESG) mandates. Current Reinforcement Learning (RL) approaches typically optimize for a single ESG provider, neglecting the significant divergence in rating methodologies across the industry and the unintuitive nature of manually weighting conflicting objectives. This paper addresses these limitations by formulating ESG-aware portfolio optimization as a Multi-Objective Reinforcement Learning (MORL) problem that simultaneously incorporates ratings from three distinct ESG agencies. To bridge the gap between high-dimensional algorithmic trade-offs and human decision-making, we integrate a Preference Elicitation framework using Gaussian Processes. This system enables practitioners to infer their latent utility functions through intuitive pairwise comparisons of candidate portfolios based on their Sharpe ratios and aggregate ESG scores. We systematically evaluate our framework by employing Large Language Model (LLM) personas to simulate Portfolio Managers operating under varied regional contexts. Empirical results using historical market data reveal that regional backgrounds fundamentally shift the derived preference weights. For instance, European-based personas tend to prioritize ESG alignment over financial returns, while Texas-based personas favor risk-adjusted performance. This work offers a highly adaptable framework that successfully aligns multi-objective algorithmic trading with diverse, real-world human sustainability preferences.
- Abstract(参考訳): 現代のポートフォリオ管理は、従来のリスク調整リターンと厳格な環境・社会・ガバナンス(ESG)委任(英語版)のバランスをますます要求している。
現在の強化学習(RL)アプローチは、通常、1つのESGプロバイダに対して最適化され、業界全体の評価方法論のかなりのばらつきと、矛盾する目的を手動で重み付けする非直感的な性質を無視している。
本稿では、3つの異なるESG機関のレーティングを同時に組み込んだ多目的強化学習(MORL)問題としてESG対応ポートフォリオ最適化を定式化した。
高次元のアルゴリズムトレードオフと人間の意思決定のギャップを埋めるために、ガウス過程を用いてPreference Elicitationフレームワークを統合する。
このシステムでは、シャープ比とESGスコアの集計に基づいて、候補ポートフォリオの直感的なペアワイズ比較により、潜在ユーティリティ機能を推測することができる。
我々は,Large Language Model (LLM) のペルソナを用いて,多様な地域環境下で運用されているPortfolio Managerをシミュレートすることで,我々のフレームワークを体系的に評価する。
歴史的市場データを用いた実証的な結果は、地域背景が派生した嗜好の重みを根本的にシフトしていることを明らかにする。
例えば、ヨーロッパ拠点のペルソナは金融リターンよりもESGアライメントを優先する傾向にあり、テキサス拠点のペルソナはリスク調整のパフォーマンスを優先する傾向にある。
この作業は高度に適応可能なフレームワークを提供し、多目的のアルゴリズム取引を多様で現実的な人間の持続可能性の選好と整合させることに成功した。
関連論文リスト
- MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization [133.27496265096445]
我々は,グループ相対的政策最適化を,その適合性を検討することなく,マルチリワード設定で適用する方法を示す。
次に、これらの問題を解決するための新しい政策最適化手法であるグループ報酬分離正規化政策最適化(GDPO)を紹介する。
GDPOはGRPOを一貫して上回り、マルチリワード強化学習最適化の有効性と一般化性を示す。
論文 参考訳(メタデータ) (2026-01-08T18:59:24Z) - Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models [19.559468441956714]
Reinforcement Learning from Human Feedbackは、大きな言語モデルと人間の好みを整合させる強力なテクニックとして登場した。
人的価値アライメントは多目的最適化問題であり、潜在的な競合する対象の集合を最大化することを目的としている。
我々は,LLMを様々な好み分布に整合させるために,多段降下を用いた新しい微調整パラダイムであるGAPOを紹介した。
論文 参考訳(メタデータ) (2025-07-02T17:25:26Z) - RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 [20.92548890511589]
本稿では,Large Language Models(LLM)を利用したレコメンデーションフレームワークであるRecLLM-R1を紹介する。
RecLLM-R1は、精度、多様性、新規性など、さまざまな評価指標において、既存のベースラインメソッドを大幅に上回っている。
論文 参考訳(メタデータ) (2025-06-24T01:39:34Z) - DisCO: Reinforcing Large Reasoning Models with Discriminative Constrained Optimization [50.91849555841057]
グループ相対政策最適化は大規模推論モデル(LRM)の強化学習手法である
差別学習の原則を基礎として, LRMの強化のための新たな差別的制約付き最適化フレームワークを導入する。
DisCO は GRPO と DAPO などの改良型を著しく上回り、GRPO の7%、DAPO の6% を平均的に上回っている。
論文 参考訳(メタデータ) (2025-05-18T11:08:32Z) - A Survey of Direct Preference Optimization [103.59317151002693]
LLM(Large Language Models)は、前例のない生成能力を示す。
人的価値との整合性は、有用で無害なデプロイメントを保証する上で、依然として重要です。
直接優先度最適化(DPO)は、最近、合理化された代替案として注目されている。
論文 参考訳(メタデータ) (2025-03-12T08:45:15Z) - Bayesian Optimization of ESG Financial Investments [0.0]
ESG (Economic, Social and Governance) の基準は金融においてより重要になっている。
本稿では,数理モデリングとESGとファイナンスを組み合わせた。
論文 参考訳(メタデータ) (2023-02-10T15:17:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。