Fugu-MT 論文翻訳(概要): Combining Reinforcement Learning and Inverse Reinforcement Learning for Asset Allocation Recommendations

論文の概要: Combining Reinforcement Learning and Inverse Reinforcement Learning for Asset Allocation Recommendations

arxiv url: http://arxiv.org/abs/2201.01874v1
Date: Thu, 6 Jan 2022 00:08:17 GMT
ステータス: 翻訳完了
システム内更新日: 2022-01-07 14:41:02.956203
Title: Combining Reinforcement Learning and Inverse Reinforcement Learning for Asset Allocation Recommendations
Title（参考訳）: 資産配分勧告のための強化学習と逆強化学習の組み合わせ
Authors: Igor Halperin, Jiayu Liu, Xiao Zhang
Abstract要約: 我々のアプローチは、逆強化学習(IRL)とRLの組み合わせに基づいている。まず、IRLコンポーネントは、トレーディング履歴から示唆されたファンドマネジャーの意図を学習し、インプリッド報酬機能を回復する。 2番目のステップでは、アセット割り当て決定を最適化するために直接RLアルゴリズムによってこの報酬関数が使用される。
参考スコア（独自算出の注目度）: 5.515442919147122
License: http://creativecommons.org/licenses/by-nc-sa/4.0/
Abstract: We suggest a simple practical method to combine the human and artificial intelligence to both learn best investment practices of fund managers, and provide recommendations to improve them. Our approach is based on a combination of Inverse Reinforcement Learning (IRL) and RL. First, the IRL component learns the intent of fund managers as suggested by their trading history, and recovers their implied reward function. At the second step, this reward function is used by a direct RL algorithm to optimize asset allocation decisions. We show that our method is able to improve over the performance of individual fund managers.
Abstract（参考訳）: 我々は、人間と人工知能を組み合わせることで、ファンドマネージャの最良の投資プラクティスを学習し、それらを改善するためのアドバイスを提供するための、シンプルな実践的な方法を提案する。我々のアプローチは、逆強化学習(IRL)とRLの組み合わせに基づいている。まず、IRLコンポーネントは、トレーディング履歴から示唆されたファンドマネージャの意図を学習し、インプリッド報酬機能を回復する。 2番目のステップでは、アセット割り当て決定を最適化するために直接RLアルゴリズムによってこの報酬関数が使用される。当社の手法は,個々のファンドマネージャのパフォーマンスよりも改善可能であることを示す。

関連論文リスト

Personalized Exercise Recommendation with Semantically-Grounded Knowledge Tracing [54.44838681588145]
ExRecは、セマンティックグラウンドの知識トレースを備えたパーソナライズされたエクササイズレコメンデーションのためのフレームワークである。 ExRecは、新しい、目に見えない質問に頑健に一般化し、解釈可能な学習軌跡を生成することを示す。
論文参考訳（メタデータ） (2025-07-15T07:54:04Z)
DeepRec: Towards a Deep Dive Into the Item Space with Large Language Model Based Recommendation [83.21140655248624]
大型言語モデル (LLM) はレコメンダシステム (RS) に導入された。本稿では, LLM と TRM の自律的マルチターンインタラクションを実現する新しい RS である DeepRec を提案する。公開データセットの実験では、DeepRecは従来のものとLLMベースのベースラインの両方で大幅にパフォーマンスが向上している。
論文参考訳（メタデータ） (2025-05-22T15:49:38Z)
Enhanced Penalty-based Bidirectional Reinforcement Learning Algorithms [4.197448156583907]
エージェントが初期状態と終端状態の両方から学習できる双方向学習手法を提案する。提案手法は,Maniのスキルベンチマーク環境に対して検証される。その結果、この統合戦略は、困難なシナリオにおける政策学習、適応性、全体的なパフォーマンスを向上させることが示唆された。
論文参考訳（メタデータ） (2025-04-04T04:43:07Z)
Non-Adversarial Inverse Reinforcement Learning via Successor Feature Matching [23.600285251963395]
逆強化学習(IRL)では、エージェントは環境との相互作用を通じて専門家のデモンストレーションを再現しようとする。伝統的にIRLは、敵が報酬モデルを探し出し、学習者が繰り返しRL手順で報酬を最適化する対戦ゲームとして扱われる。直接ポリシー最適化によるIRLに対する新しいアプローチを提案し、リターンの線形因数分解を後継特徴の内積および報酬ベクトルとして活用する。
論文参考訳（メタデータ） (2024-11-11T14:05:50Z)
From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文参考訳（メタデータ） (2024-11-06T10:35:11Z)
RLRF4Rec: Reinforcement Learning from Recsys Feedback for Enhanced Recommendation Reranking [33.54698201942643]
大規模言語モデル(LLM)は、様々な領域で顕著なパフォーマンスを示している。本稿では,Reinforcement Learning from Recsys Feedback for Enhanced Recommendation Re rankを組み込んだ新しいフレームワークであるRLRF4Recを紹介する。
論文参考訳（メタデータ） (2024-10-08T11:42:37Z)
A State Augmentation based approach to Reinforcement Learning from Human Preferences [20.13307800821161]
優先に基づく強化学習は、クエリされたトラジェクトリペアのバイナリフィードバックを利用することで、この問題を解決しようとする。本稿では,エージェントの報酬モデルが堅牢である状態拡張手法を提案する。
論文参考訳（メタデータ） (2023-02-17T07:10:50Z)
Learning to Optimize for Reinforcement Learning [58.01132862590378]
強化学習(Reinforcement Learning, RL)は、教師付き学習とは本質的に異なり、実際、これらの学習は単純なRLタスクでもうまく機能しない。エージェント勾配分布は非独立で同一分布であり、非効率なメタトレーニングをもたらす。おもちゃのタスクでしか訓練されていないが、我々の学習はブラックスの目に見えない複雑なタスクを一般化できることを示した。
論文参考訳（メタデータ） (2023-02-03T00:11:02Z)
Basis for Intentions: Efficient Inverse Reinforcement Learning using Past Experience [89.30876995059168]
逆強化学習(IRL) - エージェントの報酬関数をその振る舞いを観察することから推測する。本稿では、エージェントの報酬関数を観察することのできないIRLの問題に対処する。
論文参考訳（メタデータ） (2022-08-09T17:29:49Z)
Reward Uncertainty for Exploration in Preference-based Reinforcement Learning [88.34958680436552]
好みに基づく強化学習アルゴリズムを対象とした探索手法を提案する。我々の基本的な考え方は、学習した報酬に基づいて、斬新さを測定することによって、本質的な報酬を設計することである。実験により、学習報酬の不確実性からの探索ボーナスは、好みに基づくRLアルゴリズムのフィードバック効率とサンプル効率の両方を改善することが示された。
論文参考訳（メタデータ） (2022-05-24T23:22:10Z)
Information Directed Reward Learning for Reinforcement Learning [64.33774245655401]
我々は、標準rlアルゴリズムが可能な限り少数の専門家クエリで高い期待値を達成することができる報酬関数のモデルを学ぶ。特定のタイプのクエリ用に設計された以前のアクティブな報酬学習方法とは対照的に、IDRLは自然に異なるクエリタイプに対応します。我々は,複数の環境における広範囲な評価と,異なるタイプのクエリでこの結果を支持する。
論文参考訳（メタデータ） (2021-02-24T18:46:42Z)
Self-Imitation Advantage Learning [43.8107780378031]
自己模倣学習は、期待以上のリターンのアクションを奨励する強化学習方法です。本稿では,ベルマン最適性演算子を改変したオフポリシーRLの自己模倣学習の新たな一般化を提案する。
論文参考訳（メタデータ） (2020-12-22T13:21:50Z)
Generative Inverse Deep Reinforcement Learning for Online Recommendation [62.09946317831129]
オンラインレコメンデーションのための新しい逆強化学習手法InvRecを提案する。 InvRecは、オンラインレコメンデーションのために、ユーザの行動から報酬関数を自動的に抽出する。
論文参考訳（メタデータ） (2020-11-04T12:12:25Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。