論文の概要: When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
- arxiv url: http://arxiv.org/abs/2605.30719v1
- Date: Fri, 29 May 2026 01:24:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.325362
- Title: When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?
- Title(参考訳): LLMは逐次RLタスクに十分なポリシー最適化をいつ行うか?
- Abstract要約: 大規模言語モデル(LLM)は、強化学習タスクの効果的なブラックボックスポリシーモデルとして機能する。
Prompted Policy Optimization (PromptPO) は、状態空間、アクション空間、報酬関数をPythonで記述した LLM を反復的に生成する手法である。
PromptPOは、環境相互作用を著しく少なくしながら、標準のRLベースラインのパフォーマンスにマッチまたは超過することが多い。
- 参考スコア(独自算出の注目度): 15.079504478885953
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study when large language models (LLMs) can serve as effective black-box policy optimizers for reinforcement learning (RL) tasks, i.e., when can we replace classical RL algorithms with an LLM? We explore this question by introducing Prompted Policy Optimization (PromptPO), an iterative method that prompts an LLM with Python descriptions of the state space, action space, and reward function, then has it generate and refine executable policies based on rollout feedback. Across hard exploration environments, Meta-World robotics tasks, and several real-world control problems, PromptPO often matches or exceeds the performance of standard RL baselines while using substantially fewer environment interactions. To maximize expected return, and without further explicit prompting, the policies PromptPO outputs range from tuned proportional controllers or rule-based plans to policies that run planning algorithms like value iteration. Our results demonstrate that LLM-based policy optimization is sufficient when the LLM can leverage prior knowledge about the environment or optimization strategy. PromptPO underperforms standard RL baselines in MuJoCo domains. This demonstrates possible limitations of LLM-based policy optimization to settings that requiring fine-grained continuous control.
- Abstract(参考訳): 大規模言語モデル(LLM)が強化学習(RL)タスクに有効なブラックボックスポリシーオプティマイザとして機能しうる場合、すなわち、従来のRLアルゴリズムをLLMに置き換えるにはどうすればよいかを検討する。
Prompted Policy Optimization (PromptPO)は、状態空間、アクション空間、報酬関数をPythonで記述したLCMを反復的に実行し、ロールアウトフィードバックに基づいて実行可能なポリシーを生成し、洗練させる手法である。
硬い探査環境、メタワールドロボティクスタスク、およびいくつかの実世界の制御問題において、PromptPOは環境相互作用を著しく少なくしながら、標準のRLベースラインのパフォーマンスに適合または超過することが多い。
期待したリターンを最大化するために、さらに明確なプロンプトなしで、PromptPOの出力ポリシーは、調整された比例的なコントローラやルールベースの計画から、バリューイテレーションのような計画アルゴリズムを実行するポリシーまで様々である。
本研究は, LLMが環境や最適化戦略に関する事前知識を活用できる場合, LLMに基づく政策最適化が十分であることを示す。
PromptPO は MuJoCo ドメインの標準 RL ベースラインを過小評価する。
これは、細粒度の連続制御を必要とする設定に対するLLMベースのポリシー最適化の限界を示す。
関連論文リスト
- Towards Harnessing the Power of LLMs for ABAC Policy Mining [0.0468771281852187]
本稿では,大規模言語モデル(LLM)によるABAC(Attribute-based Access Control)ポリシーマイニングの実施に関する実証的研究を行う。
Google Gemini (Flash と Pro) と OpenAI ChatGPT を政策マイニングエンジンとして評価した。
論文 参考訳(メタデータ) (2025-11-22T15:49:36Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - Improving the Data-efficiency of Reinforcement Learning by Warm-starting with LLM [14.139788456751706]
本稿では,RL(Reinforcement Learning)アルゴリズムを温めるために,高品質なデータ収集におけるLLM(Large Language Model)の利用について検討する。
我々のアルゴリズムであるLOROは、最適ポリシーに収束し、高いサンプル効率を持つ。
CartPole や Pendulum など,OpenAI の複数の環境において,LORO がベースラインアルゴリズムより優れていることを実証的に示す。
論文 参考訳(メタデータ) (2025-05-16T05:03:39Z) - Large Language Model driven Policy Exploration for Recommender Systems [50.70228564385797]
静的ユーザデータに基づいてトレーニングされたオフラインRLポリシは、動的オンライン環境にデプロイされた場合、分散シフトに対して脆弱である。
オンラインRLベースのRSも、トレーニングされていないポリシーや不安定なポリシーにユーザをさらけ出すリスクがあるため、運用デプロイメントの課題に直面している。
大規模言語モデル(LLM)は、ユーザー目標と事前学習ポリシーをオフラインで模倣する有望なソリューションを提供する。
LLMから抽出したユーザの嗜好を利用した対話型学習ポリシー(iALP)を提案する。
論文 参考訳(メタデータ) (2025-01-23T16:37:44Z) - Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone [72.17534881026995]
ポリシーに依存しないRL(PA-RL)と呼ばれるオフラインおよびオンラインの微調整手法を開発する。
オンラインRLファインチューニングアルゴリズムであるCal-QLを用いて、7BジェネラリストロボットポリシーであるOpenVLAのファインチューニングに成功した最初の結果を示す。
論文 参考訳(メタデータ) (2024-12-09T17:28:03Z) - Value Augmented Sampling for Language Model Alignment and Personalization [39.070662999014836]
報酬最適化のための新しいフレームワーク、価値拡張サンプリング(VAS)を提案する。
VASは、ポリシーと値関数を併用することなく、最適報酬最大化ポリシーを解く。
我々のアルゴリズムは、いくつかの報酬を作曲し、展開期間中に各報酬の幅を制御できる新しい能力を解き放ちます。
論文 参考訳(メタデータ) (2024-05-10T17:59:04Z) - REBEL: Reinforcement Learning via Regressing Relative Rewards [59.68420022466047]
生成モデルの時代における最小限のRLアルゴリズムであるREBELを提案する。
理論的には、自然ポリシーグラディエントのような基本的なRLアルゴリズムはREBELの変種と見なすことができる。
我々はREBELが言語モデリングと画像生成に一貫したアプローチを提供し、PPOやDPOとより強くあるいは類似した性能を実現することを発見した。
論文 参考訳(メタデータ) (2024-04-25T17:20:45Z) - How Can LLM Guide RL? A Value-Based Approach [68.55316627400683]
強化学習(Reinforcement Learning, RL)は、将来の行動方針をフィードバックで改善することにより、シーケンシャルな意思決定問題の事実上の標準的実践となった。
大規模言語モデル(LLM)の最近の発展は、言語理解と生成において印象的な能力を示したが、探索と自己改善能力に欠けていた。
我々はLINVITというアルゴリズムを開発し、LLMガイダンスを値ベースRLの正規化因子として組み込んで学習に必要なデータ量を大幅に削減する。
論文 参考訳(メタデータ) (2024-02-25T20:07:13Z) - Jump-Start Reinforcement Learning [68.82380421479675]
本稿では、オフラインデータやデモ、あるいは既存のポリシーを使ってRLポリシーを初期化するメタアルゴリズムを提案する。
特に,タスク解決に2つのポリシーを利用するアルゴリズムであるJump-Start Reinforcement Learning (JSRL)を提案する。
実験により、JSRLは既存の模倣と強化学習アルゴリズムを大幅に上回っていることを示す。
論文 参考訳(メタデータ) (2022-04-05T17:25:22Z) - POPO: Pessimistic Offline Policy Optimization [6.122342691982727]
オフポリシーRLメソッドが、バリュー関数ビューからオフライン設定で学習できない理由について検討する。
悲観的オフライン政策最適化(POPO)を提案する。これは悲観的価値関数を学習し、強い政策を得る。
POPOは驚くほどよく機能し、高次元の状態と行動空間を持つタスクにスケールする。
論文 参考訳(メタデータ) (2020-12-26T06:24:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。