論文の概要: Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.07178v1
- Date: Wed, 08 Jul 2026 09:13:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.328767
- Title: Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning
- Title(参考訳): マルチタスクエージェント強化学習のためのエントロピーペイシングポリシー最適化
- Abstract要約: 異なるタスクが探索と探索のペースのミスマッチを示すことを示す。
このバック・アンド・フォース相互作用は、タスク間のエントロピークロスオーバーと頻繁なエントロピースパイクを生み出す。
本研究では,マルチタスクエージェント型大規模言語モデル(LLM)タスクに対して,Entropy Pacing Policy Optimization (EPPO)を導入する。
- 参考スコア(独自算出の注目度): 82.58758211120319
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent breakthroughs of Reinforcement Learning (RL) have highlighted its potential for complex agentic Large Language Model (LLM) tasks. However, existing efforts largely focus on single-task settings, whereas real-world deployment necessitates a generalist agent capable of solving multiple tasks simultaneously. In this work, we identify a critical yet underexplored phenomenon in multi-task agentic RL: different tasks can exhibit exploration-exploitation pace mismatch. Specifically, easier tasks may converge early to low-entropy policies that hinder learning on harder tasks, while harder tasks can, in turn, push easier tasks back toward high-entropy exploration. This back-and-forth interaction creates inter-task entropy crossovers and frequent entropy spikes. Inspired by this observation, we introduce Entropy Pacing Policy Optimization (EPPO) for multi-task agentic LLMs, which coordinates entropy across tasks to stabilize multi-task optimization. At the core of EPPO is a task-wise dynamic clipping mechanism that replaces the fixed clipping threshold in Group Relative Policy Optimization (GRPO) with a task entropy-aware adaptive bound, tightening updates for over-confident tasks while relaxing them for under-explored ones. Experiments on the multi-task agentic benchmarks demonstrate that the proposed EPPO yields results superior to its counterparts.
- Abstract(参考訳): 強化学習(RL)の最近の進歩は、複雑なエージェント型大規模言語モデル(LLM)タスクの可能性を強調している。
しかし、既存の取り組みはシングルタスク設定に重点を置いているのに対して、現実のデプロイメントには複数のタスクを同時に解決できるジェネラリストエージェントが必要である。
本研究では,マルチタスクエージェントRLにおける重要で未探索な現象を同定する。
具体的には、より簡単なタスクは、より難しいタスクで学習を妨げる低エントロピーポリシーに早期に収束し、より難しいタスクは、より簡単なタスクを高エントロピー探索へと押し戻すことができる。
このバック・アンド・フォース相互作用は、タスク間のエントロピークロスオーバーと頻繁なエントロピースパイクを生み出す。
本研究では,マルチタスクエージェントLLMのエントロピー最適化(EPPO)を導入し,タスク間でのエントロピーのコーディネートを行い,マルチタスク最適化の安定化を図る。
EPPOのコアとなるのは、グループ相対ポリシー最適化(GRPO)の固定クリッピングしきい値をタスクエントロピー対応バインドに置き換えるタスクワイドな動的クリッピング機構である。
マルチタスクエージェントベンチマークの実験は、提案されたEPPOが、そのベンチマークよりも優れた結果をもたらすことを示した。
関連論文リスト
- Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling [11.13427204975652]
マルチタスク強化学習は、複数のタスクにまたがるパフォーマンスを効率的に最適化するために、単一のエージェントを訓練することを目的としている。
すべてのタスクを共同で最適化することは、しばしば不均衡な学習をもたらす:エージェントはすぐに簡単なタスクを解決しますが、より難しいタスクについてゆっくりと学習します。
標準MTRLは、各タスクに同じ数の環境相互作用を割り当て、データを簡単にタスクに過度に割り当てる。
DRATSは、サンプリングタスクが解決されないように適応的に優先順位付けするアルゴリズムである。
論文 参考訳(メタデータ) (2026-05-14T04:22:24Z) - Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning [15.393743659727926]
大規模言語モデル(LLM)は、知識獲得、推論、ツール使用において顕著な能力を示した。
本稿では,マルチターンタスク計画を単一ターンタスク推論問題に変換する新しい手法を提案する。
論文 参考訳(メタデータ) (2025-09-24T23:47:36Z) - Bigger, Regularized, Categorical: High-Capacity Value Functions are Efficient Multi-Task Learners [60.75160178669076]
オンライン強化学習におけるタスク干渉の問題に対して,クロスエントロピーを用いて訓練し,学習可能なタスク埋め込みを条件とした高容量値モデルの使用が課題であることを示す。
280以上のユニークなタスクを持つ7つのマルチタスクベンチマークで、高い自由度ヒューマノイド制御と離散視覚ベースのRLにまたがるアプローチを検証した。
論文 参考訳(メタデータ) (2025-05-29T06:41:45Z) - Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning [70.96345405979179]
オフラインマルチタスク強化学習(MTRL)の目的は、オンライン環境相互作用を必要とせず、多様なタスクに適用可能な統一されたポリシーを開発することである。
タスクの内容と複雑さの変化は、政策の定式化において重大な課題を引き起こします。
本稿では,各タスクに対するパラメータの最適な調和部分空間を特定するための新しいソリューションであるHarmoDT(Harmony Multi-Task Decision Transformer)を紹介する。
論文 参考訳(メタデータ) (2024-11-02T05:49:14Z) - Sparse Diffusion Policy: A Sparse, Reusable, and Flexible Policy for Robot Learning [61.294110816231886]
我々はスパース・リユース・フレキシブル・ポリシー、スパース・ディフュージョン・ポリシー(SDP)を導入する。
SDPは、エキスパートとスキルを選択的に活性化し、モデル全体をトレーニングすることなく、効率的でタスク固有の学習を可能にする。
デモとコードはhttps://forrest-110.io/sparse_diffusion_policy/にある。
論文 参考訳(メタデータ) (2024-07-01T17:59:56Z) - Provable Benefits of Multi-task RL under Non-Markovian Decision Making
Processes [56.714690083118406]
マルコフ決定過程 (MDP) 下でのマルチタスク強化学習 (RL) において, 共有潜在構造の存在は, シングルタスクRLと比較して, サンプル効率に有意な利益をもたらすことが示されている。
このような利点が、部分的に観測可能なMDP(POMDP)やより一般的な予測状態表現(PSR)といった、より一般的なシーケンシャルな意思決定問題にまで拡張できるかどうかを検討する。
提案手法は,全てのPSRに対してほぼ最適ポリシーを求めるための,証明可能なアルゴリズム UMT-PSR を提案し,PSR の合同モデルクラスが有するマルチタスク学習の利点が示されることを示す。
論文 参考訳(メタデータ) (2023-10-20T14:50:28Z) - Continual Task Allocation in Meta-Policy Network via Sparse Prompting [42.386912478509814]
タスクの連続を継続的に学習することで、一般化可能なメタ政治の訓練方法を示す。
スパース・プロンプティング(CoTASP)による連続タスク割当(Continual Task Allocation)"で対処する。
実験では、CoTASPは過去のタスクの経験を保存または再生することなく、有望な可塑性-安定性トレードオフを達成する。
論文 参考訳(メタデータ) (2023-05-29T03:36:32Z) - Learning Complex Teamwork Tasks Using a Given Sub-task Decomposition [11.998708550268978]
本稿では,タスクをよりシンプルなマルチエージェントサブタスクに分解する手法を提案する。
各サブタスクでは、チーム全体のサブセットが、サブタスク固有のポリシを取得するようにトレーニングされる。
サブチームはマージされ、ターゲットタスクに転送される。そこでは、そのポリシーは、より複雑なターゲットタスクを解決するために、まとめて微調整される。
論文 参考訳(メタデータ) (2023-02-09T21:24:56Z) - Meta Reinforcement Learning with Autonomous Inference of Subtask
Dependencies [57.27944046925876]
本稿では,タスクがサブタスクグラフによって特徴づけられるような,新しい数発のRL問題を提案し,対処する。
メタ政治を直接学習する代わりに、Subtask Graph Inferenceを使ったメタラーナーを開発した。
実験の結果,2つのグリッドワールド領域とStarCraft II環境において,提案手法が潜在タスクパラメータを正確に推定できることが確認された。
論文 参考訳(メタデータ) (2020-01-01T17:34:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。