論文の概要: EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
- arxiv url: http://arxiv.org/abs/2607.02440v1
- Date: Thu, 02 Jul 2026 17:10:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.9396
- Title: EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
- Title(参考訳): EvoPolicyGym: 対話型環境における自律的政策進化の評価
- Abstract要約: 本稿では,固定的なインタラクション予算の下で,ハーネスモデルエージェントが繰り返し実行可能なポリシシステムを編集する制御された評価設定である自律ポリシー進化を紹介する。
この設定を、コンパクトなインタラクティブRL環境から構築されたベンチマークであるEvoPolicyGymでインスタンス化する。
EvoPolicyGymスイートでは、GPT-5.5が16の環境で最強のランキングスコアとトップ2のパフォーマンスを達成した。
- 参考スコア(独自算出の注目度): 64.33452656100393
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous agents are increasingly expected to improve executable policies through feedback, yet existing evaluations often collapse this process into a final score or confound it with open-ended software-engineering progress. We introduce Autonomous Policy Evolution, a controlled evaluation setting in which a harness-model agent repeatedly edits an executable policy system under a fixed interaction budget. We instantiate this setting in EvoPolicyGym, a benchmark built from compact interactive RL environments that evaluates how agents iteratively improve explored policies. On the EvoPolicyGym suite, GPT-5.5 achieves the strongest aggregate rank score and top-two performance on all 16 environments. Beyond leaderboard results, EvoPolicyGym also provides trajectory-level diagnostics that distinguish how agents allocate budget, convert feedback into parametric tuning. These analyses show that strong autonomous policy evolution depends not only on isolated task wins, but on discovering task-appropriate mechanisms and refining policies under bounded feedback.
- Abstract(参考訳): 自律エージェントはフィードバックを通じて実行可能なポリシを改善することがますます期待されているが、既存の評価では、このプロセスを最終的なスコアに崩壊させたり、オープンなソフトウェアエンジニアリングの進歩と混同することが多い。
本稿では,固定的なインタラクション予算の下で,ハーネスモデルエージェントが繰り返し実行可能なポリシシステムを編集する制御された評価設定である自律ポリシー進化を紹介する。
この設定をEvoPolicyGymでインスタンス化する。EvoPolicyGymはコンパクトな対話型RL環境から構築されたベンチマークで、エージェントが探索されたポリシーをどのように反復的に改善するかを評価する。
EvoPolicyGymスイートでは、GPT-5.5が16の環境で最強のランキングスコアとトップ2のパフォーマンスを達成した。
リーダーボードの結果以外にも、EvoPolicyGymは、エージェントがどのように予算を割り当てるかを区別し、フィードバックをパラメトリックチューニングに変換するトラジェクトリレベルの診断も提供する。
これらの分析は、強い自律的な政策の進化は、孤立したタスクの勝利だけでなく、タスクに適したメカニズムの発見や、限定されたフィードバックの下でのポリシーの精製にも依存していることを示している。
関連論文リスト
- OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks [17.773038952370865]
本稿では,ループポリシーを中心とした自己進化フレームワークであるOpenLoopEvolve(OLE)について述べる。
OLEは、エージェントの観察、計画、記憶、行動、検証、回復、停止、予算管理を、バージョンと系統を持つポータブルなポリシー資産として表現する。
オンラインモードは連続的な操作からのフィードバックに基づいて候補生成をトリガーし、オフラインモードはアーカイブされたトレースと障害証拠から候補ポリシーを検索する。
論文 参考訳(メタデータ) (2026-08-10T09:57:26Z) - MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution [3.5615347765658396]
長期的な実施タスクは、タスクの成功が観察される前に、多くの依存アクションを実行するポリシーを必要とする。
MementOは、コード・アズ・ポリティクスの進化のためのメモリ誘導シングルエリート・メメティック・フレームワークである。
長地平線を具現化した2つのドメイン(Robosuite Franka Tower-of-Hanoi)とAI2-THORホームインタラクション)でMementOを評価した。
論文 参考訳(メタデータ) (2026-07-24T18:16:35Z) - Co-Evolving LLM Evaluators and Policies via DynamicRubric [67.2962847914162]
政策によって引き起こされたサンプルに対する評価者フィードバックによるポストトレーニングは、大きな言語モデルを改善するための主要なメカニズムとなる。
反応条件付き評価器であるDynamicRubricを提案する。
8Bバックボーンを用いた実験では、DynamicRubricは評価器のパフォーマンスを改善し、ベースラインよりも強力なポリシー管理を提供する。
論文 参考訳(メタデータ) (2026-07-22T12:35:40Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - EvoDrive: Pareto Evolution for Safety-Critical Autonomous Driving via Self-Improving LLM Agents [59.44069233970625]
既存の手法は通常、手工芸品でこのトレードオフを管理し、探索されていないパターンを見渡す。
本稿では,シナリオ生成のためのLLMベースのエージェント進化フレームワークであるEvoDriveを紹介する。
EvoDriveはシミュレーターによるアクター批判アーキテクチャを採用しており、メモリ駆動アクターはジェネレータの改善を反復的に提案し、批判者は不明瞭な候補をフィルタリングする。
論文 参考訳(メタデータ) (2026-06-02T14:01:23Z) - COMAP: Co-Evolving World Models and Agent Policies for LLM Agents [14.918267305899619]
COMAPは、クローズドループインタラクションを通じてテキストワールドモデルとエージェントポリシーを共進化させる新しいフレームワークである。
各決定ステップにおいて、世界モデルは、候補行動に対する将来の状態フィードバックを予測し、エージェントは、このフィードバックの信頼性を推定して、将来の状態リフレクションを行う。
結果として生じるオンライン軌道は、自己蒸留によって世界モデルを更新するために使用され、エージェントの進化する相互作用分布によく一致する。
論文 参考訳(メタデータ) (2026-06-01T15:21:17Z) - Harnessing Agentic Evolution [32.567492765277855]
エージェント進化は、プログラム、イテレーション、科学的ソリューションを改善するための強力なパラダイムであり、候補を反復的に生成し、評価し、フィードバックを使って将来の探索を導く。
既存の手法は通常、モジュラーだが剛性のある固定手設計の手順や、フィードバックを柔軟に統合する汎用エージェントとしてインスタンス化される。
AEvoはメタエージェントがこの状態を観察し、次の候補を直接提案することでではなく、将来の進化を制御するプロシージャやエージェントコンテキストを編集することによって機能する。
論文 参考訳(メタデータ) (2026-05-13T17:45:16Z) - Policy Gradient Methods for Non-Markovian Reinforcement Learning [26.23306267677347]
非マルコフ決定過程(NMDP)における強化学習のための政策勾配法の研究
エージェント状態のダイナミクスを定式化したり、予測目的によって学習したりするアプローチとは対照的に、報酬中心の定式化を提案する。
我々は、ASMポリシーに対する新しいポリシー勾配定理を確立し、古典的なポリシー勾配の結果をマルコフ的設定からエピソードおよび無限水平割引NMDPへと拡張する。
論文 参考訳(メタデータ) (2026-05-11T16:34:28Z) - OGPO: Sample Efficient Full-Finetuning of Generative Control Policies [53.42266064673132]
ジェネレーティブコントロールポリシー(GCP)は、ロボット学習に有効なパラメータ化として登場した。
この研究は、GCPを微調整するためのサンプル効率であるOGPO(Off-policy Generative Policy Optimization)を導入している。
OGPOはマルチタスク設定、高精度挿入、デクスタラス制御にまたがる操作タスクにおける最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-05-04T18:36:40Z) - GRASP: Gradient Realignment via Active Shared Perception for Multi-Agent Collaborative Optimization [41.52202306408042]
非定常性は、同時ポリシー更新によって発生し、持続的な環境変動を引き起こす。
本稿では,一般ベルマン均衡を政策進化の安定目標として定義する新しい枠組みである,アクティブ共有知覚(GRASP)によるRealignmentを提案する。
論文 参考訳(メタデータ) (2026-04-01T10:26:22Z) - Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition [52.232968183793986]
General Policy Composition (GPC) は、複数の事前学習されたポリシーの分布スコアを組み合わせることで、パフォーマンスを向上させる訓練のない手法である。
GPCは、さまざまなタスクセットにおけるパフォーマンスと適応性を一貫して改善します。
論文 参考訳(メタデータ) (2025-10-01T16:05:53Z) - Off-Policy Evaluation for Large Action Spaces via Policy Convolution [60.6953713877886]
ポリシ・コンボリューション(Policy Convolution)のファミリーは、アクション内の潜在構造を使用して、ログとターゲットポリシを戦略的に畳み込みます。
合成およびベンチマークデータセットの実験では、PCを使用する場合の平均二乗誤差(MSE)が顕著に改善されている。
論文 参考訳(メタデータ) (2023-10-24T01:00:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。