論文の概要: MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution
- arxiv url: http://arxiv.org/abs/2607.22832v1
- Date: Fri, 24 Jul 2026 18:16:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.889505
- Title: MEMENTO: Memory-Guided Memetic Code-as-Policy Evolution
- Title(参考訳): MementO: メモリ駆動のメメティックなコード・アズ・ポリティクス
- Abstract要約: 長期的な実施タスクは、タスクの成功が観察される前に、多くの依存アクションを実行するポリシーを必要とする。
MementOは、コード・アズ・ポリティクスの進化のためのメモリ誘導シングルエリート・メメティック・フレームワークである。
長地平線を具現化した2つのドメイン(Robosuite Franka Tower-of-Hanoi)とAI2-THORホームインタラクション)でMementOを評価した。
- 参考スコア(独自算出の注目度): 3.5615347765658396
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon embodied tasks require policies that execute many dependent actions before task success can be observed. Representing policies as executable control pro- grams (code-as-policy) enables their decision logic to be inspected and revised after rollout evaluation. Revised programs can then be executed and compared by rollout performance, framing policy improvement as execution-guided program search. Evo- lutionary methods driven by large language models (LLMs) provide a natural mecha- nism for this search by generating variants and selecting high-performing candidates. However, existing approaches primarily select among independently generated vari- ants and lack a sequential local improvement phase. We introduce MEMENTO, a memory-guided single-elite memetic framework for code-as-policy evolution. ME- MENTO first evolves a rollout evaluator that maps policy rollouts to scalar fitness and structured feedback metrics. Fitness selects accepted candidates and the next elite, while feedback metrics condition policy proposals generated by memory-guided hill-climbing, macro-mutation, and crossover. We evaluate MEMENTO on two long- horizon embodied domains: Robosuite Franka Tower-of-Hanoi manipulation and AI2- THOR household interaction. MEMENTO outperforms Eureka and REvolve, adapted as code-as-policy evolutionary baselines, in task success and generalization to held- out Robosuite object configurations and unseen AI2-THOR scenes. Ablations show that zero-shot generation and unevolved evaluators fail to solve either domain, and that removing policy-search branches reduces performance. Finally, we deploy the best-evolved Robosuite policy on a physical Franka robot, demonstrating the feasibil- ity of sim-to-real transfer of the evolved code-as-policy. Code, prompts, and videos are available at: https://github.com/sygkounas/MEMENTO.
- Abstract(参考訳): 長期的な実施タスクは、タスクの成功が観察される前に、多くの依存アクションを実行するポリシーを必要とする。
ポリシーを実行可能な制御プログラム(code-as-policy)として表現することで、ロールアウト評価後の決定ロジックの検査と修正が可能になる。
修正されたプログラムは、ロールアウト性能、フレーミングポリシーの改善によって実行誘導プログラム検索として実行され、比較される。
大規模言語モデル (LLM) によって駆動されるエボ溶出法は、変種を生成し、高い性能の候補を選択することによって、この探索に自然なメカニムを提供する。
しかし、既存のアプローチは、主に独立に生成されたヴァリアリの中から選択され、逐次的な局所改善フェーズが欠如している。
MementOは、コード・アズ・ポリティクスの進化のためのメモリ誘導シングルエリート・メメティック・フレームワークである。
ME-MENTOはまず、ポリシーのロールアウトをスカラー適合度と構造化されたフィードバックメトリクスにマップするロールアウト評価器を進化させる。
Fitnessは、受理された候補と次のエリートを選択し、フィードバックメトリクス条件ポリシーの提案は、メモリ誘導ヒルクライミング、マクロミューテーション、クロスオーバーによって生成される。
長地平線を具現化した2つのドメイン(Robosuite Franka Tower-of-Hanoi)とAI2-THORホームインタラクション)でMementOを評価した。
MementOは、コード・アズ・ポリティクスの進化的ベースラインとして適応されたEurekaとRevolveを、Robosuiteオブジェクト設定の保持とAI2-THORシーンへのタスクの成功と一般化で上回っている。
アブレーションは、ゼロショット生成と非進化評価器がどちらの領域も解決できず、ポリシー探索のブランチを削除することで性能が低下することを示している。
最後に、進化したコード・アズ・ポリティクスのSIM-to-realトランスファーの可能性を実証し、最も進化したRobosuiteポリシーをFrankaロボットに展開する。
コード、プロンプト、ビデオは、https://github.com/sygkounas/MementO.comで入手できる。
関連論文リスト
- EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy [48.898967774856466]
EMERGE-Policyは機能呼び出しと情報交換の両方をコーディネートする。
Main Agentはアクティブなコンテキストウィンドウ内でタスクレベルの状態を保持する。
ロール固有のサブエージェント プロセスの認識、実行監視、検証、メモリ統合。
論文 参考訳(メタデータ) (2026-08-30T16:46:06Z) - OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks [17.773038952370865]
本稿では,ループポリシーを中心とした自己進化フレームワークであるOpenLoopEvolve(OLE)について述べる。
OLEは、エージェントの観察、計画、記憶、行動、検証、回復、停止、予算管理を、バージョンと系統を持つポータブルなポリシー資産として表現する。
オンラインモードは連続的な操作からのフィードバックに基づいて候補生成をトリガーし、オフラインモードはアーカイブされたトレースと障害証拠から候補ポリシーを検索する。
論文 参考訳(メタデータ) (2026-08-10T09:57:26Z) - Co-Evolving LLM Evaluators and Policies via DynamicRubric [67.2962847914162]
政策によって引き起こされたサンプルに対する評価者フィードバックによるポストトレーニングは、大きな言語モデルを改善するための主要なメカニズムとなる。
反応条件付き評価器であるDynamicRubricを提案する。
8Bバックボーンを用いた実験では、DynamicRubricは評価器のパフォーマンスを改善し、ベースラインよりも強力なポリシー管理を提供する。
論文 参考訳(メタデータ) (2026-07-22T12:35:40Z) - EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments [64.33452656100393]
本稿では,固定的なインタラクション予算の下で,ハーネスモデルエージェントが繰り返し実行可能なポリシシステムを編集する制御された評価設定である自律ポリシー進化を紹介する。
この設定を、コンパクトなインタラクティブRL環境から構築されたベンチマークであるEvoPolicyGymでインスタンス化する。
EvoPolicyGymスイートでは、GPT-5.5が16の環境で最強のランキングスコアとトップ2のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-07-02T17:10:13Z) - Can Generalist Agents Automate Data Curation? [58.652262227632406]
トレーニングデータのキュレーションは、現代のAI開発において、もっとも重要だが労働集約的な部分のひとつだ。
一般のコーディングエージェントがこのデータキュレーションループを自動化できるかどうかを問う。
モデル、トレーニングレシピ、評価スイートを修正するエージェント中心のベンチマークである*Curation-Bench*を紹介します。
論文 参考訳(メタデータ) (2026-06-02T22:26:53Z) - RankGR: Rank-Enhanced Generative Retrieval with Listwise Direct Preference Optimization in Recommendation [36.297513746770456]
提案するRangGRは、リストワイズ直接選好最適化をレコメンデーションに組み込んだジェネレーティブ検索手法である。
IAPでは、新しいリストワイズ直接選好最適化戦略をGRに組み込んで、階層的ユーザの選好をより包括的に理解する。
トレーニングとデプロイメントにおいていくつかの実践的な改善を実現し、最終的には毎秒1万近いリクエストを処理可能なリアルタイムシステムを実現しています。
論文 参考訳(メタデータ) (2026-02-09T12:13:43Z) - SCOPE: Prompt Evolution for Enhancing Agent Effectiveness [53.75986399936395]
大規模言語モデル(LLM)エージェントは、大規模で動的なコンテキストを生成する環境にますますデプロイされている。
エージェントはこのコンテキストにアクセスできますが、静的なプロンプトには効果的に管理するメカニズムがありません。
textbfSCOPE (Self-evolving Context Optimization via Prompt Evolution) を導入する。
本稿では,戦術的特異性(即時誤りの解消)と戦略的汎用性(長期原則の進化)のバランスをとるデュアルストリーム機構を提案する。
論文 参考訳(メタデータ) (2025-12-17T12:25:05Z) - HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents [6.861838493263133]
HyCodePolicyは、エンボディエージェントのための言語ベースの制御フレームワークである。
コード合成、幾何学的接地、知覚的モニタリング、反復的修復をクローズドループプログラミングサイクルに統合する。
その結果,HyCodePolicyはロボット操作ポリシーの堅牢性とサンプル効率を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2025-08-04T17:18:14Z) - Dense Policy: Bidirectional Autoregressive Learning of Actions [51.60428100831717]
本稿では,行動予測における自己回帰的政策の新たなパラダイムを確立するために,Dense Policyと呼ばれる双方向拡張学習手法を提案する。
軽量なエンコーダのみのアーキテクチャを使用して、アクションシーケンスを初期単一フレームからターゲットシーケンスへ粗い方法で反復的に展開する。
実験により、我々の密集した政策は自己回帰学習能力に優れており、既存の全体的生成ポリシーを超越できることが示された。
論文 参考訳(メタデータ) (2025-03-17T14:28:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。