論文の概要: EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2606.26327v1
- Date: Wed, 24 Jun 2026 19:13:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.061915
- Title: EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning
- Title(参考訳): EVOM:強化学習のためのアクタークリティカルアーキテクチャのエージェントメタ進化
- Authors: Boyun Zhang, Chao Wang, Kai Wu,
- Abstract要約: EVOMは高性能アクター批判アーキテクチャを発見するためのエージェント的メタ進化フレームワークである。
LLMをベースとした設計エージェントがアーキテクチャデザイナとして純粋に動作し、ポリシーの実行と環境管理から完全に切り離されている。
実験の結果,手動で設計したベースライン,LLM誘導ランダムサーチ,そして最先端のLLM誘導プログラム型ポリシーサーチ手法MLESよりも優れた結果が得られた。
- 参考スコア(独自算出の注目度): 8.492153961929898
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In actor-critic reinforcement learning, network architectures are typically manually designed. Automating this design is challenging because each candidate must be trained before evaluation, and the design space is open-ended. To address these challenges, we introduce EVOM, an agentic meta-evolution framework for discovering high-performance actor-critic architectures. We frame architecture search as a bi-level optimization: an inner loop trains weights via the low-fidelity proximal policy optimization (PPO), while an outer loop drives meta-evolution by iteratively refining architecture programs. Crucially, this outer loop is powered by an LLM-based design agent that operates purely as an architecture designer, completely decoupled from policy execution and environment control. Experiments reveal that EVOM outperforms the manually designed baseline, an LLM-guided random search, and the state-of-the-art LLM-guided programmatic policy search method MLES, delivering superior performance on Ant-v4 and HalfCheetah-v4. Ablation studies validate that both the meta-evolution loop and the LLM Design Agent are indispensable for final performance.
- Abstract(参考訳): アクター批判強化学習では、ネットワークアーキテクチャは通常手動で設計される。
この設計の自動化は、各候補を評価の前にトレーニングし、設計スペースをオープンにする必要があるため、難しい。
これらの課題に対処するために,高性能アクター批判アーキテクチャを発見するためのエージェント的メタ進化フレームワークであるEVOMを紹介する。
内部ループは低忠実性近位ポリシー最適化(PPO)を介して重み付けを行い、外側ループは反復的に精製するアーキテクチャプログラムによってメタ進化を駆動する。
重要なことは、この外輪はLLMベースの設計エージェントによって駆動され、アーキテクチャ設計者として純粋に動作し、ポリシーの実行と環境制御から完全に切り離されている。
EVOMは手動設計のベースライン、LLM誘導ランダムサーチ、最先端のLLM誘導プログラミングポリシーサーチ手法MLESより優れており、Ant-v4とHalfCheetah-v4で優れた性能を提供する。
メタ進化ループとLLMデザインエージェントの両方が最終性能に欠かせないことを検証する。
関連論文リスト
- A2DEPT: Large Language Model-Driven Automated Algorithm Design via Evolutionary Program Trees [8.49373236378493]
大規模言語モデル(LLM)に基づく自動ヒューリスティックデザイン(AHD)は、人間の介入を最小限に抑えて、自律的にコンポーネントを生成することを約束している。
剛性テンプレートを超えたオープンエンドソルバを実現するために,A2DEPT(Automated Evolutionary Program Trees)を提案する。
A2DEPTは、ハイブリッド選択と階層演算子による木構造進化探索を通じて広大なプログラム空間を探索し、完全なアルゴリズムを反復的に洗練することができる。
論文 参考訳(メタデータ) (2026-04-27T05:07:10Z) - LLM as a Tool, Not an Agent: Code-Mined Tree Transformations for Neural Architecture Search [8.58441788229967]
安定かつオープンなモデル進化のための階層木に基づくNASフレームワークを提案する。
CIFAR-10, CIFAR-100, ImageNet16-120において既存のNAS法を0.69, 1.83, 2.68ポイント改善する。
論文 参考訳(メタデータ) (2026-04-17T07:56:26Z) - Advancing Automated Algorithm Design via Evolutionary Stagewise Design with LLMs [69.91297564489464]
EvoStageは、産業規模のアルゴリズム設計の厳密な要求とLLMベースのアルゴリズム設計のギャップを埋める新しい進化パラダイムである。
EvoStageは、アルゴリズム設計プロセスを逐次的に管理可能なステージに分解し、リアルタイム中間フィードバックを反復的に洗練されたアルゴリズム設計方向に統合する。
商用グレードの3Dチップ配置ツールにデプロイすると、EvoStageはオリジナルのパフォーマンス指標を大幅に上回り、記録破りの効率を達成する。
論文 参考訳(メタデータ) (2026-03-09T05:13:44Z) - Closed-Loop LLM Discovery of Non-Standard Channel Priors in Vision Models [48.83701310501069]
大規模言語モデル(LLM)はニューラルアーキテクチャサーチ(NAS)に対する変換的アプローチを提供する
我々は、LLMが性能テレメトリに基づいてアーキテクチャ仕様を洗練する条件付きコード生成タスクのシーケンスとして検索を定式化する。
AST(Abstract Syntax Tree)変異を用いて,有効かつ整合性のあるアーキテクチャの膨大なコーパスを生成する。
CIFAR-100の実験結果は、この手法の有効性を検証し、精度の統計的に有意な改善をもたらすことを示した。
論文 参考訳(メタデータ) (2026-01-13T13:00:30Z) - Large Language Models for Physics Instrument Design [0.0]
物理機器設計における大規模言語モデル(LLM)の利用について検討し、その性能を強化学習(RL)と比較する。
RL はより強力な最終設計をもたらすが、現代の LLM は、有効で、リソースを意識し、物理的に意味のある構成を一貫して生成する。
そのため、自動クローズドループ・インスツルメンツの設計に向け、最適化の構築と監督に要する人的労力を削減できる。
論文 参考訳(メタデータ) (2026-01-12T14:30:54Z) - LM-Searcher: Cross-domain Neural Architecture Search with LLMs via Unified Numerical Encoding [55.5535016040221]
LM-Searcherは、クロスドメインニューラルネットワーク最適化のための新しいフレームワークである。
我々のアプローチの中心は、ニューラルネットワークのための普遍的な数値文字列表現であるNCodeである。
我々のデータセットは、幅広いアーキテクチャとパフォーマンスのペアを含み、堅牢で伝達可能な学習を促進する。
論文 参考訳(メタデータ) (2025-09-06T09:26:39Z) - LLM4CMO: Large Language Model-aided Algorithm Design for Constrained Multiobjective Optimization [54.35609820607923]
大規模言語モデル(LLM)は、アルゴリズム設計を支援する新しい機会を提供する。
LLM4CMOは,2つの人口構成をもつ2段階のフレームワークをベースとした新しいCMOEAである。
LLMは複雑な進化最適化アルゴリズムの開発において効率的な共同設計者として機能する。
論文 参考訳(メタデータ) (2025-08-16T02:00:57Z) - Improving Parallel Program Performance with LLM Optimizers via Agent-System Interfaces [9.880183350366792]
並列プログラムのパフォーマンスを改善する上で重要な課題は、タスクをプロセッサやデータに効率的にメモリにマッピングすることだ。
生成最適化によるマッパー開発を自動化するフレームワークを提案する。
提案手法では,9つのベンチマークで1.34倍の高速化を実現している。
論文 参考訳(メタデータ) (2024-10-21T04:08:37Z) - Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement [67.1393112206885]
大規模言語モデル(LLM)は、対話的な意思決定タスクにおいてインテリジェントなエージェントとして期待されている。
本稿では,トークンレベルでのLLMの最適化に適したエントロピー拡張RL法である,エントロピー正規化トークンレベル最適化(ETPO)を導入する。
我々は,データサイエンスコード生成を多段階対話型タスクのシリーズとしてモデル化したシミュレーション環境におけるETPOの有効性を評価する。
論文 参考訳(メタデータ) (2024-02-09T07:45:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。