論文の概要: Escher-Loop: Mutual Evolution by Closed-Loop Self-Referential Optimization
- arxiv url: http://arxiv.org/abs/2604.23472v1
- Date: Sat, 25 Apr 2026 23:46:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:07.379362
- Title: Escher-Loop: Mutual Evolution by Closed-Loop Self-Referential Optimization
- Title(参考訳): Escher-Loop:クローズドループ自己参照最適化による相互進化
- Abstract要約: Escher-Loopは2つの異なる集団の進化を運用するフレームワークである。
Escher-Loopは静的なベースラインの性能天井を効果的に越え、絶対的な最高性能を達成する。
特筆すべきは、エージェントがハイパフォーマンスなタスクエージェントの要求に合うように戦略を動的に適応させることである。
- 参考スコア(独自算出の注目度): 7.89766538351877
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: While recent autonomous agents demonstrate impressive capabilities, they predominantly rely on manually scripted workflows and handcrafted heuristics, inherently limiting their potential for open-ended improvement. To address this, we propose Escher-Loop, a fully closed-loop framework that operationalizes the mutual evolution of two distinct populations: Task Agents that solve concrete problems, and Optimizer Agents that recursively refine both the task agents and themselves. To sustain this self-referential evolution, we propose a dynamic benchmarking mechanism that seamlessly reuses the empirical scores of newly generated task agents as relative win-loss signals to update optimizers' scores. This mechanism leverages the evolution of task agents as an inherent signal to drive the evaluation and refinement of optimizers without additional overhead. Empirical evaluations on mathematical optimization problems demonstrate that Escher-Loop effectively pushes past the performance ceilings of static baselines, achieving the highest absolute peak performance across all evaluated tasks under matched compute. Remarkably, we observe that the optimizer agents dynamically adapt their strategies to match the shifting demands of high-performing task agents, which explains the system's continuous improvement and superior late-stage performance.
- Abstract(参考訳): 最近の自律エージェントは印象的な能力を示しているが、それらは主に手書きのワークフローと手作りのヒューリスティックに依存しており、本質的にはオープンな改善の可能性を制限している。
そこで本稿では,具体的問題を解決するタスクエージェントと,タスクエージェントとそれ自身を再帰的に洗練するオプティマイザエージェントという,2つの異なる集団の相互進化を運用する,完全なクローズドループフレームワークであるEscher-Loopを提案する。
この自己参照的進化を維持するため、我々は、新しいタスクエージェントの経験的スコアを相対的なウィンロス信号としてシームレスに再利用し、最適化者のスコアを更新する動的ベンチマーク機構を提案する。
このメカニズムは、タスクエージェントの進化を固有の信号として活用し、オープティマイザの評価と改善を追加のオーバーヘッドなしに進める。
数式最適化問題に対する実証的な評価は、エッシャー・ループが静的ベースラインの性能天井を効果的に越え、一致した計算の下で評価された全てのタスクで最高の絶対ピーク性能を達成することを示した。
特筆すべきは、最適化エージェントが、高性能タスクエージェントのシフト要求に適合するように、戦略を動的に適応させることである。
関連論文リスト
- Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Evolutionary Ensemble of Agents [7.465452178698495]
EvEは、分散化されたフレームワークであり、アルゴリズム発見のためのライブで共進化するシステムにコーディングエージェントを編成する。
2つの共進化する人口を維持することで、EvEはエージェントを同期レースを通じて評価し、経験的Elo格付けを更新する。
固定初期エージェントや凍結した「ベスト進化」エージェントによって駆動される変種と比較して、EvEは位相ミスマッチを独自に回避する。
論文 参考訳(メタデータ) (2026-05-09T15:56:10Z) - VeRO: An Evaluation Harness for Agents to Optimize Agents [5.227525836910522]
我々は、バージョン管理されたエージェントスナップショット、予算管理された評価、構造化された実行トレースを備えた再現可能な評価手法であるVERO(Versioning, Rewards, Observations)を紹介する。
本研究では,ターゲットエージェントの比較実験を行い,どの修正がターゲットエージェントの性能を確実に向上させるか分析する。
論文 参考訳(メタデータ) (2026-02-25T23:40:22Z) - TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents [43.376952807616256]
自律型LLMエージェントの最近の進歩は、環境との反復的相互作用によって性能を向上させる能力を示している。
本稿では,TTIを3つの包括的かつ相互接続的な次元に分解するエージェント非依存および環境非依存のフレームワークであるテスト時間改善診断評価(TIDE)を提案する。
論文 参考訳(メタデータ) (2026-02-02T15:00:47Z) - Towards Efficient Agents: A Co-Design of Inference Architecture and System [66.59916327634639]
本稿では,エージェントアクセラレーションのための統合フレームワークであるAgentInferを提案する。
問題をAgentCollab、AgentSched、AgentSAM、AgentCompressの4つの相乗的コンポーネントに分解する。
BrowseComp-zhとDeepDiverベンチマークの実験では、これらの手法の相乗的コラボレーションを通じて、AgentInferは非効率なトークン消費を50%以上削減することを示した。
論文 参考訳(メタデータ) (2025-12-20T12:06:13Z) - Agentic Predictor: Performance Prediction for Agentic Workflows via Multi-View Encoding [56.565200973244146]
Agentic Predictorは、効率的なエージェントワークフロー評価のための軽量な予測器である。
Agentic Predictorはタスク成功率の近似を学ぶことで、最適なエージェントワークフロー構成の迅速かつ正確な選択を可能にする。
論文 参考訳(メタデータ) (2025-05-26T09:46:50Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z) - Gödel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement [112.04307762405669]
G"odel AgentはG"odelマシンにインスパイアされた自己進化型フレームワークである。
G"odel Agentは、パフォーマンス、効率、一般化性において手作業によるエージェントを上回る、継続的な自己改善を実現することができる。
論文 参考訳(メタデータ) (2024-10-06T10:49:40Z) - Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement [50.481380478458945]
反復的なステップレベルプロセスリファインメント(IPR)フレームワークは、エージェントトレーニングを強化するためのステップバイステップのガイダンスを提供する。
3つの複雑なエージェントタスクに関する我々の実験は、我々のフレームワークが様々な強力なベースラインより優れていることを示した。
論文 参考訳(メタデータ) (2024-06-17T03:29:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。