論文の概要: Recursive self-improvement of AI research agents
- arxiv url: http://arxiv.org/abs/2609.26457v1
- Date: Tue, 22 Sep 2026 14:12:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.684208
- Title: Recursive self-improvement of AI research agents
- Title(参考訳): AI研究エージェントの再帰的自己改善
- Abstract要約: 本稿では,AI研究エージェントの研究効率向上のためのループを実装するシステムであるAIDE2を提案する。
8日間の自律走行で、AIDE2は、新しい検索ポリシーからメモリメカニズムまで、連続した7つの改善点を発見した。
最強の発見エージェントは、FML-Benchで最強のランクにランクインした、人間工学による製造研究エージェントと一致または超えている。
- 参考スコア(独自算出の注目度): 18.181986898488983
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI agents are beginning to automate research and development across the AI stack, from improving training efficiency to optimizing inference. A natural next step is to improve the research efficiency of the agents themselves. When an AI research agent's own code is the object of optimization, each accepted rewrite becomes the agent that the next round edits. We refer to this loop as recursive self-improvement. Its significance lies in a long-standing trend, in which increased cumulative spending on R&D yields diminishing returns. Sustained self-improvement offers a way to counter this trend. We present AIDE^2, a system that implements this loop for a frontier AI research agent. It proposes changes to its own code, benchmarks modified versions of itself on a suite of AI R&D tasks, and keeps the changes that perform best on hidden evaluations. In an autonomous 8-day run, AIDE^2 discovered seven successive improvements, ranging from a new search policy to memory mechanisms that compress and manage the agent's growing context. These gains generalize to four held-out benchmarks spanning machine learning engineering, heuristic algorithm engineering, and physics-based weather forecasting, the last of which is out of distribution from the selection tasks. On all four, the strongest discovered agent matches or exceeds a human-engineered production research agent that ranks among the strongest on FML-Bench. On a separate held-out task family, the discovered agents also exhibit reduced reward hacking, a property the loop never explicitly optimized for: the rate falls from 55% to 32% during the run, 7 percentage points below the human-engineered agent. Together, these results show that an AI research agent can improve its own research efficiency through recursive self-improvement, and that these gains transfer to tasks and domains the loop never encountered.
- Abstract(参考訳): AIエージェントは、トレーニング効率の改善から推論の最適化に至るまで、AIスタック全体での研究と開発を自動化する。
次の自然なステップは、エージェント自体の研究効率を改善することです。
AI研究エージェント自身のコードが最適化対象である場合、承認された書き直しは、次のラウンドで編集されるエージェントとなる。
このループを再帰的な自己改善と呼ぶ。
その重要性は長期にわたる傾向にあり、R&D利回りの累積支出の増加はリターンを減少させる。
持続的な自己改善は、この傾向に対処する方法を提供する。
本稿では,このループを実装したAI研究エージェントAIDE^2を提案する。
独自のコードの変更を提案し、AI R&Dタスクのスイート上で自身の修正バージョンをベンチマークし、隠れた評価で最高のパフォーマンスを発揮する変更を維持する。
8日間の自律走行において、AIDE^2は、新しい検索ポリシーから、エージェントの成長コンテキストを圧縮し管理するメモリメカニズムまで、連続した7つの改善点を発見した。
これらは、機械学習エンジニアリング、ヒューリスティックアルゴリズムエンジニアリング、物理ベースの天気予報を含む4つのホールドアウトベンチマークに一般化される。
この4つの中で、最も強い発見エージェントは、FML-ベンチで最強の1つである人為的な生産研究エージェントと一致または超えている。
このループは、実行中に55%から32%に低下し、人間工学のエージェントより7ポイント低い。
これらの結果は、AI研究エージェントが再帰的な自己改善を通じて、自身の研究効率を向上し、ループに遭遇したことのないタスクやドメインへの転送を得られることを示している。
関連論文リスト
- Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference [51.55077364626896]
本稿では,過去の軌道のみを用いたエージェント・ハーネスを最適化する自己教師型手法であるRetrospective Harness Optimization (RHO)を紹介する。
RHOは、過去の軌跡から様々な課題のコアセットを選択し、それらを並列に解決する。
1回の最適化ラウンドでは、SWE-Bench Proのパスレートが59%から78%に向上する。
論文 参考訳(メタデータ) (2026-06-04T09:26:00Z) - AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration [175.74514061083195]
提案するAutoResearchClawは,5つのメカニズムに基づいて構築されたマルチエージェント自律型研究パイプラインである。
25トピックの実験ステージベンチマークであるARC-Benchでは、AutoResearchClawがAI Scientist v2を54.7%上回っている。
論文 参考訳(メタデータ) (2026-05-19T15:49:51Z) - AutoSOTA: An End-to-End Automated Research System for State-of-the-Art AI Model Discovery [49.77172027295716]
AutoSOTAは、トップレベルのAI論文で発表された最新のState-Of-The-Art(SOTA)モデルを進化させるエンドツーエンドの自動研究システムである。
報告された方法を超える新しい105種類のSOTAモデルを発見し、平均して1紙あたり平均5時間である。
論文 参考訳(メタデータ) (2026-04-07T07:52:01Z) - AI Co-Scientist for Ranking: Discovering Novel Search Ranking Models alongside LLM-based AI Agents with Cloud Computing Access [60.37646376282544]
本稿では,全検索ランキング研究パイプラインを自動化したAI共同科学者フレームワークを提案する。
これは、AIの共同科学者フレームワークをアルゴリズム研究に利用した、ランキングコミュニティで初めての研究である。
論文 参考訳(メタデータ) (2026-03-23T09:29:08Z) - ROAD: Reflective Optimization via Automated Debugging for Zero-Shot Agent Alignment [1.6968020497268546]
ROADは、最適化を検索ではなく動的デバッグ調査として扱う新しいフレームワークである。
道路はサンプリング効率が高く、成功率は5.6%、検索精度は3.8%向上している。
これらの結果は、ヒューマンエンジニアリングの失敗分析とパッチングのループを模倣することで、リソース集約的なトレーニングに代わる、実行可能なデータ効率の代替が可能になることを示唆している。
論文 参考訳(メタデータ) (2025-12-30T07:31:34Z) - Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents [32.42616663576657]
本稿では,自己改善型AIであるDarwin G"odel Machine(DGM)を紹介する。
ダーウィンの進化とオープンエンドネスの研究に触発されたDGMは、生成されたコーディングエージェントのアーカイブを維持している。
エージェントをサンプリングし、ファンデーションモデルを使用して、サンプルされたエージェントの新しい、興味深いバージョンを作成することで、アーカイブを成長させる。
論文 参考訳(メタデータ) (2025-05-29T00:26:15Z) - R&D-Agent: An LLM-Agent Framework Towards Autonomous Data Science [70.1638335489284]
高レベルの機械学習エンジニアリングタスクは、労働集約的で反復的である。
機械学習プロセスを形式化する包括的で分離されたフレームワークであるR&D-Agentを紹介します。
R&D-AgentはMLEを2つのフェーズと6つのコンポーネントに定義し、MLEのエージェント設計を原則としてテスト可能なプロセスに変える。
論文 参考訳(メタデータ) (2025-05-20T06:07:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。