論文の概要: RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
- arxiv url: http://arxiv.org/abs/2609.24972v1
- Date: Mon, 21 Sep 2026 17:54:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:01.454685
- Title: RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
- Title(参考訳): RRSI: エージェント・ハーネスの正規化再帰的自己改善
- Abstract要約: 正規化再帰的自己改善型エージェント・ハーネス(RRSI)
本稿では、正規化の原則を取り入れたRRSIを紹介し、進化候補の提案と選択を制約することで自己改善を活用する。
RRSIは5つのアウト・オブ・ディストリビューション・ベンチマークで14.1ポイント、最大4.7ポイントを獲得し、非正規化進化よりも30%少ないポリシートークンで動作するハーネスを生産している。
- 参考スコア(独自算出の注目度): 76.67111148617533
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: An LLM agent's capability is largely magnified by its harness, namely the prompts, control flow, tooling, memory, and context management surrounding the frozen backbone model. Recent methods increasingly automate this process by iteratively proposing and selecting component-wise edits of an agent harness, practically establishing a form of recursive self-improvement (RSI) at the agent-system level. However, such recursive evolution may overfit by memorizing the training tasks, showing large in-distribution gains that shrink or even vanish on out-of-distribution benchmarks. We introduce Regularized Recursive Self-Improvement of Agent Harnesses (RRSI), which incorporates the principles of regularizations into harness self-improvement by constraining the evolution candidate proposal and selection. The proposer operates with a temporally annealed budget, limiting how many edits a candidate can bundle, and it encourages unexplored trajectories based on evolution history. The selector is equipped with a critic and a pruner: the critic screens benchmark-specific proposals, while the pruner, removes changes that are too small, too expensive, or no longer useful. Together these constraints favor reusable agent mechanisms over benchmark-specific ones or even noises. Across eight benchmarks spanning coding, agentic workspace and engineering design tasks, RRSI gains up to 14.1 points on the split it evolves against and up to 4.7 points on the five out-of-distribution benchmarks, while producing a harness that runs on 30% fewer policy tokens than the unregularized evolution. Code is available at https://github.com/google-research/rrsi and project page is https://regularized-rsi.com/.
- Abstract(参考訳): LLMエージェントの能力は、フリーズバックボーンモデルを取り巻くプロンプト、制御フロー、ツーリング、メモリ、コンテキスト管理によって大きく向上している。
近年,エージェント・ハーネスのコンポーネント・ワイズ編集を反復的に提案し,選択することで,エージェント・システムレベルで再帰的自己改善(RSI)の形式を実質的に確立することで,このプロセスを自動化する方法が増えている。
しかし、そのような再帰的な進化は、トレーニングタスクを記憶することで過度に適合し、アウト・オブ・ディストリビューション・ベンチマークで縮小または消滅する大きなイン・ディストリビューション・ゲインを示す。
本稿では、正規化の原則を取り入れた正規化帰納的自己改善(RRSI)を導入し、進化候補の提案と選定を制限して自己改善を図る。
提案者は、時間的に短縮された予算で運用し、候補がバンドルできる編集数を制限し、進化史に基づいた未探索の軌跡を奨励する。
セレクタは、批評家とプルーナーを備えており、批評家はベンチマーク固有の提案をスクリーニングするが、プルーナーは、小さすぎる、高価すぎる、またはもはや役に立たない変更を取り除く。
これらの制約は、ベンチマーク固有のものやノイズよりも再利用可能なエージェントメカニズムを好む。
コーディング、エージェントワークスペース、エンジニアリングデザインタスクにまたがる8つのベンチマークで、RRSIは進化する5つのアウト・オブ・ディストリビューション・ベンチマークで14.1ポイント、最大4.7ポイントを獲得している。
コードはhttps://github.com/google-research/rrsiで入手できる。
関連論文リスト
- ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning [74.19730275669227]
ARISE-RLは、オープンエンドエージェントをトレーニングするための新しいフルサイクルの自己進化フレームワークである。
Reward-Gated Self-Evolution Distillation (RG-SED)を提案する。
ECR-Benchは,シングルツールディープリサーチとマルチツールトラベルプランニングを対象とする,専門家校正型ルーリックベンチマークスイートである。
論文 参考訳(メタデータ) (2026-09-01T10:54:13Z) - HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution [11.431479238875712]
我々は、信頼できるエージェントの自己進化を実現するために、参照軌道から学習する自己進化フレームワークであるHarnessEvolveを紹介する。
私たちは、さまざまなモデルとエージェントフレームワークを使用して、オープンドメインとエンタープライズシナリオにまたがるいくつかのベンチマークで広範な実験を行います。
結果は、HarnessEvolveがすべてのベンチマークと設定で、最先端のベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-09-01T07:31:18Z) - Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification [30.941867057615223]
既存の提案と検証のメソッドは、固定されたタスクセットですべての候補をスコアします。
私たちは、自動化ハーネス進化のための予算対応フレームワークであるHarnessLensを紹介します。
論文 参考訳(メタデータ) (2026-08-27T16:12:23Z) - ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - SBCO: Self-Supervised, Verifier-Grounded Harness Optimization For Planning Agents [8.206010431605044]
自己改善エージェントは、AIシステムの背後にあるヒューマンエンジニアリングの労力を削減し、時間とともにパフォーマンスを進化させ、自己改善することを目指している。
我々は,Gdel-machine法と同等の閉ループの検証器付きハーネスであるSBCOを導入するが,自己参照ではなく自己監視する。
論文 参考訳(メタデータ) (2026-08-10T19:25:59Z) - Rethinking the Evaluation of Harness Evolution for Agents [83.07258924910069]
既存のハーネス進化法では、単体テストケースを使用してハーネス構成を検索し、同じ公開ベンチマークで最終的なパフォーマンスを報告している。
このプロトコルは2つの基本的な懸念を提起する。
エージェントによるテスト時間スケーリングと同様に、一致したフィードバックと推論予算の下で単純なタスクレベルの検索ベースラインと比較すべきである。
論文 参考訳(メタデータ) (2026-07-14T00:18:42Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - INFUSER: Influence-Guided Self-Evolution Improves Reasoning [54.101135873140066]
2つの共進化的役割を持つ反復的協調学習フレームワークを導入する。
解答器は、生成元が提供する回答に対して標準正当性報酬で訓練される。
8B INF共進化ジェネレータは、数学とコーディングにおいて凍った32B思考ジェネレータより優れている。
論文 参考訳(メタデータ) (2026-06-08T05:40:36Z) - CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning [4.765206163164323]
CLEANERは本質的な自己訂正機能を利用して、データ収集中にエラーに汚染されたコンテキストを除去する。
類似性を考慮した適応ロールバック機構は、クリーンで清浄な軌道を自律的に構築する。
その結果, 平均精度は6%, 3%, 5%であった。
論文 参考訳(メタデータ) (2026-01-21T16:14:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。