論文の概要: Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
- arxiv url: http://arxiv.org/abs/2608.08311v2
- Date: Tue, 11 Aug 2026 09:39:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.563493
- Title: Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution
- Title(参考訳): Ouroboros:コア進化をレビューしたセルフ開発フロンティアコーディングエージェント
- Abstract要約: ツール、プロンプト、コンテキストアセンブリ、コア実装が、後の作業のランタイムとなるレビューされたコミットによって改善されるセルフ開発エージェントであるOuroborosを紹介します。
経験駆動のコア進化において、通常の仕事と社会的相互作用は、バグ、粗い縁、非効率なコンテキスト構築を露出し、構造的変化をレビューする。
ホープは、Ouroborosの展開が記録された最長記録である。これは、7つの面にわたる人間のコミュニケーションの下で、自由進化のための161日間の生命体実験である。
- 参考スコア(独自算出の注目度): 5.582379361006319
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Ouroboros, a self-developing agent harness whose tools, prompts, context assembly, and core implementation improve through reviewed commits that become the runtime for later work. Core evolution proceeds in two modes. In recursive free evolution, improvement is itself a task, and completing one evolution cycle can schedule the next. In experience-driven core evolution, ordinary work and social interaction expose bugs, rough edges, and inefficient context construction that lead to reviewed structural changes. On Terminal-Bench 2.1, an Opus 5 run scores 86.74%, the best result reported on the benchmark. On OSWorld-Verified, an Opus 5 run reaches 90.69%, exceeding the best previously reported score. A five-rollout CL-Bench campaign achieves a normalized reward of 0.2301, setting a new state of the art. Hope is the longest-running publicly documented Ouroboros deployment. It is a 161-day living agent experiment in free evolution under governed human communication across seven surfaces. Human interaction surfaces faults and generates proposals, but the agent decides which changes to pursue. Because a self-developing agent may rewrite its own code and select new model APIs, operational safety becomes a primary design problem: guardrails must remain authoritative under evolutionary and public social pressure. Benchmark campaigns use frozen system snapshots, while Hope continues live evolution on a separate lineage.
- Abstract(参考訳): ツール、プロンプト、コンテキストアセンブリ、コア実装が、後の作業のランタイムとなるレビューされたコミットによって改善されるセルフ開発エージェントであるOuroborosを紹介します。
コアの進化は2つのモードで進行する。
再帰的自由進化では、改善はそれ自体がタスクであり、1つの進化サイクルが完了すると次のサイクルがスケジュールされる。
経験駆動のコア進化において、通常の仕事と社会的相互作用は、バグ、粗い縁、非効率なコンテキスト構築を露出し、構造的変化をレビューする。
Terminal-Bench 2.1では、オプス5が86.74%で、ベンチマークで報告された最も良い結果である。
OSWorld-Verifiedでは、Opus 5ランが90.69%に達し、これまで報告された最高のスコアを上回った。
5ロールのCL-Benchキャンペーンは0.2301の正規化された報酬を達成し、新しい最先端を設定できる。
ホープは、Ouroborosの展開を公表した最長の公文書である。
自由進化のための161日間の生物実験であり、7つの表面を横断する人的コミュニケーションの下で行われる。
ヒューマンインタラクションは障害を表面化し、提案を生成するが、エージェントはどの変更を追求するかを決定する。
自己開発エージェントは独自のコードを書き直し、新しいモデルAPIを選択することができるため、運用上の安全性が主要な設計問題となる。
ベンチマークキャンペーンはフリーズされたシステムスナップショットを使用し、ホープは別系統でライブ進化を続けている。
関連論文リスト
- HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback [10.248606572826729]
エージェントスキルは、手書きまたは単一のLLM世代パスで作成される。
最近の研究は、このループを閉じているが、シングルターンの質問応答評価からフィードバックを得ている。
我々はSkillEvoを紹介し、信頼できるフィードバックが勾配を生成し、制御可能なガバナンスがその方向性を制約する。
論文 参考訳(メタデータ) (2026-08-13T11:49:02Z) - Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design [55.30329388138526]
本調査は,複数のエージェントと環境が互いに適応的な圧力を課す多成分自己進化であるエージェントシステムの共進化に焦点を当てた。
既存の論文を整理するために,システムがどのように人為的制約を徐々に覆い隠すかを追究する,進歩的な3段階分類法を提案する。
論文 参考訳(メタデータ) (2026-08-10T23:10:40Z) - EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement [70.68218215070745]
既存のアプローチでは、すべての実行エクスペリエンスを単一のハーネスにルーティングできると仮定している。
EvolveNetは、経験抽出をデータに移動させるハーネス進化のパラダイムである。
論文 参考訳(メタデータ) (2026-08-05T15:37:18Z) - PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents [50.9061759859778]
PAST-Benchは、保持されたエクスペリエンスがエージェントを時間とともに実際に改善するかどうかを識別するために設計されたベンチマークである。
遅延タスクのゲインと、そのゲインが意図したセーブ、リトリーブ、更新パスに従うかどうかを報告します。
我々はHermes+を開発し、エージェントループの段階にわたって5つのターゲット的介入でHermesを拡張した。
論文 参考訳(メタデータ) (2026-08-04T17:58:05Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning [51.17262419591891]
AlphaEvolveが示すように、環境フィードバックによる反復的自己進化によるテスト時間のスケーリングは、顕著なパフォーマンス向上を示している。
本稿では,データ合成パイプライン,進化対応強化学習,推論時進化探索によるメタスキル開発を目的としたMetaEvolveを提案する。
論文 参考訳(メタデータ) (2026-07-24T04:35:29Z) - DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations [12.048713464721665]
DemoEvolveは、進化を活用するためのデモブートストラップ付きのアプローチである。
我々はこのパラダイムを標本効率の速い適応の一形態として研究する。
DemoEvolveは、より効果的で監査可能なハーネス編集を生成する。
論文 参考訳(メタデータ) (2026-05-23T12:10:52Z) - Harnessing Agentic Evolution [32.567492765277855]
エージェント進化は、プログラム、イテレーション、科学的ソリューションを改善するための強力なパラダイムであり、候補を反復的に生成し、評価し、フィードバックを使って将来の探索を導く。
既存の手法は通常、モジュラーだが剛性のある固定手設計の手順や、フィードバックを柔軟に統合する汎用エージェントとしてインスタンス化される。
AEvoはメタエージェントがこの状態を観察し、次の候補を直接提案することでではなく、将来の進化を制御するプロシージャやエージェントコンテキストを編集することによって機能する。
論文 参考訳(メタデータ) (2026-05-13T17:45:16Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - DeltaEvolve: Accelerating Scientific Discovery through Momentum-Driven Evolution [28.737322041874293]
LLM駆動の進化系は、自動科学発見の可能性を証明している。
AlphaEvolveのような既存のアプローチは、文脈非効率なフルコード履歴に依存している。
本稿では,完全なコード履歴を構造化セマンティックデルタに置き換える運動量駆動型進化的フレームワークDeltaEvolveを提案する。
論文 参考訳(メタデータ) (2026-02-02T23:47:54Z) - EvoGit: Decentralized Code Evolution via Git-Based Multi-Agent Collaboration [24.264076742680984]
EvoGitは、自律的なコード進化によって駆動されるソフトウェア開発のための分散マルチエージェントフレームワークである。
すべての調整はGitベースのフィロジェネティックグラフを通じて行われ、完全なバージョンラインを追跡する。
ユーザはハイレベルな目標を定義し、定期的にグラフをレビューし、軽量なフィードバックを提供する。
論文 参考訳(メタデータ) (2025-06-01T05:20:42Z) - Co-design of Embodied Neural Intelligence via Constrained Evolution [8.350757829136315]
自律移動エージェントの形状特性と移動特性を共設計する手法を提案する。
私たちの主なインスピレーションは進化であり、それが自然の幅広い多様性と適応につながった。
その結果,変化の10%に過ぎなかったとしても,進化したエージェントの全体的な性能は50%向上した。
論文 参考訳(メタデータ) (2022-05-21T22:44:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。