論文の概要: Persistent Recursive Worlds Enable Autonomous Software Evolution
- arxiv url: http://arxiv.org/abs/2608.10450v2
- Date: Wed, 12 Aug 2026 08:44:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.565247
- Title: Persistent Recursive Worlds Enable Autonomous Software Evolution
- Title(参考訳): 永続的再帰的世界は、自律的なソフトウェア進化を可能にする
- Authors: Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng,
- Abstract要約: EvoX Genesisは、ソフトウェアプロジェクトを永続化し、ローカルエージェントを有限存続させる。
組織の形成、継続、再開発を通じて、この組織を評価します。
その結果、長期的ソフトウェア開発は永続的なエージェントではなく、永続的なプロジェクトを中心に組織化できることがわかった。
- 参考スコア(独自算出の注目度): 9.245787953561281
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Complex software systems develop over timescales that exceed the lifespan of any individual coding agent. Most agentic software systems preserve continuity through persistent sessions, memories, managers or shared context. We introduce EvoX Genesis (hereafter, Genesis), which instead makes the software project persistent while allowing local agents to remain finite-lived. Genesis represents software as a persistent recursive world: each local world is situated by an accepted version and a repository path, finite-lived agents propose local changes, recursive delegation moves work across paths, and only accepted consequences advance the persistent version history. We evaluate this organization across formation, continuation and redevelopment. Starting from a repository with no compiler implementation, Genesis used DeepSeek V4 Flash to build a Rust-based C compiler with about 250k tracked lines; the run lasted over 120 hours, archived over 1,000 agent episodes and incurred only US$44 in model-token charges. The compiler passed the complete c-testsuite and most LLVM and Csmith tests. In a separate compiler world generated with GLM 5.2, development continued after repeated agent replacement while retaining full test performance. Genesis also reimplemented 13 MESA modules with over 100k Fortran lines as a Rust workspace with nearly 90k Rust lines; across six numerical workloads, it achieved median speedups of 1.55--6.87x. These results show that long-horizon software development can be organized around a persistent project rather than a persistent agent.
- Abstract(参考訳): 複雑なソフトウェアシステムは、個々のコーディングエージェントの寿命を超える時間スケールで開発される。
ほとんどのエージェントソフトウェアシステムは、永続的なセッション、記憶、マネージャ、あるいは共有コンテキストを通じて連続性を維持する。
EvoX Genesis(以下、Genesis)を導入します。
生成は、ソフトウェアを永続的な再帰的世界として表現する: 各ローカル世界は、受け入れられたバージョンとリポジトリパスによって位置付けられ、有限寿命エージェントは、局所的な変更を提案し、再帰的デリゲートは、パスを横断し、受け入れられた結果のみが永続的なバージョン履歴を前進させる。
組織の形成、継続、再開発を通じて、この組織を評価します。
コンパイラ実装のないレポジトリから、GenesisはDeepSeek V4 Flashを使用して、約250kのトラックラインを持つRustベースのCコンパイラを構築した。
コンパイラは完全なc-testsuiteとLLVMとCsmithのテストに合格した。
GLM 5.2で生成された別のコンパイラの世界では、完全なテスト性能を維持しながら、繰り返しエージェントを置き換えた後に開発が続けられた。
Genesisはまた、約90kのRustラインを持つRustワークスペースとして100k Fortranラインを持つ13のMESAモジュールを再実装した。
これらの結果は、長期的ソフトウェア開発は永続的なエージェントではなく、永続的なプロジェクトを中心に組織化できることを示している。
関連論文リスト
- LoopsBench: From Harness Engineering to Loop Engineering in Benchmarking Coding Agent [60.27239351179265]
LOOPSBENCHは、符号化エージェント評価におけるループエンジニアリングのベンチマークである。
8つのプログラミング言語と9つのドメインにまたがる、本物のソースからの112のタスクで構成されている。
フロー対応ランタイムは、準備されたフロンティアに沿ってテストをリリースし、レグレッション義務として完了したノードを保持します。
論文 参考訳(メタデータ) (2026-07-31T20:18:25Z) - RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades [32.04167306620878]
RoadmapBenchは、115の長い水平コーディングタスクのベンチマークで、実際のオープンソースバージョンをアップグレードします。
各タスクはエージェントをソースバージョンコードスナップショットに配置し、マルチターゲットのロードマップ命令を提供する。
最強のクロード=オプス-4.7でも39.1%のタスクしか解決していないのに対し、最も弱いイテレーションは5.2%しか達成していない。
論文 参考訳(メタデータ) (2026-05-15T11:00:33Z) - KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant [8.273738980475393]
KISS Sorcarは、KISS Agent Framework上に構築された汎用アシスタントおよび統合開発環境である。
KISS Sorcarは無償のオープンソースVisual Studio Codeエクステンションで、ローカルで、長期タスクに対して効果的に実行される。
システム全体が4.5ヶ月で自力で構築され、継続的ストレステストが実施され、エージェントが導入したバグが直ちに機能する能力が損なわれる。
論文 参考訳(メタデータ) (2026-04-26T17:59:06Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents [79.29376673236142]
既存のベンチマークは、完全なソフトウェアシステムを構築するのに必要な長期的能力の厳格な評価に失敗する。
符号化エージェントの長期リポジトリ生成能力を評価するために設計されたベンチマークであるNL2Repo Benchを提案する。
論文 参考訳(メタデータ) (2025-12-14T15:12:13Z) - Git Context Controller: Manage the Context of LLM-based Agents like Git [6.521644491529639]
大きな言語モデル(LLM)ベースのエージェントは、内部推論と外部ツールの使用をインターリーブすることによって、印象的な機能を示している。
ソフトウェアバージョン管理システムにインスパイアされた構造化コンテキスト管理フレームワークであるGit-Context-Controller(GCC)を紹介した。
自己複製のケーススタディでは、GCCを増強したエージェントが新しいCLIエージェントをスクラッチから作り、40.7タスクの解決を実現した。
論文 参考訳(メタデータ) (2025-07-30T08:01:45Z) - SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving [90.32201622392137]
We present SwingArena, a competitive evaluation framework for Large Language Models (LLMs)。
従来の静的ベンチマークとは異なり、SwingArenaはLLMをイテレーションとして組み合わせて、テストケースを作成し、継続的インテグレーション(CI)パイプラインを通じてパッチを検証するパッチとレビュアーを生成することで、ソフトウェアのコラボレーションプロセスをモデル化する。
論文 参考訳(メタデータ) (2025-05-29T18:28:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。