論文の概要: Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement
- arxiv url: http://arxiv.org/abs/2609.01481v1
- Date: Tue, 01 Sep 2026 16:17:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.831619
- Title: Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement
- Title(参考訳): Harness-of-Harness: 継続的改善を伴うマルチデイ自律ソフトウェア開発
- Abstract要約: 我々は,自律開発において,コーディングエージェントがソフトウェアを継続的に改善できるフレームワークであるHarness-of-Harness(HoH)を紹介した。
HoHは既存のコーディングエージェントハーネスで動作し、実行を反復的な計画コーディングテストループに編成する。
平均相対利得は52.25パーセント、最大利得は3回の反復で82.86パーセントに達する。
- 参考スコア(独自算出の注目度): 24.314536080009805
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper studies autonomous software development, in which LLM-based coding agents transform high-level requirements into complete, functional, and usable software systems without human intervention. We introduce Harness-of-Harness (HoH), a framework that enables coding agents to continually improve software during autonomous development. HoH operates on existing coding-agent harnesses, and organizes their executions into iterative planning-coding-testing loops. To sustain improvement across loops, HoH balances repair with capability growth, scopes development into small and verifiable increments, separates implementation-time testing from independent evaluation, and constrains verifiable outputs rather than prescribing agent workflows. It progressively exposes deliverables, role-specific tools, and skills, encourages reuse rather than recreation, and maintains versioned project histories. On GameCraft-Bench, FrontierSWE, and ProgramBench, three harness-model pairs (Codex with GPT-5.5, OpenCode with DeepSeek-V4-Pro, and Pi with MiniMax-M3), HoH consistently outperforms the corresponding standalone harnesses, achieving an average relative gain of 52.25 percent and a maximum gain of 82.86 percent after three iterations. In a multi-day deployment with more than 70 iterations, HoH autonomously develops a first-person-shooter game, featuring a coherent storyline, fully implemented core mechanics, human-playable experience, polished visuals and integrated audio. Github: https://github.com/Flesymeb/HarnessOfHarness Project Page: https://flesymeb.github.io/HarnessOfHarness/
- Abstract(参考訳): 本稿では,LLMをベースとしたコーディングエージェントが,人間の介入なしに高レベルの要求を完全かつ機能的,使用可能なソフトウェアシステムに変換する自律ソフトウェア開発について検討する。
我々は,自律開発において,コーディングエージェントがソフトウェアを継続的に改善できるフレームワークであるHarness-of-Harness(HoH)を紹介した。
HoHは既存のコーディングエージェントハーネスで動作し、実行を反復的な計画コーディングテストループに編成する。
ループを越えた改善を維持するため、HoHは機能拡張による修復のバランスをとり、開発を小さく検証可能なインクリメントに分割し、実装時のテストを独立した評価から分離し、エージェントワークフローを規定するのではなく検証可能なアウトプットを制約する。
成果物、ロール固有のツール、スキルを徐々に公開し、レクリエーションよりも再利用を奨励し、バージョン管理されたプロジェクト履歴を維持します。
GameCraft-Bench、FrontierSWE、ProgramBenchの3つのハーネスモデルペア(GPT-5.5のCodex、DeepSeek-V4-ProのOpenCode、MiniMax-M3のPi)では、HoHは3回の反復で平均52.25パーセント、最大82.86パーセント向上した。
70回以上のイテレーションを持つ複数日間のデプロイメントにおいて、HoHは、コヒーレントなストーリーライン、完全に実装されたコアメカニック、ヒューマンプレイ可能なエクスペリエンス、洗練されたビジュアル、統合オーディオを備えた、ファーストパーソナライズされたシューティングゲームを自律的に開発する。
Github: https://github.com/Flesymeb/HarnessOfHarness Project Page: https://flesymeb.github.io/HarnessOfHarness/
関連論文リスト
- LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents [56.902747731541695]
LEGO-RLは、ネイティブコーディングエージェントハーネスをスケーラブルなポリシ-グラディエント最適化でブリッジするフレームワークです。
我々は、3つのネイティブコーディングエージェントハーネスにまたがるGSPOを用いて、疎いMoEモデルQwen3.5-35B-A3BをトレーニングすることでLEGO-RLを評価する。
論文 参考訳(メタデータ) (2026-08-18T05:34:35Z) - EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement [70.68218215070745]
既存のアプローチでは、すべての実行エクスペリエンスを単一のハーネスにルーティングできると仮定している。
EvolveNetは、経験抽出をデータに移動させるハーネス進化のパラダイムである。
論文 参考訳(メタデータ) (2026-08-05T15:37:18Z) - LoopsBench: From Harness Engineering to Loop Engineering in Benchmarking Coding Agent [60.27239351179265]
LOOPSBENCHは、符号化エージェント評価におけるループエンジニアリングのベンチマークである。
8つのプログラミング言語と9つのドメインにまたがる、本物のソースからの112のタスクで構成されている。
フロー対応ランタイムは、準備されたフロンティアに沿ってテストをリリースし、レグレッション義務として完了したノードを保持します。
論文 参考訳(メタデータ) (2026-07-31T20:18:25Z) - HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry [35.87794858139959]
HarnessXは、構成可能、適応可能、進化可能なエージェントハーネス用のファウンダリーである。
型付きハーネスプリミティブを置換代数学で組み立て、AIGISを介して適応する。
軌道をハーネス更新とモデルトレーニング信号の両方に変換することでハーネスモデルループを閉じる。
論文 参考訳(メタデータ) (2026-06-12T08:27:11Z) - Self-Organizing Multi-Agent Systems for Continuous Software Development [10.71353057601951]
TheBotCompanyは、継続的マルチエージェントソフトウェア開発のためのオープンソースのオーケストレーションフレームワークである。
TheBotCompanyは、(1)マイルストーン駆動開発のための3段階のステートマシン(実行から検証までの戦略)、(2)マネージャエージェントがプロジェクトニーズに基づいて動的に雇用、割り当て、消防を行う自己組織化エージェントチーム、(3)非同期ヒューマン監視の3つの重要なイノベーションを紹介している。
TheBotCompanyは、チームの適応パターン、マイルストーン完了率、コスト効率、コード品質を計測し、数日間の継続的開発で現実世界のソフトウェアプロジェクトで評価します。
論文 参考訳(メタデータ) (2026-03-26T21:43:13Z) - SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios [6.776894728701934]
AIコーディングエージェントの既存のベンチマークでは、バグの修正や小さな機能の実装など、独立した単一課題のタスクに重点を置いている。
SWE-EVO(SWE-EVO)は、長期的ソフトウェア進化課題におけるエージェントの評価を行うベンチマークである。
ツールには48の進化タスクが含まれており、エージェントは平均21ファイルにまたがる複数ステップの修正を行う必要がある。
論文 参考訳(メタデータ) (2025-12-20T19:08:15Z) - SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving [90.32201622392137]
We present SwingArena, a competitive evaluation framework for Large Language Models (LLMs)。
従来の静的ベンチマークとは異なり、SwingArenaはLLMをイテレーションとして組み合わせて、テストケースを作成し、継続的インテグレーション(CI)パイプラインを通じてパッチを検証するパッチとレビュアーを生成することで、ソフトウェアのコラボレーションプロセスをモデル化する。
論文 参考訳(メタデータ) (2025-05-29T18:28:02Z) - Agent-Driven Automatic Software Improvement [55.2480439325792]
本提案は,Large Language Models (LLMs) を利用したエージェントの展開に着目して,革新的なソリューションの探求を目的とする。
継続的学習と適応を可能にするエージェントの反復的性質は、コード生成における一般的な課題を克服するのに役立ちます。
我々は,これらのシステムにおける反復的なフィードバックを用いて,エージェントの基盤となるLLMをさらに微調整し,自動化されたソフトウェア改善のタスクに整合性を持たせることを目指している。
論文 参考訳(メタデータ) (2024-06-24T15:45:22Z) - AutoCodeRover: Autonomous Program Improvement [8.66280420062806]
プログラムの改善を自律的に達成するために、GitHubの問題を解決する自動化アプローチを提案する。
AutoCodeRoverと呼ばれるアプローチでは、LLMは洗練されたコード検索機能と組み合わせられ、最終的にプログラムの変更やパッチにつながります。
SWE-bench-lite(300の現実のGitHubイシュー)の実験では、GitHubの問題を解決する効果が向上している(SWE-bench-liteでは19%)。
論文 参考訳(メタデータ) (2024-04-08T11:55:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。