論文の概要: The Kitchen Loop: User-Spec-Driven Development for a Self-Evolving Codebase
- arxiv url: http://arxiv.org/abs/2603.25697v1
- Date: Thu, 26 Mar 2026 17:45:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.40906
- Title: The Kitchen Loop: User-Spec-Driven Development for a Self-Evolving Codebase
- Title(参考訳): Kitchen Loop: 自己進化型コードベースのためのユーザ仕様駆動開発
- Abstract要約: 統合信頼モデル上に構築された自律的自己進化型ソフトウェアのためのフレームワークであるKitchen Loopを紹介します。
285以上のイテレーションで2つのプロダクションシステムにまたがって検証を行い、レグレッションオラクルによって検出されたゼロレグレッションで1,094以上のマージプルリクエストを生成しました。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code production is now a commodity; the bottleneck is knowing what to build and proving it works. We present the Kitchen Loop, a framework for autonomous, self-evolving software built on a unified trust model: (1) a specification surface enumerating what the product claims to support; (2) 'As a User x 1000', where an LLM agent exercises that surface as a synthetic power user at 1,000x human cadence; (3) Unbeatable Tests, ground-truth verification the code author cannot fake; and (4) Drift Control, continuous quality measurement with automated pause gates. We validate across two production systems over 285+ iterations, producing 1,094+ merged pull requests with zero regressions detected by the regression oracle (methodology in Section 6.1). We observe emergent properties at scale: multi-iteration self-correction chains, autonomous infrastructure healing, and monotonically improving quality gates. The primitives are not new; our contribution is their composition into a production-tested system with the operational discipline that makes long-running autonomous evolution safe.
- Abstract(参考訳): コード生産は今やコモディティであり、ボトルネックは、何を構築し、それを証明すべきかを知ることだ。
統合信頼モデル上に構築された自律的自己進化型ソフトウェアのためのフレームワークである Kitchen Loop について述べる。(1) 製品がサポートしようとするものを列挙する仕様面,(2) ユーザx1000 として LLM エージェントが合成パワーユーザとして1,000倍の時間でその表面を動作させる場合,(3) コード作者が偽造できない不当なテスト,(4) ドリフト制御,自動停止ゲートによる継続的品質測定。
285以上のイテレーションで2つのプロダクションシステムにまたがって検証を行い、回帰オラクルによって検出されたゼロ回帰(セクション6.1の方法論)で1,094以上の統合プルリクエストを生成しました。
マルチイテレーション自己補正チェーン,自律的インフラストラクチャヒーリング,品質ゲートの単調な改善など,創発的特性を大規模に観察する。
当社のコントリビューションは、長期にわたる自律的進化を安全にする運用の規律を備えた、実運用テストシステムへの構成です。
関連論文リスト
- ExeCRE: Execution-Consistency Guided Reliability Estimation for Self-Correcting Code Generation [28.515743392951194]
ExeCRE(Execution-Consistency Guided code Reliability Estimation framework)を提案する。
多数のランダムに生成された入力に対して、実行出力の一貫性パターンを統計的に解析することにより、コードの信頼性を推定する。
実験により、ExeCREは効率と安定性の両方を一貫して改善し、ミスリード補正信号を著しく低減することが示された。
論文 参考訳(メタデータ) (2026-08-05T04:29:30Z) - When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs [7.798940465229644]
再帰的な自己学習は、生成されたデータが新鮮な人的データや外部品質管理なしで再利用されるときに、神経生成モデルを劣化させる可能性がある。
我々は、このリスクを、AI生成したコードが実際のリポジトリに入り、後にトレーニングデータになり、リポジトリスケールの自己学習ループを作成するLLMのコードで研究する。
論文 参考訳(メタデータ) (2026-06-26T07:35:43Z) - AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems [82.01232437066487]
AgentXはプロダクションデプロイされたマルチエージェントシステムで、このプロダクション機能を再構築する。
自律的に生成し、実装し、評価し、レコメンデーション実験から学ぶ。
AgentXは4つの密結合したステージをクローズドループでオーケストレーションする。
論文 参考訳(メタデータ) (2026-06-25T10:42:28Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - ClawEnvKit: Automatic Environment Generation for Claw-Like Agents [85.29126619772153]
我々は、オンデマンドで検証された環境を生成することができる自動生成パイプラインであるClawEnvKitを紹介する。
ClawEnvKitは、(1)自然言語入力から構造化生成パラメータを抽出するパイプライン、(2)タスク仕様、ツールインターフェース、スコアリング設定を生成するジェネレータ、(3)実現可能性、多様性、構造的妥当性、内部整合性を強制するバリデータからなる。
爪のようなエージェントの大規模なベンチマークであるAuto-ClawEvalを構築し、24のカテゴリで1,040の環境を網羅した。
論文 参考訳(メタデータ) (2026-04-20T17:36:49Z) - OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models [69.2503510410147]
予め訓練されたVLM上に構築した統合自動運転フレームワークを提案する。
トレーニング済みのVLMアテンションは、純粋言語モデリング以上の強い伝達性を示すことを示す。
エンドツーエンドの自動運転ベンチマークの実験は、最先端のパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-04-20T07:50:00Z) - Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios [13.708123854369303]
CLI-Tool-Benchは、Command-Line Interfaceツールの基底生成を評価するための構造に依存しないベンチマークである。
ブラックボックスの差分テストフレームワークを通じて評価された100の現実世界のリポジトリが特徴だ。
エージェント生成ソフトウェアはサンドボックスで実行され、システムサイドエフェクトと端末出力を人書きのオークルと比較する。
論文 参考訳(メタデータ) (2026-04-08T07:09:10Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - GLM-5: from Vibe Coding to Agentic Engineering [222.46864802629477]
GLM-5は,バイブ符号化のパラダイムをエージェント工学に移行するために設計された次世代基盤モデルである。
GLM-5は、前任者のエージェント、推論、コーディング(ARC)能力に基づいており、長いコンテキストの忠実さを維持しながら、トレーニングと推論のコストを大幅に削減するためにDSAを採用している。
論文 参考訳(メタデータ) (2026-02-17T17:50:56Z) - ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS [12.977178538993806]
HarmonyOSエコシステムは、TypeScriptの静的型付け拡張であるArkTSに大きく依存している。
その重要性は増しているが、自動化されたコード修復のための堅牢なツールが欠如している。
本稿では,ArkTSの自動修復ワークフロー評価とベンチマーク構築のための統合フレームワークであるArkEvalを紹介する。
論文 参考訳(メタデータ) (2026-02-09T16:28:29Z) - You Don't Know Until You Click:Automated GUI Testing for Production-Ready Software Evaluation [24.956175875766952]
RealDevWorldは、大規模言語モデル(LLM)とソフトウェア開発におけるコードエージェントの評価フレームワークである。
主なコンポーネントは、194のオープンエンドソフトウェアエンジニアリングタスクのコレクションであるRealDevBenchと、新しいエージェント・アズ・ア・ジャッジ評価システムであるAppEvalPilotだ。
実証的な結果は、RealDevWorldが効果的で、自動で、そして、人間に沿った評価を提供することを示している。
論文 参考訳(メタデータ) (2025-08-17T07:31:11Z) - ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation [51.297873393639456]
ArtifactsBenchは自動ビジュアルコード生成評価のためのフレームワークである。
我々のフレームワークは、生成した各アーティファクトをレンダリングし、時間的スクリーンショットを通してその動的な振る舞いをキャプチャする。
我々は1,825の多様なタスクの新しいベンチマークを構築し、30以上の主要な大規模言語モデルを評価する。
論文 参考訳(メタデータ) (2025-07-07T12:53:00Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - On Simulation-Guided LLM-based Code Generation for Safe Autonomous Driving Software [0.577182115743694]
オートマチック・ドライビング・システム(Automated Driving System, ADS)は、車両の環境の解釈に責任を負う安全クリティカルなソフトウェアシステムである。
ADSの開発には厳格なプロセスが必要で、車両に配備する前にコードを検証し、検証し、評価し、検証する。
本研究では,自動コード生成と評価のためのプロトタイプを開発し,評価した。
論文 参考訳(メタデータ) (2025-04-02T21:35:11Z) - SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents [50.82665351100067]
FlowGenは、複数のLarge Language Model (LLM)エージェントに基づいたソフトウェアプロセスモデルをエミュレートするコード生成フレームワークである。
FlowGenScrumをHumanEval、HumanEval-ET、MBPP、MBPP-ETの4つのベンチマークで評価した。
論文 参考訳(メタデータ) (2024-03-23T14:04:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。