論文の概要: Don't Blame the Large Language Model: How Scaffolding Evolution Shapes Coding Agent Quality
- arxiv url: http://arxiv.org/abs/2607.03691v1
- Date: Sat, 04 Jul 2026 03:55:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.681397
- Title: Don't Blame the Large Language Model: How Scaffolding Evolution Shapes Coding Agent Quality
- Title(参考訳): 大規模言語モデルを損なうな - 進化的形状のコーディングの質をいかに強調するか
- Abstract要約: 5つの主要なオープンソース足場の開発とリリースの進化について検討する。
Qwen Code CLIの35のシーケンシャルリリースを評価し、エージェントの有効性と効率への影響を測定した。
- 参考スコア(独自算出の注目度): 13.474716644621735
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Coding agents, autonomous systems that use large language models (LLMs) to resolve software engineering tasks, rely on agentic scaffolding: a middleware layer in between a developer and a large language model that orchestrates system prompts, tool execution, context management, and iterative reasoning loops. While these scaffoldings evolve at extreme velocities, no study has examined how this evolution affects agent quality (i.e., effectiveness and efficiency) over time. Practitioners regularly report quality regressions after scaffolding updates, yet consistently attribute them to the underlying model rather than the scaffolding itself. In this paper, we address this gap by conducting the first controlled longitudinal study that isolates the scaffolding's contribution. Unlike prior work that fixes the scaffolding and varies the model, we fix the model and vary only the scaffolding, evaluating 35 sequential releases to measure their impact on agent effectiveness and efficiency. We first empirically study the development and release evolution of five major open-source scaffoldings (i.e., Codex, Qwen Code, Gemini, OpenCode, and OpenHands), revealing extreme release velocities exceeding two releases per day and thousands of issues within months. We then perform a controlled deep dive into 35 sequential releases of the Qwen Code CLI, evaluating each against 50 stratified SWE-bench Verified tasks while holding the underlying LLM constant. We trace the resulting quality fluctuations to specific development patterns and architectural components, and illustrate our findings with concrete qualitative evidence linking individual pull requests to measured quality shifts.
- Abstract(参考訳): ソフトウェアエンジニアリングの課題を解決するために,大規模言語モデル(LLM)を使用する自律システムであるコーディングエージェントは,システムプロンプトのオーケストレーション,ツールの実行,コンテキスト管理,反復推論ループといった,開発者と大規模言語モデルの間のミドルウェア層であるエージェントスキャフォールディングに依存している。
これらの足場は極端な速度で進化するが、この進化がエージェントの品質(すなわち有効性と効率)に時間とともにどのように影響するかは研究されていない。
実践者は、足場更新後に定期的に品質のレグレッションを報告しますが、足場自体よりも基盤となるモデルに一貫して関連しています。
本稿では,足場への貢献を分離する第1回制御縦断的研究を行うことにより,このギャップに対処する。
足場を修正しモデルを変更した以前の作業とは異なり、モデルを修正し、足場のみを変更し、35のシーケンシャルリリースを評価し、エージェントの有効性と効率に与える影響を評価します。
私たちはまず、主要な5つのオープンソーススキャフォールディング(Codex、Qwen Code、Gemini、OpenCode、OpenHands)の開発とリリースの進化を経験的に研究し、数ヶ月のうちに1日に2回以上のリリース速度と何千という問題を明らかにしました。
次に、Qwen Code CLIの35のシーケンシャルリリースに制御されたディープダイブを行い、基礎となるLLM定数を保持しながら、50の階層化されたSWEベンチ検証タスクに対してそれぞれを評価します。
得られた品質変動を、特定の開発パターンやアーキテクチャコンポーネントにトレースし、個々のプルリクエストと測定された品質変化を関連付ける具体的な定性的な証拠で示します。
関連論文リスト
- HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - Self-Evolving Coding Agents [11.43197414613246]
自己進化型コーディングエージェントは、リポジトリを検査し、ツールを実行し、テストを実行し、障害をデバッグし、パッチを生成することができる。
まず、自己進化型プログラミングエージェントを定義し、それらを従来のコーディングエージェントや一般的な自己進化型エージェントと区別する。
実行可能なフィードバック、リポジトリレベルのコンテキスト、コーディングトラジェクトリは、ソフトウェアエンジニアリングをエージェントの自己進化のための自然なドメインとして、ユニークな役割を与えます。
論文 参考訳(メタデータ) (2026-08-04T09:43:46Z) - Long-Horizon Autonomous Architecture Research with a Language-Model Agent: A Behavioural Case Study [0.3683202928838613]
我々は,1つの汎用大規模言語モデルが,長期的ニューラルアーキテクチャ設計問題において唯一の研究者として機能する場合に何が起こるかを研究する。
この研究は3つのフェーズから構成され、人間の宣言された遷移によって分離され、エージェントのツール表面や問題スケールを徐々に拡大する。
本研究は, ワークフロー設計がエージェント能力に匹敵する影響力があることを結論し, 多様な探索, 予算付きムーンショット仮説, 明示的なフォーク, ルール対応の再検証を提案する。
論文 参考訳(メタデータ) (2026-08-03T09:56:34Z) - How Do Developers Maintain and Evolve Their Agents' Instructions? An Empirical Study [9.708580060106414]
エージェントコンテキストファイル(ACF)は、エージェントを構造化命令でガイドする実用的なメカニズムとして登場した。
本稿では,ACFの進化とエージェント駆動開発におけるその役割について検討する。
論文 参考訳(メタデータ) (2026-06-24T00:32:18Z) - From Question Answering to Task Completion: A Survey on Agent System and Harness Design [67.8241530947325]
本研究はモデルハーネスレンズを用いてLCMをベースとしたエージェントについて検討する。
まず, LLMをベースとしたエージェントを基礎モデルと実行ハーネスとして, エージェントの機能的定義と実装の視点を明らかにする。
次に、モデル中心のスケーリングの限界を分析し、エージェントエンジニアリングの4つのパラダイムをトレースし、実行ハーネスを6つの結合ランタイム責任に分解する。
論文 参考訳(メタデータ) (2026-06-14T05:40:16Z) - From Model Scaling to System Scaling: Scaling the Harness in Agentic AI [4.802305157491253]
本稿では,エージェントAIの次なるボトルネックをシステムスケーリングとして検討する。
我々は、このシフトをハーネスのスケーリングと呼び、基礎モデルを取り巻く構造化された実行層を設計、評価、最適化の第一級のオブジェクトとして扱います。
私たちの主張では、エージェントAIの今後の進歩は、より強力な基礎モデルと同じくらい、システム設計に依存します。
論文 参考訳(メタデータ) (2026-05-25T17:59:36Z) - Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems [65.90791804095561]
マルチエージェントシステムは、特殊エージェント間の構造化された協調を通じてこの問題に対処するが、より厳密な調整は、あまり検討されていないリスクを増幅する。
既存の調査では、個々のエージェント能力、マルチエージェントのコラボレーション、エージェントの自己進化を別々にカバーしている。
この調査は4つの因果関係のあるステージを中心にまとめられた統一されたレビューを提供する。これはLIFEの進展(Lay the capabilities foundation)、協力によるエージェントの統合、帰属による障害の発見、自律的な自己改善によるEvolveである。
論文 参考訳(メタデータ) (2026-05-14T14:36:13Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Multi-Agent Systems for Dataset Adaptation in Software Engineering: Capabilities, Limitations, and Future Directions [8.97512410819274]
本稿では,データセット適応タスクにおいて,最先端のマルチエージェントシステムがどのように機能するかについて,最初の実証的研究を行う。
我々は、GitHub Copilotを評価し、ROCODEやLogHub2.0といったベンチマークリポジトリからSE研究成果物を適用する。
その結果、現在のシステムはキーファイルを識別し、部分的な適応を生成することができるが、正しい実装を生成することは滅多にない。
論文 参考訳(メタデータ) (2025-11-26T13:26:11Z) - Evaluating Software Process Models for Multi-Agent Class-Level Code Generation [5.545076518491288]
大規模言語モデル(LLM)は、ソフトウェア開発の自動化にますます使われています。
本研究では,クラスレベルのコード生成のためのプロセス構造とロール形状のマルチエージェント特殊化について検討する。
論文 参考訳(メタデータ) (2025-11-12T22:53:12Z) - Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails [103.05296856071931]
本稿では,自己進化型大規模言語モデル(LLM)エージェントに特有の,アライメント・ティッピング・プロセス(ATP)を同定する。
ATPは、連続的な相互作用によってエージェントが訓練中に確立されたアライメント制約を放棄し、強化された自己関心の戦略を支持するときに生じる。
実験の結果、アライメントの利点は自己進化の下で急速に低下し、最初は整合性のない状態に収束したモデルであることが判明した。
論文 参考訳(メタデータ) (2025-10-06T14:48:39Z) - Reinforcement Learning for Machine Learning Engineering Agents [52.03168614623642]
強化学習によって改善される弱いモデルによって支援されるエージェントは、はるかに大きいが静的モデルによって支援されるエージェントよりも優れていることを示す。
分散非同期RLフレームワークにおいて,高コストかつ高利回りな動作を増幅するための時間依存性の勾配更新を提案する。
また,早期に失敗するプログラムとほぼ正しくないプログラムを区別し,部分クレジットを提供する環境機器を提案する。
論文 参考訳(メタデータ) (2025-09-01T18:04:10Z) - Understanding Software Engineering Agents Through the Lens of Traceability: An Empirical Study [15.97770416681533]
ソフトウェアエンジニアリングエージェント(SWEエージェント)は、ユーザの入力を解釈し、環境フィードバックに応答することで、自律的に動作する。
本稿では,SWEエージェントの動作を,実行トレースのレンズを通してシステマティックに解析する。
論文 参考訳(メタデータ) (2025-06-10T00:41:54Z) - Towards Efficient Fine-tuning of Pre-trained Code Models: An
Experimental Study and Beyond [52.656743602538825]
微調整された事前訓練されたコードモデルは、大きな計算コストを発生させる。
我々は、レイヤーワイドで事前訓練された表現と、微調整中に符号化されたコード知識に何が起こるのかを実験的に検討する。
本稿では,レイヤ凍結により事前学習したコードモデルを効率的に微調整するTellyを提案する。
論文 参考訳(メタデータ) (2023-04-11T13:34:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。