論文の概要: Code That Works, Environments That Don't: Measuring Environment Reproducibility in AI-Generated Software
- arxiv url: http://arxiv.org/abs/2610.00425v1
- Date: Wed, 30 Sep 2026 16:04:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.654253
- Title: Code That Works, Environments That Don't: Measuring Environment Reproducibility in AI-Generated Software
- Title(参考訳): 機能するコード、そうでない環境:AI生成ソフトウェアにおける環境再現性の測定
- Abstract要約: 我々は,環境仕様のためのエージェントプロトコルを開発し,三層フレームワークを導入する。
我々は,コーディングエージェントがソフトウェア環境依存性を体系的に不特定する程度を評価する。
エージェント全体では、依存関係セットの合意は同一タスクに対して7%も低く、新しいエージェントは意味のある改善を示さない。
- 参考スコア(独自算出の注目度): 2.3275796286410677
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Code generation has emerged as a central capability of large language models, with coding agents now able to produce functionally correct software projects from natural language prompts. However, functional correctness alone does not capture a critical dimension of generation quality: environment specification, defined as the accurate identification of the dependencies required to execute generated code, is equally critical. We develop an agent protocol for environment specification and introduce a three-layer framework comprising declared, runtime-installed, and necessary-and-sufficient dependencies to systematically assess coding agents for environment specification. Using this protocol, we evaluate the extent to which coding agents systematically misspecify software environment dependencies and how this misspecification varies across three agents, four languages, and fifty programming tasks. Our results show that current coding agents exhibit systematic generalization failures along this dimension, producing dependency specifications that are inconsistent, redundant, or incomplete in ways that functional tests do not detect. Across agents, dependency set agreement is as low as 7% for identical tasks, and newer agents show no meaningful improvement, suggesting the failure is not resolved by scale or recency. The largest divergence occurs between the declared and runtime dependency layers, implicating environment priors learned from the models' training distributions as the primary driver. Our findings establish environment specification as a distinct, measurable axis of code generation quality that current benchmarks do not capture, and motivate training objectives and evaluation protocols that jointly optimize for functional correctness and environmental portability.
- Abstract(参考訳): コーディングエージェントは、自然言語プロンプトから機能的に正しいソフトウェアプロジェクトを作成できるようになった。
環境仕様は、生成されたコードを実行するのに必要な依存関係の正確な識別として定義されています。
環境仕様のためのエージェントプロトコルを開発し、環境仕様のためのコーディングエージェントを体系的に評価するために、宣言、ランタイムインストール、必要な依存性を含む3層フレームワークを導入する。
このプロトコルを用いて、コーディングエージェントがソフトウェア環境依存を体系的に不特定する程度と、この不特定が3つのエージェント、4つの言語、50のプログラミングタスクでどのように異なるかを評価する。
以上の結果から,現在の符号化エージェントはこの次元に沿って体系的な一般化の失敗を示し,不整合性,冗長性,あるいは不完全な依存性仕様を機能テストが検出しない方法で生成することを示した。
エージェント全体では、依存関係セットの合意は同一タスクに対して7%も低く、新しいエージェントは意味のある改善を示さず、スケールやリプライによって失敗が解決されないことを示唆している。
宣言された依存性層と実行時の依存関係層の間に最も大きなばらつきがあり、モデルのトレーニングディストリビューションから学んだ環境の優先順位を第一のドライバとして含んでいる。
本研究は,既存のベンチマークでは捉えていないコード生成品質の軸として環境仕様を確立し,機能的正当性と環境ポータビリティを協調的に最適化するトレーニング目標と評価プロトコルを動機付けている。
関連論文リスト
- Self-Evolving Coding Agents [11.43197414613246]
自己進化型コーディングエージェントは、リポジトリを検査し、ツールを実行し、テストを実行し、障害をデバッグし、パッチを生成することができる。
まず、自己進化型プログラミングエージェントを定義し、それらを従来のコーディングエージェントや一般的な自己進化型エージェントと区別する。
実行可能なフィードバック、リポジトリレベルのコンテキスト、コーディングトラジェクトリは、ソフトウェアエンジニアリングをエージェントの自己進化のための自然なドメインとして、ユニークな役割を与えます。
論文 参考訳(メタデータ) (2026-08-04T09:43:46Z) - ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders [26.859032352714276]
本稿では,インタラクティブなプロジェクト構築環境下でのコーディングエージェント評価ベンチマークICAE-Benchを紹介する。
基本的な考え方はファジィな製品要件から始め、自動化されたUser Agentで動的パラダイムをシミュレートすることです。
ICAE-Benchは、機能的正当性、セマンティックおよびAPI類似性、構造的忠実性、設計品質、相互作用品質などの多次元診断と共に標準化されたブラックボックステストを使用する。
論文 参考訳(メタデータ) (2026-07-23T11:31:38Z) - Beyond the 'Diff': Addressing Agentic Entropy in Agentic Software Development [42.371764229953165]
エージェントによる決定が時間やツールコール,アーキテクチャ境界を越えてどのように展開されるかを明らかにする,プロセス指向の説明可能性フレームワークを提案する。
私たちのアプローチは、既存のレビュープラクティスを置き換えるのではなく、補完するインテントレベルのテレメトリを提供します。
認知的ドリフトをコード品質と並んで第一級の関心事として扱うことで、エージェントの監視に必要な人間の理解の最小レベルを安定的に維持する。
論文 参考訳(メタデータ) (2026-03-03T12:55:28Z) - Environment-Aware Code Generation: How far are We? [52.69113158357018]
大規模言語モデル(LLM)がユーザの特定の環境に適した実行可能コードを確実に生成できるかどうかは不明である。
本稿では,環境対応コード生成(EACG)の最初の体系的研究について述べる。
その結果,現在のLLMは環境固有のコード生成に苦しむ一方で,環境の適合性や実行性も向上していることがわかった。
論文 参考訳(メタデータ) (2026-01-18T04:58:15Z) - Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents [71.85020581835042]
大規模言語モデルベースのエージェントは、ソフトウェアエンジニアリングの約束を示すが、環境構成はボトルネックのままである。
既存のベンチマークでは、エンドツーエンドのビルド/テストの成功のみを評価し、エージェントが成功または失敗する場所と理由を見極めている。
本研究では,環境設定計画中の細粒度エージェントのプロセスレベルの軌道評価を行うEnconda-benchを紹介する。
論文 参考訳(メタデータ) (2025-10-29T16:59:07Z) - Uncovering Systemic and Environment Errors in Autonomous Systems Using Differential Testing [9.625308787676286]
本稿では,非好ましくないエージェントの挙動に差分試験を適用する新しいブラックボックステスト手法であるAIProbeを紹介する。
AIProbeは、エージェントのモデルやポリシーのエラーによるものなのか、あるいは解決不可能なタスク条件によるものなのかを識別する。
評価の結果,AIProbeは,総誤差と一意誤差の両方を検出する上で,最先端技術よりも優れていた。
論文 参考訳(メタデータ) (2025-07-05T02:50:41Z) - Focused-DPO: Enhancing Code Generation Through Focused Preference Optimization on Error-Prone Points [51.40935517552926]
Focused-DPOは、優先度最適化を重要なエラー発生箇所に向けることで、コード生成を強化するフレームワークである。
エラーを起こしやすい点に焦点を当てることで、Focused-DPOはモデル生成コードの正確性と機能を向上させる。
論文 参考訳(メタデータ) (2025-02-17T06:16:02Z) - Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [60.84912551069379]
Code-Development Benchmark (Codev-Bench)は、細粒度で現実世界、リポジトリレベル、開発者中心の評価フレームワークです。
Codev-Agentは、リポジトリのクローリングを自動化し、実行環境を構築し、既存のユニットテストから動的呼び出しチェーンを抽出し、データ漏洩を避けるために新しいテストサンプルを生成するエージェントベースのシステムである。
論文 参考訳(メタデータ) (2024-10-02T09:11:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。