論文の概要: The Productivity-Reliability Paradox: Specification-Driven Governance for AI-Augmented Software Development
- arxiv url: http://arxiv.org/abs/2605.01160v1
- Date: Fri, 01 May 2026 23:37:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:49.616476
- Title: The Productivity-Reliability Paradox: Specification-Driven Governance for AI-Augmented Software Development
- Title(参考訳): 生産性-信頼性のパラドックス:AI強化ソフトウェア開発のための仕様駆動型ガバナンス
- Abstract要約: コントロールされた研究によると、よくスコープされたタスクで生産性が20~56%向上し、最も厳格なRCT文書は経験豊富な開発者にとって19%の減速を報告している。
10,000人以上の開発者を対象としたテレメトリでは、プルリクエストが98%増加したが、フラットなデリバリメトリクスによるレビュー時間が91%長かった。
本稿では,非決定論的コードジェネレータから生じる系統的な現象と,仕様の不十分な規律であるProductivity-Reliability Paradox(PRP)について論じる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Since 2022, AI-powered coding assistants have produced contradictory evidence: controlled studies report 20-56% productivity gains on well-scoped tasks, while the most rigorous RCT documents a 19% slowdown for experienced developers, and telemetry across 10,000+ developers shows 98% more pull requests but 91% longer review times with flat delivery metrics. This paper argues these findings constitute the Productivity-Reliability Paradox (PRP): a systematic phenomenon emerging from non-deterministic code generators and insufficient specification discipline. Through a multivocal literature review of 67 sources (2022-2026), this paper: (1) formally defines the PRP with three moderating variables (task abstraction, codebase maturity, developer experience) and two amplifying mechanisms (code review bottleneck, context window constraint); (2) proposes the AI-Augmented Methodology Taxonomy (AAMT), classifying six methodologies under three AI integration tiers; (3) introduces the Specification Governance Model (SGM), grounded in Transaction Cost Economics, with a practical governance decision guide; and (4) evaluates Spec Kit and TDAD as SGM instantiations via a four-month pilot study. Specification discipline, not model capability, is the binding constraint on AI-assisted software dependability.
- Abstract(参考訳): 2022年以降、AIを利用したコーディングアシスタントは矛盾する証拠を生み出している。コントロールされた調査では、よくスキャンされたタスクで20~56%の生産性向上が報告されている。
本稿では,非決定論的コードジェネレータから生じる系統的な現象と,仕様の不十分な規律であるProductivity-Reliability Paradox(PRP)について論じる。
67の文献レビュー(2022-2026)を通じて、(1)3つのモデレーション変数(タスク抽象化、コードベースの成熟度、開発者エクスペリエンス)と2つの増幅メカニズム(コードレビューボトルネック、コンテキストウィンドウの制約)でPRPを正式に定義し、(2)AI統合層で6つの方法論を分類するAI拡張方法論分類法(AAMT)を提案し、(3)トランザクションコスト経済を基盤とした仕様ガバナンスモデル(SGM)を導入し、(4)4ヶ月のパイロット研究を通じて仕様キットとTDADをSGMのインスタンス化として評価する。
仕様の規律は、モデル能力ではなく、AI支援ソフトウェアの信頼性に対する拘束力である。
関連論文リスト
- Specification-Driven Development as the Foundation of AI-Native Enterprise Software Engineering [0.0]
大規模言語モデル(LLM)とエージェントAIは、ソフトウェアエンジニアリングを手作業によるコーディングからインテント仕様、アーキテクチャ、ガバナンスへとシフトさせています。
バイブコーディング(vibe coding)と、観察された振る舞いを通じてAIアーティファクトを受け入れる直観駆動アプローチ(intuition-driven approach)と、構造化仕様を真理の信頼できる情報源として使用する仕様駆動開発(Specification-Driven Development, SDD)の2つのパラダイムが登場した。
この記事では、3つのコントリビューションを行います。まず最初に、生産性-信頼性パラドックス、限られたコンテキストからのアーキテクチャ侵食、セキュリティ露出、技術的負債といった、過度な会話生成の失敗モードを特定します。
第2に、正式な仕様ガバナンス参照モデル(SGRM)を導入する。
論文 参考訳(メタデータ) (2026-07-18T07:27:02Z) - Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems [100.24694338574402]
本稿では,インダクティブ・デダクティブ・シンセシス(IDS)について述べる。
IDSは約6.8時間で7/7を達成し、1仕様あたり106ドル、専門家の努力の約200倍、SOTAエージェントの約17%を達成している。
IDSはパフォーマンスフィードバックを同じループに組み込んでおり、検証されたシステムよりも最大3倍高速な実装を実現している。
論文 参考訳(メタデータ) (2026-05-22T00:05:36Z) - Philosophical Dispositions as Behavioral Constraints for AI-Assisted Code Review: An Empirical Study [0.0]
哲学的な配置を通してAIレビュアーの行動を制限するシステムを提案する。
それぞれの分布は(それがすることを拒否して)好意的に定義される
5つのプログラミング言語にまたがる7つのレポジトリ間で50のプルリクエストをマージしたシステムの評価を行った。
論文 参考訳(メタデータ) (2026-05-21T23:57:25Z) - IACDM: Interactive Adversarial Convergence Development Methodology -- A Structured Framework for AI-Assisted Software Development [0.0]
この記事では、障害は構造的な原因 – 検証のギャップ – を共有している、と論じる。
我々は,外部検証エージェントによる検証ギャップに対処するために,構造化された8フェーズフレームワークであるIACDMを提案する。
論文 参考訳(メタデータ) (2026-03-31T09:48:09Z) - Early-Stage Prediction of Review Effort in AI-Generated Pull Requests [0.0]
我々は,2,807リポジトリにわたるAIDevデータセットから,エージェントによるPR33,707件を分析した。
本稿では,高解像度PRを生成時に予測するサーキットブレーカートリアージモデルを提案する。
論文 参考訳(メタデータ) (2026-01-02T17:18:01Z) - AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent [80.83250816918861]
o3やDeepSeek-R1のようなLarge Reasoning Models (LRM)は、長いチェーン・オブ・シークレットを持つ自然言語推論において顕著な進歩を遂げている。
しかし、計算的に非効率であり、複雑な数学的操作を必要とする問題を解く際には精度に苦しむ。
本稿では,言語モデルの推論能力とコードインタプリタの計算精度をシームレスに統合するエージェントフレームワークであるAgentMathを紹介する。
論文 参考訳(メタデータ) (2025-12-23T19:57:49Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems [3.215065407261898]
大規模言語モデルと外部ツールを組み合わせたマルチエージェントシステムは、研究機関からハイテイクドメインへと急速に移行している。
この「先進的な」続編は、アルゴリズムのインスタンス化や経験的な証拠を提供することで、そのギャップを埋める。
AMDMは擬似ゴールドリフトで異常検出遅延を12.3秒から5.6秒に減らし、偽陽性率を4.5%から0.9%に下げる。
論文 参考訳(メタデータ) (2025-08-28T15:52:49Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - Thinking Longer, Not Larger: Enhancing Software Engineering Agents via Scaling Test-Time Compute [61.00662702026523]
より大規模なモデルではなく、推論時間の増加を活用する統合されたテスト時間計算スケーリングフレームワークを提案する。
当社のフレームワークには,内部TTCと外部TTCの2つの補完戦略が組み込まれている。
当社の textbf32B モデルは,DeepSeek R1 671B や OpenAI o1 など,はるかに大きなモデルを上回る 46% の課題解決率を実現している。
論文 参考訳(メタデータ) (2025-03-31T07:31:32Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - Generative AI for Requirements Engineering: A Systematic Literature Review [1.6986294649170766]
生成事前学習型トランスモデルが現在の応用を支配している。
産業採用は未熟であり、90%以上の研究が初期開発に対応している。
GenAIベースのREの変革的な可能性にもかかわらず、いくつかの障壁は実践的な採用を妨げる。
論文 参考訳(メタデータ) (2024-09-10T02:44:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。