論文の概要: A Governance Methodology Layer for AI-Assisted Software Development: Defect Taxonomy, Controlled Ablation, and a Test of Process-Over-Capability
- arxiv url: http://arxiv.org/abs/2609.04218v3
- Date: Tue, 15 Sep 2026 03:08:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.46364
- Title: A Governance Methodology Layer for AI-Assisted Software Development: Defect Taxonomy, Controlled Ablation, and a Test of Process-Over-Capability
- Title(参考訳): AI支援ソフトウェア開発のためのガバナンス手法レイヤ:欠陥分類、制御されたアブレーション、プロセス・オーバ・キャパビリティのテスト
- Abstract要約: 5つのAIエージェントの許可とガバナンスモジュールに基づく欠陥クラス分類を提案する。
本稿では,ジェネレータの出力を読み出し,構造化されたバリデーションを出力するランタイム分離型ガバナンスゲートについて述べる。
トークンマッチングされた未構造化プロンプトとハーネス構造化されたレビューを比較した制御アブレーション実験を報告する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous coding agents produce output that passes syntactic checks -- compilation, type safety, CI -- at high velocity. Yet syntactic correctness does not imply semantic correctness: design boundaries, security invariants, and maintainability contracts remain structurally invisible to automated pipelines. This paper makes four contributions. First, we present a defect-class taxonomy grounded in five AI agent permission and governance modules, separating defects structurally detectable by static analysis from those requiring semantic review. Second, we describe a runtime-decoupled governance gate -- a file-based protocol that reads generator output and emits a structured verdict without API coupling, hence portable across generators. Third, we formalize methodology-as-code: expressing a verification protocol as a version-controlled, executable artifact whose two layers separate portable methodology from host automation. Fourth, we report a controlled ablation experiment (E-ablation, N=5 artifacts, 8-item independent ground truth) comparing harness-structured review against a token-matched unstructured prompt. The structured condition records 62% lenient recall against 50%, with 25% strict against 0%. A severity-grade differential reported earlier does not survive blind re-grading and is withdrawn (Sec. 6.6). An independent-session re-test with blind scoring does not replicate that contrast: the conditions differ by one strict hit in 24 (6/24 against 5/24), the structured aggregate again 25% and the unstructured 0% not recurring (Sec. 6.7). Both conditions miss document-quality defects identified by a human QA reviewer, indicating complementarity between structured AI review and human process inspection. The re-test does not distinguish structured review from a detailed unstructured prompt here, so process design as the dominant factor remains a hypothesis, not a result of this paper.
- Abstract(参考訳): 自動コーディングエージェントは、構文チェック(コンパイル、型安全性、CI)を高速にパスする出力を生成する。
設計バウンダリ、セキュリティ不変性、保守性契約は、自動パイプラインに対して構造的に見えないままです。
この論文には4つの貢献がある。
まず,5つのAIエージェントの許可とガバナンスモジュールに基づいて,静的解析によって構造的に検出可能な欠陥を,セマンティックレビューを必要とするものから分離する。
第2に、実行時分離型のガバナンスゲート -- ジェネレータ出力を読み出し、API結合なしで構造化されたバリデーションを出力するファイルベースのプロトコルで、ジェネレータ間でポータブルである。
第3に、検証プロトコルを2つのレイヤがホスト自動化から可搬性のある方法論を分離したバージョン管理の実行可能なアーティファクトとして表現する。
第4に, 制御アブレーション実験 (E-ablation, N=5 アーティファクト, 8-item 独立基底真理) を, トークンマッチングされた未構造化プロンプトと比較した。
構造化条件は50%に対して62%の寛大なリコール、25%は0%に対して厳格なリコールを記録した。
先に報告された重度グレードの差分は、ブラインド・リグレーディングを生き残らず、削除される(Sec. 6.6)。
ブラインドスコアによる独立セッションの再テストでは、24/24で1回の厳密なヒット(6/24対5/24)、構造化されたアグリゲーションの25%、非構造化された0%が再発しない(Sec. 6.7)。
どちらの条件も、人間のQAレビュアーが特定した文書品質の欠陥を見逃し、構造化されたAIレビューとヒューマンプロセスインスペクションの相補性を示している。
再テストでは、構造化されたレビューと詳細な非構造化的なプロンプトを区別しないので、プロセス設計を主要因とする設計は、この論文の結果ではなく仮説のままである。
関連論文リスト
- Algebraic Consistency Alone Does Not Certify Temporal Structure in Latent Action Models [18.86499205164955]
アクションモデルは、アクションフリービデオの2つのフレーム間の遷移のコードを推論する。
近年の手法では、この符号を正則化して加法的および反対称的に構成する。
この結論は従わないことを示す。
論文 参考訳(メタデータ) (2026-09-20T09:03:21Z) - A distribution-free certification framework for trustworthy crash-severity prediction [1.089614199781423]
厳密なモデルを修正せずにラップする認証層を開発します。
テキサス州の7つのベースモデルにまたがる520万件の記録では、同層は同一の妥当性を持つ。
フレームワークは定理レベルのテストを備えたオープンソースパッケージとしてリリースされている。
論文 参考訳(メタデータ) (2026-09-10T14:20:08Z) - Explicit State Elicitation Is Not Enough: A Controlled Audit of Memory-Policy Classification [11.991995412984503]
この設定を用いて、構造化中間出力の実証監査プロトコルを開発する。
480サンプルの合成開発セットは、当初は状態に構造化されたプロンプトバンドルから大きな利益が得られたことを示唆していた。
このセットでは、4つの状態定義を公開することで精度が向上するが、分離された明示的な状態出力フィールドはポリシーの精度を著しく改善しない。
論文 参考訳(メタデータ) (2026-08-18T01:04:45Z) - Causal Structure is Inducible but Functionally Decoupled: The Routing/Readout Boundary of a Typed Mechanism Library [0.0]
言語モデルが介入問題に答えるとき、それが実行しなければならない計算は、クエリが必要とするエビデンスの種類に依存する。
本稿では、トランスフォーマーが因果的知識をどう整理するかの分離について報告する: タイプレベルの監督によって誘導されるスロット・バイ・タイプ構造はルーティングを編成するが、応答の読み出しから切り離される。
論文 参考訳(メタデータ) (2026-08-12T08:10:01Z) - Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework [49.16055123488827]
大規模言語モデルを利用したコーディングエージェントは、バグレポートから直接コードパッチを生成することができる。
報告された問題を真に解決するかどうかを独立に検証するメカニズムは存在しない。
本稿では,RETRACE をトレーニング不要なポストジェネレーション検証フレームワークとして提案する。
論文 参考訳(メタデータ) (2026-08-09T22:59:13Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration [0.0]
生産言語モデルシステムは、労働者エージェントの目に見えないオーケストレーションにまたがってそれを拡大する要求に答える。
これは、単一のワーカーが見ることができない欠陥のクラスに何をもたらすか尋ねる。
1人の開発者から5世代にわたる10のシステムと、異なるアライメントパラダイムからの5つのプロバイダのみです。
論文 参考訳(メタデータ) (2026-05-25T05:09:48Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - Noise & pattern: identity-anchored Tikhonov regularization for robust structural anomaly detection [58.535473924035365]
異常検出は自動産業検査において重要な役割を担い、他の均一な視覚パターンの微妙な欠陥や稀な欠陥を識別することを目的としている。
自己教師型オートエンコーダを用いて, 破損した入力の修復を学習する構造的異常検出に取り組む。
構造欠陥を模倣した画像に人工的破壊を注入する汚職モデルを導入する。
論文 参考訳(メタデータ) (2025-11-10T15:48:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。