論文の概要: The Specification as Quality Gate: Three Hypotheses on AI-Assisted Code Review
- arxiv url: http://arxiv.org/abs/2603.25773v1
- Date: Thu, 26 Mar 2026 11:59:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-30 21:49:48.204126
- Title: The Specification as Quality Gate: Three Hypotheses on AI-Assisted Code Review
- Title(参考訳): 品質ゲートとしての仕様:AI支援コードレビューの3つの仮説
- Abstract要約: AIが生成するコード品質の問題に対する業界の主要な反応は、AIレビュアーをデプロイすることだ。
本稿では,実行可能な仕様が存在しない場合,この応答は構造的に円形であると主張している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The dominant industry response to AI-generated code quality problems is to deploy AI reviewers. This paper argues that this response is structurally circular when executable specifications are absent: without an external reference, both the generating agent and the reviewing agent reason from the same artefact, share the same training distribution, and exhibit correlated failures. The review checks code against itself, not against intent. Three hypotheses are developed. First, that correlated errors in homogeneous LLM pipelines echo rather than cancel, a claim supported by convergent empirical evidence from multiple 2025-2026 studies and by three small contrived experiments reported here. The first two experiments are same-family (Claude reviewing Claude-generated code); the third extends to a cross-family panel of four models from three families. All use a planted bug corpus rather than a natural defect sample; they are directional evidence, not a controlled demonstration. Second, that executable specifications perform a domain transition in the Cynefin sense, converting enabling constraints into governing constraints and moving the problem from the complex domain to the complicated domain, a transition that AI makes economically viable at scale. Third, that the defect classes lying outside the reach of executable specifications form a well-defined residual, which is the legitimate and bounded target for AI review. The combined argument implies an architecture: specifications first, deterministic verification pipeline second, AI review only for the structural and architectural residual. This is not a claim that AI review is valueless. It is a claim about what it is actually for, and about what happens when it is deployed without the foundation that makes it non-circular.
- Abstract(参考訳): AIが生成するコード品質の問題に対する業界の主要な反応は、AIレビュアーをデプロイすることだ。
本稿では, 外部参照がなければ, 生成エージェントとレビューエージェントの双方が同じ人工物から原因を判断し, 同一のトレーニング分布を共有し, 相関する故障を示す。
レビューは意図に反してではなく、それ自体でコードをチェックします。
3つの仮説が展開されている。
第一に、同種LLMパイプラインの相関誤差はキャンセルではなく反響し、複数の2025-2026研究による収束した経験的証拠と、ここで報告された3つの小さな実験によって支持された。
最初の2つの実験は、同じファミリー(ClaudeによるClaude生成コードのレビュー)で、3番目の実験は、3つのファミリーから4つのモデルのクロスファミリーパネルに拡張される。
すべては天然の欠陥サンプルではなく、植えられたバグコーパスを使用します。
第二に、実行可能な仕様はCynefinの意味でドメイン移行を実行し、制約の許容を規制の制約に変換し、複雑なドメインから複雑なドメインへ問題を移動させます。
第3に、実行可能な仕様の範囲外にある欠陥クラスは、AIレビューの正当かつ有界なターゲットである、明確に定義された残留部を形成する。
仕様第一、決定論的検証パイプライン第二、AIレビューは構造的およびアーキテクチャ的残留のためにのみ行われる。
これはAIレビューが価値がないという主張ではない。
実際に何のためにあるのか、そしてそれが非循環的な基盤なしでデプロイされたときに何が起こるのか、という主張である。
関連論文リスト
- Trust the Spec, Not the Code - A Specification-First, AI-Assisted Case Study in Online Banking [1.6796354350132203]
形式的な仕様は、早期エラー検出、明示的な不変性、設計による正しさを約束するが、その表記コストは主流の実践から遠ざかっている。
AIは推論と証明に十分な精度の中間仕様言語として機能する、と我々は主張する。
仕様は、著者、レビュー、証明、洗練の成果物となり、コードは再生可能な出力になる。
論文 参考訳(メタデータ) (2026-09-07T11:35:49Z) - Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review [0.0]
本稿では,AI符号化エージェントによる大規模建築解体のケーススタディについて報告する。
ここで述べられているプロトコルの下で、エージェントはそれを正常に完了した。
論文 参考訳(メタデータ) (2026-08-12T15:35:48Z) - Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence [86.61561123749011]
Apodex Discovery(アポデックスディスカバリー)は、重度解法を用いて発見的AIを構築し評価するためのフレームワークである。
まず16のセクターで511の業界を調査し、423の高価値現実問題を集め、最初のリリースで20を選定した。
第二に、共通の環境-タスク-エピソード抽象化は、データ、ツール、制約、フィードバック、軌跡記録、中間成果物と最終提出物の検証を提供する。
論文 参考訳(メタデータ) (2026-08-11T18:48:40Z) - When benchmark inferences do not compose: Projectibility in AI evaluation [0.0]
AIベンチマークの結果が1ステップで連続的なクレームに達することはめったにない。
評価者はそれをさらなるケースに一般化し、能力の証拠として解釈し、新しいタスクに外挿し、他のシステムやサイトへ輸送する。
保証リンクは保証チェーンを自動的に作らない。
論文 参考訳(メタデータ) (2026-07-28T18:07:04Z) - One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution [85.65263343588026]
我々は,自己修正型,自律型,接地型実験機であるSAGEを提案する。
その中核的なメカニズムであるMHFA(Multi-Hypothesis Failure Attribution)は、回復を構造的因果診断として扱う。
12のトピック、5ドメインのベンチマークでは、SAGEは基準リフレクションでメトリクスを含むアウトプットを42%から92%に増やしている。
論文 参考訳(メタデータ) (2026-06-30T10:54:16Z) - Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software [0.304585143845864]
物理学者は、CLAX-PTを構築するために、12の作業日と57のセッションでAIコーディングエージェントを監督した。
エージェントは、託宣試験を繰り返すことで、自律的に10を解決した。
予防されたオラクル検出ができなかった3つは共通の性質を共有しており、症状の減少を根本原因の解決法として扱った。
論文 参考訳(メタデータ) (2026-05-28T17:59:59Z) - LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition [55.572260012037084]
本稿では, LC-ERD (Logic-Consistent Endogenous Reward Decomposition) を紹介する。
モデルの潜在論理エキスパートズ(Latent Logic Expertise)からのコンセンサスを集約することで、変分論理ポテンシャルを導出する。
LC-ERDは、論理の一貫性と正確性の間のトレードオフを明らかにする、堅牢な自己進化パスを提供する。
論文 参考訳(メタデータ) (2026-05-19T07:27:50Z) - Scaling Human-AI Coding Collaboration Requires a Governable Consensus Layer [22.42181408084751]
ビブコーディングは正確で実行可能なコードを高速に生成するが、構造的なコミットメントや依存関係、証拠の記録は残っていない。
本稿では,操作可能な世界モデルであるコンセンサス層Cが,エンジニアリングの主要な成果物としてコードを置き換えるパラダイムであるエージェント・コンセンサスを提案する。
本稿では,チャットによるベースラインと比較して,コンセンサスに基づく人間の介入を減らすかどうかを測定するためのベンチマークタスクファミリーを提案する。
論文 参考訳(メタデータ) (2026-04-20T06:53:32Z) - Dynamic analysis enhances issue resolution [53.50448142467294]
DAIRA(Dynamic Analysis-enhanced Issue Resolution Agent)は、エージェントの推論サイクルに動的解析を組み込む自動修復フレームワークである。
テストトレース駆動の方法論によって駆動されるDAIRAは、軽量モニタを使用して重要なランタイムデータを抽出する。
Gemini 3 Flash Previewを使用すると、DAIRAは新たな最先端(SOTA)パフォーマンスを確立し、SWE-bench Verifiedデータセットで79.4%の解像度を達成する。
論文 参考訳(メタデータ) (2026-03-23T14:48:54Z) - Agency and Architectural Limits: Why Optimization-Based Systems Cannot Be Norm-Responsive [0.0]
AIシステムは、標準によって管理されるという前提の下で、ハイステークな状況にますますデプロイされている。
本稿では,最適化システムに対して仮定が正式に無効であることを示す。
論文 参考訳(メタデータ) (2026-02-26T17:16:17Z) - AI-Assisted Engineering Should Track the Epistemic Status and Temporal Validity of Architectural Decisions [0.0]
LLMコーディングアシスタントは、チームが検証できるよりも早く意思決定を生成する。
広く採用されているフレームワークは、検証された知識と推測を区別するものではない。
責任あるAI支援工学の3つの要件を提案する。
論文 参考訳(メタデータ) (2026-01-28T23:12:07Z) - The Mirror Loop: Recursive Non-Convergence in Generative Reasoning Systems [0.0]
外部からのフィードバックのない再帰的な自己評価は、進歩よりもむしろ改革をもたらすことが多い。
3つのモデル(OpenAI GPT-4o-mini, Anthropic Claude 3 Haiku, Google Gemini 2.0 Flash)と4つのタスクファミリー(パラメータ、コード、説明、リフレクション)にまたがる144の推論シーケンスについて検討する。
我々はこれを、生成的推論における自己補正の構造的限界の証拠として解釈する。
論文 参考訳(メタデータ) (2025-10-23T07:53:26Z) - Abduct, Act, Predict: Scaffolding Causal Inference for Automated Failure Attribution in Multi-Agent Systems [20.846301581161978]
マルチエージェントシステムにおける障害帰属は、批判的だが未解決の課題である。
現在の手法では、これを長い会話ログ上のパターン認識タスクとして扱う。
A2P Scaffoldingは、パターン認識から構造化因果推論タスクへの障害帰属を変換する。
論文 参考訳(メタデータ) (2025-09-12T16:51:15Z) - Unveiling the Magic of Code Reasoning through Hypothesis Decomposition and Amendment [54.62926010621013]
我々は,大規模言語モデルの推論能力に対する新たな視点を提供するために,新しいタスクであるコード推論を導入する。
論理的推論の確立した形式に基づいて3つのメタベンチマークを要約し、8つの特定のベンチマークタスクにインスタンス化する。
本稿では,人間の複雑な問題解決手法に触発された新たな経路探索パイプラインを提案する。
論文 参考訳(メタデータ) (2025-02-17T10:39:58Z) - Making Large Language Models Better Reasoners with Alignment [57.82176656663245]
推論(Reasoning)とは、証拠を使って結論に達する認知過程である。
近年の研究では、思考の連鎖(COT)推論プロセスによるデータ上の微調整LDMは、その推論能力を著しく向上させることができることが示されている。
テキストアライメントファインチューニング(AFT)パラダイムを3ステップで導入する。
論文 参考訳(メタデータ) (2023-09-05T11:32:48Z) - Nested Counterfactual Identification from Arbitrary Surrogate
Experiments [95.48089725859298]
観測と実験の任意の組み合わせからネスト反事実の同定について検討した。
具体的には、任意のネストされた反事実を非ネストされたものへ写像できる反ファクト的非ネスト定理(英語版)(CUT)を証明する。
論文 参考訳(メタデータ) (2021-07-07T12:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。