論文の概要: Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work
- arxiv url: http://arxiv.org/abs/2606.17099v1
- Date: Sun, 14 Jun 2026 05:53:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-17 17:15:32.055784
- Title: Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work
- Title(参考訳): ソフトウェアデリゲーション契約:AIコーディング-エージェント作業におけるレビュー可能性の測定
- Abstract要約: 以前の作業では、タスク、権限、返却された作業パッケージ、受け入れコンテキストを、委譲されたコーディング作業の分析単位として記述するソフトウェア委譲契約を提案したが、その効果は測定しなかった。
本稿では,符号化エージェントの明示的デリゲート契約に関する制御されたパイロット研究について報告する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI coding agents increasingly accept assigned software tasks, modify repositories under bounded authority, and return work packages for review. Prior work proposed the software delegation contract, covering the task, authority, returned work package, and acceptance context, as the unit of analysis for delegated coding work, but did not measure its effects. This paper reports a controlled pilot study of explicit delegation contracts for coding agents. We built a dependency-free TypeScript API task environment with seeded defects and documentation gaps, authored ten tasks across five families, and ran 64 agent executions across two model tiers under three conditions: a realistic issue-style prompt, an explicit delegation contract, and a contract with a required evidence bundle. Each run was scored with hidden acceptance tests, mutation checks, and scope analysis, then reviewed by three independent condition-blinded model-based reviewers using a fixed rubric, for 192 reviews. Explicit contracts did not improve objective task outcomes: all 64 runs passed hidden acceptance checks, with zero scope violations. They did improve reviewability. Evidence sufficiency improved in 22 of 30 paired comparisons and worsened in none (+0.83 on a 5-point scale, p < 0.0001, Cliff's delta = 0.66); reviewer ambiguity decreased (p = 0.035); changed-file lists, known-limitations sections, residual-risk sections, and reviewer checklists appeared mostly or only when demanded by the contract. Contracts cost +13% agent tokens and +38% wall-clock time, with larger effects for the weaker model tier. On these small tasks, delegation contracts bought reviewability rather than correctness.
- Abstract(参考訳): AIコーディングエージェントは、割り当てられたソフトウェアタスクを受け入れ、制限付き権限の下でリポジトリを変更し、レビュー用のワークパッケージを返す。
以前の作業では、タスク、権限、返却された作業パッケージ、受け入れコンテキストを、委譲されたコーディング作業の分析単位として記述するソフトウェア委譲契約を提案したが、その効果は測定しなかった。
本稿では,符号化エージェントの明示的デリゲート契約に関する制御されたパイロット研究について報告する。
依存関係のないTypeScript APIタスク環境を構築し、欠陥とドキュメントのギャップをシード化し、5つのファミリーに10のタスクを書き、現実的なイシュースタイルのプロンプト、明示的なデリゲート契約、必要なエビデンスバンドルとの契約という3つの条件の下で、64のエージェント実行を実行しました。
各ランは、隠された受け入れテスト、突然変異チェック、スコープ分析で評価され、固定されたルーリックを使用して3つの独立した条件書式モデルベースレビュアーによって192のレビューでレビューされた。
明示的な契約は、客観的なタスクの結果を改善しなかった。64回の実行はすべて、隠された受け入れチェックをパスし、スコープ違反はゼロである。
彼らはレビュー可能性を改善した。
結果、30対比較中22対で改善され、ゼロ(5点スケールで+0.83、p < 0.0001、Cliff's delta = 0.66)、レビュアーのあいまいさが減少(p = 0.035)、変更ファイルリスト、既知のリミテーションセクション、残留リスクセクション、レビュアーのチェックリストは、契約によって要求された場合、あるいは契約によって要求された場合にのみ表示される。
契約の費用は+13%のエージェントトークンと+38%のウォールクロックであり、より弱いモデル層に対する影響が大きい。
これらの小さなタスクにおいて、委譲契約は正確性よりもレビュー可能性を購入した。
関連論文リスト
- Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review [0.0]
本稿では,AI符号化エージェントによる大規模建築解体のケーススタディについて報告する。
ここで述べられているプロトコルの下で、エージェントはそれを正常に完了した。
論文 参考訳(メタデータ) (2026-08-12T15:35:48Z) - SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories [13.437222222971272]
仕様パスの感度は、最終的な意味において等価な要求履歴が同一のエージェントシステムに振る舞いの異なるプログラムを作成させる障害モードである。
本稿では,契約に至るリビジョンパスのみを変更しつつ,リポジトリ,最終契約,検証,エージェントシステム,実行予算を保持する診断評価であるSpecPathを紹介する。
論文 参考訳(メタデータ) (2026-08-10T16:19:00Z) - VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents [57.240036084348354]
本稿では,ロボットスキルコントラクトの検証誘導自己進化のためのフレームワークであるVASOを紹介する。
VASOは論理的に一貫性のないスキル契約を検証し、グローバルおよびローカルな時間的仕様に対してスキルによって誘発される計画を検証する。
Clearpath Jackal と PX4 のクアッドコプタータスクでは、VASO は100点未満の最適化サンプルを使用して97.2% の形式的な仕様準拠に達した。
論文 参考訳(メタデータ) (2026-06-03T20:02:35Z) - Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks [0.0]
他のエージェントやエンジニアが残した部分的な状態からタスクを中断し、再割り当てし、レビューし、再開するからです。
前任者の作業が不透明あるいは不完全である場合に課される再検討コスト。
我々の乗っ取りプロトコルは、決定論的ハンドオフポイントで符号化エージェントを中断し、リポジトリを凍結し、4つのハンドオフビューで後継エージェントを評価する。
論文 参考訳(メタデータ) (2026-06-01T20:40:38Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Security Is Relative: Training-Free Vulnerability Detection via Multi-Agent Behavioral Contract Synthesis [14.657771106188115]
脆弱性検出のためのトレーニング不要なマルチエージェントフレームワークであるPhoenixを提案する。
Phoenixは、検出をセマンティックスライダ、要求リバースエンジニア、契約審査員の3つのステージに分解する。
PrimeVul Pairedでは、Phoenix は F1 = 0.825 と Pair-Correct = 64.4% を獲得し、RASM-Vul (F1 = 0.668) と VulTrial (F1 = 0.563) を上回る。
論文 参考訳(メタデータ) (2026-04-21T03:02:34Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - Agent Behavioral Contracts: Formal Specification and Runtime Enforcement for Reliable Autonomous AI Agents [0.0]
Agent Behavioral Contracts (ABC)は、自律型AIエージェントにDesign-by-Contractの原則をもたらす正式なフレームワークである。
ABCは、プリコンディション、不変性、ガバナンスポリシー、およびリカバリメカニズムをランタイム強化可能なコンポーネントとして定義している。
実行時実行ライブラリであるAgentAssertにABCを実装し、AgentContract-Benchで評価する。
論文 参考訳(メタデータ) (2026-02-25T18:42:56Z) - One Signature, Multiple Payments: Demystifying and Detecting Signature Replay Vulnerabilities in Smart Contracts [56.94148977064169]
署名の使用状況のチェックが不足すると、繰り返し検証が行われ、許可の不正使用のリスクが増大し、契約資産が脅かされる可能性がある。
我々はこの問題をSignature Replay Vulnerability (SRV) として定義する。
37のブロックチェーンセキュリティ企業を対象とした1,419の監査報告から、詳細なSRV記述と5種類のSRVを分類した108を識別しました。
論文 参考訳(メタデータ) (2025-11-12T09:17:13Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - Understanding Inconsistent State Update Vulnerabilities in Smart Contracts [10.224761284656992]
不整合状態更新問題は、非同期的な修正などの理由で発生する可能性がある。
本稿では,不整合状態更新脆弱性に関する大規模な実証的研究を行う。
実世界のスマートコントラクトプロジェクト352において、116の一貫性のない状態更新脆弱性を調査した。
論文 参考訳(メタデータ) (2025-08-08T10:15:29Z) - SolBench: A Dataset and Benchmark for Evaluating Functional Correctness in Solidity Code Completion and Repair [51.0686873716938]
コード補完モデルによって生成されたSolidityスマートコントラクトの機能的正しさを評価するベンチマークであるSolBenchを紹介する。
本稿では,スマートコントラクトの機能的正当性を検証するための検索拡張コード修復フレームワークを提案する。
その結果、コード修復と検索技術は、計算コストを削減しつつ、スマートコントラクト完了の正しさを効果的に向上することを示した。
論文 参考訳(メタデータ) (2025-03-03T01:55:20Z) - CodeAgent: Autonomous Communicative Agents for Code Review [12.163258651539236]
コードレビュー自動化のための新しいマルチエージェント大規模言語モデル(LLM)システムであるツールを紹介する。
CodeAgentは、すべてのエージェントのコントリビューションが初期レビュー問題に対処するように、監督エージェントであるQA-Checkerを組み込んでいる。
結果はCodeAgentの有効性を実証し、コードレビュー自動化の新たな最先端に寄与している。
論文 参考訳(メタデータ) (2024-02-03T14:43:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。