論文の概要: SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories
- arxiv url: http://arxiv.org/abs/2608.09799v1
- Date: Mon, 10 Aug 2026 16:19:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.383078
- Title: SpecPath: Testing Coding Agents Across Contract-Equivalent Specification Histories
- Title(参考訳): SpecPath: コントラクト等価な仕様履歴を対象とするコーディングエージェントのテスト
- Authors: Yangfan Wu, Haozhe Wang, Huanyu Yang, Jianmin Ji, Fangzhen Lin,
- Abstract要約: 仕様パスの感度は、最終的な意味において等価な要求履歴が同一のエージェントシステムに振る舞いの異なるプログラムを作成させる障害モードである。
本稿では,契約に至るリビジョンパスのみを変更しつつ,リポジトリ,最終契約,検証,エージェントシステム,実行予算を保持する診断評価であるSpecPathを紹介する。
- 参考スコア(独自算出の注目度): 13.437222222971272
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern coding agents increasingly appear capable of following complex software requirements, yet their success leaves a critical ambiguity: do they resolve the active specification, or merely follow the most salient path by which it was stated? We identify specification-path sensitivity, a failure mode in which requirement histories that are equivalent in their final meaning lead the same agent system to produce behaviorally different programs. This reframes evolving-requirement evaluation as active-contract resolution: before writing code, an agent must determine which requirements still count. Building on this view, we introduce SpecPath, a diagnostic evaluation that holds the repository, final contract, verifier, agent system, and execution budget fixed while changing only the revision path that leads to the contract. Rather than treating each patch as an isolated pass or failure, SpecPath uses paired executable outcomes to reveal whether an agent realizes the same tested behavior across contract-equivalent histories. Across five calibrated software tasks and fourteen coding-agent configurations, aggregate direct and revision-history accuracy is nearly unchanged; nevertheless, 35 of 100 complete blocks that succeed on the direct specification fail on at least one equivalent history. These results show that implementation success on a consolidated request does not guarantee specification-path invariance. Evaluating evolving requirements therefore calls for controlled tests of whether agents are robust to the path by which a specification becomes final.
- Abstract(参考訳): 現代のコーディングエージェントは、複雑なソフトウェア要件に従う能力を持つように思われるが、その成功は重要な曖昧さを残している。
仕様パスの感度は、最終的な意味において等価な要求履歴が同一のエージェントシステムに振る舞いの異なるプログラムを作成させる障害モードである。
コードを書く前に、エージェントはどの要件がまだ数えられているかを判断する必要があります。
この観点から、契約に至るリビジョンパスのみを変更しつつ、リポジトリ、最終契約、検証者、エージェントシステム、実行予算を保持する診断評価であるSpecPathを紹介します。
SpecPathは、各パッチを独立したパスや障害として扱うのではなく、ペア化された実行可能な結果を使用して、エージェントがコントラクト等価な履歴で同じテストされた動作を実現するかどうかを明らかにする。
5つのキャリブレーションされたソフトウェアタスクと14のコーディングエージェント構成、アグリゲートダイレクトとリビジョン履歴の精度はほぼ変化していないが、ダイレクト仕様で成功した100のブロックのうち35は、少なくとも1つの等価な履歴で失敗している。
これらの結果は、統合された要求に対する実装の成功が仕様パスの不変性を保証していないことを示している。
したがって、進化する要求を評価するには、エージェントが仕様が確定するパスに対して堅牢であるかどうかの制御されたテストが必要である。
関連論文リスト
- Formal Verification of Agentic Systems over Operational Data [59.98246281888422]
大規模言語モデル(LLM)によって駆動されるエージェントシステムは、永続的な運用データを扱う現実世界にますます展開されている。
既存のアプローチはそのようなシステムレベルの保証を提供していません。
本稿では, 1 つの LLM とツールオーケストレーションハーネスからなるエージェントシステムのリレーショナル操作データに対する検証について述べる。
論文 参考訳(メタデータ) (2026-08-04T13:01:30Z) - Preventing Premature Commitment in Coding Agents with an Evidence-Conditioned Execution Layer [38.62073085926841]
LLMベースのコーディングエージェントはソースコードを編集したり、変更を正当化するための十分なリポジトリ証拠を調べる前にパッチを提出する。
我々は、エビデンス条件付き実行を実行するために、エージェントとレポジトリの間を介在する実行層であるECLoopを提案する。
論文 参考訳(メタデータ) (2026-07-30T20:16:35Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - What Resolve Rate Hides: Trajectory Structure Diagnostics for Coding Agents [14.988334585821939]
コーディングエージェントは、ほぼ完全に解決率でランク付けされる。
単一のパス/フェイルラベルは、なぜ実行が失敗したのか、なぜ承認された実行が追加のステップ、時間、トークンを費やしたのかについて何も述べていない。
TraceProbeは、リゾルフレートが隠すものを回復するトラジェクトリに依存しないフレームワークである。
論文 参考訳(メタデータ) (2026-07-07T12:09:46Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents [2.3488056916440856]
既存のベンチマークでは、エージェントがタスクが不明確かどうかを無視して、パイプラインが動作しているかどうかをスコア付けしている。
本稿では,予測対象曖昧さと評価対象曖昧さの2つの診断スイートであるAmbig-DSを紹介する。
すべてのタスクに対して、元の完全に指定されたバージョンと、コントロールされた編集によって生成されるあいまいなバリエーションをペアにします。
論文 参考訳(メタデータ) (2026-05-10T18:34:12Z) - BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases [0.0]
BUILD-AND-FINDは、下流エージェントが生成されたリポジトリから意図した選択を復元できるかどうかを評価するプロトコルである。
各タスクに対して、ビルダーは隠されたリポジトリの仕様を見て、仕様に書かれた複数選択の質問バンクを作成します。
このプロトコルは、行動の正しさをアーティファクト側のリカバリから切り離し、リカバリの正確性、再現性、実装のカバレッジ、検査の労力を報告します。
論文 参考訳(メタデータ) (2026-05-07T12:35:27Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - A Trace-Based Assurance Framework for Agentic AI Orchestration: Contracts, Testing, and Governance [0.22940141855172028]
本稿では,Large Language Models (LLM) を用いたエージェントAIシステムの保証フレームワークを提案する。
実行は、明示的なステップとトレースコントラクトを備えたメッセージ・アクション・トレース(MAT)として実装される。
このフレームワークは、有界摂動に対する予算付き反例探索として定式化されたストレステストを含む。
論文 参考訳(メタデータ) (2026-03-18T10:23:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。