論文の概要: The reach of a verification tool decides its value: A controlled study of verification surface, artifact quality, and cost in AI coding agents
- arxiv url: http://arxiv.org/abs/2608.28795v1
- Date: Fri, 28 Aug 2026 18:59:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.749539
- Title: The reach of a verification tool decides its value: A controlled study of verification surface, artifact quality, and cost in AI coding agents
- Title(参考訳): 検証ツールのリーチは、その価値を決定する:AIコーディングエージェントにおける検証表面、アーティファクト品質、コストの制御された研究
- Authors: Achint Mehta,
- Abstract要約: 本研究は, エージェントが出荷するソフトウェアの品質に一致する成長をもたらすのは, 表面のみである。
条件ブラインドされた人間は、すべてのアプリケーションを凍結したアーティファクトに対してグレードし、自動プローブは、API観測可能な振る舞いをストレステストした。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Modern artificial-intelligence coding agents can be equipped with tools for checking their own work e.g. a linter, a boot probe, a shell, a screenshot tool. We call this set the agent's verification surface. This study asks whether increasing only that surface, with everything else held fixed, produces a matching growth in the quality of the software the agent ships. We built a minimal coding agent whose tool list is the single controlled variable and used it to implement 1,116 web applications across six models and eight tool configurations. A condition-blind human graded every application against a frozen rubric, and automatic probes stress-tested the API-observable behaviors. Verification's cheapest benefit arrives first, which is to make sure that the application comes up. Without any tools, about one build in seven fails to launch at all and a single boot probe removes nearly all of these failures at roughly 35 percent of a full shell's token cost, while the full shell multiplies the no-tools cost by 2.35. Screenshots help most where mistakes are visible (e.g. element placement, interaction), though even there the gain over a shell is modest and does not survive correction for multiple statistical comparisons. In cases where failures can only be measured rather than seen, such as keeping scrolling smooth over a 100,000-row list, screenshots add nothing. A verification tool improves the output artifact only where its reach covers the way the application actually fails.
- Abstract(参考訳): 現代の人工知能コーディングエージェントには、linter、ブートプローブ、シェル、スクリーンショットツールなど、自身の作業をチェックするツールが備わっている。
これをエージェントの検証サーフェスと呼ぶ。
本研究は, エージェントが出荷するソフトウェアの品質に一致する成長をもたらすのは, 表面のみである。
ツールリストが単一の制御変数である最小限のコーディングエージェントを構築し、6つのモデルと8つのツール構成で1,116のWebアプリケーションを実装しました。
条件ブラインドされた人間は、すべてのアプリケーションを凍結したルーリックに対してグレードし、自動プローブはAPI観測可能な振る舞いをテストした。
検証の最も安いメリットは最初に届きます。
ツールがなければ7つに1つのビルドが失敗し、1つのブートプローブが全シェルのトークンコストの約35%でこれらの障害のほとんどを除去する一方、フルシェルはノーツールのコストを2.35に乗算する。
スクリーンショットは、誤りが見える場所(例えば、要素配置、相互作用)の多くに役立つが、シェルの利得は控えめであり、複数の統計的比較の補正に耐えられない。
10万の行リスト上でスクロールをスムーズに保つなど、失敗を目立たずに測定できる場合、スクリーンショットには何の役にも立たない。
検証ツールによって出力アーティファクトが改善されるのは、その到達範囲がアプリケーションの実際の障害方法をカバーする場合のみである。
関連論文リスト
- ADeptS-Bench: Measuring the Trustworthiness of Computer Use Agents Across Devices [48.36933831982682]
我々はADEPTS機能フレームワークを基盤とした信頼性ベンチマークであるADeptS-Benchを紹介する。
Safetyストリームは、視覚インターフェースに埋め込まれた脅威を伴うペアの良心/悪意のあるタスクを提供する。
曖昧さストリームは、意図が曖昧である場合、エージェントが明確化を求めるかどうかを評価する。
論文 参考訳(メタデータ) (2026-08-25T23:21:57Z) - When Does Restricting a Coding Agent to execute_code Help? A Regime $\times$ Agent-Design Ablation [20.672156968511587]
合成計算タスクとSWE-bench Mini修正タスクにおける3アームアブレーション(ベースライン/bash_only/code_only)の比較を行った。
結果として得られた4つの(登録、エージェント)細胞全体で、エージェントを1つの execute_code MCP ツールに制限することは、最も安価なツールリッチなライバルである -- あるいは統計的に結びついている -- よりも安価である。
唯一の例外はSWE-bench/Claudeである。
論文 参考訳(メタデータ) (2026-07-12T04:52:08Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents [64.59100414726556]
大規模言語モデル(LLM)エージェントは、コンテキスト、ツール、マルチターン実行を管理するハーネスに依存している。
Retrieval-augmented Tool selectionは、自然な代替手段を提供するが、既存のワンショット検索方法は、独立したツール記述とエージェントの真のタスク意図との整合に失敗する。
我々は、ユーザ意図、ツール機能、ツールコラボレーションパターンをリンクするインテントツーオールグラフを構築する、意図認識型のアクティブツール発見フレームワークであるSINGを提案する。
論文 参考訳(メタデータ) (2026-06-15T11:37:37Z) - LLM Agents Already Know When to Call Tools -- Even Without Reasoning [25.40369702634587]
LLMエージェントは、たとえモデルが直接答えられるとしても、ツールを無差別に呼び出す傾向がある。
ツールコールが実際に必要になった場合、既存のベンチマークは体系的に研究されない。
ツールの必要性の3つのカテゴリにまたがる18の環境のベンチマークである When2Tool を提案する。
論文 参考訳(メタデータ) (2026-05-10T01:37:40Z) - Beyond the Black Box: Interpretability of Agentic AI Tool Use [0.0]
本稿では,スパースオートエンコーダと線形プローブ上に構築された機械論的・解釈可能性ツールキットを提案する。
フレームワークは各アクションの前にモデル状態を読み出し、ツールが必要かどうか、そして次のツールアクションがいかに適切かの両方を推測する。
我々は、NVIDIA Nemotron関数呼び出しデータセットから多段階の軌道上のプローブをトレーニングし、GPT-OSS 20BとGemma 3 27Bモデルに同じワークフローを適用する。
論文 参考訳(メタデータ) (2026-05-07T19:47:30Z) - ProgramBench: Can Language Models Rebuild Programs From Scratch? [59.40748183470308]
ProgramBenchは、ソフトウェアエンジニアリングエージェントがソフトウェアをホリシックに開発する能力を測定する。
エンドツーエンドの動作テストはエージェント駆動ファジィによって生成される。
モデルは、人間が書いたコードと大きく異なるモノリシックでシングルファイルの実装を好む。
論文 参考訳(メタデータ) (2026-05-05T09:17:02Z) - Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents [0.8714519393367773]
符号化エージェントは、次のステップで各観察のごく一部だけであっても、長いツール観察を繰り返し消費する。
タスク条件付きツールアウトプットプルーニングについて検討する: 集中クエリと1つのツールアウトプットが与えられたら、エージェントが次に検査すべき最小の動詞のエビデンスを返します。
論文 参考訳(メタデータ) (2026-04-04T18:52:44Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。