論文の概要: Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- arxiv url: http://arxiv.org/abs/2607.02436v1
- Date: Thu, 02 Jul 2026 17:08:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.938525
- Title: Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- Title(参考訳): エージェントコード生成における第一級信頼度をツールアクセスではなく推論で取得する:観察的研究
- Abstract要約: 90の独立したエージェントが、1つの詳細な仕様から、リアルタイムのレトロスペクティブボードである同じアプリケーションを構築します。
実行は、いくつかのモデル世代、エージェントハーネス2つ、推論作業レベル2つ、テストツール1つ、設計指向のプロンプト2つにまたがった。
テストツールのコストは42~68%向上し、インターフェースの可視性も向上した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic coding assistants are increasingly given extra capabilities, such as browser based testing tools and design oriented system prompts, on the assumption that more capability yields better software. This study tested that assumption directly. Ninety independent agent runs built the same application, a real time retrospective board, from one detailed specification, each scored on a fixed 14 criterion functional rubric (42 point maximum) and a visual quality review. The runs spanned several model generations, two agent harnesses, two reasoning effort levels, a testing tool, and two design oriented prompts. Capability tier dominated: frontier models clustered near the ceiling while a low cost local model fell to 24 to 37 points. A criterion level analysis revealed what run totals conceal. Container deployment was the dominant defect, failing first try in 44 percent of runs, with its failure rate shifting sharply across model generations while mean totals moved less than a point. The testing tool raised cost by 42 to 68 percent without improving functional score or reliability, even on interface visible criteria. Raising reasoning effort from High to xHigh lifted first try perfect runs from 28 percent to 89 percent and cut corrective prompts about five fold, for 9 to 29 percent more cost. A design oriented prompt raised visual quality, 4.5 versus 3.0 on a 5 point scale, without lifting function, and a one paragraph paraphrase of its directive reproduced the entire lift. The practical lesson is to match the fix to the failure: most first run failures came from weak reasoning, which a stronger model or more effort prevents, not from visible flaws a checking tool would catch.
- Abstract(参考訳): エージェントコーディングアシスタントは、より多くの能力がより良いソフトウェアを生み出すという前提で、ブラウザベースのテストツールや設計指向のシステムプロンプトのような余分な能力がますます与えられている。
この研究は直接その仮定を検証した。
9人の独立したエージェントが、同じアプリケーション、リアルタイムのレトロスペクティブボードを1つの詳細な仕様から構築し、それぞれが固定された14の基準機能ルーリック(42ポイントの最大値)と視覚的品質レビューをスコア付けします。
実行は、いくつかのモデル世代、エージェントハーネス2つ、推論作業レベル2つ、テストツール1つ、設計指向のプロンプト2つにまたがった。
フロンティアモデルは天井付近に集結し、ローコストのローカルモデルは24から37ポイントまで低下した。
基準レベル分析により, 走行総量は隠蔽された。
コンテナのデプロイが主な欠陥であり、最初に44%のテストで失敗し、失敗率はモデル世代間で急激にシフトし、総数は1ポイント以下でした。
テストツールのコストは42~68%向上し、インターフェースの可視性も向上した。
HighからxHighへの推論の取り組みは、まず28%から99%まで、そして修正プロンプトを約5倍に減らし、9~29%のコスト削減を図った。
設計指向のプロンプトにより視覚的品質が向上し、リフト機能無しで4.5対3.0となり、指示文の1段落のパラフレーズがリフト全体を再現した。
ほとんどの最初の実行失敗は、より強力なモデルやもっと多くの労力が妨げられるような、弱い推論から発生し、チェックツールがキャッチするような目に見える欠陥によって防がれます。
関連論文リスト
- Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI [2.2616066835313253]
7つのカテゴリと3つの難易度で86のPicoCTF課題を実行し、3つのツールアクセスレジームと3つのモデル/クライアント構成で実行します。
既存のツール,エージェント・ビヘイビアの変更,11の新たな機能ツールに修正を適用し,これまで未経験だったトライアルを再実行します。
全体の解決率は55.4%から72.0%に上昇し、全ての構成が大幅に改善される。
論文 参考訳(メタデータ) (2026-07-03T02:20:04Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - SPOQ: Specialist Orchestrated Queuing for Multi-Agent Software Engineering [2.0769172070951067]
マルチエージェントAIシステムは、ソフトウェアエンジニアリングタスクの自動化を約束する。
既存のアプローチでは、調整のオーバーヘッド、品質管理のギャップ、人間の監視が制限されている。
SPOQ(Specialist Orchestrated Queuing)は,3つのイノベーションを組み合わせた方法論である。
論文 参考訳(メタデータ) (2026-06-02T03:59:56Z) - AgentAtlas: Beyond Outcome Leaderboards for LLM Agents [0.025718125188898048]
AgentAtlasは、診断語彙および監査プロトコルとしてのエージェント評価を再設定する。
i)6状態制御-決定分類(Act / Ask / Refuse / Stop / Confirm / Recover)、(ii)一次誤差源と下流衝撃を持つ軌道障害語彙、(iv)8つのモデルで評価された合成1,342-itemに関する実証的プロトコル研究。
論文 参考訳(メタデータ) (2026-05-19T22:05:12Z) - KWBench: Measuring Unprompted Problem Recognition in Knowledge Work [0.0]
KWBenchは、大規模言語モデルにおける未証明問題認識のベンチマークである。
解決しようとする前に、プロのシナリオを特定することができます。
これには、買収、契約交渉、臨床薬局、組織政治、詐欺分析、インセンティブデザインを含む223の業務が含まれている。
論文 参考訳(メタデータ) (2026-04-17T07:04:54Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - Capable but Unreliable: Canonical Path Deviation as a Causal Mechanism of Agent Failure in Long-Horizon Tasks [0.38991526486631006]
信頼性障害の多くは、タスクの潜在解構造からのドリフトに起因するものであり、能力障害ではない、と我々は主張する。
我々は、モデル能力と作業難易度を維持できる自然実験を用いて、これを因果的に確立する。
論文 参考訳(メタデータ) (2026-02-22T02:37:57Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Preference Optimization for Reasoning with Pseudo Feedback [100.62603571434167]
提案手法では,解のラベル付けを関連するテストケースに対する評価として行うことで,推論タスクに対する疑似フィードバックを生成する手法を提案する。
本研究では,擬似フィードバックを優先最適化に用いる数学的推論と符号化の両タスクについて実験を行い,両タスク間の改善を観察する。
論文 参考訳(メタデータ) (2024-11-25T12:44:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。