論文の概要: Prompt-Induced Waste in Coding Agents: Reasoning Structure, Tool Behavior, and End-to-End Cost
- arxiv url: http://arxiv.org/abs/2608.01347v2
- Date: Wed, 05 Aug 2026 05:05:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.077318
- Title: Prompt-Induced Waste in Coding Agents: Reasoning Structure, Tool Behavior, and End-to-End Cost
- Title(参考訳): コーディング剤中のプロンプト性廃棄物:構造, 工具挙動, エンド・ツー・エンドコスト
- Authors: Sarel Weinberger, Amir Hozez,
- Abstract要約: コーディングエージェントは単に命令を実行するのではなく、これらの命令のワード化によって、どれだけの作業が実行され、どの作業が実行されるか、その作業にどれだけのコストがかかるかが変わります。
本稿では,複数の推論モデル,2つの実コードエージェントハーネス,隠れ評価によるソフトウェアタスクの事前登録について述べる。
主な発見は、いくつかの一般的なプロンプトの習慣が、成功を改善することなく、かなりの余分な作業を生み出すことである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Coding agents do not simply execute instructions; the wording of those instructions changes how much work they perform, what kind of work they perform, and how much that work costs. We present a preregistered study across multiple reasoning models, two real coding-agent harnesses, and controlled software tasks with hidden evaluation. The main finding is that several common prompt habits create substantial extra work without improving success. Asking for multiple approaches causes agents to develop and discard several solution paths before implementing one. Telling them to think deeply mainly produces longer visible reasoning, while demanding maximum certainty encourages repeated checking, extra tests, additional turns, and longer execution. Misleading architectural hints can also push agents toward unsupported lines of investigation. By contrast, prompts that define scope, request the smallest sufficient change, and include a clear stopping rule preserve diagnosis and validation while avoiding unnecessary work. This shows that effective prompts are not merely shorter; they are better bounded. We further show that different kinds of waste propagate through different channels. Some remain mostly in reasoning, while others expand into tool use, latency, repeated testing, and context growth. The agent harness itself can matter even more than the prompt, because system instructions, turn structure, and tool policy strongly shape total cost. Overall, prompt design is an operational control over coding-agent behavior. Efficient agents require prompts that focus work, avoid unnecessary exploration, and stop once the task is complete.
- Abstract(参考訳): コーディングエージェントは単に命令を実行するのではなく、これらの命令のワード化によって、どれだけの作業が実行され、どの作業が実行されるか、その作業にどれだけのコストがかかるかが変わります。
本稿では,複数の推論モデル,2つの実コードエージェントハーネス,隠れ評価によるソフトウェアタスクの事前登録について述べる。
主な発見は、いくつかの一般的なプロンプトの習慣が、成功を改善することなく、かなりの余分な作業を生み出すことである。
複数のアプローチを求めると、エージェントはそれを実装する前にいくつかのソリューションパスを開発して破棄する。
深く考えるように指示することは、主に目に見える推論を長くし、最大の確実性を要求することは、繰り返しチェック、追加のテスト、追加のターン、実行を奨励します。
アーキテクチャ上のヒントを誤解することは、エージェントを無防備な捜査線へと押し上げることもできる。
対照的に、スコープを定義し、最小限の変更を要求するプロンプトや、不要な作業を避けながら診断と検証を明確な停止ルールを含む。
これは、効果的なプロンプトが単に短いだけでなく、バウンドが良いことを示している。
さらに, 異なる種類の廃棄物が異なる経路を伝播することを示す。
一部は推論に留まり、他のものはツールの使用、レイテンシ、繰り返しテスト、コンテキストの成長に拡大している。
エージェント自身は、システム命令、ターン構造、ツールポリシーが総コストを強く形作るため、プロンプト以上に重要である。
全体として、プロンプトデザインはコーディングエージェントの振る舞いを操作的に制御するものである。
効率的なエージェントは、作業に集中し、不要な探索を避け、タスクが完了したら停止するプロンプトを必要とする。
関連論文リスト
- The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - Rerank Before You Reason: Analyzing Reranking Tradeoffs through Effective Token Cost in Deep Search Agents [50.212640395029744]
深層探索パイプラインにおける推論予算の配分について検討する。
BrowseComp-Plusベンチマークを用いて、モデルスケール、推論の労力、深度の再検討、トークン総コストのトレードオフを分析する。
論文 参考訳(メタデータ) (2026-01-20T18:38:35Z) - CODE: A Contradiction-Based Deliberation Extension Framework for Overthinking Attacks on Retrieval-Augmented Generation [43.85448261466922]
我々はContradiction-Based Deliberation Extension (CODE) というエンドツーエンド攻撃フレームワークを提案する。
CODEは、知識ベースに注入される中毒サンプルを構築するためのマルチエージェントアーキテクチャを開発している。
実験の結果、CODEはタスク性能を劣化させることなく5.32x-24.72倍のトークン消費を発生させることが示された。
論文 参考訳(メタデータ) (2026-01-19T14:52:31Z) - Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning [11.179446105672461]
教師付き微調整と強化学習を組み合わせた多段階効率的な推論手法を提案する。
提案手法は,8Bモデルでは平均28%,32Bモデルでは40%の応答長を減少させる。
より複雑な最先端の効率的な推論手法に比べて、優れたトレードオフを実現する。
論文 参考訳(メタデータ) (2026-01-06T12:31:51Z) - Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time [22.9491443902816]
本研究では、推論軌跡の構造と、異なる認知行動と相関する特別な注意点を明らかにする。
テスト時間における認知推論ステアリングのトレーニング不要な方法であるCRESTを提案する。
CRESTは非生産的推論の振る舞いを適応的に抑制し、高い精度と低い計算コストをもたらす。
論文 参考訳(メタデータ) (2025-12-31T02:46:04Z) - Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning [46.106795445750855]
REFRAINはトレーニング不要のフレームワークで、理由付けをやめて過度に考えることを緩和する。
REFRAINは、標準的なCoTプロンプトと比較して、トークンの使用量を20~55%削減し、精度を維持または改善している。
論文 参考訳(メタデータ) (2025-10-11T08:30:00Z) - ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation [74.37307916314407]
提案するフレームワークはConciseHintと呼ばれ,推論モデルが簡潔に話すことを継続的に奨励する。
DeepSeek-R1 および Qwen-3 シリーズを含む最先端の LRM 実験により,本手法が簡潔な推論を効果的に生成できることが実証された。
論文 参考訳(メタデータ) (2025-06-23T16:20:44Z) - What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding [84.42056293290015]
推論モデルと非推論モデルの間のトークンレベルのミスアライメントを分析する。
本稿では,FoReaL-Decodingを提案する。
一般的な4つの数学推論ベンチマークにおいて、FoReaL-Decodingは理論FLOPを30から50%減らし、CoTの長さを最大40%減らした。
論文 参考訳(メタデータ) (2025-06-08T05:08:32Z) - The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models [54.88805865447848]
モデルが全体の効率を向上し,問題の難しさが効率に影響を及ぼすことを示す。
インストラクションモデルが簡単なアウトラインをドラフトし,思考モデルがそれを拡張する,シンプルな2段階パイプラインであるCOTHINKを提案する。
GSM8K、MATH500、AIME24では、COTHINKはトークンの使用量を21.1%削減し、4つの思考モデルの精度を維持し、強力な効率のベースラインと競争し続ける。
論文 参考訳(メタデータ) (2025-05-28T06:24:45Z) - SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning [14.020244011380063]
SpecReasonは、LEM推論を加速するシステムである。
最終回答の正確性を維持する上で、思考トークンのセマンティックな柔軟性を利用する。
バニラLEM推論よりも1.4-3.0times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-04-10T16:05:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。