論文の概要: Same Task, Different Work: Prompt-Induced Waste in Coding Agents
- arxiv url: http://arxiv.org/abs/2608.01347v3
- Date: Thu, 06 Aug 2026 05:54:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.611511
- Title: Same Task, Different Work: Prompt-Induced Waste in Coding Agents
- Title(参考訳): 同一課題, 異なる作業: コード剤中のプロンプト性廃棄物
- Abstract要約: 2つのプロンプトは、同じコード変更を要求して、同じ正しいパッチを生成することができるが、コーディングエージェントは、根本的に異なる種類の作業を実行する。
この効果を,4,644回の有効実行,24個の決定論的コーディングタスク,7つの推論モデル,および2つの実エージェントハーネスにまたがる事前登録されたベンチマークで検討した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Two prompts can request the same code change and produce the same correct patch, yet cause a coding agent to perform radically different kinds and amounts of work. We study this effect in a preregistered benchmark spanning 4,644 valid runs, 24 deterministic coding tasks, seven reasoning models, and two real agent harnesses. The central finding is that prompt wording does not merely scale total effort; it changes where that effort is spent. Multiple approaches and deep thinking primarily inflate reasoning. Multiple approaches increases reasoning by 2.4x to 7.4x across all six open models and creates about three elaborated but discarded solution branches, while still yielding only one implemented solution and no success gain. Maximum certainty activates a different pathway: repeated verification propagates into extra test runs, tool calls, turns, latency, and context growth. Runs with high redundant verification cost 18x the clean-run median, execute 2.5x more tool calls, and take 3x longer, again without a success gradient. These mechanisms therefore have distinct cost carriers: some prompts are reasoning-heavy and token-borne, while others are tool-heavy and system-borne. Harness design amplifies both effects and changes cost per successful task by 5x to 30x in our setting. The findings survive a frozen holdout, paraphrase tests, a Kimi-K3 replication, and a first-party Claude Sonnet 5 study. In contrast, bounded-efficiency wording preserves diagnosis and final validation while avoiding the measured waste mechanisms. Prompt engineering for coding agents is therefore work design: it determines what the agent thinks through, what it executes, and when it stops.
- Abstract(参考訳): 2つのプロンプトは、同じコード変更を要求して、同じ正しいパッチを生成することができるが、コーディングエージェントは、根本的に異なる種類の作業を実行する。
この効果を,4,644回の有効実行,24個の決定論的コーディングタスク,7つの推論モデル,および2つの実エージェントハーネスにまたがる事前登録されたベンチマークで検討した。
中心的な発見は、迅速な言葉遣いは、単に全労力をスケールするだけでなく、その労力がどこに費やされているかを変えることである。
複数のアプローチと深い思考は、主に推論を膨らませます。
複数のアプローチは、6つのオープンモデルすべてに対して2.4倍から7.4倍の推論を増加させ、3つの精巧だが破棄されたソリューションブランチを生成する一方で、実装されたソリューションは1つのみで、成功は得られない。
検証の繰り返しは、余分なテスト実行、ツールコール、ターン、レイテンシ、コンテキスト成長に伝播する。
高冗長な検証コストで18倍のクリーンラン中央値を実行し、2.5倍のツールコールを実行し、成功の勾配なしに3倍の時間を要する。
これらのメカニズムには異なるコスト担体があり、いくつかのプロンプトは推論重でトークン駆動であり、他のものはツール重でシステム駆動である。
ハーネス設計は、我々の設定において、成功タスク当たりの効果とコストを5倍から30倍に増幅します。
凍結したホールドアウト、パラフレーズテスト、Kim-K3複製、そして第1のClaude Sonnet 5研究が生き残った。
対照的に、有界効率の単語化は、測定された廃棄物のメカニズムを回避しつつ、診断と最終検証を保っている。
そのため、コーディングエージェントのプロンプトエンジニアリングは作業設計であり、エージェントが何を考えているか、何が実行され、いつ停止するかを決定する。
関連論文リスト
- Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation - Identity Adequacy and Evidence Adequacy [0.0]
本報告では,81回にまたがる147件の番号付インシデントに対して,生産エージェント型ソフトウェアデリバリプラットフォームが故障したことを報告する。
50-4連続して成功したツールコールのループには、エラーレートブレーカが見つからない。
メッセージではなくデリゲートを執行単位とする7つの信頼性プリミティブを導出します。
論文 参考訳(メタデータ) (2026-08-26T15:38:21Z) - Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data [4.191965713559235]
コーディングエージェントは、スコアに対してソフトウェアを改善するために、単独で残すことができます。
このパターンでは、エージェントはデータセット、評価スクリプト、編集可能な1つのファイルを受け取り、監督なしで反復する。
このループを実際の生産タスクで実行し、ノイズの多い音声認識書面にどのクラニック詩が現れるかを決定しました。
論文 参考訳(メタデータ) (2026-07-20T15:32:09Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents [0.05371337604556311]
タスク,環境,基本LPMが固定された場合でも,ソフトウェアエージェントハーネスがエージェントのマルチステップ信念を変えることができることを示す。
我々は,K段軌道の進行,リスク,回復可能性,制約,障害モード,不確実性,今後の成功,修理コスト,代替ハーネスの下での次の行動について,構造的K段軌道を付与する信念ロールアウト診断を導入する。
論文 参考訳(メタデータ) (2026-07-05T22:22:39Z) - SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks [55.76734816061826]
我々は20の問題と93のチェックポイントからなる言語に依存しないベンチマークであるSlopCodeBenchを紹介する。
我々は、冗長性、重複コードの割合、構造的侵食という2つの軌道レベルの品質信号を追跡する。
11モデルにまたがるエンドツーエンドの問題を解決するエージェントは存在しない。
論文 参考訳(メタデータ) (2026-03-25T19:26:44Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - Rerank Before You Reason: Analyzing Reranking Tradeoffs through Effective Token Cost in Deep Search Agents [50.212640395029744]
深層探索パイプラインにおける推論予算の配分について検討する。
BrowseComp-Plusベンチマークを用いて、モデルスケール、推論の労力、深度の再検討、トークン総コストのトレードオフを分析する。
論文 参考訳(メタデータ) (2026-01-20T18:38:35Z) - CODE: A Contradiction-Based Deliberation Extension Framework for Overthinking Attacks on Retrieval-Augmented Generation [43.85448261466922]
我々はContradiction-Based Deliberation Extension (CODE) というエンドツーエンド攻撃フレームワークを提案する。
CODEは、知識ベースに注入される中毒サンプルを構築するためのマルチエージェントアーキテクチャを開発している。
実験の結果、CODEはタスク性能を劣化させることなく5.32x-24.72倍のトークン消費を発生させることが示された。
論文 参考訳(メタデータ) (2026-01-19T14:52:31Z) - Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning [11.179446105672461]
教師付き微調整と強化学習を組み合わせた多段階効率的な推論手法を提案する。
提案手法は,8Bモデルでは平均28%,32Bモデルでは40%の応答長を減少させる。
より複雑な最先端の効率的な推論手法に比べて、優れたトレードオフを実現する。
論文 参考訳(メタデータ) (2026-01-06T12:31:51Z) - Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time [22.9491443902816]
本研究では、推論軌跡の構造と、異なる認知行動と相関する特別な注意点を明らかにする。
テスト時間における認知推論ステアリングのトレーニング不要な方法であるCRESTを提案する。
CRESTは非生産的推論の振る舞いを適応的に抑制し、高い精度と低い計算コストをもたらす。
論文 参考訳(メタデータ) (2025-12-31T02:46:04Z) - TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework [62.66056331998838]
TeaRAGは、検索内容と推論ステップの両方を圧縮できるトークン効率のエージェントRAGフレームワークである。
報奨関数は,過剰な推論ステップをペナルティ化しながら,知識マッチング機構によって知識満足度を評価する。
論文 参考訳(メタデータ) (2025-11-07T16:08:34Z) - Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning [46.106795445750855]
REFRAINはトレーニング不要のフレームワークで、理由付けをやめて過度に考えることを緩和する。
REFRAINは、標準的なCoTプロンプトと比較して、トークンの使用量を20~55%削減し、精度を維持または改善している。
論文 参考訳(メタデータ) (2025-10-11T08:30:00Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Abduct, Act, Predict: Scaffolding Causal Inference for Automated Failure Attribution in Multi-Agent Systems [20.846301581161978]
マルチエージェントシステムにおける障害帰属は、批判的だが未解決の課題である。
現在の手法では、これを長い会話ログ上のパターン認識タスクとして扱う。
A2P Scaffoldingは、パターン認識から構造化因果推論タスクへの障害帰属を変換する。
論文 参考訳(メタデータ) (2025-09-12T16:51:15Z) - ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation [74.37307916314407]
提案するフレームワークはConciseHintと呼ばれ,推論モデルが簡潔に話すことを継続的に奨励する。
DeepSeek-R1 および Qwen-3 シリーズを含む最先端の LRM 実験により,本手法が簡潔な推論を効果的に生成できることが実証された。
論文 参考訳(メタデータ) (2025-06-23T16:20:44Z) - What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding [84.42056293290015]
推論モデルと非推論モデルの間のトークンレベルのミスアライメントを分析する。
本稿では,FoReaL-Decodingを提案する。
一般的な4つの数学推論ベンチマークにおいて、FoReaL-Decodingは理論FLOPを30から50%減らし、CoTの長さを最大40%減らした。
論文 参考訳(メタデータ) (2025-06-08T05:08:32Z) - The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models [54.88805865447848]
モデルが全体の効率を向上し,問題の難しさが効率に影響を及ぼすことを示す。
インストラクションモデルが簡単なアウトラインをドラフトし,思考モデルがそれを拡張する,シンプルな2段階パイプラインであるCOTHINKを提案する。
GSM8K、MATH500、AIME24では、COTHINKはトークンの使用量を21.1%削減し、4つの思考モデルの精度を維持し、強力な効率のベースラインと競争し続ける。
論文 参考訳(メタデータ) (2025-05-28T06:24:45Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z) - Adversarial Reasoning for Repair Based on Inferred Program Intent [12.923634025700826]
本稿では,批判的・敵対的推論に基づくAdverIntent-Agentという手法を提案する。
当社のアプローチは、複数のAPRパッチの生成から、複数の潜在的プログラム意図の推測に焦点を移すという斬新なアプローチです。
AdverIntent-AgentはDefects4J 2.0とHumanEval-Javaの2つのベンチマークで評価された。
論文 参考訳(メタデータ) (2025-05-19T11:51:56Z) - SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning [14.020244011380063]
SpecReasonは、LEM推論を加速するシステムである。
最終回答の正確性を維持する上で、思考トークンのセマンティックな柔軟性を利用する。
バニラLEM推論よりも1.4-3.0times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-04-10T16:05:19Z) - When Disagreements Elicit Robustness: Investigating Self-Repair Capabilities under LLM Multi-Agent Disagreements [56.29265568399648]
我々は、不一致が早期のコンセンサスを防ぎ、探索されたソリューション空間を拡張することを主張する。
タスククリティカルなステップの相違は、ソリューションパスのトポロジによってコラボレーションを損なう可能性がある。
論文 参考訳(メタデータ) (2025-02-21T02:24:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。