論文の概要: Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents
- arxiv url: http://arxiv.org/abs/2608.01347v1
- Date: Sun, 02 Aug 2026 16:10:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.171137
- Title: Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents
- Title(参考訳): 大規模共振モデルにおけるプロンプト誘起廃棄物--符号化剤の2つのハーネスベンチマーク-
- Abstract要約: 大規模な推論モデルは、検討、ツールコール、繰り返しエージェントターンからコストを発生させる。
提案手法は,6つの大推論モデル,2つの実エージェントハーネス,24個の決定論的符号化タスクに隠れ評価器を用いたベンチマークを示す。
素早い定式化は、正確性を改善することなく、推論コストを乗じることができる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large reasoning models used as coding agents incur costs from deliberation, tool calls, and repeated agent turns, yet the causal effect of prompt wording on this spend has not been measured systematically. We present a preregistered benchmark across six large reasoning models, two real agent harnesses, and 24 deterministic coding tasks with hidden evaluators. Across 4,643 valid runs, including screening, stress, holdout, replication, and cross-provider studies, we find that prompt formulation can multiply reasoning cost without improving correctness. Asking the model to develop and compare several approaches is the most consistently wasteful instruction, increasing reasoning tokens by 2.4-7.4x across all models. Generic "think deeply" cues also increase deliberation by 1.6-2.2x, while a bounded-efficiency template specifying scope, acceptance criteria, and a stop condition is cost-neutral and can halve reasoning. Harness choice matters even more: identical model-task-prompt triples cost 5-30x more per success under Claude Code than under pi, mainly because of larger static prefixes and more turns. Misleading architectural hints are far costlier than irrelevant prose, and provider-side caching reduces billed cost without changing behavior, so it must not be treated as efficiency. Replications on Kimi-K3 and Claude Sonnet 5 preserve the main effect directions while revealing model-specific sensitivity to thinking and certainty cues. Overall, prompt wording and harness design materially affect agent cost, often with no gain in task success.
- Abstract(参考訳): コーディングエージェントとして使用される大きな推論モデルは、検討、ツールコール、繰り返しエージェントターンからコストを発生させるが、この使用量に対する即発的な言葉遣いの因果効果は、体系的に測定されていない。
我々は,6つの大推論モデル,2つの実エージェントハーネス,24個の決定論的符号化タスクを対象とした事前登録ベンチマークを示す。
スクリーニング, ストレス, ホールドアウト, 複製, クロスプロジェクタなど4,643回にわたる有効実行の結果, 迅速な定式化は, 正確性を向上することなく, 推論コストを乗算できることが判明した。
モデルにいくつかのアプローチを開発し比較するよう求めることは最もムダな命令であり、全てのモデルで2.4-7.4倍の推論トークンが増加する。
ジェネリックの「深く考える」手がかりは1.6-2.2xの熟考も増加し、スコープ、受け入れ基準、停止条件を指定する有界効率テンプレートはコスト中立であり、推論を半減させる。
同一のモデル・タスク・プロンプト・トリプルはClaude Codeの下では、pi以下の場合よりも5-30倍のコストがかかる。
誤解を招くアーキテクチャヒントは、無関係な散文よりもはるかにコストがかかり、プロバイダ側のキャッシュは、振る舞いを変えることなく請求されたコストを削減するので、効率性として扱うべきではない。
Kimi-K3 と Claude Sonnet 5 の複製は、思考と確実性へのモデル特異的感受性を明らかにしながら、主な効果方向を保っている。
全体として、迅速な語句作成と使用はエージェントコストに大きく影響し、多くの場合、タスクの成功は得られない。
関連論文リスト
- The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - Rerank Before You Reason: Analyzing Reranking Tradeoffs through Effective Token Cost in Deep Search Agents [50.212640395029744]
深層探索パイプラインにおける推論予算の配分について検討する。
BrowseComp-Plusベンチマークを用いて、モデルスケール、推論の労力、深度の再検討、トークン総コストのトレードオフを分析する。
論文 参考訳(メタデータ) (2026-01-20T18:38:35Z) - CODE: A Contradiction-Based Deliberation Extension Framework for Overthinking Attacks on Retrieval-Augmented Generation [43.85448261466922]
我々はContradiction-Based Deliberation Extension (CODE) というエンドツーエンド攻撃フレームワークを提案する。
CODEは、知識ベースに注入される中毒サンプルを構築するためのマルチエージェントアーキテクチャを開発している。
実験の結果、CODEはタスク性能を劣化させることなく5.32x-24.72倍のトークン消費を発生させることが示された。
論文 参考訳(メタデータ) (2026-01-19T14:52:31Z) - Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning [11.179446105672461]
教師付き微調整と強化学習を組み合わせた多段階効率的な推論手法を提案する。
提案手法は,8Bモデルでは平均28%,32Bモデルでは40%の応答長を減少させる。
より複雑な最先端の効率的な推論手法に比べて、優れたトレードオフを実現する。
論文 参考訳(メタデータ) (2026-01-06T12:31:51Z) - Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time [22.9491443902816]
本研究では、推論軌跡の構造と、異なる認知行動と相関する特別な注意点を明らかにする。
テスト時間における認知推論ステアリングのトレーニング不要な方法であるCRESTを提案する。
CRESTは非生産的推論の振る舞いを適応的に抑制し、高い精度と低い計算コストをもたらす。
論文 参考訳(メタデータ) (2025-12-31T02:46:04Z) - Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning [46.106795445750855]
REFRAINはトレーニング不要のフレームワークで、理由付けをやめて過度に考えることを緩和する。
REFRAINは、標準的なCoTプロンプトと比較して、トークンの使用量を20~55%削減し、精度を維持または改善している。
論文 参考訳(メタデータ) (2025-10-11T08:30:00Z) - ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation [74.37307916314407]
提案するフレームワークはConciseHintと呼ばれ,推論モデルが簡潔に話すことを継続的に奨励する。
DeepSeek-R1 および Qwen-3 シリーズを含む最先端の LRM 実験により,本手法が簡潔な推論を効果的に生成できることが実証された。
論文 参考訳(メタデータ) (2025-06-23T16:20:44Z) - What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding [84.42056293290015]
推論モデルと非推論モデルの間のトークンレベルのミスアライメントを分析する。
本稿では,FoReaL-Decodingを提案する。
一般的な4つの数学推論ベンチマークにおいて、FoReaL-Decodingは理論FLOPを30から50%減らし、CoTの長さを最大40%減らした。
論文 参考訳(メタデータ) (2025-06-08T05:08:32Z) - The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models [54.88805865447848]
モデルが全体の効率を向上し,問題の難しさが効率に影響を及ぼすことを示す。
インストラクションモデルが簡単なアウトラインをドラフトし,思考モデルがそれを拡張する,シンプルな2段階パイプラインであるCOTHINKを提案する。
GSM8K、MATH500、AIME24では、COTHINKはトークンの使用量を21.1%削減し、4つの思考モデルの精度を維持し、強力な効率のベースラインと競争し続ける。
論文 参考訳(メタデータ) (2025-05-28T06:24:45Z) - SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning [14.020244011380063]
SpecReasonは、LEM推論を加速するシステムである。
最終回答の正確性を維持する上で、思考トークンのセマンティックな柔軟性を利用する。
バニラLEM推論よりも1.4-3.0times$のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-04-10T16:05:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。