論文の概要: Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks
- arxiv url: http://arxiv.org/abs/2608.25399v1
- Date: Wed, 26 Aug 2026 05:58:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.609178
- Title: Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks
- Title(参考訳): あなたのAIエージェントは安くできるのか?エージェントコーディングタスクにおけるトークン使用量に対するタスク仕様の影響を調べる
- Authors: Jakub Smékal,
- Abstract要約: 我々は,3つの思考活動において,異なるタスク仕様がK3モデルを用いたエージェントトークン支出に与える影響について検討した。
完全なタスク仕様を裸のユーザストーリーにすると、トークンの費用が29.7%上昇するのに対して、実行時から実行時までの分散は、迅速な変更の影響を受けないままである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agentic coding workflows are now widely deployed in real-world systems. With long-horizon reasoning and tool use, token usage has become an important consideration for both cost and efficiency. Two engineers using AI will solve the same problem differently. How the specification of a task shapes an agent's token spend, and whether that spend can be predicted in advance, are open questions. Here, we study the effects of different task specifications on agentic token spend with the Kimi K3 model at three thinking efforts. Across $2,700$ runs, we show that reducing a full task specification to a bare user story raises token spend by $29.7\%$, while run-to-run variance remains unaffected by any prompt changes. We show that prompt-sensitivity is task-dependent, running from $13\%$ to $115\%$. We fit a simple predictor that can price a full distribution of task specifications and thinking effort configurations from a single cheap probe on an unseen task within $36\%$, improving over prior work in predicting token spend. Our work provides initial results quantifying the effects of task specification on agentic token spend and introduces a method that can be used to systematically evaluate the cost of AI coding workflows.
- Abstract(参考訳): エージェントコーディングワークフローは現在、現実世界のシステムに広くデプロイされている。
長期の推論とツールの使用により、トークンの使用はコストと効率の両方において重要な考慮事項となっている。
AIを使用している2人のエンジニアは同じ問題を解決します。
タスクの仕様がエージェントのトークンの支出をどのように形成し、その費用を事前に予測できるかは、オープンな質問である。
本稿では,3つの思考活動において,異なるタスク仕様がK3モデルを用いたエージェントトークン支出に与える影響について検討する。
2700ドルを突破すると、完全なタスク仕様を素のユーザストーリーにすると、トークンの支出が29.7セントになるが、実行時から実行時までの分散は、急激な変更の影響を受けない。
我々は、プロンプト感度がタスク依存であることを示し、13\%$から15\%$まで実行している。
私たちは、未確認のタスクに対する1つの安価なプローブから、タスク仕様の完全な分布と思考の労力構成を36セント以内で設定できるシンプルな予測器を適合させ、トークンの支出を予測する前の作業よりも改善します。
我々の研究は,タスク仕様がエージェントトークン支出に与える影響を定量化し,AIコーディングワークフローのコストを体系的に評価する手法を提案する。
関連論文リスト
- Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution [1.733151600403503]
大規模言語モデル(LLM)エージェントは、ますます多段階のエンジニアリングと情報処理を自動化する。
彼らはしばしば、最大コンテキストファーストの戦略に従い、ファイルや依存関係を読み取り、一行の編集を小さなコードベースの監査に切り替える。
タスク対応型実行-スコープ推定の欠如を論じる。
論文 参考訳(メタデータ) (2026-07-14T17:59:31Z) - Not All Errors Are Equal: Consequence-Aware Reasoning Compute Allocation [5.523004155648451]
本稿では,結果認識型テスト時間計算アロケーションを提案する。
我々はSWE-bench Liteの実験を行い、Multi-SWE-bench mini上でのクロスデータセット動作を評価する。
論文 参考訳(メタデータ) (2026-06-03T03:29:57Z) - How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks [40.99169244450745]
本稿では,エージェントプログラミングタスクにおけるトークン消費パターンに関する最初の体系的研究について述べる。
タスク実行前に、モデルが自身のトークンコストを予測する能力を評価する。
我々の研究は、AIエージェントの経済性に関する新たな洞察を提供し、将来の研究を刺激することができる。
論文 参考訳(メタデータ) (2026-04-24T17:54:47Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z) - Algorithm Design for Continual Learning in IoT Networks [16.35495567193046]
連続学習(CL)は、異なるタスクから連続的に生成されたストリーミングデータに対する新しいオンライン学習技術である。
実用的なIoTネットワークでは、データをサンプリングしてさまざまなタスクを学習する自動運転車は、タスクパターンの順序をルーティングし変更することができる。
論文 参考訳(メタデータ) (2024-12-22T02:36:09Z) - Label Budget Allocation in Multi-Task Learning [61.12008399759143]
マルチタスク学習では、関連するタスクが互いに情報を提供し、全体的なパフォーマンスを改善する。
最適なマルチタスクパフォーマンスを実現するために,ラベル予算をさまざまなタスクに割り当てるには,どうすればよいのか?
我々は,マルチタスク学習において,ラベル予算配分問題を初めて提案し,正式に定義する。
論文 参考訳(メタデータ) (2023-08-24T17:38:14Z) - Efficient Controllable Multi-Task Architectures [85.76598445904374]
本稿では,共有エンコーダとタスク固有デコーダからなるマルチタスクモデルを提案する。
我々のキーとなる考え方は、タスク固有のデコーダの容量を変化させ、計算コストの総和を制御し、タスクの重要度を制御することである。
これにより、与えられた予算に対してより強力なエンコーダを許可し、計算コストの制御を高め、高品質のスリム化サブアーキテクチャを提供することにより、全体的な精度を向上させる。
論文 参考訳(メタデータ) (2023-08-22T19:09:56Z) - FAMO: Fast Adaptive Multitask Optimization [48.59232177073481]
本稿では,動的重み付け手法であるFast Adaptive Multitask Optimization FAMOを導入する。
この結果から,FAMOは最先端の勾配操作技術に匹敵する,あるいは優れた性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2023-06-06T15:39:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。