論文の概要: TokenCast: Forecasting Token Consumption During LLM Agent Execution
- arxiv url: http://arxiv.org/abs/2609.35760v2
- Date: Tue, 29 Sep 2026 10:45:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.843886
- Title: TokenCast: Forecasting Token Consumption During LLM Agent Execution
- Title(参考訳): TokenCast: LLMエージェント実行中のToken消費予測
- Abstract要約: TokenCastは、実行セグメントごとに構成可能なコスト表現を学び、独自の消費と導入するコンテキスト成長を記録します。
オフラインの予算管理リプレイでは、TokenCastは、一致したトレース完了時の固定予算ポリシーよりも平均21.3%少ないトークンを使用する。
- 参考スコア(独自算出の注目度): 18.139769061341195
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When a large language model (LLM) agent executes the same task, token consumption can vary by over an order of magnitude across runs. The agent chooses its next steps based on tool feedback and intermediate results, while the growing context steadily inflates the input size of every subsequent call. The total consumption of a task is therefore hard to predict before execution and the prediction must be revised as the run unfolds. In this paper, we propose TokenCast, which learns a composable cost representation for each execution segment, recording its own consumption and the context growth it introduces. Composing adjacent segments yields a cumulative estimate that captures the extra input cost incurred when context from earlier segments is re-read by every later call. As execution unfolds, newly observed evidence refreshes the forecast, requiring no additional LLM calls and incurring a mean cumulative prediction time of 32.8 ms per run on SWE-bench Verified. Across 4 task suites and 6 agent models, TokenCast's mean absolute error reduction against the strongest comparator averages 14.5% over 96 evaluated combinations. In offline budget-control replay, TokenCast uses 21.3% fewer tokens on average than a fixed-budget policy at matched trace completion. The code is available at https://github.com/DEFENSE-SEU/TokenCast.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントが同じタスクを実行すると、トークンの消費はラン毎に桁違いに変化する。
エージェントはツールのフィードバックと中間結果に基づいて次のステップを選択する。
したがって、タスクの総消費は実行前に予測することが難しく、実行が展開するにつれて予測を修正しなければなりません。
本稿では,TokenCastを提案する。このTokenCastは,実行セグメントごとに構成可能なコスト表現を学習し,その利用状況とそれを紹介する。
隣接セグメントを構成することで累積推定値が得られ、後続の呼び出し毎に前のセグメントからのコンテキストが再読み込まれるときに発生する追加の入力コストをキャプチャする。
実行が拡大するにつれて、新たに観察された証拠は予測を更新し、追加のLCM呼び出しを必要とせず、SWE-bench Verified上で1ラン当たり平均累積予測時間32.8msを発生させる。
4つのタスクスイートと6つのエージェントモデルにまたがって、TokenCastの最大のコンパレータ平均に対する平均的な絶対誤差削減は、96の組合せを14.5%上回った。
オフラインの予算管理リプレイでは、TokenCastは、一致したトレース完了時の固定予算ポリシーよりも平均21.3%少ないトークンを使用する。
コードはhttps://github.com/DEFENSE-SEU/TokenCast.comで公開されている。
関連論文リスト
- Total Cost of Agency: Exact Attribution of Memory Injection Cost in Multi-Agent LLM Workflows [0.8770825039504507]
マルチエージェントワークフローのコストをプロンプト、推論、メモリインジェクション、ミスペナルティ、コンテキスト蓄積コンポーネントに分解する。
ワードカウントプロキシからトークンを推定するのではなく、直接トークンを注入する。
論文 参考訳(メタデータ) (2026-09-20T18:23:47Z) - Deadline-Aware Adaptive Prefill Chunking for Efficient Large Language Model Serving [11.307452536192125]
継続はスループットを提供する大きな言語モデル(LLM)を改善するが、長いプロンプトプリフィルはデコードイテレーションを遅延させ、トークン間の遅延目標に違反する可能性がある。
SLOWeaveは,最初期のアクティブデコード期限前に終了すると予想される最大のプリフィルチャンクを選択するオンラインスケジューリング手法である。
私たちは、デコードのみのイテレーションが実現可能で、コストのイテレーションが正確であればいつでも、SLOWeaveは、すべてのアクティブリクエストの次の完了期限を保存する決定の即時準備の進捗を最大化します。
論文 参考訳(メタデータ) (2026-09-07T18:47:57Z) - Parsing the Stream: A Live Trace Model for Long-Horizon Agents and Their Observers [4.008486665405814]
ロングホライゾンエージェントのトレースは、実行を監視している人間のオブザーバとエージェント自体の両方のコンシューマをオーバーホールする。
我々は、ライブトレースモデル、追加のみのイベント台帳を型付けされた実行状態に段階的に折り畳み、両方のコンシューマに対して評価する。
LLMリーダをプロキシとして評価したオブザーバ側では、コンパイルされたビューは、約14倍、15倍少ない入力トークンを使用して、質問に回答する。
論文 参考訳(メタデータ) (2026-09-01T16:03:54Z) - Prediction-Assisted Pricing and Admission for LLM APIs with Stochastic Token Consumption [0.0]
LLMアプリケーションは、複数のサービス製品を販売したり、内部的に割り当てたりすることが多い。
価格が購入確率を変更し、トークンキャップがユーザ値とリソース消費のテールの両方を変更する。
オンラインの信頼区間とオフラインの予測区間を交差する予測クラッピング UCB を提案する。
論文 参考訳(メタデータ) (2026-09-01T04:40:34Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - Preventing Premature Commitment in Coding Agents with an Evidence-Conditioned Execution Layer [38.62073085926841]
LLMベースのコーディングエージェントはソースコードを編集したり、変更を正当化するための十分なリポジトリ証拠を調べる前にパッチを提出する。
我々は、エビデンス条件付き実行を実行するために、エージェントとレポジトリの間を介在する実行層であるECLoopを提案する。
論文 参考訳(メタデータ) (2026-07-30T20:16:35Z) - LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference [63.932718076408584]
LASTは、エッジクラウド協調MLLM推論におけるクエリ依存のビジュアルトークンプルーニングのための、トレーニング不要のフレームワークである。
完全な精度の95.4%を維持し、視覚トークンの12.5%しか保持せず、エッジ側の選択オーバーヘッドは低く、クラウド側の計算は少ない。
論文 参考訳(メタデータ) (2026-07-30T09:59:25Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Think before you speak: Training Language Models With Pause Tokens [73.61375226378712]
言語モデルは、即座に連続して一連のトークンを生成して応答を生成する。
代わりに、$(K+1)th$トークンを出力する前に、モデルに$K+10$隠れベクターを操作させるとしたらどうでしょう?
私たちは、(学習可能な)$textitpause$トークンを使って、言語モデルでトレーニングと推論を行うことで、このアイデアを運用します。
論文 参考訳(メタデータ) (2023-10-03T17:32:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。