論文の概要: Token Reduction Is Not Cost Reduction
- arxiv url: http://arxiv.org/abs/2607.12161v1
- Date: Mon, 13 Jul 2026 21:10:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.966919
- Title: Token Reduction Is Not Cost Reduction
- Title(参考訳): トークン削減はコスト削減ではない
- Abstract要約: キャッシュの作成と読み込みは、再建された4コンポーネントのコストの約87%、実際の請求書の約80%を占めていた。
ツール出力の削減は、請求コストの削減を確実に予測しなかった。
本稿では,トークンの削減よりも成功調整請求コストを基準とした階層化エビデンスを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Context-reduction layers for API-based coding agents, including command-output compressors, retrieval rankers, and payload-optimizing proxies, are usually evaluated by how much text they remove. We ask instead: when does reducing retrieved context or tool output lower the actual billed cost of a coding agent without reducing task success or lengthening its trajectory? Our primary evidence is a pre-specified, hash-frozen, paired campaign of 2,908 provider-billed Claude Code runs, of which 2,848 were analyzed, covering 103 tasks, seven repositories, and three models. The campaign compared a baseline with two generations of hook-based compression and an API-boundary proxy, within a broader measured program of roughly 5,500 billed executions. Three findings emerge. First, prompt-cache traffic dominated cost composition. Cache creation and reads accounted for about 87% of reconstructed four-component cost, or about 80% of the actual bill, with an 8.7% dollar-weighted residual that retained telemetry could not attribute. On Haiku 4.5, this residual scaled with thinking effort. Second, tool-output reduction did not reliably predict billed-cost reduction. An arm that removed 38% of estimated raw tool-output tokens had 6.8% higher paired cost (95% CI: +2.8% to +11.3%), while per-task reduction was only weakly associated with cost change (Pearson r = 0.15, CI crossing zero). Third, compression can harm task completion by removing action-critical evidence. In a small single-shot study on SWE-bench-derived Go tasks, compression reduced patch application from 27/40 to 15/40 by corrupting verbatim edit anchors, and the compressed grounded arm produced fewer solves at higher observed cost per solve. We propose a layered evidence standard centered on success-adjusted billed cost rather than token reduction alone.
- Abstract(参考訳): コマンド出力圧縮器、検索ローダ、ペイロード最適化プロキシなど、APIベースのコーディングエージェントのコンテキスト推論レイヤは通常、削除するテキスト量によって評価される。
代わりに、検索したコンテキストやツールのアウトプットを減らすことで、タスクの成功を減らしたり、軌道を延長したりすることなく、実際の請求コストを下げることができますか?
我々の主要な証拠は、事前に特定され、ハッシュフリーズで、2,908人の提供者によるClaude Codeランニングのペアキャンペーンであり、そのうち2,848人が分析され、103のタスク、7つのリポジトリ、3つのモデルがカバーされた。
このキャンペーンは、ベースラインを2世代にわたるフックベースの圧縮とAPIバウンダリプロキシと比較した。
3つの発見がある。
第一に、急速キャッシュのトラフィックがコスト構成を支配した。
キャッシュの作成と読み取りは、再建された4成分のコストの約87%、または実際の法案の約80%を占め、テレメトリを保持することができない8.7%のドル重みが残っていた。
俳句4.5では、この残余は思考の努力によって拡大した。
第二に、ツール出力の削減は請求コストの削減を確実に予測しなかった。
推定された生ツール出力トークンの38%を除去したアームは、ペアコストが6.8%高く(95% CI:+2.8%から+11.3%)、一方、タスク単位の削減はコスト変更と弱い関係しか持たなかった(ピアソンr = 0.15、CI交差ゼロ)。
第三に、圧縮は行動クリティカルな証拠を取り除くことでタスクの完了を損なう可能性がある。
SWEベンチ由来のGoタスクに関する小さな単発的な研究では、バータティム編集アンカーを破損させることにより、圧縮されたパッチ適用を27/40から15/40に減らし、圧縮された接地アームは、より高いコストで、より少ない解を生成する。
トークンの削減のみではなく、成功調整の請求コストを基準とした階層化エビデンスを提案する。
関連論文リスト
- State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning [15.652256738395018]
大きな推論モデルは、長いチェーン・オブ・ソート(CoT)推論を通じて複雑なタスクに優れる。
KV-cache圧縮は一般的なソリューションであるが、既存の推論指向のメソッドは、キャッシュから削除したものによってのみ圧縮を判断する。
軽量プロセス逆推定器が各完了ステップをスコアし、3つのコンポーネントを駆動するフレームワークであるReCoを提案する。
論文 参考訳(メタデータ) (2026-08-05T12:36:28Z) - Control Under Compression: Reliability Frontiers for Tool-Using Agents [0.0]
ACC圧縮のための環境検証ベンチマークであるCompressAgentを紹介する。
75%の保持状況では、汎用的な書き換えとセクションベースの圧縮が92.7%、92.4%の成功を収めている。
25%から10%の継続コンテキスト予算では、実行可能なプロトコルは脆弱になる。
論文 参考訳(メタデータ) (2026-08-02T07:43:44Z) - Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs [0.5352699766206807]
単発モノレポの連続28日間における単発非ランダム化縦断ケーススタディについて検討した。
即時キャッシュ(99.3%のヒット率)がAPIのコストを88.6%削減し、有効な0.57%のトークンが得られた。
論文 参考訳(メタデータ) (2026-07-13T07:04:49Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - VisualClaw: A Real-Time, Personalized Agent for the Physical World [76.89211120690028]
2つの原則に基づいて構築された自己進化型マルチモーダルエージェントであるVisualClawを紹介する。
第一に、ハイブリッド符号化は、情報の少ないストリーミングフレームをカスケードゲートでフィルタリングすることにより、デプロイメントコストを低減する。
第二に、スキルの進化により、エージェントは失敗から学び、将来の質問に役立つスキルバンク更新を生成する。
論文 参考訳(メタデータ) (2026-06-15T06:58:22Z) - Token Budgets: An Empirical Catalog of 63 LLM-Agent Budget-Overrun Incidents, with an Affine-Typed Rust Mitigation as a Case Study [0.0]
私たちは、アフィンのオーナシップを運用するRustクレートを構築して、クローン、ダブルスペンディング、あるいは予算の使用を委譲することで、オペレータが避けなければならないランタイムのハザードではなくコンパイルエラーを発生させます。
5つのランタイム、3つのプロバイダ、温度階層化されたライブAPIテストで、このアプローチでは、コンカレントワークと同等の動作で、キャップ違反がゼロで、偽の拒否がゼロであることを報告している。
論文 参考訳(メタデータ) (2026-06-02T10:46:57Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models [9.374717320061988]
Carbon-Taxed Transformers (CTT) は、マルチアーキテクチャ圧縮方式のパイプラインオーダである。
CTTは、アーキテクチャ上の非効率性を罰し、デプロイ対応圧縮に報いる計算炭素税を運用している。
その結果, 1) 最大49倍のメモリ削減, (2) クローン検出に最大8~10倍の時間短縮, 要約に最大3倍の時間短縮, 生成に4~7倍の時間短縮が得られた。
論文 参考訳(メタデータ) (2026-04-28T17:48:16Z) - ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation [9.992155237142306]
ClawTraceは、エージェントセッション中にすべてのLCMコール、ツール使用、サブエージェントスレーブを記録するエージェントトレースプラットフォームである。
CostCraftは、TraceCardsを読み出し、3種類のスキルパッチを生成する蒸留パイプラインである。
コスト属性とプルーパッチの両方が独立に品質の低下を減少させることを示す。
論文 参考訳(メタデータ) (2026-04-26T19:44:10Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - Prompt Compression in Production Task Orchestration: A Pre-Registered Randomized Trial [0.05586191108738562]
即時圧縮の経済性は、入力トークンの削減だけでなく、圧縮が出力長をどのように変化させるかにも依存する。
実運用マルチエージェントタスクオーケストレーションにおける即時圧縮を予め登録した6腕ランダム化制御試行において,これを評価した。
論文 参考訳(メタデータ) (2026-03-06T21:47:34Z) - AgentCompress: Task-Aware Compression for Affordable Large Language Model Agents [0.0]
70ビリオンパラメータモデルを使用した1セッションは、クラウドコンピューティングの料金が約127ドルである。
本稿では,タスク認識型動的圧縮によってこの問題に対処するフレームワークであるAgentCompressを提案する。
計算コストは68.3%減少し、当初の成功率の96.2%を維持した。
論文 参考訳(メタデータ) (2026-01-08T18:13:46Z) - VeriThinker: Learning to Verify Makes Reasoning Model Efficient [52.74493506816969]
大型推論モデルは、Chain-of-Thought (CoT)推論を用いて複雑なタスクで優れている。
過度に考える傾向は、必然的に長い推論連鎖に繋がる。
我々は,CoT圧縮の新しい手法であるVeriThinkerを紹介する。
論文 参考訳(メタデータ) (2025-05-23T14:17:56Z) - Task-Circuit Quantization: Leveraging Knowledge Localization and Interpretability for Compression [55.323397702682506]
後トレーニング量子化(PTQ)は、コストのかかる再トレーニングなしに全精度重みを低ビット重みにマッピングすることで、モデルのメモリフットプリントを削減する。
我々は,自動回路発見に並列性を持つ新しい混合精度PTQ手法であるTask-Circuit Quantization (TaCQ)を開発した。
論文 参考訳(メタデータ) (2025-04-10T02:19:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。