論文の概要: Token Reduction Is Not Cost Reduction
- arxiv url: http://arxiv.org/abs/2607.12161v2
- Date: Wed, 15 Jul 2026 08:42:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 12:21:59.512677
- Title: Token Reduction Is Not Cost Reduction
- Title(参考訳): トークン削減はコスト削減ではない
- Abstract要約: 再建した4成分の約87%に占めるコスト構成は,急激なキャッシュトラフィックが支配的であった。
ローカルペイロードの削減は、エンドツーエンドの請求コストの信頼できる予測器ではなかった。
本稿では,トークンの削減のみではなく,成功調整請求コストによる文脈還元システムの評価を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Context-reduction layers for API-based coding agents, including command-output compressors, retrieval rankers, and API-boundary proxies, are commonly evaluated by how much context or tool output they remove. We ask a different question: which interventions actually reduce end-to-end billed cost while preserving task success? Our primary evidence is a pre-specified, hash-frozen, paired campaign of 2,908 provider-billed Claude Code runs, of which 2,848 were analyzed, covering 103 tasks, seven repositories, and three models. The campaign compared a baseline with two generations of hook-based compression and an API-boundary proxy within a broader measured program of roughly 5,500 billed executions. Three findings emerge. First, prompt-cache traffic dominated cost composition, accounting for about 87% of reconstructed four-component cost (about 80% of the actual bill), with an 8.7% dollar-weighted residual not attributable from retained telemetry. Second, local payload reduction was not a reliable predictor of end-to-end billed cost. An arm that removed 38% of estimated raw tool-output tokens incurred 6.8% higher paired cost (95% CI: +2.8% to +11.3%), while per-task reduction showed only a weak association with cost change (Pearson r = 0.15). Third, aggressive compression can remove action-critical evidence: on SWE-bench-derived Go tasks, compression reduced successful patch application from 27/40 to 15/40 by corrupting verbatim edit anchors. We propose evaluating context-reduction systems by success-adjusted billed cost rather than token reduction alone.
- Abstract(参考訳): コマンド出力圧縮、検索ローダ、APIバウンダリプロキシを含む、APIベースのコーディングエージェントのコンテキスト推論レイヤは、一般的に、削除されるコンテキストやツールアウトプットの量によって評価される。
タスクの成功を保ちながら、エンドツーエンドの請求コストを実際に削減するための介入は何か?
我々の主要な証拠は、事前に特定され、ハッシュフリーズで、2,908人の提供者によるClaude Codeランニングのペアキャンペーンであり、そのうち2,848人が分析され、103のタスク、7つのリポジトリ、3つのモデルがカバーされた。
このキャンペーンは、ベースラインをフックベースの2世代圧縮とAPIバウンダリプロキシと比較した。
3つの発見がある。
第一に、急流の交通がコスト構成を支配し、再建された4成分の約87%(実際の請求書の約80%)を占めた。
第二に、ローカルペイロードの削減は、エンドツーエンドの請求コストの信頼できる予測ではなかった。
推定された生ツール出力トークンの38%を除去したアームは対価が6.8%高い(95% CI:+2.8%から+11.3%)。
第三に、攻撃的な圧縮は、アクションクリティカルなエビデンスを取り除くことができる: SWE-bench由来のGoタスクでは、圧縮は、冗長な編集アンカーを破損させることで、成功しているパッチアプリケーションを27/40から15/40に削減する。
本稿では,トークンの削減のみではなく,成功調整請求コストによる文脈還元システムの評価を提案する。
関連論文リスト
- State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning [15.652256738395018]
大きな推論モデルは、長いチェーン・オブ・ソート(CoT)推論を通じて複雑なタスクに優れる。
KV-cache圧縮は一般的なソリューションであるが、既存の推論指向のメソッドは、キャッシュから削除したものによってのみ圧縮を判断する。
軽量プロセス逆推定器が各完了ステップをスコアし、3つのコンポーネントを駆動するフレームワークであるReCoを提案する。
論文 参考訳(メタデータ) (2026-08-05T12:36:28Z) - Control Under Compression: Reliability Frontiers for Tool-Using Agents [0.0]
ACC圧縮のための環境検証ベンチマークであるCompressAgentを紹介する。
75%の保持状況では、汎用的な書き換えとセクションベースの圧縮が92.7%、92.4%の成功を収めている。
25%から10%の継続コンテキスト予算では、実行可能なプロトコルは脆弱になる。
論文 参考訳(メタデータ) (2026-08-02T07:43:44Z) - Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs [0.5352699766206807]
単発モノレポの連続28日間における単発非ランダム化縦断ケーススタディについて検討した。
即時キャッシュ(99.3%のヒット率)がAPIのコストを88.6%削減し、有効な0.57%のトークンが得られた。
論文 参考訳(メタデータ) (2026-07-13T07:04:49Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - VisualClaw: A Real-Time, Personalized Agent for the Physical World [76.89211120690028]
2つの原則に基づいて構築された自己進化型マルチモーダルエージェントであるVisualClawを紹介する。
第一に、ハイブリッド符号化は、情報の少ないストリーミングフレームをカスケードゲートでフィルタリングすることにより、デプロイメントコストを低減する。
第二に、スキルの進化により、エージェントは失敗から学び、将来の質問に役立つスキルバンク更新を生成する。
論文 参考訳(メタデータ) (2026-06-15T06:58:22Z) - Token Budgets: An Empirical Catalog of 63 LLM-Agent Budget-Overrun Incidents, with an Affine-Typed Rust Mitigation as a Case Study [0.0]
私たちは、アフィンのオーナシップを運用するRustクレートを構築して、クローン、ダブルスペンディング、あるいは予算の使用を委譲することで、オペレータが避けなければならないランタイムのハザードではなくコンパイルエラーを発生させます。
5つのランタイム、3つのプロバイダ、温度階層化されたライブAPIテストで、このアプローチでは、コンカレントワークと同等の動作で、キャップ違反がゼロで、偽の拒否がゼロであることを報告している。
論文 参考訳(メタデータ) (2026-06-02T10:46:57Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - Carbon-Taxed Transformers: A Green Compression Pipeline for Overgrown Language Models [9.374717320061988]
Carbon-Taxed Transformers (CTT) は、マルチアーキテクチャ圧縮方式のパイプラインオーダである。
CTTは、アーキテクチャ上の非効率性を罰し、デプロイ対応圧縮に報いる計算炭素税を運用している。
その結果, 1) 最大49倍のメモリ削減, (2) クローン検出に最大8~10倍の時間短縮, 要約に最大3倍の時間短縮, 生成に4~7倍の時間短縮が得られた。
論文 参考訳(メタデータ) (2026-04-28T17:48:16Z) - ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation [9.992155237142306]
ClawTraceは、エージェントセッション中にすべてのLCMコール、ツール使用、サブエージェントスレーブを記録するエージェントトレースプラットフォームである。
CostCraftは、TraceCardsを読み出し、3種類のスキルパッチを生成する蒸留パイプラインである。
コスト属性とプルーパッチの両方が独立に品質の低下を減少させることを示す。
論文 参考訳(メタデータ) (2026-04-26T19:44:10Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - Prompt Compression in Production Task Orchestration: A Pre-Registered Randomized Trial [0.05586191108738562]
即時圧縮の経済性は、入力トークンの削減だけでなく、圧縮が出力長をどのように変化させるかにも依存する。
実運用マルチエージェントタスクオーケストレーションにおける即時圧縮を予め登録した6腕ランダム化制御試行において,これを評価した。
論文 参考訳(メタデータ) (2026-03-06T21:47:34Z) - AgentCompress: Task-Aware Compression for Affordable Large Language Model Agents [0.0]
70ビリオンパラメータモデルを使用した1セッションは、クラウドコンピューティングの料金が約127ドルである。
本稿では,タスク認識型動的圧縮によってこの問題に対処するフレームワークであるAgentCompressを提案する。
計算コストは68.3%減少し、当初の成功率の96.2%を維持した。
論文 参考訳(メタデータ) (2026-01-08T18:13:46Z) - VeriThinker: Learning to Verify Makes Reasoning Model Efficient [52.74493506816969]
大型推論モデルは、Chain-of-Thought (CoT)推論を用いて複雑なタスクで優れている。
過度に考える傾向は、必然的に長い推論連鎖に繋がる。
我々は,CoT圧縮の新しい手法であるVeriThinkerを紹介する。
論文 参考訳(メタデータ) (2025-05-23T14:17:56Z) - Task-Circuit Quantization: Leveraging Knowledge Localization and Interpretability for Compression [55.323397702682506]
後トレーニング量子化(PTQ)は、コストのかかる再トレーニングなしに全精度重みを低ビット重みにマッピングすることで、モデルのメモリフットプリントを削減する。
我々は,自動回路発見に並列性を持つ新しい混合精度PTQ手法であるTask-Circuit Quantization (TaCQ)を開発した。
論文 参考訳(メタデータ) (2025-04-10T02:19:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。