論文の概要: Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs
- arxiv url: http://arxiv.org/abs/2607.13080v1
- Date: Mon, 13 Jul 2026 07:04:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.523127
- Title: Inference Economics of Enterprise Coding Agents: A Case Study of Cloud vs. On-Premise LLMs
- Title(参考訳): 企業コーディングエージェントの推論経済学:クラウド対オンプレミスLLMのケーススタディ
- Abstract要約: 単発モノレポの連続28日間における単発非ランダム化縦断ケーススタディについて検討した。
即時キャッシュ(99.3%のヒット率)がAPIのコストを88.6%削減し、有効な0.57%のトークンが得られた。
- 参考スコア(独自算出の注目度): 0.5352699766206807
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous coding agents force engineering organizations to choose between API-based frontier models -- strong reasoning at high token cost -- and on-premise quantized open-weights models, which promise low-marginal-cost scaling and data sovereignty at some loss of reasoning fidelity. We study this trade-off through a single-developer, non-randomized longitudinal case study over two contiguous 28-day periods on a production monorepo: an API-based Claude Opus 4.7/4.8 configuration using Claude Code versus an on-premise GLM-5.1/5.2 configuration using Opencode, quantized to NVFP4, on NVIDIA Blackwell hardware. Analyzing LLM telemetry and Git history, we find that prompt caching (99.3% hit rate) cuts realized API cost by 88.6% to an effective \$0.57 per million tokens -- below even the \$2.83 amortized unit cost of the shared on-premise slice (a utilization-dependent inversion; total realized spend and total cost of ownership (TCO) are the robust quantities). At comparable gross code churn, the local configuration was associated with a far higher defect-repair burden: a Fix Commit Ratio (FCR) of 74.9% versus 45.9%, with the odds of a commit being a repair 2.6 to 4.9 times higher within every difficulty tier (Mantel-Haenszel OR = 3.61). Under Taiwan-market parameters and a symmetric labor model, on-premise deployment nonetheless saves 40.1% of true TCO under shared GPU allocation, whereas dedicated reservation costs 43.8% more than the cached API. Under shared allocation, the genuine penalty is not monetary but a measurable developer-experience burden -- timestamp indicators show more work trapped in debugging spirals and a slower commit cadence -- and an offline replay shows hybrid routing gateways trade defect rate for infrastructure savings along a cost-quality frontier rather than dominate the pure-API baseline.
- Abstract(参考訳): 自律的なコーディングエージェントは、エンジニアリング組織に、APIベースのフロンティアモデル – トークンコストの高い強い推論 – とオンプレミスの量子化されたオープンウェイトモデル – を選択するように強制する。
APIベースのClaude Opus 4.7/4.8構成と、Opencodeを使ったオンプレミスのGLM-5.1/5.2構成とを比較し、NVFP4に量子化する。
LLMテレメトリとGit履歴を分析してみると、APIの即時キャッシング(99.3%のヒット率)が、APIのコストを88.6%削減して、有効な$0.57 per millionトークンとなった。
FCR(Fix Commit Ratio)は74.9%対45.9%で、コミットの確率は難易度ごとに2.6から4.9倍高い(Mantel-Haenszel OR = 3.61)。
台湾市場パラメータと対称労働モデルの下では、オンプレミスのデプロイメントは、GPU割り当てによって真のTCOの40.1%を節約する一方、専用の予約コストはキャッシュされたAPIよりも43.8%高い。
タイムスタンプインジケータは、デバッギングスパイラルに閉じ込められ、コミットケイデンスが遅くなることを示しています。オフラインリプレイでは、純粋なAPIベースラインを独占するのではなく、コスト品質のフロンティアに沿って、インフラストラクチャの節約のために、ハイブリッドルーティングゲートウェイの貿易欠陥率を示しています。
関連論文リスト
- State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - CogEvol: Towards Efficient and Reliable Learning Environment Generation [49.18054685846454]
本稿では,学習環境生成に特化して訓練されたモデル群であるCogEvolを紹介する。
CogEvolは、スライドを中央値17秒、対話ページを59秒で完了し、数分のマルチターンエージェントの足場を置き換える。
プロダクショングラウンドのデータパイプラインは、実際の障害を53,687個のSFTサンプルに変換する。
論文 参考訳(メタデータ) (2026-08-31T15:33:38Z) - Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation [4.212647848163336]
本稿では,関数呼び出しのための高品質な合成トレーニングデータを生成する,オープンソースのフレームワークであるData Turnstileを紹介する。
Turnstileは、マルチターンツール使用のインタラクションを、バリデーションとエラーフィードバックループを備えた制約付き、ステップワイズ生成に分解する。
本論文では,Turnstileデータを用いた2つの関数呼び出しベンチマークにおけるドメイン適応の有効性を示す。
論文 参考訳(メタデータ) (2026-07-31T10:21:36Z) - Token Reduction Is Not Cost Reduction [0.0]
再建した4成分の約87%に占めるコスト構成は,急激なキャッシュトラフィックが支配的であった。
ローカルペイロードの削減は、エンドツーエンドの請求コストの信頼できる予測器ではなかった。
本稿では,トークンの削減のみではなく,成功調整請求コストによる文脈還元システムの評価を提案する。
論文 参考訳(メタデータ) (2026-07-13T21:10:22Z) - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - VisualClaw: A Real-Time, Personalized Agent for the Physical World [76.89211120690028]
2つの原則に基づいて構築された自己進化型マルチモーダルエージェントであるVisualClawを紹介する。
第一に、ハイブリッド符号化は、情報の少ないストリーミングフレームをカスケードゲートでフィルタリングすることにより、デプロイメントコストを低減する。
第二に、スキルの進化により、エージェントは失敗から学び、将来の質問に役立つスキルバンク更新を生成する。
論文 参考訳(メタデータ) (2026-06-15T06:58:22Z) - YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition [78.52944812151664]
大きな言語モデル(LLM)は、大きな金融革新をもたらすが、そのデプロイメントはKVキャッシュメモリのオーバーヘッドによってボトルネックになる。
我々は,Huawei Ascendエコシステム上に構築された包括的な構造遷移とトレーニングパイプラインによって強化された,高効率な金融LLMであるYouZhi-LLMを提案する。
論文 参考訳(メタデータ) (2026-06-04T08:44:37Z) - Human-Inspired Memory Architecture for LLM Agents [0.9507070656654629]
6つの認知機構からなる生体記憶アーキテクチャを提案する。
各メカニズムは、単純メモリ蓄積の特定の障害モードに対処する。
S層スケール(50セッション)では、デダップベースのコンソリデーションにより、好みのリコールが+13.3pp向上する。
論文 参考訳(メタデータ) (2026-05-08T22:52:37Z) - RouteNLP: Closed-Loop LLM Routing with Conformal Cascading and Distillation Co-Optimization [13.891522069967507]
RouteNLPはクローズドループフレームワークで、タイアップされたモデルポートフォリオにクエリをルーティングし、タスク毎の品質制約を満たすとともに、コストを最小限に抑える。
企業顧客サービス部門の8週間のパイロットデプロイメント処理で、RuteNLPは推論コストを58%削減し、91%の応答受け入れを維持し、p99レイテンシを1,847msから387msに削減した。
論文 参考訳(メタデータ) (2026-04-26T07:34:36Z) - Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving [9.457255218406333]
プロダクションvLLMフリートは通常、最悪のコンテキスト長に対して各インスタンスをプロビジョニングする。
実際には、80-95%のリクエストは短いが、長いコンテキストに最適化された設定の下で提供される。
本稿では,同種艦隊を2つの専用プールに分割する軽量ディスパッチ機構であるデュアルプールトークン予算ルーティングを提案する。
論文 参考訳(メタデータ) (2026-04-09T10:47:20Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - The Price Reversal Phenomenon: When Cheaper Reasoning Models End Up Costing More [76.93600828673503]
リストAPIの価格設定は、実際のコストに対する信頼性の低いプロキシである。
思考トークンのコストの削減は、ランキングの反転を70%削減します。
この結果から,コスト意識モデル選択と透過的な要求毎のコスト監視の必要性が示唆された。
論文 参考訳(メタデータ) (2026-03-25T06:07:39Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。