論文の概要: Task-to-Model Optimization for Enterprise LLM Coding Assistants: A Data-Driven Framework for Cost-Optimal Routing
- arxiv url: http://arxiv.org/abs/2608.08528v1
- Date: Sun, 09 Aug 2026 06:57:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.861268
- Title: Task-to-Model Optimization for Enterprise LLM Coding Assistants: A Data-Driven Framework for Cost-Optimal Routing
- Title(参考訳): エンタープライズLLM符号化アシスタントのタスク・ツー・モデル最適化:コスト最適ルーティングのためのデータ駆動フレームワーク
- Abstract要約: エンタープライズAIコーディングアシスタントは、相当な推論費用を発生させ、トークンコストの最小化は、再試行、エスカレーション、開発者待ち時間を含むと、エンドツーエンドコストの削減に失敗することが多い。
実運用におけるモデル選択を最適化するためのデータ駆動手法であるタスク・ツー・モデル最適化(T2MO)を提案する。
私たちは、各開発者セッションを、発見、分類、難易度を評価、プロダクション風のハーネスでベンチマークし、品質とレイテンシの制約の中でそれを完了できる最も安価なモデルにルーティングできるタスクとして扱います。
- 参考スコア(独自算出の注目度): 5.00725149774706
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Enterprise AI coding assistants incur substantial inference spend, and naive token-cost minimization often fails to reduce end-to-end cost once retries, escalations, and developer wait time are included. We present Task-to-Model Optimization (T2MO), a data-driven methodology for optimizing model selection in production coding workflows. We treat each developer session as a task that can be discovered, classified, graded for difficulty, benchmarked in a production-like harness, and routed to the cheapest model able to complete it within quality and latency constraints. The framework is a nine-stage pipeline spanning telemetry instrumentation, taxonomy discovery, difficulty grading, benchmark construction, candidate evaluation, optimal mix derivation, forecasting and version planning, staged routing deployment, and continuous governance. Unlike token-centric routing rules, our objective is cost per completed task, with failure escalation priced in explicitly. We show that this expected-completion-cost objective weakly dominates token-cost minimization under escalation, and we derive the routing boundary, the minimum pass rate a cheaper model must reach on a given cell to be worth deploying. Decisions are organized as a two-level hierarchy of task category difficulty tier, and per-cell displacement opportunities are aggregated into a traffic-weighted savings waterfall that ranks replacement candidates by realized dollar impact. The framework supports developer guidance, spend forecasting, and a staged transition from static policies to shadow-mode classifiers, verified cascades, and ultimately an intelligent router. We describe the methodology, optimization objective, evaluation protocol, and governance loop in a form suitable for production deployment and future empirical study.
- Abstract(参考訳): エンタープライズAIコーディングアシスタントは、相当な推論費用を発生させ、トークンコストの最小化は、再試行、エスカレーション、開発者待ち時間を含むと、エンドツーエンドコストの削減に失敗することが多い。
本稿では,本運用環境におけるモデル選択を最適化するためのデータ駆動手法であるタスク・ツー・モデル最適化(T2MO)を提案する。
私たちは、各開発者セッションを、発見、分類、難易度を評価、プロダクション風のハーネスでベンチマークし、品質とレイテンシの制約の中でそれを完了できる最も安価なモデルにルーティングできるタスクとして扱います。
このフレームワークは、テレメトリ計測機器、分類学発見、難易度評価、ベンチマーク構築、候補評価、最適混合導出、予測とバージョン計画、ステージドルーティングデプロイメント、継続的ガバナンスにまたがる9段階のパイプラインである。
トークン中心のルーティングルールとは異なり、私たちの目標は完了したタスク当たりのコストであり、障害エスカレーションを明示的に設定することです。
提案手法は,エスカレーション下でのトークンコストの最小化を弱く支配し,より安価なモデルが所定のセルに到達する最小パスレートであるルーティング境界を導出する。
決定は、タスクカテゴリの難易度階層の2段階の階層として編成され、セルごとの変位機会を交通量重の貯蓄滝に集約する。
このフレームワークは、開発者ガイダンス、予測に費やし、静的ポリシーからシャドウモード分類器、検証されたカスケード、そして最終的にはインテリジェントルータへの段階的な移行をサポートする。
本稿では,生産展開に適した方法論,最適化目標,評価プロトコル,ガバナンスループについて述べる。
関連論文リスト
- Latent World Models with Monotone Planning Costs for Image-Goal Navigation [11.421277609989302]
凍結したDINOファミリーエンコーダ上に構築された潜在世界モデルを提案し,それを2つの相補的目的で訓練する。
自動回帰的なロールアウト損失は、トレーニングとマルチステッププランニングロールアウトの間のギャップを減少させる。
モノトーンコストランキング(MCR)の損失は、より混乱したアクションシーケンスを直接的に促進し、より高い計画コストを受け取る。
論文 参考訳(メタデータ) (2026-08-10T03:23:26Z) - ScaleSense: Cost-Intelligent Scaling Framework via Learned Resource Estimation in Alibaba AnalyticDB [59.708423132520515]
クラウドネイティブなサーバレスデータウェアハウスは、計算からストレージを分離することで、きめ細かい弾力性を達成する。
しかし、高度にヘテロジニアスなアドホッククエリに対する最適なリソース割り当てを決定することは、深刻な産業上の課題である。
プロアクティブでクエリレベルのリソーススケーリングフレームワークであるScaleSenseを提案する。
論文 参考訳(メタデータ) (2026-08-08T06:10:35Z) - Cost-Aware Learning [72.31444819326795]
本稿では,異なるコンポーネント関数をサンプリングするコスト認識学習の問題点について考察する。
凸関数に対するコスト・アウェア・Descentアルゴリズムを提案し、そのコスト複雑性を導出し誤差を$$$とする。
本稿では,性能を保ちつつポリシー最適化のコストを削減するアルゴリズムであるCost-Aware GRPOを紹介する。
論文 参考訳(メタデータ) (2026-04-30T15:39:09Z) - Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization [18.737087162461563]
テストタイムの計算スケーリングは、大規模言語モデルのパフォーマンスを向上させるための強力なレバーとなっている。
しかし、これらのテクニックを有限の推論予算の下で展開するには、現在のシステムがほとんど無視する決定が必要である。
我々はこれを制約付き最適化問題(平均計算予算の予測精度を最大化する)として定式化し、2段階のソルベ・テン・ラーンパイプラインで解いた。
論文 参考訳(メタデータ) (2026-04-16T10:39:22Z) - Scalable Prompt Routing via Fine-Grained Latent Task Discovery [42.098155635687796]
プロンプトルーティングは、クエリ毎に候補のプールから最も適切な大きな言語モデルを動的に選択する。
本稿では,タスクの自動検出とタスク認識品質推定により,制約に対処する2段階のルーティングアーキテクチャを提案する。
提案手法は,既存のベースラインを常に上回り,最強の個人モデルを超えながら,コストの半減を図っている。
論文 参考訳(メタデータ) (2026-03-19T19:15:51Z) - Budget-Aware Agentic Routing via Boundary-Guided Training [24.0709108941881]
予算対応エージェントルーティング(Budget-Aware Agentic Routing)は、各ステップで安価なモデルと高価なモデルを選択して、コスト削減フロンティアを最適化する。
境界誘導訓練(Boundary-Guided Training)は、希少な報酬の下で学習を定着させるために難しい分類法を構築する。
実験結果から,提案手法は高効率フロンティアを改良し,強いルーティングベースラインを極めて低コストで整合することを示した。
論文 参考訳(メタデータ) (2026-02-04T07:39:27Z) - EvoRoute: Experience-Driven Self-Routing LLM Agent Systems [100.64399490164959]
EvoRouteは、静的で事前定義されたモデルの割り当てを超越する、自己進化型のモデルルーティングパラダイムである。
挑戦的なエージェントベンチマークの実験によると、既製のエージェントシステムに統合されたEvoRouteは、システムのパフォーマンスを維持または向上するだけでなく、実行コストを最大80%削減し、レイテンシを70%以上削減する。
論文 参考訳(メタデータ) (2026-01-06T04:06:46Z) - Arbitrage: Efficient Reasoning via Advantage-Aware Speculation [71.45710345765528]
投機的復号化は、高速だが不正確なドラフトモデルを用いて推論を加速し、自動回帰的にトークンを提案する。
しかし、意味論的に等価なステップにおけるトークンミスマッチによる不要な拒絶のため、従来のトークンレベルの投機的デコーディングは、タスクの推論に苦労する。
提案するArbitrageは,ドラフトモデルとターゲットモデルとの相対的優位性に基づいて動的に生成をルーティングする,新しいステップレベルの投機生成フレームワークである。
論文 参考訳(メタデータ) (2025-12-04T17:50:53Z) - Conformal Constrained Policy Optimization for Cost-Effective LLM Agents [27.37909142846675]
大規模言語モデル(LLM)は最近、AI問題の解決に向けて大きな進歩を遂げた。
本稿では,複数のLLMモデルとコスト/精度のトレードオフをエージェント方式で組み合わせた新しい戦略を提案する。
当社のアプローチは,信頼性を維持しつつ,よりコスト効率のよいLCMエージェントをデプロイするための,原則的かつ実用的なフレームワークを提供する。
論文 参考訳(メタデータ) (2025-11-14T19:39:28Z) - CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing [74.14816777318033]
Token-lEvel Routing(CITER)との協調推論は、小規模および大規模言語モデルの効率的な協調を可能にするフレームワークである。
ルータの学習をポリシー最適化として定式化し、予測の質と生成の推論コストの両方に基づいて報酬を受け取る。
実験の結果,CITERは高品質な生成を保ちながら推論コストを低減し,リアルタイムおよびリソース制約のあるアプリケーションに対して有望なソリューションを提供することがわかった。
論文 参考訳(メタデータ) (2025-02-04T03:36:44Z) - When Demonstrations Meet Generative World Models: A Maximum Likelihood
Framework for Offline Inverse Reinforcement Learning [62.00672284480755]
本稿では, 専門家エージェントから, 一定の有限個の実演において観測された動作を過小評価する報酬と環境力学の構造を復元することを目的とする。
タスクを実行するための正確な専門知識モデルは、臨床的意思決定や自律運転のような安全に敏感な応用に応用できる。
論文 参考訳(メタデータ) (2023-02-15T04:14:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。