論文の概要: From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix
- arxiv url: http://arxiv.org/abs/2609.01572v1
- Date: Tue, 01 Sep 2026 17:39:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.901026
- Title: From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix
- Title(参考訳): 生産量から後評価へ:企業要求をカバーした自己完結型LCMの構築
- Authors: Olga Tsymboi, Dmitrii Stoianov, Ramil Latypov, Danil Taranets, Daniil Dryabin, Mikhail Gashkov, Viktor Zelenkovskiy, Aleksandr Fida, Gleb Alektorov, Nikita Gulyakov, Arthur Babkin, Aleksandr Medvedev, Pavel Gein, Anatolii Potapov,
- Abstract要約: 200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
- 参考スコア(独自算出の注目度): 55.08143827481755
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data-residency constraints force enterprises to self-host LLMs, but continuous adoption of newer models without decommissioning their predecessors expands the serving fleet, fragmenting a finite GPU pool. We consolidate traffic from over 200 internal applications onto a single model by closing quality gaps identified through production error analysis along three axes: instruction following, function-calling, and internal task distribution. Quality is tracked by offline benchmarks stratified to production traffic and scored by deterministic verifiers or calibrated LLM judges. Rather than optimising all objectives jointly, which introduces cross-domain reward interference, we train a separate GRPO expert per axis and merge them via two-stage SLERP. Each expert's reward exposes a distinct failure mode, namely semantic collapse, over-calling, and verbosity hacking, each requiring a domain-specific fix. In non-reasoning mode the recipe surpasses a ${\sim}7\times$ larger by total parameters baseline on the in-house Arena with 69.6 to 65.8, instruction following with 0.85 to 0.83, and function-calling with 0.79 to 0.77, while lifting general dialogue benchmarks. The model absorbs 50% of platform traffic, 116M requests per month, at a fraction of the serving cost.
- Abstract(参考訳): データレジデンシの制約により、企業はLLMを自己ホストせざるを得ないが、前者を廃止せずに新しいモデルを継続的に採用することは、サービスフリートを拡張し、有限のGPUプールを分断する。
我々は,200以上の内部アプリケーションから1つのモデルへのトラフィックを,命令追従,関数呼び出し,内部タスク分布という3つの軸に沿った生産エラー解析によって同定された品質ギャップを閉じることで集約する。
品質は、生産トラフィックに階層化されたオフラインベンチマークによって追跡され、決定論的検証器または校正LDM審査員によって測定される。
ドメイン間の報酬干渉をもたらす全ての目的を共同で最適化するのではなく、個別のGRPOエキスパートを軸ごとに訓練し、2段階のSLERPを介してマージする。
それぞれの専門家の報酬は、セマンティック・クラッシュ、オーバーコール、冗長なハッキングといった、ドメイン固有の修正を必要とする独自の障害モードを公開する。
非推論モードでは、レシピは、社内アリーナの総パラメータベースラインが69.6から65.8で、命令が0.85から0.83で、関数呼び出しが0.79から0.77で、合計で${\sim}7\times$を超える。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
関連論文リスト
- ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - Sub-Billion, Super-Frontier: Small Language Models Rival Zero-Shot Frontier LLMs on General and Literary Relation Extraction [5.070542698701158]
大言語モデル(LLM)は強い関係抽出(RE)を実現する
本研究では,小言語モデル(SLM)が汎用ドメインと文学テキスト間のギャップをいかに埋めるかを考察する。
論文 参考訳(メタデータ) (2026-06-21T17:24:31Z) - Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents [5.689042186242701]
企業の専門家が暗黙的に適用する決定ルールは、反復的エラー分析によって体系的に回復し、改善することができる。
基本機構は textbfEISR である textbfTrace2Policy について述べる。
各ラウンドは検証セット上でルールを実行し、ルート原因によるエラーをMISSING、WRONG、CONFLICTタイプにクラスタし、ターゲットパッチを適用し、レグレッションゲートを通過するもののみをコミットする。
論文 参考訳(メタデータ) (2026-06-09T06:05:29Z) - CAX-Agent: A Lightweight Agent Harness for Reliable APDL Automation [7.355373109826612]
本稿ではMAPDL自動化のための軽量エージェントハーネスであるCAX-Agentのアーキテクチャについて述べる。
我々は50の標準構造ベンチマークで3つのリカバリ戦略(no_recovery, rule_only, model_only)を評価した。
Model_onlyは、最大完了率(0.9267)、タスクスコア(3.59/4)、総得点(9.16/10)、ゼロ介入率(0.84)、0.7733, 3.17/4, 7.03/10, 0.00)、no_recovery(0.6933, 2.74/4, 5.60/10, 0.00)を大きな効果サイズで達成する。
論文 参考訳(メタデータ) (2026-05-12T14:46:34Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Efficient Multi-Model Orchestration for Self-Hosted Large Language Models [2.3275796286410677]
Pick and Spinは、セルフホストのオーケストレーションと経済性を実現するフレームワークである。
統合されたHelmベースのデプロイメントシステム、適応型スケールツーゼロ自動化、ハイブリッドルーティングモジュールを統合している。
最大21.6%の成功率、30%のレイテンシ、クエリ毎のコストの33%削減を実現している。
論文 参考訳(メタデータ) (2025-12-26T22:42:40Z) - Evaluating the Limitations of Local LLMs in Solving Complex Programming Challenges [0.31498833540989407]
本研究では,オープンソースのローカルホスト型大規模言語モデル(LLM)による複雑なプログラミングタスクの処理性能について検討する。
AI駆動のコード生成評価(FACE)のためのオリジナルのフレームワークをベースとして、著者らはパイプラインを完全にオフラインで動作するように改造した。
その結果、パス@1の精度は局所モデルでは控えめであり、最高のモデルはプロプライエタリモデルの受け入れ率の約半分であることがわかった。
論文 参考訳(メタデータ) (2025-09-18T14:13:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。