論文の概要: GLM-5 Serving Parameter Tuning for OpenClaw: Single-Deployment MaaS Inference Optimization for Long-Context Agent Workloads
- arxiv url: http://arxiv.org/abs/2607.02518v1
- Date: Mon, 27 Apr 2026 11:12:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.97705
- Title: GLM-5 Serving Parameter Tuning for OpenClaw: Single-Deployment MaaS Inference Optimization for Long-Context Agent Workloads
- Title(参考訳): GLM-5 OpenClawのServingパラメータチューニング:長期エージェントワークロードの単一デプロイMaaS推論最適化
- Authors: Minjie Hua, Ning Wang, Peijun Yang, Kai Wang, Shiguo Lian,
- Abstract要約: OpenClawリクエストは、システムプロンプト、会話履歴、コンテキストウィンドウに出力されるツールアウトプットなど、長いツール拡張プレフィックスによって支配される。
このワークロードでは、要求毎に約28k-30kの入力トークンと500の出力トークンを持つため、サービス品質は短期的なスループットのみではなく、スループット、TTFT、テールレイテンシによって管理される。
- 参考スコア(独自算出の注目度): 6.400220635933459
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: OpenClaw requests are dominated by long, tool-augmented prefixes, including system prompts, conversation history, and tool outputs fed back into the context window. For this workload, with about 28k-30k input tokens and 500 output tokens per request, serving quality is governed by throughput, TTFT, and tail latency rather than short-prompt throughput alone. This report studies GLM-5 serving-parameter tuning within a MaaS multi-model inference optimization architecture. The scope is the Single-Node Optimization block of the inference-optimization layer, where chunked prefill, tensor parallelism (TP), pipeline parallelism (PP), and request concurrency are tuned for one GLM-5 serving deployment; in this report, "Single-Node Optimization" denotes the architecture block, while experiments run on a two-node, sixteen-GPU cluster. Within the tested space, the best configuration is chunked-prefill-size=3072, tp=4, pp-size=4, and max-running-requests=24. Compared with the conservative 2048/4/4/16 baseline, it increases request throughput from 0.43 to 0.48 req/s and total token throughput from 9029.64 to 9993.23 tok/s, while reducing average TTFT from 8.98 to 6.69 s and latency P90 from 40.23 to 32.64 s. Under the same hardware footprint, this corresponds to an estimated 10.4% lower serving cost per request and 9.6% lower cost per token. The results show that the optimum is workload-specific: larger chunk sizes and deeper queueing do not monotonically improve performance. We therefore recommend 3072 / tp4 / pp4 / max24 as the default OpenClaw deployment profile.
- Abstract(参考訳): OpenClawリクエストは、システムプロンプト、会話履歴、コンテキストウィンドウに出力されるツールアウトプットなど、長いツール拡張プレフィックスによって支配される。
このワークロードでは、要求毎に約28k-30kの入力トークンと500の出力トークンを持つため、サービス品質は短期的なスループットのみではなく、スループット、TTFT、テールレイテンシによって管理される。
本稿では,MaaSマルチモデル推論最適化アーキテクチャにおけるGLM-5サービスパラメータチューニングについて述べる。
対象は、チャンク前処理、テンソル並列処理(TP)、パイプライン並列処理(PP)、リクエスト並列処理を1つのGLM-5に調整する推論最適化層のシングルノード最適化ブロックであり、このレポートでは、"Single-Node Optimization"はアーキテクチャブロックを表し、実験は2ノード、16GPUクラスタ上で実行される。
テストスペース内では、最高の設定はチャンク-prefill-size=3072、tp=4、pp-size=4、max-running-requests=24である。
保守的な2048/4/4/16ベースラインと比較して、要求スループットを0.43から0.48 req/sに、トークンスループットを9029.64から9993.23 tok/sに、平均TTFTを8.98から6.69 sに、レイテンシP90を40.23から32.64 sに下げる。
同じハードウェアフットプリントの下では、要求当たりのサービスコストが10.4%低く、トークン当たりのコストが9.6%低いと見積もられている。
より大きなチャンクサイズとより深いキューは、パフォーマンスを単調に改善しない。
したがって、デフォルトのOpenClawデプロイメントプロファイルとして3072 / tp4 / pp4 / max24を推奨します。
関連論文リスト
- Lower Bounds for PIR with Preprocessing from Blackbox Cryptography [57.20693707878285]
プリプロセッシングによるシングルサーバプライベート情報検索(PIR)の限界について検討する。
本研究は,プリプロセッシングを伴うシングルサーバPIRに対して,計算の低いバウンダリを提示する。
論文 参考訳(メタデータ) (2026-07-07T16:12:48Z) - Think Before You Grid-Search: Floor-First Triage for LLM Serving [0.0]
LLMサービス最適化は通常、多くの設定をベンチマークし、遅延ターゲットが欠落しているときに重いプロファイラに到達する。
我々は逆の規律を主張する: 推定はプロファイリングの分析的な層である。
論文 参考訳(メタデータ) (2026-07-07T06:11:54Z) - ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning [58.54940026861599]
textscChunkFTはメモリ効率の良い微調整フレームワークである。
textscChunkFTは、ネットワークアーキテクチャを変更することなく任意のサブテンソルの勾配計算を可能にする。
textscChunkFTは、既存のメモリ効率のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-20T13:44:44Z) - Dual-Pool Token-Budget Routing for Cost-Efficient and Reliable LLM Serving [9.457255218406333]
プロダクションvLLMフリートは通常、最悪のコンテキスト長に対して各インスタンスをプロビジョニングする。
実際には、80-95%のリクエストは短いが、長いコンテキストに最適化された設定の下で提供される。
本稿では,同種艦隊を2つの専用プールに分割する軽量ディスパッチ機構であるデュアルプールトークン予算ルーティングを提案する。
論文 参考訳(メタデータ) (2026-04-09T10:47:20Z) - Architecture-Aware LLM Inference Optimization on AMD Instinct GPUs: A Comprehensive Benchmark and Deployment Study [0.0]
AMD Instinct MI325X GPUにおけるLCM推定のクロスアーキテクチャ評価
3つのアーキテクチャファミリにまたがる235Bから1兆のパラメータにまたがる4つのモデルのベンチマーク。
論文 参考訳(メタデータ) (2026-02-27T13:21:48Z) - StreamServe: Adaptive Speculative Flows for Low-Latency Disaggregated LLM Serving [2.1072136327189672]
StreamServeは、非集約のプリフィルデコードサービスアーキテクチャである。
StreamServeはテンソル並列vLLMベースラインと比較してレイテンシを11~18倍削減する。
スループットは、要約タスクで毎秒2235トークンに達する。
論文 参考訳(メタデータ) (2026-02-11T21:03:47Z) - EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference [49.94169109038806]
本稿では,既存の並列処理方式を超越したMoE用パイプラインスケジューラであるEPS-MoEを紹介する。
その結果,既存の並列推論手法と比較して,プリフィルスループットは52.4%向上した。
論文 参考訳(メタデータ) (2024-10-16T05:17:49Z) - HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM
Inference [68.59839755875252]
HiREは2つの新しいコンポーネントから構成される: (i) (i) (i) (i) (i) (i) (i) (i) (i) (i) (ii) DA-TOP-$k$: 効率的なマルチデバイス近似トップ-k$演算子) (i) (i) (i) (i) (i) (i) (i) DA-TOP-$k$演算子) 。
我々は、10億のパラメータモデルにおいて、HiREがソフトマックスとフィードフォワード層の両方に適用され、ほぼ一致した事前学習と下流の精度を実現し、1台のTPUv5eデバイスで1.47Times$の推論遅延を高速化することを示した。
論文 参考訳(メタデータ) (2024-02-14T18:04:36Z) - Non-Parametric Adaptive Network Pruning [125.4414216272874]
アルゴリズム設計を簡略化するノンパラメトリックモデリングを導入。
顔認識コミュニティに触発されて,メッセージパッシングアルゴリズムを用いて,適応的な例示数を求める。
EPrunerは「重要」フィルタを決定する際にトレーニングデータへの依存を壊します。
論文 参考訳(メタデータ) (2021-01-20T06:18:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。