論文の概要: BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks
- arxiv url: http://arxiv.org/abs/2608.05926v1
- Date: Thu, 06 Aug 2026 11:57:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.897688
- Title: BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks
- Title(参考訳): BALANCE: 無線エッジネットワークにおけるハイブリッド自己回帰型LLM推論
- Abstract要約: エッジ推論は、次世代モバイルネットワークで大規模言語モデル(LLM)推論サービスを提供するための有望なパラダイムである。
LLM推論は主に2つのアプローチに依存している: 自己回帰復号(AD)は出力トークンを逐次生成し、長いレイテンシをもたらす。
エッジLLM推論のためのハイブリッド自己回帰-投機的推論(BALANCE)フレームワークを提案する。
- 参考スコア(独自算出の注目度): 12.929167421781074
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Edge inference is a promising paradigm to provide large language model (LLM) inference services in next-generation mobile networks. LLM inference mainly relies on two approaches: Autoregressive decoding (AD) generates output tokens sequentially, resulting in long latency; Speculative decoding (SD) accelerates inference by using a small language model (SLM) to generate multiple draft tokens for LLM verification, but incurs extra memory costs. Due to this latency-memory tradeoff, neither approach alone can efficiently serve users with heterogeneous demands under limited edge computing resources. To address this challenge, we propose a hybrid autoregressive-speculative inference (BALANCE) framework for edge LLM inference. In BALANCE, an edge server hosts both an SLM and an LLM, assigns each user to AD or SD, and performs the two modes simultaneously. To maximize the number of served users, we formulate a task throughput maximization problem to jointly determine user scheduling and computing resource allocation between AD and SD under user latency requirements and server memory constraints. Since the problem is NP-hard, we develop a polynomial-time algorithm that transforms the original problem into two sub-problems and obtains a sub-optimal solution with a constant approximation guarantee. Experiments demonstrate that BALANCE consistently outperforms conventional AD and SD and significantly improves task throughput.
- Abstract(参考訳): エッジ推論は、次世代モバイルネットワークで大規模言語モデル(LLM)推論サービスを提供するための有望なパラダイムである。
LLM推論は主に2つのアプローチに依存している: 自己回帰復号(AD)は出力トークンを逐次生成し、長いレイテンシをもたらす; 投機的復号(SD)は小さな言語モデル(SLM)を用いて推論を加速し、LLM検証のために複数のドラフトトークンを生成するが、余分なメモリコストが発生する。
このレイテンシーメモリのトレードオフのため、どちらのアプローチも、エッジコンピューティングリソースに制限されたヘテロジニアスな要求をユーザに効率的に提供できない。
この課題に対処するために、エッジLLM推論のためのハイブリッド自動回帰推論(BALANCE)フレームワークを提案する。
BALANCEでは、エッジサーバがSLMとLLMの両方をホストし、各ユーザにADまたはSDを割り当て、同時に2つのモードを実行する。
サービス利用者数を最大化するために、ユーザ待ち時間とサーバメモリ制約下でのADとSD間のスケジューリングと資源割り当てを共同で決定するタスクスループット最大化問題を定式化する。
問題はNPハードであるため、元の問題を2つのサブプロブレムに変換し、一定の近似保証付き準最適解を得る多項式時間アルゴリズムを開発する。
実験により、BALANCEは従来のADとSDを一貫して上回り、タスクスループットを大幅に向上することが示された。
関連論文リスト
- End-to-End Latency-Minimizing and Load-Balanced Request Scheduling for Edge LLM Inference in Agentic AI Services [13.04369901641143]
大規模言語モデル(LLM)を使用したエージェントAIサービスでは、低レイテンシ推論がますます求められている。
本研究では,各要求に対する送信,プリフィル,再分配レベル復号化,キー値キャッシュの進化をキャプチャするクロススロット推論モデルを開発した。
本稿では,Lyapunov最適化による長期負荷分散制約を変換するLYREO手法を提案する。
論文 参考訳(メタデータ) (2026-09-15T13:50:54Z) - HALO: Semantic-Aware Distributed LLM Inference in Lossy Edge Network [50.33808558714122]
エッジでの大規模言語モデル(LLM)推論は、ユーザのプライバシを保護すると同時に、サービスの応答性を促進する。
損失エッジネットワークにおける分散LLM推論を向上する新しいフレームワークであるHALOを提案する。
Raspberry Piクラスタによる実験の結果、HALOは信頼性の低いネットワーク条件下でLLaMAシリーズLLMの3.41倍のエンドツーエンドのスピードアップを達成した。
論文 参考訳(メタデータ) (2026-01-16T07:37:23Z) - Constrained Network Slice Assignment via Large Language Models [0.0]
ネットワークスライシングのための無線リソース割り当てにLarge Language Models (LLMs) を用いる方法について検討する。
ゼロショットプロンプトであっても、LLMはスライス代入の合理的な第1ドラフトを生成することができることを示す。
次に、LLMのサービス要求に対する理解を最適化解決器に組み込んで、改善されたアロケーションを生成する。
論文 参考訳(メタデータ) (2025-11-14T07:47:42Z) - Collaborative Large Language Model Inference via Resource-Aware Parallel Speculative Decoding [6.130486652666936]
投機的復号化は、モバイルデバイスの軽量ドラフトモデルとエッジサーバの強力なターゲットモデルとの間にトークン生成を分割することで、有望なソリューションを提供する。
本稿では,効率的な並列投機的復号化を支援するために,ユーザアソシエーションとリソースアロケーションを協調的に最適化する統合フレームワークを初めて提案する。
その結果,提案手法は推定精度を損なうことなく,最大28.0%,平均23.7%のレイテンシ削減を実現していることがわかった。
論文 参考訳(メタデータ) (2025-11-03T16:04:44Z) - Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model [98.35868970993232]
拡散言語モデル(DLM)は、支配的な自己回帰パラダイムに代わる強力で有望な選択肢として現れています。
コード生成における推論速度と出力品質の向上を実現するために,適応加速度を用いた効率的なサンプリングとバックトラック強化リマッシング(セイバー)を導入する。
論文 参考訳(メタデータ) (2025-10-20T23:38:12Z) - Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition [95.54406667705999]
Pangu Embeddedは、Ascend Neural Processing Units (NPU) 上で開発された効率的なLarge Language Model (LLM) 推論器である。
既存の推論最適化 LLM でよく見られる計算コストと推論遅延の問題に対処する。
単一の統一モデルアーキテクチャ内で、迅速な応答と最先端の推論品質を提供する。
論文 参考訳(メタデータ) (2025-05-28T14:03:02Z) - Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints [14.341123057506827]
大規模言語モデル(LLM)は、今日のアプリケーションでは必須であるが、推論手順は重要な計算資源を必要とする。
本稿では,多段階オンラインスケジューリング問題としてLLM推論最適化を定式化する。
我々は,アルゴリズム設計をガイドするトラクタブルなベンチマークを提供するために,流体力学近似を開発した。
論文 参考訳(メタデータ) (2025-04-15T16:00:21Z) - Progressive Mixed-Precision Decoding for Efficient LLM Inference [49.05448842542558]
我々は,デコーディングのメモリバウンドネスに対処するために,プログレッシブ・ミックス・プレシジョン・デコーディング(PMPD)を導入する。
PMPDはfp16モデルの行列ベクトル乗算において1.4$-$12.2$times$ Speedupを達成する。
我々の手法は、fp16モデルよりも3.8$-$8.0$times$、均一量子化アプローチよりも1.54$times$のスループット向上をもたらす。
論文 参考訳(メタデータ) (2024-10-17T11:46:33Z) - Edge Intelligence Optimization for Large Language Model Inference with Batching and Quantization [20.631476379056892]
大規模言語モデル(LLM)がこの運動の最前線にある。
LLMはクラウドホスティングを必要とするため、プライバシやレイテンシ、使用制限に関する問題が発生する。
LLM推論に適したエッジインテリジェンス最適化問題を提案する。
論文 参考訳(メタデータ) (2024-05-12T02:38:58Z) - A Multi-Head Ensemble Multi-Task Learning Approach for Dynamical
Computation Offloading [62.34538208323411]
共有バックボーンと複数の予測ヘッド(PH)を組み合わせたマルチヘッドマルチタスク学習(MEMTL)手法を提案する。
MEMTLは、追加のトレーニングデータを必要とせず、推測精度と平均平方誤差の両方でベンチマーク手法より優れている。
論文 参考訳(メタデータ) (2023-09-02T11:01:16Z) - Low-Latency Federated Learning over Wireless Channels with Differential
Privacy [142.5983499872664]
フェデレートラーニング(FL)では、モデルトレーニングはクライアントに分散し、ローカルモデルは中央サーバによって集約される。
本稿では,各クライアントの差分プライバシ(DP)要件だけでなく,全体としてのトレーニング性能に制約された無線チャネル上でのFLトレーニング遅延を最小限に抑えることを目的とする。
論文 参考訳(メタデータ) (2021-06-20T13:51:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。