論文の概要: Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving
- arxiv url: http://arxiv.org/abs/2608.03579v1
- Date: Tue, 04 Aug 2026 12:34:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.189578
- Title: Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving
- Title(参考訳): ピン・イン・スワップ・ライト:サブスペースアライメント・センチロイド-効率的なウルトラローラ・サービングのための残留訓練
- Authors: Xiang Li, Pengcheng Wang, Huazheng Wang, Saurabh Bagchi,
- Abstract要約: Subspace-Aligned LoRA Training (SALT)は、効率的な階層的な微調整フレームワークである。
まず、高容量なドメインセントロイドをドメイン内の公開データ上で共同で訓練する。
次にユーザは、凍結したCentroid上のプライベートデータに超低ランクのタスク残差アダプタを微調整する。
推論中、プロバイダはGPU VRAMにセントロイドをピン留めし、要求に応じて各ユーザのタスクを動的にスワップする。
- 参考スコア(独自算出の注目度): 25.88998577757845
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern multi-tenant Low-Rank Adapters (LoRAs) serving systems concurrently host tens to hundreds of LoRA adapters. Though powerful, this introduces a critical system dilemma between serving efficiency and task performance: higher-rank adapters generally achieve better downstream task performance, but their GPU VRAM footprint and Host-to-Device PCIe swapping overhead severely constrain scalability. Conversely, ultra-low-rank adapters ($r \le 2$) minimize both VRAM footprint and PCIe transfer overhead, but suffer from downstream task performance degradation. To solve this problem, we propose Subspace-Aligned LoRA Training (SALT), a serving efficiency-aware hierarchical fine-tuning framework. Our solution operates in three phases. First, a provider jointly trains high-capacity domain centroids on public data within the domain using a novel alignment regularizer that coheres in-domain task subspaces into a unified basis. Next, users fine-tune ultra-low-rank task residual adapters on private data atop those frozen centroids. Finally, during inference, the provider pins the centroid in GPU VRAM and dynamically swaps in each user's task residual on demand. Across LLMs of varying scales, SALT recovers high-rank accuracy using $r \le 2$ residuals, achieving up to 18.5% absolute accuracy gains over state-of-the-art compression baselines and reducing per-adapter memory by up to 16x. When integrated into vLLM, SALT improves serving throughput by up to 51% under PCIe bandwidth pressure and 28% under GPU VRAM constraints for Llama-3.2-3B.
- Abstract(参考訳): 現代のマルチテナントローランドアダプタ (LoRA) は、数十から数百のLoRAアダプタを同時にホストする。
上位のアダプタは一般的にダウンストリームのタスクパフォーマンスを改善するが、GPU VRAMフットプリントとホスト・ツー・デバイスPCIeはオーバーヘッドを過度に制約スケーラビリティに置き換える。
逆に、超低ランクのアダプタ(r \le 2$)はVRAMフットプリントとPCIe転送のオーバーヘッドを最小化するが、下流のタスクパフォーマンスの劣化に悩まされる。
この問題を解決するために,効率に配慮した階層的微調整フレームワークであるSubspace-Aligned LoRA Training (SALT)を提案する。
私たちのソリューションは3つのフェーズで動作します。
まず、プロバイダは、ドメイン内のタスクサブスペースを統一されたベースにコヒーレントする新しいアライメント正規化器を用いて、ドメイン内の公開データ上の高容量ドメインセントロイドを共同で訓練する。
次にユーザは、凍結したCentroid上のプライベートデータに超低ランクのタスク残差アダプタを微調整する。
最後に、推論の間、プロバイダはGPU VRAMにセントロイドをピン留めし、要求に応じて各ユーザのタスクを動的にスワップする。
様々なスケールのLSMで、SALTは$r \le 2$残差を使って高い精度を回復し、最先端の圧縮ベースラインよりも18.5%の絶対精度を達成し、アダプタ単位のメモリを最大16倍まで削減する。
vLLMに統合されると、SALTはLlama-3.2-3BのPCIe帯域幅圧力で最大51%、GPU VRAM制約で最大28%のスループットを向上する。
関連論文リスト
- Serving Heterogeneous LoRA Adapters in Distributed LLM Inference Systems [11.584593298674688]
Low-Rank Adaptation (LoRA)は,大規模言語モデル(LLM)のパラメータ効率向上のためのデファクト手法となった。
プロダクションでは、LoRAベースのモデルが大規模に提供され、数百のアダプタがベースモデルを共有するマルチテナント環境を生成する。
作業負荷を考慮した動的アダプタ配置とルーティングフレームワークであるLoRAServeについて述べる。
論文 参考訳(メタデータ) (2025-11-28T05:04:02Z) - LoRAFusion: Efficient LoRA Fine-Tuning for LLMs [7.13923757932177]
Low-Rank Adaptation (LoRA) はLarge Language Models (LLM) のためのPEFT (Efficient Fine-Tuning) メソッドの先駆けとなった。
LLMのための効率的なLoRA微調整システムであるLoRAFusionを紹介する。
LoRAFusionはMegatron-LMと比較して最大1.96times$(平均1.47times$)エンドツーエンドのスピードアップを達成し、mLoRAよりも最大1.46times$(平均1.29times$)改善する。
論文 参考訳(メタデータ) (2025-09-30T19:26:22Z) - Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving [4.309392302169281]
エンジンレベルのプリフィル・デコード(PD)デアグリゲーションは干渉を避けるが、高いハードウェアと調整オーバーヘッドを引き起こす。
PDは、最大2.2倍のスループット、20倍のTTFT、2.5倍のTBTを達成する。
論文 参考訳(メタデータ) (2025-07-09T07:27:18Z) - EdgeLoRA: An Efficient Multi-Tenant LLM Serving System on Edge Devices [7.596547050649462]
本稿では,マルチテナント環境におけるエッジデバイス上での大規模言語モデル(LLM)の効率的な提供システムであるEdgeLoRAを紹介する。
EdgeLoRAは、(1)アダプタ設定プロセスを合理化するための適応型アダプタ選択機構、(2)インテリジェントなアダプタキャッシュとプーリングを活用してメモリ操作のオーバーヘッドを軽減する不均一なメモリ管理、(3)効率的なバッチ処理を可能にして計算遅延を大幅に削減するバッチLoRA推論という3つの重要なイノベーションを取り入れている。
論文 参考訳(メタデータ) (2025-07-02T07:47:28Z) - Dynamic Low-Rank Sparse Adaptation for Large Language Models [54.1231638555233]
Low-rank Sparse Adaptation (LoSA)は、低ランク適応をsparse LLM sparsityにシームレスに統合する新しい手法である。
LoSAは、微調整中に対応するスパース重みに基づいてLoRA結果を動的に分散する。
LoSAは、追加の推論負荷を伴わずに、スパースLSMの有効性を数時間で効果的に向上させることができる。
論文 参考訳(メタデータ) (2025-02-20T18:37:32Z) - FusionLLM: A Decentralized LLM Training System on Geo-distributed GPUs with Adaptive Compression [55.992528247880685]
分散トレーニングは、システム設計と効率に関する重要な課題に直面します。
大規模深層ニューラルネットワーク(DNN)のトレーニング用に設計・実装された分散トレーニングシステムFusionLLMを提案する。
本システムと手法は,収束性を確保しつつ,ベースライン法と比較して1.45~9.39倍の高速化を実現可能であることを示す。
論文 参考訳(メタデータ) (2024-10-16T16:13:19Z) - ConServe: Fine-Grained GPU Harvesting for LLM Online and Offline Co-Serving [61.35068981176018]
ConServeは、高いスループットと強力なオンラインレイテンシ保証を実現する大規模言語モデル(LLM)サービスシステムである。
我々は,ConServeが平均2.2$times$高スループットを実現し,オンラインサービステールのレイテンシを最先端システムと比較して平均2.9$times$削減することを示した。
論文 参考訳(メタデータ) (2024-10-02T04:12:13Z) - Flat-LoRA: Low-Rank Adaptation over a Flat Loss Landscape [52.98187034726091]
フルパラメータ空間の平坦領域に位置する低ランク適応を同定することを目的としたFlat-LoRAを提案する。
また、Flat-LoRAはドメイン内とドメイン外の両方の一般化を改善していることを示す。
論文 参考訳(メタデータ) (2024-09-22T11:24:10Z) - S-LoRA: Serving Thousands of Concurrent LoRA Adapters [59.490751234925206]
パラメータ効率のよい微調整法であるLoRA(Lo-Rank Adaptation)は、ベースモデルを複数のタスクに適応させるためによく用いられる。
本稿では,多数のLoRAアダプタのスケーラブルな提供を目的としたシステムであるS-LoRAを提案する。
論文 参考訳(メタデータ) (2023-11-06T17:26:17Z) - FusionAI: Decentralized Training and Deploying LLMs with Massive
Consumer-Level GPUs [57.12856172329322]
我々は、巨大な未使用のコンシューマレベルのGPUをアンロックする分散システムを構想する。
このシステムは、CPUとGPUメモリの制限、ネットワーク帯域幅の低さ、ピアとデバイスの多様性など、重要な課題に直面している。
論文 参考訳(メタデータ) (2023-09-03T13:27:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。