論文の概要: Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs
- arxiv url: http://arxiv.org/abs/2607.23115v1
- Date: Sat, 25 Jul 2026 09:06:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.994353
- Title: Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs
- Title(参考訳): Gleam: LAN上でのクロスデバイスGPU共有のための適応的ネットワーク効率のCUDA APIリモーティング
- Abstract要約: 本稿では、ローカルエリアネットワーク(LAN)内のデバイス間での計算および通信効率のよいGPU共有を実現することを目的とする。
本稿では,タスクジェネリックGPU共有のための新しい,ネットワーク効率の高いフレームワークであるGleamを提案する。
Gleemは最先端のベースラインを一貫して上回り、APIリモーティング効率の1.4~24.2倍の改善を実現している。
- 参考スコア(独自算出の注目度): 27.795876706914857
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper aims to enable computation- and communication-efficient GPU sharing across devices within local area networks (LANs), facilitating ubiquitous AI inference on heterogeneous personal devices. We achieve distributed task offloading via CUDA API remoting. However, beyond raw computation, network constraints emerge as the primary bottleneck: limited bandwidth, high-frequency API invocations, and cross-task contention significantly hinder performance. To address these challenges, we propose Gleam, a novel and network-efficient framework for task-generic GPU sharing across local-area CUDA devices, with three key contributions. First, we reduce bandwidth overhead in CUDA API remoting through automatic model weight caching, and mitigate accumulated latency from frequent API calls by asynchronous execution. Second, we design a runtime task scheduler that dynamically determines API remoting pairs between LAN clients and servers, explicitly accounting for both network conditions and GPU resource contention under parallel workloads. Finally, we introduce dedicated mechanisms to ensure CUDA context consistency across distributed executions. Extensive experiments on heterogeneous NVIDIA GPUs and diverse AI workloads show Gleam consistently outperforms state-of-the-art baselines, achieving 1.4-24.2 times improvements in API remoting efficiency and up to 1.79 times higher system throughput.
- Abstract(参考訳): 本稿では、ローカルエリアネットワーク(LAN)内のデバイス間での計算および通信効率のよいGPU共有の実現を目標とし、異種パーソナルデバイス上でのユビキタスAI推論を容易にすることを目的とする。
CUDA APIリモーティングによる分散タスクオフロードを実現しています。
しかし、生の計算以外にも、帯域幅の制限、高速なAPI呼び出し、タスク間の競合など、ネットワークの制約が主なボトルネックとして浮上し、パフォーマンスを著しく損なう。
これらの課題に対処するために、Gleamを提案する。Gleamは、ローカル領域のCUDAデバイス間でのタスクジェネリックGPU共有のための、新しくてネットワーク効率のよいフレームワークで、3つの重要なコントリビューションがある。
まず、CUDA APIのリモーティングにおいて、自動モデルウェイトキャッシングによる帯域幅のオーバーヘッドを低減し、非同期実行による頻繁なAPI呼び出しからの累積レイテンシを軽減する。
次に、LANクライアントとサーバ間のAPIリモーティングペアを動的に決定するランタイムタスクスケジューラを設計し、並列ワークロード下でのネットワーク条件とGPUリソース競合の両方を明示的に考慮する。
最後に、分散実行におけるCUDAコンテキストの整合性を保証するための専用のメカニズムを導入する。
異質なNVIDIA GPUと多様なAIワークロードに関する大規模な実験は、Gleamが一貫して最先端のベースラインを上回り、APIのリモーティング効率が1.4~24.2倍改善され、システムスループットが最大1.79倍向上したことを示している。
関連論文リスト
- CTA-Pipelining: A Latency-Oriented Spatial Scaling Method for Multi-GPU Systems [2.870762512009438]
本稿では,共有メモリマルチGPUシステムを活用するための実行パラダイムであるCTA-pipeliningを紹介する。
遅延指向の空間スケーリング手法として、CTAパイプライニングは協調スレッドアレイレベルを活用する。
その結果、CTAパイプライニングはマイクロバッチに比べてレイテンシを最大31.8%削減することがわかった。
論文 参考訳(メタデータ) (2026-07-08T18:54:08Z) - Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment [60.442064966340524]
本稿では、WiFi経由で接続されたNVIDIA Jetson Orin Nanoデバイスに関するプロトタイプ研究を行う。
主な発見は、主なボトルネックは、ネットワーク帯域幅だけでなく、通信中のCPU-GPUステージングである。
実験によると、この戦略はフルテンソル交換と比較して遅延を65%-77%減らし、エネルギー消費を34%-52%減らしている。
論文 参考訳(メタデータ) (2026-05-25T10:39:28Z) - VUDA: Breaking CUDA-Vulkan Isolation for Spatial Sharing of Compute and Graphics on the Same GPU [8.606051275493147]
VUDAは、単一のデバイス上でのAIインターリーブ物理シミュレーション(CUDA)とレンダリング(Vulkan)を具現化するシステムである。
Vulkanは異なる抽象化を公開しているが、その実行パスはドライバとハードウェアレベルで共通のチャネルプリミティブに収束する。
実験によると、VUDAは時間共有ベースラインよりも85%高い。
論文 参考訳(メタデータ) (2026-05-02T09:54:20Z) - GPU-Initiated Networking for NCCL [0.7990599798388804]
従来のGPU通信は、CPUがすべての通信操作をオーケストレーションするホスト開始モデルに従っている。
本稿では,GINアーキテクチャ,設計,セマンティクスについて述べる。
論文 参考訳(メタデータ) (2025-11-19T03:36:03Z) - Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs [61.953548065938385]
分析フレームワークとして'3つの税'(バルク同期、カーネル間データローカリティ、カーネルローンチオーバーヘッド)を紹介した。
我々は、分散GPU実行におけるキー非効率に対処するために、厳密なBSPモデルを超えて移動することを提案する。
BSPベースのアプローチによるエンドツーエンドのレイテンシの10-20%の高速化を観察する。
論文 参考訳(メタデータ) (2025-11-04T01:15:44Z) - Accelerating Mobile Inference through Fine-Grained CPU-GPU Co-Execution [1.3356260369011272]
本稿では,OpenCLの微細粒度共有仮想メモリ(SVM)と機械学習モデルに基づいて,実行時間を正確に予測する軽量同期機構を提案する。
4つのモバイルプラットフォーム上での総合的な評価から,線形層で最大1.89倍,畳み込み層で最大1.75倍の高速化を実現したCPU-GPU共同実行戦略を迅速に選択できることが示唆された。
論文 参考訳(メタデータ) (2025-10-24T01:41:43Z) - Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving [4.309392302169281]
エンジンレベルのプリフィル・デコード(PD)デアグリゲーションは干渉を避けるが、高いハードウェアと調整オーバーヘッドを引き起こす。
PDは、最大2.2倍のスループット、20倍のTTFT、2.5倍のTBTを達成する。
論文 参考訳(メタデータ) (2025-07-09T07:27:18Z) - FusionLLM: A Decentralized LLM Training System on Geo-distributed GPUs with Adaptive Compression [55.992528247880685]
分散トレーニングは、システム設計と効率に関する重要な課題に直面します。
大規模深層ニューラルネットワーク(DNN)のトレーニング用に設計・実装された分散トレーニングシステムFusionLLMを提案する。
本システムと手法は,収束性を確保しつつ,ベースライン法と比較して1.45~9.39倍の高速化を実現可能であることを示す。
論文 参考訳(メタデータ) (2024-10-16T16:13:19Z) - Latency-aware Unified Dynamic Networks for Efficient Image Recognition [72.8951331472913]
LAUDNetは動的ネットワークの理論的および実用的な効率ギャップを橋渡しするフレームワークである。
3つの主要な動的パラダイム - 適応型計算、動的層スキップ、動的チャネルスキップ - を統合している。
これにより、V100,3090やTX2 GPUのようなプラットフォーム上で、ResNetのようなモデルの遅延を50%以上削減できる。
論文 参考訳(メタデータ) (2023-08-30T10:57:41Z) - Dynamic Split Computing for Efficient Deep Edge Intelligence [78.4233915447056]
通信チャネルの状態に基づいて最適な分割位置を動的に選択する動的分割計算を導入する。
本研究では,データレートとサーバ負荷が時間とともに変化するエッジコンピューティング環境において,動的スプリットコンピューティングが高速な推論を実現することを示す。
論文 参考訳(メタデータ) (2022-05-23T12:35:18Z) - Instant Neural Graphics Primitives with a Multiresolution Hash Encoding [67.33850633281803]
品質を犠牲にすることなく、より小さなネットワークを使用できる汎用的な新しい入力符号化を提案する。
小さなニューラルネットワークは、勾配降下によって値が最適化された訓練可能な特徴ベクトルの多分解能ハッシュテーブルによって拡張される。
数桁の高速化を実現し、高品質なニューラルネットワークプリミティブを数秒でトレーニングすることができる。
論文 参考訳(メタデータ) (2022-01-16T07:22:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。