論文の概要: Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
- arxiv url: http://arxiv.org/abs/2604.10180v1
- Date: Sat, 11 Apr 2026 12:19:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:15.894088
- Title: Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
- Title(参考訳): Tessera:カーネル・グラニュラリティ・デアグリゲーションによる異種GPUのロック解除
- Authors: Tiancheng Hu, Jin Qin, Zheng Wang, Junhao Hu, Yuzheng Wang, Lei Chen, Yizhou Shan, Mingxing Zhang, Ting Cao, Chunwei Xia, Huimin Cui, Tao Xie, Chenxi Wang,
- Abstract要約: Tesseraは、大規模なモデル推論のための異種GPUの性能とコスト効率を改善する最初のカーネルデアグリゲーションシステムである。
私たちの重要な洞察は、単一のアプリケーション内のカーネルは多様なリソース要求を示しており、ハードウェア機能に合わせるのに最適な粒度になっているということです。
- 参考スコア(独自算出の注目度): 28.460540141249925
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Disaggregation maps parts of an AI workload to different types of GPUs, offering a path to utilize modern heterogeneous GPU clusters. However, existing solutions operate at a coarse granularity and are tightly coupled to specific model architectures, leaving much room for performance improvement. This paper presents Tessera, the first kernel disaggregation system to improve performance and cost efficiency on heterogeneous GPUs for large model inference. Our key insight is that kernels within a single application exhibit diverse resource demands, making them the most suitable granularity for aligning computation with hardware capabilities. Tessera integrates offline analysis with online adaptation by extracting precise inter-kernel dependencies from PTX to ensure correctness, overlapping communication with computation through a pipelined execution model, and employing workload-aware scheduling with lightweight runtime adaptation. Extensive evaluations across five heterogeneous GPUs and four model architectures, scaling up to 16 GPUs, show that Tessera improves serving throughput and cost efficiency by up to 2.3x and 1.6x, respectively, compared to existing disaggregation methods, while generalizing to model architectures where prior approaches do not apply. Surprisingly, a heterogeneous GPU pair under Tessera can even exceed the throughput of two homogeneous high-end GPUs at a lower cost.
- Abstract(参考訳): DisaggregationはAIワークロードの一部をさまざまなタイプのGPUにマッピングし、現代的な異種GPUクラスタを利用するためのパスを提供する。
しかし、既存のソリューションは粗い粒度で動作し、特定のモデルアーキテクチャと密結合しているため、パフォーマンス改善の余地がたくさんある。
本稿では,大規模なモデル推論のためのヘテロジニアスGPUの性能向上とコスト効率向上を目的とした,最初のカーネルデアグリゲーションシステムであるTesseraを提案する。
私たちの重要な洞察は、単一のアプリケーション内のカーネルは多様なリソース要求を示しており、計算とハードウェア機能との整合に最適な粒度になっているということです。
Tesseraはオフライン解析をオンライン適応と統合し、PTXから正確なカーネル間の依存関係を抽出して正確性を確保し、パイプライン化された実行モデルを通じて計算との通信を重複させ、軽量ランタイム適応によるワークロード対応スケジューリングを採用する。
5つのヘテロジニアスGPUと4つのモデルアーキテクチャで、最大16個のGPUをスケーリングすることで、Tesseraは既存の非凝集法と比較してスループットとコスト効率を最大2.3倍、1.6倍改善し、従来のアプローチが適用されないモデルアーキテクチャに一般化したことを示している。
驚くべきことに、Tesseraの下にある異種GPUペアは、2つの同種ハイエンドGPUのスループットを低コストで上回ることができる。
関連論文リスト
- GPU-Accelerated Algorithms for Graph Vector Search: Taxonomy, Empirical Study, and Research Directions [54.570944939061555]
本稿では,GPU加速グラフに基づくベクトル探索アルゴリズムについて包括的に研究する。
我々は、GPU最適化戦略の詳細な分類を確立し、アルゴリズムタスクとハードウェア実行ユニット間のマッピングを明確にする。
我々の発見は、スケーラブルで堅牢なGPUベースの近接検索システムを設計するための明確なガイドラインを提供する。
論文 参考訳(メタデータ) (2026-02-10T16:18:04Z) - A Scalable Multi-GPU Framework for Encrypted Large-Model Inference [5.966282323502589]
完全同型暗号化(FHE)を使用した暗号化AIは、強力なプライバシ保証を提供する。
最近の研究はFHEを加速するためにASICを提案しているが、計算を制約する高価な先進的な製造プロセスを必要としている。
本稿では,大規模モデル上でのFHE推論のためのマルチGPUフレームワークであるCeriumについて述べる。
論文 参考訳(メタデータ) (2025-12-12T04:15:38Z) - ParallelKittens: Systematic and Practical Simplification of Multi-GPU AI Kernels [40.94392896555992]
既存のシステムは、計算通信の重複によってこれを緩和するが、しばしばワークロードと新しいアクセラレータ間の理論的帯域幅を満たさない。
演算子固有のテクニックの代わりに、簡単な再利用可能な原則の小さなセットが、ワークロードの最適なパフォーマンスを導くことができるかどうかを問う。
PKKittens(PK)カーネルは、最大2.33倍の並列ワークロードを実現する。
論文 参考訳(メタデータ) (2025-11-17T21:48:33Z) - NGPU-LM: GPU-Accelerated N-Gram Language Model for Context-Biasing in Greedy ASR Decoding [54.88765757043535]
この研究は、統計的なn-gram言語モデルのデータ構造を再考し、GPU最適化推論の高速かつ並列な操作を可能にする。
我々のアプローチは NGPU-LM と呼ばれ、7% 未満の計算オーバーヘッドを持つ全ての主要な ASR モデルに対して、カスタマイズ可能なgreedy decoding を導入している。
提案手法は,ビーム探索による顕著な遅延を回避しつつ,greedy と beam search の精度ギャップの50%以上を排除できる。
論文 参考訳(メタデータ) (2025-05-28T20:43:10Z) - Minute-Long Videos with Dual Parallelisms [57.22737565366549]
Diffusion Transformer (DiT)ベースのビデオ拡散モデルは、大規模に高品質なビデオを生成するが、長いビデオの処理遅延とメモリコストは禁じられている。
我々はDualParalと呼ばれる新しい分散推論戦略を提案する。
1つのGPUでビデオ全体を生成する代わりに、時間フレームとモデルレイヤの両方をGPU間で並列化します。
論文 参考訳(メタデータ) (2025-05-27T11:55:22Z) - HETHUB: A Distributed Training System with Heterogeneous Cluster for Large-Scale Models [17.08669201975141]
大規模モデルのトレーニングは、膨大な数のコンピューティングリソースに依存している。
ひとつのタイプのGPUアクセラレータを備えた大規模クラスタを構築するのは、非常に難しい。
本稿では,大規模モデルを対象としたハイブリッド並列処理を用いた分散トレーニングシステムHETHUBを提案する。
論文 参考訳(メタデータ) (2024-05-25T14:36:35Z) - Adaptive Elastic Training for Sparse Deep Learning on Heterogeneous
Multi-GPU Servers [65.60007071024629]
本稿では,Adaptive SGDが4つの最先端ソリューションよりも精度が高いことを示す。
本稿では,Adaptive SGDが時間と精度で4つの最先端ソリューションより優れていることを示す。
論文 参考訳(メタデータ) (2021-10-13T20:58:15Z) - Kernel methods through the roof: handling billions of points efficiently [94.31450736250918]
カーネル法は、非パラメトリック学習に対するエレガントで原則化されたアプローチを提供するが、今のところ大規模な問題ではほとんど利用できない。
最近の進歩は、最適化、数値線形代数、ランダム射影など、多くのアルゴリズム的アイデアの利点を示している。
ここでは、これらの取り組みをさらに進めて、GPUハードウェアを最大限に活用する解決器を開発し、テストする。
論文 参考訳(メタデータ) (2020-06-18T08:16:25Z) - Heterogeneous CPU+GPU Stochastic Gradient Descent Algorithms [1.3249453757295084]
ヘテロジニアスCPU+GPUアーキテクチャの深層学習のためのトレーニングアルゴリズムについて検討する。
私たちの2倍の目標 -- 収束率と資源利用を同時に最大化する -- は、この問題を難しくします。
これらのアルゴリズムの実装は,複数の実データセットよりも高速な収束と資源利用の両立を実現していることを示す。
論文 参考訳(メタデータ) (2020-04-19T05:21:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。