論文の概要: Benchmarking Confidential Computing Performance on NVIDIA Blackwell GPUs
- arxiv url: http://arxiv.org/abs/2608.26575v2
- Date: Tue, 01 Sep 2026 01:17:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 14:14:25.841219
- Title: Benchmarking Confidential Computing Performance on NVIDIA Blackwell GPUs
- Title(参考訳): NVIDIA Blackwell GPU上での信頼性コンピューティングパフォーマンスのベンチマーク
- Authors: Amean Asad, Ansgar Grunseid,
- Abstract要約: 本稿では,信頼された実行環境内での大規模言語モデル推論とトレーニングの実行によるパフォーマンスへの影響を計測する。
パフォーマンスへの影響は、単一の物理ホスト上でのシークレットと非シークエンシャル実行のペアから生じる。
それぞれのコストを特定の暗号化されたバウンダリにローカライズし、サブミッションカウント内のサービスペナルティを予測するマイクロベンチマークを提供し、具体的なデプロイメントガイダンスで終了する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper measures the performance impact of running large language model inference and training inside a Trusted Execution Environment (TEE) on NVIDIA B200 GPUs, using Intel Trust Domain Extensions (TDX) confidential VMs together with NVIDIA Confidential Computing (CC) on Blackwell GPUs. The performance impact is derived from paired confidential versus non-confidential runs on a single physical host where the only variable is the GPU CC bit and the TDX guest object in the VM launch. The main result is that confidential inference on Blackwell achieves low single-digit throughput overhead when the stack is configured correctly, at about 1-3%. Stock inference stacks incur 30 to 40% penalties due to avoidable configurations rather than the achievable operating point. The cost is not fully represented by a single number because it is governed by two independent axes, a fixed per-host-operation cost that amortizes as batch size grows and a per-NVLink-traffic cost that tracks the share of the step spent in encrypted collectives, and which of the two dominates is set by the workload and the software. We localize each cost to a specific encrypted boundary, give a microbenchmark that predicts the serving penalty to within a submission count, and end with concrete deployment guidance. GPU compute, energy draw, and usable memory capacity are unaffected by CC.
- Abstract(参考訳): 本稿では,Intel Trust Domain Extensions (TDX)Secret VMとNVIDIA Confidential Computing (CC)を併用した,NVIDIA B200 GPU上でのTrusted Execution Environment (TEE)内での大規模言語モデル推論とトレーニングの実行によるパフォーマンスへの影響を評価する。
パフォーマンスへの影響は、VM起動時のGPU CCビットとTDXゲストオブジェクトが唯一の変数である、単一の物理ホスト上での秘密と機密でない実行のペアから生じる。
主な結果は、ブラックウェルの秘密推論がスタックが正しく構成されたときに1桁のスループットのオーバーヘッドを約1~3%に抑えることである。
ストック推論スタックは、達成可能な操作ポイントではなく、回避可能な構成のため、30から40%のペナルティを発生させる。
このコストは、2つの独立した軸によって管理され、バッチサイズが大きくなるにつれて記憶される固定されたホストごとの運用コストと、暗号化された集合体に費やされたステップの共有を追跡するNVLink単位のトラヒックコストと、2つの支配のどちらがワークロードとソフトウェアによって設定されるため、単一の数字で完全に表現されない。
それぞれのコストを特定の暗号化されたバウンダリにローカライズし、サブミッションカウント内のサービスペナルティを予測するマイクロベンチマークを提供し、具体的なデプロイメントガイダンスで終了する。
GPU計算、エネルギドロー、使用可能なメモリ容量はCCの影響を受けない。
関連論文リスト
- Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models [67.17268530365189]
本稿では,Mixture-of-Experts(MoE)モデルのためのメモリ効率のトレーニングスタックを紹介する。
さまざまなレイヤやMoEモデルのトレーニングパイプラインのステージにおいて、さまざまな既存および新しい並列処理テクニックを組み合わせて、特殊化する。
論文 参考訳(メタデータ) (2026-07-02T08:06:57Z) - The Serialized Bridge: Understanding and Recovering LLM Serving Performance under Blackwell GPU Confidential Computing [6.69555823710995]
GPU-CCはNVIDIA B300上でGPUローカルなパフォーマンスを保ち、BF16 matmulは信頼できないパフォーマンスの0.998倍で動作する。
しかし、Intel TDXとGPU-CCは依然として13~27%のスループットを失い、KV-cache復元のレイテンシは2倍以上になる。
ブリッジモデルは+131%のKVストアのペナルティと34倍のモデルスローダウンを説明する。
論文 参考訳(メタデータ) (2026-06-22T21:48:53Z) - Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs [2.2964417137558457]
NVIDIAのCuTileは、GPUカーネル開発のためのPythonベースのタイル中心の抽象化を導入した。
確立されたアプローチに対するCuTileの独立したクロスアーキテクチャ評価を初めて提示する。
論文 参考訳(メタデータ) (2026-04-25T23:13:47Z) - A Scalable Multi-GPU Framework for Encrypted Large-Model Inference [5.966282323502589]
完全同型暗号化(FHE)を使用した暗号化AIは、強力なプライバシ保証を提供する。
最近の研究はFHEを加速するためにASICを提案しているが、計算を制約する高価な先進的な製造プロセスを必要としている。
本稿では,大規模モデル上でのFHE推論のためのマルチGPUフレームワークであるCeriumについて述べる。
論文 参考訳(メタデータ) (2025-12-12T04:15:38Z) - CompTrack: Information Bottleneck-Guided Low-Rank Dynamic Token Compression for Point Cloud Tracking [43.89894227481455]
LiDARポイントクラウドにおける3Dオブジェクトトラッキングは、コンピュータビジョンと自律運転において重要なタスクである。
成功をおさめたにもかかわらず、ポイントクラウドの本質的な分散性は、二重冗長性の問題をもたらす。
我々は、ポイントクラウドにおける両方の冗長性を体系的に排除する、新しいエンドツーエンドフレームワークであるCompTrackを提案する。
論文 参考訳(メタデータ) (2025-11-19T16:12:24Z) - Scalable GPU-Based Integrity Verification for Large Machine Learning Models [4.301162531343759]
我々は、CPUとGPUプラットフォーム間の整合性保護を標準化することで、分散機械学習を強化するセキュリティフレームワークを提案する。
提案手法は,GPUアクセラレータ上での大規模なMLモデル実行と直接的に整合性検証を行う。
私たちは、基盤となるCPUやGPUインフラストラクチャに関係なく、エンタープライズチームがデプロイできるハードウェアに依存しない基盤を提供します。
論文 参考訳(メタデータ) (2025-10-27T23:45:21Z) - ThunderKittens: Simple, Fast, and Adorable AI Kernels [43.32681787348603]
We present ThunderKittens (TK), a framework for write performanceant AI kernels while rest to use and maintain。
我々は、さまざまなAI操作に対して、以前のカーネルと一致するか、より優れているカーネルを提供することで、TKの価値を示す。
論文 参考訳(メタデータ) (2024-10-27T10:07:16Z) - vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving [53.972175896814505]
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
大規模言語モデル(LLM)は様々なドメインで広く使われ、数百万の日次要求を処理する。
論文 参考訳(メタデータ) (2024-07-22T14:37:58Z) - GME: GPU-based Microarchitectural Extensions to Accelerate Homomorphic Encryption [33.87964584665433]
ホモモルフィック暗号化(FHE)は、暗号化データを復号することなく処理することができる。
FHEは、平文データを使った同じ計算と比較して最大5桁のスローダウンを導入している。
本稿では,3つのキーとなるマイクロアーキテクチャ拡張と,現在のAMD CDNA GPUアーキテクチャへのコンパイル時間最適化を組み合わせたGMEを提案する。
論文 参考訳(メタデータ) (2023-09-20T01:50:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。