論文の概要: Meganeura: Portable GPU Training and Inference through Vulkan and Metal
- arxiv url: http://arxiv.org/abs/2608.01563v1
- Date: Mon, 03 Aug 2026 00:42:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.286959
- Title: Meganeura: Portable GPU Training and Inference through Vulkan and Metal
- Title(参考訳): Meganeura: VulkanとMetalによるポータブルGPUトレーニングと推論
- Authors: Dzmitry Malyshau,
- Abstract要約: Meganeura氏は、ひとつのコンパクトなネイティブコンパイラが、コンシューマGPU上の両方のフェーズにまたがることができるかどうかを尋ねている。
NVIDIAとAMDの離散GPUで、マッチした5つのワークロードとPyTorchを比較した。
その結果,一般消費者のグラフィクスAPIは,コンパクトな共有トレイン・ツー・デプロイスタックを,時としてベンダ・コンペティティブなパフォーマンスでサポートできることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training and deployed inference often cross export, conversion, and platform-specific runtime boundaries. Meganeura asks whether one compact native compiler can span both phases on consumer GPUs. Its typed static graph, automatic differentiation, optimizer, checkpoint, memory planner, and runtime lower specialized programs through Vulkan and Metal. We compare five matched workloads with PyTorch on NVIDIA and AMD discrete GPUs, an AMD APU, Apple silicon, and an Intel iGPU. The protocol separates strict f32 from validated fast paths and gates forward and backward independently. Forty-eight of 50 device-workload-mode cells pass both gates; the other two share one unresolved backward-reference disagreement on a newly supported APU. In strict f32, Meganeura wins 12 of 20 GPU-referenced minimal-latency cells and has a median valid training gap of 1.8x. On the discrete AMD GPU, four of five inference workloads are within 1.10x of compiled ROCm PyTorch and three training workloads are faster. Under accelerated contracts, the worst training gap is 4.6x. Compilation takes 0.1-2.4 seconds versus 6-96 seconds for torch.compile on supported GPU paths; the stripped binary is 13 MiB. Dispatch profiles localize the largest gaps to convolution derivatives and attention backward. A physical Android XR case study transfers a Meganeura-trained decoder into an Adreno/OpenXR application sharing the graphics queue. The results show that general consumer graphics APIs can support a compact shared train-to-deploy stack at useful, sometimes vendor-competitive performance. The measured gaps point to kernel coverage, scheduling, and arithmetic policy rather than an identified API limitation.
- Abstract(参考訳): トレーニングとデプロイの推論は、しばしばエクスポート、変換、プラットフォーム固有のランタイム境界を越えて行われる。
Meganeura氏は、ひとつのコンパクトなネイティブコンパイラが、コンシューマGPU上の両方のフェーズにまたがることができるかどうかを尋ねている。
型付けされた静的グラフ、自動微分、オプティマイザ、チェックポイント、メモリプランナー、そして実行時に、VulkanとMetalを通じて特別なプログラムを下げる。
我々は、NVIDIAとAMDの離散GPU、AMD APU、Apple Silicon、Intel iGPUのPyTorchにマッチしたワークロードを5つ比較した。
このプロトコルは厳密なf32と検証済みの高速パスとゲートを独立して分離する。
50個のうち48個は両ゲートを通過し、残りの2個は新たにサポートされたAPUで未解決の後方参照不一致を共有している。
厳格なf32では、Meganeuraは、GPUが参照する20の最小レイテンシセルのうち12で勝利し、トレーニングギャップの中央値が1.8倍である。
離散AMD GPUでは、5つの推論ワークロードのうち4つは、コンパイルされたROCm PyTorchの1.10倍以内であり、3つのトレーニングワークロードはより高速である。
加速契約の下では、最悪のトレーニングギャップは4.6倍である。
サポート対象のGPUパスでは、Torch.compileに0.1-2.4秒かかるが、削除されたバイナリは13MiBである。
ディスパッチプロファイルは、畳み込みデリバティブと注意を後方に向ける最大のギャップをローカライズする。
物理Android XRケーススタディでは、Meganeuraでトレーニングされたデコーダを、グラフィックキューを共有するAdreno/OpenXRアプリケーションに転送する。
その結果,一般消費者のグラフィクスAPIは,コンパクトな共有トレイン・ツー・デプロイスタックを,時としてベンダ・コンペティティブなパフォーマンスでサポートできることが示唆された。
測定されたギャップは、特定されたAPI制限ではなく、カーネルのカバレッジ、スケジューリング、演算ポリシーを示している。
関連論文リスト
- Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models [67.17268530365189]
本稿では,Mixture-of-Experts(MoE)モデルのためのメモリ効率のトレーニングスタックを紹介する。
さまざまなレイヤやMoEモデルのトレーニングパイプラインのステージにおいて、さまざまな既存および新しい並列処理テクニックを組み合わせて、特殊化する。
論文 参考訳(メタデータ) (2026-07-02T08:06:57Z) - Characterizing WebGPU Dispatch Overhead for LLM Inference Across Four GPU Vendors, Three Backends, and Three Browsers [0.0]
WebGPUのセキュリティを重視した設計では、ニューラルネットワーク推論において、多数の小さなディスパッチにまたがる化合物の操作毎の検証が義務付けられている。
バッチサイズ1のLLM推論のためのWebGPUディスパッチオーバーヘッドを,4つのベンダ(NVIDIA,AMD,Apple,Intel)と2つのネイティブ実装(Dawn,wgpu-native)と3つのブラウザ(Chrome,Safari,Firefox)にまたがるシステマティックな評価を行った。
私たちの主なコントリビューションはシーケンシャルなディスパッチ手法です。
論文 参考訳(メタデータ) (2026-02-09T20:14:42Z) - Characterization of GPU TEE Overheads in Distributed Data Parallel ML Training [7.236249885667945]
信頼できるコンピューティング(CC)または信頼できる実行エンクレーブ(TEE)は、クラウドでセキュアなコンピューティングを実現するための最も一般的なアプローチである。
NVIDIAによるGPU TEEの導入により、モデルウェイトやデータをクラウドプロバイダにリークすることなく、マシンラーニング(ML)モデルをトレーニングすることが可能になった。
本稿では,GPU TEEを用いた分散データ並列(DDP)MLトレーニングの実行に伴う性能オーバーヘッドについて,詳細な解析を行った。
論文 参考訳(メタデータ) (2025-01-20T22:23:50Z) - Scaling Tractable Probabilistic Circuits: A Systems Perspective [53.76194929291088]
PyJuiceは、いくつかの点で先行技術を改善するPCの一般的な実装設計である。
大規模PCのトレーニングでは、既存のシステムよりも1~2桁高速である。
PyJuiceは2~5倍のメモリを消費するので、より大きなモデルをトレーニングすることができます。
論文 参考訳(メタデータ) (2024-06-02T14:57:00Z) - PockEngine: Sparse and Efficient Fine-tuning in a Pocket [62.955793932377524]
さまざまなエッジデバイスで微調整が可能な,小型でスパースで効率的なエンジンであるPockEngineを紹介します。
PockEngineはスパースバックプロパゲーションをサポートし、測定メモリの節約とレイテンシの削減でモデルをスパース更新する。
注目すべきなのは、PockEngineはNVIDIA Jetson AGX OrinのLLaMav2-7Bを550トークン/秒で微調整できることだ。
論文 参考訳(メタデータ) (2023-10-26T19:46:11Z) - FlexGen: High-Throughput Generative Inference of Large Language Models
with a Single GPU [89.2451963569343]
FlexGenは、単一のコモディティGPU上で大きな言語モデル(LLM)推論を実行するための世代エンジンである。
1つの16GB GPU上でOPT-175Bを実行する場合、FlexGenは最先端のオフロードシステムに比べてスループットが大幅に向上する。
HELMベンチマークでは、FlexGenは7つの代表サブシナリオに16GBのGPUで30Bモデルを21時間でベンチマークすることができる。
論文 参考訳(メタデータ) (2023-03-13T05:19:28Z) - Heterogeneous Acceleration Pipeline for Recommendation System Training [1.8457649813040096]
レコメンデーションモデルは、ディープラーニングネットワークと大規模な埋め込みテーブルに依存している。
これらのモデルは一般的に、ハイブリッドGPUまたはGPUのみの設定を使用してトレーニングされる。
本稿ではヘテロジニアスなCPUアクセラレーションパイプラインであるHotlineを紹介する。
論文 参考訳(メタデータ) (2022-04-11T23:10:41Z) - Hybrid Models for Learning to Branch [81.93868699246214]
我々はCPUマシン上で効率的な分岐を行うための新しいハイブリッドアーキテクチャを提案する。
提案アーキテクチャは,GNNの表現力と分岐処理のための計算コストの低い多層パーセプトロン(MLP)を組み合わせる。
論文 参考訳(メタデータ) (2020-06-26T21:03:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。