論文の概要: Nova: An End-to-End MLIR Compiler for Deep Learning
- arxiv url: http://arxiv.org/abs/2608.00029v1
- Date: Wed, 15 Jul 2026 05:16:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-09 10:00:34.257027
- Title: Nova: An End-to-End MLIR Compiler for Deep Learning
- Title(参考訳): Nova: ディープラーニングのためのエンドツーエンドMLIRコンパイラ
- Authors: Adwaid Suresh, Aparna A, Harshini V M, Jona Delcy C A, Killi Uma Maheswara Rao, Ram Charan Golla, Surendra Vendra,
- Abstract要約: 我々は、Novaがオペレーション境界を越えて操作を融合し、複雑なメモリ階層を最適化し、レジスタレベルまで実行をチューニングする方法を示す。
PyTorchと比較してメモリフットプリントを最大29%削減することで、Novaは17,900トークン/秒で144万のパラメータモデルをトレーニングした。
ノヴァマッチは、ほとんどの形状のTF32マトゥール上のcuBLASとXLAをわずかに上回り、強い5e-4相対誤差を保っている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The performance of deep learning models at scale relies heavily on how effectively high-level mathematical operations are mapped to underlying physical hardware. While high-level tensor frameworks provide flexible abstractions for model design, their eager execution models inherently lack the whole-graph visibility and granular control over hardware and memory required to maximize physical hardware utilization natively. To bridge this gap, we designed Nova, an automated end-to-end JIT compiler whose defining purpose is to achieve absolute control over this hardware mapping: fusing operations across operation boundaries, optimizing complex memory hierarchies, and tuning execution down to the register level. By capturing eager executions and unifying forward and backward passes into a single value-semantic dialect, Nova unlocks aggressive whole-graph optimizations. It then utilizes an Analytic Configurator to deterministically derive optimal execution schedules based on arithmetic intensity, dropping search time to zero. Backed by a structural hashing runtime, Nova synthesizes fine-grained kernels directly from the computation's structure. In our evaluations on an RTX 3060, Nova matches or modestly exceeds cuBLAS and XLA on TF32 matmuls on most shapes, maintaining a stringent < 5e-4 relative error. At the model level, Nova achieves up to 10.6% greater throughput than PyTorch and 4.4% greater than XLA on a 42-million parameter model, without compromising on numerical fidelity. Crucially, by reducing the memory footprint by up to 29% relative to PyTorch, Nova successfully trains a 144-million parameter model at 17,900 tokens/s where PyTorch encounters Out-Of-Memory (OOM) failures on the same 12 GB consumer GPU.
- Abstract(参考訳): 大規模なディープラーニングモデルの性能は、基礎となる物理ハードウェアにいかに効果的に高レベルの数学的操作がマッピングされるかに大きく依存している。
高レベルのテンソルフレームワークは、モデル設計の柔軟な抽象化を提供するが、その熱心な実行モデルは本質的に、物理ハードウェアの利用をネイティブに最大化するために必要なハードウェアとメモリ全体の可視性と粒度の制御を欠いている。
このギャップを埋めるため、我々はNovaを設計しました。Novaは、このハードウェアマッピングの絶対的な制御を実現することを目的としている自動エンドツーエンドJITコンパイラで、オペレーション境界を越えて操作を融合させ、複雑なメモリ階層を最適化し、レジスタレベルまで実行をチューニングします。
熱心に実行をキャプチャし、前方と後方を統一することで、Novaは攻撃的な全グラフ最適化をアンロックする。
次に、解析構成器を用いて、算術的強度に基づいて最適な実行スケジュールを決定的に導出し、探索時間をゼロにする。
構造ハッシュランタイムによってバックアップされたNovaは、計算の構造から直接きめ細かいカーネルを合成する。
RTX 3060 における評価において,Nova は TF32 の乗算で cuBLAS と XLA をわずかに上回り, 相対誤差は 5e-4 である。
モデルレベルでは、NovaはPyTorchよりも最大10.6%、XLAより4.4%のスループットを実現している。
重要なのは、PyTorchと比較してメモリフットプリントを最大29%削減することで、Novaは同じ12GBの消費者向けGPU上で、PyTorchがOOM(Out-Of-Memory)障害に遭遇する17,900トークン/秒で144万のパラメータモデルをトレーニングすることに成功している。
関連論文リスト
- KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch? [13.026983194416168]
大きな言語モデル(LLM)は、KernelBenchのようなベンチマークでPyTorchを上回っているように見えるカスタムカーネルを生成することができる。
We demonstrate that frontier models often involved in reward hacking to artificially inflate performance。
論文 参考訳(メタデータ) (2026-06-26T03:22:50Z) - Resource-Efficient Iterative LLM-Based NAS with Feedback Memory [49.44875022114861]
ニューラルアーキテクチャサーチ(NAS)はネットワーク設計を自動化するが、従来の手法ではかなりの計算資源を必要とする。
本稿では,大規模言語モデル(LLM)を活用して,畳み込みニューラルネットワークアーキテクチャを反復的に生成し,評価し,洗練するクローズドループパイプラインを提案する。
論文 参考訳(メタデータ) (2026-03-12T16:00:22Z) - Memory-Efficient Acceleration of Block Low-Rank Foundation Models on Resource Constrained GPUs [11.45717904490388]
トランスフォーマーベースの基盤モデルの最近の進歩は、多くのタスクのデフォルト選択となった。
その急速に成長するサイズは、単一のGPUに完全なモデルを適合させることがますます難しくなり、計算コストが禁じられる。
ブロック低ランク(BLR)圧縮技術は、重み行列のコンパクト表現を学習することでこの問題に対処する。
論文 参考訳(メタデータ) (2025-12-24T00:41:13Z) - Omniwise: Predicting GPU Kernels Performance with LLMs [0.06666419797034795]
Omniwiseは、GPUカーネルのパフォーマンス予測に大規模言語モデル(LLM)を適用する、エンド・ツー・エンドの自己教師型微調整パイプラインである。
メモリ帯域幅、キャッシュヒット率、GFLOP、演算強度などの重要なパフォーマンス指標を、コード実行やプロファイリングツールを必要とせずに、カーネルコードから直接予測することができる。
提案手法は,AMD MI250およびMI300Xアーキテクチャ上で実行されるGPUカーネル上での相対誤差の10%以内の予測を90%以上達成する。
論文 参考訳(メタデータ) (2025-06-25T23:36:44Z) - Test-Time Training Done Right [61.8429380523577]
テスト時間トレーニング(TTT)モデルは、推論中にモデルの重みの一部を適応させることによってコンテキストをモデル化する。
既存のTT手法は、長文データを扱う上で有効性を示すのに苦労した。
我々は,大規模チャンクテストタイムトレーニング(LaCT)を開発し,ハードウェア利用率を桁違いに向上させる。
論文 参考訳(メタデータ) (2025-05-29T17:50:34Z) - Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers [65.35142508909892]
AxoNNと呼ばれる,スケーラブルでポータブルなオープンソースフレームワークで実装された新しい4次元ハイブリッド並列アルゴリズムを提案する。
本稿では,Frontier 上で AxoNN を用いて405ビリオンパラメータ LLM の微調整を行う。
論文 参考訳(メタデータ) (2025-02-12T06:05:52Z) - Pruning Large Language Models with Semi-Structural Adaptive Sparse Training [17.381160429641316]
Adaptive Sparse Trainer (AST)は、半構造化スパースモデルに適した、新規で効率的なリトレーニングフレームワークである。
ASTは、密度と2:4の半構造化スパースモデルのパープレキシティとゼロショット精度のギャップをそれぞれ0.6と1.16%に削減する。
論文 参考訳(メタデータ) (2024-07-30T06:33:44Z) - QLoRA: Efficient Finetuning of Quantized LLMs [66.58009990713134]
我々は,48GBのGPU上で65Bパラメータモデルを微調整するのに十分なメモリ使用量を削減する,効率的な微調整手法QLoRAを提案する。
QLoRAは凍結した4ビット量子化事前学習言語モデルを通して低ランクアダプタ(LoRA)に逆伝搬する
最高のモデルファミリであるGuanacoは、Vicunaベンチマークでリリースされたすべてのモデルより優れています。
論文 参考訳(メタデータ) (2023-05-23T17:50:33Z) - Integral Continual Learning Along the Tangent Vector Field of Tasks [112.02761912526734]
本稿では,特殊データセットからの情報を段階的に組み込んだ軽量連続学習手法を提案する。
ソースデータセットの0.4%まで小さく、小さな固定サイズのメモリバッファを保持しており、単純な再サンプリングによって更新される。
提案手法は,異なるデータセットに対して,様々なバッファサイズで高い性能を実現する。
論文 参考訳(メタデータ) (2022-11-23T16:49:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。