論文の概要: An MLIR-Based Compilation Method for Large Language Models
- arxiv url: http://arxiv.org/abs/2607.15865v1
- Date: Fri, 17 Jul 2026 11:24:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.836378
- Title: An MLIR-Based Compilation Method for Large Language Models
- Title(参考訳): MLIRを用いた大規模言語モデルのコンパイル法
- Abstract要約: 本稿では,MLIRを用いた大規模言語モデルに対するコンパイル手法を提案する。
モデルは最初にTopOpとして表現され、次にレイヤ単位のレイヤをTpuOpに下げ、最終的にデプロイ可能なバイナリが生成される。
この方法は、TPU-MLIRコンパイラとLLM-TPUデプロイメントプロジェクトで実装されている。
- 参考スコア(独自算出の注目度): 9.14762452723213
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have become the dominant workload on modern AI accelerators, yet deploying them on specialized hardware still faces two core challenges: how to import a trained model into a compiler-friendly intermediate representation, and how to efficiently schedule the autoregressive inference loop under limited on-chip memory. This paper presents an MLIR (Multi-Level Intermediate Representation) based compilation method for large language models, illustrated using two dialects of operators, TopOp and TpuOp. TopOp serves as a high-level graph dialect that is independent of both the source framework and the target chip, and is responsible for expressing model semantics; TpuOp serves as the target hardware dialect, carrying chip-related decisions such as quantization, layer groups, and memory layout. A model is first represented as TopOp, then lowered layer by layer to TpuOp, and finally a deployable binary is generated. In addition, each Transformer layer is split into three stages for static compilation: prefill, prefill_kv (prefill with historical key-value cache), and decode, so as to accommodate the different computational characteristics of prompt-parallel processing and per-token generation. The method has been implemented in the TPU-MLIR compiler{https://github.com/sophgo/tpu-mlir} and the LLM-TPU deployment project\footnote{https://github.com/sophgo/LLM-TPU}, supporting a variety of generative models including the Qwen, Llama, InternVL, and MiniCPM-V series, as well as multiple quantization and deployment forms such as GPTQ, AWQ, and AutoRound.
- Abstract(参考訳): 大規模言語モデル(LLM)は、現代のAIアクセラレーターにおいて支配的なワークロードとなっているが、特別なハードウェアにデプロイする上で、トレーニングされたモデルをコンパイラフレンドリな中間表現にインポートする方法と、オンチップメモリの制限下で自動回帰推論ループを効率的にスケジュールする方法の2つの主要な課題に直面している。
本稿では,TopOp と TpuOp の2つの方言を用いて,MLIR (Multi-Level Intermediate Representation) を用いた大規模言語モデルのためのコンパイル手法を提案する。
TopOpは、ソースフレームワークとターゲットチップの両方に依存しない高レベルのグラフ方言として機能し、モデルセマンティクスを表現する。
モデルは最初にTopOpとして表現され、次にレイヤ単位のレイヤをTpuOpに下げ、最終的にデプロイ可能なバイナリが生成される。
さらに、各トランスフォーマー層は、プリフィル(prefill)、プリフィル(prefill)_kv(prefill)、デコード(decode)の3つのステージに分けられ、プロンプト並列処理とトーケン生成の異なる計算特性に対応する。
この方法は TPU-MLIR コンパイラ{https://github.com/sophgo/tpu-mlir} と LLM-TPU デプロイメントプロジェクト\footnote{https://github.com/sophgo/LLM-TPU} で実装されており、Qwen、Llama、InternVL、MiniCPM-V シリーズ、GPTQ、AWQ、AutoRound といった複数の量子化および展開形式をサポートする。
関連論文リスト
- ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs [48.87461975674182]
マルチモーダル大言語モデルのための並列ビジョンランゲージ(ParVL)スケーリングフレームワークについて紹介する。
ParVLは、既存のViTとLLMのバックボーンパラメータを複数のビジョンと言語ブランチで再利用することで、並列計算をスケールする。
また,ParVLは,シングルブランチベースラインよりも総合的なマルチモーダル性能を向上することを示す。
論文 参考訳(メタデータ) (2026-08-04T17:59:58Z) - Stacked from One: Multi-Scale Self-Injection for Context Window Extension [69.24689919827817]
Modelnameは、多粒度コンテキスト圧縮とクエリ対応情報取得に基づく新しいフレームワークである。
modelnameachievesパフォーマンスは、強いベースラインと同等か、優れている。
論文 参考訳(メタデータ) (2026-03-05T03:16:16Z) - nncase: An End-to-End Compiler for Efficient LLM Deployment on Heterogeneous Storage Architectures [7.460240094212613]
さまざまなターゲットに対して最適化を統合するために設計された、エンドツーエンドのコンパイルフレームワークであるnncaseを提示する。
nncaseは、異種コンピューティングユニットに適応するためのAuto Vectorize、並列戦略を検索するためのAuto Distribution、オンチップキャッシュのローカリティを最大化するAuto Scheduleの3つの重要なモジュールを統合している。
論文 参考訳(メタデータ) (2025-12-25T08:27:53Z) - Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing [8.705453442427585]
大規模言語モデル(LLM)は様々な推論タスクでほぼ人間に近い性能を達成した。
リソース制約のあるIoT(Internet-of-Things)デバイスへのデプロイメントは、大量のパラメータフットプリントとメモリ集約型の自己回帰デコーディングのため、依然として現実的ではない。
この研究は、エッジデバイスにLLMを配置するために明示的に設計された最初の自動回帰対応分割コンピューティングフレームワークを紹介した。
論文 参考訳(メタデータ) (2025-11-06T02:55:07Z) - Frame-Stacked Local Transformers For Efficient Multi-Codebook Speech Generation [13.289870835946347]
大規模言語モデル(LLM)に基づく音声生成モデルは、テキストトークンと基本的に異なる離散音響符号で動作する。
各段階において、モデルはNのコードブックエントリを共同で予測し、単純な並列予測アプローチに挑戦する依存関係を導入する必要がある。
これを解決するために階層戦略では、ローカルトランスフォーマー(LT)を使用して予測を洗練し、タイムステップ内依存関係をキャプチャする。
本稿では,計算効率や合成忠実度などのデプロイメントの優先順位に基づいて,デコード戦略を選択するための実践的ガイドラインを提案する。
論文 参考訳(メタデータ) (2025-09-23T21:31:00Z) - Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition [95.54406667705999]
Pangu Embeddedは、Ascend Neural Processing Units (NPU) 上で開発された効率的なLarge Language Model (LLM) 推論器である。
既存の推論最適化 LLM でよく見られる計算コストと推論遅延の問題に対処する。
単一の統一モデルアーキテクチャ内で、迅速な応答と最先端の推論品質を提供する。
論文 参考訳(メタデータ) (2025-05-28T14:03:02Z) - Core Context Aware Transformers for Long Context Language Modeling [50.774702091154204]
高速な長文モデリングのためのCCAアテンションを提案する。
本手法は,学習過程における冗長性を低下させながら,コアコンテキストに自動的に焦点を合わせ,強化する。
提案手法は,既存の大規模言語モデルにおける自己注意モジュールを最小限の微調整コストで置き換えることができる。
論文 参考訳(メタデータ) (2024-12-17T01:54:08Z) - Extreme Compression of Large Language Models via Additive Quantization [59.3122859349777]
我々のアルゴリズムは、AQLMと呼ばれ、情報検索のための古典的な加算量子化(AQ)アプローチを一般化する。
トークン生成のためのAQLMの高速GPUおよびCPU実装を提供しており、最適化されたFP16実装を高速にマッチングまたは性能良くすることができる。
論文 参考訳(メタデータ) (2024-01-11T18:54:44Z) - Sorted LLaMA: Unlocking the Potential of Intermediate Layers of Large
Language Models for Dynamic Inference [32.62084449979531]
SortedNet を Sorted Fine-Tuning (SoFT) に置き換えることで生成 NLP タスクに拡張する。
我々のアプローチはモデル効率を向上し、推論中に様々なシナリオに対する複数のモデルの必要性を排除します。
以上の結果から,SFT+ICT(Early-Exit)と標準ファインチューニング(SFT+ICT)と比較して,サブモデルの優れた性能を示す。
論文 参考訳(メタデータ) (2023-09-16T11:58:34Z) - Speculative Decoding with Big Little Decoder [108.95187338417541]
Big Little Decoder (BiLD) は、幅広いテキスト生成アプリケーションの推論効率と遅延を改善するフレームワークである。
NVIDIA T4 GPUでは、当社のフレームワークは最大2.12倍の高速化を実現し、生成品質の最小化を実現している。
私たちのフレームワークは完全にプラグアンドプレイで、トレーニングプロセスやモデルアーキテクチャの変更なしに適用できます。
論文 参考訳(メタデータ) (2023-02-15T18:55:29Z) - TPU-MLIR: A Compiler For TPU Using MLIR [2.6519283973116963]
TPU-MLIRは、TPU(Processing Unit)と呼ばれるカスタムASICに、トレーニング済みニューラルネットワーク(NN)モデルをデプロイする
NNモデルはTOP方言に変換され、チップの構成に応じて異なるTPUのためにTPU方言に低下する。
MLIRパスパイプラインを使用してTPU上で最適化を行い、マシンコードを生成する方法を示す。
論文 参考訳(メタデータ) (2022-10-23T10:45:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。