論文の概要: Axon: A Synthesizing Superoptimizer for Tensor Programs
- arxiv url: http://arxiv.org/abs/2606.26344v1
- Date: Wed, 24 Jun 2026 19:37:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.064151
- Title: Axon: A Synthesizing Superoptimizer for Tensor Programs
- Title(参考訳): Axon: テンソルプログラムのための合成超最適化器
- Abstract要約: 本稿では、テンソルプログラムの超最適化であるAxonを紹介する。
プログラム合成を使用して、セマンティックス仕様からターゲット命令を自動的に生成する。
その後、ISA命令をターゲットとするテンソル操作を減らし、ハードウェア記述に制約されたタイリング構成を探索し、演算子と命令を融合してメモリトラフィックを最小化する。
- 参考スコア(独自算出の注目度): 3.796387190665545
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Writing high performance kernels for AI accelerators requires deep expertise in tiling, instruction selection, data layout, and operator fusion placing a significant burden on programmers. In this paper, we focus on tile based AI accelerator programs and present Axon, a synthesizing superoptimizer for tensor programs: it uses program synthesis to automatically generate target instructions from semantics specifications, and explores semantically equivalent program variants to select the best performing kernel empirically. Axon discovers algebraic transformations by propagating operators through computation graphs and uses SMT over unbounded tensors to guarantee that all transformations preserve semantics without requiring hand crafted rewrite rules. It then lowers tensor operations to target ISA instructions, explores tiling configurations constrained by hardware descriptions, and fuses operators and instructions to minimize memory traffic.
- Abstract(参考訳): AIアクセラレーターのための高性能カーネルを書くには、タイリング、命令の選択、データレイアウト、演算子融合に関する深い専門知識が必要である。
本稿では、タイルベースのAIアクセラレータプログラムと、テンソルプログラムの合成スーパー最適化であるAxonに着目し、プログラム合成を用いてセマンティックス仕様からターゲット命令を自動的に生成し、セマンティックに等価なプログラム変種を探索し、最も優れたカーネルを経験的に選択する。
アクソンは演算子を計算グラフを通して伝播させることで代数変換を発見し、すべての変換が手作りの書き換え規則を必要とせずセマンティックスを保存することを保証するために無界テンソル上でSMTを使用する。
その後、ISA命令をターゲットとするテンソル操作を減らし、ハードウェア記述に制約されたタイリング構成を探索し、演算子と命令を融合してメモリトラフィックを最小化する。
関連論文リスト
- AutoVecCoder: Teaching LLMs to Generate Explicitly Vectorized Code [69.84692701646769]
AutoVecCoderは、大規模言語モデルに自動明示的ベクトル化機能を持たせるために設計された新しいフレームワークである。
自動データ合成パイプラインであるVecPromptは、ドメイン固有の固有の知識を注入する。
強化学習フレームワークであるVecRLは、コード生成と実行効率を一致させる。
このフレームワークでトレーニングされたAutoVecCoder-8Bは、SimdBenchのSSEおよびAVXサブセット上で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-05-18T07:33:15Z) - QiMeng-Xpiler: Transcompiling Tensor Programs for Deep Learning Systems with a Neural-Symbolic Approach [25.521351239401287]
不均一深層学習システム (DLS) は産業用データセンターに広く導入されている。
そこで我々は,DLSをまたいでプログラムを自動的に翻訳する新しいトランスコンパイラ,すなわちQiMeng-Xpilerを提案する。
その結果、DLSのプログラミングは、レガシプログラムをトランスコンパイルすることで最大9倍改善される。
論文 参考訳(メタデータ) (2025-05-04T15:14:27Z) - Guided Tensor Lifting [54.10411390218929]
機械学習のためのドメイン固有言語(s)は、機械学習ワークロードのスピードと効率に革命をもたらしている。
これらの機能を利用するには、ユーザはまず、現在記述されている言語からレガシーコードを新しいDSLに変換する必要があります。
これらのDSLにコードを自動的に持ち込むプロセスは、プログラム合成を解決策として提案する最近のいくつかの研究によって特定されている。
論文 参考訳(メタデータ) (2025-04-28T12:00:10Z) - Hexcute: A Tile-based Programming Language with Automatic Layout and Task-Mapping Synthesis [8.742879659920643]
Hexcuteはタイルベースのプログラミング言語で、共有メモリとレジスタの抽象化を公開し、混合型演算子のきめ細かい最適化を可能にする。
レイアウトとタスクマッピングの合成を、新しい型推論ベースのアルゴリズムで自動化する。
評価の結果,Hexcute は広い範囲の DL 演算子に一般化し,混合型演算子に対する既存の DL コンパイラよりも 1.7-11.28$times$ の高速化を実現し,エンドツーエンド評価では 2.91$times$ の高速化を実現している。
論文 参考訳(メタデータ) (2025-04-22T19:01:28Z) - Use Your INSTINCT: INSTruction optimization for LLMs usIng Neural bandits Coupled with Transformers [66.823588073584]
大規模言語モデル (LLM) は命令追従能力に優れ、様々なアプリケーションで優れた性能を発揮している。
最近の研究は、ブラックボックスLLMに与えられる命令を自動的に最適化するために、クエリ効率のよいベイズ最適化(BO)アルゴリズムを用いている。
NNサロゲートによりBOのGPを置換し,ブラックボックスLLMの命令を最適化するニューラルバンディットアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-10-02T02:01:16Z) - Guess & Sketch: Language Model Guided Transpilation [59.02147255276078]
学習されたトランスパイレーションは、手作業による書き直しやエンジニアリングの取り組みに代わるものだ。
確率的ニューラルネットワークモデル(LM)は、入力毎に可塑性出力を生成するが、正確性を保証するコストがかかる。
Guess & Sketch は LM の特徴からアライメントと信頼性情報を抽出し、意味的等価性を解決するためにシンボリック・ソルバに渡す。
論文 参考訳(メタデータ) (2023-09-25T15:42:18Z) - Performance Embeddings: A Similarity-based Approach to Automatic
Performance Optimization [71.69092462147292]
パフォーマンス埋め込みは、アプリケーション間でパフォーマンスチューニングの知識伝達を可能にする。
本研究では, 深層ニューラルネットワーク, 密度およびスパース線形代数合成, および数値風速予測ステンシルのケーススタディにおいて, この伝達チューニング手法を実証する。
論文 参考訳(メタデータ) (2023-03-14T15:51:35Z) - Hidet: Task Mapping Programming Paradigm for Deep Learning Tensor
Programs [11.338285393619042]
本稿では,スケジューリングプロセスをテンソルプログラムに組込み,タスクマッピングと呼ばれる専用マッピングを用いて計算の割り当てと順序付けを定義することを提案する。
提案するパラダイムでは、深層学習コンパイラであるHietを実装しています。
論文 参考訳(メタデータ) (2022-10-18T05:32:13Z) - Tensor Relational Algebra for Machine Learning System Design [7.764107702934616]
本稿では、リレーショナルテンソル代数(TRA)と呼ばれる別の実装抽象化を提案する。
TRA は、リレーショナル代数に基づく集合基底代数である。
我々の実証研究は、最適化されたTRAベースのバックエンドが、分散クラスタでMLを実行する際の選択肢を大幅に上回っていることを示している。
論文 参考訳(メタデータ) (2020-09-01T15:51:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。