論文の概要: WarmTuner: Program-Specific Warm Starts for Compiler Autotuning via Offline-to-Online Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.25831v1
- Date: Tue, 28 Jul 2026 15:11:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.87966
- Title: WarmTuner: Program-Specific Warm Starts for Compiler Autotuning via Offline-to-Online Reinforcement Learning
- Title(参考訳): WarmTuner: オフラインからオンラインへの強化学習によるコンパイラ自動チューニングのためのプログラム特有のウォームスタート
- Abstract要約: 既存のコンパイラ自動チューニング技術は、検索スペースをプルーニングしたり、検索バイアスを注入したり、構成性能を予測したりすることで、チューニングコストを削減する。
我々は、記録をプログラム条件のポリシーに変換するオフラインからオンラインへの強化学習フレームワークであるWarmTunerを提案する。
WarmTunerはGCC-O3で平均1.732倍のスピードアップを達成し、14/30プログラムで最高の結果を得る。
- 参考スコア(独自算出の注目度): 5.936710708376451
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Compilers are fundamental software tools that translate high-level programs into machine code. Modern compilers expose hundreds of optimizations, each turned on or off through an optimization flag, to improve the performance of the generated code. However, the number of possible flag combinations grows exponentially, making it difficult to find a flag configuration well suited to a given target program. Existing compiler auto-tuning techniques reduce tuning cost by pruning the search space, injecting search biases, or predicting configuration performance. Although some exploit program features, the knowledge they extract from historical data is frozen once search begins; runtime feedback then guides only the search itself, never the prior. As a result, when this prior mismatches the target program, these methods waste much of the limited online budget before the search reaches good configurations. We propose WarmTuner, an offline-to-online reinforcement learning framework that instead turns historical records into a program-conditioned policy that predicts each flag's setting over the full flag space and remains adaptable on the target program. Offline, WarmTuner learns this program-conditioned policy over the full flag space from historical good configurations. Online, it refines the same policy on the target program using real compile-run feedback, so that the policy is driven by measured speedups rather than limited to the historical data. We instantiate the online update with Group Relative Policy Optimization (GRPO), which compares candidates in the same round and avoids a separate value model. We evaluate WarmTuner on GCC 15.2.0 with cBench and PolyBench. The results show that WarmTuner achieves an average speedup of 1.732x over GCC -O3 and obtains the best result on 14/30 programs, significantly outperforming the compared techniques.
- Abstract(参考訳): コンパイラは、ハイレベルプログラムをマシンコードに変換する基本的なソフトウェアツールである。
現代のコンパイラは、数百の最適化を公開し、それぞれが最適化フラグをオン/オフして、生成されたコードのパフォーマンスを改善する。
しかし、可能なフラグの組み合わせの数は指数関数的に増加するため、特定のターゲットプログラムに適したフラグ構成を見つけることは困難である。
既存のコンパイラ自動チューニング技術は、検索スペースをプルーニングしたり、検索バイアスを注入したり、構成性能を予測したりすることで、チューニングコストを削減する。
プログラムの特徴を悪用するものもあるが、履歴データから抽出した知識は検索が開始されると凍結される。
その結果,本手法は対象プログラムと一致しない場合,検索が良好な設定に達する前に,限られたオンライン予算の多くを浪費する。
WarmTunerは、オフラインからオンラインへの強化学習フレームワークで、歴史記録をプログラム条件付きポリシーに変換し、各フラグの設定をフルフラグ空間上で予測し、ターゲットプログラムに適応する。
オフラインで、WarmTuner氏は、歴史的な良い設定から、フルフラグ空間に関するこのプログラム条件のポリシーを学びます。
オンライン上では、実際のコンパイル時のフィードバックを使ってターゲットプログラム上の同じポリシーを洗練し、履歴データに制限されるのではなく、測定されたスピードアップによってポリシーを駆動する。
オンライン更新をGRPO(Group Relative Policy Optimization)でインスタンス化し、同じラウンドの候補を比較して、別の価値モデルを避ける。
我々は,GCC 15.2.0 上で WarmTuner を cBench と PolyBench で評価した。
その結果、WarmTunerはGCC-O3よりも平均1.732倍のスピードアップを達成し、14/30プログラムで最高の結果を得た。
関連論文リスト
- Overcoming the Weakest-Link Effect in LLM-Driven Program Optimization via Heterogeneous Edit Recombination [59.679182823718556]
HEROは、多様で重複しない原子編集を生成し、それから体系的に選択し、評価器スコアを用いてコヒーレントなプログラム改善に構成するプログラムである。
我々は,アルゴリズム問題,戦略ゲーム,LSMに基づくエージェントシステムの設計,ロボット経路計画などにわたるHEROを評価する。
論文 参考訳(メタデータ) (2026-07-31T02:05:45Z) - GRACE: Globally-Seeded Representation-Aware Cluster-Specific Evolution for Compiler Auto-Tuning [10.225578019039506]
本稿では,LLVM IR命令数最適化のためのコンパイラ自動チューニングフレームワーク GRACE を紹介する。
GRACEは、パスシナジーと重み付けされたスコアリング法を利用して、探索空間を効果的に削減し、初期品質の高い候補シーケンスとパスプールを生成する。
次に、パスシーケンスベースのデータ拡張を使用してコントラスト学習を使用して、類似性を認識したクラスタリングを容易にするプログラム埋め込みを生成する。
論文 参考訳(メタデータ) (2025-10-15T06:01:19Z) - Improving Parallel Program Performance with LLM Optimizers via Agent-System Interfaces [9.880183350366792]
並列プログラムのパフォーマンスを改善する上で重要な課題は、タスクをプロセッサやデータに効率的にメモリにマッピングすることだ。
生成最適化によるマッパー開発を自動化するフレームワークを提案する。
提案手法では,9つのベンチマークで1.34倍の高速化を実現している。
論文 参考訳(メタデータ) (2024-10-21T04:08:37Z) - Towards General and Efficient Online Tuning for Spark [55.30868031221838]
本稿では,3つの問題を同時に処理できる汎用的で効率的なSparkチューニングフレームワークを提案する。
我々は、このフレームワークを独立したクラウドサービスとして実装し、Tencentのデータプラットフォームに適用しました。
論文 参考訳(メタデータ) (2023-09-05T02:16:45Z) - Re-Evaluating LiDAR Scene Flow for Autonomous Driving [80.37947791534985]
自己教師型LiDARシーンフローの一般的なベンチマークは、動的動き、非現実的な対応、非現実的なサンプリングパターンの非現実的な速度を持つ。
実世界のデータセットのスイート上で,トップメソッドのスイートを評価する。
学習に重点を置いているにもかかわらず、ほとんどのパフォーマンス向上は前処理と後処理のステップによって引き起こされる。
論文 参考訳(メタデータ) (2023-04-04T22:45:50Z) - NAPG: Non-Autoregressive Program Generation for Hybrid Tabular-Textual
Question Answering [52.10214317661547]
現在の数値推論法はプログラムシーケンスを自己回帰的にデコードする。
プログラム生成の精度は、デコードステップがエラー伝搬によって展開されるにつれて急激に低下する。
本稿では,非自己回帰型プログラム生成フレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-07T11:25:21Z) - Improved Learning Bounds for Branch-and-Cut [98.92725321081994]
分岐とカットは整数プログラムの解法として最も広く使われているアルゴリズムである。
ますます人気のあるアプローチは、機械学習を使ってパラメータをチューニングすることだ。
本稿では,本手法のサンプル保証について述べる。
論文 参考訳(メタデータ) (2021-11-18T04:07:29Z) - Learning to Superoptimize Real-world Programs [79.4140991035247]
本稿では,ニューラルシークエンス・ツー・シーケンス・モデルを用いて,実世界のプログラムを最適化するフレームワークを提案する。
我々は、x86-64アセンブリでオープンソースプロジェクトから抽出された25万以上の実世界の関数からなるデータセットであるBig Assemblyベンチマークを紹介した。
論文 参考訳(メタデータ) (2021-09-28T05:33:21Z) - Autotuning PolyBench Benchmarks with LLVM Clang/Polly Loop Optimization
Pragmas Using Bayesian Optimization (extended version) [0.8070511670572696]
LLVM Clang/Pollyループ最適化プラグマを用いてPolyBenchベンチマークを最適化する。
次に、自動調整フレームワークを使用して、pragmaパラメータを最適化してパフォーマンスを改善します。
本稿では,Floyd-Warshallベンチマークの性能向上のために,単純なmctreeオートチューニングフレームワークを用いたループ自動チューニングを提案する。
論文 参考訳(メタデータ) (2021-04-27T14:46:57Z) - Boosting for Online Convex Optimization [64.15578413206715]
多数の専門家とオンライン凸最適化の意思決定フレームワークを検討します。
弱学習アルゴリズムは、基本クラスの専門家に対するおよその後悔を保証するメカニズムとして定義します。
ベースクラスの凸船体に対するほぼ最適の後悔を保証する効率的なブースティングアルゴリズムを提供します。
論文 参考訳(メタデータ) (2021-02-18T12:30:49Z) - Autotuning PolyBench Benchmarks with LLVM Clang/Polly Loop Optimization
Pragmas Using Bayesian Optimization [0.6583716093321499]
オートチューニング(Autotuning)は、カーネルやアプリケーションの実装/設定が可能な検索スペースを探索するアプローチである。
ベイズ最適化を利用してパラメータ空間探索を行う自動チューニングフレームワークを開発した。
論文 参考訳(メタデータ) (2020-10-15T22:09:42Z) - Static Neural Compiler Optimization via Deep Reinforcement Learning [1.458855293397494]
本稿では,位相整合問題に対する深層強化学習手法を用いる。
LLVMのO3シークエンスを構成するサブシーケンスを用いて、エージェントはトレーニングに使用するソースコードのセット上でO3シークエンスより優れていることを学習する。
我々は、我々のアプローチを用いて訓練されたモデルは、ニューラル最適化エージェントとして現代のコンパイラに統合できると考えている。
論文 参考訳(メタデータ) (2020-08-20T13:16:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。