論文の概要: PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX
- arxiv url: http://arxiv.org/abs/2608.17379v2
- Date: Wed, 19 Aug 2026 20:36:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.443271
- Title: PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX
- Title(参考訳): PTXBench:アーキテクチャ固有のPTXを用いたGPUカーネル最適化のためのベンチマークと適応LDM
- Abstract要約: 大規模言語モデル(LLM)の評価と適応のためのベンチマークであるPTXBenchを紹介する。
PTXBenchは、選択したターゲット命令が実行時に実行されるか、フロンティアライブラリを高速化するか、機能的正確性を測定する。
本評価は,アーキテクチャ固有のPTX能力が不均一であることを示す。
- 参考スコア(独自算出の注目度): 3.197729846436415
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce PTXBench, a benchmark for evaluating and adapting large language models (LLMs) to use architecture-specific PTX for GPU kernel optimization. PTXBench measures functional correctness, whether selected target instructions execute at runtime, and speedup over frontier libraries across GEMM and attention workloads on H100 and B200 GPUs. Our evaluation shows that architecture-specific PTX capability remains uneven: success rates fall substantially on complex attention backward workloads, and executing the target instructions does not necessarily translate into competitive performance. No evaluated model consistently matches frontier libraries across the suite. We further adapt Qwen3.6-27B using supervised fine-tuning. Repair-conditioned training improves several tasks, but generalization remains uneven; data coverage, balance, and the quality of the reasoning teacher matter in addition to dataset size. PTXBench provides an auditable testbed for measuring and improving LLMs' ability to exploit evolving GPU architectures.
- Abstract(参考訳): 我々は,大規模言語モデル(LLM)の評価と適応のためのベンチマークであるPTXBenchを導入し,アーキテクチャ固有のPTXを用いてGPUカーネルの最適化を行う。
PTXBenchは、選択したターゲット命令が実行時に実行されるかどうか、GEMM全体にわたるフロンティアライブラリのスピードアップ、H100とB200GPU上のアテンションワークロードなどの機能的正確性を測定する。
我々の評価では、アーキテクチャ固有のPTX能力は不均一であり、成功率は複雑な後向きのワークロードで大幅に低下し、ターゲット命令の実行が必ずしも競合性能に変換されるとは限らない。
評価されたモデルは、スイート全体のフロンティアライブラリと一貫して一致しない。
さらに、教師付き微調整を用いてQwen3.6-27Bを適応する。
修理条件付きトレーニングは、いくつかのタスクを改善するが、データカバレッジ、バランス、推論する教師の質に加えて、データセットのサイズも不均一である。
PTXBenchは、進化中のGPUアーキテクチャを利用するLLMの能力の測定と改善のための監査可能なテストベッドを提供する。
関連論文リスト
- Flower Hub: A Reproducible Benchmarking Platform for Federated Learning in Simulation and Deployment [51.83961778298564]
Flower Hubは、分散およびフェデレーションされたアプリケーションを公開、発見、実行するためのプラットフォームです。
ベンチマークを実行可能としてパッケージングすることで再現性のあるベンチマークを実現する方法、標準化されたメタデータを備えたバージョン管理されたアプリケーション、ピン付き依存関係、明示的な評価について示す。
論文 参考訳(メタデータ) (2026-08-25T20:09:44Z) - HIERA: Workload-Aware Planning Across Implementation Spaces for GPU Kernel Optimization [17.600449573236194]
カーネル最適化のための階層型検索空間計画フレームワークであるtextscHIERAを提案する。
textscHIERAは、拡張されたタスク仕様を構築し、PyTorch演算子、ライブラリ、カスタムカーネルにまたがる適切な実装空間を選択する。
実験の結果、textscHIERAは既存のトレーニング不要の手法よりも全体的な実装の洗練、妥当性、最適化性能が向上した。
論文 参考訳(メタデータ) (2026-08-21T14:29:20Z) - Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent [10.241408048987038]
既存のGPUカーネル生成ベンチマークは、デプロイされたワークロードから分岐する合成またはキュレートされたソースから問題を引き出す。
Atrex-Benchは、30の演算子と440の形状が、計算限定のメモリリッチGPUのフルクラスタ生産推定トレースから直接サンプリングされるベンチマークである。
論文 参考訳(メタデータ) (2026-07-16T03:49:50Z) - CodegenBench: Can LLMs Write Efficient Code Across Architectures? [17.06172900876354]
汎用プログラミングとGPUアクセラレーション環境のためのコード生成タスクにおいて,大規模言語モデル (LLM) が広く評価されている。
CodegenBenchは、3つの異なるハードウェアプラットフォームにわたる効率的な並列コードの生成を評価するために設計されたベンチマークスイートである。
論文 参考訳(メタデータ) (2026-06-01T12:55:10Z) - ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning [58.54940026861599]
textscChunkFTはメモリ効率の良い微調整フレームワークである。
textscChunkFTは、ネットワークアーキテクチャを変更することなく任意のサブテンソルの勾配計算を可能にする。
textscChunkFTは、既存のメモリ効率のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-20T13:44:44Z) - ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants [12.49256588033198]
LLMベースのコーディングエージェントは、機能的に正しいGPUカーネルを生成することができるが、その性能は、重要な計算に関する手動最適化ライブラリよりもはるかに低いままである。
データフロー不変量を通じてこの問題に対処するエージェントフレームワークであるArgusを紹介します。
我々は、GEMM、フラッシュアテンション、MoEカーネルにわたるAMD MI300X GPU上でArgusを評価する。
論文 参考訳(メタデータ) (2026-04-16T15:49:31Z) - Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization [48.656549870801285]
Kernel-Smithは高性能GPUカーネルと演算子生成のためのフレームワークである。
エージェント側では、Kernel-Smithは実行可能な候補の集団を維持し、反復的にそれらを改善している。
トレーニング側では、長距離進化軌道をステップ中心の監視と強化学習信号に変換する。
論文 参考訳(メタデータ) (2026-03-30T12:12:49Z) - Beyond Test-Time Training: Learning to Reason via Hardware-Efficient Optimal Control [86.63490309209378]
我々は、最適制御として推論を定式化し、推論時に潜在状態に対して有限水平LQR計画を行うテスト時間制御層を導入する。
アーキテクチャ層として最適制御を組み込むことは、テスト時間トレーニングを超えた推論のための効果的でスケーラブルなメカニズムを提供することを実証する。
論文 参考訳(メタデータ) (2026-03-10T05:42:13Z) - Can Large Language Models Predict Parallel Code Performance? [1.5221392705893568]
本稿では,Large Language Models (LLM) がハードウェアに依存しないGPU性能予測に代替的なアプローチを提供するかどうかを考察する。
LLMはRooflineモデルについて強く理解しており、明示的なプロファイリングデータを備えた場合、100%の分類精度を達成する。
以上の結果から,より優れたデータセットと迅速な戦略により,LLMはHPCルーフライン解析および性能ポータビリティのための実用的なツールとなる可能性が示唆された。
論文 参考訳(メタデータ) (2025-05-06T21:41:20Z) - KernelBench: Can LLMs Write Efficient GPU Kernels? [36.4117525096377]
KernelBenchは、高速で正確なカーネルを記述する言語モデルの能力を評価するためのオープンソースのフレームワークである。
本稿では,関数的に正しい生成カーネルの割合を計測する,新しい評価基準であるfast_pを紹介する。
実験の結果,フロンティア推論モデルが最も優れているが,全体としては不足していることがわかった。
論文 参考訳(メタデータ) (2025-02-14T19:30:53Z) - Harnessing Deep Learning and HPC Kernels via High-Level Loop and Tensor Abstractions on CPU Architectures [67.47328776279204]
この研究は、効率的でポータブルなDeep LearningとHigh Performance Computingカーネルを開発するためのフレームワークを導入している。
1)プロセッシングプリミティブ(TPP)を用いた計算コアの表現と,2)高レベルな宣言的手法でTPPのまわりの論理ループの表現の2つのステップでカーネルの開発を分解する。
我々は、スタンドアロンカーネルと、さまざまなCPUプラットフォームにおける最先端実装よりも優れたエンドツーエンドワークロードを使用して、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-04-25T05:04:44Z) - Energy-efficient Task Adaptation for NLP Edge Inference Leveraging
Heterogeneous Memory Architectures [68.91874045918112]
Adapter-ALBERTは、様々なタスクにわたる最大データ再利用のための効率的なモデル最適化である。
検証されたNLPエッジアクセラレータ上でシミュレーションを行うことにより、モデルを不均一なオンチップメモリアーキテクチャにマッピングする利点を実証する。
論文 参考訳(メタデータ) (2023-03-25T14:40:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。