論文の概要: DataKernelBench: Can LLMs Optimize Database Queries on GPUs?
- arxiv url: http://arxiv.org/abs/2608.25061v2
- Date: Thu, 27 Aug 2026 17:07:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.844538
- Title: DataKernelBench: Can LLMs Optimize Database Queries on GPUs?
- Title(参考訳): DataKernelBench: LLMはGPU上でのデータベースクエリを最適化できるか?
- Abstract要約: 既存のベンチマークでは、機械学習オペレータに重点を置いており、データベーススタイルのオペレータはテストされていない。
検証済みのPyTorch TorchPlanプログラムに変換するDataBenchを紹介する。
我々はTorchPlanをDask-cuDFに拡張し、4つのH100 GPUでTPC-H SF100のオンデマンドパーティションローディングを実現し、2.54タイムの高速化を実現した。
- 参考スコア(独自算出の注目度): 4.882933140189258
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: GPUs increasingly accelerate database systems, but query-specific peak performance still often relies on hand-written kernels. Existing LLM kernel benchmarks focus on machine learning operators, leaving irregular, heterogeneous, data-movement-heavy database-style operators untested. We introduce DataKernelBench, which translates SQL into validated PyTorch TorchPlan programs and evaluates LLMs that optimize either the core tensor-bounded snippet or the full query in CUDA or Triton through execution-guided repair. Across ten proprietary and open-weight models on TPC-H SF10 with an H100 GPU, the strongest full-query CUDA configuration achieves $2.11\times$ speedup over the TorchPlan baseline at full pass rate. We find that higher-performing implementations commonly use kernel fusion and execution-strategy changes, stronger models benefit most from full-query specialization, and workload context matters more than hardware context. To handle data larger than GPU memory, we extend TorchPlan with Dask-cuDF for on-demand partition loading on TPC-H SF100 with four H100 GPUs, achieving $2.54\times$ speedup. Project page: https://kerneldf.github.io/datakernelbench
- Abstract(参考訳): GPUはますますデータベースシステムを加速するが、クエリ固有のピークパフォーマンスは手書きのカーネルに依存していることが多い。
既存のLLMカーネルベンチマークは機械学習演算子に重点を置いており、不規則で不均一で、データ移動量の多いデータベーススタイル演算子は未検証のままである。
我々は,SQLを検証済みのPyTorch TorchPlanプログラムに変換するDataKernelBenchを紹介し,コアテンソルバウンドスニペットやCUDAやTritonのフルクエリを,実行誘導修復によって最適化するLCMを評価した。
TPC-H SF10のプロプライエタリでオープンウェイトな10モデルにH100 GPUを搭載し、最も強力なフルクエリCUDA構成はTorchPlanベースラインをフルパスレートで2.11\times$スピードアップする。
性能の高い実装では、カーネルの融合と実行戦略の変更が一般的であり、より強力なモデルはフルクエリの特殊化の恩恵を受けており、ワークロードコンテキストはハードウェアのコンテキストよりも重要である。
GPUメモリより大きいデータを処理するために、TorchPlanをDask-cuDFに拡張して、4つのH100 GPUでTPC-H SF100のオンデマンドパーティションローディングを可能にします。
プロジェクトページ: https://kerneldf.github.io/datakernelbench
関連論文リスト
- SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System [45.52961410486319]
本稿では,各行列,演算子,ターゲットGPU用のGPUカーネルを構築するLLMベースのシステムであるSparseDittoを提案する。
SparseDittoは、統一設計フレームワークでSpMV、SpMM、SpGEMMをサポートする。
生成されたSpMMカーネルは、最大3.39倍のフルバッチGCNトレーニングを加速する。
論文 参考訳(メタデータ) (2026-08-05T16:41:03Z) - Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent [10.241408048987038]
既存のGPUカーネル生成ベンチマークは、デプロイされたワークロードから分岐する合成またはキュレートされたソースから問題を引き出す。
Atrex-Benchは、30の演算子と440の形状が、計算限定のメモリリッチGPUのフルクラスタ生産推定トレースから直接サンプリングされるベンチマークである。
論文 参考訳(メタデータ) (2026-07-16T03:49:50Z) - GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization [73.92934811090163]
カーネル評価のための選択的なGPUサロゲートとしてLLMがどのように機能するかを検討する。
限られたGPU測定予算下での高速カーネルの復旧に,その予測が正確で校正され,実用的に有用であるかどうかを計測する。
実験により,LLMは相対的なカーネル性能を正確に予測し,強化学習により性能を向上できることを示した。
論文 参考訳(メタデータ) (2026-05-29T15:56:08Z) - ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants [12.49256588033198]
LLMベースのコーディングエージェントは、機能的に正しいGPUカーネルを生成することができるが、その性能は、重要な計算に関する手動最適化ライブラリよりもはるかに低いままである。
データフロー不変量を通じてこの問題に対処するエージェントフレームワークであるArgusを紹介します。
我々は、GEMM、フラッシュアテンション、MoEカーネルにわたるAMD MI300X GPU上でArgusを評価する。
論文 参考訳(メタデータ) (2026-04-16T15:49:31Z) - CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation [51.72529978689561]
Agentは、カーネルの専門知識を3つのコンポーネントで開発する大規模なエージェント強化学習システムである。
AgentはKernelBench上で、トーチコンパイルよりも100%、100%、92%高速なレートを提供する。
論文 参考訳(メタデータ) (2026-02-27T18:58:05Z) - Can Large Language Models Predict Parallel Code Performance? [1.5221392705893568]
本稿では,Large Language Models (LLM) がハードウェアに依存しないGPU性能予測に代替的なアプローチを提供するかどうかを考察する。
LLMはRooflineモデルについて強く理解しており、明示的なプロファイリングデータを備えた場合、100%の分類精度を達成する。
以上の結果から,より優れたデータセットと迅速な戦略により,LLMはHPCルーフライン解析および性能ポータビリティのための実用的なツールとなる可能性が示唆された。
論文 参考訳(メタデータ) (2025-05-06T21:41:20Z) - CAT: A GPU-Accelerated FHE Framework with Its Application to High-Precision Private Dataset Query [0.51795041186793]
本稿では,オープンソースGPUアクセラレーションによる完全同型暗号(FHE)フレームワークCATを紹介する。
emphCATは、コア数学の基礎、事前計算された要素と複合操作のブリッジ、FHE演算子のAPIアクセス可能なレイヤという3層アーキテクチャを備えている。
本フレームワークでは,CKKS,BFV,BGVの3種類のFHEスキームを実装した。
論文 参考訳(メタデータ) (2025-03-28T08:20:18Z) - BurTorch: Revisiting Training from First Principles by Coupling Autodiff, Math Optimization, and Systems [56.16884466478886]
BurTorchは、単一ノードワークステーション上でのディープラーニング(DL)トレーニングを最適化するために設計された、コンパクトな高性能フレームワークである。
BurTorchは最小限の設計を採用し、これらの状況下では、古典的なコンパイルされたプログラミング言語がDL研究において重要な役割を果たすことを証明している。
論文 参考訳(メタデータ) (2025-03-18T00:52:12Z) - KernelBench: Can LLMs Write Efficient GPU Kernels? [36.4117525096377]
KernelBenchは、高速で正確なカーネルを記述する言語モデルの能力を評価するためのオープンソースのフレームワークである。
本稿では,関数的に正しい生成カーネルの割合を計測する,新しい評価基準であるfast_pを紹介する。
実験の結果,フロンティア推論モデルが最も優れているが,全体としては不足していることがわかった。
論文 参考訳(メタデータ) (2025-02-14T19:30:53Z) - Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference [23.633481089469836]
LLM(Large Language Models)の自動回帰デコーディングは、ハードウェアの性能に大きなオーバーヘッドをもたらす。
トレーニング可能なパラメータを0.0002$%しか必要とせず,A100-40GBのGPUをたった16時間で効率的にトレーニングできる並列プロンプトデコーディングを提案する。
我々のアプローチでは、最大2.49$times$ スピードアップを示し、最小のメモリオーバーヘッドは0.0004$%である。
論文 参考訳(メタデータ) (2024-05-28T22:19:30Z) - Fully-fused Multi-Layer Perceptrons on Intel Data Center GPUs [3.7101665559244874]
本稿では,Intel Data Center GPU Max 1550用のMulti-formedLayer Perceptrons(MLP)の実装について述べる。
これにより算術強度が大幅に向上し,特に推論性能が向上することを示す。
論文 参考訳(メタデータ) (2024-03-26T11:38:39Z) - SIP: Autotuning GPU Native Schedules via Stochastic Instruction Perturbation [0.0]
大型言語モデル(LLM)はその出現以来、重要なワークロードとなっている。
また、数十億のパラメータを持ち、大量のデータで訓練されているため、計算コストも高い。
近年、LLMのトレーニングと推論のための専用カーネルが開発されているため、ハードウェアリソースは可能な限り十分に活用されている。
論文 参考訳(メタデータ) (2024-03-25T15:26:50Z) - Harnessing Deep Learning and HPC Kernels via High-Level Loop and Tensor Abstractions on CPU Architectures [67.47328776279204]
この研究は、効率的でポータブルなDeep LearningとHigh Performance Computingカーネルを開発するためのフレームワークを導入している。
1)プロセッシングプリミティブ(TPP)を用いた計算コアの表現と,2)高レベルな宣言的手法でTPPのまわりの論理ループの表現の2つのステップでカーネルの開発を分解する。
我々は、スタンドアロンカーネルと、さまざまなCPUプラットフォームにおける最先端実装よりも優れたエンドツーエンドワークロードを使用して、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2023-04-25T05:04:44Z) - FlexGen: High-Throughput Generative Inference of Large Language Models
with a Single GPU [89.2451963569343]
FlexGenは、単一のコモディティGPU上で大きな言語モデル(LLM)推論を実行するための世代エンジンである。
1つの16GB GPU上でOPT-175Bを実行する場合、FlexGenは最先端のオフロードシステムに比べてスループットが大幅に向上する。
HELMベンチマークでは、FlexGenは7つの代表サブシナリオに16GBのGPUで30Bモデルを21時間でベンチマークすることができる。
論文 参考訳(メタデータ) (2023-03-13T05:19:28Z) - PLSSVM: A (multi-)GPGPU-accelerated Least Squares Support Vector Machine [68.8204255655161]
Support Vector Machines (SVM) は機械学習で広く使われている。
しかし、現代的で最適化された実装でさえ、最先端ハードウェア上の大きな非自明な高密度データセットにはうまくスケールしない。
PLSSVMはLVMのドロップイン代替として使用できる。
論文 参考訳(メタデータ) (2022-02-25T13:24:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。