論文の概要: A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family
- arxiv url: http://arxiv.org/abs/2608.12700v2
- Date: Mon, 17 Aug 2026 20:55:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:32.776849
- Title: A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family
- Title(参考訳): LLM生成GPUカーネル用コントラクトグレード検証器とGated-Linear-Recurrenceファミリー用ネイティブブラックウェルバックワード
- Authors: Rishi Shah, Rishav Shrestha,
- Abstract要約: 言語モデルでGPUカーネルを生成するシステムは、高い正確性率を報告している。
カーネルをいくつかのランダムな入力で1つの固定された形で実行し、出力が参照に近ければ受け入れる。
我々は12個の逆ゲートからなるコントラクトグレードの検証器を構築し、それぞれが正しいカーネルが満たさなければならないプロパティであり、そのいくつかはトレランスフリーである。
- 参考スコア(独自算出の注目度): 0.9740025522928777
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Systems that generate GPU kernels with language models report high correctness rates. Those rates come from a single loose test: run the kernel on a few random inputs at one fixed shape and accept it if the output is close to a reference. A kernel can pass that test and still be silently wrong. It can return an ordinary number where the true answer is a NaN or an infinity, differ from run to run, break when the shape changes, or accumulate in fp16 where the reference keeps an fp32 total. We build the instrument that checks correctness properly: a contract-grade verifier of twelve adversarial gates, each a property a correct kernel must satisfy, several of them tolerance-free, so no choice of threshold can explain a failure away. Aimed outward, the verifier audits 2,638 machine-generated kernels that a public system's own harness had already accepted as correct. It finds 39.5% broken beyond any tolerance argument and 62.1% carrying at least one violation. The field's standard test accepts 1,487 kernels the verifier rejects, against only 14 the other way. We defend the finding four independent ways: a 7/7 positive control, a threshold-calibration sweep, 98.5% agreement with the reference benchmark's own correctness code, and a stratified hand-audit. Aimed inward, the verifier judges a kernel of our own: the first native Blackwell tcgen05 training backward for the gated-linear-recurrence (GDN) family, including the reverse-state stage the field still runs on a fallback. We establish its correctness independently, against a double-precision oracle, and train five family members through it. The correctness signal behind reported progress in kernel generation is far weaker than the numbers suggest, and a set of tolerance-free contracts would close most of the gap.
- Abstract(参考訳): 言語モデルでGPUカーネルを生成するシステムは、高い正確性率を報告している。
カーネルをいくつかのランダムな入力で1つの固定された形で実行し、出力が参照に近ければ受け入れる。
カーネルはそのテストに合格し、いまだに静かに間違っている。
正解が NaN か無限大である通常の数値を返したり、実行時と異なるり、形が変わると壊れたり、参照が fp32 の合計を保持する fp16 に蓄積したりすることができる。
12個の逆ゲートのコントラクトグレード検証器、各カーネルが満たさなければならないプロパティ、いくつかは耐障害性がないため、しきい値の選択は失敗を説明できない。
検証者は、公開システムの自身のハーネスが既に正しく受け入れられていたことを2,638個のマシン生成カーネルを監査した。
39.5%が破られ、62.1%が少なくとも1件の違反を負っている。
フィールドの標準テストは1,487個のカーネルを受け入れ、検証者が拒否する。
7/7の正の制御、しきい値の校正、基準ベンチマーク独自の正当性コードとの98.5%の合意、階層化された手監査の4つの独立した方法の発見を守ります。
最初のネイティブBlackwell tcgen05は、ゲート-リニア-リカレンス(GDN)ファミリーのために後方にトレーニングし、フィールドがまだフォールバックで動いている逆状態のステージを含む。
我々は、その正しさを、二重精度の託宣に対して独立に確立し、5人の家族を教育する。
カーネル生成の進展が報告されている正しいシグナルは、数値が示すよりもはるかに弱く、耐障害性のない一連の契約がギャップの大部分を埋める。
関連論文リスト
- Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets [13.85834524293015]
私たちは、ロールが想定する能力を測定し、通常、ロールが配置されるプロトコルの下でそれを欠いていることを見つけます。
モデルは、その候補がセット自体の作者よりもはるかに優れているかどうかを判断する。
論文 参考訳(メタデータ) (2026-08-02T05:00:44Z) - Test-Input Generation for Tensor Programs: What Actually Finds Kernel Bugs [0.0]
我々は,クローゼップコーパスにおける7つのテスト生成戦略を評価した。
バグリコールと偽陽性率(FP)の2つの軸について,それぞれの戦略を報告する。
論文 参考訳(メタデータ) (2026-06-23T21:43:30Z) - Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels [0.0]
テンソル-カーネルの正当性テストは、手書きの絶対値と相対値の許容値を持つ固定形全クローズスタイルチェックを経由する。
我々は、カーネル自体が正しい実装で観察される絶対許容度を問う。
答えは、現在の手書きのガソリンよりずっときつい。
論文 参考訳(メタデータ) (2026-06-23T20:50:36Z) - The Correctness Illusion in LLM-Generated GPU Kernels [0.0]
LLM生成GPUカーネルのベンチマークは、固定形で小さなオールクローススタイルのチェックによって正確性を評価する。
我々は24のトリトンとCPUのスタンドインカーネルの制御コーパスを構築した。
同じプロトコルを5つのGPUクラスで再実行します。
論文 参考訳(メタデータ) (2026-06-18T11:52:46Z) - DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models [6.628401122676601]
ルールベースの論理解法は、ベンチマークの全インスタンスを50マイクロ秒未満で100%精度で解決する。
データセットと生成パイプラインであるDeFAb(Defeasible Abduction Benchmark)を紹介します。
論文 参考訳(メタデータ) (2026-06-17T00:13:40Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - PRover: Proof Generation for Interpretable Reasoning over Rules [81.40404921232192]
本稿では,ルールベース上の二項質問に応答し,対応する証明を生成するトランスフォーマーモデルを提案する。
本モデルは,効率的な制約付き学習パラダイムを用いて,証明グラフに対応するノードやエッジを予測できることを学習する。
我々は、QAと証明生成のための有望な結果を示すために、合成、手書き、人文による規則ベースの実験を行う。
論文 参考訳(メタデータ) (2020-10-06T15:47:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。