論文の概要: Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels
- arxiv url: http://arxiv.org/abs/2607.16228v2
- Date: Tue, 21 Jul 2026 16:12:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.04493
- Title: Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels
- Title(参考訳): テンソルカーネルに対する演算子対応混合精度許容度校正
- Abstract要約: テンソル-カーネルの正当性テストは、手書きの絶対値と相対値の許容値を持つ固定形全クローズスタイルチェックを経由する。
我々は、カーネル自体が正しい実装で観察される絶対許容度を問う。
答えは、現在の手書きのガソリンよりずっときつい。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Most tensor-kernel correctness tests go through a fixed-shape all close-style check with hand-picked absolute and relative tolerances. The thresholds are copied across the corpus and rarely revisited. We mine the element-wise error distribution of every test case from accumulated cloud GPU runs across the 26-entry gpuemu corpus and 2 dtypes (8,076 result rows). We then ask one empirical question: what absolute tolerance would the kernel itself, observed under its correct implementation, justify? The answer is much tighter than the current hand-picked atol. The largest tightening is attention_triton fp16 at $2{,}184\times$. Restricted to the seven LLM-style buggy variants for which the corpus ships a paired correct counterpart, calibrated per-(op, dtype) tolerances raise bug-detection recall from 73.2% (1,805 of 2,467) to 82.4% (2,034 of 2,467), an absolute gain of 9.3 percentage points (+229 new detections). The control false-positive count rises from 0 to 20 out of 1,882 correct-control cases (+1.1 percentage points).
- Abstract(参考訳): ほとんどのテンソルカーネルの正しさテストは、手書きの絶対値と相対値の許容値を持つ固定形状のすべてのクローズドなチェックを通過します。
閾値はコーパス全体にコピーされ、めったに更新されない。
蓄積されたクラウドGPUから,26エントリのgpuemuコーパスと2dタイプ(8,076行)にわたる各テストケースの要素誤差分布を抽出した。
カーネル自体が正しい実装の下で観察される絶対許容度は、正当か?
答えは、現在の手書きのガソリンよりずっときつい。
最大の締め付けは attention_triton fp16 at $2{,}184\times$である。
コーパスがペアの正装(オプト、d型)を搭載できる7つのLCMスタイルのバギー変種に制限され、73.2% (2,467の1,805) から82.4% (2,467の2,034) にリコールされ、絶対ゲインは9.3%(+229)となった。
コントロール偽陽性カウントは1,882例中0から20に上昇する(+1.1ポイント)。
関連論文リスト
- Deterministic LLM Inference Across GPU Kernels: Power-of-Two INT8 Quantization Scales and the Limits of Tolerance-Based Conformance [0.10152838128195468]
量子化されたGEMMカーネルのコンフォーマンススイートは、2つの実装が許容範囲内で一致するかどうかを問う。
5つのエピローグ断層(スケール精度、ダブルラウンド、乗算順序、出力トランケーション、融合順序)のうちの1つが、少なくとも1つのbfloat16間隔で出力を移動していることがわかった。
5つの断層のうち4つはスイートのチェック無しで検出され、5番目は2つのスケールでのみ検出される。
論文 参考訳(メタデータ) (2026-08-25T03:05:54Z) - The Integer Alibi: Localizing Cross-Kernel Divergence in INT8-Quantized LLM Inference [0.10152838128195468]
同じスケールのINT8 GEMMインターフェースを実装した2つのGPUカーネルは通常、交換可能である。
チェックポイント、プロンプト、ハードウェア、推論エンジン、デコード、量子化設定を固定し、vLLM内のINT8リニアカーネルのみを交換する。
1.7B では、各アームはコールドリスタートでビット・フォー・ビットを再生するが、実行したエンドツーエンドの比較(0/8、0/16、0/64)では、腕は一致しない。
論文 参考訳(メタデータ) (2026-08-13T20:34:36Z) - A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family [0.9740025522928777]
言語モデルでGPUカーネルを生成するシステムは、高い正確性率を報告している。
カーネルをいくつかのランダムな入力で1つの固定された形で実行し、出力が参照に近ければ受け入れる。
我々は12個の逆ゲートからなるコントラクトグレードの検証器を構築し、それぞれが正しいカーネルが満たさなければならないプロパティであり、そのいくつかはトレランスフリーである。
論文 参考訳(メタデータ) (2026-08-13T01:25:56Z) - Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson [35.18016233072556]
NVIDIA Jetson Orin Nano Super (8GB) で完全に動作する2次元SO-101システムを提案する。
我々は、NVMMバッファによってバックアップされたGStreamerキャプチャパイプラインを構築し、3つのカメラセンシングから冗長なホストデバイスコピーを取り除く。
我々は、ACTと拡散政策を同一のデモンストレーションで訓練し、それぞれが独自の基準予算で実施する。
論文 参考訳(メタデータ) (2026-08-04T17:09:41Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - Mean-to-Score Discrete Diffusion: Posterior-Mean Denoisers for Score Entropy [17.48959208263029]
我々は,クリーンな後進平均を予測し,正確なカーネル依存線形写像を用いてスコアに変換するEmphmean-to-score (M2S)を導入する。
均一な汚職のために、確率的単純度をブリッジポリトープにマッピングし、吸収マスクの破損のためにMD4を正確に回収する。
論文 参考訳(メタデータ) (2026-07-23T14:37:30Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Active Quantum Kernel Acquisition for Gaussian Process Regression [30.032230630492155]
量子カーネル分類に関する最近の研究は、カーネルエントリに不均一にショットを割り当てることによって、ターゲット精度に到達するために必要なショット予算を削減できることを示した。
我々はこのアイデアをガウス過程(GP)回帰(英語版)に拡張し、下流の量(全スペクトル後方分散、対数行列、辺縁確率)が、符号のみの分類出力よりも厳密なカーネルエラーに結合する設定とする。
我々は、3つの閉形式のペアレベル感性予測結合 $|_i_j|$, leave-one-out residual, and marginal-likelihood gradient を導出し、それらをネイマン型最小値に差し込む。
論文 参考訳(メタデータ) (2026-06-27T09:40:20Z) - Test-Input Generation for Tensor Programs: What Actually Finds Kernel Bugs [0.0]
我々は,クローゼップコーパスにおける7つのテスト生成戦略を評価した。
バグリコールと偽陽性率(FP)の2つの軸について,それぞれの戦略を報告する。
論文 参考訳(メタデータ) (2026-06-23T21:43:30Z) - The Correctness Illusion in LLM-Generated GPU Kernels [0.0]
LLM生成GPUカーネルのベンチマークは、固定形で小さなオールクローススタイルのチェックによって正確性を評価する。
我々は24のトリトンとCPUのスタンドインカーネルの制御コーパスを構築した。
同じプロトコルを5つのGPUクラスで再実行します。
論文 参考訳(メタデータ) (2026-06-18T11:52:46Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Sequential Consensus for Multi-Agent LLM Debates: A Wald-SPRT compute governor with calibration-based failure detection [0.0]
マルチエージェントの議論は事実と推論を改善するが、ほとんどのレシピは固定されたラウンドカウントを選択する。
我々は,LLM討論のプラグイン計算として,Wald's Sequential Probability Ratio Test (SPRT)を適用した。
GSM8Kでは、ルールは1.01ラウンド(4.06 LLMコール)で97.0%の精度で終了するが、15回のコールで固定5の討論では99.0%の精度で終了する。
MMLUでは、キャリブレーションされたKLは約0に崩壊し、ルール上限は2.1倍のコストで99.5%となる。
論文 参考訳(メタデータ) (2026-05-18T23:43:12Z) - Adaptive Calibration in Non-Stationary Environments [44.81344039432424]
複数のキャリブレーション対策の下で適応的なキャリブレーション保証を実現するアルゴリズムの組を開発する。
我々の手法は先行研究(Hu et al., 2026, Luo et al., 2025)の上に構築され、基礎となる基底真理付近でより微細な分解を割り当てる予測空間の非一様分割を導入する。
論文 参考訳(メタデータ) (2026-05-12T04:06:40Z) - KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels [41.03500441875287]
LLMベースのTritonカーネル生成は大きな関心を集めているが、基本的な実験的な疑問は未解決のままである。
本稿では,その正しさとハードウェア効率のカテゴリ認識による評価を通じて,この問題に対処するためのベンチマークであるKernelBenchXを提案する。
論文 参考訳(メタデータ) (2026-05-06T14:18:36Z) - The Verification Tax: Fundamental Limits of AI Auditing in the Rare-Error Regime [0.0]
最も引用されているキャリブレーションの結果は、CIFAR-100上での温度スケーリング後のECEの0.012は、統計的ノイズフロアより下である。
モデル誤差率のエプシロンによるキャリブレーション誤差を推定するミニマックスレートは Theta((Lepsilon/m)2/3) であり、推定器が打ち負かせない。
論文 参考訳(メタデータ) (2026-04-14T16:48:24Z) - Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference [31.2331188304598]
評価バッチサイズ、GPUカウント、GPUバージョンなどのシステム構成の変更は、生成されたレスポンスに大きな違いをもたらす可能性がある。
この変数の根本原因は、限定的な数値精度で浮動小数点算術の非連想性に遡る。
そこで我々は16ビットの精度で重みを格納するが、FP32では全ての計算を実行する軽量な推論パイプラインLayerCastを開発した。
論文 参考訳(メタデータ) (2025-06-11T08:23:53Z) - Robust Conformal Prediction with a Single Binary Certificate [58.450154976190795]
コンフォーマル予測(CP)は、任意のモデルの出力を、真のラベルを(調整可能な)高い確率でカバーすることを保証した予測セットに変換する。
我々は,MCサンプルが著しく低い場合でも,より小さな集合を生成する頑健な共形予測を提案する。
論文 参考訳(メタデータ) (2025-03-07T08:41:53Z) - KSD Aggregated Goodness-of-fit Test [38.45086141837479]
我々は、異なるカーネルで複数のテストを集約するKSDAggと呼ばれるテストを構築する戦略を導入する。
我々は、KSDAggのパワーに関する漸近的でない保証を提供する。
KSDAggは、他の最先端のKSDベースの適合性試験方法よりも優れていることがわかった。
論文 参考訳(メタデータ) (2022-02-02T00:33:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。