論文の概要: Test-Input Generation for Tensor Programs: What Actually Finds Kernel Bugs
- arxiv url: http://arxiv.org/abs/2606.27396v1
- Date: Tue, 23 Jun 2026 21:43:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.269824
- Title: Test-Input Generation for Tensor Programs: What Actually Finds Kernel Bugs
- Title(参考訳): テンソルプログラムのためのテスト入力生成:実際にカーネルバグを見つけたもの
- Abstract要約: 我々は,クローゼップコーパスにおける7つのテスト生成戦略を評価した。
バグリコールと偽陽性率(FP)の2つの軸について,それぞれの戦略を報告する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Test-input generation for tensor kernels is folkloric. Most projects pick a representative shape and dtype, run a fixed-shape allclose-style check, and ship. We make the choices explicit and measure them. Using the gpuemu op-schema-aware seeded fuzzer (arXiv:2606.20128), we evaluate seven test-generation strategies across a 26-op corpus (16 correct controls and 10 LLM-style buggy variants seeded with documented transcription patterns) on an RTX 3060 GPU instance. Strategies vary the shape candidate set, the dtype mix, and the input value distribution. We report each strategy on two axes: bug recall and control false-positive (FP) rate. Boundary-only shape sampling is the operationally safe winner: 78% recall on the 10 buggy kernels with 0% FP on the 16 controls. Adversarial value sampling reaches higher recall (99%) but inflates control FP to 94% because the strategy injects NaN and Inf inputs and the validator's NaN check fires on every kernel that propagates them, not only on buggy kernels. On the two softmax tail-mask bugs the "regular" strategy (no boundary shapes) catches 0%, while boundary raises recall to 100% and 62% respectively. That gap is the clearest single signal in the data. The corpus result is about which seeded bug patterns each strategy catches, not about the bug rate of any specific deployed LLM.
- Abstract(参考訳): テンソルカーネルのテストインプット生成は民俗学である。
ほとんどのプロジェクトは代表的な形とdtypeを選択し、固定形のオールクローススタイルのチェックを実行し、出荷します。
選択を明確化し、測定します。
RTX 3060 GPUインスタンス上で、gpuemu op-schema-aware seeded fuzzer (arXiv:2606.20128)を用いて、26オプコーパス(正しい制御と10 LLMスタイルのバグギー変種)の7つのテスト生成戦略を評価する。
戦略は、形状候補セット、d型混合、入力値分布を変化させる。
バグリコールと偽陽性率(FP)の2つの軸について,それぞれの戦略を報告する。
境界のみの形状サンプリングが運用上安全である: 78%が16のコントロールで0%のFPを持つ10のバギーカーネルをリコールする。
逆値サンプリングは高いリコール(99%)に達するが、戦略がNaNとInfの入力を注入し、バリデーターのNaNがバギーカーネルだけでなく、それらを伝播するすべてのカーネルにチェックするので、制御FPを94%に膨らませる。
2つのソフトマックス尾マスクのバグでは、"正規"戦略(境界形状がない)が0%、バウンダリが100%と62%に上昇する。
このギャップは、データの最も明確な単一信号です。
コーパスの結果は、特定のデプロイ LLM のバグ率ではなく、各戦略がキャッチするバグパターンの種付けに関するものだ。
関連論文リスト
- TriCalRAG: A Three-Strategy, Retrieval-Augmented Benchmark for On-Premise LLM-Based Root Cause Analysis in AIOps [1.8136615181861766]
クラウドホスト型大規模言語モデル(LLM)は、AIOpsパイプラインの根本原因分析(RCA)にますます使用されている。
データプライバシのリスク、ネットワークレイテンシ、および運用ログボリュームの低いクエリ単位のコストを導入している。
我々は,従来のLSTMを用いたログ異常検出器に対して,vLLMを介して局所的に提供されるオープンウェイトの評価ベンチマークであるRAGを提示する。
論文 参考訳(メタデータ) (2026-09-13T19:52:46Z) - A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family [0.9740025522928777]
言語モデルでGPUカーネルを生成するシステムは、高い正確性率を報告している。
カーネルをいくつかのランダムな入力で1つの固定された形で実行し、出力が参照に近ければ受け入れる。
我々は12個の逆ゲートからなるコントラクトグレードの検証器を構築し、それぞれが正しいカーネルが満たさなければならないプロパティであり、そのいくつかはトレランスフリーである。
論文 参考訳(メタデータ) (2026-08-13T01:25:56Z) - Beyond Fail-to-Pass: Iterative Hardening of Co-Generated Bug Reproduction Tests and Fixes [55.114939648705395]
大規模言語モデル(LLM)は、現実のバグに対して、プログラムの自動修正をますます実用的にしている。
バグ再現テスト(BRT)は、バグレポートを実行可能なバグ固有の信号に変換することで、このギャップを埋めるのに役立つ。
本稿では,ループ内収束基準としてLax信号を用いるコジェネレーションフレームワークであるCoHardenを提案する。
論文 参考訳(メタデータ) (2026-07-22T07:30:07Z) - Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels [0.0]
テンソル-カーネルの正当性テストは、手書きの絶対値と相対値の許容値を持つ固定形全クローズスタイルチェックを経由する。
我々は、カーネル自体が正しい実装で観察される絶対許容度を問う。
答えは、現在の手書きのガソリンよりずっときつい。
論文 参考訳(メタデータ) (2026-06-23T20:50:36Z) - The Correctness Illusion in LLM-Generated GPU Kernels [0.0]
LLM生成GPUカーネルのベンチマークは、固定形で小さなオールクローススタイルのチェックによって正確性を評価する。
我々は24のトリトンとCPUのスタンドインカーネルの制御コーパスを構築した。
同じプロトコルを5つのGPUクラスで再実行します。
論文 参考訳(メタデータ) (2026-06-18T11:52:46Z) - PBT-Bench: Benchmarking AI Agents on Property-Based Testing [29.035258104995204]
PBT-Benchは、40の実際のPythonライブラリにまたがる100のプロパティベースのテスト問題のベンチマークである。
各問題は1つ以上のセマンティックなバグ(総数365、平均3.65)を注入し、デフォルトのストラテジーなランダムな入力がほとんど起こらないように設計する。
PBT指導によるバグリコールは42.1%から83.4%の範囲で、オープンエンドベースラインでは31.4%から76.7%である。
論文 参考訳(メタデータ) (2026-05-13T18:01:05Z) - Surprisal-Guided Selection: Compute-Optimal Test-Time Strategies for Execution-Grounded Code Generation [0.0]
検証可能な実行地上(VEG)タスクに対する計算-最適テスト時間戦略について検討する。
重回帰VEGタスクの場合、計算は勾配適応ではなく、サンプルの多様性とインテリジェントな選択に割り当てるべきである。
論文 参考訳(メタデータ) (2026-02-07T19:29:07Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - DyePack: Provably Flagging Test Set Contamination in LLMs Using Backdoors [52.85182605005619]
トレーニング中にベンチマークテストセットを使用したモデルを識別するためにバックドアアタックを利用するフレームワークであるDiePackを紹介します。
銀行が染料パックにお金を混ぜて強盗をマークするのと同じように、DiePackはバックドアのサンプルとテストデータとを混ぜて、その上で訓練されたモデルのフラグを立てる。
我々はDiePackを3つのデータセットにわたる5つのモデルで評価し、複数の選択とオープンな生成タスクの両方をカバーした。
論文 参考訳(メタデータ) (2025-05-29T02:22:14Z) - SBEST: Spectrum-Based Fault Localization Without Fault-Triggering Tests [17.90798133817018]
本研究は, 事故報告から得られたスタックトレースを, スペクトルベース断層定位における故障トリガー試験のプロキシとして用いる可能性について検討した。
本稿では,スタックトレース情報とテストカバレッジデータを統合する新たな手法であるSBESTを提案する。
論文 参考訳(メタデータ) (2024-05-01T15:15:52Z) - Lazy Layers to Make Fine-Tuned Diffusion Models More Traceable [70.77600345240867]
新たな任意の任意配置(AIAO)戦略は、微調整による除去に耐性を持たせる。
拡散モデルの入力/出力空間のバックドアを設計する既存の手法とは異なり,本手法では,サンプルサブパスの特徴空間にバックドアを埋め込む方法を提案する。
MS-COCO,AFHQ,LSUN,CUB-200,DreamBoothの各データセットに関する実証研究により,AIAOの堅牢性が確認された。
論文 参考訳(メタデータ) (2024-05-01T12:03:39Z) - AdaNPC: Exploring Non-Parametric Classifier for Test-Time Adaptation [64.9230895853942]
ドメインの一般化は、ターゲットのドメイン情報を活用することなく、任意に困難にすることができる。
この問題に対処するためにテスト時適応(TTA)手法が提案されている。
本研究では,テスト時間適応(AdaNPC)を行うためにNon-Parametricを採用する。
論文 参考訳(メタデータ) (2023-04-25T04:23:13Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。