論文の概要: Pattern-Guided Graph Synthesis for Suppressing Known Defects in DL Compiler Fuzzing
- arxiv url: http://arxiv.org/abs/2610.06968v1
- Date: Sat, 03 Oct 2026 18:41:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.483047
- Title: Pattern-Guided Graph Synthesis for Suppressing Known Defects in DL Compiler Fuzzing
- Title(参考訳): DLコンパイラファジリングにおける既知の欠陥抑制のためのパターンガイドグラフ合成
- Abstract要約: Repriseは、テスト生成中に既知の欠陥の報告を抑圧するaDLコンパイラファズーである。
プログラムを多様化する代わりに、Repriseは発見された欠陥をそれぞれ意味グラフパターンに蒸留する。
Repriseはまた、3つのコンパイラで25の既知のバグを発見した。
- 参考スコア(独自算出の注目度): 6.570884869339776
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fuzzing is effective at finding bugs in deep learning (DL) compilers, but existing fuzzers repeatedly trigger faults they have already uncovered. Current fuzzers diversify the generated programs, and downstream tools deduplicate bug reports post hoc, but neither stops a fuzzer from generating programs that re-trigger known defects. We present Reprise, a DL compiler fuzzer that suppresses reports of known defects during test generation. Reprise uses a deliberately lightweight generator that builds graphs in a unified intermediate representation (UIR) with local operator signatures. Instead of diversifying programs, Reprise distills each discovered defect into a semantic graph pattern that captures the operators, value constraints, graph context, and data flow required to trigger it. During graph synthesis, it regenerates any node that completes a known pattern, so known defect triggers are avoided before compilation and execution. We evaluate Reprise on three DL compilers: TVM, PyTorch Inductor, and ONNX Runtime. Against its unguided variant, patterns written for the dominant known defects reduce crash reports by 90.2% on TVM (254 to 25) and by 93.8% on PyTorch Inductor (594 to 37), with comparable branch coverage and 1.0-17.9% fewer executed tests. These results come from one run per configuration and concern the defects the patterns were distilled from. Reprise also found 25 previously unknown bugs across the three compilers, 24 of them within one month, of which 7 have been fixed and 12 more confirmed by developers. The replication package has been provided at [11].
- Abstract(参考訳): ファジィングは、ディープラーニング(DL)コンパイラのバグを見つけるのに有効だが、既存のファジィザは、既に発見した欠陥を繰り返しトリガーする。
現在のファジィアは生成されたプログラムを多様化し、下流のツールはバグレポートのポストホックを重複させるが、ファジィアが既知の欠陥を再トラガーするプログラムを生成するのを止めることはない。
本稿では、テスト生成中に既知の欠陥の報告を抑圧するDLコンパイラファザであるRepriseを紹介する。
Repriseは意図的に軽量なジェネレータを使用しており、ローカル演算子シグネチャと統合中間表現(UIR)でグラフを構築する。
プログラムを多様化する代わりに、Repriseは発見された各欠陥をセマンティックグラフパターンに蒸留し、オペレーター、値制約、グラフコンテキスト、そしてそれをトリガーするために必要なデータフローをキャプチャする。
グラフ合成中は、既知のパターンを完了したノードを再生するので、既知の欠陥トリガはコンパイルと実行前に回避される。
我々は、TVM、PyTorchインダクタ、NNX Runtimeの3つのDLコンパイラ上でRepriseを評価する。
主要な既知の欠陥のために書かれたパターンは、TVM(254から25)では90.2%、PyTorchインダクタ(594から37)では93.8%減少し、同様のブランチカバレッジと1.0-17.9%減少している。
これらの結果は、構成毎に1回実行され、パターンが蒸留された欠陥が懸念される。
Repriseはまた、3つのコンパイラで25の既知のバグを発見し、そのうち24が1ヶ月以内に修正され、7が修正され、12が開発者によって確認された。
複製パッケージは[11]で提供されました。
関連論文リスト
- Agora: Git as Shared Memory for Collective AutoResearch [54.31992252587096]
別々のセッションで作業する調査エージェントは、他の人が試したことと、構築可能な結果を知る必要がある。
各コミットは結果、洞察、仮説、検証、報告を記録し、それを以前の作業とリンクする。
約12日間に渡り,13人の言語モデル労働者がアゴラを重み移動問題の解決に利用したことを報告した。
論文 参考訳(メタデータ) (2026-09-16T04:00:54Z) - TyPatch: Transforming Patches into Typestate Rules for Kernel Bug Detection [9.241492644741198]
我々はTyPatchを紹介し、パッチ固有の欠陥セマンティクスをアナライザの実装から分離する。
Linux v6.16では、TyPatchは559の異なるバグを発見し、そのうち121はカーネル開発者によって確認されている。
論文 参考訳(メタデータ) (2026-09-12T05:34:12Z) - Measuring the Checker: Mutation Analysis for GPU-Kernel Benchmark Oracles [86.41218924166775]
LLM生成のGPUカーネルのベンチマークは、ランダムな入力とゆるやかな浮動小数点耐性で正確性を決定する。
最近の研究は、これらのチェッカーは弱く、手動でパッチを当てることに同意している。
本稿では,カーネルベンチマークの精度指標として突然変異解析を導入する。
論文 参考訳(メタデータ) (2026-09-02T10:30:05Z) - PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation [51.92442051257354]
PairCoderは、実行のみではなく、完全な公式メトリックスイート上で、アーティファクトが検証可能なすべてのベンチマークを本質的に改善する。
TikZのコンパイルレートは、各モデルで10から30ポイント、シングルモデルの2.9から9.2倍である。
論文 参考訳(メタデータ) (2026-07-02T08:36:02Z) - Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All [57.23434868678603]
Live-kBenchは、新たに発見されたカーネルバグのエージェントをスクラップし、評価するセルフ進化ベンチマークの評価フレームワークである。
kEnvは、カーネルのコンパイル、実行、フィードバックのためのエージェントに依存しないクラッシュ解決環境である。
kEnvを用いて3つの最先端エージェントをベンチマークし、最初の試行で74%のクラッシュを解決したことを示す。
論文 参考訳(メタデータ) (2026-02-02T19:06:15Z) - Discovering 100+ Compiler Defects in 72 Hours via LLM-Driven Semantic Logic Recomposition [15.27741331581011]
プログラム生成に機能を組み合わせたコンパイラファズーであるFeatureFuzzを提案する。
24時間にわたるキャンペーンで、FeatureFuzzは167のユニークなクラッシュを発見し、これは第2位のファザーより2.78倍高い。
72時間のファジィキャンペーンを通じて、FeatureFuzzはGCCとLLVMの113のバグを特定した。
論文 参考訳(メタデータ) (2026-01-18T11:33:45Z) - BugPilot: Complex Bug Generation for Efficient Learning of SWE Skills [59.003563837981886]
高品質なバグは、次世代の言語モデルベースソフトウェアエンジニアリング(SWE)エージェントをトレーニングする鍵となる。
難易度および多種多様なバグを合成する新しい方法を提案する。
論文 参考訳(メタデータ) (2025-10-22T17:58:56Z) - NeuRI: Diversifying DNN Generation via Inductive Rule Inference [16.463237407360594]
NeuRIは、有効な多様なディープラーニングモデルを生成するための、完全に自動化されたアプローチである。
NeuRIは、最先端のモデルレベルのファザよりも、PyTorchのブランチカバレッジを24%と15%改善する。
論文 参考訳(メタデータ) (2023-02-04T23:42:07Z) - Coverage-Guided Tensor Compiler Fuzzing with Joint IR-Pass Mutation [20.519361342905775]
広範に使われているTVMテンソルコンパイラのためのファジィ手法であるTzerを提案する。
以上の結果から,Tzerはテンソルコンパイラテストにおいて,既存のファジリング技術よりも大幅に優れていることがわかった。
これまでTzerは、TVMの49の既知のバグを検出し、37のバグが確認され、25のバグが修正された。
論文 参考訳(メタデータ) (2022-02-21T01:48:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。