論文の概要: Benchmarking Large Language Models on Repairing Qiskit Programs using Bugs4Q
- arxiv url: http://arxiv.org/abs/2607.09007v1
- Date: Fri, 10 Jul 2026 00:23:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.759861
- Title: Benchmarking Large Language Models on Repairing Qiskit Programs using Bugs4Q
- Title(参考訳): Bugs4Qを用いたQiskitプログラム修復のための大規模言語モデルのベンチマーク
- Authors: Saumya Brahmbhatt, Mitali Hukkeri, Dongchan Kim, M. V. Panduranga Rao, Lei Zhang,
- Abstract要約: 67個の真のQiskit欠陥を含む2つのBugs4Qバージョンを評価する。
参照修正が実行を止めたり、バグのあるプログラムが障害を再現しない場合、量子ベンチマークはサイレントラベルエラーに悩まされる可能性がある。
- 参考スコア(独自算出の注目度): 3.9289101676026146
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: In quantum programs, Bugs4Q is a widely used benchmark containing real quantum defects. However, its evaluation assumes that benchmark labels remain valid and that generated fixes execute in the target environment. We evaluate two Bugs4Q versions containing 67 unique real Qiskit defects, adding executable tests where missing, and re-run all entries across six pinned Qiskit releases (0.25.0, 0.45.0, 1.0.0, 1.1.1, 2.0.0, and 2.3.1). We find that quantum benchmarks can suffer from silent label inversion: entries become invalid without errors when reference fixes stop executing or buggy programs no longer reproduce failures. Thus, correctness depends on the (benchmark, version) pair rather than the benchmark alone. We evaluate four LLMs (GPT-4o-mini, GPT-5o-mini, GPT-5.4, and GPT-5.4-mini), generating up to 10 repair candidates per defect and testing them across all versions. GPT-5.4 achieves the highest pass@10 (48.8%), followed by GPT-5.4-mini (47.3%), GPT-5o-mini (30.3%), and GPT-4o-mini (22.6%). All models perform best on Qiskit 0.45.0 and decline after the Qiskit 1.0 transition. Many failures arise from deprecated or incompatible APIs rather than incorrect repairs, and 64\% of successful repairs occur on entries invalid under the target version. We release a re-validated, version-pinned Bugs4Q benchmark and show that benchmark validation must precede repair evaluation.
- Abstract(参考訳): 量子プログラムでは、Bugs4Qは実際の量子欠陥を含む広く使われているベンチマークである。
しかし、その評価では、ベンチマークラベルは有効であり、生成された修正はターゲット環境で実行されると仮定している。
67の真のQiskit欠陥を含む2つのBugs4Qバージョンを評価し、欠落した6つのピン付きQiskitリリース(0.25.0, 0.45.0, 1.0.0, 1.1.1, 2.0.0, 2.3.1)で全てのエントリを再実行する実行可能なテストを追加した。
我々は、量子ベンチマークがサイレントラベルの逆転に悩まされる可能性があることを発見した: 参照修正が実行を停止したり、バグ修正プログラムが障害を再現しない場合、エントリはエラーなしで無効になる。
したがって、正確性はベンチマーク単独ではなく(ベンチマーク、バージョン)ペアに依存します。
我々は4つのLPM(GPT-4o-mini, GPT-5o-mini, GPT-5.4, GPT-5.4-mini)を評価し、欠陥毎に最大10個の修復候補を生成し、全バージョンにわたってテストした。
GPT-5.4は最高パス@10(48.8%)、続いてGPT-5.4-mini(47.3%)、GPT-5o-mini(30.3%)、GPT-4o-mini(22.6%)となる。
全てのモデルはQiskit 0.45.0で最高の性能を示し、Qiskit 1.0移行後に低下する。
多くの障害は、不正な修復ではなく、非推奨または非互換のAPIから発生し、ターゲットバージョンで無効なエントリに対して、64\%の修正が成功している。
我々は、再検証されたバージョンピン付きBugs4Qベンチマークをリリースし、ベンチマークバリデーションが修復評価に先行する必要があることを示す。
関連論文リスト
- Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions [0.0]
大規模言語モデルは、プラウシブルな量子コードを生成することができるが、ユーザが要求する特定のソフトウェア開発キット(SDK)バージョンを確実にターゲットできるかどうかは不明である。
本稿では,バージョン忠実度測定のベンチマークであるquantum-api-driftを紹介する。
Qiskitは、v0.43、v1.3、v2.0でかなりのインターフェース変更が行われた代表的量子SDKである。
論文 参考訳(メタデータ) (2026-07-05T01:16:12Z) - On the Reproducibility of Quantum Software Defect Datasets: A Case Study of Bugs4Q [0.3383208046995158]
本研究では、量子プログラムにおける実世界のバグのデータセットであるBugs4Qを用いて、以前の研究の複製研究を行う。
実験の結果、Bugs4Q は Qiskit v0.20.1 で62.2% から v2.3.1 で16.2% に低下した。
これらの発見は以前の研究と一致しているが、相違点も観察した。特に、Bugs4Qの複製失敗のほとんどは、依存バージョンを調整するだけでは解決できない。
論文 参考訳(メタデータ) (2026-06-25T15:01:43Z) - Precise Debugging Benchmark: Is Your Model Debugging or Regenerating? [31.082688278576356]
このフレームワークは,任意のコーディングデータセットを,精度を意識したベンチマークに自動的に変換する。
必要な編集回数と、解決したバグ数を計測する2つの新しいメトリクスである、編集レベルの精度とバグレベルのリコールを定義します。
実験では、GPT-5.1-CodexやDeepSeek-V3.2-Thinkingのようなフロンティアモデルが76%を超えるが、精度は45%以下である。
論文 参考訳(メタデータ) (2026-04-19T09:08:23Z) - Are Benchmark Tests Strong Enough? Mutation-Guided Diagnosis and Augmentation of Regression Suites [49.16055123488827]
十分に強力なテストスイートは、報告された成功率を膨らませながら、妥当だが意味的に正しくないパッチを認めることができる。
STINGは、意味的に変化するプログラムの変種を診断ストレス要因として利用する、ターゲットテスト拡張のためのフレームワークである。
STINGは211インスタンスにまたがる1014の検証テストを生成し、パッチリージョンラインとブランチカバレッジを10.8%、9.5%向上させた。
論文 参考訳(メタデータ) (2026-04-02T01:13:40Z) - Specification-Guided Repair of Arithmetic Errors in Dafny Programs using LLMs [79.74676890436174]
本稿では,障害の局所化と修復のためのオラクルとして形式仕様を用いたDafny用のAPRツールを提案する。
プログラム内の各ステートメントの状態を決定するために、Hoareロジックの使用を含む一連のステップを通じて、障害をローカライズします。
また, GPT-4o miniが74.18%と高い修理成功率を示した。
論文 参考訳(メタデータ) (2025-07-04T15:36:12Z) - Why you shouldn't fully trust ChatGPT: A synthesis of this AI tool's error rates across disciplines and the software engineering lifecycle [1.7912507269030578]
ChatGPTや他の大規模言語モデル(LLM)は、医療、ビジネス、経済、工学、ソフトウェア工学(SE)で広く使われている。
その人気にもかかわらず、信頼性、特にドメイン間のエラー率とソフトウェア開発ライフサイクル(SDLC)に関する懸念が続いている。
本研究は,ChatGPTが報告した誤り率とSDLC相に整合したSEタスクを合成し,定量化する。
論文 参考訳(メタデータ) (2025-04-26T08:49:33Z) - Is Self-Repair a Silver Bullet for Code Generation? [68.02601393906083]
大規模な言語モデルは、コード生成において顕著な適性を示しているが、それでも複雑なタスクを実行するのに苦労している。
自己修復(Self-repair) — モデルが自身のコードをデバッグし、修復する — は、最近、パフォーマンスを向上する一般的な方法になっている。
我々は,Code Llama, GPT-3.5, GPT-4によるHumanEvalとAPPSの自己修復能力について分析した。
論文 参考訳(メタデータ) (2023-06-16T15:13:17Z) - QLoRA: Efficient Finetuning of Quantized LLMs [66.58009990713134]
我々は,48GBのGPU上で65Bパラメータモデルを微調整するのに十分なメモリ使用量を削減する,効率的な微調整手法QLoRAを提案する。
QLoRAは凍結した4ビット量子化事前学習言語モデルを通して低ランクアダプタ(LoRA)に逆伝搬する
最高のモデルファミリであるGuanacoは、Vicunaベンチマークでリリースされたすべてのモデルより優れています。
論文 参考訳(メタデータ) (2023-05-23T17:50:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。