論文の概要: What Output-Equivalence Oracles Miss: An Empirical Study of Equivalence-Invisible Bug Fixes in Quantum Transpilers
- arxiv url: http://arxiv.org/abs/2609.13839v2
- Date: Mon, 21 Sep 2026 07:46:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 03:38:27.336375
- Title: What Output-Equivalence Oracles Miss: An Empirical Study of Equivalence-Invisible Bug Fixes in Quantum Transpilers
- Title(参考訳): 出力等価オラクルが見逃したもの:量子トランスパイラにおける等価不可視バグフィックスの実証的研究
- Abstract要約: 量子コンパイラは出力等価性によって正しいと判断される。
実際にマージされたコンパイラの修正で発生する頻度を測定します。
コーパス、コードブック、コーディングアーティファクトをリリースしています。
- 参考スコア(独自算出の注目度): 0.25489046505746704
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Quantum compilers are judged correct by an output-equivalence oracle: the compiled circuit must compute the same unitary as the original, modulo global phase and a qubit-layout permutation. This oracle, by construction, checks only that semantic map, not the circuit's own layout, permutation, or phase records: a defect there, or in a fixed-seed run's determinism, can pass unseen though the record is public. We measure how often this happens in real merged compiler fixes: a systematically identified corpus of Qiskit transpiler bug-fixes, classified by an independently dual-coded, source-validated manifestation taxonomy. Nineteen of 68 fixes (28%, 95% Wilson CI 19-40%) repair faults that this equivalence screen does not catch, even one augmented with compilation-validity, circuit-quality, and performance checks, and an extended 104-fix corpus over a wider window holds at the same rate with a tighter interval (29/104, 27.9%, CI 20-37%). A conservative floor remains even restricted to the one unconditionally equivalence-invisible channel (a corrupted layout or permutation record): 10 of 68 fixes (15%, CI 8-25%) beneath the 28% headline. The gap is not Qiskit-specific: it replicates in tket (7 of 21, 33%), with Cirq smaller but consistent. We detected no systematic differences on five inexpensive PR-level characteristics (19 vs 49, underpowered on its own; the same comparison on the extended 29-vs-75 corpus tightens every interval toward zero). This class dominates the invisible set, concentrating at representation-boundary crossings. We release the corpus, codebook, and coding artifacts. Here we only measure it.
- Abstract(参考訳): 計算回路は、元のモジュラー大域位相と同じユニタリを計算し、キュービット・レイアウトの置換を演算しなければならない。
このオラクルは、構成上、回路のレイアウト、置換、フェーズレコードではなく、セマンティックマップのみをチェックする。
Qiskitトランスパイラのバグフィックスを体系的に特定したコーパスは、独立に二重コードされたソース検証されたマニフェスト分類によって分類される。
68の修正(28%、95%のWilson CI 19-40%)のうち9つは、この等価スクリーンがキャッチできない修復欠陥であり、コンパイル正当性、回路品質、性能チェックが強化されても1つは、より広いウィンドウに104の修正コーパスが拡張されても、より厳密な間隔(29/104、27.9%、CI 20-37%)で保持される。
保守的なフロアは、28%の見出しの下にある68の修正(15%、CI 8-25%)のうち10の非条件で同値なチャネル(レイアウトまたは置換記録)に制限されている。
ギャップは、Qiskit特有のものではなく、Cirqが小さくて一貫性のある、tket(7の21と33%)で複製する。
5つの安価なPRレベル特性(19対49、自力でパワー不足、29-vs-75コーパスの場合と同様)について系統的な差は認められなかった。
このクラスは、表現境界交差に集中して見えない集合を支配している。
コーパス、コードブック、コーディングアーティファクトをリリースしています。
ここで測定するのはそれだけです。
関連論文リスト
- When LLM Decompilers Recompile More and Preserve Less [35.2873296518414]
我々は、ある関数が出荷された全てのテストに合格し、他の正当な入力で分岐することを示します。
De-Divergeは,定型あるいは手作業によるテストに頼らない行動比較オラクルである。
論文 参考訳(メタデータ) (2026-09-04T17:16:18Z) - Shortcut Before Circuit: Document Statistics Time In-Context Conflict Resolution [0.0]
我々は、電流と希薄度が正確に一致した合成言語でトランスフォーマーを訓練する。
私たちはこれらを最小限の因果編集で分離し、真実、トークン数、答え位置を固定しながら1つのキューを反転させます。
論文 参考訳(メタデータ) (2026-08-25T12:09:19Z) - When Graph-JEPA Learns the Wrong Thing: Diagnosing and Repairing Category-Conditional Collapse [3.0255780640228984]
共同埋め込み予測アーキテクチャは線形探索と有効ランクによってほぼ普遍的に選択される。
本報告では,表現中に使用可能なインスタンス情報がゼロである場合に,両者が正常に読まれる事例を報告する。
Graph-JEPAは、サブグラフの残りの側面から1つのマスクされたアスペクトを予測し、線形プローブ精度0.871と有効ランク18-47を達成する。
再現性監査とターゲットゲートを備えたハーネスをリリースする。
論文 参考訳(メタデータ) (2026-08-20T19:22:49Z) - Similarity Gates Approve Reversals: A Validity Audit of Embedding-Cosine Thresholds in Agent Systems [0.0]
エージェントフレームワークは、テキストブロックを埋め込みコサインの類似性によって比較し、固定されたカットオフを決定する品質ゲートを出荷する。
重複フィルタ、セマンティックキャッシュ、ドリフトガード、応答グレーダゲートは、質問に答えるために配置されます。
我々はこのゲートクラスを測定器として監査する。
論文 参考訳(メタデータ) (2026-08-10T20:36:40Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - Forgetting Is Not a Fix: Path Dependence in Sequential Engram Editing [35.76482964927589]
本研究では,概念固有のメモリトレースが1回,1回,1回を算術的に組み合わせて抽出できる線形オブジェクトとなるという仮説を検証した。
そのテストは、著者自身の参照実装に基づいて、報告された最高の編集強度で実行します。
アンラーニング・アズ・コンプライアンス:今日認定された消去は、次の編集後にアーティファクトを認定しない。
論文 参考訳(メタデータ) (2026-07-06T23:45:06Z) - Context-Verified, Error-Budget-Aware Decomposition Selection for Toffoli Networks [0.0]
本稿では,Toffoli 毎の分解を選択する最初のコンパイラパスを提案する。
検証者フラグ66は、コンテキストチェックなしで非等価に展開されたライブラリを書き換え、12のベンチマーク回路のうち6のカウントグレーディ置換は静かに破損する。
論文 参考訳(メタデータ) (2026-06-30T15:11:28Z) - Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence [56.25095230687242]
コーディングエージェントは、しばしば自身のローカル検証ルーチンを過度に信頼し、表面チェックを満たすアーティファクトの成功を宣言する。
この問題は、事前評価が結果駆動である変換において特に深刻である。
ブラインド・コンバージョンは26.7-28.9%に達し、スペック・パスレートは91.1%まで上昇した。
このことは、失敗は限られた予算やバックボーンの強さよりも、契約ミスによる自己検証に起因していることを示唆している。
論文 参考訳(メタデータ) (2026-05-27T19:57:15Z) - What Are We Actually Decoding? Source Attribution for Non-Invasive Brain-to-Language Retrieval [42.66754319854329]
我々は,刺激同期MEG-to-audio検索を監査フレームワークとして再放送した。
構造的ショートカット、ウィンドウレベルの刺激ロックされたエビデンス、ウィンドウ間のコンテキストアグリゲーションを使用します。
これらの結果は、脳から言語へのパフォーマンスは、単に報告されるのではなく、ソース属性であるべきだことを示唆している。
論文 参考訳(メタデータ) (2026-05-23T11:23:39Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels [41.03500441875287]
LLMベースのTritonカーネル生成は大きな関心を集めているが、基本的な実験的な疑問は未解決のままである。
本稿では,その正しさとハードウェア効率のカテゴリ認識による評価を通じて,この問題に対処するためのベンチマークであるKernelBenchXを提案する。
論文 参考訳(メタデータ) (2026-05-06T14:18:36Z) - The Rotation Gap Is Not An Error: Ternary Structure in IBM Quantum Hardware [0.0]
量子エラー補正は、すべてのシンドロームアクティベーションが修正を必要とするエラーを表すと仮定する。
756 QEC が IBM Eagle r3 プロセッサを3つに分けて実行していることから,この仮定が間違っているという証拠を提示する。
ハードウェアは、サブ・ポアソン症候群の統計を示し、一部の症候群はランダムノイズではなく、構造化された協調的な遷移であることを示している。
論文 参考訳(メタデータ) (2026-04-13T18:54:39Z) - QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation [39.32132630606808]
Qiskit、PennyLane、Cirqにまたがる統一ベンチマークであるQuanBench+を紹介します。
我々は,機能テストの実行可能なモデルの評価を行い,Pass@1およびPass@5を報告する。
フレームワーク全体で、最強のワンショットスコアはキズキットで59.5%、サークルで54.8%、ペニーレーンで42.9%に達した。
論文 参考訳(メタデータ) (2026-03-25T20:51:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。