論文の概要: Auditing Empirical Comparisons in Quantum Software
- arxiv url: http://arxiv.org/abs/2607.00516v1
- Date: Wed, 01 Jul 2026 07:02:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.767697
- Title: Auditing Empirical Comparisons in Quantum Software
- Title(参考訳): 量子ソフトウェアにおける経験的比較
- Abstract要約: 実証的な量子ソフトウェア論文では、あるコンパイラ、バックエンド、あるいはアザッツが別のコンパイラよりも優れていると報告されることが多い。
既存のテスト、ベンチマーク、メソッドは、プログラム、ツール、実行、プラットフォームを評価するのに役立つ。
CLAIMSTAB-QCは、量子ソフトウェアにおける経験的比較を監査するための、ソースバウンドなフレームワークである。
- 参考スコア(独自算出の注目度): 2.384717245145118
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Empirical quantum-software papers often report that one compiler, optimizer, backend, or ansatz outperforms another. Such comparisons are not properties of a tool alone: they can change with benchmark scope, circuit construction, compilation, sampling, backend or noise assumptions, optimizer choices, and resource budgets. Existing testing, benchmarking, and reproducibility methods help assess programs, tools, executions, and platforms, but they do not directly audit whether the reported comparison itself is supported by the evidence exposed in the source paper or accompanying materials. We present CLAIMSTAB-QC, a source-bounded framework for auditing empirical comparisons in quantum software. Given a reported comparison, the framework records the baselines, metric, relation, and admissible evidence; locks the comparison design before outcomes are computed; and reports either a scoped relation outcome or an explicit evidence boundary. For strict scalar-directional comparisons, the reported direction is classified as Sustained, Unresolved, or Reversed within the locked audit scope. We evaluate CLAIMSTAB-QC on 455 comparative claims from 119 quantum-software papers. The central finding is a materialization gap: 175 claims can be represented for audit planning, 79 become scalar-directional planning records, 53 yield lockable audit or diagnostic designs, and only 8 expose enough matched evidence to audit the original comparison without proxy reconstruction. These 8 records yield 2 Sustained, 4 Unresolved, and 2 Reversed outcomes. Controlled diagnostics over 24 benchmark-relevant comparisons further show that simpler checks can preserve apparent directions whose support weakens under locked audit designs.
- Abstract(参考訳): 経験的量子ソフトウェア論文では、あるコンパイラ、オプティマイザ、バックエンド、あるいはアザッツが別のコンパイラよりも優れていると報告されることが多い。
ベンチマークスコープ、サーキット構成、コンパイル、サンプリング、バックエンドまたはノイズの仮定、オプティマイザの選択、リソース予算で変更できる。
既存のテスト、ベンチマーク、再現性メソッドは、プログラム、ツール、実行、プラットフォームを評価するのに役立ちますが、報告された比較そのものがソースペーパーや関連する資料で公開された証拠によってサポートされているかどうかを直接監査することはできません。
CLAIMSTAB-QCは、量子ソフトウェアにおける経験的比較を監査するための、ソースバウンドなフレームワークである。
報告された比較結果から、このフレームワークは基準線、メートル法、関係、許容できる証拠を記録し、結果が計算される前に比較設計をロックし、スコープ付き関係結果または明示的な証拠境界をレポートする。
厳密なスカラー方向比較では、報告された方向はロックされた監査範囲内でサステンド(Sustained)、アンリゾル(Unresolved)、あるいはリバース(Reversed)に分類される。
我々はCLAIMSTAB-QCを119の量子ソフトウェア論文から455のクレームと比較した。
175の主張は監査計画のために表され、79はスカラー指向の計画記録となり、53はロック可能な監査または診断設計となり、8はプロキシ再構成なしでオリジナルの比較を監査するのに十分な十分な証拠を公開している。
この8つの記録は、持続2つ、未解決4つ、逆2つの結果をもたらす。
24以上のベンチマーク関連比較を制御した診断は、ロックされた監査設計の下でサポートが弱まるように、簡易なチェックが明確な方向を維持できることをさらに示している。
関連論文リスト
- Tacet: A Language and Type System for Automatic Statistical Validity Accounting [0.0]
分析が生成したものを宣言する言語であるTacetを導入する。
その中心となる計算Tは、報告されたフットプリントと純度ビットを含む自由推定サブ言語である。
読み出し結果から選択されたサンプルは純度ビットを設定し、読み取ったものをすべて永久に検査したと記録され、片側または確認価格が与えられない。
富変換器は実現されたp-値のアンチトーンであるため、分析が実行される前に手頃な価格を確認することができ、事前登録を型付け規則に変換することができる。
論文 参考訳(メタデータ) (2026-08-27T17:59:01Z) - Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation [3.079997053226693]
本報告では,4つの主要なツールコール・ベンチマーク・ファミリーの体系的妥当性と評価について述べる。
496人の専門家がレビューしたベンチマークタスクのうち、92人の評価者と人間の意見の不一致が18.5%のミスアライメントレートに対応している。
ツールコール評価失敗、トレースレベルの監査成果物、修正された評価項目の統一分類を導入し、ツールの実行、タスク完了、結果検証を別々に計測する指標について議論する。
論文 参考訳(メタデータ) (2026-06-30T21:10:42Z) - SafetyRepro: Configuration-Conditional Rank Instability on Alignment Benchmarks [0.30586855806896046]
有限エンベロープ命題は、厳密な順序付けが構成対逆転を許容するか否かを計測可能なペアワイズ判定率に結びつける。
テストするすべてのベンチマークにおいて、設定の選択だけでペアワイズな判断を覆すことができます。
論文 参考訳(メタデータ) (2026-05-25T06:54:44Z) - Confidence-Aware Alignment Makes Reasoning LLMs More Reliable [65.44962502963378]
CASPOは、トークンレベルの信頼度とステップワイドな論理的正しさを、個別の報酬モデルをトレーニングせずに整合させるフレームワークである。
推論中、信頼を意識した思考(CaT)を提案し、不確実な推論枝を無視可能なO(V)レイテンシで動的に生成する。
10のベンチマークと複数のモデルファミリでの実験では、CASPOは推論の信頼性と推論効率を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-08T07:08:25Z) - Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone [11.663456969895462]
機械学習におけるアライメント評価は、主にモデルの評価となっている。
本稿では, モデルレベルの評価だけでは, 配置関連アライメントを推定できないことを論じる。
論文 参考訳(メタデータ) (2026-05-06T03:28:30Z) - FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification [57.196748998757954]
本稿では,クレーム抽出,文献位置決定,実行に基づくクレーム検証を組み合わせたエビデンスベースレビューシステムであるFactReviewを紹介する。
FactReviewは論文を提出すると、主要なクレームを特定し、その結果を報告し、論文の技術的な位置を明らかにするために近くの作業を取り出し、コードが利用可能であれば、リリースされたリポジトリを実行する。
その後、簡潔なレビューと、主要な請求を5つのラベルのうち1つに割り当てるエビデンスレポートを生成する。
論文 参考訳(メタデータ) (2026-04-05T11:45:22Z) - DeepFact: Co-Evolving Benchmarks and Agents for Deep Research Factuality [49.62610727661819]
既存のファクトチェッカーは主に汎用ドメイン、ファクトイドスタイルの原子クレーム用に設計されている。
本稿では,ベンチマークラベルと有理値が明示的に変更可能なAudit-then-Score (AtS)を提案する。
我々は、AtSを、監査可能な有理量を持つDRR事実性ベンチマークであるDeepFact-Benchとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-03-06T05:05:57Z) - Retrieval-Infused Reasoning Sandbox: A Benchmark for Decoupling Retrieval and Reasoning Capabilities [32.76303717104482]
DeR2(DeR2)は、ドキュメント基底推論を分離する制御されたディープ検索サンドボックスである。
DeR2は、推論から4つのレシエーション(命令のみ、概念のみ、関連のみ、フルセット)を通じてアクセスする証拠を分離する。
さまざまな最先端の基礎モデルに対する実験は、かなりのバリエーションと重要なヘッドルームを明らかにしている。
論文 参考訳(メタデータ) (2026-01-29T16:26:19Z) - Retrieve-Refine-Calibrate: A Framework for Complex Claim Fact-Checking [32.6738019397553]
大規模言語モデル(LLM)に基づくRetrieve-Refine-Calibrate(RRC)フレームワークを提案する。
特に、このフレームワークは、まずクレームに記載されたエンティティを特定し、それらに関連する証拠を検索する。
そして、無関係な情報を減らすためのクレームに基づいて、回収された証拠を精査する。
最後に、信頼性の低い予測を再評価することで検証プロセスを校正する。
論文 参考訳(メタデータ) (2026-01-23T08:48:52Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - SparseCL: Sparse Contrastive Learning for Contradiction Retrieval [87.02936971689817]
コントラディション検索(Contradiction Search)とは、クエリの内容に明示的に異を唱える文書を識別し、抽出することである。
類似性探索やクロスエンコーダモデルといった既存の手法には、大きな制限がある。
文間の微妙で矛盾したニュアンスを保存するために特別に訓練された文埋め込みを利用するSparseCLを導入する。
論文 参考訳(メタデータ) (2024-06-15T21:57:03Z) - Benchmarking Answer Verification Methods for Question Answering-Based
Summarization Evaluation Metrics [74.28810048824519]
質問応答に基づく要約評価メトリクスは、QAモデルの予測が正しいかどうかを自動的に判断する必要がある。
筆者らは,現在QAベースのメトリクスで使用されている語彙的回答検証手法と,より洗練された2つのテキスト比較手法をベンチマークした。
論文 参考訳(メタデータ) (2022-04-21T15:43:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。