論文の概要: Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation
- arxiv url: http://arxiv.org/abs/2605.27210v1
- Date: Tue, 26 May 2026 16:02:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:42.400935
- Title: Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation
- Title(参考訳): Qiskit QuantumKatas: Microsoftの量子コンピューティング演習をLLM評価に適用する
- Authors: Juan Cruz-Benito, Ismael Faro,
- Abstract要約: 我々は、MicrosoftのQuantumKatas量子コンピューティングカリキュラムに、体系的LLM評価のための評価フレームワークをパッケージ化する。
その結果得られたベンチマークは、26のカテゴリにわたる350のタスクで構成され、高度なアルゴリズムを通じて基本的なゲートにまたがる。
各タスクは、自然言語プロンプト、標準解、古典回路シミュレーションによる決定論的テスト検証を含む。
- 参考スコア(独自算出の注目度): 1.2891210250935148
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We adapt Microsoft's QuantumKatas -- a well-established quantum computing curriculum -- from Q# to Qiskit, the most widely-adopted quantum computing framework, and package it with an evaluation framework for systematic LLM assessment. The resulting benchmark comprises 350 tasks across 26 categories, spanning fundamental gates through advanced algorithms (Grover's, Simon's, Deutsch-Jozsa), error correction, key distribution, and quantum games. Each task includes a natural language prompt, canonical solution, and deterministic test verification via classical circuit simulation. By building on the QuantumKatas' proven pedagogical design rather than creating tasks from scratch, we inherit a principled difficulty progression and comprehensive concept coverage while contributing the framework adaptation, evaluation infrastructure, and empirical analysis. We evaluate 16 LLMs across 7 prompting configurations -- a total of 39,200 model runs -- to demonstrate the benchmark's utility. Three key findings emerge: (1) the benchmark effectively differentiates model capabilities, with best-configuration pass rates ranging from 32.3% to 83.1% and a 26.1 pp average gap between frontier and open-source models; (2) models perform well at implementing known algorithms (SimonsAlgorithm 82.1%, BasicGates 81.6%) but struggle with problem encoding (SolveSATWithGrover 34.4%, DistinguishUnitaries 40.0%); and (3) chain-of-thought prompting shows a modestly bimodal effect -- it is the best strategy for three models (two of them explicitly reasoning-tuned per vendor documentation) but degrades performance for the rest, leaving it mid-pack in aggregate (56.3% mean) behind few-shot-5 (57.8%). We release the benchmark, evaluation framework, and baseline results to support research on LLM capabilities in quantum computing.
- Abstract(参考訳): 確立された量子コンピューティングカリキュラムであるMicrosoftのQuantumKatasを、最も広く採用されている量子コンピューティングフレームワークであるQ#からQiskitに適応させ、体系的なLCM評価のための評価フレームワークでパッケージ化する。
その結果得られたベンチマークは、26のカテゴリにわたる350のタスクで構成され、高度なアルゴリズム(Grover、Simon's、Deutsch-Jozsa)、エラー修正、鍵分布、量子ゲームを通じて基本的なゲートにまたがる。
各タスクは、自然言語プロンプト、標準解、古典回路シミュレーションによる決定論的テスト検証を含む。
我々は、QuantumKatasの実証済みの教育設計に基づいて、タスクをスクラッチから作成するのではなく、フレームワーク適応、評価インフラ、経験分析に貢献しながら、基本的な難易度向上と包括的概念カバレッジを継承する。
ベンチマークの有用性を示すため、7つの設定(合計39,200モデル実行)にまたがる16のLLMを評価した。
ベンチマークはモデル機能を効果的に差別化しており、フロンティアとオープンソースの間の平均的なギャップは32.3%から83.1%、(2)既知のアルゴリズム(SimonsAlgorithm 82.1%、BasicGates 81.6%)の実装に優れているが、問題のエンコーディングに苦労している(SolveSATWithGrover 34.4%、DistinguishUnitaries 40.0%)。
我々は、量子コンピューティングにおけるLLM機能の研究を支援するために、ベンチマーク、評価フレームワーク、ベースライン結果をリリースする。
関連論文リスト
- Quantum-Safe Code Auditing: LLM-Assisted Static Analysis and Quantum-Aware Risk Scoring for Post-Quantum Cryptography Migration [0.0]
量子セーフコード(Quantum-Safe Code)は、量子を意識した静的解析フレームワークである。
量子加重プリミティブの15のクラスと変分ブーンシゾルダー(VQE)モデルを使用している。
602のラベル付きインスタンスのサンプルでは、71.98%の精度、100%のリコール、そしてF1スコア83.71%を達成した。
論文 参考訳(メタデータ) (2026-04-01T07:10:17Z) - QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation [39.32132630606808]
Qiskit、PennyLane、Cirqにまたがる統一ベンチマークであるQuanBench+を紹介します。
我々は,機能テストの実行可能なモデルの評価を行い,Pass@1およびPass@5を報告する。
フレームワーク全体で、最強のワンショットスコアはキズキットで59.5%、サークルで54.8%、ペニーレーンで42.9%に達した。
論文 参考訳(メタデータ) (2026-03-25T20:51:21Z) - Chain of Simulation: A Dual-Mode Reasoning Framework for Large Language Models with Dynamic Problem Routing [0.0]
Chain of Simulation(CoS)は、動的に問題を特別な推論戦略にルーティングする新しいデュアルモード推論フレームワークである。
CoSは、数学的問題に対する自己整合性を伴う計算フロー、空間的推論のための表現を伴う記号的状態追跡、マルチホップ推論のためのハイブリッド事実抽出という3つの異なる推論モードを採用している。
論文 参考訳(メタデータ) (2026-02-02T21:44:01Z) - Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code [76.80306464249217]
本稿では,LLMにより良い理性を教えることを目的としたTeaRを提案する。
TeaRは、注意深いデータキュレーションと強化学習を活用して、コード関連のタスクを通じて最適な推論パスを発見するモデルをガイドする。
我々は、2つのベースモデルと3つの長いCoT蒸留モデルを用いて広範な実験を行い、モデルのサイズは15億から32億のパラメータから、Math、Knowledge、Code、Logical Reasoningにまたがる17のベンチマークにまたがる。
論文 参考訳(メタデータ) (2025-07-10T07:34:05Z) - LegalEval-Q: A New Benchmark for The Quality Evaluation of LLM-Generated Legal Text [0.0]
我々は,明快さ,コヒーレンス,用語に基づく法文の質を評価する回帰モデルを構築した。
まず、モデルの品質レベルが14億のパラメータから外れ、限界的な改善は72億のパラメータで2.7%だけである。
論文 参考訳(メタデータ) (2025-05-30T17:30:18Z) - BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs [7.9458352414205295]
大規模な言語モデルは一般的なタスクでは優れていますが、ロジック重大で精度の高い、財務、法律、医療といった重要な領域での信頼性の評価は依然として難しいままです。
BizFinBenchは、実世界の金融アプリケーションにおけるLSMの評価に特化して設計された最初のベンチマークである。
BizFinBenchは中国語で6,781の注釈付きクエリで構成されており、数値計算、推論、情報抽出、予測認識、知識に基づく質問応答の5つの次元にまたがっている。
論文 参考訳(メタデータ) (2025-05-26T03:23:02Z) - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking [58.15568681219339]
大規模言語モデル(LLM)を評価するための新しいベンチマークであるEquiBenchを紹介する。
このタスクは、プログラムのセマンティクスについて推論するモデルの能力を直接テストする。
19の最先端LCMを評価し、最も難しいカテゴリでは、最高の精度は63.8%と76.2%であり、50%のランダムベースラインよりわずかに高い。
論文 参考訳(メタデータ) (2025-02-18T02:54:25Z) - "Give Me BF16 or Give Me Death"? Accuracy-Performance Trade-Offs in LLM Quantization [67.3213104337679]
量子化は大規模言語モデル(LLM)推論を高速化するための強力なツールであるが、異なるフォーマット間での精度と性能のトレードオフは依然として不明である。
FP8,INT8,INT4の量子化を学術ベンチマークや実世界のタスクで評価し,これまでで最も包括的な実証的研究を行った。
論文 参考訳(メタデータ) (2024-11-04T18:21:59Z) - Extreme Compression of Large Language Models via Additive Quantization [59.3122859349777]
我々のアルゴリズムは、AQLMと呼ばれ、情報検索のための古典的な加算量子化(AQ)アプローチを一般化する。
トークン生成のためのAQLMの高速GPUおよびCPU実装を提供しており、最適化されたFP16実装を高速にマッチングまたは性能良くすることができる。
論文 参考訳(メタデータ) (2024-01-11T18:54:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。