論文の概要: Qupertino: Pure MLX Array Kernels versus Hand-Tuned Metal Shaders for Quantum Circuit Simulation on Apple Silicon
- arxiv url: http://arxiv.org/abs/2609.19147v1
- Date: Thu, 09 Jul 2026 08:58:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.612899
- Title: Qupertino: Pure MLX Array Kernels versus Hand-Tuned Metal Shaders for Quantum Circuit Simulation on Apple Silicon
- Title(参考訳): Qupertino: Apple Silicon上の量子回路シミュレーションのための純MLX配列カーネルと手動金属シェーダー
- Abstract要約: Apple Silicon用のオープンソースの量子回路シミュレータQupertinoを紹介する。
純粋なティアは構造化ゲートを特殊なMLXカーネルにディスパッチする。
ベンチマークでは、オプトインシェーダ層がすべての構造化レイヤファミリに対して手書きのMetalカーネルを追加しています。
- 参考スコア(独自算出の注目度): 0.304585143845864
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Qupertino, an open-source quantum circuit simulator for Apple Silicon, and use it to ask how far a simulator written purely in MLX array operations can go and what remains for hand-tuned Metal shaders. The framework ships two measured tiers. The pure tier dispatches structured gates to specialized MLX kernels: diagonal gates run as broadcast phase multiplies, controlled gates as masked half-state updates, and SWAP as an axis permutation; a paired dense-path ablation attributes a 25-33x speedup to this dispatch alone. The opt-in shader tier adds hand-written Metal kernels for every structured layer family in our benchmarks, including phase-LUT diagonals, GF(2) affine permutation gathers, fused tensor-product single-qubit layers, radix-4 QFT and Walsh-Hadamard butterflies, and basis-conjugated XX/YY Trotter layers; runtime fusion detectors route work to them while preserving circuit semantics exactly, confirmed by parity tests. In a four-way interleaved campaign on M1 Max (two warmups, ten measured repeats per cell), the shader tier is fastest by mean runtime in all 18 comparison cells against same-machine Qiskit Aer CPU and PennyLane lightning.qubit. At 25 qubits, gate-stream QFT runs in 0.0591 +/- 0.0029 s (paired 47.2x over Aer, 95.3x over PennyLane) and TFIM Trotter evolution in 0.495 +/- 0.035 s (36.2x and 67.2x). Across a 29-workload suite, the shader tier's paired speedup over pure MLX reaches 25x, with 25 of 29 workloads accelerating above parity. The framework also supports variational ansatz workloads, QAOA, QCBM, Trotter-Suzuki Hamiltonian simulation, and OpenQASM 2.0 import (unitary subset); a preliminary MPS backend reaches 150 qubits on limited-entanglement workloads. Correctness rests on 253 Python tests, independent complex128 checks, and a Trotter-error curve against exact diagonalization. State-vector memory remains exponential in qubit count.
- Abstract(参考訳): 我々は、Apple Siliconのオープンソースの量子回路シミュレータQupertinoを紹介し、それを、MLX配列操作で純粋に書かれたシミュレータがどこまで進むか、手作りのMetalシェーダーに残るものを尋ねる。
このフレームワークは、2つの測定された層を出荷する。
純粋な層は、構造化ゲートを特殊なMLXカーネルにディスパッチする: 対角ゲートはブロードキャストフェーズの乗算として、制御ゲートはマスク付きの半状態更新として、SWAPは軸の置換として、そしてペアの高密度パスアブレーションは、このディスパッチのみに25-33倍のスピードアップがある。
このオプトインシェーダ層は、フェーズLUT対角線、GF(2)アフィン置換、融合テンソル生成単ビット層、radix-4 QFTおよびWalsh-Hadamardバターフライ、ベース共役XX/YYトロッター層を含む、我々のベンチマークのすべての構造化層ファミリーに対して手書きのMetalカーネルを追加します。
M1 Max上の4方向のインターリーブ(2つのウォームアップ、1セルあたり10回の繰り返し測定)において、シェーダー層は、同じマシンのQiskit Aer CPUとPennyLane Lightning.qubitと比較して、すべての18個の比較セルの平均実行時間で最速である。
25量子ビットでは、ゲートストリームQFTは0.0591 +/- 0.0029 s(Aer 47.2x、PennyLane 95.3x)で走り、TFIMトロッターは0.495 +/- 0.035 s (36.2x、67.2x)で進化する。
29のワークロードスイート全体で、シェーダー層の純粋なMLX上でのペアスピードアップは25倍に達し、29のワークロードのうち25がパリティ以上で加速している。
このフレームワークは、可変アンサッツワークロード、QAOA、QCBM、トロッター・スズキ・ハミルトンシミュレーション、OpenQASM 2.0インポート(ユニットサブセット)もサポートする。
正確性は、253のPythonテスト、独立したcomplex128チェック、正確な対角化に対するTrotter-error曲線に依存する。
状態ベクトルメモリは量子ビット数で指数関数的である。
関連論文リスト
- Circuit Hypernetworks for Quantum-Augmented Diffusion Language Models [26.836972508136125]
凍結言語モデルにトークン条件付き量子残差分枝を追加するHyperQを導入する。
各ブランチ内では、軽量回路ハイパーネットワークがトークン固有の回転角、結合強度、測定軸を放出する。
64量子ビットでは、HyperQはバックボーンとローランク適応のそれぞれ4.71ポイントと3.67ポイントを超えている。
論文 参考訳(メタデータ) (2026-09-21T14:25:04Z) - Unfolding the Leech Lattice: Fused Multi-Shell Decoding and VRAM Layouts for 2-Bit LLM Weights [8.550323073861415]
リーチ格子ベクトル量子化は、最強の報告された2ビット品質を独自の評価プロトコルで保持する。
本報告では, バッチ1におけるデコード相GEMVの供用コストを計測する。
論文 参考訳(メタデータ) (2026-09-02T14:26:06Z) - Measuring Maximum Activations in Open Large Language Models [60.3514350516308]
集中度, MoE, 視覚言語, 中間訓練, 命令調整型変異にまたがる8つのオープンファミリーから27個のチェックポイントで, グローバルおよび階層的に最大値を測定した。
最大アクティベーションサイズは、単純なサイズの副産物ではなく、ファミリー、アーキテクチャ、トレーニングステージに結びついているモデル特性である、と結論付けます。
論文 参考訳(メタデータ) (2026-05-15T03:31:51Z) - XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference [0.0]
XFPはコードブックのサイズ、アウトリーチ予算、レイヤごとのパッケージを自動的に決定する。
XFPはワークステーションハードウェア上で128 tok/sのシングルストリームデコードに達する。
対象メモリエンベロープに収まらないモデルに対しては、H-Processを示す。
論文 参考訳(メタデータ) (2026-05-14T13:52:31Z) - Hierarchical Transformer Preconditioning for Interactive Physics Simulation [28.137076331332413]
階層型トランスフォーマープレコンディショナー(Hierarchical Transformer Preconditioner)は、弱い許容率のH行列分割に固定されたニューラルプレコンディショナーである。
ネットワークは低ランクの遠距離因子を通して逆をモデル化する。
高速道路の接続を利用して、奥行きを隔ててコンテキストを伝播する。
論文 参考訳(メタデータ) (2026-05-13T11:02:27Z) - A Controlled Study of Memory Hierarchy Transitions in Quantum Circuit Simulation on Apple M4 Pro Unified Memory Architecture [0.0]
状態ベクトル量子回路シミュレーションはメモリ帯域境界である。
Apple M4 Pro Unified Memory Architectureを使ってこの問題に対処する。
ピークストリーミング帯域幅は、連続しないメモリアクセスパターンのシミュレーションスピードアップを予測できないことを示す。
論文 参考訳(メタデータ) (2026-05-09T08:22:55Z) - Gated QKAN-FWP: Scalable Quantum-inspired Sequence Learning [38.502127166117674]
量子インスパイアされたKolmogorov-Arnold Network(QKAN)とFWPを統合した高速軽量フレームワークQKAN-FWPを提案する。
私たちは、DARUAN(DatA Re-Uploading ActivatioN)として知られる、学習可能な非線形アクティベーションとしてシングルキュービットデータ再ロード回路を使用している。
時系列ベンチマーク,MiniGrid強化学習,および実世界の太陽周期予測を主要な実践的結果として取り上げ,その枠組みを評価する。
論文 参考訳(メタデータ) (2026-05-07T13:04:09Z) - Open-TQ-Metal: Fused Compressed-Domain Attention for Long-Context LLM Inference on Apple Silicon [0.0]
我々は、Apple Siliconに融合圧縮ドメインアテンションの最初の実装であるOpen-TQ-Metalを紹介する。
Llama 3.1 70Bの128Kコンテクスト推論を可能にする。
Open-TQ-MetalはKVキャッシュをオンザフライでInt4に量子化し、圧縮された表現に直接注意を計算する。
論文 参考訳(メタデータ) (2026-04-18T10:39:28Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - Chronicals: A High-Performance Framework for LLM Fine-Tuning with 3.51x Speedup over Unsloth [0.0]
Unsloth上で3.5倍のスピードアップを実現したオープンソースのトレーニングフレームワークであるCentralsを紹介します。
オンラインのソフトマックスの正しさ、FlashAttention IO complexity O(N2 d2 M-1)、LoRA+学習速度勾配近似など、完全な数学的基礎を提供する。
論文 参考訳(メタデータ) (2026-01-06T00:00:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。