論文の概要: Exposing SIMD Parallelism in SQIsign: An AVX-512 Implementation
- arxiv url: http://arxiv.org/abs/2608.13948v2
- Date: Mon, 17 Aug 2026 12:09:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 13:30:43.596135
- Title: Exposing SIMD Parallelism in SQIsign: An AVX-512 Implementation
- Title(参考訳): SQIsignにおけるSIMD並列性公開: AVX-512の実装
- Abstract要約: 現代の等質暗号系は、実行時間の大部分を有限体、楕円曲線、高次元等質演算に費やしている。
より高度なプリミティブの算術的依存グラフを再編成することで,SIMDの並列性は回復可能であることを示す。
- 参考スコア(独自算出の注目度): 8.28115240166203
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern isogeny-based cryptosystems spend much of their running time in finite-field, elliptic-curve, and higher-dimensional isogeny arithmetic. Exploiting SIMD parallelism is nontrivial: routines such as Montgomery ladders contain loop-carried dependencies, while point, pairing, and theta-coordinate formulas expose only irregular fine-grained parallelism. We show that substantial SIMD parallelism can be recovered by reorganizing the arithmetic dependency graphs of higher-level primitives rather than vectorizing field multiplication in isolation. We develop an end-to-end AVX-512IFMA implementation of SQIsign in which data remain in a radix-$2^{51}$ vector representation across most of the curve-side computation. Our redesign includes projective xDBLADD schedules, batched point doubling in several coordinate systems, a vectorized biscalar ladder, fused cubical-arithmetic pairing steps, and batched one- and two-dimensional isogeny evaluation. Relative to the reference C implementation, we achieve end-to-end speedups of $1.76\times$, $1.71\times$, and $3.18\times$ for key generation, signing, and verification at NIST level~I; combined with Qlapoti, key-generation and signing speedups rise to $2.90\times$ and $2.69\times$. We further apply the same backend and methodology to CORAL, a recent isogeny group action for post-quantum non-interactive key exchange based on two-dimensional $2$-isogenies. Across five parameter sets, this yields $1.28$--$1.40\times$ speedups for key generation and $1.92$--$2.46\times$ for shared-key computation. These results provide cross-scheme evidence that algorithm-level SIMD scheduling is a reusable optimization dimension for higher-dimensional isogeny cryptography.
- Abstract(参考訳): 現代の等質暗号系は、実行時間の大部分を有限体、楕円曲線、高次元等質演算に費やしている。
モンゴメリーはしご(英語版)のようなルーチンはループ駆動の依存関係を含むが、点、ペアリング、テータ座標式は不規則な微細な並列性のみを露呈する。
本研究では,高次プリミティブの算術的依存グラフをベクトル化フィールド乗法ではなく再編成することで,SIMDの並列性を大幅に回復できることを示す。
SQIsign の終端から終端までの AVX-512IFMA 実装を開発した。
我々の再設計には、射影 xDBLADD スケジュール、複数の座標系におけるバッチ点倍増、ベクトル化された双スカラーはしご、融合された立方体対数ステップ、バッチ化された1次元および2次元等質評価が含まれる。
参照Cの実装とは対照的に、1.76\times$, $1.71\times$, $3.18\times$をキージェネレーション、署名、検証のためにNISTレベル~Iで達成し、Qlapotiと組み合わせると、キージェネレーションと署名のスピードアップは2.90\times$と2.69\times$に上昇する。
さらに,2次元2ドルの異種性に基づく非相互作用鍵交換のための最近の同種グループであるCoRALにも,同様のバックエンドと方法論を適用した。
5つのパラメータセットにまたがって、1.28$--1.40\times$キー生成のスピードアップ、1.92$--2.46\times$共有キー計算のスピードアップとなる。
これらの結果は,アルゴリズムレベルのSIMDスケジューリングが高次元等質暗号における再利用可能な最適化次元であることを示す。
関連論文リスト
- ELiTeFormer: An Efficient Transformer for FPGAs [3.884894816711594]
トランスフォーマーブロックは、大きな言語モデル(LLM)で広く使われているが、現在のデプロイメント課題である。
ELiTeFormerは,ハイブリッド線形アテンションと超低精度(3次)線形プロジェクションを一体化した最初のトランスフォーマーモデルである。
論文 参考訳(メタデータ) (2026-07-04T00:52:06Z) - Low-rank Updates in Slowly Time-varying Graphs for Spatial-Temporal Signal Interpolation [36.25340747048208]
グラフ信号処理(GSP)における重要な仮定は、ノード間のペアの類似性をキャプチャする基礎となるグラフの存在である。
ノード間類似性が時間とともに変化する時空間データに対して、静的な空間グラフは不十分である。
グラフ変化を2つの連続隣接行列$P = W(2) - W(1)$で低ランク行列としてモデル化する。
論文 参考訳(メタデータ) (2026-06-22T23:33:33Z) - Demystifying Pipeline Parallelism: First Theory for PipeDream [53.657104889705856]
本稿では、PDスタイルの手法に対して、クリーンな非収束性をもたらす固定ブロック-SGD抽象化としてランダム化PipeDream(PD)を導入する。
定常PDによって引き起こされる遅延は、$S2 - S/2 + O(1)$ for $S$として増大するので、スタイルリードのコントリビューションは、チューナレート形式で$(2S4)$、同等に$(S4/K)$としてスケールする。
論文 参考訳(メタデータ) (2026-06-02T11:14:57Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z) - Communication-Efficient, 2D Parallel Stochastic Gradient Descent for Distributed-Memory Optimization [2.2596489829928452]
この研究は、1D $s$-step SGD と Averaging (FedAvg) を用いた 1D Federated SGD の作業を一般化し、2D 並列 SGD 法 (HybridSGD) を生成する。
C++ と MPI で全てのアルゴリズムを実装し,Cray EX スーパーコンピュータシステム上での性能評価を行う。
論文 参考訳(メタデータ) (2025-01-13T17:56:39Z) - EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference [49.94169109038806]
本稿では,既存の並列処理方式を超越したMoE用パイプラインスケジューラであるEPS-MoEを紹介する。
その結果,既存の並列推論手法と比較して,プリフィルスループットは52.4%向上した。
論文 参考訳(メタデータ) (2024-10-16T05:17:49Z) - Block encoding bosons by signal processing [0.0]
単位行列に対する量子特異値変換(QSVT)や量子固有値変換(QETU)といったQSPベースの手法がBEの実装に有効に利用できることを示す。
本稿では,QSVTアルゴリズムとQETUアルゴリズムと組み合わせて,格子ボソンに対するハミルトニアンの符号化をブロックするいくつかの例を示す。
QSVTをBEに使用すると、サイト毎のキュービット数で最高のゲートカウントスケーリングが得られるが、LOVE-LCUは最大$lesssim11$ qubitsの演算子に対して、他のすべてのメソッドよりも優れている。
論文 参考訳(メタデータ) (2024-08-29T18:00:02Z) - Fast computation of 2-isogenies in dimension 4 and cryptographic applications [0.0]
次元 $ggeq 1$ のアーベル多様体とレベル $n=2$ のtheta-coordinates の間の 2$-isogenies の連鎖を計算するアルゴリズムを提案する。
開始曲線の自己準同型環が、ラップトップ上で数秒以内に未知である場合には、SIDHに対して完全なキーリカバリ攻撃を実行することができる。
論文 参考訳(メタデータ) (2024-07-22T09:19:20Z) - AdaLog: Post-Training Quantization for Vision Transformers with Adaptive Logarithm Quantizer [54.713778961605115]
Vision Transformer (ViT) はコンピュータビジョンコミュニティにおいて最も普及しているバックボーンネットワークの1つである。
本稿では,AdaLog(Adaptive Logarithm AdaLog)量子化器を提案する。
論文 参考訳(メタデータ) (2024-07-17T18:38:48Z) - An Efficient Algorithm for Modulus Operation and Its Hardware Implementation in Prime Number Calculation [0.0]
提案アルゴリズムは加算演算,減算演算,論理演算,ビットシフト演算のみを用いる。
暗号化アプリケーションにおけるスケーラビリティの課題に対処する。
このアルゴリズムを50,000までの素数計算に適用すると、実用性と性能上の利点が示される。
論文 参考訳(メタデータ) (2024-07-17T13:24:52Z) - Projection by Convolution: Optimal Sample Complexity for Reinforcement Learning in Continuous-Space MDPs [56.237917407785545]
本稿では,円滑なベルマン作用素を持つ連続空間マルコフ決定過程(MDP)の一般クラスにおいて,$varepsilon$-optimal Policyを学習する問題を考察する。
我々のソリューションの鍵となるのは、調和解析のアイデアに基づく新しい射影技術である。
我々の結果は、連続空間 MDP における2つの人気と矛盾する視点のギャップを埋めるものである。
論文 参考訳(メタデータ) (2024-05-10T09:58:47Z) - Multi-level projection with exponential parallel speedup; Application to sparse auto-encoders neural networks [2.264332709661011]
ell_1,infty$ノルムの時間複雑性は、$mathbbRntimes m$の行列に対して$mathcalObig(n m big)$のみであることを示す。
実験により、我々の予測は、実際の最速のユークリッドアルゴリズムの2倍高速であることが示されている。
論文 参考訳(メタデータ) (2024-05-03T13:21:49Z) - Transformers as Support Vector Machines [54.642793677472724]
自己アテンションの最適化幾何と厳密なSVM問題との間には,形式的等価性を確立する。
勾配降下に最適化された1層変圧器の暗黙バイアスを特徴付ける。
これらの発見は、最適なトークンを分離し選択するSVMの階層としてのトランスフォーマーの解釈を刺激していると信じている。
論文 参考訳(メタデータ) (2023-08-31T17:57:50Z) - GloptiNets: Scalable Non-Convex Optimization with Certificates [61.50835040805378]
本稿では,ハイパーキューブやトーラス上のスムーズな関数を扱う証明書を用いた非キューブ最適化手法を提案する。
スペクトルの減衰に固有の対象関数の正則性を活用することにより、正確な証明を取得し、高度で強力なニューラルネットワークを活用することができる。
論文 参考訳(メタデータ) (2023-06-26T09:42:59Z) - Projection-free Graph-based Classifier Learning using Gershgorin Disc
Perfect Alignment [59.87663954467815]
グラフベースのバイナリ学習では、既知のラベルのサブセット$hatx_i$を使って未知のラベルを推論する。
ラベルの$x_i$をバイナリ値に制限する場合、問題はNPハードである。
代わりに線形プログラム(LP)の列を解くことにより,高速なプロジェクションフリー手法を提案する。
論文 参考訳(メタデータ) (2021-06-03T07:22:48Z) - On Effective Parallelization of Monte Carlo Tree Search [51.15940034629022]
モンテカルロ木探索(MCTS)は、探索木を構築するためにかなりの数のロールアウトを必要とするため、計算コストがかかる。
効果的な並列MCTSアルゴリズムを設計する方法は、体系的に研究されておらず、まだよく分かっていない。
我々は,より効率的な並列MCTSアルゴリズムの設計に,提案する必要条件をどのように適用できるかを実証する。
論文 参考訳(メタデータ) (2020-06-15T21:36:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。