論文の概要: FPGA Acceleration of Fully Homomorphic Encryption with Adaptive Key Switching
- arxiv url: http://arxiv.org/abs/2609.09423v1
- Date: Tue, 08 Sep 2026 20:24:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.810021
- Title: FPGA Acceleration of Fully Homomorphic Encryption with Adaptive Key Switching
- Title(参考訳): 適応鍵スイッチングによる完全同型暗号のFPGA高速化
- Abstract要約: キースイッチングは、FHE(Fully Homomorphic Encryption)操作における主要なパフォーマンスボトルネックである。
近年の暗号技術では、特定の操作の複雑さを減らし、従来のハイブリッド鍵スイッチング法(HKS)よりも高い計算精度を必要とする新しい鍵スイッチング法(KLSS)が導入されている。
オフチップ暗号文転送を不要とするメモリ効率の高いKLSSデータパスを提案する。
そこで我々は,KLSSとHKSの両方のオーバーヘッドを分析し,比較する性能モデルを開発した。
- 参考スコア(独自算出の注目度): 10.382948833881693
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fully Homomorphic Encryption (FHE) enables privacy-preserving cloud services but incurs substantial computation overhead, making hardware acceleration essential. Among FHE operations, key-switching is a major performance bottleneck. Recent cryptographic advances introduce a novel key-switching method (i.e., KLSS) that reduces certain operational complexity but demands higher computational precision than the traditional Hybrid Key Switching (HKS) method. This trade-off leads to distinct computation and memory requirements, making the relative latency of KLSS and HKS highly dependent on hardware parallelism, FHE security parameters, and available on-chip memory capacity, particularly on FPGA platforms, where memory resources and parallelism must be carefully balanced. In this work, we first propose a memory-efficient KLSS datapath that eliminates off-chip ciphertext transfers. We then develop a performance model to analyze and compare the overheads of both KLSS and HKS. Our analysis reveals that an adaptive solution supporting both methods can achieve lower overall latency than a static method during FHE computation. Guided by the performance model, we design an adaptive FPGA-based FHE accelerator that dynamically selects between HKS and KLSS during computation. We implement the accelerator on an Alveo U280 and evaluate it across multiple FHE benchmarks. Experimental results demonstrate that our adaptive solution achieves a 1.84-3.31$\times$ speedup in bootstrapping latency and a 1.66-2.52$\times$ speedup in secure image classification compared to state-of-the-art FPGA accelerators.
- Abstract(参考訳): FHE(Fully Homomorphic Encryption)は、プライバシ保護のクラウドサービスを実現するが、相当な計算オーバーヘッドを発生させるため、ハードウェアアクセラレーションが不可欠である。
FHE操作の中で、キースイッチングは主要なパフォーマンスボトルネックである。
近年の暗号技術では、特定の操作の複雑さを減らし、従来のハイブリッド鍵スイッチング法(HKS)よりも高い計算精度を必要とする新しい鍵スイッチング法(KLSS)が導入されている。
このトレードオフにより、KLSSとHKSの相対レイテンシは、ハードウェアの並列性、FHEセキュリティパラメータ、特にメモリリソースと並列性を慎重にバランスしなければならないFPGAプラットフォームで利用可能なオンチップメモリ容量に大きく依存する。
本研究ではまず,オフチップ暗号文の転送を不要とするメモリ効率の高いKLSSデータパスを提案する。
そこで我々は,KLSSとHKSの両方のオーバーヘッドを分析し,比較する性能モデルを開発した。
解析の結果,両手法を適応的にサポートすることで,FHE計算時の静的手法よりも全体の遅延を小さくすることができることがわかった。
性能モデルを用いて,HKSとKLSSを動的に選択するFPGAベースのFHEアクセラレータを設計する。
このアクセラレーターをAlveo U280上で実装し、複数のFHEベンチマークで評価する。
実験の結果、我々の適応型ソリューションは、ブートストラップレイテンシの1.84-3.31$\times$スピードアップと、最先端のFPGAアクセラレータと比較して、セキュアな画像分類の1.66-2.52$\times$スピードアップを実現していることがわかった。
関連論文リスト
- Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding [51.48425605758328]
我々は,Faster Flash Decoding (FFD) という,長文デコーディングにおいてメモリ壁を壊すように設計されたハードウェア・アルゴリズムの共同設計フレームワークを提示する。
FFDはセレクタとコンピュータを完全に融合したカーネルに統合し、外部メタデータのインデックスをコンテンツ認識スキャンに置き換える。
最大11.6倍のカーネルレベルのスピードアップと256Kコンテキスト長のスケーリングを実現し、2.37倍のスループット向上を実現している。
論文 参考訳(メタデータ) (2026-08-31T15:13:20Z) - Portable Acceleration of Learning With Errors KEMs for Post-Quantum Cryptography [0.0]
OpenMP Targetオフロードを用いた格子ベースの暗号スキームのポータブルGPU実装を提案する。
その結果、OpenMP Targetのオフロードは、異種GPUエコシステム間のソースレベルのポータビリティを保ちながら、マルチコアCPUベースライン上で大幅に加速することがわかった。
論文 参考訳(メタデータ) (2026-07-10T15:46:20Z) - HE^2: A Communication-Light Heterogeneous Architecture for Efficient Fully Homomorphic Encryption [15.713680964307736]
CKKSは、完全同型暗号化方式として登場し、プライバシー保護アプリケーションに期待されている。
CKKSには、計算コストの高い計算集約演算子(ComOps)と、メモリフットプリントが大きいメモリ集約演算子(MemOps)の両方が含まれる。
データフローグラフ(DFG)最適化とアーキテクチャ共設計を備えた通信用xPU-xMUヘテロジニアスFHEアクセラレータである$HE2$を提案する。
論文 参考訳(メタデータ) (2026-05-29T08:38:53Z) - OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond [50.440302567029654]
マルチモーダルインテリジェンスにより、Key-Valueキャッシュは効率的なデプロイメントのための主要なメモリボトルネックとなった。
本研究では、チャネルごとの量子化パラダイムの本質的な限界を再考する。
X-LLMのための高精度かつ軽量なKVキャッシュ圧縮フレームワークOScaRを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:53:03Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - Bridging Superconducting and Neutral-Atom Platforms for Efficient Fault-Tolerant Quantum Architectures [14.971894680142343]
本稿では,超伝導 (SC) と中性原子 (NA) プラットフォームの利点を生かしたヘテロジニアス量子アーキテクチャ (HQA) への戦略的アプローチを提案する。
我々の設計では、NAのみのベースラインよりも平均で752タイムでスピードアップし、SCのみのシステムに比べて物理量子ビットのフットプリントを10タイム以上削減しています。
論文 参考訳(メタデータ) (2026-01-15T07:39:05Z) - FAME: FPGA Acceleration of Secure Matrix Multiplication with Homomorphic Encryption [11.342625695057281]
ホモモルフィック暗号化(HE)は、クラウドコンピューティングにおけるプライバシー問題に対処する暗号化データに対するセキュアな計算を可能にする。
したがって、プライバシー保護機械学習のようなアプリケーションには、同型暗号化MM(HE MM)の高速化が不可欠である。
本稿では HE MM の帯域幅効率 FPGA 実装について述べる。
FAMEは、HE MM用に特別に設計されたFPGAベースのアクセラレーターである。
論文 参考訳(メタデータ) (2025-12-17T15:09:36Z) - Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models [97.55009021098554]
本研究の目的は、SLMのリアルタイムレイテンシの主要な決定要因を特定し、SLMの設計とトレーニングのための一般化可能な原則と方法論を提供することである。
我々はNemotron-Flashと呼ばれるハイブリッドSLMの新たなファミリーを導入し、最先端SLMの精度・効率のフロンティアを大幅に向上させる。
論文 参考訳(メタデータ) (2025-11-24T08:46:36Z) - Towards a Functionally Complete and Parameterizable TFHE Processor [3.907410857035328]
TFHEは高速トーラスベースの完全同型暗号方式である。
これは、他のどのFHEスキームよりも高速なブートストラップ動作性能を提供する。
ホモモルフィック回路の評価には計算オーバーヘッドがかなり高い。
本稿では,同相回路評価のためのFPGAベースのハードウェアアクセラレータを提案する。
論文 参考訳(メタデータ) (2025-10-27T16:16:40Z) - HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference [8.057006406834462]
大きな言語モデル(LLM)は、レイテンシに敏感なアプリケーションにおける効率的な推論の需要を増大させた。
これらの課題に対するヘテロジニアスメモリ中心のアクセラレータであるHALOを提案する。
HALOはAtAccの最大18倍の幾何平均速度を達成し,注目度を最適化したマッピング,CENTの2.5倍を実現している。
論文 参考訳(メタデータ) (2025-10-03T02:20:17Z) - InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation [56.694702609077495]
ロングシーケンス処理は、現代の大規模言語モデルにとって重要な機能である。
InfLLM-V2は、ショートシーケンスからロングシーケンスまでのモデルをシームレスに適応する訓練可能なスパースアテンションフレームワークである。
実験では、InfLLM-V2は高密度の注意より4$times$速いが、98.1%と99.7%のパフォーマンスを維持している。
論文 参考訳(メタデータ) (2025-09-29T12:08:33Z) - EdgeBERT: Sentence-Level Energy Optimizations for Latency-Aware
Multi-Task NLP Inference [82.1584439276834]
BERTのようなトランスフォーマーベースの言語モデルでは、自然言語処理(NLP)タスクの精度が大幅に向上する。
We present EdgeBERT, a in-deepth algorithm- hardware co-design for latency-aware energy optimization for multi-task NLP。
論文 参考訳(メタデータ) (2020-11-28T19:21:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。