論文の概要: HE^2: A Communication-Light Heterogeneous Architecture for Efficient Fully Homomorphic Encryption
- arxiv url: http://arxiv.org/abs/2605.31004v1
- Date: Fri, 29 May 2026 08:38:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.478426
- Title: HE^2: A Communication-Light Heterogeneous Architecture for Efficient Fully Homomorphic Encryption
- Title(参考訳): HE^2:完全同型効率的な暗号化のための通信光不均一アーキテクチャ
- Abstract要約: CKKSは、完全同型暗号化方式として登場し、プライバシー保護アプリケーションに期待されている。
CKKSには、計算コストの高い計算集約演算子(ComOps)と、メモリフットプリントが大きいメモリ集約演算子(MemOps)の両方が含まれる。
データフローグラフ(DFG)最適化とアーキテクチャ共設計を備えた通信用xPU-xMUヘテロジニアスFHEアクセラレータである$HE2$を提案する。
- 参考スコア(独自算出の注目度): 15.713680964307736
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: CKKS, an emerging fully homomorphic encryption (FHE) scheme, has been promising in privacy-preserving applications by enabling SIMD fixed-point computations on ciphertexts. Despite its strong security guarantees, CKKS involves both compute-intensive operators (ComOps) with high computational cost and memory-intensive operators (MemOps) with large memory footprints, making existing ASIC-based or NMP-based acceleration approaches suffer from high hardware overhead and limited efficiency. This observation motivates the integration of the architectural advantages of both paradigms into a heterogeneous xPU (ASIC)-xMU (NMP) architecture. However, in such a design, frequent and long-latency heterogeneous communication caused by the dominant keyswitch operator remains a key performance bottleneck. In this paper, we propose $HE^2$, a communication-light xPU-xMU heterogeneous FHE accelerator with dataflow graph (DFG) optimization and architecture co-design. First, we observe that the majority of communication arises at the interface between ModUp/ModDown and neighboring MemOps. To address this, we propose a DFG-level optimization framework to fully exploit the ModUp/ModDown reduction potential of the hoisting algorithm by identifying parallel keyswitch blocks and fusing them for reduced communication frequency. Second, we design an efficient heterogeneous architecture that adopts a group-level pipelined execution to effectively hide communication latency by leveraging the inherent parallelism across decomposed groups. End-to-end evaluation results show that $HE^2$ achieves 1.66$\times$ speedup and 9.23$\times$ lower EDAP (Energy-Delay-Area Product) compared to the state-of-the-art accelerator, with communication stalls accounting for only 6.67% of the total latency.
- Abstract(参考訳): CKKSは、暗号文上のSIMD固定点計算を有効にすることで、プライバシ保護アプリケーションにおいて有望である。
強力なセキュリティ保証にもかかわらず、CKKSは計算コストの高い演算子(ComOps)とメモリフットプリントが大きいメモリ集約演算子(MemOps)の両方を伴い、既存のASICベースまたはNMPベースのアクセラレーションアプローチは高いハードウェアオーバーヘッドと限られた効率に悩まされる。
この観察は、両方のパラダイムのアーキテクチャ上の利点を異種xPU(ASIC)-xMU(NMP)アーキテクチャに統合する動機となっている。
しかし、この設計ではキーウィッチ演算子によって引き起こされる頻繁で長期間にわたる異種通信が重要な性能ボトルネックとなっている。
本稿では,データフローグラフ(DFG)最適化とアーキテクチャ共設計による通信用xPU-xMUヘテロジニアスFHEアクセラレータである$HE^2$を提案する。
まず、ModUp/ModDownと隣接するMemOpsのインターフェースで通信の大部分が発生することを観察する。
そこで本稿では,並列キーウィッチブロックを同定し,通信周波数の低減を目的としたDFGレベル最適化フレームワークを提案する。
第2に,分割されたグループ間の並列性を活用することにより,通信遅延を効果的に隠蔽するために,グループレベルのパイプライン実行を採用する,効率的な異種アーキテクチャを設計する。
エンド・ツー・エンド評価の結果、$HE^2$は1.66$\times$スピードアップと9.23$\times$低いEDAP(Energy-Delay-Area Product)を達成した。
関連論文リスト
- FPGA Acceleration of Fully Homomorphic Encryption with Adaptive Key Switching [10.382948833881693]
キースイッチングは、FHE(Fully Homomorphic Encryption)操作における主要なパフォーマンスボトルネックである。
近年の暗号技術では、特定の操作の複雑さを減らし、従来のハイブリッド鍵スイッチング法(HKS)よりも高い計算精度を必要とする新しい鍵スイッチング法(KLSS)が導入されている。
オフチップ暗号文転送を不要とするメモリ効率の高いKLSSデータパスを提案する。
そこで我々は,KLSSとHKSの両方のオーバーヘッドを分析し,比較する性能モデルを開発した。
論文 参考訳(メタデータ) (2026-09-08T20:24:21Z) - Accelerating Unified Multimodal Models with Core-Expansion Routing and Unified Computation Scheduling [61.28599393707943]
統一マルチモーダルモデルは、理解と生成を共同でサポートするが、トークン、レイヤ、生成タイムステップ間でかなりの冗長な計算を行う。
本稿では,タスク共有型コアスコアラと進行条件付き生成拡張を提案し,生成分解とクロスタスクコアアライメントを最適化した。
2つの代表的UMMアーキテクチャの実験では、両タスク間で一貫した品質改善が示され、98.03%の高密度な理解性能を維持し、エンドツーエンドの推論速度は1.93times$である。
論文 参考訳(メタデータ) (2026-08-29T14:27:55Z) - AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization [84.25316984309725]
動的スパース構造とパラメータ効率のよいアダプタ(例えばLoRA)の統合は、大規模言語モデル(LLM)を拡張するための強力な技術である。
計算負荷は最小限に抑えられるが、計算のレイテンシが急上昇し、復号速度が2.5倍以上遅くなる。
AdaFuseはアルゴリズムと基盤となるハードウェアシステムとの緊密な協調設計に基づいて構築されたフレームワークで、効率的な動的アダプタ実行を実現する。
論文 参考訳(メタデータ) (2026-03-12T12:46:42Z) - Bridging Superconducting and Neutral-Atom Platforms for Efficient Fault-Tolerant Quantum Architectures [14.971894680142343]
本稿では,超伝導 (SC) と中性原子 (NA) プラットフォームの利点を生かしたヘテロジニアス量子アーキテクチャ (HQA) への戦略的アプローチを提案する。
我々の設計では、NAのみのベースラインよりも平均で752タイムでスピードアップし、SCのみのシステムに比べて物理量子ビットのフットプリントを10タイム以上削減しています。
論文 参考訳(メタデータ) (2026-01-15T07:39:05Z) - Towards a Functionally Complete and Parameterizable TFHE Processor [3.907410857035328]
TFHEは高速トーラスベースの完全同型暗号方式である。
これは、他のどのFHEスキームよりも高速なブートストラップ動作性能を提供する。
ホモモルフィック回路の評価には計算オーバーヘッドがかなり高い。
本稿では,同相回路評価のためのFPGAベースのハードウェアアクセラレータを提案する。
論文 参考訳(メタデータ) (2025-10-27T16:16:40Z) - Edge Collaborative Gaussian Splatting with Integrated Rendering and Communication [69.23838350582764]
エッジ協調(ECO-GS)では,各ユーザが小さなGSモデルに切り替えて忠実さを保証し,遠隔大GSモデルで忠実さを保証できる。
低コストのレンダリングステータスとエッジパワー割り当てを協調的に最適化する統合通信(IRAC)を提案する。
論文 参考訳(メタデータ) (2025-10-26T15:33:29Z) - HHEML: Hybrid Homomorphic Encryption for Privacy-Preserving Machine Learning on Edge [4.623074730653607]
プライバシ保護機械学習(PPML)は、信頼できない環境で機密データに対するセキュアな機械学習推論を処理するための、新たなトピックである。
完全同型暗号化(FHE)は、サーバ側の暗号化データ上で直接計算を可能にするが、クライアント側の重要な通信と計算オーバーヘッドを導入する。
HHEは、クライアント側の計算コストを削減するために、対称暗号(SE)とFHEを組み合わせることで、この制限に対処する。
本研究は、FHE互換に最適化された軽量対称暗号を中心に構築されたハードウェアアクセラレーションHHEアーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-10-23T05:51:55Z) - A Scalable Architecture for Efficient Multi-bit Fully Homomorphic Encryption [1.4174227043241145]
本稿では,マルチビットTFHE計算の効率化を目的としたハードウェアアクセラレータTaurusを紹介する。
Taurusは、新しいFFTユニットを活用し、キー再利用戦略を通じてメモリ帯域幅を最適化することで、最大10ビットの暗号文をサポートする。
実験の結果,TaurusはCPU上で最大2600倍の高速化,GPU上で1200倍の高速化を実現した。
論文 参考訳(メタデータ) (2025-09-16T05:00:57Z) - Joint Transmit and Pinching Beamforming for Pinching Antenna Systems (PASS): Optimization-Based or Learning-Based? [89.05848771674773]
MISO (Multiple-input Single-output) フレームワークを提案する。
それは複数の導波路で構成されており、多数の低コストアンテナ(PA)を備えている。
PAの位置は、大規模パスと空間の両方にまたがるように再構成することができる。
論文 参考訳(メタデータ) (2025-02-12T18:54:10Z) - EPS-MoE: Expert Pipeline Scheduler for Cost-Efficient MoE Inference [49.94169109038806]
本稿では,既存の並列処理方式を超越したMoE用パイプラインスケジューラであるEPS-MoEを紹介する。
その結果,既存の並列推論手法と比較して,プリフィルスループットは52.4%向上した。
論文 参考訳(メタデータ) (2024-10-16T05:17:49Z) - SOCI^+: An Enhanced Toolkit for Secure OutsourcedComputation on Integers [50.608828039206365]
本稿では,SOCIの性能を大幅に向上させるSOCI+を提案する。
SOCI+は、暗号プリミティブとして、高速な暗号化と復号化を備えた(2, 2)ホールドのPaillier暗号システムを採用している。
実験の結果,SOCI+は計算効率が最大5.4倍,通信オーバヘッドが40%少ないことがわかった。
論文 参考訳(メタデータ) (2023-09-27T05:19:32Z) - PolyMPCNet: Towards ReLU-free Neural Architecture Search in Two-party
Computation Based Private Inference [23.795457990555878]
プライバシー保護型ディープラーニング(DL)計算を可能にするために,セキュアなマルチパーティ計算(MPC)が議論されている。
MPCは計算オーバーヘッドが非常に高く、大規模システムではその人気を阻害する可能性がある。
本研究では,MPC比較プロトコルとハードウェアアクセラレーションの協調オーバーヘッド削減のための,PolyMPCNetという体系的なフレームワークを開発する。
論文 参考訳(メタデータ) (2022-09-20T02:47:37Z) - An Adaptive Device-Edge Co-Inference Framework Based on Soft
Actor-Critic [72.35307086274912]
高次元パラメータモデルと大規模数学的計算は、特にIoT(Internet of Things)デバイスにおける実行効率を制限する。
本稿では,ソフトポリシーの繰り返しによるエフェキシット点,エフェキシット点,エンフェキシット点を生成する離散的(SAC-d)のための新しい深層強化学習(DRL)-ソフトアクタ批判法を提案する。
レイテンシと精度を意識した報酬設計に基づいて、そのような計算は動的無線チャンネルや任意の処理のような複雑な環境によく適応でき、5G URLをサポートすることができる。
論文 参考訳(メタデータ) (2022-01-09T09:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。