論文の概要: Latency-Optimal Adaptive Split Inference for Privacy-Preserving Cloud-Edge-End Collaboration
- arxiv url: http://arxiv.org/abs/2608.01148v1
- Date: Sun, 02 Aug 2026 10:59:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.103714
- Title: Latency-Optimal Adaptive Split Inference for Privacy-Preserving Cloud-Edge-End Collaboration
- Title(参考訳): プライバシ保護クラウドエッジエンドコラボレーションのためのレイテンシ最適適応スプリット推論
- Authors: Yi Li, Peng Zhang, Man Ho Au,
- Abstract要約: IoT(Internet of Things)エンドポイントデバイスは、プライバシに敏感なバッチ推論をサポートすることがますます期待されている。
本稿では,プライバシ保護型クラウド-エッジ-エンドコラボレーションのためのレイテンシ最適化型分割推論フレームワークを提案する。
- 参考スコア(独自算出の注目度): 12.36184530292183
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Internet of Things (IoT) end devices are increasingly expected to support privacy-sensitive batch inference, yet their limited computational resources often make full local execution of convolutional neural networks impractical. This paper presents a latency-optimal adaptive split inference framework for privacy-preserving cloud-edge-end collaboration. The end device acts as the trust anchor, executes the plaintext model prefix, encrypts the split activation using fully homomorphic encryption (FHE), and keeps the secret key locally, while the edge and cloud execute assigned model segments only on FHE ciphertexts. We formulate collaborative encrypted inference as a split-pair selection problem over an end-side split point and an edge-side termination point. The proposed planner jointly models plaintext prefix execution, encryption, communication, edge-side FHE execution, and cloud-side FHE completion, and supports both convolution-level and block-level split granularities. Experiments on CIFAR-10 and PathMNIST show that the proposed convolution-level collaborative scheme achieves amortized end-to-end speedups of approximately 12.9 times over full-cloud FHE and 3.9 times over the block-level alternative, while preserving the corresponding plaintext-model accuracy. Including modeled communication, the amortized latencies are 1033.279 s/sample on CIFAR-10 and 1023.429 s/sample on PathMNIST.
- Abstract(参考訳): IoT(Internet of Things)エンドポイントデバイスは、プライバシに敏感なバッチ推論をサポートすることがますます期待されているが、その限られた計算リソースは、畳み込みニューラルネットワークの完全なローカル実行を非現実的にすることが多い。
本稿では,プライバシ保護型クラウド-エッジ-エンドコラボレーションのためのレイテンシ最適化型分割推論フレームワークを提案する。
エンドデバイスは、信頼アンカーとして機能し、平文モデルプレフィックスを実行し、完全同型暗号化(FHE)を使用して分割活性化を暗号化し、秘密鍵をローカルに保持し、エッジとクラウドはFHE暗号文のみに割り当てられたモデルセグメントを実行する。
我々は,協調的な暗号化推論を,エンド側分割点とエッジ側終端点上の分割ペア選択問題として定式化する。
提案したプランナーは、プレーンテキストプレフィックスの実行、暗号化、通信、エッジサイドのFHE実行、クラウドサイドのFHE補完を共同でモデル化し、畳み込みレベルとブロックレベルの両方の粒度をサポートする。
CIFAR-10とPathMNISTの実験により、提案された畳み込みレベルの協調スキームは、対応する平文モデルの精度を維持しながら、フルクラウドFHEの約12.9倍、ブロックレベルの代替品の約3.9倍の劣化したエンドツーエンドのスピードアップを達成することが示された。
CIFAR-10では1033.279 s/s、PathMNISTでは1023.429 s/s/sである。
関連論文リスト
- Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models [7.51065715735168]
本稿では,認証KVキャッシュ上に構築された,プライバシ中心のエッジクラウド協調LLM推論フレームワークを提案する。
評価の結果、このフレームワークはトーケン毎のレイテンシを最大46.1%削減し、ダウンリンクペイロードを最大67.4%削減している。
論文 参考訳(メタデータ) (2026-07-14T01:17:17Z) - WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference [56.297697169678095]
WISV(Wireless-Informed Semantic Verification)は、分散投機的復号化フレームワークである。
WISVは最大60.8%の許容長の増加、37.3%の対話ラウンドの削減、31.4%のエンドツーエンドレイテンシの改善を実現している。
NVIDIA Jetson AGX OrinとA40搭載サーバからなるハードウェアテストベッド上でWISVを検証する。
論文 参考訳(メタデータ) (2026-04-20T01:29:56Z) - HALO: Semantic-Aware Distributed LLM Inference in Lossy Edge Network [50.33808558714122]
エッジでの大規模言語モデル(LLM)推論は、ユーザのプライバシを保護すると同時に、サービスの応答性を促進する。
損失エッジネットワークにおける分散LLM推論を向上する新しいフレームワークであるHALOを提案する。
Raspberry Piクラスタによる実験の結果、HALOは信頼性の低いネットワーク条件下でLLaMAシリーズLLMの3.41倍のエンドツーエンドのスピードアップを達成した。
論文 参考訳(メタデータ) (2026-01-16T07:37:23Z) - Towards Federated Clustering: A Client-wise Private Graph Aggregation Framework [57.04850867402913]
フェデレーションクラスタリングは、分散化されたラベルのないデータからパターンを抽出する課題に対処する。
本研究では,プライバシ保護のための知識共有媒体として,局所構造グラフを革新的に活用する新しいアルゴリズムSPP-FGCを提案する。
我々のフレームワークは最先端のパフォーマンスを実現し、認証可能なプライバシー保証を維持しつつ、フェデレーションベースラインよりも最大10%(NMI)のクラスタリング精度を向上させる。
論文 参考訳(メタデータ) (2025-11-14T03:05:22Z) - Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing [8.705453442427585]
大規模言語モデル(LLM)は様々な推論タスクでほぼ人間に近い性能を達成した。
リソース制約のあるIoT(Internet-of-Things)デバイスへのデプロイメントは、大量のパラメータフットプリントとメモリ集約型の自己回帰デコーディングのため、依然として現実的ではない。
この研究は、エッジデバイスにLLMを配置するために明示的に設計された最初の自動回帰対応分割コンピューティングフレームワークを紹介した。
論文 参考訳(メタデータ) (2025-11-06T02:55:07Z) - Design and Prototyping Distributed CNN Inference Acceleration in Edge
Computing [85.74517957717363]
HALPはエッジコンピューティングにおけるエッジデバイス(ED)間のシームレスなコラボレーションを設計することで推論を加速する。
実験により、分散推論HALPはVGG-16に対して1.7倍の推論加速を達成することが示された。
分散推論HALPを用いたモデル選択は,サービスの信頼性を著しく向上させることができる。
論文 参考訳(メタデータ) (2022-11-24T19:48:30Z) - Receptive Field-based Segmentation for Distributed CNN Inference
Acceleration in Collaborative Edge Computing [93.67044879636093]
協調エッジコンピューティングネットワークにおける分散畳み込みニューラルネットワーク(CNN)を用いた推論高速化について検討する。
我々は,CNNモデルを複数の畳み込み層に分割するために,融合層並列化を用いた新しい協調エッジコンピューティングを提案する。
論文 参考訳(メタデータ) (2022-07-22T18:38:11Z) - An Adaptive Device-Edge Co-Inference Framework Based on Soft
Actor-Critic [72.35307086274912]
高次元パラメータモデルと大規模数学的計算は、特にIoT(Internet of Things)デバイスにおける実行効率を制限する。
本稿では,ソフトポリシーの繰り返しによるエフェキシット点,エフェキシット点,エンフェキシット点を生成する離散的(SAC-d)のための新しい深層強化学習(DRL)-ソフトアクタ批判法を提案する。
レイテンシと精度を意識した報酬設計に基づいて、そのような計算は動的無線チャンネルや任意の処理のような複雑な環境によく適応でき、5G URLをサポートすることができる。
論文 参考訳(メタデータ) (2022-01-09T09:31:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。