論文の概要: FESC: Remodeling Long-Context Private Inference with Encrypted State-Space Models
- arxiv url: http://arxiv.org/abs/2608.17442v2
- Date: Wed, 19 Aug 2026 01:30:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 13:35:39.255956
- Title: FESC: Remodeling Long-Context Private Inference with Encrypted State-Space Models
- Title(参考訳): FESC: 暗号化されたステートスペースモデルでロングコンテキストのプライベート推論をモデル化する
- Abstract要約: 本稿では,Factized Encrypted Scan-Contract (FESC)について述べる。
FESCは、単一のGPU上でネイティブなエンドツーエンド実行を$L geq 1,024$で完了する最初のプライベートな長期ドキュメント推論システムである。
- 参考スコア(独自算出の注目度): 21.63908755417832
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Processing long, sensitive documents with machine-learning models requires efficient, privacy-preserving long-context inference. Prior private inference systems optimize or distribute encrypted Transformer attention, but its quadratic token-pair work remains the bottleneck as sequence length grows. Selective state-space models (SSMs) offer linear-time recurrence, yet direct encrypted implementation incurs linear multiplicative depth, sequence-wide state residency, or dense FHE-MPC conversion. We present Factorized Encrypted Scan-Contract (FESC), a hybrid FHE-MPC system for private long-context selective SSM inference. Its factorized scan-contract keeps input-dependent transitions compact across conversion boundaries, composes them without dense expansion, streams state chunks on demand, and contracts outputs before conversion. We demonstrate interface compatibility of the scan-contract implementation across invariant and selective SSM architectures. For our Mamba-2 instantiation, we design GPU-optimized CKKS kernels for linear computations, MPC protocols for SiLU, softplus, exponential, and RMSNorm, with approximation-aware fine-tuning. To our knowledge, FESC is the first private long-document inference system to complete native end-to-end execution at $L \geq 1{,}024$ on a single GPU. At $L = 2{,}048$, a 12-layer Mamba-base model completes inference in 77.3 minutes on one A100 GPU with a peak memory footprint of 32.7 GB, while maintaining near-plaintext accuracy on the evaluated long-document tasks.
- Abstract(参考訳): 機械学習モデルで長く機密性の高いドキュメントを処理するには、効率的でプライバシー保護の長いコンテキスト推論が必要である。
以前のプライベート推論システムは、暗号化されたトランスフォーマーの注意を最適化または分散していたが、シークエンスの長さが増加するにつれて、その二次トークンペアの作業はボトルネックのままである。
SSM(Selective State-space Model)は、線形時間繰り返しを提供するが、直接暗号化された実装は線形乗算深度、シーケンスワイド状態定常性、あるいは密度の高いFHE-MPC変換をもたらす。
本稿では,Factized Encrypted Scan-Contract (FESC)について述べる。
その分解されたスキャン契約は、入力依存の遷移を変換境界を越えてコンパクトに保ち、密な拡張なしで構成し、要求に応じて状態チャンクをストリームし、変換前の出力を出力する。
不変および選択的SSMアーキテクチャ間のスキャン・コントラクション実装のインタフェース互換性を実証する。
Mamba-2インスタンス化のために、線形計算のためのGPU最適化CKKSカーネル、SiLUのためのMPCプロトコル、ソフトプラス、指数関数、RMSNormを近似型微調整で設計する。
我々の知る限り、FESCは単一のGPU上でのネイティブなエンドツーエンド実行を$L \geq 1{,}024$で完了する最初のプライベートな長期ドキュメント推論システムである。
L = 2{,}048$で、1つのA100 GPU上で77.3分で推論を完了し、ピークメモリのフットプリントは32.7GBである。
関連論文リスト
- Planning-aligned Token Compression for Long-Context Autonomous Driving [95.59023657139208]
条件付きVQ-VA上に構築した計画整合型ワーキングメモリフレームワークを提案する。
圧縮は歴史的軌跡と学習した計画意図の両方で条件付けられている。
歴史的文脈が行動の正確性に最も重要となる高信号動的シナリオについて評価する。
論文 参考訳(メタデータ) (2026-06-05T17:16:21Z) - AEGIS: Scaling Long-Sequence Homomorphic Encrypted Transformer Inference via Hybrid Parallelism on Multi-GPU Systems [22.26887231291305]
AEGISは、長期暗号化トランスフォーマー推論のためのアプリケーション暗号化ガイド推論システムである。
フィードフォワードネットワークにおいて、GPU間通信を57.9%削減する。
最大96.62%のスケーリング効率、3.86倍のエンドツーエンドスピードアップ、69.1%のデバイス毎のメモリ削減を実現している。
論文 参考訳(メタデータ) (2026-04-03T19:47:26Z) - Stacked from One: Multi-Scale Self-Injection for Context Window Extension [69.24689919827817]
Modelnameは、多粒度コンテキスト圧縮とクエリ対応情報取得に基づく新しいフレームワークである。
modelnameachievesパフォーマンスは、強いベースラインと同等か、優れている。
論文 参考訳(メタデータ) (2026-03-05T03:16:16Z) - S$^3$-Attention:Attention-Aligned Endogenous Retrieval for Memory-Bounded Long-Context Inference [11.779449360037518]
S3-Attentionは,長期コンテキスト処理を注目に順応した内因性検索として扱うメモリファースト推論時フレームワークである。
S3-Attentionは、軽量なスパースオートエンコーダを使用して、トランジェントキーとクエリプロジェクションをトップkスパース機能識別子にデコードする。
単一のストリーミングスキャン中にトークンの位置やスパンにCPUベースの逆インデックスマッピング機能を構築する。
論文 参考訳(メタデータ) (2026-01-25T05:25:22Z) - DP-FEDSOFIM: Differentially Private Federated Stochastic Optimization using Regularized Fisher Information Matrix [0.0611737116137921]
DP-FLは、プライバシーを守るために導入された圧倒的なノイズのために、厳格なプライバシー予算の下で緩やかな収束に苦しむ。
本稿では,サーバサイドの2次最適化フレームワークであるDP-FedSOFIMを提案する。
分析の結果,サーバサイドのプレコンディショニングは後処理定理によって(エプシロン,デルタ)差分プライバシーを保っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-01-14T05:11:28Z) - Structured Sparse Transition Matrices to Enable State Tracking in State-Space Models [68.31088463716269]
状態空間モデル(SSM)における遷移行列の構造的スパースパラメトリゼーションを提案する。
我々の方法PD-SSMは、遷移行列をカラム1ホット行列(P$)と複素数値対角行列(D$)の積としてパラメータ化する。
このモデルは、様々なFSA状態追跡タスクにおいて、現代のSSMの多種多様なバリエーションを著しく上回っている。
論文 参考訳(メタデータ) (2025-09-26T12:46:30Z) - LLM Serving Optimization with Variable Prefill and Decode Lengths [6.937936394246354]
本研究では,各要求が不均一なプレフィルとデコード長を持つLLM要求(Large Language Model)を提供する問題について検討する。
この問題は、配置制約の相互運用、優先関係、メモリ使用量の線形増加などによりNPハードであることが示される。
本稿では,時間とともに効率よくバッチを生成する新しい選択基準に基づく新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-08-08T08:54:21Z) - Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache [67.47789629197857]
本稿では,トランスヘッド次元の不均一な役割を生かした学習自由フレームワークを提案する。
フーリエアテンションは、長コンテキスト非感性次元をフーリエ基底に投影することにより、その時間的進化を固定長のスペクトル係数で近似する。
本稿では,FourierAttention が LongBench と Needle-In-A-Haystack 上で最高の長文精度を実現することを示す。
論文 参考訳(メタデータ) (2025-06-13T15:35:54Z) - On the Expressiveness and Length Generalization of Selective State-Space Models on Regular Languages [56.22289522687125]
SSM(Selective State-space Model)はTransformerの代替品である。
正規言語タスクにおける表現性や長さの一般化性能を解析する。
本稿では,Selective Dense State-Space Model (SD-SSM)を紹介する。
論文 参考訳(メタデータ) (2024-12-26T20:53:04Z) - Extreme Compression of Large Language Models via Additive Quantization [59.3122859349777]
我々のアルゴリズムは、AQLMと呼ばれ、情報検索のための古典的な加算量子化(AQ)アプローチを一般化する。
トークン生成のためのAQLMの高速GPUおよびCPU実装を提供しており、最適化されたFP16実装を高速にマッチングまたは性能良くすることができる。
論文 参考訳(メタデータ) (2024-01-11T18:54:44Z) - DCT-Former: Efficient Self-Attention with Discrete Cosine Transform [4.622165486890318]
トラスフォルマーアーキテクチャの本質的な制限は、ドット積の注意の計算から生じる。
我々のアイデアは、アテンションモジュールの近似を導き出すために、損失の多いデータ圧縮(JPEGアルゴリズムなど)の世界からインスピレーションを得ている。
実験の広範なセクションでは,提案手法が同一性能のメモリを消費しにくくする一方で,推定時間を大幅に削減することを示した。
論文 参考訳(メタデータ) (2022-03-02T15:25:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。