論文の概要: Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers
- arxiv url: http://arxiv.org/abs/2607.04819v1
- Date: Mon, 06 Jul 2026 08:51:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.092013
- Title: Layer-Parallel Inference Reduces Encrypted Nonlinear Depth in Transformers
- Title(参考訳): 層並列推論は変圧器の暗号化された非線形深さを減少させる
- Authors: Ligong Han, Kai Xu, Hao Wang, Ruijiang Gao, Akash Srivastava,
- Abstract要約: 本研究では, SNLP(Structured Layerism)により, この層間構造がFHEに親しみやすくなったか検討する。
SNLPは、階層的に非線形な深さをLステージから少数のソルバと線形構造補正に還元する。
すべてのテストモデルにおいて、SNLPは逐次イテレーションよりも増幅率が低い。
- 参考スコア(独自算出の注目度): 25.855270424537412
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Fully homomorphic encryption (FHE) enables computation on encrypted data, but practical encrypted Transformer inference is bottlenecked by the sequential composition of many nonlinear blocks. We study whether Structured Newton Layer Parallelism (SNLP) can make this inter-layer composition more FHE-friendly: each Transformer block still requires polynomial approximations for operations such as softmax and RMSNorm, but SNLP reduces the layerwise sequential nonlinear depth from L stages to a small number of solver iterations plus linear structured corrections. Using a simulation framework based on Chebyshev polynomial approximations, we measure error accumulation under sequential versus SNLP inference across 8 models and 4 architecture families. On a 0.5B IDN-trained model, SNLP reduces symbolic bootstraps from 53 to 20 (2.65x) with only +1.2% perplexity degradation, while lowering error amplification (1.36x vs. 1.42x). Across all tested models, SNLP has lower amplification than sequential inference. Ablations show that softmax approximation dominates the error budget and CKKS arithmetic noise is negligible in our setting, suggesting that SNLP is complementary to block-level FHE-friendly operator design rather than a replacement for it.
- Abstract(参考訳): 完全同型暗号(FHE)は、暗号化されたデータの計算を可能にするが、多くの非線形ブロックのシーケンシャルな構成により、実用的な暗号化トランスフォーマー推論がボトルネックとなる。
各トランスフォーマーブロックは依然としてソフトマックスやRMSノームのような演算に対して多項式近似を必要とするが、SNLPはLステージから少数のソルバイテレーションと線形構造補正に階層的に逐次非線形深さを減少させる。
チェビシェフ多項式近似に基づくシミュレーションフレームワークを用いて,8つのモデルと4つのアーキテクチャファミリ間のSNLP推論の逐次的比較による誤差の蓄積を測定する。
0.5B IDN トレーニングモデルでは、SNLP は 53 から 20 (2.65x) までのシンボリックブートストラップを +1.2% のパープレクティ劣化で減少させ、エラー増幅 (1.36x vs. 1.42x) を低下させる。
全ての試験モデルにおいて、SNLPはシーケンシャル推論よりも増幅率が低い。
アブレーションは,ソフトマックス近似が誤差予算を支配し,CKKS算術ノイズが無視可能であることを示し,SNLPは代用ではなくブロックレベルFHEフレンドリな演算子設計と相補的であることを示唆している。
関連論文リスト
- Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - SNLP: Layer-Parallel Inference via Structured Newton Corrections [22.126763421836966]
本研究では, 非線形残留方程式の解として, 層間の隠れ状態トレースを扱い, 層間依存性を緩和できるかどうかを考察した。
構造ニュートン層並列性(SNLP)は、ジャコビアン層をより安価なアーキテクチャによるサロゲートダイナミクスに置き換えるトレーニングと推論のフレームワークである。
論文 参考訳(メタデータ) (2026-05-18T04:28:16Z) - Normalized Architectures are Natively 4-Bit [49.13186675123547]
重みと隠れ表現を単位超球面に制限するアーキテクチャであるnGPTは、本質的に低精度算術よりも堅牢である。
本手法は,最大3B/30Bパラメータの1.2B密度モデルとハイブリッド(Mamba-Transformer)MoEモデルの両方で検証する。
論文 参考訳(メタデータ) (2026-05-07T11:54:07Z) - MLPMoE: Zero-Shot Architectural Metamorphosis of Dense LLM MLPs into Static Mixture-of-Experts [0.0]
大規模言語モデル(LLM)は、主に高密度トランスフォーマーとしてデプロイされ、すべてのトークンに対してフィードフォワードブロック内の全てのパラメータがアクティブになる。
MoEfication、CMoE、ToMoE、MoOREといった最近のアップサイクリング手法は、高密度フィードフォワードネットワーク内の疎小で半モジュラーなサブ構造に有用な計算の大部分が存在していることを明らかにしている。
本稿では,高密度の変圧器ブロックを静的な高心性混合体に再構成する学習自由変換であるMoE(MLP-Experts)を紹介する。
論文 参考訳(メタデータ) (2025-11-26T06:14:26Z) - Don't Be Greedy, Just Relax! Pruning LLMs via Frank-Wolfe [61.68406997155879]
State-of-the-art Large Language Model (LLM) プルーニング手法は階層的に動作し、階層ごとのプルーニングエラーを最小限に抑え、完全な再トレーニングを回避する。
既存の手法は、刈り上げ対象の重量相互作用を無視する欲求凸に依存する。
提案手法は, 層ごとのプルーニング誤差を大幅に低減し, 最先端のGPTアーキテクチャにおいて高いベースラインを達成し, メモリ効率を保っている。
論文 参考訳(メタデータ) (2025-10-15T16:13:44Z) - PAPER: Privacy-Preserving ResNet Models using Low-Degree Polynomial Approximations and Structural Optimizations on Leveled FHE [5.819818547073678]
最近の研究は、完全同型暗号化(FHE)を用いた深層畳み込みニューラルネットワーク(CNN)の実行により、非インタラクティブなプライバシ保護推論をより実用的なものにしている。
また、非線形アクティベーションの高次近似にも依存しており、これは平文のReLUモデルと比較して乗算深度を増大させ、精度を2-5%削減する。
本研究では、プライバシ保護推論において広く採用されているベンチマークアーキテクチャであるResNetsに注目し、FHE非インタラクティブモデルとそれに対応するモデルの精度ギャップを埋める。
論文 参考訳(メタデータ) (2025-09-26T19:10:23Z) - Efficient Large Language Model Inference with Neural Block Linearization [51.619870789584525]
本稿では,トランスフォーマーモデル推論を高速化する新しいフレームワークであるNeural Block Linearization (NBL)を紹介する。
NBLは、線形最小平均正方形誤差推定器から導かれる線形近似で自己アテンション層を置き換える。
実験では、NBLは競争精度を維持しながら、顕著な計算スピードアップを達成する。
論文 参考訳(メタデータ) (2025-05-27T12:01:43Z) - KHRONOS: a Kernel-Based Neural Architecture for Rapid, Resource-Efficient Scientific Computation [0.9355993154058798]
我々はモデルベース、モデルフリー、モデル反転タスクのためのAIフレームワークであるKHRONOSを紹介する。
KHRONOSは、次元ごとのカーネル展開の階層的な構成で連続的に微分可能な対象場を構築する。
逆問題に対して、KHRONOSは、サンプルレイテンシあたりのサブマイクロ秒で、数回のフォワード評価で、高速で反復的なレベルセットのリカバリを容易にする。
論文 参考訳(メタデータ) (2025-05-19T16:29:07Z) - Factorizers for Distributed Sparse Block Codes [45.29870215671697]
分散ブロック符号(SBC)を高速かつ高精度に分解する手法を提案する。
我々の反復分解器は、しきい値に基づく非線形活性化、条件付きランダムサンプリング、および $ell_infty$-based similarity metricを導入している。
CIFAR-100, ImageNet-1K, RAVENデータセット上での4つの深層CNNアーキテクチャの実現可能性を示す。
論文 参考訳(メタデータ) (2023-03-24T12:31:48Z) - Improved techniques for deterministic l2 robustness [63.34032156196848]
畳み込みニューラルネットワーク(CNN)を$l_2$ノルムの下で厳密な1-Lipschitz制約で訓練することは、対向的堅牢性、解釈可能な勾配、安定した訓練に有用である。
我々は,最後の線形層を1重層に置き換えることで,1-Lipschitz CNNのロバスト性を証明する手法を提案する。
我々は,CIFAR-10およびCIFAR-100における標準および証明可能な堅牢な精度の最先端化を図る。
論文 参考訳(メタデータ) (2022-11-15T19:10:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。