論文の概要: ATLAS: Automated Approximation of Transformers for Efficient Homomorphic Inference in One Hour
- arxiv url: http://arxiv.org/abs/2607.23478v1
- Date: Sun, 26 Jul 2026 06:08:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.126045
- Title: ATLAS: Automated Approximation of Transformers for Efficient Homomorphic Inference in One Hour
- Title(参考訳): ATLAS: 1時間での効率的な同型推論のための変圧器の自動近似
- Abstract要約: ホモモルフィック暗号化(FHE)は、プライベート推論に対して強力な暗号化保証を提供する。
FHEの下でトランスフォーマーモデルをデプロイすることは、依然として高価である。
我々は、層ごとの近似設定を自動で設定するATLASを提案する。
- 参考スコア(独自算出の注目度): 23.72956569553183
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Fully homomorphic encryption (FHE) provides strong cryptographic guarantees for private inference, but deploying transformer models under FHE remains prohibitively expensive. A key bottleneck is that non-linear operations such as softmax, normalization, and activation must be replaced with polynomial approximations compatible with the CKKS scheme, and the multiplicative depth consumed by these approximations dominates inference cost. Recent frameworks have advanced approximation techniques, yet all rely on manually configured approximation hyperparameters (e.g., number of iterations, polynomial degree), applied uniformly across all layers. While convenient, this uniform-configuration approach is overly rigid: different layers can tolerate different levels of approximation error without degrading predictive accuracy, and uniform configurations cannot exploit this variability to reduce latency. Allowing each layer to adopt its own configuration, however, causes the search space to explode with model depth, reaching roughly $10^{84}$ configurations for BERT/ViT (12 layers) and $10^{225}$ for LLaMA3 (32 layers), rendering manual exploration practically impossible. We present ATLAS, an automated framework that configures per-layer approximation settings by formulating the problem as a multi-objective optimization over latency and predictive accuracy. The resulting problem is inherently difficult: 1) competing objectives over a large decision space (120 or 320 variables for BERT/ViT or LLaMA3); 2) expensive evaluation, as each configuration takes 70-1,000 seconds even in cleartext; and 3) sparse optimization signals, as 35-50% of candidate configurations yield numerically invalid solutions. ATLAS addresses these challenges through a two-stage optimization strategy that progressively relaxes layer-wise constraints, combined with surrogate models to accelerate evaluation.
- Abstract(参考訳): 完全同型暗号化(FHE)は、プライベート推論に対して強力な暗号化保証を提供するが、FHEの下でトランスフォーマーモデルをデプロイすることは違法に高価である。
鍵となるボトルネックは、ソフトマックス、正規化、アクティベーションなどの非線形演算をCKKSスキームと互換性のある多項式近似に置き換えなければならないことである。
最近のフレームワークには高度な近似技術があるが、すべて手動で設定された近似ハイパーパラメータ(例えば、反復数、多項式次数)に依存しており、すべての層で一様に適用されている。
異なるレイヤが予測精度を低下させることなく、異なるレベルの近似エラーを許容し、均一な構成では、この変動を利用してレイテンシを低減できない。
しかし、各層が独自の構成を採用することで、サーチスペースはモデル深度で爆発し、BERT/ViT(12層)とLLaMA3(32層)で約10^{225}$設定に達した。
本稿では,階層ごとの近似設定を,レイテンシと予測精度に対する多目的最適化として定式化することで自動化するATLASを提案する。
結果として生じる問題は本質的に難しい。
1) 大きな決定空間上の競合対象(BERT/ViT又はLLaMA3の120又は320変数)
2) 各構成がクリアテキストであっても70~1000秒かかるため、高価な評価。
3)スパース最適化信号は35-50%の候補構成で数値的に無効な解が得られる。
ATLASは2段階の最適化戦略によってこれらの課題に対処し、レイヤーの制約を徐々に緩和し、サロゲートモデルと組み合わせて評価を加速する。
関連論文リスト
- LLM-Driven Evolutionary Generation of Multi-Objective Bayesian Optimization Algorithms [2.012877764904354]
我々は、進化戦略において、大きな言語モデルを突然変異とクロスオーバー演算子として使用し、完全なアルゴリズムの実装を生成する。
9回の進化的実行で約900のアルゴリズムを生成し、12の合成問題と3つの実世界の工学的問題をベンチマークした。
論文 参考訳(メタデータ) (2026-07-06T08:44:13Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - Wall-Clock Complexity for Zeroth-Order Optimization with Tunable Oracle Fidelity [68.54852541944625]
ブラックボックス最適化は勾配が利用できない場合に適用され、客観的評価は高価なシミュレーションに依存する。
本稿では, オラクル型, ノイズモデル, 最適化方式の選択が, アルゴリズムパラメータに対する壁面最適選択をいかに引き起こすかを示す。
論文 参考訳(メタデータ) (2026-05-29T14:24:54Z) - Adaptive Smooth Tchebycheff Attention for Multi-Objective Policy Optimization [55.338784037660474]
ドメインにおける多曲率強化学習は、矛盾する目的間の複雑な非脆弱な干渉トレードオフのバランスを必要とする。
本稿では,生態系をモニタリングするプロキシであるロボットビジュアルを用いた,新しいリアルタイムなリアルタイム最適化を提案する。
論文 参考訳(メタデータ) (2026-05-12T21:32:57Z) - Universally Empowering Zeroth-Order Optimization via Adaptive Layer-wise Sampling [43.822941944402544]
ゼロ階最適化は、微調整された大規模言語モデルのための有望なメモリ効率のパラダイムを提供する。
しかし,壁面収差の緩やかな収束と高い推定分散により,その実用化は厳しく制約されている。
本稿では,適応層型ZO最適化フレームワークであるAdaLeZOを提案する。
論文 参考訳(メタデータ) (2026-04-20T13:37:31Z) - Deterministic Differentiable Structured Pruning for Large Language Models [37.33389749907146]
構造化プルーニングは、重要度の低いアーキテクチャ部品を取り除き、LLM推論コストを削減する。
マスクのみの最適化手法であるDDP(Deterministic Differentiable Pruning)を提案する。
従来のアプローチと比較して、DDPはより表現力が高く、テストミスマッチが減少し、より早く収束する。
論文 参考訳(メタデータ) (2026-03-09T07:59:17Z) - The Structural Scalpel: Automated Contiguous Layer Pruning for Large Language Models [33.90597962418094]
大規模言語モデルのための新しい連続層プルーニングフレームワークであるCLPを提案する。
CLPは、プルーニングに最適な連続層セグメントを自動的に識別する、微分可能な凹面ゲートアルゴリズムを使用している。
CLPは量子化とシームレスに結合して、わずかな性能損失だけでモデルをさらに圧縮することができる。
論文 参考訳(メタデータ) (2025-10-25T16:40:17Z) - Near-Optimal Online Learning for Multi-Agent Submodular Coordination: Tight Approximation and Communication Efficiency [52.60557300927007]
離散部分モジュラー問題を連続的に最適化するために,$textbfMA-OSMA$アルゴリズムを提案する。
また、一様分布を混合することによりKLの発散を効果的に活用する、プロジェクションフリーな$textbfMA-OSEA$アルゴリズムも導入する。
我々のアルゴリズムは最先端OSGアルゴリズムによって提供される$(frac11+c)$-approximationを大幅に改善する。
論文 参考訳(メタデータ) (2025-02-07T15:57:56Z) - Progressive Mixed-Precision Decoding for Efficient LLM Inference [49.05448842542558]
我々は,デコーディングのメモリバウンドネスに対処するために,プログレッシブ・ミックス・プレシジョン・デコーディング(PMPD)を導入する。
PMPDはfp16モデルの行列ベクトル乗算において1.4$-$12.2$times$ Speedupを達成する。
我々の手法は、fp16モデルよりも3.8$-$8.0$times$、均一量子化アプローチよりも1.54$times$のスループット向上をもたらす。
論文 参考訳(メタデータ) (2024-10-17T11:46:33Z) - Decoding-Time Language Model Alignment with Multiple Objectives [116.42095026960598]
既存の手法は主に、1つの報酬関数に対してLMを最適化することに集中し、それらの適応性は様々な目的に制限される。
本稿では,予測の線形結合から次のトークンを出力する復号時間アルゴリズムである$textbfmulti-objective decoding (MOD)$を提案する。
提案手法は, 自然条件下であっても, 既存のアプローチが準最適であることを示すとともに, 提案手法の最適性を保証する。
論文 参考訳(メタデータ) (2024-06-27T02:46:30Z) - Optimized Layerwise Approximation for Efficient Private Inference on Fully Homomorphic Encryption [17.429712940497843]
本研究では、プライバシー保護型ディープニューラルネットワークのための最適化レイヤワイド近似(OLA)フレームワークを提案する。
効率的な近似のために、各アクティベーション関数の実際の入力分布を考慮し、階層的精度を反映する。
その結果、OLA法はResNet-20モデルとResNet-32モデルの推論時間をそれぞれ3.02倍と2.82倍に削減した。
論文 参考訳(メタデータ) (2023-10-16T12:34:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。