論文の概要: Leaky Language Models: Stealing Architecture and Inference Optimizations via Per-Token Timing
- arxiv url: http://arxiv.org/abs/2607.20723v1
- Date: Wed, 22 Jul 2026 20:51:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.220177
- Title: Leaky Language Models: Stealing Architecture and Inference Optimizations via Per-Token Timing
- Title(参考訳): 漏洩言語モデル: アーキテクチャと推論の最適化
- Authors: Sadegh Majidi, Niloofar Mireshghallah, Kazem Taram,
- Abstract要約: LeakyLMsは、トークン生成タイミングのみを使用して、キーモデルとデプロイメントの詳細を推測できることを最初に示したものだ。
Google Gemini Flash 2.5は、約128Kトークンのドラフトコンテキストウィンドウで投機的デコーディングを使用している。
- 参考スコア(独自算出の注目度): 7.6104368339199615
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This work presents LeakyLMs, a set of attacks that leak proprietary model, architecture, and deployment information from production language models. LeakyLMs is the first to demonstrate that key model and deployment details can be inferred using only token generation timing, even when interacting through remote APIs. LeakyLMs introduces two core attacks. The first attack targets inference optimizations and deployment strategies. For example, our attack detects whether a provider uses speculative decoding, a widely deployed inference-time optimization, and further identifies the context length of the draft model used in the pipeline. Our measurements show that Google Gemini Flash 2.5 uses speculative decoding with a draft context window of approximately 128K tokens. The second attack recovers key architectural properties, including the number of transformer layers, hidden dimension size, and number of attention heads. To achieve this, LeakyLMs builds a detailed and accurate model of token-generation timing on modern NVIDIA GPUs, characterizing how latency scales with model configuration and hardware parameters. The attack then performs a search over the architecture space using this timing model. In experiments with Llama models, the near-correct architectural configuration appears in the top-10 guesses more than 90% of the time.
- Abstract(参考訳): この研究は、プロプライエタリなモデル、アーキテクチャ、本番言語モデルからのデプロイメント情報をリークする一連の攻撃であるLeakyLMを提示する。
LeakyLMsは、リモートAPIを介して対話する場合でも、トークン生成タイミングのみを使用して、キーモデルとデプロイメントの詳細を推論できることを最初に示す。
LeakyLMsは2つのコアアタックを導入している。
最初の攻撃は推論最適化とデプロイメント戦略をターゲットにしている。
例えば、我々の攻撃は、広くデプロイされた推論時間最適化である投機的デコーディングを使用しているかどうかを検出し、さらにパイプラインで使用されるドラフトモデルのコンテキスト長を特定します。
Google Gemini Flash 2.5は、約128Kトークンのドラフトコンテキストウィンドウで投機的デコーディングを使用している。
第2の攻撃は、変圧器層数、隠された寸法サイズ、注目ヘッド数など、重要なアーキテクチャ特性を回復する。
これを実現するため、LeakyLMsは最新のNVIDIA GPU上でトークン生成タイミングの詳細なモデルを構築し、モデル構成とハードウェアパラメータによるレイテンシのスケールを特徴付ける。
攻撃は、このタイミングモデルを使用してアーキテクチャ空間を探索する。
Llamaモデルを用いた実験では、最も正確なアーキテクチャ構成がトップ10に現れ、その90%以上を推測している。
関連論文リスト
- Shape and Substance: Dual-Layer Side-Channel Attacks on Local Vision-Language Models [2.1198879079315573]
デバイス上のビジョンランゲージモデル(VLM)は、ローカル実行を通じてデータのプライバシを約束する。
動的高分解能前処理へのアーキテクチャシフトは,アルゴリズム的なサイドチャネルを導入している。
ローカルなVLMに対する2層アタック・フレームワークを実演する。
論文 参考訳(メタデータ) (2026-03-26T12:53:49Z) - Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs [63.82840470917859]
本稿では,dLLMの復号化機構をモデル属性の強力なツールとして利用できることを示す。
本稿では、デコードステップ間の構造的関係を捉え、モデル固有の振る舞いをよりよく明らかにする、DDM(Directed Decoding Map)と呼ばれる新しい情報抽出手法を提案する。
論文 参考訳(メタデータ) (2025-10-02T06:25:10Z) - BACKTIME: Backdoor Attacks on Multivariate Time Series Forecasting [43.43987251457314]
本稿では,BackTime という効果的な攻撃手法を提案する。
MTSデータにいくつかのステルスなトリガを微妙に注入することで、BackTimeは攻撃者の意図に応じて予測モデルの予測を変更することができる。
BackTimeは、まずデータ中の有害なタイムスタンプを特定し、次に、ステルスで効果的なトリガーを適応的に合成する。
論文 参考訳(メタデータ) (2024-10-03T04:16:49Z) - SIGMA:Sinkhorn-Guided Masked Video Modeling [69.31715194419091]
SIGMA (Sinkhorn-guided Masked Video Modelling) は、新しいビデオ事前学習法である。
時空管の特徴を,限られた数の学習可能なクラスタに均等に分散する。
10個のデータセットによる実験結果から,より高性能で時間的,堅牢な映像表現を学習する上で,SIGMAの有効性が検証された。
論文 参考訳(メタデータ) (2024-07-22T08:04:09Z) - Tandem Transformers for Inference Efficient LLMs [49.75726447408795]
これらの問題に対処するために,新しいアーキテクチャであるタンデム変換器を導入する。
このアーキテクチャは、小さな自己回帰モデルとブロックモードで動作する大きなモデルを組み合わせたものである。
PaLM2プレトレーニングデータセットでは、PaLM2-BisonとPaLM2-Geckoのタンデムが次点予測精度を3.3%改善している。
論文 参考訳(メタデータ) (2024-02-13T18:24:08Z) - Speculative Decoding with Big Little Decoder [108.95187338417541]
Big Little Decoder (BiLD) は、幅広いテキスト生成アプリケーションの推論効率と遅延を改善するフレームワークである。
NVIDIA T4 GPUでは、当社のフレームワークは最大2.12倍の高速化を実現し、生成品質の最小化を実現している。
私たちのフレームワークは完全にプラグアンドプレイで、トレーニングプロセスやモデルアーキテクチャの変更なしに適用できます。
論文 参考訳(メタデータ) (2023-02-15T18:55:29Z) - Lite-Mono: A Lightweight CNN and Transformer Architecture for
Self-Supervised Monocular Depth Estimation [9.967643080731683]
CNNとトランスフォーマーの効率的な組み合わせについて検討し,Lite-Monoのハイブリッドアーキテクチャを設計する。
完全なモデルはMonodepth2よりも精度が高く、トレーニング可能なパラメータが約80%少ない。
論文 参考訳(メタデータ) (2022-11-23T18:43:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。