論文の概要: Inverting the Hidden: Unveiling Multimodal Privacy Leakage in Collaborative LVLM Inference
- arxiv url: http://arxiv.org/abs/2608.01020v1
- Date: Sun, 02 Aug 2026 05:56:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.063501
- Title: Inverting the Hidden: Unveiling Multimodal Privacy Leakage in Collaborative LVLM Inference
- Title(参考訳): 隠れた場所を逆転する - 協調LVLM推論におけるマルチモーダルなプライバシリーク
- Authors: Shuaifan Jin, Zhibo Wang, Qiyuan Wang, Yiting Han, Yajie Zhou, Yuanfan Zhang, Jiahui Hu, Xiaoyi Pang,
- Abstract要約: コラボレーション推論は、エッジデバイスとクラウド間の計算により、LVLM(Large Vision-Language Models)をデプロイする。
生の入力を控えることでプライバシーが保証されるが、中間の隠蔽状態の送信は重要な攻撃面を公開する。
重層LVLM隠蔽状態からでも、プライバシーに敏感な視覚情報やテキスト情報を復元できることを示す。
- 参考スコア(独自算出の注目度): 10.251138435714147
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Collaborative inference deploys Large Vision-Language Models (LVLMs) by partitioning computation between edge devices and the cloud. While withholding raw inputs supposedly ensures privacy, transmitting intermediate hidden states exposes a critical attack surface. However, it remains unclear whether deep-layer LVLM hidden states retain recoverable private information, given that visual content has been projected into the language embedding space. To address this concern, we theoretically analyze LVLM hidden-state recoverability and show that, under regularity assumptions and a positive semantic--nuisance margin, privacy-relevant visual semantics remain identifiable and stably recoverable. Motivated by this analysis, we propose RASR, a novel coarse-to-fine multimodal reconstruction attack. RASR obtains initial image and text reconstructions through modality-specific inverse paths that follow their respective forward processing pipelines in reverse, and then uses hidden-state consistency to refine both reconstructions. Evaluations on Qwen3-VL-8B-Instruct and LLaVA-1.5-7B across five datasets demonstrate that RASR reduces image reconstruction MSE by \(\sim\)50\% compared to the strongest baselines, while achieving up to 99\% token accuracy for text recovery. These results show that privacy-sensitive visual and textual information can be recovered even from deep-layer LVLM hidden states, exposing the privacy risks of collaborative inference.
- Abstract(参考訳): コラボレーション推論は、エッジデバイスとクラウド間の計算を分割することで、LVLM(Large Vision-Language Models)をデプロイする。
生の入力を控えることでプライバシーが保証されるが、中間の隠蔽状態の送信は重要な攻撃面を公開する。
しかし、言語埋め込み空間に視覚コンテンツが投影されていることを考えると、深層LVLM隠蔽状態が復元可能なプライベート情報を保持しているかどうかは不明である。
この問題に対処するために,LVLMの隠蔽状態回復可能性を分析し,正規性仮定と正のセマンティック・ニュアンス・マージンの下では,プライバシ関連視覚的セマンティクスが識別可能で安定して回復可能であることを示す。
この分析によって得られたRASRは,新規な粗大なマルチモーダル再構築攻撃である。
RASRは、各前方処理パイプラインを逆向きに追従するモダリティ固有の逆経路を通じて、初期画像とテキストの再構成を取得し、その後、隠れ状態の一貫性を使用して、両方の再構成を洗練する。
Qwen3-VL-8B-InstructとLLaVA-1.5-7Bを5つのデータセットで評価したところ、RASRはテキスト復元に99\%のトークン精度を達成しつつ、最強のベースラインに比べて画像再構成のMSEを(\sim\)50\%削減することがわかった。
これらの結果から,LVLM隠蔽状態からでも,プライバシーに敏感な視覚情報やテキスト情報を復元し,協調推論のプライバシーリスクを明らかにすることができた。
関連論文リスト
- TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction [51.17509341761903]
TrustCLIPは、機能条件付きジェネレータを明示的なプライバシ敵として扱う、再構築駆動のフレームワークである。
従来の分類とマルチモーダルな大規模言語モデルパイプラインにおいて,その有効性を示す。
論文 参考訳(メタデータ) (2026-07-05T20:11:00Z) - What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference [13.194874392306085]
本稿では、クライアントの入力を再構築するために、中間的なアクティベーションマッチング問題を解決するActInvを紹介する。
この脆弱性を理解するために、我々は、層固有の復元抵抗を定量化する指標である摂動増幅係数(PAF)を開発した。
私たちの分析によると、プライバシーの脆弱性はレイヤ間で均一ではなく、いくつかのレイヤはリークの影響を受けやすいが、他のレイヤは自然な抵抗を提供する。
論文 参考訳(メタデータ) (2026-05-22T02:14:16Z) - ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models [59.94664910790462]
ResPruneは、大規模な視覚言語モデルのためのトレーニング不要のビジュアルトークンプルーニングフレームワークである。
視覚トークンのコンパクトだが情報に富むサブセットを選択する。
これは、計算、メモリ消費、推論遅延を効果的に削減する。
論文 参考訳(メタデータ) (2026-03-22T07:44:45Z) - NeuroFilter: Privacy Guardrails for Conversational LLM Agents [50.75206727081996]
本研究は,エージェント型大規模言語モデル(LLM)のプライバシを強制する際の計算上の課題に対処する。
NeuroFilterは、標準違反をモデルのアクティベーション空間における単純な方向にマッピングすることで、コンテキスト整合性を運用するガードレールフレームワークである。
7Bから70Bパラメータのモデルをカバーする15万以上のインタラクションに対する包括的な評価は、NeuroFilterの強力なパフォーマンスを示している。
論文 参考訳(メタデータ) (2026-01-21T05:16:50Z) - The Double-edged Sword of LLM-based Data Reconstruction: Understanding and Mitigating Contextual Vulnerability in Word-level Differential Privacy Text Sanitization [53.51921540246166]
我々は,言語大モデル (LLM) がDP対応テキストの文脈的脆弱性を活用可能であることを示す。
LLM再建の二重刃剣効果がプライバシーと実用性に与える影響を実験的に明らかにした。
本稿では,データ再構成を後処理のステップとして使用するための推奨事項を提案する。
論文 参考訳(メタデータ) (2025-08-26T12:22:45Z) - CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models [11.201984255831126]
CapRecoverは、ラベルやキャプションなどの高レベルのセマンティックコンテンツを、画像再構成なしで中間機能から直接復元する。
本稿では,各層における中間機能にランダムノイズを付加し,次層におけるノイズを除去する,シンプルで効果的な保護手法を提案する。
論文 参考訳(メタデータ) (2025-07-30T16:42:02Z) - Safeguarding LLM Embeddings in End-Cloud Collaboration via Entropy-Driven Perturbation [16.419373701694067]
EntroGuardはエントロピー駆動の埋め込みプライバシー保護手法である。
エンドツーエンドのコラボレーションにおいて、検索精度を維持しながら、テキスト埋め込みのプライバシを保護することができる。
論文 参考訳(メタデータ) (2025-03-17T07:58:05Z) - TrojVLM: Backdoor Attack Against Vision Language Models [50.87239635292717]
本研究では、視覚言語モデル(VLM)を対象としたバックドアアタックの最初の調査であるTrojVLMを紹介する。
TrojVLMは、有毒な画像に遭遇したとき、所定のターゲットテキストを出力テキストに挿入する。
画像内容のセマンティックな整合性を確保するために,新たなセマンティック保存損失を提案する。
論文 参考訳(メタデータ) (2024-09-28T04:37:09Z) - Zero-Shot Video Moment Retrieval from Frozen Vision-Language Models [58.17315970207874]
モーメント・テキストアライメントを容易にするため、任意のVLMから一般化可能なビジュアル・テクスチャの事前適応のためのゼロショット手法を提案する。
3つのVMRベンチマークデータセットで実施された実験は、ゼロショットアルゴリズムの顕著なパフォーマンス上の利点を示している。
論文 参考訳(メタデータ) (2023-09-01T13:06:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。