論文の概要: POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking
- arxiv url: http://arxiv.org/abs/2607.06649v1
- Date: Tue, 07 Jul 2026 16:28:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.16843
- Title: POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking
- Title(参考訳): POPS: プロンプト最適化パラメータシェーキングを用いたMLLMにおける未知のマルチモーダル知識の復元
- Abstract要約: MMU (Multi-modality Machine Unlearning) は、MLLMが個人情報を忘れることを効果的に強制する緩和策として提案された。
本稿では,MLLMから未学習のマルチモーダルな知識を回収することを目的とした新しい戦略であるPrompt-d adversarial-POPSを提案する。
提案手法は, 被害者のMLLMに対して, プロンプトサフィックス最適化による潜在的プライベートサンプルの生成を誘導し, 合成した出力を利用してモデルを微調整し, 真のプライベート情報を開示する。
- 参考スコア(独自算出の注目度): 56.151482557515955
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) have demonstrated impressive performance on cross-modal tasks by jointly training on large-scale textual and visual data, where privacy-sensitive examples could be unintentionally encoded, raising concerns about privacy or copyright violation. To this end, Multi-modality Machine Unlearning (MMU) was proposed as a mitigation that can effectively force MLLMs to forget private information. However, the robustness of such unlearning methods is not fully exploited when the model is published and accessible to malicious users. In this paper, we propose a novel adversarial strategy, namely Prompt-Optimized Parameter Shaking (POPS), aiming to recover the supposedly unlearned multi-modality knowledge from the MLLMs. Our method elicits the victim MLLMs to generate potential private examples via prompt-suffix optimization, and then exploits these synthesized outputs to fine-tune the models so they disclose the true private information. The experiments on the different MMU benchmarks reveal substantial weaknesses in the existing MMU algorithms. Our POPS can even achieve a near-complete recovery of supposedly erased sensitive information on the unlearned MLLMs, exposing fundamental vulnerabilities that challenge the foundational robustness of representative MMU-based privacy protections.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、大規模なテキストと視覚データを共同でトレーニングすることで、クロスモーダルなタスクにおける印象的なパフォーマンスを実証している。
この目的のために、MLLMを効果的に個人情報を忘れるように強制する緩和策として、MMU(Multi-modality Machine Unlearning)が提案された。
しかし、そのような未学習手法の堅牢性は、モデルが公開され、悪意のあるユーザーにアクセス可能である場合に完全には利用されない。
本稿では,MLLMから未学習のマルチモーダルな知識を回復することを目的とした,新しい逆方向戦略,すなわち Prompt-Optimized Parameter Shaking (POPS) を提案する。
提案手法は, 被害者のMLLMに対して, プロンプト・サフィックス最適化による潜在的プライベートサンプルの生成を誘導し, 合成した出力を利用してモデルを微調整し, 真のプライベート情報を開示する。
異なるMMUベンチマークの実験により、既存のMMUアルゴリズムの重大な弱点が明らかになった。
当社のPOPSは、未発表のMLLMの機密情報のほぼ完全な回復を達成でき、MMUベースのプライバシー保護の基本的な堅牢性に挑戦する根本的な脆弱性を明らかにします。
関連論文リスト
- PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models [31.957271923746713]
我々は,現実的な人中心の削除要求の下で,コーパスのないマルチモーダル・アンラーニングを評価するためのベンチマークであるPRMUを紹介する。
PRMUは自然に獲得した人的知識に着目し、モデルが関連する知識を保持しながら対象の知識を除去できるかどうかを評価する。
さらに、知識変位、保護されたパラメータ空間編集、局所性を考慮したマルチモーダル制御を備えた軽量なコーパスなし未学習ベースラインであるSGPE(Simisity-Gated Projection Editing)を紹介する。
論文 参考訳(メタデータ) (2026-08-11T17:09:28Z) - Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges [55.425628316813174]
MLLM(Multi-modal Large Language Models)は、テキストと画像の両方を処理する。
テキストのみのモデルと比較して、MLLMは画像に埋め込まれた機密情報を抽出し、公開することができる。
一部のMLLMはプライバシー侵害の影響を受けやすく、画像やメモリに埋め込まれた機密データを漏洩させる。
論文 参考訳(メタデータ) (2026-06-08T07:19:42Z) - PerProb: Indirectly Evaluating Memorization in Large Language Models [13.905375956316632]
LLM脆弱性を間接的に評価するためのラベルフリーフレームワークであるPerProbを提案する。
PerProbは、被害者モデルと敵対モデルによって生成されたデータ間の難易度と平均ログ確率の変化を評価する。
PerProbの有効性を5つのデータセットで評価し、さまざまなメモリ挙動とプライバシリスクを明らかにした。
論文 参考訳(メタデータ) (2025-12-16T17:10:01Z) - When Privacy Meets Recovery: The Overlooked Half of Surrogate-Driven Privacy Preservation for MLLM Editing [61.80513991207956]
この研究は、さまざまなMLLMシナリオでサロゲート駆動の保護されたデータを復元する方法の課題に焦点を当てている。
私たちはまず、SPPE(Surrogate Privacy Protected Editable)データセットの提供によって、この研究ギャップを埋めます。
MLLM生成編集の忠実さを保ちながら、プライベートコンテンツを確実に再構築する統一的な手法を提案する。
論文 参考訳(メタデータ) (2025-12-08T04:59:03Z) - SOFT: Selective Data Obfuscation for Protecting LLM Fine-tuning against Membership Inference Attacks [17.77094760401298]
メンバーシップ推論攻撃(MIA)に対する微調整大言語モデルの脆弱性について検討する。
プライバシー保護とプライバシー保護のバランスをとるために,影響のあるデータ選択を調整可能なパラメータで活用することで,プライバシーの漏洩を緩和する新しい防衛手法であるSOFTを提案する。
論文 参考訳(メタデータ) (2025-06-12T07:23:56Z) - Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation [88.78166077081912]
我々は、MLLMから特定のマルチモーダル知識を削除する方法を評価するために、マルチモーダル・アンラーニング・ベンチマークUnLOK-VQAとアタック・アンド・ディフェンス・フレームワークを導入する。
その結果,マルチモーダル攻撃はテキストや画像のみの攻撃よりも優れており,最も効果的な防御は内部モデル状態から解答情報を除去することを示した。
論文 参考訳(メタデータ) (2025-05-01T01:54:00Z) - PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models [27.338242898495448]
マルチモーダル大規模言語モデル (MLLM) は視覚言語タスクにおいて顕著な成功を収めた。
膨大なインターネットソースデータへの依存は、プライバシーとセキュリティの重大な懸念を引き起こす。
マシン・アンラーニング(MU)はこれらの問題に対処するための重要な手法として登場した。
PEBenchはMLLMにおけるMUの徹底的な評価を容易にするために設計された新しいベンチマークである。
論文 参考訳(メタデータ) (2025-03-16T15:26:20Z) - SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning [48.42431979599426]
MLLM(Multimodal Large Language Models)のための安全アンラーニングベンチマークであるSAFEERASERを提案する。
我々は2つの観点から非学習手法を総合的に評価する。
実験により、PD損失と既存の未学習手法を組み合わせることで、過剰な鍛造を効果的に防止できることが示された。
論文 参考訳(メタデータ) (2025-02-18T04:09:46Z) - Drawing the Line: Enhancing Trustworthiness of MLLMs Through the Power of Refusal [21.342265570934995]
既存の手法はMLLMの信頼性を高める手段としての拒絶応答の重要性をほとんど見落としてきた。
InBoL(Information Boundary-Aware Learning Framework)は,MLLMが不十分な情報に遭遇する際のユーザクエリの応答を拒否する,新たなアプローチである。
このフレームワークでは、包括的なデータ生成パイプラインと、適切な拒絶応答を提供するモデルの能力を改善するためのトレーニング戦略が導入された。
論文 参考訳(メタデータ) (2024-12-15T14:17:14Z) - LLM-PBE: Assessing Data Privacy in Large Language Models [111.58198436835036]
大規模言語モデル(LLM)は多くのドメインに不可欠なものとなり、データ管理、マイニング、分析におけるアプリケーションを大幅に進歩させた。
この問題の批判的な性質にもかかわらず、LLMにおけるデータプライバシのリスクを総合的に評価する文献は存在しない。
本稿では,LLMにおけるデータプライバシリスクの体系的評価を目的としたツールキットであるLLM-PBEを紹介する。
論文 参考訳(メタデータ) (2024-08-23T01:37:29Z) - UNDIAL: Self-Distillation with Adjusted Logits for Robust Unlearning in Large Language Models [12.45822383965784]
本稿では,UnDIAL(Unlearning via Self-Distillation on Adjusted Logits)を紹介する。
本手法では, 自己蒸留を利用してロジットを調整し, ターゲットトークンの影響を選択的に低減する。
論文 参考訳(メタデータ) (2024-02-15T16:21:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。