論文の概要: Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models
- arxiv url: http://arxiv.org/abs/2608.01849v1
- Date: Mon, 03 Aug 2026 07:57:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.390747
- Title: Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models
- Title(参考訳): 未学習多モーダル大言語モデルにおける知識ホールの探索とブリッジング
- Abstract要約: そこで本研究では,ベニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグニグナグニグニグニグニグニグニグニグナグニグナグニグナグニグニグナグニグナグナグニグ
また、アンコール型正規化による選択的保護を提案し、アンカー型アクティベーションフィルタリングにより一般的なパターンを保護する。
SafeEraserの実験では,標準ベースラインの50%以下に比べ,SPARがバニラ応答品質の98%以上を回復することが示された。
- 参考スコア(独自算出の注目度): 23.51933427959403
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Machine unlearning offers a promising approach to remove unsafe content from Multimodal Large Language Models (MLLMs), yet ensuring the precision of unlearning remains a persistent challenge. One reason is that current MLLM unlearning evaluation paradigms suffer from a critical blind spot: they assess model utility through benchmarks whose representations are distant from the forget set, failing to capture knowledge holes---severe degradation on benign adjacent inputs. To probe knowledge holes in unlearned MLLMs, we construct a benchmark that captures unintended degradation on benign inputs sharing generic patterns with the forget set, and confirm through controlled experiments that they are a systematic consequence of commonly used approaches. Furthermore, to bridge this gap, we propose Selective Protection with Anchored Regularization, which protects generic patterns via anchored activation filtering while reinforcing them through entity-abstracted enhancement. Our experiments on SafeEraser demonstrate that SPAR recovers over 98% of vanilla response quality compared to below 50% for standard baselines---while achieving 0.00% attack success rate and competitive model utility. These results underscore the necessity of more fine-grained evaluation for trustworthy MLLM unlearning.
- Abstract(参考訳): 機械学習は、MLLM(Multimodal Large Language Models)から安全でないコンテンツを取り除くための有望なアプローチを提供する。
一つの理由は、現在のMLLMアンラーニング評価パラダイムが重要な盲点に悩まされているためである。彼らは、表現が忘れられたセットから遠く離れているベンチマークを通じてモデルユーティリティを評価し、知識ホールの取得に失敗する。
学習されていないMLLMの知識穴を探索するため, 一般用手法の系統的な結果であることを示す制御実験を通じて, 一般的なパターンを共有する良性入力の意図しない劣化を抽出するベンチマークを構築した。
さらに, このギャップを埋めるために, アンコレギュラー化による選択的保護を提案する。
SafeEraserの実験では、標準的なベースラインでは50%以下であり、攻撃成功率0.00%、競争モデルユーティリティでは、SPARがバニラ応答品質の98%以上を回復することを示した。
これらの結果は、信頼性の高いMLLMアンラーニングのためのよりきめ細かい評価の必要性を浮き彫りにした。
関連論文リスト
- Measuring the Depth of LLM Unlearning via Activation Patching [3.590648050085134]
大規模言語モデル(LLM)のアンラーニングは、プライバシ保護とAI安全性にとって重要なポストホックメカニズムとして登場した。
既存の出力レベルのメトリクスは、この知識が内部表現から回復可能であることを検出できない。
本研究では,アクティベーションパッチによるアンラーニングの力学深さを定量化する指標として,Unlearning Depth Score (UDS)を提案する。
論文 参考訳(メタデータ) (2026-05-23T14:52:28Z) - Unlearning That Lasts: Utility-Preserving, Robust, and Almost Irreversible Forgetting in LLMs [31.768387661474904]
大規模言語モデル(LLM)におけるアンラーニングでは、事前訓練されたモデルから特定の情報を正確に除去する。
これは、事前訓練中に取得した個人データや有害な知識を削除することで、LLMの安全性を確保するために重要である。
JensUnを導入し、Jensen-Shannon Divergenceをセットを忘れたり、保持したりするためのトレーニングの目的として活用する。
大規模な実験では、JensUnは競合するメソッドよりも忘れやすいトレードオフを実現し、再学習に強いレジリエンスを示しています。
論文 参考訳(メタデータ) (2025-09-02T20:38:53Z) - One Token to Fool LLM-as-a-Judge [52.45386385722788]
大規模言語モデル(LLM)は、自動化された審査員としてますます信頼され、評価を支援し、他のモデルを訓練するための報酬信号を提供する。
生成的報酬モデルは、ハッキングに対して体系的に影響を受けやすい。
論文 参考訳(メタデータ) (2025-07-11T17:55:22Z) - SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning [48.42431979599426]
MLLM(Multimodal Large Language Models)のための安全アンラーニングベンチマークであるSAFEERASERを提案する。
我々は2つの観点から非学習手法を総合的に評価する。
実験により、PD損失と既存の未学習手法を組み合わせることで、過剰な鍛造を効果的に防止できることが示された。
論文 参考訳(メタデータ) (2025-02-18T04:09:46Z) - Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models [104.55763564037831]
我々は、注意マップ、現在の生成ステップにおける確率、および以前に生成されたトークンから繰り返し計算された不確実性スコアを利用する回帰モデルを訓練する。
評価の結果,提案手法は選択的生成に極めて有効であり,教師なしアプローチと教師なしアプローチに比較して大幅な改善が得られた。
論文 参考訳(メタデータ) (2024-08-20T09:42:26Z) - Towards Effective Evaluations and Comparisons for LLM Unlearning Methods [97.2995389188179]
本稿では,大規模言語モデルにおける機械学習評価の精度向上を図る。
評価指標の堅牢性と、競合する目標間のトレードオフという、2つの重要な課題に対処します。
論文 参考訳(メタデータ) (2024-06-13T14:41:00Z) - Large Language Model Unlearning via Embedding-Corrupted Prompts [10.889859281637406]
大規模言語モデルのための軽量なアンラーニングフレームワークである textbfEmbedding-COrrupted (ECO) Prompts を提案する。
推論中に未学習の状態を識別し、忘れるプロンプトを保護するためにプロンプト分類器を用いて強制する。
その結果, 学習対象を満足させるだけでなく, 忘れることを意図したデータに基づいて訓練されたことのないモデルから得られる出力を, より正確に近似できることがわかった。
論文 参考訳(メタデータ) (2024-06-12T06:56:20Z) - ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks [91.55895047448249]
本稿では,LLMベースのフレームワークであるReEvalについて述べる。
本稿では、ChatGPTを用いてReEvalを実装し、2つの人気のあるオープンドメインQAデータセットのバリエーションを評価する。
我々の生成したデータは人間可読であり、大きな言語モデルで幻覚を引き起こすのに役立ちます。
論文 参考訳(メタデータ) (2023-10-19T06:37:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。