論文の概要: Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks
- arxiv url: http://arxiv.org/abs/2607.07907v1
- Date: Wed, 08 Jul 2026 20:42:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.340209
- Title: Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks
- Title(参考訳): 視覚、言語、ビデオ、オーディオを横断するマルチモーダル・アンラーニング:方法、データセット、ベンチマークの調査
- Abstract要約: マルチモーダル・ファンデーション・モデルは、機密性、著作権、偏見、安全でないクロスモーダル・アソシエーションを不注意にエンコードすることができる。
削除要求やポリシー更新後のリトレーニングは非現実的であり、知識が共有表現に分散されているため、目標とする忘れ込みは依然として困難である。
このサーベイは、視覚、言語、オーディオ、ビデオにわたるマルチモーダル・アンラーニングの統一されたシステム指向のビューを提供する。
- 参考スコア(独自算出の注目度): 5.24082989583665
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: With the growing adoption of VLMs, DMs, LLMs, and AFMs, these multimodal foundation models can inadvertently encode sensitive, copyrighted, biased, or unsafe cross-modal associations that originate from their training data. Retraining after deletion requests or policy updates is often impractical, and targeted forgetting remains difficult because knowledge is distributed across shared representations. Multimodal unlearning addresses this challenge by enabling selective removal across modalities while retaining overall utility. This survey offers a unified, system-oriented view of multimodal unlearning across vision, language, audio, and video, grounded in recent advances, emerging applications, and open problems. Our taxonomy enables systematic comparison across model architectures and modalities, clarifying trade-offs among deletion strength, retention, efficiency, reversibility, and robustness. This survey highlights open problems and practical considerations to support future research and deployment of multimodal unlearning. We release a curated repository: https://smsnobin77.github.io/Awesome-Multimodal-Unlearning/
- Abstract(参考訳): VLM, DM, LLM, AFMの採用の増加に伴い、これらのマルチモーダル基盤モデルは、トレーニングデータから生じるセンシティブ、著作権、バイアス、安全でない相互モーダル関連を不注意にエンコードすることができる。
削除要求やポリシー更新後のリトレーニングは非現実的であり、知識が共有表現に分散されているため、目標とする忘れ込みは依然として困難である。
マルチモーダル・アンラーニングは、全体的なユーティリティを維持しながら、モダリティをまたいだ選択的削除を可能にすることで、この問題に対処する。
このサーベイは、視覚、言語、オーディオ、ビデオにまたがるマルチモーダル・アンラーニングの統一されたシステム指向のビューを提供する。
我々の分類学は、モデルアーキテクチャとモダリティの体系的な比較を可能にし、削除強度、維持力、効率性、可逆性、堅牢性の間のトレードオフを明確にする。
本調査は,マルチモーダル・アンラーニングの今後の研究と展開を支援するためのオープンな課題と実践的考察に焦点を当てる。
私たちはキュレートされたリポジトリをリリースした。 https://smsnobin77.github.io/Awesome-Multimodal-Unlearning/
関連論文リスト
- On the Robustness of Machine Unlearning for Vision-Language Models [34.64078380392795]
視覚言語モデル(VLM)は、学習データから望ましくない情報を記憶し、機械学習への関心が高まっている。
VLMアンラーニングの最初の体系的調査とロバスト性分析を行う。
論文 参考訳(メタデータ) (2026-05-26T13:14:12Z) - LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations [53.20772659095155]
本稿では、トレーニング時不完全観察において、より困難なIMLの設定に取り組む。
本稿では,この課題を条件付きシーケンス推論タスクとして再構成したLIMSSR(LLM-Driven Incomplete Multimodal Sequence-to-Score Reasoning)を提案する。
論文 参考訳(メタデータ) (2026-05-01T06:11:42Z) - From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation [59.27094165576015]
疎度な意思決定から高密度な推論トレースへ移行する新しい学習パラダイム(UniMod)を提案する。
モノリシックな意思決定タスクを多次元境界学習プロセスに再構成し,エビデンス,モダリティ評価,リスクマッピング,政策決定,応答生成を含む構造化軌道を構築する。
タスク固有のパラメータを分離し、トレーニングダイナミクスを再バランスさせ、マルチタスク学習における多様な目的間の干渉を効果的に解消する、特別な最適化戦略を導入する。
論文 参考訳(メタデータ) (2026-01-28T09:29:40Z) - Unlearning in LLMs: Methods, Evaluation, and Open Challenges [7.530890774798437]
機械学習は、完全なリトレーニングなしでトレーニングされたモデルから知識やデータを選択的に取り除くための、有望なパラダイムとして登場した。
本稿は,大規模言語モデルにおける信頼性の高い非学習技術開発のためのロードマップとして機能することを目的としている。
論文 参考訳(メタデータ) (2026-01-19T17:58:26Z) - Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting [70.83781268763215]
視覚言語モデル(VLM)は、大規模事前学習を活用することで、多様なマルチモーダルタスクにおいて優れたパフォーマンスを実現している。
VLMは、クロスモーダル機能ドリフト、共有アーキテクチャによるパラメータ干渉、ゼロショット機能侵食など、ユニークな課題に直面している。
本調査は、生涯の視覚言語システムを開発する研究者にとって、包括的かつ診断的な基準となることを目的としている。
論文 参考訳(メタデータ) (2025-08-06T09:03:10Z) - Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation [88.78166077081912]
我々は、MLLMから特定のマルチモーダル知識を削除する方法を評価するために、マルチモーダル・アンラーニング・ベンチマークUnLOK-VQAとアタック・アンド・ディフェンス・フレームワークを導入する。
その結果,マルチモーダル攻撃はテキストや画像のみの攻撃よりも優れており,最も効果的な防御は内部モデル状態から解答情報を除去することを示した。
論文 参考訳(メタデータ) (2025-05-01T01:54:00Z) - Ask in Any Modality: A Comprehensive Survey on Multimodal Retrieval-Augmented Generation [2.549112678136113]
Retrieval-Augmented Generation (RAG)は、外部の動的情報を統合することで問題を軽減し、現実のグラウンドを改善する。
クロスモーダルアライメントと推論は、単調なRAG以上の難題をもたらす。
この調査は、より有能で信頼性の高いAIシステムを開発するための基盤となる。
論文 参考訳(メタデータ) (2025-02-12T22:33:41Z) - RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training [55.54020926284334]
近年,MLLM (Multimodal Large Language Models) が注目されている。
検索拡張技術はLLMとMLLMの両方に有効なプラグインであることが証明されている。
本研究では,MLLMの新しい検索支援フレームワークであるRA-BLIP(Retrieval-Augmented Bootstrapping Language-Image Pre-training)を提案する。
論文 参考訳(メタデータ) (2024-10-18T03:45:19Z) - Retrieving Multimodal Information for Augmented Generation: A Survey [35.33076940985081]
マルチモーダルな知識を検索することで生成モデルを補助・拡張する手法について検討する。
このような手法は、事実性、推論、解釈可能性、堅牢性といった重要な問題に対する有望な解決策を提供する。
論文 参考訳(メタデータ) (2023-03-20T05:07:41Z) - Multimodality Representation Learning: A Survey on Evolution,
Pretraining and Its Applications [47.501121601856795]
マルチモダリティ表現学習は、異なるモダリティとそれらの相関から情報を埋め込む学習手法である。
異なるモダリティからのクロスモーダル相互作用と補完情報は、高度なモデルが任意のマルチモーダルタスクを実行するために不可欠である。
本調査では,深層学習型マルチモーダルアーキテクチャの進化と拡張に関する文献を報告する。
論文 参考訳(メタデータ) (2023-02-01T11:48:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。