論文の概要: The Poisoned Conversation: Privacy-Leaking Watermarks in Unified Multimodal Models
- arxiv url: http://arxiv.org/abs/2610.05453v1
- Date: Sun, 04 Oct 2026 18:53:31 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:24:31.713477
- Title: The Poisoned Conversation: Privacy-Leaking Watermarks in Unified Multimodal Models
- Title(参考訳): 汚染された会話: 統一マルチモーダルモデルにおけるプライバシー漏洩の透かし
- Abstract要約: プライバシ漏洩透かし(PLW)について紹介する。
PLWは、悪意のあるモデルプロバイダが以前のチャット履歴を条件にできるトリガー依存の透かしである。
有害なモデルでは、画像生成をプライバシー漏洩のチャネルに隠蔽しながら実用性を維持することができる。
- 参考スコア(独自算出の注目度): 14.029301988906566
- License:
- Abstract: Multimodal models are increasingly shifting toward unified architectures that understand and generate text, images, and other modalities within a shared conversational context. This design enables fluid interaction across modalities, but it also changes the privacy threat model: Information revealed in one part of a conversation may remain accessible when the model later generates content in another modality. This risk is particularly concerning in settings where users rely on locally deployed models for privacy, assuming that sensitive interactions remain confined to their device. We introduce Privacy-Leaking Watermarks (PLWs): invisible, trigger-dependent watermarks that a malicious model provider can condition on prior chat history. With this adversarial intervention, the usual separation breaks: a sensitive keyword or semantic cue mentioned earlier in the conversation can cause a later, unrelated image to carry a hidden yet detectable watermark. PLWs pose a novel threat to users of unified multimodal models: A poisoned model can retain utility while covertly turning image generation into a channel for privacy leakage, even when deployed locally. Across 13 sensitive-attribute triggers and two model families, PLWs reach up to 100.0% TPR at 1% FPR. For example, across all tested conversational separations, OmniGen2 detects every prior disclosure of depression while falsely flagging only 1% of images generated without such a disclosure.
- Abstract(参考訳): マルチモーダルモデルは、共有会話コンテキスト内でテキスト、画像、その他のモダリティを理解し、生成する統一アーキテクチャへとシフトしつつある。
この設計は、モダリティ間の流動的な相互作用を可能にするが、プライバシ脅威モデルも変更する: ある会話の一部で明らかになった情報は、後にモデルが別のモダリティでコンテンツを生成するときにアクセス可能である。
このリスクは、ユーザーがプライバシーのためにローカルにデプロイされたモデルに依存している設定において特に関係している。
プライバシ漏洩透かし(PLWs: Privacy-Leaking Watermarks): 悪意のあるモデルプロバイダが事前のチャット履歴を条件にできる、目に見えないトリガー依存の透かし。
会話で先に述べたセンシティブなキーワードやセマンティックなキューは、後続の無関係な画像に隠れて検出可能な透かしをもたらす可能性がある。
PLWは、統一マルチモーダルモデルのユーザに対して、新たな脅威となる。 有毒モデルでは、ローカルにデプロイされた場合でも、画像生成を秘密裏にプライバシリークのチャネルに変換しながら、実用性を維持できる。
13の感度属性トリガーと2つのモデルファミリーのうち、PLWは1%のFPRで最大100.0%のTPRに達する。
例えば、すべてのテストされた会話分離において、OmniGen2は、プレッシャーの事前開示をすべて検出し、そのような開示なしに生成された画像の1%を誤ってフラグ付けする。
関連論文リスト
- Undetectable Conversations Between AI Agents via Pseudorandom Noise-Resilient Key Exchange [7.877552575246053]
AIエージェントは、正直な対話と計算的に区別できない書き起こしを生成しながら、並列な秘密の会話を実行できることを示す。
我々は、擬似ランダムノイズ耐性鍵交換と呼ばれる新しい暗号プリミティブを導入する。
結果は、転写監査だけでAIエージェント間の秘密調整を除外できないことを示している。
論文 参考訳(メタデータ) (2026-04-06T15:25:38Z) - The Violation State: Safety State Persistence in a Multimodal Language Model Interface [0.0]
マルチモーダルAIシステムは、テキスト生成、画像生成、その他の機能を単一の会話インターフェースに統合する。
シングルターン拒否は期待されているが、安全フィルタと会話レベル状態の相互作用はよく理解されていない。
本稿では,ChatGPT (GPT-5.1) Webインターフェースにおける再現可能な動作効果について述べる。
論文 参考訳(メタデータ) (2025-12-18T15:50:32Z) - Adapter Shield: A Unified Framework with Built-in Authentication for Preventing Unauthorized Zero-Shot Image-to-Image Generation [74.5813283875938]
ゼロショット画像・画像生成は知的財産権侵害に重大なリスクをもたらす。
この研究は、個人イメージを誤用から守ることを目的とした、最初の普遍的および認証統合ソリューションであるAdapter Shieldを提示する。
提案手法は, ゼロショット画像合成の不正化において, 最先端の防御を克服する。
論文 参考訳(メタデータ) (2025-11-25T04:49:16Z) - SleeperMark: Towards Robust Watermark against Fine-Tuning Text-to-image Diffusion Models [77.80595722480074]
SleeperMarkは、回復力のある透かしをT2I拡散モデルに埋め込むように設計されたフレームワークである。
学習したセマンティックな概念から透かし情報を切り離すようモデルに誘導する。
各種拡散モデルにおけるSleeperMarkの有効性について実験を行った。
論文 参考訳(メタデータ) (2024-12-06T08:44:18Z) - Watermarking Language Models for Many Adaptive Users [47.90822587139056]
証明可能な保証付き言語モデルの透かし方式について検討する。
モデル生成テキストを個々のユーザに対してトレース可能なマルチユーザ透かしを導入する。
検出不能なChrist, Gunn, Zamir (2024) のゼロビットスキームが適応的に堅牢であることを証明する。
論文 参考訳(メタデータ) (2024-05-17T22:15:30Z) - Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution [22.933101948176606]
バックドアベースのモデル透かしは、リリースされたモデルにそのような特性を埋め込む、プライマリおよび最先端の方法である。
特徴属性の説明に検証動作を埋め込む新しい透かしパラダイムである$i.e.$, Explanation as a Watermark (EaaW) を設計する。
論文 参考訳(メタデータ) (2024-05-08T05:49:46Z) - Towards Robust Model Watermark via Reducing Parametric Vulnerability [57.66709830576457]
バックドアベースのオーナシップ検証が最近人気となり,モデルオーナがモデルをウォーターマークすることが可能になった。
本研究では,これらの透かし除去モデルを発見し,それらの透かし挙動を復元するミニマックス定式化を提案する。
本手法は,パラメトリックな変化と多数のウォーターマーク除去攻撃に対するモデル透かしの堅牢性を向上させる。
論文 参考訳(メタデータ) (2023-09-09T12:46:08Z) - InfoScrub: Towards Attribute Privacy by Targeted Obfuscation [77.49428268918703]
視覚データに流出した個人情報を個人が制限できる技術について検討する。
我々はこの問題を新しい画像難読化フレームワークで解決する。
提案手法では,元の入力画像に忠実な難読化画像を生成するとともに,非難読化画像に対して6.2$times$(または0.85bits)の不確実性を増大させる。
論文 参考訳(メタデータ) (2020-05-20T19:48:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。