論文の概要: Attribute-based Undetectable Watermarking for Generative AI Models
- arxiv url: http://arxiv.org/abs/2608.03174v1
- Date: Tue, 04 Aug 2026 06:05:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.057487
- Title: Attribute-based Undetectable Watermarking for Generative AI Models
- Title(参考訳): 属性に基づく生成AIモデルのための検出不能な透かし
- Authors: Miryam Mi-Ying Huang, Chung-Wei Lee, Max Raffel, Er-Cheng Tang,
- Abstract要約: 我々は、生成AIモデルのための最初のインパトリビュートベースの透かしを紹介する。
整合性、有界な汚職に対する適応的堅牢性、検出不能性、健全性などのセキュリティ特性を定式化する。
我々は,制約付き擬似乱数関数,擬似乱数誤り訂正符号,生成AIモデルによる回復手順を統合した。
- 参考スコア(独自算出の注目度): 5.283970991624705
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative AI systems increasingly produce content whose provenance is difficult to verify, motivating watermarking techniques for identifying model-generated outputs. Existing cryptographic watermarking methods provide strong undetectability guarantees: without a detection key, watermarked outputs are computationally indistinguishable from unwatermarked ones. However, these approaches do not address the crucial deployment challenge of how to safely delegate detection capabilities. With an unrestricted detection key, a malicious detector may use the detection key beyond its intended scope, enabling watermark sanitization, scope abuse, and user profiling. To mitigate this safety concern, we introduce, to the best of our knowledge, the first \emph{attribute-based watermarking} for generative AI models, providing fine-grained, policy-controlled watermark detection. In our approach, each generated output is associated with attributes, and each detection key is \emph{constrained by a policy} on potential attributes. A detection key can only be used to detect watermarked outputs whose attributes satisfy the corresponding policy, while watermarked outputs that fall outside the policy remain computationally indistinguishable from unwatermarked ones. We construct such an attribute-based watermarking scheme and formalize its security properties, including consistency, adaptive robustness to bounded corruptions, undetectability, and soundness, along with a security proof under standard cryptographic assumptions. Our construction integrates constrained pseudorandom functions, pseudorandom error-correcting codes, and randomness recovery procedures with generative AI models. Finally, we implement a prototype and an empirical evaluation, demonstrating that attribute-based watermarking is both effective and practical.
- Abstract(参考訳): 生成AIシステムは、モデル生成出力を特定するための透かしテクニックを動機付け、検証が難しいコンテンツをますます生成する。
既存の暗号透かし方式は、検出キーがなければ、透かしの出力は非透かしの出力と計算的に区別できないという、強力な検出不可能な保証を提供する。
しかしながら、これらのアプローチは、検出機能を安全に委譲する方法における重要なデプロイメント課題に対処していない。
制限のない検出キーにより、悪意のある検出キーは、意図されたスコープを超えて検出キーを使用することができ、透かしの衛生化、スコープ乱用、ユーザプロファイリングを可能にする。
この安全性の懸念を軽減するため、我々は、私たちの知る限り、生成AIモデルのための最初のemph{attribute-based watermarking}を導入し、きめ細かなポリシー制御された透かし検出を提供する。
提案手法では,各出力は属性に関連付けられ,各検出キーは潜在的属性に対するポリシによって制限される。
検出キーは、属性が対応するポリシーを満たす透かし出力を検出するのにのみ使用でき、一方、ポリシー外にある透かし出力は、未透かし出力と計算的に区別できないままである。
このような属性に基づく透かし方式を構築し、そのセキュリティ特性を定式化し、一貫性、有界な汚職に対する適応的堅牢性、検出不能性、健全性、および標準的な暗号的仮定に基づくセキュリティ証明を定式化する。
提案手法は,制約付き擬似乱数関数,擬似乱数誤り訂正符号,生成AIモデルによるランダム性回復手順を統合した。
最後に,提案手法の試作と実証評価を行い,属性に基づく透かしが有効かつ実用的であることを示す。
関連論文リスト
- VOW: Verifiable and Oblivious Watermark Detection for Large Language Models [4.920744236528847]
プライバシー保護と暗号的に検証可能な透かし検出の両方を実現する新しいプロトコルを提案する。
VOWは短いテキストに対して実用的であり、現代のパラフレーズ攻撃に対する透かしの堅牢性の重要な再評価を提供する。
論文 参考訳(メタデータ) (2026-04-30T10:02:18Z) - On the Robustness of Watermarking for Autoregressive Image Generation [21.402408065930796]
自己回帰(AR)画像生成装置は、モデル崩壊を防ぐために、出力の信頼性の高い検出と属性を要求する。
ARモデル用に特別に設計された透かし技術は、世代毎に微妙な信号を埋め込んで、下流の検証を可能にする。
これらのスキームを検証し,ウォーターマーク除去と偽造攻撃の両方に対する脆弱性を実証する。
論文 参考訳(メタデータ) (2026-04-13T16:56:48Z) - Robustness of Watermarking on Text-to-Image Diffusion Models [9.277492743469235]
本稿では,透かし埋め込みとテキスト・ツー・イメージ・ジェネレーション処理を統合することで生成する透かしの堅牢性について検討する。
生成型透かし法は, 識別器による攻撃やエッジ予測に基づく攻撃のエッジ情報に基づく操作など, 直接回避攻撃に対して堅牢であるが, 悪意のある微調整には脆弱であることがわかった。
論文 参考訳(メタデータ) (2024-08-04T13:59:09Z) - Certifiably Robust Image Watermark [57.546016845801134]
ジェネレーティブAIは、偽情報やプロパガンダキャンペーンの促進など、多くの社会的懸念を提起する。
ウォーターマークAI生成コンテンツは、これらの懸念に対処するための重要な技術である。
本報告では, 除去・偽造攻撃に対するロバスト性保証を保証した最初の画像透かしを提案する。
論文 参考訳(メタデータ) (2024-07-04T17:56:04Z) - Watermark-based Attribution of AI-Generated Content [34.913290430783185]
我々は,AI生成コンテンツの透かしに基づくユーザレベルの属性に関する最初の体系的研究を行う。
私たちのキーとなるアイデアは、GenAIサービスの各ユーザにユニークな透かしを割り当て、この透かしを、そのユーザが作成したAI生成コンテンツに埋め込むことです。
次に、アトリビューションは、与えられたコンテンツから抽出したユーザとベストマッチしたユーザを特定して実行される。
論文 参考訳(メタデータ) (2024-04-05T17:58:52Z) - Safe and Robust Watermark Injection with a Single OoD Image [90.71804273115585]
高性能なディープニューラルネットワークをトレーニングするには、大量のデータと計算リソースが必要である。
安全で堅牢なバックドア型透かし注入法を提案する。
我々は,透かし注入時のモデルパラメータのランダムな摂動を誘導し,一般的な透かし除去攻撃に対する防御を行う。
論文 参考訳(メタデータ) (2023-09-04T19:58:35Z) - An Unforgeable Publicly Verifiable Watermark for Large Language Models [84.2805275589553]
現在の透かし検出アルゴリズムは、透かし生成プロセスで使用される秘密鍵を必要としており、公開検出中にセキュリティ違反や偽造の影響を受ける。
両段階で同じキーを使用するのではなく、2つの異なるニューラルネットワークを用いて透かしの生成と検出を行う。
論文 参考訳(メタデータ) (2023-07-30T13:43:27Z) - A Watermark for Large Language Models [84.95327142027183]
本稿では,プロプライエタリな言語モデルのための透かしフレームワークを提案する。
透かしはテキストの品質に無視できない影響で埋め込むことができる。
言語モデルAPIやパラメータにアクセスすることなく、効率的なオープンソースアルゴリズムを使って検出することができる。
論文 参考訳(メタデータ) (2023-01-24T18:52:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。