論文の概要: Watermarking for Proprietary Dataset Protection
- arxiv url: http://arxiv.org/abs/2607.00325v1
- Date: Wed, 01 Jul 2026 01:55:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.680225
- Title: Watermarking for Proprietary Dataset Protection
- Title(参考訳): プロプライエタリデータセット保護のための透かし
- Abstract要約: 出力透かし技術は、生成モデルのトレーニングメンバーシップテストをより魅力的にするための適切なガジェットである、と我々は主張する。
我々は、従来の損失に基づく会員推定手法に対して、透かしに基づくデータセット推論アプローチを真っ向から検討する。
- 参考スコア(独自算出の注目度): 67.79905448913145
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A growing body of literature suggests that training data membership inference problems are fundamentally hard tasks in modern language modeling settings. We argue that output watermarking techniques are the right gadget to make training membership tests for generative models more tractable, based on prior results showing that language models exhibit residual watermark "radioactivity" under partially watermarked training datasets. We pit a watermark-based dataset inference approach head-to-head against traditional loss-based membership inference methods and show that watermarking can achieve comparable membership detection performance when subset exposure is high enough, under an alternate set of assumptions.
- Abstract(参考訳): 文献の増大は、現代の言語モデリング設定において、データメンバーシップ推論のトレーニングが根本的に難しいことを示唆している。
出力透かし技術は、部分的に透かしを施したトレーニングデータセットの下で、言語モデルが残留した透かし「放射能」を示すことを示す以前の結果に基づいて、生成モデルのトレーニング会員試験をより魅力的にするための適切な手段である、と我々は主張する。
我々は,従来の損失に基づく会員推定手法に対して,透かしに基づくデータセット推論アプローチを真っ向から検討し,サブセット露出が十分高い場合に,透かしが同等の会員検出性能が得られることを示す。
関連論文リスト
- Hidden in Plain Tokens: Simply Robust, Gradient-Free Watermark for Synthetic Audio [58.612001688217056]
自己回帰モデルに対する推論時透かしは、離散化の不整合による連続的なモダリティには適さない。
合成音声の強力で堅牢な透かしのためのエレガントな解法を提案する。
論文 参考訳(メタデータ) (2026-05-25T15:43:20Z) - Robust Data Watermarking in Language Models by Injecting Fictitious Knowledge [31.766208360156906]
言語モデルのデータ透かしは、トークンシーケンスやスタイルパターンなどのトレース可能な信号を著作権のあるテキストに注入する。
従来のデータ透かし技術は主に事前学習時の効果的な記憶に焦点を当てていた。
本研究では,定型的だが定型的な知識を学習データに注入する新しいデータ透かし手法を提案する。
論文 参考訳(メタデータ) (2025-03-06T02:40:51Z) - Task-Agnostic Language Model Watermarking via High Entropy Passthrough Layers [11.089926858383476]
本稿では,既存の事前学習ネットワークに付加されたパススルー層を用いたモデル透かしを提案する。
本手法は完全にタスク非依存であり,分類タスクとシーケンス対シーケンスタスクの両方に適用できる。
提案手法は, 下流の微調整, 微切り, 層除去攻撃に対して堅牢であることを示す。
論文 参考訳(メタデータ) (2024-12-17T05:46:50Z) - TokenMark: A Modality-Agnostic Watermark for Pre-trained Transformers [67.57928750537185]
TokenMarkは、事前訓練されたモデルに対する頑健で、モダリティに依存しない、堅牢な透かしシステムである。
予めトレーニングされたモデルを、特別に置換されたデータサンプルのセットに微調整することで、透かしを埋め込む。
これはモデル透かしの堅牢性、効率、普遍性を著しく改善する。
論文 参考訳(メタデータ) (2024-03-09T08:54:52Z) - Set-Membership Inference Attacks using Data Watermarking [21.69169876101301]
深層画像透かしを用いた生成モデルに対するセットメンバーシップ推論攻撃を提案する。
実験の結果,提案手法は画像データの非合意的利用を検出するための原則的手法であることがわかった。
論文 参考訳(メタデータ) (2023-06-22T06:47:56Z) - Did You Train on My Dataset? Towards Public Dataset Protection with
Clean-Label Backdoor Watermarking [54.40184736491652]
本稿では,公開データの保護のための一般的な枠組みとして機能するバックドアベースの透かし手法を提案する。
データセットに少数の透かしサンプルを挿入することにより、我々のアプローチは、ディフェンダーが設定した秘密関数を暗黙的に学習することを可能にする。
この隠れた機能は、データセットを違法に使用するサードパーティモデルを追跡するための透かしとして使用できる。
論文 参考訳(メタデータ) (2023-03-20T21:54:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。