論文の概要: Observation-Level Watermarking and Detection for Tabular Data
- arxiv url: http://arxiv.org/abs/2607.10554v1
- Date: Sun, 12 Jul 2026 04:03:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.465938
- Title: Observation-Level Watermarking and Detection for Tabular Data
- Title(参考訳): タブラルデータの観測レベル透かしと検出
- Abstract要約: STAMP (Single-observation Tabular Attribution and Marking procedure) は幅広い分布を適応し保存するために提案されている。
また,サンプルサイズが小さい場合でも確実に透かしを識別できる検出機構も開発した。
提案手法は,データ忠実度と高い検出率を維持しながら,部分集合化に対して有効かつ堅牢であることを示す。
- 参考スコア(独自算出の注目度): 2.5107166631583215
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: With the development of generative AI, watermarking techniques have been widely used to detect the authenticity of AI-generated data and protect the rights of users and creators. While it is already well applied in data types including imaging and text data, watermarking tabular data is still under-explored. Existing methods primarily focus on numerical data, leaving discrete, categorical, and mixed data less studied. In this work, we propose STAMP (Single-observation Tabular Attribution and Marking Procedure), a novel framework for watermarking tabular data that can accommodate and preserve a wide range of distributions. We also develop a corresponding detection mechanism, which can reliably identify watermarks even when the sample size is as small as one. We establish theoretical guarantees for asymptotic consistency and detection accuracy. Finally, through extensive simulation studies and two real-data applications, we demonstrate that the proposed method is effective and robust to subsetting, while maintaining data fidelity and a high detection rate.
- Abstract(参考訳): 生成AIの発展に伴い、透かし技術はAIが生成したデータの真正性を検出し、ユーザやクリエイターの権利を保護するために広く使われてきた。
画像やテキストデータなど、すでにデータタイプによく適用されていますが、表データの透かしはまだ未調査です。
既存の手法は主に数値データに重点を置いており、離散的、分類的、混合的なデータは研究を減らしたままである。
本研究では,多様な分布を収容・保存可能な表データの透かし機構であるSTAMP(Single-observation Tabular Attribution and Marking procedure)を提案する。
また,サンプルサイズが小さい場合でも確実に透かしを識別できる検出機構も開発した。
我々は漸近的一貫性と検出精度の理論的保証を確立する。
最後に、広範囲なシミュレーション研究と2つの実データ応用を通して、提案手法はデータの忠実さと高い検出率を維持しつつ、サブセット化に有効で堅牢であることを示す。
関連論文リスト
- RaMark: Radioactive Watermarking for Generated Tabular Data [26.198071919012033]
RaMarkは、正弦波依存性をデータ分布の内在成分として埋め込む放射性な透かし法である。
我々はRaMarkが7つの最先端手法よりもはるかに強力な放射能を達成し、再訓練とデータ修正攻撃の両方に対して一貫して優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-07-10T00:06:42Z) - DWBench: Holistic Evaluation of Watermark for Dataset Copyright Auditing [43.881484429055654]
データセット透かし技術は、監査と使用の検証を約束する。
我々はDWBenchを開発した。DWBenchは、画像データセットのウォーターマーク手法を体系的に評価するための統一ベンチマークおよびオープンソースツールキットである。
そこで本研究では,詳細な透かし識別のためのサンプルの意義と,データセットレベルの監査における検証成功率の2つの新しい指標について述べる。
論文 参考訳(メタデータ) (2026-02-14T01:09:19Z) - Leave No TRACE: Black-box Detection of Copyrighted Dataset Usage in Large Language Models via Watermarking [51.74368870268278]
我々は,大規模な言語モデルにおける著作権付きデータセット使用量を完全にブラックボックスで検出するフレームワークであるTRACEを提案する。
textttTRACEは、プライベートキーでガイドされた歪みのない透かしでデータセットを書き換える。
さまざまなデータセットとモデルファミリにわたって、TRACEは一貫して重要な検出を実現している。
論文 参考訳(メタデータ) (2025-10-03T12:53:02Z) - Dataset Protection via Watermarked Canaries in Retrieval-Augmented LLMs [67.0310240737424]
本稿では,テキストデータセットの所有権を保護し,RA-LLMによる不正使用を効果的に検出するための新しいアプローチを提案する。
提案手法では,IPデータセットに特別に設計されたカナリア文書を挿入することにより,元のデータを完全に変更することなく保護する。
検出プロセス中、カナリア文書をクエリし、RA-LLMの応答を分析することにより、不正使用を識別する。
論文 参考訳(メタデータ) (2025-02-15T04:56:45Z) - Data Watermarking for Sequential Recommender Systems [52.207721219147814]
逐次リコメンデータシステムにおけるデータ透かしの問題について検討する。
データセット全体のオーナシップを保護するデータセット透かしと,個々のユーザのデータを保護するユーザ透かしという2つの設定に重点を置いています。
論文 参考訳(メタデータ) (2024-11-20T02:34:21Z) - Watermarking Generative Categorical Data [9.087950471621653]
本手法は,データ分布を2つの成分に分割し,一方の分布を他方との決定論的関係に基づいて修正することにより秘密信号を埋め込む。
透かしを検証するために挿入逆アルゴリズムを導入し、逆復号データと元の分布との間の全変動距離を計測してその存在を検出する。
論文 参考訳(メタデータ) (2024-11-16T21:57:45Z) - Adaptive and Robust Watermark for Generative Tabular Data [9.275547262985917]
生成表データに対するフレキシブルでロバストな透かし機構を提案する。
ウォーターマークされたデータセットがデータ品質と下流のユーティリティに無視できる影響があることを理論的および実証的に示す。
論文 参考訳(メタデータ) (2024-09-23T04:37:30Z) - Watermarking Generative Tabular Data [39.31042783480766]
提案した透かしは,データ忠実性を忠実に保ちながら,有効に検出できることを理論的に示す。
また,付加音に対する強靭性も示している。
論文 参考訳(メタデータ) (2024-05-22T21:52:12Z) - Finding needles in a haystack: A Black-Box Approach to Invisible Watermark Detection [68.90458499700038]
WaterMark Detection (WMD) は、ブラックボックスとアノテーションなしの設定下で最初に目に見えない透かし検出法である。
我々はオフセット学習の基礎を用いてWMDを開発し、クリーンな非透かしデータセットにより、透かしサンプルのみの影響を分離することができる。
論文 参考訳(メタデータ) (2024-03-23T23:22:54Z) - A Resilient and Accessible Distribution-Preserving Watermark for Large Language Models [65.40460716619772]
本研究は,textbfDistribution-textbf Preserving (DiP)ウォーターマークの重要性に焦点をあてる。
現在の戦略とは対照的に,提案したDiPmarkは透かし中に元のトークン分布を同時に保存する。
言語モデルAPIにアクセスせずに検出可能で(アクセス可能)、トークンの適度な変更に対して確実に堅牢である。
論文 参考訳(メタデータ) (2023-10-11T17:57:35Z) - Did You Train on My Dataset? Towards Public Dataset Protection with
Clean-Label Backdoor Watermarking [54.40184736491652]
本稿では,公開データの保護のための一般的な枠組みとして機能するバックドアベースの透かし手法を提案する。
データセットに少数の透かしサンプルを挿入することにより、我々のアプローチは、ディフェンダーが設定した秘密関数を暗黙的に学習することを可能にする。
この隠れた機能は、データセットを違法に使用するサードパーティモデルを追跡するための透かしとして使用できる。
論文 参考訳(メタデータ) (2023-03-20T21:54:30Z) - Open-sourced Dataset Protection via Backdoor Watermarking [87.15630326131901]
本稿では,オープンソースの画像分類データセットを保護するために,Emphbackdoor Embeddingベースのデータセット透かし手法を提案する。
疑わしい第三者モデルによって生成される後続確率に基づいて,仮説テストガイド法を用いてデータセット検証を行う。
論文 参考訳(メタデータ) (2020-10-12T16:16:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。