論文の概要: QuanText: Protecting Dataset-Level Secrets in Textual Data Sharing
- arxiv url: http://arxiv.org/abs/2609.17995v2
- Date: Fri, 18 Sep 2026 03:21:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-21 18:40:16.695374
- Title: QuanText: Protecting Dataset-Level Secrets in Textual Data Sharing
- Title(参考訳): QuanText: テキストデータ共有におけるデータセットレベルのシークレット保護
- Abstract要約: データユーティリティを保ちながらテキストデータセットのグローバルな秘密を保護するトレーニングフリーで大規模言語に依存しないデータリリース機構を提案する。
QuanTextはStatistic Maximal Leakageフレームワークにインスパイアされている。
以上の結果から,QuanTextは競合するデータ生成ベースラインよりも,経験的なプライバシユーティリティトレードオフを実現していることがわかった。
- 参考スコア(独自算出の注目度): 19.987334131481482
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Natural-language datasets support many downstream applications and research studies, but releasing text can reveal sensitive global properties of the underlying data source, such as the proportion of records associated with a particular gender, diagnosis, or political stance. Existing work has largely focused on property inference attacks that recover such global properties, while defenses for protecting these dataset-level secrets remain limited. Differential privacy, although effective for protecting individual records, provides only weak protection for aggregate properties. We propose Randomized Quantization for Text (QuanText), a training-free and large-language-model-agnostic data release mechanism that protects global secrets in textual datasets while preserving data utility. Given a dataset-level secret, such as the proportion of records with a particular diagnosis, and attributes whose utility should be preserved, such as topic and sentiment, QuanText perturbs both the secret distribution and the distributions of correlated attributes. It does so by constructing candidate release distributions over secret and non-secret attributes, randomly selecting a candidate sufficiently close to the private empirical distribution, and rewriting each private text sample to match the selected distribution using attribute-related snippets from the original text. QuanText is inspired by the Statistic Maximal Leakage (SML) framework, which bounds leakage about a secret function of a data distribution. Under idealized conditions, we show that QuanText satisfies an SML guarantee. Since these conditions may not hold exactly in practice, we also evaluate QuanText empirically on real-world datasets. Our results show that QuanText achieves a better empirical privacy-utility trade-off than competing data generation baselines.
- Abstract(参考訳): 自然言語データセットは多くの下流のアプリケーションや研究研究をサポートしているが、テキストを公開することで、特定の性別、診断、政治的スタンスに関連するレコードの割合など、基礎となるデータソースのセンシティブなグローバルな特性を明らかにすることができる。
既存の作業は、このようなグローバルなプロパティを回復するプロパティ推論攻撃に重点を置いている一方で、これらのデータセットレベルのシークレットを保護するための防御は、依然として限られている。
差分プライバシーは個々の記録を保護するのに有効であるが、集合資産に対する弱い保護しか提供しない。
データユーティリティを保ちながらテキストデータセットのグローバルな秘密を保護するトレーニングフリーで大規模言語に依存しないデータリリース機構であるRandomized Quantization for Text (QuanText)を提案する。
特定の診断を伴うレコードの割合や、トピックや感情などのユーティリティを保存すべき属性などのデータセットレベルのシークレットが与えられた場合、QuanTextは、シークレット分布と相関属性の分布の両方を摂動する。
秘密属性及び非秘密属性を介して候補リリース分布を構築し、プライベートな経験分布に十分近い候補をランダムに選択し、元のテキストから属性関連スニペットを使用して選択されたディストリビューションにマッチするように、各プライベートテキストサンプルを書き換える。
QuanTextはStatistic Maximal Leakage (SML)フレームワークにインスパイアされている。
理想的な条件下では、QuanTextがSMLの保証を満たすことを示す。
これらの条件が正確には成立しない可能性があるため、実世界のデータセット上でQuanTextを実証的に評価する。
以上の結果から,QuanTextは競合するデータ生成ベースラインよりも,経験的なプライバシユーティリティトレードオフを実現していることがわかった。
関連論文リスト
- Secret-Protected Evolution for Differentially Private Synthetic Text Generation [25.60898496792365]
SecPE(Secret-Protected Evolution)は、シークレット・アウェア・プロテクションによってプライベート・プロテクションを拡張する新しいフレームワークである。
SecPE が$(mathrmp, Mathrmr)$- Secret Protection を満たすことを示す。
その結果、SecPEはより実用的で効果的なプライバシー保護型合成テキスト生成を解放できることがわかった。
論文 参考訳(メタデータ) (2025-10-13T04:05:42Z) - Zero-Shot Privacy-Aware Text Rewriting via Iterative Tree Search [60.197239728279534]
クラウドベースのサービスにおける大規模言語モデル(LLM)は、重大なプライバシー上の懸念を引き起こしている。
既存のテキスト匿名化と、ルールベースのリアクションやスクラブのような非識別技術は、プライバシー保護とテキストの自然性と実用性のバランスをとるのに苦労することが多い。
我々は,一貫性,妥当性,自然性を保ちながら,秘密情報を体系的に難読化・削除するゼロショット木探索型反復文書き換えアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-09-25T07:23:52Z) - Robust Utility-Preserving Text Anonymization Based on Large Language Models [80.5266278002083]
機密情報を含む匿名化は、幅広いアプリケーションにとって不可欠である。
既存の技術は、大規模言語モデルの再識別能力の新たな課題に直面している。
本稿では,プライバシ評価器,ユーティリティ評価器,最適化コンポーネントの3つの重要なコンポーネントで構成されるフレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-16T14:28:56Z) - PrivacyMind: Large Language Models Can Be Contextual Privacy Protection Learners [81.571305826793]
コンテキストプライバシ保護言語モデル(PrivacyMind)を紹介する。
我々の研究はモデル設計に関する理論的分析を提供し、様々な手法をベンチマークする。
特に、肯定的な例と否定的な例の両方による命令チューニングは、有望な方法である。
論文 参考訳(メタデータ) (2023-10-03T22:37:01Z) - Source Attribution for Large Language Model-Generated Data [57.85840382230037]
合成テキストの生成に寄与したデータプロバイダを特定することで、ソース属性を実行できることが不可欠である。
我々はこの問題を透かしによって取り組めることを示した。
本稿では,アルゴリズム設計により,これらの重要な特性を満足する情報源属性フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-01T12:02:57Z) - Differentially Private Language Models for Secure Data Sharing [19.918137395199224]
本稿では,生成言語モデルを個別に学習し,その結果を抽出する方法について述べる。
自然言語のプロンプトと新しいプロンプトミスマッチの損失を用いることで、高度に正確で流動的なテキストデータセットを作成できる。
我々は、我々の合成データセットが元のデータから情報を漏らさず、言語質が高いことを示す徹底的な実験を行う。
論文 参考訳(メタデータ) (2022-10-25T11:12:56Z) - Retrieval Enhanced Data Augmentation for Question Answering on Privacy
Policies [74.01792675564218]
本研究では,ラベルのないポリシー文書から関連するテキストセグメントを抽出する検索モデルに基づくデータ拡張フレームワークを開発する。
拡張データの多様性と品質を改善するために,複数の事前学習言語モデル(LM)を活用し,ノイズ低減フィルタモデルでそれらをカスケードする。
PrivacyQAベンチマークの強化データを使用して、既存のベースラインを大きなマージン(10% F1)に高め、新しい最先端のF1スコアを50%達成します。
論文 参考訳(メタデータ) (2022-04-19T15:45:23Z) - Scotch: An Efficient Secure Computation Framework for Secure Aggregation [0.0]
フェデレーション学習は、複数のデータ所有者がプライベートデータセットを公開せずに、機械学習モデルを共同でトレーニングすることを可能にする。
悪意のある集約サーバは、モデルパラメータを使用して、使用したトレーニングデータセットに関する機密情報を導き出すことができる。
フェデレーションアグリゲーションのための分散化テキストitm-partyセキュア計算フレームワークであるtextscScotch を提案する。
論文 参考訳(メタデータ) (2022-01-19T17:16:35Z) - Attribute Privacy: Framework and Mechanisms [26.233612860653025]
本研究では、データ所有者が分析中にデータセット全体の機密性を明らかにすることに関心を持つ属性プライバシの研究を行う。
我々は,グローバル属性を保護する必要がある2つのケースにおいて,インパトリビュートプライバシを捕捉するための定義を提案する。
これらの設定の属性プライバシーを満足する2つの効率的なメカニズムと1つの非効率的なメカニズムを提供する。
論文 参考訳(メタデータ) (2020-09-08T22:38:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。