論文の概要: A Seed for Privacy -- semi-automatic privacy-revealing data detection in databases and data streams
- arxiv url: http://arxiv.org/abs/2607.08801v2
- Date: Wed, 15 Jul 2026 00:30:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 14:31:40.668633
- Title: A Seed for Privacy -- semi-automatic privacy-revealing data detection in databases and data streams
- Title(参考訳): プライバシのシード - データベースとデータストリームにおける半自動プライバシ検出
- Authors: He Gu, Thomas Plagemann, Vera Goebel,
- Abstract要約: pArboristは、複雑なイベントを識別してラベル付けするためのクエリを作成するツールである。
pArboristは,プライバシ保護クエリの検索において,90%のリコールと93%の精度を実現している。
- 参考スコア(独自算出の注目度): 1.0781866671930855
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Sharing databases and data streams imposes the danger of revealing private information in the form of complex events which can comprise individual data elements and their combinations. Identifying these privacy-revealing complex events is crucial for preserving privacy while maintaining data utility. However, data producers often lack the expertise to comprehensively identify these events, which undermines many state-of-the-art privacy-preserving mechanisms that rely on accurate event labeling. To address this challenge, we developed pArborist - a tool that can semi-automatically create a set of queries to identify and label privacy-revealing complex events in both static datasets and dynamic data streams, guided by the privacy requirements of the data producer. pArborist uses the schema of the database or data stream combined with initial input from the data producer, i.e., seed queries. From each seed query, pArborist grows a tree containing all possible syntactically correct queries, constrained by an upper limit on computational resources. Following this growing phase, the tree is refined by eliminating queries that lack correlation to the seed or are conditionally independent of the seed. Our evaluation indicates that pArborist achieves overall recall of 90% and precision of 93% in finding privacy-revealing queries, and this significantly surpasses the state-of-the-art approach FQID. In data stream processing experiments, pArborist introduces a delay of approximately 1.3 ms following an average warm-up period of 920 ms. The experiments also show that pArborist can automatically detect privacy-revealing complex events according to GDPR.
- Abstract(参考訳): データベースとデータストリームを共有することは、個々のデータ要素とそれらの組み合わせから構成される複雑なイベントの形で、プライベート情報を公開する危険性を強いる。
データユーティリティを維持しながらプライバシを保護するためには、これらのプライバシ保護の複雑なイベントの特定が不可欠だ。
しかし、データプロデューサは、これらのイベントを包括的に識別する専門知識を欠くことが多く、正確なイベントラベリングに依存する多くの最先端のプライバシ保護メカニズムを損なう。
この課題に対処するため、我々はpArboristを開発した。pArboristは、静的データセットと動的データストリームの両方において、プライバシを検出およびラベル付けする複雑なイベントを、データプロデューサのプライバシ要件によってガイドされたクエリセットを半自動生成するツールである。
pArboristは、データベースまたはデータストリームのスキーマと、データプロデューサからの最初の入力、すなわちシードクエリの組み合わせを使用する。
それぞれのシードクエリから、pArboristは、計算リソースの上限によって制約されたすべての構文的に正しいクエリを含むツリーを成長させる。
この成長段階の後、種子との相関を欠いたクエリを除去したり、種子から条件的に独立して木を精製する。
pArborist は,プライバシ保護クエリの検索において,90% のリコールと 93% の精度を実現しており,これは最先端の FQID をはるかに上回っている。
データストリーム処理の実験では、pArboristは、平均ウォームアップ期間920msの後に約1.3msの遅延を導入している。
関連論文リスト
- PrivSTRUCT: Untangling Data Purpose Compliance of Privacy Policies in Google Play Store [7.8875412433566465]
複雑なプライバシー開示を解消する,新規かつ体系的なエンコーダとデコーダを組み合わせたフレームワークであるPrivSTRUCTを紹介する。
PrivSTRUCTを3,756のAndroidアプリの大規模なデータセットに適用することで、重要な透明性ギャップが明らかになりました。
また、センシティブなサードパーティのデータフローは、しばしば希釈され、一般的なカテゴリや無関係なカテゴリに絡み合っていることもわかりました。
論文 参考訳(メタデータ) (2026-04-24T02:12:11Z) - Privasis: Synthesizing the Largest "Public" Private Dataset from Scratch [101.49955223689268]
私たちはPrivasisを紹介します。Privasisは、スクラッチから完全に構築された最初の100万規模の完全合成データセットです。
既存のデータセットと比較すると、Privasisは質の高いマグニチュードスケールを提供する。
我々はPrivasisを利用して、テキストを分解してターゲット衛生に適用するパイプラインで、テキスト衛生のための並列コーパスを構築する。
論文 参考訳(メタデータ) (2026-02-03T06:54:46Z) - How to DP-fy Your Data: A Practical Guide to Generating Synthetic Data With Differential Privacy [52.00934156883483]
Differential Privacy(DP)は、情報漏洩を推論し、制限するフレームワークである。
Differentially Private Synthetic Dataは、ソースデータの全体的なトレンドを保存する合成データを指す。
論文 参考訳(メタデータ) (2025-12-02T21:14:39Z) - MAGPIE: A dataset for Multi-AGent contextual PrIvacy Evaluation [54.410825977390274]
LLMエージェントのコンテキストプライバシを評価するための既存のベンチマークは、主にシングルターン、低複雑さタスクを評価する。
まず、15ドメインにわたる158のリアルタイムハイテイクシナリオからなるベンチマーク-MAGPIEを示す。
次に、コンテキスト的にプライベートなデータに対する理解と、ユーザのプライバシを侵害することなくコラボレーションする能力に基づいて、最先端のLCMを評価します。
論文 参考訳(メタデータ) (2025-06-25T18:04:25Z) - Differentially Private Explanations for Clusters [16.217435153209752]
本稿では,ブラックボックスクラスタリング結果の説明を提供するフレームワークであるDPClustXについて述べる。
我々は,DPClustXを実データ上で実験的に解析し,厳密なプライバシー制約下であっても洞察に富んだ正確な説明を提供することを示した。
論文 参考訳(メタデータ) (2025-06-06T09:14:45Z) - Improving Statistical Privacy by Subsampling [0.0]
プライバシメカニズムとしてよく使われるのは、クエリに応答するデータのサンプルを取得することだ。
本論文は, 統計的条件下で, サンプリング方法の違いが, プライバシを増加させるかどうかを, 正確に検証する。
DP設定のトレードオフ関数は (epsilon,delta)-pairs よりもプライバシーの指標として提案されている。
論文 参考訳(メタデータ) (2025-04-15T17:40:45Z) - Mitigating the Privacy Issues in Retrieval-Augmented Generation (RAG) via Pure Synthetic Data [51.41288763521186]
Retrieval-augmented Generation (RAG)は、外部知識ソースから取得した関連情報を統合することにより、言語モデルの出力を強化する。
RAGシステムは、プライベートデータを取得する際に深刻なプライバシーリスクに直面する可能性がある。
検索データに対するプライバシー保護の代替として,合成データを用いる方法を提案する。
論文 参考訳(メタデータ) (2024-06-20T22:53:09Z) - RASE: Efficient Privacy-preserving Data Aggregation against Disclosure Attacks for IoTs [2.1765174838950494]
センサデバイスが生み出すデータを収集・保護する新たなパラダイムについて検討する。
データアグリゲーションとプライバシ保護の共同設計に関するこれまでの研究は、信頼されたフュージョンセンターがプライバシ体制に準拠していることを前提としている。
本稿では,3段階の逐次手順,雑音付加,ランダムな置換,パラメータ推定に一般化可能な新しいパラダイム(RASE)を提案する。
論文 参考訳(メタデータ) (2024-05-31T15:21:38Z) - Privacy-Preserved Neural Graph Databases [48.57788773216699]
NGDBにおけるプライバシー漏洩のリスクを軽減するために,プライバシ保存型ニューラルグラフデータベース(P-NGDB)フレームワークを提案する。
本研究は,NGDBを訓練段階に導入し,個人情報で質問したときの識別不能な回答を生成する。
論文 参考訳(メタデータ) (2023-12-25T02:32:05Z) - Private Synthetic Data with Hierarchical Structure [33.72123440111452]
本研究では,個々のデータポイントがグループ化される階層的データセットに対する差分プライベートな合成データ生成の問題について検討する。
特に、合成データセットと基礎となるプライベートデータセットの類似性を測定するために、プライベートクエリリリースの問題の下で、私たちの目標を設定します。
階層型クエリリリースのためのプライベートな合成データアルゴリズムを導入し、階層型データセット上で評価する。
論文 参考訳(メタデータ) (2022-06-13T07:22:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。