論文の概要: Decoding the Legalese: A Scalable and Quantitative Framework for Analyzing Corporate Privacy Policies
- arxiv url: http://arxiv.org/abs/2609.26680v1
- Date: Tue, 22 Sep 2026 16:38:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.748223
- Title: Decoding the Legalese: A Scalable and Quantitative Framework for Analyzing Corporate Privacy Policies
- Title(参考訳): Decoding the Legalese: 企業プライバシポリシを解析するためのスケーラブルで定量的なフレームワーク
- Abstract要約: 規制要件を超えたプライバシーポリシーの重要な品質を特徴付ける標準化された指標が欠如している。
近年の大規模言語モデル(LLM)の進歩により,これらの文書を大規模に自動構築・解析することが可能になった。
我々は、生のプライバシーポリシーをきめ細かな構造化された表現に変換するエンドツーエンドのLCM対応システムを開発し、評価する。
- 参考スコア(独自算出の注目度): 5.77286702833073
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Even though privacy policies are the primary mechanism organizations use to disclose how they collect, process, and share personal data, they are difficult for average users to interpret, perhaps by design, due to their verbosity and dense legal language. Importantly, there is a lack of standardized metrics that characterize key qualities of a privacy policy beyond regulatory requirements. Recent advances in large language models (LLMs) make it feasible to automatically structure and analyze these documents at scale. In this study, we develop and evaluate an end-to-end, LLM-enabled system that converts raw privacy policies into fine-grained structured representations and a set of quantitative measures. Our pipeline applies a detailed taxonomy to extract specific data elements and governing practices, capturing relational links that connect each practice to the data elements it references. We apply our framework to a diverse corpus of 10,000 website privacy policies, yielding, to the best of our knowledge, the most comprehensive dataset of its kind to date. Building on our structured representations, we introduce the first standardized and repeatable quantitative metrics for evaluating privacy policies along four dimensions: completeness, transparency, commitment to user protection, and emphasis on business-driven data practices. This allows us to compare policies within and across industry sectors, and to assess the tension between user protection and business interests.
- Abstract(参考訳): プライバシポリシは、個人データの収集、処理、共有の方法を明らかにするために組織が使用している主要なメカニズムですが、おそらくは、冗長性や密集した法律言語のために、設計によって、平均的なユーザが解釈することが難しいのです。
重要なことは、規制要件を超えたプライバシーポリシーの重要な品質を特徴付ける標準化されたメトリクスが欠如していることだ。
近年の大規模言語モデル(LLM)の進歩により,これらの文書を大規模に自動構築・解析することが可能になった。
本研究では、生のプライバシーポリシーをきめ細かな構造化された表現に変換するエンドツーエンドのLCM対応システムを開発し、評価する。
私たちのパイプラインは、特定のデータ要素を抽出し、その参照するデータ要素とそれぞれのプラクティスを結びつけるリレーショナルリンクをキャプチャするために、詳細な分類を適用しています。
当社のフレームワークを1万のWebサイトプライバシポリシの多種多様なコーパスに適用し、その結果、私たちの知る限りでは、これまででもっとも包括的なデータセットに当てはめています。
構造化された表現に基づいて、完全性、透明性、ユーザ保護へのコミットメント、ビジネス駆動型データプラクティスの強調という4つの側面に沿って、プライバシポリシを評価するための、初めて標準化された、繰り返し可能な定量的メトリクスを紹介します。
これにより、業界セクター内でポリシーを比較し、ユーザ保護とビジネス上の利益の間の緊張を評価することができます。
関連論文リスト
- PrivSTRUCT: Untangling Data Purpose Compliance of Privacy Policies in Google Play Store [7.8875412433566465]
複雑なプライバシー開示を解消する,新規かつ体系的なエンコーダとデコーダを組み合わせたフレームワークであるPrivSTRUCTを紹介する。
PrivSTRUCTを3,756のAndroidアプリの大規模なデータセットに適用することで、重要な透明性ギャップが明らかになりました。
また、センシティブなサードパーティのデータフローは、しばしば希釈され、一般的なカテゴリや無関係なカテゴリに絡み合っていることもわかりました。
論文 参考訳(メタデータ) (2026-04-24T02:12:11Z) - LADFA: A Framework of Using Large Language Models and Retrieval-Augmented Generation for Personal Data Flow Analysis in Privacy Policies [3.1079404628759306]
LADFAはプライバシーポリシーを分析するためのエンドツーエンドの計算フレームワークである。
特定のプライバシポリシで非構造化テキストを処理し、個人データフローを抽出し、個人データフローグラフを構築することができる。
プライバシーポリシー分析以外のテキストベースの分析タスクにも適している。
論文 参考訳(メタデータ) (2026-01-15T14:03:22Z) - SynBench: A Benchmark for Differentially Private Text Generation [35.908455649647784]
医療や金融といった高度な分野におけるデータ駆動型意思決定のサポートは、データ共有にとって大きな障壁に直面している。
大規模言語モデルのような最近の生成AIモデルは、オープンドメインタスクにおいて印象的なパフォーマンスを示している。
しかし、彼らのセンシティブな環境への導入は、予測不可能な振る舞いと、プライバシー保護の不十分なデータセットによって制限されている。
論文 参考訳(メタデータ) (2025-09-18T03:57:50Z) - MAGPIE: A dataset for Multi-AGent contextual PrIvacy Evaluation [54.410825977390274]
LLMエージェントのコンテキストプライバシを評価するための既存のベンチマークは、主にシングルターン、低複雑さタスクを評価する。
まず、15ドメインにわたる158のリアルタイムハイテイクシナリオからなるベンチマーク-MAGPIEを示す。
次に、コンテキスト的にプライベートなデータに対する理解と、ユーザのプライバシを侵害することなくコラボレーションする能力に基づいて、最先端のLCMを評価します。
論文 参考訳(メタデータ) (2025-06-25T18:04:25Z) - Entailment-Driven Privacy Policy Classification with LLMs [3.564208334473993]
本稿では,プライバシーポリシーの段落をユーザが容易に理解できる意味のあるラベルに分類する枠組みを提案する。
私たちのフレームワークは、F1スコアを平均11.2%改善します。
論文 参考訳(メタデータ) (2024-09-25T05:07:05Z) - Collection, usage and privacy of mobility data in the enterprise and public administrations [55.2480439325792]
個人のプライバシーを守るためには、匿名化などのセキュリティ対策が必要である。
本研究では,現場における実践の洞察を得るために,専門家によるインタビューを行った。
我々は、一般的には最先端の差分プライバシー基準に準拠しない、使用中のプライバシー強化手法を調査した。
論文 参考訳(メタデータ) (2024-07-04T08:29:27Z) - EROS: Entity-Driven Controlled Policy Document Summarization [16.661448437719464]
制御された抽象要約を用いてポリシー文書の解釈可能性と可読性を向上させることを提案する。
プライバシー関連エンティティラベルをマークしたポリシー文書要約データセットであるPD-Sumを開発した。
提案モデルであるEROSは,スパン型エンティティ抽出モデルを用いて重要なエンティティを識別し,それらを用いて要約情報の内容を制御する。
論文 参考訳(メタデータ) (2024-02-29T21:44:50Z) - PrivacyMind: Large Language Models Can Be Contextual Privacy Protection Learners [81.571305826793]
コンテキストプライバシ保護言語モデル(PrivacyMind)を紹介する。
我々の研究はモデル設計に関する理論的分析を提供し、様々な手法をベンチマークする。
特に、肯定的な例と否定的な例の両方による命令チューニングは、有望な方法である。
論文 参考訳(メタデータ) (2023-10-03T22:37:01Z) - PLUE: Language Understanding Evaluation Benchmark for Privacy Policies
in English [77.79102359580702]
プライバシポリシ言語理解評価ベンチマークは,プライバシポリシ言語理解を評価するマルチタスクベンチマークである。
また、プライバシポリシの大規模なコーパスを収集し、プライバシポリシドメイン固有の言語モデル事前トレーニングを可能にします。
ドメイン固有の連続的な事前トレーニングは、すべてのタスクでパフォーマンスを改善することを実証します。
論文 参考訳(メタデータ) (2022-12-20T05:58:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。