論文の概要: A Systematic Evaluation of Traditional Privacy Policy Analysis Tools Against LLMs
- arxiv url: http://arxiv.org/abs/2607.17075v1
- Date: Sun, 19 Jul 2026 04:50:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.350424
- Title: A Systematic Evaluation of Traditional Privacy Policy Analysis Tools Against LLMs
- Title(参考訳): LLMに対する従来のプライバシーポリシー分析ツールの体系的評価
- Authors: Madhav Aryal, Sudipa Saha, Kaushal Kafle, Anshuman Chhabra, Sunil Manandhar,
- Abstract要約: 本論文は、市販のLCMが特殊なプライバシー分析ツールを置き換えることができるかどうかを、初めて体系的に評価したものである。
本稿では,矛盾検出,規制コンプライアンス分析,プライバシーポリシーの要約と集約という,3つの主要な機能にまたがる6つの代表的なツールについて検討する。
以上の結果から, LLM は既存のツールの機能に一貫して適合するか, 上回っていることが明らかとなった。
- 参考スコア(独自算出の注目度): 8.598491900175185
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: The advent of LLMs has significantly changed the research on privacy policy and data compliance analysis by enabling tasks that previously required specialized, domain-specific tools. However, it remains unclear to what extent LLMs can truly replicate the diverse functionalities, and the wide range of methodologies and analysis offered by prior work. In this paper, we conduct the first systematic evaluation of whether off-the-shelf LLMs can replace specialized privacy analysis tools. We study six representative tools spanning three major functionalities: contradiction detection, regulatory compliance analysis, and privacy policy summarization and aggregation, and across three intermediate tasks: structured data extraction using tuples, Semantic Role Labeling (SRL) and manual privacy policy labeling. We compare the performance of two state-of-the-art LLMs (GPT-5.2 and Gemini-2.5 in various configurations) against the tools by directly prompting the models to perform corresponding functionalities and tasks on a custom dataset of 10 privacy policies, allowing us to assess whether off-the-shelf models can produce tool-specific functionalities without further engineering or domain-specific training, major limitations in prior work. Our results show that LLMs consistently match or exceed the capabilities of existing tools across the functionalities. In manual labeling of first-party collection entities, LLMs achieved an average precision of 81.8% and recall of 70.9%, while for labeling of third-party sharing entities, they achieved an average precision of 91.4% and recall of 70.8% compared to the OPP-115 dataset. Overall, our findings indicate that LLMs can effectively perform a broad range of functionalities and tasks in privacy policy and regulation analysis that previously required specialized tools.
- Abstract(参考訳): LLMの出現は、以前は専門的なドメイン固有のツールを必要としていたタスクを有効にすることで、プライバシポリシとデータコンプライアンス分析の研究を大きく変えた。
しかし、LLMがいかに多様な機能と、先行研究によって提供される幅広い方法論と分析を真に再現できるかは、まだ不明である。
本稿では,市販のLCMが特別なプライバシー分析ツールを置き換えることができるかどうかを,まず体系的に評価する。
本稿では, 矛盾検出, 規制コンプライアンス分析, プライバシーポリシーの要約と集約, タプルを用いた構造化データ抽出, セマンティックロールラベル (SRL) と手動プライバシポリシラベルの3つの主要な機能にまたがる6つの代表的なツールについて検討する。
我々は,10のプライバシポリシのカスタムデータセット上で,モデルに対応する機能やタスクを直接実行するよう促すことで,2つの最先端LCM(GPT-5.2とGemini-2.5)のパフォーマンスをツールと比較する。
以上の結果から, LLM は既存のツールの機能に一貫して適合するか, 上回っていることが明らかとなった。
ファースト・パーティ・コレクション・エンティティのラベリングにおいて、LLMは平均精度81.8%、リコール70.9%を達成し、サードパーティの共有エンティティのラベリングでは平均精度91.4%、リコール70.8%をOPP-115データセットと比較した。
以上の結果から, LLMは, 以前は特殊なツールが必要であったプライバシポリシや規制分析において, 幅広い機能やタスクを効果的に実行できることが示唆された。
関連論文リスト
- Auditing Training Data in Domain-adapted LLMs: LoRA-MINT [15.934462293442792]
LoRA-MINTは,Low-Rank Adaptation (LoRA) を通じてNLPタスクに微調整された最近のLarge Language Models (LLMs) に適用された新しいメンバシップ推論テスト(MINT)手法である。
第一の目的は、個々のサンプルがこれらの適応モデルのトレーニングデータの一部であったかどうかを評価することであり、知的財産権と機密データの管理に有用な監査ツールを提供することである。
論文 参考訳(メタデータ) (2026-06-05T06:19:03Z) - An End-to-End Framework for Building Large Language Models for Software Operations [9.453014847107069]
OpsLLMは、ソフトウェア操作のためのドメイン固有の大規模言語モデルである。
知識に基づく質問応答(QA)と根本原因分析(RCA)の両方をサポートする。
7B、14B、32Bパラメータを持つOpsLLMの3つのバージョンと15Kの微調整データセットをオープンソースにします。
論文 参考訳(メタデータ) (2026-04-06T02:40:18Z) - Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs [66.63911043019294]
データ準備は、生のデータセットを識別し、データセット間の関係を解明し、それらから貴重な洞察を抽出することを目的としている。
本稿では,様々な下流タスクのためのデータ準備にLLM技術を用いることに焦点を当てる。
データクリーニング、標準化、エラー処理、計算、データ統合、データ豊か化という3つの主要なタスクにフィールドを編成するタスク中心の分類を導入します。
論文 参考訳(メタデータ) (2026-01-22T12:02:45Z) - IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis [60.32962597618861]
IDA-Benchは、多ラウンドの対話シナリオで大規模言語モデルを評価する新しいベンチマークである。
エージェント性能は、最終的な数値出力と人間由来のベースラインを比較して判断する。
最先端のコーディングエージェント(Claude-3.7-thinkingなど)でさえ50%のタスクを成功させ、シングルターンテストでは明らかでない制限を強調している。
論文 参考訳(メタデータ) (2025-05-23T09:37:52Z) - Using LLMs for Automated Privacy Policy Analysis: Prompt Engineering, Fine-Tuning and Explainability [16.537038702325283]
機械学習ベースの分類器は、特定のプライバシポリシにおける異なる概念の検出を自動化するために開発された。
大規模言語モデル(LLM)を多くのNLPタスクに適用することは成功したが、自動プライバシポリシ分析にLLMを使うことを研究する研究はほとんどない。
論文 参考訳(メタデータ) (2025-03-16T10:50:31Z) - Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity [17.723293304671877]
我々は、パーソナライズされたツール呼び出しを評価するための新しいベンチマークETAPPを紹介する。
評価精度を向上させるために,キーポイントに基づく評価手法を提案する。
好み設定とキーポイントに基づく評価手法の有効性も検証した。
論文 参考訳(メタデータ) (2025-03-02T07:36:22Z) - SELF-GUIDE: Better Task-Specific Instruction Following via Self-Synthetic Finetuning [70.21358720599821]
大規模言語モデル(LLM)は、適切な自然言語プロンプトを提供する際に、多様なタスクを解決するという約束を持っている。
学生LLMからタスク固有の入出力ペアを合成する多段階メカニズムであるSELF-GUIDEを提案する。
ベンチマークの指標から,分類タスクに約15%,生成タスクに18%の絶対的な改善を報告した。
論文 参考訳(メタデータ) (2024-07-16T04:41:58Z) - Tool-Augmented Reward Modeling [58.381678612409]
本稿では,外部環境へのアクセスによるRMの強化により,制約に対処するツール拡張された嗜好モデリング手法であるThemisを提案する。
我々の研究は、外部ツールをRMに統合し、様々な外部ソースとの相互作用を可能にすることを目的としている。
人間の評価では、テミスで訓練されたRLHFはベースラインと比較して平均32%の勝利率を得る。
論文 参考訳(メタデータ) (2023-10-02T09:47:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。