論文の概要: Enabling Multilingual Privacy Policy Audits: Large-Scale Analysis of Spanish Mobile Apps
- arxiv url: http://arxiv.org/abs/2607.18424v1
- Date: Mon, 20 Jul 2026 18:13:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.212845
- Title: Enabling Multilingual Privacy Policy Audits: Large-Scale Analysis of Spanish Mobile Apps
- Title(参考訳): マルチリンガルプライバシポリシの監査の実施: スペインのモバイルアプリの大規模分析
- Authors: Marcos Moran, David Rodriguez, Luka Nenadic, Norman Sadeh, Jose M. Del Alamo,
- Abstract要約: 本稿では,大規模言語モデル(LLM)が,言語固有の適応を必要とせずに,英語以外のプライバシポリシ分析を拡張できるかどうかを検討する。
専門家が注釈付けした2つのデータセットの翻訳版から、24の公式EU言語すべてを対象とした評価コーパスを組み立てる。
以上の結果から,英語のみのプライバシ監査が多言語環境における透明性のギャップを体系的に解消する方法が示唆された。
- 参考スコア(独自算出の注目度): 0.5707369719866678
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automated analyses of privacy policies enable large-scale assessments of transparency in digital ecosystems, yet existing auditing pipelines remain predominantly English-centric. This limits their ability to systematically evaluate multilingual environments, as in the European Union, where many services disclose privacy practices only in local languages. This paper examines whether large language models (LLMs) can extend privacy policy analysis beyond English without requiring language-specific adaptation, thus empowering large-scale auditing in linguistically diverse app ecosystems. We assemble an evaluation corpus spanning all 24 official EU languages from translated versions of two established expert-annotated datasets (OPP-115 and MAPP) and assess translation fidelity through automated metrics and targeted legal-expert review. Our LLM-based classifier for identifying categories of personal data collection achieves stable cross-lingual performance, with macro-F1 scores ranging between 0.91 and 0.94. We then leverage this capability in a large-scale audit of 2,611 Android applications from the Spanish Google Play Store. Combining multilingual privacy policy analysis with the evaluation of corresponding privacy labels and runtime network traffic exposes an important linguistic barrier: public-sector apps predominantly provide privacy policies in Spanish, whereas popular commercial apps mostly provide them in English. We reveal systematic discrepancies between declared and observed practices, especially in public-sector apps. Overall, our results indicate how English-only privacy audits can systematically obfuscate transparency gaps in multilingual environments.
- Abstract(参考訳): プライバシーポリシーの自動分析により、デジタルエコシステムにおける透明性の大規模評価が可能になるが、既存の監査パイプラインは主に英語中心のままである。
これにより、欧州連合のように多言語環境を体系的に評価する能力が制限される。
本稿では,大規模言語モデル(LLM)が言語固有の適応を必要とせずに,英語以外のプライバシポリシ分析を拡張できるかどうかを検討する。
我々は、確立された2つの専門家アノテートデータセット(OPP-115とMAPP)の翻訳版から、24の公式EU言語すべてにまたがる評価コーパスを組み立て、自動メトリクスとターゲットの法的専門家レビューを通じて、翻訳の忠実度を評価する。
個人データ収集のカテゴリを識別する LLM ベースの分類器は,0.91 から 0.94 までのマクロF1 スコアで,安定した言語間性能を実現する。
スペインGoogle Play Storeの2,611のAndroidアプリケーションの大規模な監査で、この機能を活用しました。
多言語によるプライバシポリシ分析と、対応するプライバシラベルとランタイムネットワークトラフィックの評価を組み合わせることで、重要な言語的障壁が明らかになる。
宣言されたプラクティスと観察されたプラクティスの体系的な相違点を明らかにする。
以上の結果から,英語のみのプライバシ監査が多言語環境における透明性のギャップを体系的に解消する方法が示唆された。
関連論文リスト
- Multilingual Refusal Alignment for Safer Large Language Models [53.64286756804503]
単言語アライメントが言語横断的に伝達されるか,トレーニング中に言語一貫性が保たれるか,一般的な知識能力とのトレードオフが生じるかを検討する。
RefusEUは、12のヨーロッパ言語をカバーする新しい拒絶アライメントデータセットであり、現在の最先端モデルを評価するための専用のテストセットを含む。
制御された直接選好最適化(DPO)実験は、2つの重要な洞察を提供する: 英語でのみモデルを整列することは、同じハーネスカテゴリであっても、言語間安全を保証するには不十分である。
論文 参考訳(メタデータ) (2026-04-24T09:29:14Z) - LangGPS: Language Separability Guided Data Pre-Selection for Joint Multilingual Instruction Tuning [49.22807995935406]
大規模言語モデル(LLM)の多言語命令追従能力と下流性能を改善するための多言語命令チューニングは広く採用されている手法である。
既存の選択法は、しばしばテキストの品質、多様性、タスク関連性といった特徴に基づいており、典型的には多言語データの固有の言語構造を見落としている。
言語分離性によって導かれる軽量な2段階事前選択フレームワークであるLangGPSを提案する。
論文 参考訳(メタデータ) (2025-11-13T12:02:32Z) - The Model's Language Matters: A Comparative Privacy Analysis of LLMs [0.3441021278275805]
我々は,6つの言語指標を定量化し,抽出,反事実記憶,会員推定の3つの攻撃ベクトルを評価する。
イタリアは最も強い漏れを示す一方、英語は高い会員分離性を示す。
フランスとスペインは、モルフォロジーの複雑さが高いため、より大きなレジリエンスを示す。
論文 参考訳(メタデータ) (2025-10-09T20:59:42Z) - Multilingual Self-Taught Faithfulness Evaluators [11.200203292660758]
合成多言語要約データからのみ学習するフレームワークである。
我々のフレームワークは、最先端の英語評価器や機械翻訳に基づくアプローチなど、既存のベースラインよりも改善されている。
論文 参考訳(メタデータ) (2025-07-28T12:01:59Z) - The AI Language Proficiency Monitor -- Tracking the Progress of LLMs on Multilingual Benchmarks [0.0]
我々は、最大200言語にわたる大規模言語モデル(LLM)のパフォーマンスを評価する包括的なベンチマークであるAI Language Monitorを紹介した。
FLORES+, MMLU, GSM8K, TruthfulQA, ARCなどのデータセットを用いて, 翻訳, 質問応答, 数学, 推論などのタスクを集約した。
私たちは、研究者、開発者、政策立案者をサポートし、モデルパフォーマンスの強さとギャップを識別する、オープンソースの自動更新型リーダボードとダッシュボードを提供しています。
論文 参考訳(メタデータ) (2025-07-11T12:38:02Z) - MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety [56.77103365251923]
大規模言語モデル(LLM)は、ジェイルブレイクのような敵の攻撃を受けやすい。
この脆弱性は、多言語セーフティアライメントされたデータが制限される多言語設定で悪化する。
素早い分類のための多言語ガードレールを提案する。
論文 参考訳(メタデータ) (2025-04-21T17:15:06Z) - Building cross-language corpora for human understanding of privacy
policies [7.1707060082291925]
この研究は、国語と参照学習言語で同等のクロス言語を構築するための方法論を提供する。
本稿では,プライバシポリシにおける技術的用語の理解に関する最初の研究の1つとして,英語とイタリア語を比較した方法論の応用例を示す。
論文 参考訳(メタデータ) (2023-02-10T16:16:55Z) - PLUE: Language Understanding Evaluation Benchmark for Privacy Policies
in English [77.79102359580702]
プライバシポリシ言語理解評価ベンチマークは,プライバシポリシ言語理解を評価するマルチタスクベンチマークである。
また、プライバシポリシの大規模なコーパスを収集し、プライバシポリシドメイン固有の言語モデル事前トレーニングを可能にします。
ドメイン固有の連続的な事前トレーニングは、すべてのタスクでパフォーマンスを改善することを実証します。
論文 参考訳(メタデータ) (2022-12-20T05:58:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。