論文の概要: CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment
- arxiv url: http://arxiv.org/abs/2608.09164v2
- Date: Thu, 13 Aug 2026 06:14:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.518709
- Title: CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment
- Title(参考訳): CIDER:プライバシ優先アライメントのためのコンテキスト開示境界のデータセット
- Abstract要約: 我々は169名のユーザから14,850名の人的アノテーションのデータセットであるCIDERを紹介した。
我々は、60の対人コミュニケーションシナリオにまたがる1,650のコンテキスト開示境界セットを形成する。
文脈内パーソナライゼーションは6つの歴史的例だけで予測精度を最大11.41ポイント向上させる。
- 参考スコア(独自算出の注目度): 5.186812525968559
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Aligning large language models (LLMs) with human privacy preferences requires capturing individuals' disclosure boundaries beyond general privacy norms. However, a gap remains in eliciting such nuanced preferences to evaluate alignment in realistic settings. We introduce CIDER, a dataset of 14,850 human annotations from 169 users, forming 1,650 contextual disclosure boundary sets across 60 interpersonal communication scenarios involving information sharing that violates privacy norms. Each boundary represents a real user's disclosure decisions over 9 sharing variants in a scenario, for a given communication role and AI-mediated condition. We formulate a task in which models predict a user's disclosure decision from historical boundaries, with varying levels of contextual information. Across 12 open and proprietary models, in-context personalization improves prediction accuracy by up to 11.41 percentage points using only 6 historical examples. Larger models such as GPT-5.4 (with medium reasoning effort) and Claude Sonnet 4.6 are better at leveraging semantic context to understand user-specific, context-dependent disclosure preferences for more accurate predictions, while smaller models tend to rely on structured heuristics based on disclosure granularity and identifiability. Personalization generally improves prediction accuracy, but the improvement is often accompanied by imbalanced shifts in false-positive and false-negative rates across models, with only Claude Sonnet 4.6 achieving balanced improvements in both. Our findings reveal both the promise and limitations of inference-time personalization for privacy preference modeling and position CIDER as a resource for advancing personalized privacy alignment.
- Abstract(参考訳): 大きな言語モデル(LLM)を人間のプライバシの好みに合わせるには、一般のプライバシの規範を越えて個人の開示境界を捉える必要がある。
しかし、現実的な設定でのアライメントを評価するために、そのようなニュアンスな嗜好を引き出すことにはギャップが残っている。
プライバシ規範に違反した情報共有を含む60の対人コミュニケーションシナリオを対象に,14,850人のユーザから得られた14,850人のアノテーションのデータセットであるCIDERを紹介した。
各バウンダリは、与えられたコミュニケーションロールとAIを介する条件に対して、シナリオ内で9つの変種を共有する実際のユーザの開示決定を表す。
我々は,ユーザの開示決定を歴史的境界から予測するタスクを,さまざまな文脈情報を用いて定式化する。
12のオープンおよびプロプライエタリなモデルにおいて、コンテキスト内パーソナライゼーションは6つの歴史的な例だけで最大11.41ポイントの予測精度を向上させる。
GPT-5.4 や Claude Sonnet 4.6 のようなより大規模なモデルは、より正確な予測のためにユーザー固有の、文脈に依存した開示の好みを理解するために意味的コンテキストを活用するのに優れているが、より小さなモデルは、開示の粒度と識別可能性に基づいて構造化されたヒューリスティックに依存する傾向がある。
パーソナライゼーションは一般的に予測精度を改善するが、この改善はモデル間での偽陽性と偽陰性率の不均衡なシフトを伴うことが多い。
本研究は,プライバシ選好モデリングにおける推論時パーソナライズの可能性と限界を明らかにするとともに,パーソナライズされたプライバライズアライメントを促進するためのリソースとしてCIDERを位置づけた。
関連論文リスト
- Evaluating the Hidden Costs of Personalization in Large Language Models [55.07935163900691]
我々は,(1)無関係なパーソナライゼーション,(2)不必要な文脈で個人情報を参照するモデル,(2)好みの絞り込み,(2)情報エコーチャンバーを補強するモデル,(3)覚醒バイアス,(3)モデルがユーザの意見に過度に同意するモデル,の3つのリスクを識別する。
我々は、現在のAIアシスタントの体系的な制限を明らかにするために、自動データ生成と調整されたメトリクスを備えた動的評価フレームワークであるPRISKを提案する。
論文 参考訳(メタデータ) (2026-08-28T20:05:12Z) - Private Direct Preference Optimization for LLM Alignment [77.56374641532715]
直接選好最適化(DPO)は、人間の選好データを用いて大規模言語モデル(LLM)を調整するための標準手法である。
本稿では、DPOのためのラベルDPスタイルのプライバシー概念である嗜好プライバシを定式化する。
次に、大規模LLMトレーニングと互換性を維持しながら、好みのプライバシを強制するDPOの派生であるPrivDPOを設計する。
論文 参考訳(メタデータ) (2026-08-05T16:51:02Z) - Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling [2.805986764620217]
報酬学習のみに差分プライバシーを課すプライバシー保護フレームワークを提案する。
プライバシーは、通常の非私的統計誤差を超える付加的な用語に寄与していることを示す。
人為的HH-RLHFデータセットの実験は、既存の微分プライベートベースライン法よりも強いプライベートアライメント性能を示す。
論文 参考訳(メタデータ) (2026-03-23T20:45:17Z) - Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict [5.739904853130176]
本稿では,プライバシの態度,社会性,データ共有の受容に関する標準化されたアンケートを管理するコンテキストベースのアセスメントプロトコルを提案する。
競合する姿勢下での価値-作用アライメントを評価するために,多群構造方程式モデリング(MGSEM)を用いて,プライバシの懸念やデータ共有に対する親和性から関係を同定する。
論文 参考訳(メタデータ) (2026-01-07T03:30:42Z) - Measuring Physical-World Privacy Awareness of Large Language Models: An Evaluation Benchmark [10.645183619391135]
EAPrivacyは、エンボディエージェントの物理世界のプライバシー意識を定量化するために設計された総合評価ベンチマークである。
EAPrivacyは、4層にわたる手続き的に生成されたシナリオを使用して、エージェントの機密性のあるオブジェクト処理能力のテスト、環境の変化への適応、タスクの実行とプライバシの制約のバランス、社会的規範との矛盾の解決を行う。
論文 参考訳(メタデータ) (2025-09-27T23:39:56Z) - Personalized Language Models via Privacy-Preserving Evolutionary Model Merging [53.97323896430374]
言語モデルにおけるパーソナライゼーションは、個々のユーザやユーザグループに対する振る舞いをモデル化することを目的としている。
進化的アルゴリズム(PriME)によるプライバシ保護モデルマージを提案する。
PriMEは、プライバシーリスクを低減しつつ、ユーティリティを直接最適化するために、勾配のない方法を採用している。
LaMPベンチマークの実験によると、Primeは一貫してベースラインを上回り、タスクパフォーマンスを最大45%改善している。
論文 参考訳(メタデータ) (2025-03-23T09:46:07Z) - Optimal Private Discrete Distribution Estimation with One-bit Communication [63.413106413939836]
1ビット通信制約を伴う個別分布推定問題を考える。
1ビット通信制約下での最悪のトレードオフの1次を特徴付ける。
これらの結果は,1ビット通信制約下でのプライバシユーティリティトレードオフの最適依存性を示す。
論文 参考訳(メタデータ) (2023-10-17T05:21:19Z) - Learning Personalized Alignment for Evaluating Open-ended Text Generation [44.565686959174585]
PerSEは、特定の人間の好みに合わせてアライメントを評価するために設計された解釈可能な評価フレームワークである。
テキスト内個人プロファイルから特定の好みを推測し、生成されたコンテンツと個人の好みとの整合性を評価するように調整される。
当社の13B LLaMA-2ベースのPerSEは、ケダル相関が15.8%増加し、ゼロショットレビュアーによる13.7%の精度向上を示している。
論文 参考訳(メタデータ) (2023-10-05T04:15:48Z) - Mixed Differential Privacy in Computer Vision [133.68363478737058]
AdaMixは、プライベートとパブリックの両方の画像データを使用して、ディープニューラルネットワーク分類器をトレーニングするための適応型微分プライベートアルゴリズムである。
プライベートデータを無視する数ショットあるいはゼロショットの学習ベースラインは、大規模なプライベートデータセットの微調整よりも優れています。
論文 参考訳(メタデータ) (2022-03-22T06:15:43Z) - Private Prediction Sets [72.75711776601973]
機械学習システムは、個人のプライバシーの確実な定量化と保護を必要とする。
これら2つのデシラタを共同で扱う枠組みを提案する。
本手法を大規模コンピュータビジョンデータセット上で評価する。
論文 参考訳(メタデータ) (2021-02-11T18:59:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。