論文の概要: Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences
- arxiv url: http://arxiv.org/abs/2605.30873v1
- Date: Fri, 29 May 2026 05:52:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-01 20:56:50.410212
- Title: Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences
- Title(参考訳): パーソナライズされたユーザの嗜好に対するGumbel-Softmaxによるフェデレーション型変分選好アライメント
- Abstract要約: 我々はGumbel-Softmax Prior (FedVPA-GP) を用いたフェデレーション型変分選好アライメントを提案する。
FedVPA-GPは、プライバシーを損なうことなく、様々な好みを乱すように設計されたフレームワークである。
HH-RLHFデータセットの実験は、FedVPA-GPがモノリシックベースラインを著しく上回ることを示した。
- 参考スコア(独自算出の注目度): 27.034832184399992
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Federated Learning (FL) offers a privacy-preserving pathway for aligning Large Language Models (LLMs); however, existing frameworks typically enforce a monolithic reward model, inevitably averaging out inherently conflicting user preferences (e.g., helpfulness vs. harmlessness). While Variational Preference Learning (VPL) offers a pathway to personalization, adapting it to decentralized settings presents a fundamental challenge: posterior collapse driven by severe local data scarcity and heterogeneity. In this paper, we propose Federated Variational Preference Alignment with Gumbel-Softmax Prior (FedVPA-GP), a framework designed to disentangle diverse preferences without compromising privacy. To stabilize variational inference, we introduce a Federated Mixture Prior that enables clients to leverage the aggregate population distribution as a dynamic prior. Furthermore, we incorporate an Orthogonal Loss that explicitly enforces the separation of preference prototypes in the latent space. Experiments on the HH-RLHF dataset demonstrate that FedVPA-GP significantly outperforms monolithic baselines, successfully disentangling conflicting user intents and enabling dynamic preference switching.
- Abstract(参考訳): フェデレートラーニング(FL)は、大規模言語モデル(LLM)の整合性を維持するためのプライバシ保護の経路を提供するが、既存のフレームワークは通常、モノリシックな報酬モデルを適用し、必然的に矛盾するユーザの好み(例えば、有用性対無害性)を平均化する。
変分選好学習(VPL)はパーソナライズへの道筋を提供するが、分散化された環境に適応させることは、深刻な局所データの不足と不均一性によって引き起こされる後部崩壊という根本的な課題を示す。
本稿では,FedVPA-GP(Federated Variational Preference Alignment with Gumbel-Softmax Prior)を提案する。
変動予測を安定させるために,クライアントが集団分布を動的に活用できるフェデレート・ミキチャー・プリエントを導入する。
さらに、直交ロス(Orthogonal Loss)を導入し、潜在空間における選好プロトタイプの分離を明示的に実施する。
HH-RLHFデータセットの実験では、FedVPA-GPはモノリシックなベースラインを著しく上回り、競合するユーザの意図をうまく切り離し、動的に好みを切り替えることを可能にしている。
関連論文リスト
- Preference Data Selection for Mitigating the Alignment Tax in Large Language Models [52.18310687523229]
BALIGNは、アライメント効率を最適化しながら破滅的な忘れを緩和するバランスのとれたデータ選択戦略である。
3つの重要なデータ中心の機能を統一された複合リスクスコアに集約することにより、BALIGNは、ハイリスクな選好サンプルを体系的にフィルタリングする。
標準的な人間の嗜好データセットの実験では、BALIGNはアライメントゲインを損なうことなく基礎的能力を強く保持している。
論文 参考訳(メタデータ) (2026-08-25T07:58:42Z) - Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models [63.70401095689976]
VLM(Vision-Language Models)は、医療や金融といったプライバシに敏感な分野において大きな可能性を秘めている。
ヘテロジニアスVLMのためのGRPOとMixture-of-Rewardsを組み合わせた協調アライメントフレームワークであるMoRを提案する。
MoRは、一般化とクロスクライアント適応性において、フェデレートされたアライメントベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-05T07:02:50Z) - Taming Noise-Induced Prototype Degradation for Privacy-Preserving Personalized Federated Fine-Tuning [21.950552296952623]
Prototype-based Personalized Federated Learning (ProtoPFL) は、コンパクトクラスプロトタイプを通信することで、効率的なマルチドメイン適応を実現する。
一般的な防御策としては、プロトタイプをバインドして感度を制限し、その後に局所微分プライバシーを強制する等方的ノイズが伴う。
本稿では,既存のProtoPFLにシームレスに統合されたクライアント側のプライバシプラグインであるVPDRを提案する。
論文 参考訳(メタデータ) (2026-04-30T13:20:51Z) - FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment [55.97027207627]
Fed PDPO(Federated Personalized Direct Preference Optimization)は、大規模言語モデル(LLM)の優先順位調整のためのパーソナライズされたフレームワークである。
パラメータ効率の良い微調整アーキテクチャを採用し、各クライアントはLow-Rank Adaptation (LoRA)アダプタで拡張された凍結したLLMバックボーンを維持し、通信効率のよいアグリゲーションを可能にする。
複数の嗜好データセットの実験では、最先端のパフォーマンスを示し、フェデレーション付きドメイン内およびクロスドメイン設定の平均精度が4.80%向上した。
論文 参考訳(メタデータ) (2026-03-20T08:24:49Z) - Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment [13.085014101959118]
我々は、バッチ統計から有利な推定を分離する新しいアライメントフレームワークであるPersonalized GRPOを紹介する。
我々はP-GRPOを多種多様なタスクで評価し、標準のGRPOよりも高速な収束と高い報酬を達成することを発見した。
論文 参考訳(メタデータ) (2026-02-17T19:00:43Z) - Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models [63.70401095689976]
パラメータを好みに置き換えることは、よりスケーラブルでプライバシに保護される未来を表している、と私たちは主張する。
ヘテロジニアスVLMのためのGRPOとMixture-of-Rewardsを用いた協調アライメントフレームワークであるMoRを提案する。
MoRは、一般化、堅牢性、およびクロスクライアント適応性において、連邦化されたアライメントベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-01-31T03:11:51Z) - SPRInG: Continual LLM Personalization via Selective Parametric Adaptation and Retrieval-Interpolated Generation [11.253466187411524]
SPRInGは、効果的な継続パーソナライズを目的とした、新しい半パラメトリックフレームワークである。
訓練中、SPRInGはドリフト駆動の選択的適応を採用しており、これは確率に基づくスコアリング機能を用いて高能率相互作用を識別する。
長期のパーソナライズされた生成ベンチマークの実験は、SPRInGが既存のベースラインを上回っていることを示している。
論文 参考訳(メタデータ) (2026-01-15T01:32:27Z) - FedAWA: Adaptive Optimization of Aggregation Weights in Federated Learning Using Client Vectors [50.131271229165165]
Federated Learning (FL)は、分散機械学習のための有望なフレームワークとして登場した。
ユーザの行動、好み、デバイス特性の相違から生じるデータの異質性は、連合学習にとって重要な課題である。
本稿では,学習過程におけるクライアントベクトルに基づくアダプティブ重み付けを適応的に調整する手法であるAdaptive Weight Aggregation (FedAWA)を提案する。
論文 参考訳(メタデータ) (2025-03-20T04:49:40Z) - Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes [50.544186914115045]
大きな言語モデル(LLM)は、日々のアプリケーションにますます組み込まれています。
個人ユーザの多様な嗜好との整合性を確保することは、重要な課題となっている。
数発のステアライメントのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-18T16:14:59Z) - ComPO: Community Preferences for Language Model Personalization [122.54846260663922]
ComPOは、言語モデルにおける好みの最適化をパーソナライズする手法である。
ComPRedはRedditからコミュニティレベルの好みを持った質問応答データセットです。
論文 参考訳(メタデータ) (2024-10-21T14:02:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。