論文の概要: Compliance2LoRA: Personalizable On-Demand Safety Alignment on Arbitrary Policy Subsets via Hypernetwork-Generated LoRA Adapters
- arxiv url: http://arxiv.org/abs/2607.27594v2
- Date: Sun, 02 Aug 2026 13:40:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.080962
- Title: Compliance2LoRA: Personalizable On-Demand Safety Alignment on Arbitrary Policy Subsets via Hypernetwork-Generated LoRA Adapters
- Title(参考訳): Compliance2LoRA: Hypernetwork-Generated LoRA Adaptersによる任意ポリシーサブセットのパーソナライズ可能なオンデスマンセーフティアライメント
- Abstract要約: 大規模推論モデル(LRM)におけるトレーニング後のアライメントは、様々な安全コンプライアンス設定への適応性を著しく改善した。
下流ユーザーに対するLRMのパーソナライズが中心となるため、様々なレベルのポリシーコンプライアンスの需要が増大する。
マルチポリシーコンプライアンスのための適応型ハイパーネットワークベースのフレームワークを提案する。
- 参考スコア(独自算出の注目度): 50.29667251847595
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training alignment in large reasoning models (LRMs) has significantly improved their adaptability to diverse safety compliance settings. However, as LRMs personalization for downstream users takes center stage, the demand for varying levels of policy compliance grows as different user-specific LRMs must adhere to distinct subsets of safety policies. Training a separate LRM for each policy subset introduces severe combinatorial overhead. While in context learning methods overcome this combinatorial overhead, they introduce additional computational challenges associated with long context generation. To address this challenge, we propose \ours, a unified adaptive hypernetwork-based framework for multi-policy compliance. In our framework, safety policies serve as customizable inputs to a LoRA adapter generator, which learns to produce policy compliant LoRA weights for downstream LRM. When added to the LRM these weights enable the generation of responses compliant with the specified policy subsets. In this work, we demonstrate that training such a hypernetwork enables on-demand policy adjustments on a single LRM without sacrificing task performance across reasoning models of different sized and different evaluation datasets. This highlights the effectiveness and practicality of adaptive hypernetwork based alignment in LRMs.
- Abstract(参考訳): 大規模推論モデル(LRM)におけるトレーニング後のアライメントは、様々な安全コンプライアンス設定への適応性を著しく改善した。
しかし、下流ユーザーに対するLRMのパーソナライズが中心となるにつれて、異なるユーザ固有のLRMが異なる安全ポリシーのサブセットに従わなければならないため、様々なレベルのポリシーコンプライアンスの需要が増大する。
各ポリシーサブセットに対して別々のLEMをトレーニングすると、深刻な組合せオーバーヘッドが発生する。
文脈学習手法はこの組み合わせのオーバーヘッドを克服する一方で、長期の文脈生成に関連するさらなる計算課題を導入している。
この課題に対処するため、我々は多国間コンプライアンスのための適応型ハイパーネットワークベースの統合フレームワークである \ours を提案する。
本フレームワークでは, 安全ポリシーをLoRAアダプタジェネレータにカスタマイズ可能な入力として機能し, 下流LEMに対するポリシー準拠のLoRA重みの生成を学習する。
LRMに追加されると、これらの重みは特定のポリシーサブセットに準拠した応答の生成を可能にする。
本研究では,そのようなハイパーネットワークのトレーニングによって,異なるサイズと異なる評価データセットの推論モデルにまたがるタスク性能を犠牲にすることなく,単一 LRM 上でのオンデマンドポリシー調整が可能になることを実証する。
このことは、LRMにおける適応型ハイパーネットワークベースのアライメントの有効性と実用性を強調している。
関連論文リスト
- Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models [63.70401095689976]
VLM(Vision-Language Models)は、医療や金融といったプライバシに敏感な分野において大きな可能性を秘めている。
ヘテロジニアスVLMのためのGRPOとMixture-of-Rewardsを組み合わせた協調アライメントフレームワークであるMoRを提案する。
MoRは、一般化とクロスクライアント適応性において、フェデレートされたアライメントベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-05T07:02:50Z) - Safe Multi-Agent Deep Reinforcement Learning for Privacy-Aware Edge-Device Collaborative DNN Inference [8.14391361533752]
本稿では,エッジデバイスとサーバ間で適応モデル分割を行う,プライバシ対応協調推論フレームワークを提案する。
本稿では,モデル配置,ユーザサーバアソシエーション,モデル分割,リソースアロケーションを統合したCMDP(Constrained Markov Decision Process)として共同問題を定式化する。
HC-MAPPO-Lは、エネルギー消費とプライバシコストのバランスを保ちながら、厳しい遅延制約を一貫して満たしていることを示す。
論文 参考訳(メタデータ) (2026-02-23T11:33:52Z) - MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - Collab: Controlled Decoding using Mixture of Agents for LLM Alignment [90.6117569025754]
人間のフィードバックからの強化学習は、大規模言語モデルを整合させる効果的な手法として現れてきた。
制御された復号化は、再訓練せずに推論時にモデルを整列するメカニズムを提供する。
本稿では,既存の既成のLCMポリシを活用するエージェントベースのデコーディング戦略の混合を提案する。
論文 参考訳(メタデータ) (2025-03-27T17:34:25Z) - AsymLoRA: Harmonizing Data Conflicts and Commonalities in MLLMs [5.018961516699825]
AsymLoRAは、知識のモジュール化と相互調整を統一するパラメータ効率のチューニングフレームワークである。
AsymLoRAは、共通点のみを捉えたバニラLoRAと、紛争のみに焦点を当てたLoRA-MoEの両方を一貫して上回っている。
論文 参考訳(メタデータ) (2025-02-27T12:21:02Z) - Low-Rank Agent-Specific Adaptation (LoRASA) for Multi-Agent Policy Learning [3.333453555166201]
マルチエージェント強化学習(MARL)は、効率的にスケールするために、エフェムパラメータ共有(PS)に依存することが多い。
我々は,各エージェントのポリシーを,共有バックボーンから微調整した特別タスクとして扱う新しいアプローチである textbfLow-Rank Agent-Specific Adaptation (LoRASA) を提案する。
我々は、StarCraft Multi-Agent Challenge (SMAC)やMulti-Agent MuJoCo (MAMuJoCo)といった挑戦的なベンチマークでLoRASAを評価する。
論文 参考訳(メタデータ) (2025-02-08T13:57:53Z) - Large Language Model driven Policy Exploration for Recommender Systems [50.70228564385797]
静的ユーザデータに基づいてトレーニングされたオフラインRLポリシは、動的オンライン環境にデプロイされた場合、分散シフトに対して脆弱である。
オンラインRLベースのRSも、トレーニングされていないポリシーや不安定なポリシーにユーザをさらけ出すリスクがあるため、運用デプロイメントの課題に直面している。
大規模言語モデル(LLM)は、ユーザー目標と事前学習ポリシーをオフラインで模倣する有望なソリューションを提供する。
LLMから抽出したユーザの嗜好を利用した対話型学習ポリシー(iALP)を提案する。
論文 参考訳(メタデータ) (2025-01-23T16:37:44Z) - HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning [72.25707314772254]
本稿では,各タスクに対するパラメータの最適な調和部分空間を特定するための新しいソリューションであるHarmoDT(Harmony Multi-Task Decision Transformer)を紹介する。
このフレームワークの上位レベルは、調和部分空間を規定するタスク固有のマスクの学習に特化しており、内部レベルは、統一されたポリシーの全体的なパフォーマンスを高めるためにパラメータの更新に重点を置いている。
論文 参考訳(メタデータ) (2024-05-28T11:41:41Z) - Personalized Reinforcement Learning with a Budget of Policies [9.846353643883443]
機械学習(ML)におけるパーソナライゼーションは、ユーザの個々の特性に対する決定をモデル化する。
本稿では,Markov Decision Processes (r-MDPs) に代表される新しいフレームワークを提案する。
r-MDPでは、少数の代表ポリシーとのインタラクションを通じて、それぞれ独自の嗜好を持つ多様なユーザ人口に対応する。
r-MDPを効率的に解くための2つの深層強化学習アルゴリズムを開発した。
論文 参考訳(メタデータ) (2024-01-12T11:27:55Z) - A State-Augmented Approach for Learning Optimal Resource Management
Decisions in Wireless Networks [58.720142291102135]
マルチユーザ無線ネットワークにおける無線リソース管理(RRM)問題について考察する。
目標は、ユーザのエルゴード平均パフォーマンスに制約を受けるネットワーク全体のユーティリティ機能を最適化することである。
本稿では, RRM の制約に対応する2変数の集合を入力として, 瞬時ネットワーク状態と並行して, RRM のパラメータ化を提案する。
論文 参考訳(メタデータ) (2022-10-28T21:24:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。