論文の概要: Multi-Objective Exploration and Preference Optimization via Mutual Information
- arxiv url: http://arxiv.org/abs/2607.01392v2
- Date: Fri, 03 Jul 2026 09:34:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 13:04:58.457237
- Title: Multi-Objective Exploration and Preference Optimization via Mutual Information
- Title(参考訳): 相互情報を用いた多目的探索と選好最適化
- Authors: Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuang Huang, Deqing Wang, Jianxin Li, Shuangyong Song,
- Abstract要約: 情報理論フレームワークMI-EPO(Multi-Objective Exploration and Optimization Preference)を提案する。
MI-EPOは、生成した応答、嗜好フィードバック、選好ベクトルのジョイント条件相互情報を最大化することにより、多目的探索とアライメントを統一する。
安全なアライメントと補助的アシスタントタスクの実験により、MI-EPOは生成した応答と選好ベクトルとのアライメントを著しく改善することが示された。
- 参考スコア(独自算出の注目度): 28.76886053636383
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Aligning large language models with diverse and heterogeneous human values requires multi-objective alignment methods to effectively trade off conflicting preference dimensions. Current methods achieve this trade-off by training policies conditioned on preference vectors and leveraging online direct preference optimization. However, exploration uncertainty can cause the reward distributions of responses generated under different preference vectors to overlap, and the generated responses may fail to effectively align with the corresponding preference vectors. In this paper, we propose Multi-Objective Exploration and Preference Optimization via Mutual Information (MI-EPO), an information-theoretic framework. It unifies multi-objective exploration and alignment by maximizing the joint conditional mutual information among generated responses, preference feedback, and preference vectors. By incorporating a probabilistic routing mechanism, MI-EPO naturally decomposes objective alignment and preference-aware exploration, encouraging the model to generate responses that are distinguishable and aligned with different preference conditions. Experiments on safe alignment and helpful assistant tasks show that MI-EPO significantly improves the alignment between generated responses and preference vectors, makes the outputs more controllable, and achieves stable trade-offs across multiple objectives.
- Abstract(参考訳): 多様な異質な人間の価値を持つ大きな言語モデルを調整するには、矛盾する好みの次元を効果的に取り除くための多目的アライメント手法が必要である。
現在の手法は、嗜好ベクトルを条件としたトレーニングポリシーと、オンラインの直接選好最適化を活用することで、このトレードオフを実現する。
しかし、探索の不確実性は、異なる選好ベクトルの下で生成された応答の報酬分布が重複し、生成された応答は対応する選好ベクトルと効果的に一致しない可能性がある。
本稿では,情報理論フレームワークMI-EPOによる多目的探索と参照最適化を提案する。
生成した応答、選好フィードバック、選好ベクトルのジョイント条件相互情報を最大化することにより、多目的探索とアライメントを統一する。
確率的ルーティング機構を導入することで、MI-EPOは自然に客観的アライメントと選好意識の探索を分解し、異なる選好条件に適合する応答を生成するようモデルに促す。
安全なアライメントと補助的タスクの実験により、MI-EPOは生成した応答と選好ベクトルのアライメントを著しく改善し、出力をより制御しやすくし、複数の目的に対して安定したトレードオフを実現する。
関連論文リスト
- MGDA-Decoupled: Geometry-Aware Multi-Objective Optimisation for DPO-based LLM Alignment [6.301256425456381]
幾何学に基づく多目的最適化アルゴリズムMGDA-Decoupledを導入する。
それぞれの目的の収束ダイナミクスを明示的に説明しながら、共通の降下方向を見つける。
UltraFeedbackデータセットの実験では、MGDA-Decoupledがゴールデンレスポンスに対して最高勝利率を達成した。
論文 参考訳(メタデータ) (2026-04-22T15:33:45Z) - Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment [74.25832963097658]
マルチオブジェクトアライメント(MOA)は、応答を複数の人間の嗜好目標に合わせることを目的としている。
DPOをベースとしたMOAアプローチは、データに広範囲にわたる優先的対立に悩まされている。
論文 参考訳(メタデータ) (2025-02-20T08:27:00Z) - Controllable Preference Optimization: Toward Controllable Multi-Objective Alignment [103.12563033438715]
人工知能におけるアライメントは、モデル応答と人間の好みと値の一貫性を追求する。
既存のアライメント技術は、主に一方向であり、様々な目的に対して、最適以下のトレードオフと柔軟性の低下につながる。
制御可能な選好最適化(CPO)を導入し、異なる目的に対する選好スコアを明確に指定する。
論文 参考訳(メタデータ) (2024-02-29T12:12:30Z) - Bayesian Inverse Transfer in Evolutionary Multiobjective Optimization [29.580786235313987]
InvTrEMO(InvTrEMO)の第1回リバーストランスファー・マルチオブジェクト(InvTrEMO)を紹介する。
InvTrEMOは、決定空間がタスク間で正確に整合していない場合でも、多くの一般的な領域で共通の目的関数を利用する。
InvTrEMOは、高い精度の逆モデルを重要な副産物とし、オンデマンドで調整されたソリューションの生成を可能にする。
論文 参考訳(メタデータ) (2023-12-22T14:12:18Z) - Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization [76.09576643028362]
複数のアライメント目的に対してMODPO(Multi-Objective Direct Preference Optimization)を提案する。
MODPOは、言語モデリングを直接報酬モデルに折り畳み、暗黙の集団報酬モデルとして言語モデルを訓練する。
理論的には MORLHF と同じ最適解が得られるが、実質的にはより安定で効率的である。
論文 参考訳(メタデータ) (2023-10-05T17:35:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。