論文の概要: Which Preferences to Train On? End-to-End Multi-Objective Alignment with an Adversarial Preference Distribution
- arxiv url: http://arxiv.org/abs/2610.04845v1
- Date: Sun, 04 Oct 2026 01:09:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 08:30:33.172631
- Title: Which Preferences to Train On? End-to-End Multi-Objective Alignment with an Adversarial Preference Distribution
- Title(参考訳): トレーニングのどちらが望ましいか? 逆選好分布を用いたエンドツーエンド多目的アライメント
- Abstract要約: 多目的アライメント(MOA)は、大きな言語モデル(LLM)と人間の値との整合性の問題に対処する。
我々は,MOAを選好分布のミニマックス問題として定式化し,RLを用いて単一プロンプト条件のポリシーをエンドツーエンドに学習するMAESTROを提案する。
HH-RLHF、ビーバータイルズ(BeaverTails)、および要約タスクでは、最大3つの目標を持つMAESTROは、1回のトレーニング実行において、比較した手法の中で最低のトレーニングコストで、ほとんどのタスクにおいて最高の最前線に達する。
- 参考スコア(独自算出の注目度): 44.320242052146796
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Aligning large language models (LLMs) with human values is important for safe, efficient, and beneficial AI deployment. However, human values are multifaceted: helpfulness, harmlessness and humor trade off against one another, and different users want different trade-offs. Multi-objective alignment (MOA) addresses this by training a policy that can provide any point of the Pareto front, but existing methods either train one model per preference, interpolate a few separately aligned experts post hoc, or train a single conditioned model without considering which preferences it should be trained on. Since the hard regions of the preference simplex depend on the objectives at hand, existing methods leave them under-trained and do not get the most out of a single model. Therefore, we propose MAESTRO (Multi-objective Alignment via End-to-end STeering and Robust Optimization), which formulates MOA as a minimax problem over preference distributions and trains a single prompt-conditioned policy end-to-end with RL against an adversarial preference distribution: a Dirichlet distribution updated by online mirror descent toward the preferences the current policy serves worst, rather than on a fixed one. On HH-RLHF, BeaverTails and a summarization task, with up to three objectives, MAESTRO attains the best Pareto front on most tasks in a single training run, at the lowest training cost among the compared methods. The largest margins appear in the hard regions that a fixed preference distribution leaves under-trained, confirming that a single prompt-conditioned model is capable of covering the objective trade-offs on its own.
- Abstract(参考訳): 大規模な言語モデル(LLM)を人間の価値で調整することは、安全で効率的で有益なAIデプロイメントにとって重要である。
しかし、人間の価値は多面的だ:有益性、無害性、ユーモアは互いに引き離され、異なるユーザーは異なるトレードオフを求めている。
マルチオブジェクトアライメント(MOA)は、Paretoフロントの任意のポイントを提供するポリシーをトレーニングすることでこの問題に対処するが、既存の方法は、好みごとに1つのモデルをトレーニングするか、いくつかの個別のアライメントした専門家をホック後にインターポートするか、あるいは、どの好みをトレーニングすべきかを考慮せずに単一の条件付きモデルをトレーニングする。
好みの単純さの硬い領域は、手元にある目的に依存しているため、既存の手法は訓練を受けていないままにし、単一のモデルから最大限のものを得られない。
そこで,MAESTRO (Multi-objective Alignment via End-to-end STeering and Robust Optimization) を提案し,MOAを選好分布よりもミニマックス問題として定式化し,一方の条件付きポリシをRLでエンドツーエンドにトレーニングする。
HH-RLHF、ビーバータイルズ(BeaverTails)および要約タスクでは、最大3つの目標を持つMAESTROは、比較手法の中で最低の訓練コストで、単一のトレーニングランでほとんどのタスクにおいて最高のパレートを達成している。
固定された嗜好分布が未学習のまま残る硬い地域では最大のマージンが現れ、単一のプロンプト条件モデルが目的のトレードオフを自身でカバーできることを確認した。
関連論文リスト
- Post Hoc Extraction of Pareto Fronts for Continuous Control [1.0705399532413618]
現実世界のエージェントはしばしば、連続制御における速度、安定性、エネルギー効率などの複数の目的のバランスをとる必要がある。
条件や好みを変えるために、エージェントは、複数の最適なトレードオフを表すポリシーのパレートフロンティアを理想的に学ぶ必要がある。
近年の多目的強化学習(MORL)の進歩により,パレートフロントを直接学習することが可能になるが,訓練開始時から完全に多目的的考察が必要である。
論文 参考訳(メタデータ) (2026-03-03T05:57:59Z) - Robust Preference Alignment via Directional Neighborhood Consensus [13.313830197011983]
本稿では,指向性近傍のコンセンサスを利用したポストホックなトレーニングフリー手法であるRobust Preference Selection(RPS)を紹介する。
RPSは、関連する好みの地域からの複数の応答をサンプリングし、優れた候補プールを作成する。
本研究は, 嗜好整合モデルの信頼性を高めるための, 実用的, 理論的に基礎的なソリューションを提案する。
論文 参考訳(メタデータ) (2025-10-23T12:39:20Z) - A Minimaximalist Approach to Reinforcement Learning from Human Feedback [49.45285664482369]
人間のフィードバックから強化学習を行うアルゴリズムとして,SPO(Self-Play Preference Optimization)を提案する。
我々のアプローチは、報酬モデルや不安定な敵の訓練を必要としないという点で最小主義である。
我々は,一連の継続的制御タスクにおいて,報酬モデルに基づくアプローチよりもはるかに効率的に学習できることを実証した。
論文 参考訳(メタデータ) (2024-01-08T17:55:02Z) - Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization [76.09576643028362]
複数のアライメント目的に対してMODPO(Multi-Objective Direct Preference Optimization)を提案する。
MODPOは、言語モデリングを直接報酬モデルに折り畳み、暗黙の集団報酬モデルとして言語モデルを訓練する。
理論的には MORLHF と同じ最適解が得られるが、実質的にはより安定で効率的である。
論文 参考訳(メタデータ) (2023-10-05T17:35:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。