論文の概要: A Better Spur Should Start From Each Objective
- arxiv url: http://arxiv.org/abs/2609.08211v1
- Date: Tue, 08 Sep 2026 03:50:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.570461
- Title: A Better Spur Should Start From Each Objective
- Title(参考訳): より優れたスパーはそれぞれの目的から始めるべきだ
- Abstract要約: 実世界の多目的強化学習(MORL)は、しばしばまばらな報酬、報奨紛争、後期的な報奨綱引きに悩まされる。
本稿では,データ,勾配,制約レベルに介入する細粒度フレームワークであるMMPOを提案する。
実世界のeコマースデータセットの実験は、MMPOがトレーニングの安定性を改善し、競合するメトリクス間でのより良いパフォーマンスを一貫して軽減していることを示している。
- 参考スコア(独自算出の注目度): 12.849739663589316
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-world Multi-Objective Reinforcement Learning (MORL) often suffers from sparse rewards, reward conflicts, and late-stage reward tug-of-war, causing traditional linear scalarization to experience severe metric oscillations. To address optimization conflicts among multiple objectives in real-world deployment scenarios, we propose Multi-Marginal Preference Optimization (MMPO), a fine-grained framework that intervenes at the data, gradient, and constraint levels rather than relying on coarse-grained global scalarization. Specifically, MMPO performs exposure debiasing to mitigate sparse and biased rewards, applies priority-aware orthogonal projection to decouple conflicting gradients, and introduces self-prompted gradient constraints to prevent dominant objectives from overwhelming weaker ones. Experiments on real-world e-commerce datasets show that MMPO improves training stability and consistently achieves better performance across conflicting metrics. Moreover, it generalizes robustly to broader tasks such as ToolRL and code generation, demonstrating its effectiveness as a practical paradigm for multi-objective alignment.
- Abstract(参考訳): 実世界の多目的強化学習(MORL)は、しばしばスパース報酬、報酬相反、後期報酬の綱引きに悩まされ、伝統的な線形スカラー化は深刻なメートル法振動を経験する。
実世界の展開シナリオにおける複数の目的間の最適化競合を解決するために,大まかなグローバルスキャラライゼーションに頼るのではなく,データ,勾配,制約レベルに介入する細粒度フレームワークであるMulti-Marginal Preference Optimization (MMPO)を提案する。
特に、MMPOは、スパースと偏りの報酬を緩和するために露光脱バイアスを行い、対立する勾配を分離するために優先に配慮した直交射影を適用し、支配的な目的を圧倒的に弱いものから防ぐために、自発勾配制約を導入している。
実世界のeコマースデータセットの実験では、MMPOはトレーニングの安定性を改善し、競合するメトリクス間のパフォーマンスを一貫して向上させる。
さらに、ToolRLやコード生成といったより広範なタスクに対して堅牢に一般化し、多目的アライメントの実践的パラダイムとしての有効性を示す。
関連論文リスト
- Multi-Objective Reference-Aligned Machine Unlearning [0.6299766708197883]
機械学習は、モデルの有用性を維持しながら、特定のトレーニングサンプルの影響を取り除くことを目的としている。
既存の単目的のアプローチ、例えば昇華やランダムレバーベリングは、しばしば矛盾する最適化のダイナミクスと非有界な忘れの目的のために、忘れを誘発する。
本稿では, 損失を, 忘れられたサンプルに対する予測の有界なKLアライメントに置き換えることで, 忘れと保持を共同で最適化する多目的フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-29T22:32:40Z) - Towards Universal Physical Adversarial Attacks via a Joint Multi-Objective and Multi-Model Optimization Framework [9.467008278776063]
本稿では,JMOF(Joint Multi-Objective and Multi-Model Optimization Framework)を提案する。
JMOF内では、二重レベル機構が予測出力を共同で抑制し、中間特徴分布を平坦化し、攻撃効率と深い一般化のバランスをとる。
実験により、JMOFは様々なブラックボックス検出器に対して最先端のベースラインを上回っていることが示された。
この研究は、物理的な敵攻撃の一般化限界を推し進め、現実世界のデプロイメントにおける視覚的AI脆弱性を評価するための堅牢なフレームワークを提供する。
論文 参考訳(メタデータ) (2026-05-18T02:44:54Z) - TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment [52.570581883709345]
本稿では,報酬を人間レベルの報酬分布マッチングに置き換えるトラジェクティブマッチングポリシバランス最適化(TMPO)を提案する。
TMPOは最先端の手法に対する生成的多様性を9.1%向上させ、下流および効率の指標で競合性能を達成する。
大規模フロープレフィックスのマルチトラックトレーニング時間を短縮するため、TMPOはDynamic Tree Smplingモデルを導入し、動的にスケジュールされたステップでトラジェクトリがdenoisingとブランチを共有する。
論文 参考訳(メタデータ) (2026-05-09T04:41:02Z) - Revitalizing the Beginning: Avoiding Storage Dependency for Model Merging in Continual Learning [57.10440766103372]
Trajectory Regularized Merging (TRM) は、拡張されたトラジェクトリ部分空間内の最適化プロセスとしてマージフェーズを再構成するフレームワークである。
本フレームワークは,タスクアライメント,予測整合性,勾配応答性といった3つの相乗的目標を統合し,統合モデルの履歴安定性と再活性化最適化のダイナミクスを同時に保存する。
論文 参考訳(メタデータ) (2026-05-08T14:07:32Z) - Reward-free Alignment for Conflicting Objectives [12.275610380458119]
我々は、競合対象(RACO)に対するリワードフリーアライメントフレームワークを提案する。
RACOはペアワイズ選好データを直接利用し、競合-逆勾配勾配の新たなクリッピング変種を通じて勾配衝突を解消する。
ユーザが指定した目標重みを尊重するパレート臨界点に対する収束保証を行い、クリッピングが2目的設定における収束率を厳密に改善できることを示す。
論文 参考訳(メタデータ) (2026-02-02T18:59:52Z) - MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization [56.074760766965085]
大規模言語モデル(LLM)の整合性のための効率的なパラダイムとしてグループ相対政策最適化が登場している。
我々は,報酬スカラー化を動的潜在ポリシーとして扱い,モデルの終端隠蔽状態を意味的ボトルネックとして活用するMAESTROを提案する。
本稿では,軽量コンダクタネットワークがメタリワード信号としてグループ相対的優位性を生かしてポリシと共進化する,双方向最適化フレームワークにおけるコンテキスト的帯域幅問題としてこれを定式化する。
論文 参考訳(メタデータ) (2026-01-12T05:02:48Z) - GARDO: Reinforcing Diffusion Models without Reward Hacking [54.841464430913476]
オンライン強化学習(RL)による微調整拡散モデルにより,テキストと画像のアライメントが向上する可能性が示された。
このミスマッチは、しばしば報酬のハッキングにつながり、プロキシスコアは増加し、実際の画像品質は低下し、生成の多様性は崩壊する。
我々は、サンプル効率、効率的な探索、報酬ハッキングの軽減という競合する要求に対処するため、Gated and Adaptive Regularization with Diversity-Aware Optimization (GARDO)を提案する。
論文 参考訳(メタデータ) (2025-12-30T10:55:45Z) - Variance Reduced Policy Gradient Method for Multi-Objective Reinforcement Learning [0.0]
多目的強化学習(MORL)は、従来の強化学習(RL)の一般化である
目的を非線形スカラー化関数を用いて組み合わせるMORLの問題点を考察する。
この問題を解決しようとする以前の試みは過度に厳密な仮定に依存しており、大規模な状態対応空間への拡張性におけるPGMの利点を失う。
論文 参考訳(メタデータ) (2025-08-14T12:52:57Z) - Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes [50.544186914115045]
大きな言語モデル(LLM)は、日々のアプリケーションにますます組み込まれています。
個人ユーザの多様な嗜好との整合性を確保することは、重要な課題となっている。
数発のステアライメントのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-18T16:14:59Z) - Conflict-Averse Gradient Aggregation for Constrained Multi-Objective Reinforcement Learning [13.245000585002858]
多くの実世界の応用において、強化学習(RL)エージェントは、複数の目的を考慮し、安全ガイドラインに従うべきである。
制約付き多目的勾配集約アルゴリズム(Constrained Multi-Objective Gradient Aggregator, CoGAMO)を提案する。
論文 参考訳(メタデータ) (2024-03-01T04:57:13Z) - Beyond Losses Reweighting: Empowering Multi-Task Learning via the Generalization Perspective [61.10883077161432]
マルチタスク学習(MTL)は、共有バックボーンを使用して複数の目的を同時に最適化するために、ディープニューラルネットワークを訓練する。
本稿では,重み摂動を利用して勾配ノルムを規制し,一般化を改善する新しいMTLフレームワークを提案する。
本手法は,タスク性能とモデル全体のロバスト性の観点から,既存の勾配に基づくMTL技術よりも大幅に優れる。
論文 参考訳(メタデータ) (2022-11-24T17:19:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。