論文の概要: Preference-Agile Multi-Objective Optimization for Real-time Vehicle Dispatching
- arxiv url: http://arxiv.org/abs/2604.10664v1
- Date: Sun, 12 Apr 2026 14:39:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.159727
- Title: Preference-Agile Multi-Objective Optimization for Real-time Vehicle Dispatching
- Title(参考訳): リアルタイム自動車ディスパッチのためのアジャイル多目的最適化
- Authors: Jiahuan Jin, Wenhao Zhao, Rong Qu, Jianfeng Ren, Xinan Chen, Qingfu Zhang, Ruibin Bai,
- Abstract要約: そこで本論文では,ユーザの嗜好を動的に調整し,インタラクティブにアサインできるようにするために,PAMOO(Reference-agile Multi-Objective Optimization)を提案する。
コンテナ端末における実生活車両の派遣問題に対する挑戦実験により, PAMOOは優れた性能と一般化能力が得られることを示した。
- 参考スコア(独自算出の注目度): 30.864388536113797
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Multi-objective optimization (MOO) has been widely studied in literature because of its versatility in human-centered decision making in real-life applications. Recently, demand for dynamic MOO is fast-emerging due to tough market dynamics that require real-time re-adjustments of priorities for different objectives. However, most existing studies focus either on deterministic MOO problems which are not practical, or non-sequential dynamic MOO decision problems that cannot deal with some real-life complexities. To address these challenges, a preference-agile multi-objective optimization (PAMOO) is proposed in this paper to permit users to dynamically adjust and interactively assign the preferences on the fly. To achieve this, a novel uniform model within a deep reinforcement learning (DRL) framework is proposed that can take as inputs users' dynamic preference vectors explicitly. Additionally, a calibration function is fitted to ensure high quality alignment between the preference vector inputs and the output DRL decision policy. Extensive experiments on challenging real-life vehicle dispatching problems at a container terminal showed that PAMOO obtains superior performance and generalization ability when compared with two most popular MOO methods. Our method presents the first dynamic MOO method for challenging \rev{dynamic sequential MOO decision problems
- Abstract(参考訳): 多目的最適化(MOO)は、人間中心の意思決定において、現実の応用において汎用性があることから、文献で広く研究されている。
近年、動的MOOの需要は、異なる目的に対する優先順位のリアルタイムな調整を必要とする厳しい市場ダイナミクスのために急速に増大している。
しかし、既存のほとんどの研究は、実用的でない決定論的MOO問題や、現実の複雑さに対処できない非逐次動的MOO決定問題に焦点を当てている。
これらの課題に対処するために、ユーザが動的に調整し、対話的に選好をオンザフライで割り当てるように、選好型多目的最適化(PAMOO)を提案する。
これを実現するために,ユーザの動的嗜好ベクトルを明示的に入力できる,深層強化学習(DRL)フレームワークにおける一様モデルを提案する。
また、選好ベクトル入力と出力DRL判定ポリシーとの間の高品質なアライメントを確保するために校正機能を設ける。
コンテナ端末における実生活車両派遣問題に対する大規模な実験により, PAMOOは2つの最も一般的なMOO手法と比較して, 優れた性能と一般化能力が得られることが示された。
提案手法は, 動的逐次MOO決定問題に挑戦する最初の動的MOO法である。
関連論文リスト
- PCHC: Enabling Preference Conditioned Humanoid Control via Multi-Objective Reinforcement Learning [50.63196995993855]
多目的強化学習(MORL)を活用してPCHC(Preference-Conditioned Humanoid Control)を実現する新しいフレームワークを提案する。
当社のフレームワークは、単一の嗜好条件のポリシーを多種多様な行動を示すために有効である。
論文 参考訳(メタデータ) (2026-03-25T07:55:37Z) - Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation [60.33386541343322]
本稿では,Hardness-Aware とNoNoRec (HaNoRec) を併用したマルチモーダル大規模言語モデルフレームワークを提案する。
具体的には、HaNoRecは、各トレーニングサンプルの予測硬度とポリシーモデルのリアルタイム応答性の両方に基づいて、最適化重量を動的に調整する。
論文 参考訳(メタデータ) (2025-11-24T04:10:46Z) - Pareto Multi-Objective Alignment for Language Models [7.9051473654430655]
大規模言語モデル(LLM)は、複数の、しばしば矛盾する、目的の慎重なバランスを必要とする現実世界のアプリケーションに、ますます多くデプロイされている。
LLMにおける多目的アライメント(MOA)を明示的に設計するアルゴリズムを提案する。
PAMAは、マルチオブジェクトRLHFをクローズドフォームソリューションで凸最適化に変換し、スケーラビリティを大幅に向上させる。
論文 参考訳(メタデータ) (2025-08-11T08:54:14Z) - RAG/LLM Augmented Switching Driven Polymorphic Metaheuristic Framework [5.10888539576355]
Polymorphic Metaheuristic Framework (PMF) は、リアルタイムパフォーマンスフィードバックと動的アルゴリズム選択によって駆動される自己適応型メタヒューリスティックスイッチング機構である。
AIによる意思決定と自己修正メカニズムを統合することで、PMFはスケーラブルでインテリジェントで自律的な最適化フレームワークの道を開いた。
論文 参考訳(メタデータ) (2025-05-20T01:41:22Z) - Robust Multi-Objective Preference Alignment with Online DPO [6.434799451791957]
多目的選好アライメントは、パーソナライズ可能で、有用で、安全であるAIシステムの開発に不可欠である。
既存のアプローチは、トレーニングに計算コストがかかるか、モデル動作を十分に制御できないかのいずれかである。
本稿では,多目的オンラインDPOアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-03-01T02:01:49Z) - UCB-driven Utility Function Search for Multi-objective Reinforcement Learning [51.00436121587591]
マルチオブジェクト強化学習(MORL)エージェントでは、意思決定行動の最適化を行う。
重みベクトル w でパラメトリした線型効用関数の場合に焦点を当てる。
学習過程の異なる段階で最も有望な重みベクトルを効率的に探索する上信頼境界に基づく手法を提案する。
論文 参考訳(メタデータ) (2024-05-01T09:34:42Z) - Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment [46.44464839353993]
リワード・イン・コンテキスト(Rewards-in-Context, RiC)を導入する。
RiCは単一のファンデーションモデルの教師付き微調整のみを必要とし、推論時間中にユーザの好みを動的に調整する。
論文 参考訳(メタデータ) (2024-02-15T18:58:31Z) - PD-MORL: Preference-Driven Multi-Objective Reinforcement Learning
Algorithm [0.18416014644193063]
本稿では,連続ロボット作業にスケーラブルな選好空間全体をカバーするために,単一のユニバーサルネットワークをトレーニングする新しいMORLアルゴリズムを提案する。
PD-MORLは、連続制御タスクに挑戦するために最大25%大きなハイパーボリュームを達成する。
論文 参考訳(メタデータ) (2022-08-16T19:23:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。