論文の概要: A New Trajectory-Oriented Approach to Enhancing Comprehensive Crowd Navigation Performance
- arxiv url: http://arxiv.org/abs/2512.06608v1
- Date: Sun, 07 Dec 2025 00:52:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:40.178407
- Title: A New Trajectory-Oriented Approach to Enhancing Comprehensive Crowd Navigation Performance
- Title(参考訳): 包括的群集ナビゲーション性能向上のための軌道指向型アプローチ
- Abstract要約: 群集のナビゲーションは近年、かなりの研究の関心を集めている。
現在のDRLアプローチは一般的に効率と快適さを優先している。
本稿では,軌道曲率最適化を明確に強調する新たな報酬形成戦略を提案する。
- 参考スコア(独自算出の注目度): 28.07757592239467
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Crowd navigation has garnered considerable research interest in recent years, especially with the proliferating application of deep reinforcement learning (DRL) techniques. Many studies, however, do not sufficiently analyze the relative priorities among evaluation metrics, which compromises the fair assessment of methods with divergent objectives. Furthermore, trajectory-continuity metrics, specifically those requiring $C^2$ smoothness, are rarely incorporated. Current DRL approaches generally prioritize efficiency and proximal comfort, often neglecting trajectory optimization or addressing it only through simplistic, unvalidated smoothness reward. Nevertheless, effective trajectory optimization is essential to ensure naturalness, enhance comfort, and maximize the energy efficiency of any navigation system. To address these gaps, this paper proposes a unified framework that enables the fair and transparent assessment of navigation methods by examining the prioritization and joint evaluation of multiple optimization objectives. We further propose a novel reward-shaping strategy that explicitly emphasizes trajectory-curvature optimization. The resulting trajectory quality and adaptability are significantly enhanced across multi-scale scenarios. Through extensive 2D and 3D experiments, we demonstrate that the proposed method achieves superior performance compared to state-of-the-art approaches.
- Abstract(参考訳): 群集ナビゲーションは近年、特に深層強化学習(DRL)技術の普及により、かなりの研究関心を集めている。
しかし、多くの研究は評価指標間の相対的優先順位を十分に分析していないため、異なる目的を持つ手法の公平な評価が損なわれる。
さらに、軌道連続度(特にC^2$の滑らかさを必要とするもの)はめったに組み込まれない。
現在のDRLアプローチは一般に効率性と近接快適さを優先し、軌跡最適化を無視したり、単純で無効な滑らかさ報酬によってのみ対処する。
それでも、自然性の確保、快適性の向上、航法システムのエネルギー効率の最大化には効果的な軌道最適化が不可欠である。
これらのギャップに対処するために,複数の最適化目標の優先順位付けと共同評価を検証し,ナビゲーション手法の公平かつ透明な評価を可能にする統一的なフレームワークを提案する。
さらに、軌道曲率最適化を明確に強調する新たな報酬形成戦略を提案する。
結果として得られる軌道品質と適応性は、マルチスケールシナリオで大幅に向上する。
提案手法は,2次元および3次元の広範囲な実験により,最先端の手法に比べて優れた性能が得られることを示す。
関連論文リスト
- Rethinking Learnability in Offline Data-driven Optimization [20.146021332129703]
Black-Box Optimization (BBO)は、現実世界の問題がますます複雑化するにつれて効率上の課題に直面している。
データ駆動最適化は、データから学習することでBBOの効率を改善する最も一般的なパラダイムである。
多くのオフライン最適化手法が提案されているが、根本的な疑問は未解決のままである。
論文 参考訳(メタデータ) (2026-09-01T16:22:28Z) - Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations [98.44542103979735]
勾配勾配降下法(SGD)とアダム(Adam)による1次勾配勾配降下法は、現代の訓練パイプラインの基礎となる。
大規模モデルトレーニング、厳格なプライバシ要件、分散学習パラダイムは、プライバシ保護とメモリ効率に関する従来のアプローチにおける重要な制限を明らかにする。
深層学習最適化アルゴリズムの進化軌道を振り返って分析し、様々なモデルアーキテクチャやトレーニングシナリオの主流を包括的に評価する。
我々は、重要な新興トレンドと基本設計のトレードオフを抽出し、将来の研究の有望な方向性を示唆する。
論文 参考訳(メタデータ) (2026-04-14T17:01:36Z) - HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving [51.268878540511054]
我々は階層的拡散政策を備えたエンドツーエンドの計画フレームワークであるHADを提案する。
我々は,NAVSIMとHUGSIMの両方でHADが新たな最先端性能を実現することを示す。
論文 参考訳(メタデータ) (2026-04-04T04:12:47Z) - Divergence Minimization Preference Optimization for Diffusion Model Alignment [66.31417479052774]
Divergence Minimization Preference Optimization (DMPO) は、逆KL分散を最小化して拡散モデルを整列する原理的手法である。
DMPOは、異なるベースモデルとテストセットで既存のテクニックを一貫して上回り、適合させることができる。
論文 参考訳(メタデータ) (2025-07-10T07:57:30Z) - Preference Optimization for Combinatorial Optimization Problems [54.87466279363487]
強化学習(Reinforcement Learning, RL)は、ニューラルネットワーク最適化のための強力なツールとして登場した。
大幅な進歩にもかかわらず、既存のRLアプローチは報酬信号の減少や大規模な行動空間における非効率な探索といった課題に直面している。
統計的比較モデルを用いて定量的報酬信号を定性的選好信号に変換する新しい手法であるPreference Optimizationを提案する。
論文 参考訳(メタデータ) (2025-05-13T16:47:00Z) - A Survey of Direct Preference Optimization [103.59317151002693]
LLM(Large Language Models)は、前例のない生成能力を示す。
人的価値との整合性は、有用で無害なデプロイメントを保証する上で、依然として重要です。
直接優先度最適化(DPO)は、最近、合理化された代替案として注目されている。
論文 参考訳(メタデータ) (2025-03-12T08:45:15Z) - Continual Optimization with Symmetry Teleportation for Multi-Task Learning [73.28772872740744]
マルチタスク学習(MTL)は、1つのモデルを用いて複数のタスクの同時学習を可能にする。
シンメトリ・テレポーテーション(COST)を用いた連続最適化に基づく新しい手法を提案する。
COSTは、競合の勾配を減らすために、損失ランドスケープに別の損失等価点を求める。
論文 参考訳(メタデータ) (2025-03-06T02:58:09Z) - Analyzing and Bridging the Gap between Maximizing Total Reward and Discounted Reward in Deep Reinforcement Learning [17.245293915129942]
最適目的は強化学習(RL)の基本的側面である
総リターンは理想的であるが、割引リターンはその安定性のために現実的な目的である。
目的を整合させる2つの方法を提案する。
論文 参考訳(メタデータ) (2024-07-18T08:33:10Z) - Preference-Guided Reinforcement Learning for Efficient Exploration [14.058764537783086]
LOPE: textbfLearning textbfOnline with trajectory textbfPreferencedanctextbfE, a end-to-end preference-guided RL framework。
我々の直感では、LOPEは人的フィードバックをガイダンスとして考慮し、オンライン探索の焦点を直接調整する。
LOPEは収束率と全体的な性能の点で、最先端のいくつかの手法より優れている。
論文 参考訳(メタデータ) (2024-07-09T02:11:12Z) - Deep Pareto Reinforcement Learning for Multi-Objective Recommender Systems [54.2484458418885]
複数の目的を同時に最適化することは、レコメンデーションプラットフォームにとって重要なタスクです。
既存の多目的推薦システムは、そのような動的な関係を体系的に考慮していない。
論文 参考訳(メタデータ) (2024-07-04T02:19:49Z) - Adaptive trajectory-constrained exploration strategy for deep
reinforcement learning [6.589742080994319]
深層強化学習 (DRL) は, まばらさや虚偽の報奨や大きな状態空間を持つタスクにおいて, ハード探索問題に対処する上で, 重大な課題に直面している。
DRLの最適軌道制約探索法を提案する。
2つの大きな2次元グリッドワールド迷路と複数のMuJoCoタスクについて実験を行った。
論文 参考訳(メタデータ) (2023-12-27T07:57:15Z) - Confidence-Controlled Exploration: Efficient Sparse-Reward Policy Learning for Robot Navigation [72.24964965882783]
強化学習(RL)はロボットナビゲーションにおいて有望なアプローチであり、ロボットは試行錯誤を通じて学習することができる。
現実世界のロボットタスクは、しばしばまばらな報酬に悩まされ、非効率な探索と準最適政策に繋がる。
本稿では,RLに基づくロボットナビゲーションにおいて,報酬関数を変更せずにサンプル効率を向上させる新しい手法であるConfidence-Controlled Exploration (CCE)を紹介する。
論文 参考訳(メタデータ) (2023-06-09T18:45:15Z) - Reinforcement Learning to Optimize the Logistics Distribution Routes of
Unmanned Aerial Vehicle [0.0]
本稿では,複数のノフライゾーンを含む複雑な環境下でUAVの経路計画を実現するための改良手法を提案する。
その結果,このような複雑な状況に適応するモデルの有効性と効率性が示された。
論文 参考訳(メタデータ) (2020-04-21T09:42:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。