論文の概要: NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation
- arxiv url: http://arxiv.org/abs/2607.14643v1
- Date: Thu, 16 Jul 2026 07:10:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.020409
- Title: NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation
- Title(参考訳): NavCMPO: 適応ナビゲーションのための批判ガイド付き平均フローポリシー最適化
- Abstract要約: 本稿では,2段階の適応ナビゲーションフレームワークであるNavCMPOについて紹介する。
InternVLA-N1ベンチマークの一致したトレーニング予算の下で、NavCMPOは平均74.7%の成功率に達し、再トレーニングされたNavDPベースラインを6.4ポイント上回る。
- 参考スコア(独自算出の注目度): 8.749359019282508
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: End-to-end diffusion-based policies have demonstrated strong performance in mapless visual navigation, but their iterative denoising process introduces substantial inference latency, while behavior cloning limits performance to the quality of expert demonstrations. We present NavCMPO, a two-stage adaptive navigation framework that combines few-step MeanFlow trajectory generation, critic-guided refinement, and reinforcement learning fine-tuning. During pre-training, an obstacle proximity prediction task encourages the visual representation to capture obstacle-aware spatial information. To compensate for the degradation in obstacle avoidance caused by few-step generation, Critic-Guided Trajectory Refinement (CGTR) uses gradients from a critic trained with obstacle-point-cloud supervision to refine intermediate trajectories. During adaptation, the MeanFlow policy is fine-tuned using Proximal Policy Optimization with behavior-cloning regularization, while the critic is updated to accommodate embodiment-specific observation changes. Under a matched training budget on the InternVLA-N1 benchmark, NavCMPO achieves an average success rate of 74.7\%, exceeding the retrained NavDP baseline by 6.4 percentage points, while reducing inference latency from 85\,ms to 60\,ms. Experiments on a Unitree Go2 further demonstrate effective sim-to-real transfer.
- Abstract(参考訳): エンドツーエンドの拡散ベースのポリシは、マップレスビジュアルナビゲーションにおいて強力なパフォーマンスを示しているが、反復的なデノナイジングプロセスは、相当な推論レイテンシを持ち込み、振る舞いのクローン化は、専門家によるデモンストレーションの品質にパフォーマンスを制限している。
本稿では,2段階の適応ナビゲーションフレームワークであるNavCMPOについて紹介する。
事前学習中、障害物近接予測タスクは、障害物認識空間情報を捕捉する視覚的表現を促進する。
CGTR(Critical-Guided Trajectory Refinement)は、障害物点雲の監視を訓練した批評家の勾配を利用して、中間軌道を洗練させる。
適応中、MeanFlowポリシーは、行動閉ざされた正規化を伴うプロキシポリシー最適化を使用して微調整され、批判者は、エンボディメント固有の観察変化に対応するように更新される。
InternVLA-N1ベンチマークの一致したトレーニング予算の下で、NavCMPOは74.7\%の平均的な成功率を達成し、再トレーニングされたNavDPベースラインを6.4ポイント越え、推論遅延を85\,msから60\,msに削減した。
Unitree Go2の実験では、より効果的なsim-to-real転送が示されている。
関連論文リスト
- An Adaptive Fixed-Time Line-of-Sight Guidance Scheme for 3D Path Following of Underwater Vehicles: Theory and Experiment [2.202253618096515]
本稿では,AUVの3次元経路追跡のための頑健な固定時間適応誘導フレームワークを提案する。
また、カーブした経路におけるトラッキング性能を改善するために、時間変化のルックアヘッド機構も導入されている。
論文 参考訳(メタデータ) (2026-09-13T19:42:16Z) - RoamFlow: Reinforcement-Aligned One-Step Action MeanFlow Policy for Image-Goal Navigation [15.931984448913264]
RoamFlowは、MeanFlowを利用して軌道合成の平均速度場を予測する生成ナビゲーションフレームワークである。
Habitatシミュレーションと実世界のロボットプラットフォームの両方の実験では、RoamFlowは、リアルタイムの制約下で強力なナビゲーション性能を維持しながら、効率的な推論を実現している。
論文 参考訳(メタデータ) (2026-06-29T08:10:43Z) - LNN-Fly: Continuous-Time UAV Navigation for Robust Obstacle Avoidance under Timing Mismatch [17.86034589419106]
LNN-Flyは、LiDARベースのUAV障害物回避のための連続時間ナビゲーションポリシーである。
テスト環境では障害物回避性能が向上し、制御周波数の低減、スパース観測、制御周期ジッタに対する耐性が向上した。
屋内での周波数クロスワールドテストでは、20回の飛行で100%成功している。
論文 参考訳(メタデータ) (2026-06-27T09:26:22Z) - A Heuristic Approach for Performance Tuning in RL-based Quadrotor Control via Reward Design and Termination Conditions [14.576960188691215]
強化学習(Reinforcement Learning, RL)に基づく四角形制御ポリシは、乱雑な環境での高速ナビゲーションやドローンレースといったタスクにおいて、優れたパフォーマンスを実現している。
報奨設計と終了条件を用いて,RLに基づくクアドロータ制御におけるチューニング可能な性能を実現するための新しい手法を提案する。
論文 参考訳(メタデータ) (2026-05-18T22:40:30Z) - Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization [69.03519018775779]
グループ相対政策最適化は、ビデオ拡散モデルと人間の嗜好の整合に不可欠である。
既存の効率の手法は、最適化を妥協し、深刻な不安定を示し、完全な軌道性能に到達できなかった。
Flash-GRPOは,低計算予算下でのアライメント品質において,完全な軌道学習よりも優れた1ステップのトレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-05-15T14:13:39Z) - SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data [49.370849653460716]
本稿では,アクタに整列したオフポリシー評価信号を用いたSOPEを,自動早期停止機構として提案する。
Minariベンチマークスイートから25の継続的制御タスクを評価した。
SOPEはベースライン性能を最大45.6%改善し、必要なTFLOPを最大22倍改善した。
論文 参考訳(メタデータ) (2026-05-07T08:32:09Z) - Beyond Imitation: Reinforcement Learning Fine-Tuning for Adaptive Diffusion Navigation Policies [31.52910494173408]
拡散に基づくロボットナビゲーションポリシーは、ロボットの視覚的観察から直接マルチモーダルな軌道を生成することができる。
拡散型ナビゲーションに適した強化学習フレームワークを提案する。
提案手法は, 衝突頻度を低減しつつ, 52.0%から58.7%, SPLを0.49から0.54に改善する。
論文 参考訳(メタデータ) (2026-03-13T10:14:32Z) - Spatially-Aware Adaptive Trajectory Optimization with Controller-Guided Feedback for Autonomous Racing [74.83272587893508]
本稿では,NURBSに基づく軌道表現,CMA-ESグローバル軌道最適化,コントローラ誘導空間フィードバックを組み合わせた自律レースライン最適化フレームワークを提案する。
シミュレーションでは,最大静的加速度をパラメータ化したコントローラと比較して17.38%のラップタイム短縮を実現している。
高摩擦から低摩擦まで様々なタイヤ化合物で試験された実ハードウェアでは、摩擦を明示的にパラメータ化することなく、7.60%のラップタイムの改善が得られる。
論文 参考訳(メタデータ) (2026-02-17T15:10:44Z) - DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation [73.80968452950854]
Vision-Language Navigation in Continuous Environments (VLN-CE) は、エージェントが自由形式の3D空間を通して自然言語の指示に従う必要がある。
既存のVLN-CEアプローチは通常、2段階のウェイポイント計画フレームワークを使用する。
本稿では,エンドツーエンド最適化VLN-CEポリシとしてDAgger Diffusion Navigation (DifNav)を提案する。
論文 参考訳(メタデータ) (2025-08-13T02:51:43Z) - Gaussian Process Regression for Improved Underwater Navigation [13.221163846643607]
ドップラー速度ログ(DVL)は通常、速度測定によってこのドリフトを緩和するために使用される。
本稿では、DVL速度推定を改善するために、多出力ガウス過程回帰(MOGPR)に基づくデータ駆動方式を提案する。
提案手法を実世界のAUVデータを用いて評価し,LSと最先端のディープラーニングモデルであるBeamsNetと比較した。
論文 参考訳(メタデータ) (2025-02-23T09:13:41Z) - StreamYOLO: Real-time Object Detection for Streaming Perception [84.2559631820007]
将来を予測する能力を備えたモデルを提供し、ストリーミング知覚の結果を大幅に改善する。
本稿では,複数の速度を駆動するシーンについて考察し,VasAP(Velocity-Awared streaming AP)を提案する。
本手法は,Argoverse-HDデータセットの最先端性能を実現し,SAPとVsAPをそれぞれ4.7%,VsAPを8.2%改善する。
論文 参考訳(メタデータ) (2022-07-21T12:03:02Z) - Extrapolation for Large-batch Training in Deep Learning [72.61259487233214]
我々は、バリエーションのホストが、我々が提案する統一されたフレームワークでカバー可能であることを示す。
本稿では,この手法の収束性を証明し,ResNet,LSTM,Transformer上での経験的性能を厳格に評価する。
論文 参考訳(メタデータ) (2020-06-10T08:22:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。