Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution
Abstractの概要
Hydraは、リアルタイム制御を困難にしている生成型世界モデルと外部プランナー間の不整合に対処するために設計されたナビゲーション世界行動モデルです。視覚的観測、ロボットの姿勢、行動にわたる統一された潜在多様体を構築し、これらすべてのモダリティをベクトル量子化ボトルネックで圧縮することで、離散潜在空間内で直接プランニングを実行できるようにします。本手法はDiscrete Latent Planningを採用して学習済みのキノダイナミクス的意図を探索し、候補ごとにピクセルをデコードすることなく運動学的・知覚的コストで候補をランク付けします。実行時には、Hydraはフローマッチングを通じて選択された離散意図を滑らかな連続軌道へとマッピングし、論文ではプランニングおよび経路追従タスクにおいて実ロボット上でシステムを評価しています。
新規性
本論文の主な新規性は、単一のナビゲーション世界行動モデル内で離散潜在プランニングと連続フローマッチング実行を組み合わせた点にあります。そのプランナーは、連続的な外部サンプリングや画像空間でのスコアリングに依存するのではなく、ベクトル量子化された意図および視覚コードブックを用いて共有潜在多様体内で候補軌道を探索・評価します。
成果
動画予測において、Hydraは報告されたNWMベースラインよりも優れた時間的一貫性FVDを達成しつつ、100クリップ生成においてNWMより大幅に高速でした。実機での近距離プランニングでは、Hydraのプランニング時間はNWM/Bの500秒以上に対して約0.9秒で動作し、障害物のない試行で10/10、遮蔽および死角シナリオの両方で8/10の成功率を達成しました。Spotでの局所経路追従において、Hydraのガイダンスバリアントはより疎なウェイポイントガイダンスを用いているにもかかわらず複数のシナリオで反応型ベースラインと同等以上の結果を示しましたが、完全プランニングモードは長距離シナリオでやや劣りました。
論文の注目点
- Hydraは視覚、姿勢、行動を共有潜在表現に統合して将来の意図を離散化し、学習されたキノダイナミクス的プリミティブ上で直接プランニングを可能にします。
- 運動学的・知覚的コストは潜在空間の幾何学的、事前分布、エントロピー、および量子化シグナルを利用し、すべての候補をピクセルにデコードすることなく安全性と進捗をスコアリングします。
- 実ロボットでの実験により、連続世界モデルのベースラインと比較して大幅なプランニング速度の向上が示され、反応型ナビゲーションポリシーに対しても競争力のある経路追従性能が示されています。