論文の概要: MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality
- arxiv url: http://arxiv.org/abs/2607.12965v1
- Date: Tue, 14 Jul 2026 17:04:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.231951
- Title: MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality
- Title(参考訳): MAMMOTH: オフロードモビリティロバストによるモダリティの欠如に対するマルチモーダルエンドツーエンドポリシ
- Abstract要約: MAMMOTH(MAMMOTH)は、オフロード・ゴール・コンディショナリなナビゲーションと、非ダイレクトな探索のための統合されたエンドツーエンドナビゲーションポリシーである。
具体的には、MAMMOTHはマルチモーダル観測(RGB、サーマル、3Dポイントクラウド、エゴ速度)を効率的に融合させ、モダリティ・ドロップアウト・スキームで訓練する。
その結果, 衝突回避, 地形を考慮した計画, 欠落モードへの一般化など, 優れた性能を示すことができた。
- 参考スコア(独自算出の注目度): 5.507970541170981
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable autonomous navigation in unstructured off-road environments remains a critical unsolved challenge due to extreme terrain diversity, drastic illumination variations and acute sensor degradation. Recent developments have approached the problem as a traversability costmap estimation or visual navigation task. However, many exhibit heavy reliance on RGB modality, leading to poor performance in varied illumination such as glares, shadows or low ambient light. Achieving robust generalization in such conditions requires integrating modalities that provide supplementary scene information. Such multi-modal methods suffer from a rigid dependency on the presence of near-perfect sensor inputs, leaving them unable to robustly handle sensor degradation or individual modality failure. To address these limitations, we introduce MAMMOTH (MAsking Multi-Modal inputs for Off-road Traversability Heuristic-informed navigation), a unified end-to-end navigation policy for robust off-road visual-goal-conditioned navigation and undirected exploration. Specifically, MAMMOTH efficiently fuses multi-modal observations (RGB, Thermal, 3D Pointcloud and Ego Velocity) and is trained with a modality dropout scheme, enabling it to generalize to missing modalities at inference time. Furthermore, we employ a diffusion policy to learn the joint conditional probability distribution of physically-grounded trajectories and a intrinsic traversability heuristic. MAMMOTH utilizes this heuristic to prefer safer, smoother trajectories. We validate MAMMOTH through extensive real-world robot experiments in distinct off-road environments, including night-time operation. Our results demonstrate superior performance, with significant improvements in collision avoidance, terrain-aware planning and generalization to missing modalities. The code and dataset used for this work will be made publicly available.
- Abstract(参考訳): 未構造化のオフロード環境における信頼性の高い自律航法は、極端な地形の多様性、急激な照明のバリエーション、急性のセンサー劣化のために、重要な未解決の課題である。
近年,トラバーサビリティのコストマップ推定や視覚ナビゲーションタスクとして,この問題にアプローチしている。
しかし、多くの人はRGBのモダリティに大きく依存しており、フレア、シャドウ、低環境光といった様々な照明の性能は低い。
このような条件下で堅牢な一般化を実現するには、補助的なシーン情報を提供するモダリティを統合する必要がある。
このようなマルチモーダル手法は、ほぼ完全なセンサー入力の存在に厳格な依存を被り、センサーの劣化や個々のモダリティの失敗に頑健に対処することができない。
これらの制約に対処するため,我々はMAMMOTH (Masking Multi-Modal inputs for Off-road Traversability Heuristic-informed Navigation)を導入した。
具体的には、MAMMOTHはマルチモーダル観測(RGB、サーマル、3Dポイントクラウド、エゴ速度)を効率的に融合させ、モーダリティ・ドロップアウト・スキームで訓練し、推論時に欠落モードに一般化することができる。
さらに,拡散ポリシを用いて,物理的に接地した軌道の連接状態の確率分布と,本質的な可逆性ヒューリスティックを学習する。
MAMMOTHはこのヒューリスティックを利用して、より安全で滑らかな軌道を好んでいる。
我々は,夜間動作を含む異なるオフロード環境における実世界のロボット実験を通じて,MAMMOTHを検証する。
その結果, 衝突回避, 地形を考慮した計画, 欠落モードへの一般化など, 優れた性能を示すことができた。
この作業に使用されるコードとデータセットが公開される予定だ。
関連論文リスト
- CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving [15.316817374554828]
Cruiseは、新しい不確実性を認識したクロスモーダルセンサー融合フレームワークである。
視覚言語モデル(VLM)誘導UQモジュールを統合し、細粒度でピクセルレベルの不確実性推定を生成する。
我々は、モジュール間の依存関係を明示的にモデル化し、キャプチャする動的適応機構を導入する。
論文 参考訳(メタデータ) (2026-08-10T07:17:00Z) - UNSEEN: Uncertainty-aware Navigation via Sparse Estimation in Unknown Environments [5.893948403053389]
視覚のみのナビゲーションは軽量な代替手段だが、動作のぼやけ、テクスチャの低さ、照明の変更により性能が著しく低下する。
UNSEENは、フロントマウントカメラのみを使用して、位置決め、マッピング、計画を明確に組み合わせた、統一された不確実性と認識を意識したナビゲーションフレームワークである。
論文 参考訳(メタデータ) (2026-06-18T07:54:07Z) - A CLIP-based Uncertainty Modal Modeling (UMM) Framework for Pedestrian Re-Identification in Autonomous Driving [6.223368492604449]
Uncertainty Modal Modeling (UMM) フレームワークは、マルチモーダルトークンマッパー、合成モダリティ強化戦略、およびクロスモーダルキュー対話型学習器を統合している。
UMMは、不確実なモード条件下で強い堅牢性、一般化、および計算効率を達成する。
論文 参考訳(メタデータ) (2025-08-15T04:50:27Z) - What You Have is What You Track: Adaptive and Robust Multimodal Tracking [72.92244578461869]
本研究では,時間的に不完全なマルチモーダルデータを用いたトラッカー性能に関する総合的研究を行った。
我々のモデルは9つのベンチマークでSOTA性能を達成し、従来の完全性と欠落したモダリティ設定の両方で優れている。
論文 参考訳(メタデータ) (2025-07-08T11:40:21Z) - TOMD: A Trail-based Off-road Multimodal Dataset for Traversable Pathway Segmentation under Challenging Illumination Conditions [17.019567722324666]
このような環境に特化して設計された包括的データセットであるTrail-based Off-road Multimodal dataset (TOMD)を紹介する。
TOMDは、128チャンネルのLiDAR、ステレオ画像、IMU、照明測定を含む高忠実なマルチモーダルセンサーデータを備えている。
また,正確な経路予測のための動的マルチスケールデータ融合モデルを提案する。
論文 参考訳(メタデータ) (2025-06-24T23:58:44Z) - Easy-Poly: A Easy Polyhedral Framework For 3D Multi-Object Tracking [23.40561503456164]
複数のオブジェクトカテゴリを対象としたリアルタイムフィルタベースの3DMOTフレームワークであるEasy-Polyを提案する。
結果は,Poly-MOTやFast-Polyといった最先端の手法よりも優れていることを示す。
これらの知見は、多様なシナリオにおけるEasy-Polyの適応性と堅牢性を強調している。
論文 参考訳(メタデータ) (2025-02-25T04:01:25Z) - PFSD: A Multi-Modal Pedestrian-Focus Scene Dataset for Rich Tasks in Semi-Structured Environments [73.80718037070773]
本稿では, 半構造化シーンに, nuScenesの形式を付加したマルチモーダルなPedestrian-Focused Sceneデータセットを提案する。
また,密集・隠蔽シナリオにおける歩行者検出のためのHMFN(Hybrid Multi-Scale Fusion Network)を提案する。
論文 参考訳(メタデータ) (2025-02-21T09:57:53Z) - Multi-Modality Driven LoRA for Adverse Condition Depth Estimation [61.525312117638116]
逆条件深さ推定のためのMulti-Modality Driven LoRA(MMD-LoRA)を提案する。
Prompt Driven Domain Alignment (PDDA) と Visual-Text Consistent Contrastive Learning (VTCCL) の2つのコアコンポーネントで構成されている。
nuScenesとOxford RobotCarデータセットの最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2024-12-28T14:23:58Z) - Drive Anywhere: Generalizable End-to-end Autonomous Driving with
Multi-modal Foundation Models [114.69732301904419]
本稿では、画像とテキストで検索可能な表現から、運転決定を提供することができる、エンドツーエンドのオープンセット(環境/シーン)自律運転を適用するアプローチを提案する。
当社のアプローチでは, 多様なテストにおいて非並列的な結果を示すと同時に, アウト・オブ・ディストリビューションの状況において, はるかに高いロバスト性を実現している。
論文 参考訳(メタデータ) (2023-10-26T17:56:35Z) - SHIFT: A Synthetic Driving Dataset for Continuous Multi-Task Domain
Adaptation [152.60469768559878]
ShiFTは、自動運転のための最大規模のマルチタスク合成データセットである。
曇り、雨と霧の強さ、昼の時間、車と歩行者の密度を個別に連続的に変化させる。
私たちのデータセットとベンチマークツールキットはwww.vis.xyz/shift.comで公開されています。
論文 参考訳(メタデータ) (2022-06-16T17:59:52Z) - Drone-based RGB-Infrared Cross-Modality Vehicle Detection via
Uncertainty-Aware Learning [59.19469551774703]
ドローンによる車両検出は、空中画像中の車両の位置とカテゴリーを見つけることを目的としている。
我々はDroneVehicleと呼ばれる大規模ドローンベースのRGB赤外線車両検出データセットを構築した。
私たちのDroneVehicleは28,439RGBの赤外線画像を収集し、都市道路、住宅地、駐車場、その他のシナリオを昼から夜までカバーしています。
論文 参考訳(メタデータ) (2020-03-05T05:29:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。