論文の概要: UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation
- arxiv url: http://arxiv.org/abs/2607.06537v2
- Date: Sat, 11 Jul 2026 15:47:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 13:33:35.675392
- Title: UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation
- Title(参考訳): UniLM-Nav: ゼロショットラストミルナビゲーションのための統一フレームワーク
- Abstract要約: ゼロショットオープン語彙ラストマイルナビゲーションのためのフレームワークであるUniLM-Navを提案する。
UniLM-Navは、ラストマイルナビゲーションをビューセレクション、タスク条件付きアベイランスグラウンド、基本目的推論に分解する。
OVMMベンチマークでUniLM-Navを評価し,従来の最先端手法であるMoToを3.13ポイント上回る性能を示した。
- 参考スコア(独自算出の注目度): 42.39025692205837
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mobile manipulation requires a robot to navigate to a target object or receptacle and then perform intended manipulation. However, reaching the vicinity of the target does not guarantee a manipulation-ready base pose, a problem known as last-mile navigation. Prior methods for last-mile navigation either rely on manual pose annotation or task-specific training, limiting their scalability to open-vocabulary settings with fine-grained spatial constraints. We propose UniLM-Nav, a unified framework for zero-shot open-vocabulary last-mile navigation. UniLM-Nav decomposes last-mile navigation into view selection, task-conditioned affordance grounding, and geometry-aware base-pose reasoning, all resolved with a shared multimodal large language model (MLLM) backend. Specifically, UniLM-Nav first selects a reference view that best captures the target object or receptacle from recently collected observations. It then grounds task-relevant affordance point in the selected view and lifts the result into the robot-centric coordinate frame. Finally, conditioned on the grounded affordance, task context, and robot geometry, it infers a manipulation-ready base pose for the robot. We evaluate UniLM-Nav on the OVMM benchmark, where it outperforms the previous state-of-the-art method, MoTo, by 3.13 percentage points. Analyses show that the components of our method are crucial to final performance, and that the choice of MLLM also has a substantial effect. We further deploy UniLM-Nav on a Unitree B2 quadruped robot with a 6-DoF Unitree Z1 manipulator, validating its applicability to real-world mobile manipulation tasks.
- Abstract(参考訳): 移動操作には、ロボットが対象物や受容器に移動し、意図した操作を行う必要がある。
しかし、目標付近に到達しても操作可能なベースポーズは保証されない。
ラストマイルナビゲーションの以前の方法は、手動のポーズアノテーションやタスク固有のトレーニングに依存しており、そのスケーラビリティは、きめ細かい空間的制約のあるオープン語彙設定に制限されている。
ゼロショットオープン語彙ラストマイルナビゲーションのための統合フレームワークUniLM-Navを提案する。
UniLM-Navは、ラストマイルナビゲーションをビューセレクション、タスク条件付きアベイランスグラウンド、ジオメトリ対応のベースポジション推論に分解し、すべてMLLM(Multimodal Large Language Model)バックエンドで解決する。
特に、UniLM-Navは、最近収集された観測から対象物や受容体を最もよく捉えた参照ビューを最初に選択する。
そして、選択されたビューにタスク関連価格ポイントを置き、その結果をロボット中心の座標フレームに持ち上げる。
最後に、条件付き価格、タスクコンテキスト、ロボットの幾何学に基づいて、ロボットの操作可能なベースポーズを推測する。
我々はOVMMベンチマークでUniLM-Navを評価し,従来の最先端手法であるMoToを3.13ポイント上回る性能を示した。
分析の結果,本手法の構成要素は最終性能に不可欠であり,MLLMの選択にも大きな影響があることが示唆された。
さらに、UniLM-Navを6-DoFのUnitree Z1マニピュレータを備えたUnitree B2四脚ロボットにデプロイし、実際のモバイル操作タスクへの適用性を検証する。
関連論文リスト
- SSMG-Nav: Enhancing Lifelong Object Navigation with Semantic Skeleton Memory Graph [13.132353682972315]
textitSemantic Memory Graph (SSMG)上に構築されたオブジェクトナビゲーションのためのフレームワークであるSSMG-Navを紹介する。
SSMGは過去の観測を、トポロジカル・キーポイントによって固定された空間的に整列された永続記憶に集約する。
各サブグラフに対して、メモリから合成されたマルチモーダルプロンプトがVLMを誘導し、目的地に対する目標信念を推測する。
論文 参考訳(メタデータ) (2026-03-02T12:48:00Z) - ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation [53.95797153529148]
身体的エージェントは、主に部分的な自我中心の観測に依存するため、効率的なナビゲーションに苦しむことが多い。
本稿では,マルチモーダル大規模言語モデル(MLLM)と決定論的プランナを結合することにより,この理由に基づくパラダイムを運用する,人間にインスパイアされたフレームワークであるReasonNaviを紹介する。
論文 参考訳(メタデータ) (2026-01-26T19:09:20Z) - Learning Category-level Last-meter Navigation from RGB Demonstrations of a Single-instance [5.161531917413708]
ほとんどのRGBベースのナビゲーションシステムは、粗いメートルレベルの精度しか保証していない。
このギャップは、操作ポリシーがトレーニングデモの配布内で動作することを防ぐ。
我々は、ラストメーターナビゲーションのためのオブジェクト中心の模倣学習フレームワークを導入する。
論文 参考訳(メタデータ) (2025-12-11T23:35:05Z) - MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation [46.30498198691935]
MoMa-Kitchenは、最適な最終ナビゲーション位置を学習するためのトレーニングモデルのためのベンチマークデータセットである。
視覚データは、ロボットアームに取り付けられた1人称ビューカメラによってキャプチャされたRGB-D入力から収集される。
提案手法は,異なるアームタイプとプラットフォームの高さに対応する,アベイランスに基づく最終的な位置決めの学習を可能にする。
論文 参考訳(メタデータ) (2025-03-14T04:47:38Z) - TopV-Nav: Unlocking the Top-View Spatial Reasoning Potential of MLLM for Zero-shot Object Navigation [52.422619828854984]
MLLMをベースとしたTopV-Navを提案する。
MLLMの空間推論能力をトップビューで完全に解き放つために,適応型視覚プロンプト生成法(AVPG)を提案する。
論文 参考訳(メタデータ) (2024-11-25T14:27:55Z) - SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation [83.4599149936183]
既存のゼロショットオブジェクトナビゲーション手法は、空間的に閉じたオブジェクトのテキストでLCMをプロンプトする。
本稿では,3次元シーングラフを用いて観察されたシーンを表現することを提案する。
我々は,MP3D,HM3D,RoboTHOR環境において,SG-Navが従来のゼロショット法を10%以上のSRで上回る大規模な実験を行った。
論文 参考訳(メタデータ) (2024-10-10T17:57:19Z) - Can an Embodied Agent Find Your "Cat-shaped Mug"? LLM-Guided Exploration
for Zero-Shot Object Navigation [58.3480730643517]
言語駆動型ゼロショットオブジェクトゴールナビゲーション(L-ZSON)のための新しいアルゴリズムLGXを提案する。
このアプローチでは、このタスクにLarge Language Models(LLM)を使用します。
現状のゼロショットオブジェクトナビゲーションをRoboTHOR上で実現し,現在のベースラインよりも27%以上の成功率(SR)向上を実現した。
論文 参考訳(メタデータ) (2023-03-06T20:19:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。