論文の概要: SAIN: Structure-Aware Interactive Navigation with Active Dialogue Grounding for Mobile Robot
- arxiv url: http://arxiv.org/abs/2608.09196v1
- Date: Mon, 10 Aug 2026 07:08:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.121667
- Title: SAIN: Structure-Aware Interactive Navigation with Active Dialogue Grounding for Mobile Robot
- Title(参考訳): SAIN:移動ロボットのためのアクティブ対話グラウンドを用いた構造認識型対話ナビゲーション
- Abstract要約: 現実世界のロボットは、不明瞭、不明確、不完全な自然な人間の指示に遭遇することが多い。
対話型インスタンスゴールナビゲーション(IIGN)では、具体的エージェントがあいまいなカテゴリレベルの命令の下で特定のインスタンスを見つける必要がある。
アクティブ対話を永続的なナビゲーション状態に変換するゼロショットフレームワークであるSAINを提案する。
- 参考スコア(独自算出の注目度): 10.02850919496088
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most existing vision-language navigation tasks assume that instructions are complete and unambiguous. However, real-world robots often encounter natural human instructions that are ambiguous, underspecified, or incomplete, requiring them to resolve such uncertainties through active questioning. Interactive Instance Goal Navigation (IIGN) requires an embodied agent to find the specific instance under an ambiguous category-level instruction through active dialogue. However, existing dialogue-enabled methods often consume oracle answers as transient textual context for immediate decisions, rather than persistent spatial or object-centric structured state. We present SAIN, a zero-shot framework that turns active dialogue into persistent navigation state. Instead of consuming oracle answers as one-step text hints, SAIN compiles them into target evidence, route-level corridor memory, and object-candidate labels. These states are stored in structured value, room, graph, and object memories, then consumed by a unified policy for frontier ranking and final target approach. On the VL-LN IIGN benchmark, SAIN improves SR from 20.2 to 25.4 and SPL from 13.07 to 14.17 over the strongest reported dialogue-enabled baseline, while requiring no task-specific policy training. The results support dialogue-to-state conversion as an effective zero-shot mechanism for long-horizon interactive instance navigation. Project website: https://zorattc.github.io/SAIN/
- Abstract(参考訳): 既存の視覚言語ナビゲーションタスクの多くは、命令が完全で曖昧であると仮定している。
しかし、現実世界のロボットは、不明瞭、不明確、不完全な自然な人間の指示に遭遇し、活発な質問を通じてそのような不確実性を解決する必要がある。
対話型インスタンスゴールナビゲーション(IIGN)は、アクティブ対話を通じてあいまいなカテゴリレベルの命令の下で特定のインスタンスを見つけるために、エンボディエージェントを必要とする。
しかし、既存の対話可能な方法は、永続的な空間的あるいはオブジェクト中心の構造化状態ではなく、即時決定のための過渡的なテキストの文脈として、オラクルの回答をしばしば消費する。
アクティブ対話を永続的なナビゲーション状態に変換するゼロショットフレームワークであるSAINを提案する。
オラクルの回答をワンステップのテキストヒントとして使う代わりに、SAINはそれらを対象のエビデンス、ルートレベルの回廊メモリ、オブジェクト候補ラベルにコンパイルする。
これらの状態は構造化された値、部屋、グラフ、オブジェクトメモリに格納され、フロンティアランキングと最終ターゲットアプローチのための統一されたポリシーによって消費される。
VL-LN IIGNベンチマークにおいて、SAINはSRを20.2から25.4に改善し、SPLを13.07から14.17に改善した。
その結果,対話型インスタンスナビゲーションに有効なゼロショット機構として,対話型インスタンス変換がサポートされた。
プロジェクトウェブサイト: https://zorattc.github.io/SAIN/
関連論文リスト
- CoINS: Counterfactual Interactive Navigation via Skill-Aware VLM [13.352875026471445]
スキル認識型VLM(CoINS)による対物対話ナビゲーションを提案する。
我々は、スキルの余裕と具体的な制約パラメータを入力コンテキストに組み込んだ、InterNav-VLMというVLMを微調整する。
生成した高レベルプランを実行するために,強化学習による総合的なスキルライブラリを開発する。
論文 参考訳(メタデータ) (2026-01-07T14:10:46Z) - VL-LN Bench: Towards Long-horizon Goal-oriented Navigation with Active Dialogs [51.18508300818979]
Vision Language-Language Navigation (VL-LN)ベンチマークは、ダイアログ対応ナビゲーションモデルのトレーニングと評価のための大規模で自動生成されたデータセットを提供する。
VL−LNは、トレーニング用41k以上の長軸ダイアログ拡張軌道と、エージェントクエリに応答可能なオラクルを備えた自動評価プロトコルとを備える。
論文 参考訳(メタデータ) (2025-12-26T19:00:12Z) - Collaborative Instance Object Navigation: Leveraging Uncertainty-Awareness to Minimize Human-Agent Dialogues [54.81155589931697]
協調インスタンスオブジェクトナビゲーション(CoIN)は、エージェントがターゲットインスタンスに関する不確実性を積極的に解決する新しいタスク設定である。
未認識者に対するエージェント・ユーザインタラクション(AIUTA)の新たな学習自由化手法を提案する。
まず、オブジェクト検出時に、セルフクエチオナーモデルがエージェント内で自己対話を開始し、完全かつ正確な観察記述を得る。
インタラクショントリガーモジュールは、人間に質問するか、継続するか、ナビゲーションを停止するかを決定する。
論文 参考訳(メタデータ) (2024-12-02T08:16:38Z) - OpenObject-NAV: Open-Vocabulary Object-Oriented Navigation Based on Dynamic Carrier-Relationship Scene Graph [10.475404599532157]
本稿では、頻繁に使用されるオブジェクトと静的キャリアの関係をキャプチャする。
本稿では,ナビゲーションプロセスをマルコフ決定プロセスとしてモデル化するインスタンスナビゲーション戦略を提案する。
その結果,CRSGを更新することで,移動目標への移動を効率的に行うことができることがわかった。
論文 参考訳(メタデータ) (2024-09-27T13:33:52Z) - I2EDL: Interactive Instruction Error Detection and Localization [65.25839671641218]
連続環境(IVLN-CE)における対話型VLNの新たな課題を提案する。
これにより、VLN-CEナビゲーション中にエージェントがユーザと対話し、命令エラーに関する疑念を検証できる。
我々は、事前学習したモジュールを利用して命令エラーを検出し、テキスト入力と過去の観察を相互参照することで、命令中のそれらをピンポイントする。
論文 参考訳(メタデータ) (2024-06-07T16:52:57Z) - GOAT-Bench: A Benchmark for Multi-Modal Lifelong Navigation [65.71524410114797]
GOAT-BenchはユニバーサルナビゲーションタスクGO to AnyThing(GOAT)のベンチマークである。
GOATでは、エージェントはカテゴリ名、言語記述、イメージによって指定されたターゲットのシーケンスにナビゲートするように指示される。
我々はGOATタスク上でモノリシックなRLおよびモジュラーメソッドをベンチマークし、その性能をモダリティにわたって分析する。
論文 参考訳(メタデータ) (2024-04-09T20:40:00Z) - Think, Act, and Ask: Open-World Interactive Personalized Robot Navigation [17.279875204729553]
Zero-Shot Object Navigation (ZSON)は、エージェントが未知の環境でオープン語彙オブジェクトへナビゲートすることを可能にする。
ZIPONでは、ユーザーとの会話をしながら、ロボットがパーソナライズされた目標オブジェクトにナビゲートする必要がある。
我々は、知覚、ナビゲーション、コミュニケーションのための異なるモジュールを操作するためのシーケンシャルな決定を行うために、Open-woRld Interactive persOnalized Navigation (ORION)を提案する。
論文 参考訳(メタデータ) (2023-10-12T01:17:56Z) - $A^2$Nav: Action-Aware Zero-Shot Robot Navigation by Exploiting
Vision-and-Language Ability of Foundation Models [89.64729024399634]
本研究では,ゼロショット視覚言語ナビゲーション(ZS-VLN)の課題について検討する。
通常、命令は複雑な文法構造を持ち、しばしば様々な行動記述を含む。
これらのアクション要求を正しく理解し実行する方法は重要な問題であり、アノテーション付きデータがないため、さらに困難になる。
論文 参考訳(メタデータ) (2023-08-15T19:01:19Z) - ADAPT: Vision-Language Navigation with Modality-Aligned Action Prompts [92.92047324641622]
視覚言語ナビゲーション(VLN)のためのmodAlity-aligneD Action PrompT(ADAPT)を提案する。
ADAPTは、アクションレベルのモダリティアライメントの明示的な学習を可能にするために、アクションプロンプトをVLNエージェントに提供する。
R2RとRxRの両方の実験結果は、最先端手法よりもADAPTの方が優れていることを示している。
論文 参考訳(メタデータ) (2022-05-31T02:41:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。