論文の概要: Hierarchical Fast-Slow ReAct Agent for Zero-Shot Object-Goal Navigation
- arxiv url: http://arxiv.org/abs/2608.09816v2
- Date: Tue, 11 Aug 2026 09:19:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 16:08:30.750157
- Title: Hierarchical Fast-Slow ReAct Agent for Zero-Shot Object-Goal Navigation
- Title(参考訳): ゼロショット目標ナビゲーションのための階層型高速低速リアクトエージェント
- Authors: Zhaochen Lan, Zhi Yang, Yuxiang Fu, Mengxiang Lin,
- Abstract要約: ゼロショットのオブジェクトゴールナビゲーションでは、ロボットが入力したことのない建物の中で名前の付いたオブジェクトカテゴリーを見つける必要がある。
我々は、ロボットがすでに見たものを熟考の対象にするシステムを開発した。
我々のシステムは、HM3D v1 val valで68.75%、MP3Dで47.29%に達する。
- 参考スコア(独自算出の注目度): 3.8281938955545587
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Zero-shot object-goal navigation (ZSON) requires a robot to find a named object category in a building it has never entered. The prevailing approach scores frontiers with a vision-language value map: every decision is another argmax over the map as it currently stands, and the evidence behind that score is discarded the moment it is taken. Systems that place a large vision-language model inside the perception-action loop typically query it on a fixed schedule from the current view alone; a room the robot walked through minutes earlier is never reconsidered, and a failed call has no defined fallback. We turn what the robot has already seen into the object of deliberation. Our hierarchical fast-slow agent leaves the value-map controller running at every step and writes a coordinate-anchored memory as it moves: a semantic grid of room types and confirmed object instances, together with a bounded store of pose-tagged keyframes. A VLM screens each candidate detection before it is written. A deliberative layer reads this memory in a bounded reason-retrieve-act loop. It wakes on structural events the reactive layer computes, reasons first over text, and recalls a first-person view only for candidates that text alone cannot separate. Per-invocation and per-run caps bound its calls, a call-free first tier resolves the most frequent stall, and any failure returns control to the reactive controller. Our system reaches 68.75% SR on HM3D v1 val and 47.29% on MP3D val, the highest success rate among the zero-shot methods compared here. Choosing among far frontiers by argmax instead of deliberating costs 3.40 SR points in a paired comparison over all 2000 HM3D episodes (95% CI [1.70, 5.05]); deliberating over every frontier does not recover them.
- Abstract(参考訳): ゼロショットのオブジェクトゴールナビゲーション(ZSON)は、ロボットが入力したことのない建物の中で名前の付いたオブジェクトカテゴリーを見つける必要がある。
すべての決定は、現在あるマップ上の別のargmaxであり、そのスコアの背後にある証拠は、取られた瞬間に破棄される。
知覚行動ループ内に大きな視覚言語モデルを置くシステムは、通常、現在のビューのみから一定のスケジュールでクエリする;ロボットが数分前に歩いた部屋は、再考されることはない。
私たちは、ロボットがすでに見たものを熟考の対象にします。
我々の階層的な高速スローエージェントは、すべてのステップで実行されているバリューマップコントローラを残して、移動中に座標アンコールされたメモリを書きます。
VLMは、書き込み前に各候補検出をスクリーニングする。
デリバティブ・レイヤは、このメモリをバウンダリ-リトリーブ-アクティヴループで読み込む。
構造的なイベントを起動し、リアクティブ層が計算し、テキストよりもまず理由を判断し、テキストだけでは分離できない候補に対してのみ、一人称のビューをリコールする。
呼び出し毎と実行毎の上限は呼び出しをバインドし、コールフリーの第1層は最も頻繁なストールを解決し、障害はすべてリアクティブコントローラに制御を返す。
我々のシステムは、HM3D v1 valで68.75% SR、MP3D valで47.29%に達する。
2000年のHM3Dエピソード(95% CI [1.70, 5.05])に比較して、検討コスト3.40 SRポイントではなくargmaxで極端フロンティアを選択すると、すべてのフロンティア上での議論は回復しない。
関連論文リスト
- Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation [14.431337587744538]
ロングホライズン・ヒューマノイド・ロコ・マニピュレーション(Long-Horizon humanoid loco-manipulation)は、ロボットが作業対象を運動、接触、回復の至る所で永続的な物理的実体として扱うことを要求する。
RGB-D観測からロールインデクシングされた3Dオブジェクトの記録を保持するemphPersistent Object Tokenization (POT)を提案する。
emphPOT-VLAとして実装され、同じオブジェクトが条件アクションの生成を記録し、幾何学的述語チェックをサポートし、クローズドループ実行システムを生成する。
論文 参考訳(メタデータ) (2026-07-20T14:52:46Z) - Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving [9.75159490914078]
大規模言語モデルは、命令の追従とシーン推論をエンドツーエンドの駆動にもたらす。
既存のクローズドループエージェントはこのギャップを、別のシミュレーションティッチでモデルを呼び出すことで隠している。
この妥協を取り除いた高速スローアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-07-17T04:40:02Z) - REMIND: RE-Identification with Memory for INDoor Navigation [39.146761527401424]
モノクロRGB画像からの屋内ジェネリックオブジェクトの長期的多目的再識別のためのオンライントラッカー。
視覚的認知の証拠によって、人間は明示的な自己ローカライゼーションではなく、蓄積した外観の親しみと空間的コンテキストに依存している。
ScanNet++では、すべてのシーンで1つのエンドツーエンド検出を除いて、すべての設定で最高のIDF1を達成している。
論文 参考訳(メタデータ) (2026-07-10T10:30:50Z) - EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation [81.54723508469617]
EvoMemNavは、ゼロショットエンボディナビゲーションのための効率的で自己進化的できめ細かいメモリフレームワークである。
VSMGraphは、セマンティックキューとトポロジ的関係を持つビューをルームビューオブジェクト階層に整理する。
GOAT-BenchとHM3Dのオブジェクト、テキスト記述、画像ゴールのモダリティによる実験は、SR/SPLにおいて一貫した利得を示している。
論文 参考訳(メタデータ) (2026-06-02T11:27:44Z) - Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors [51.096845970243855]
高忠実度3Dデータの不足により,全体Humanoid-Object Interaction (HOI) がボトルネックとなる。
本研究では,ゼロショットHOIフレームワークであるImagine2Realを提案する。
論文 参考訳(メタデータ) (2026-05-21T10:15:39Z) - ChangingGrounding: 3D Visual Grounding in Changing Scenes [92.00984845186679]
現実世界のロボットは自然言語からオブジェクトをローカライズするが、周囲のシーンは変化し続けている。
既存の3Dビジュアルグラウンドティング(3DVG)手法のほとんどは、再構築された最新の点雲を前提としている。
エージェントが過去の観測をいかにうまく活用できるかを明示的に測定する最初のベンチマークであるChangeingGroundingを紹介します。
論文 参考訳(メタデータ) (2025-10-16T17:59:16Z) - CabiNet: Scaling Neural Collision Detection for Object Rearrangement
with Procedural Scene Generation [54.68738348071891]
私たちはまず、さまざまな日常環境において、650万以上の散らばったシーン(前よりも桁違いに多い)を生成します。
このデータから合成部分点雲をレンダリングし、それをCabiNetモデルアーキテクチャのトレーニングに使用します。
CabiNetは、オブジェクトとシーンポイントの雲を受け入れる衝突モデルである。
論文 参考訳(メタデータ) (2023-04-18T21:09:55Z) - Negative Frames Matter in Egocentric Visual Query 2D Localization [119.23191388798921]
最近リリースされたEgo4Dデータセットとベンチマークは、一人称視覚知覚データを大幅にスケールし、多様化している。
Visual Queries 2Dローカライゼーションタスクは、1対1の視点で記録された過去に存在するオブジェクトを検索することを目的としている。
本研究は,Epsodic Memoryベンチマークで導入された3段階ベースラインに基づく。
論文 参考訳(メタデータ) (2022-08-03T09:54:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。