論文の概要: Structured World-State Reasoning for Agentic Robotic Search
- arxiv url: http://arxiv.org/abs/2609.23841v1
- Date: Sun, 20 Sep 2026 19:47:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 16:17:45.714423
- Title: Structured World-State Reasoning for Agentic Robotic Search
- Title(参考訳): エージェントロボット探索のための構造的世界状態推論
- Abstract要約: WORLDSは、地理空間的先行から永続的なグラフを推論し、知覚によって更新するフレームワークである。
WORLDSは5,311回のCityNavテストで51.8%のナビゲーション成功を達成した。
また、WORLDSを4乗子上で実演し、生成した検出経路を飛ばし、3つの言語目標をグラウンド化する。
- 参考スコア(独自算出の注目度): 19.734168080468706
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon robotic search must resolve natural language against heterogeneous, incomplete, and often ambiguous evidence: textual information, prior maps, and observations arriving over time. The core challenge is to contextualize these streams and decide where to gather evidence before selecting a target. We present WORLDS: World-state Observation and Reasoning for Language-guided Discovery and Search, a framework that grounds reasoning in a persistent graph initialized from geospatial priors and updated by perception. Parallel Reasoners maintain competing candidate interpretations and request evidence to distinguish between them. We collect and process the requested observations with a multimodal Examiner, after which a Judge selects a grounded target or requests another pass. WORLDS achieves 51.8% navigation success across all 5,311 CityNav test episodes, the highest reported success rate, exceeding the previous published best by 15.7 percentage points under an OSM-only, high-resolution orthographic protocol. On 1,000 shared episodes, it achieves 50.0% versus 27.9% for the strongest adapted baseline using the same model, prior, sensing stack, and movement budget. Observation-based verification by the Examiner contributes 5.9 points of this success, and at a reduced reasoning-effort setting WORLDS still exceeds the adapted GeoNav baseline by 18.8 points while generating fewer tokens. We also demonstrate WORLDS on a quadrotor, which flies the generated sensing waypoints and grounds three language targets, including a vehicle absent from the map, from its onboard imagery.
- Abstract(参考訳): ロングホライズン・ロボティック・サーチは、不均一で不完全で、しばしば曖昧な証拠であるテキスト情報、事前地図、時間とともにやってくる観察に対して、自然言語を解決しなければならない。
主な課題は、これらのストリームをコンテキスト化し、ターゲットを選択する前に証拠を集める場所を決定することである。
We present WORLDS: World-state Observation and Reasoning for Language-Guided Discovery and Search, a framework that basedsing in a persistent graph initialized from geospatial priors and updated by perception。
並列共振器は競合する解釈を維持し、両者を区別するために証拠を要求する。
我々は、要求された観察をマルチモーダル検査器で収集、処理し、その後、審査官が接地対象を選択したり、別のパスを要求する。
WORLDSは5,311のCityNavテストエピソードで51.8%のナビゲーション成功を達成し、最も成功したと報告されている。
1000回の共有エピソードでは、同じモデル、前のモデル、センシングスタック、移動予算を使った最強適応ベースラインの50.0%対27.9%を達成している。
Examinerによる観測に基づく検証はこの成功の5.9ポイントに寄与し、WORLDSは改良されたGeoNavベースラインを18.8ポイント上回り、トークンが少ない。
また、WORLDSは、生成した検出経路を飛行し、地図上にない車両を含む3つの言語目標を車載画像から示す。
関連論文リスト
- Map the Possibilities: Spatial Belief Fields for Language-Goal Aerial Navigation [49.03955946482723]
SBFNavは、言語条件付き空間的信念場を中心としたクローズドループナビゲーションフレームワークである。
主に観測されたことを記録しているエゴ中心の地図とは異なり、SBFレポジトリ-はタスク条件付き分布を可視な目標位置上で再送する。
SBFNavは、制御のためのメットリックなウェイポイントとして、命令と観察に最も適したゴールを選択する。
論文 参考訳(メタデータ) (2026-09-05T03:11:01Z) - GeoAgent: Evaluating VLM Geolocalization Through Embodied Navigation [1.7370190083648793]
現代のビジョンランゲージモデル(VLM)は、画像のジオローカライゼーションにおいて、人間のベースラインよりはるかに高い性能を発揮する。
我々は,エージェントがストリートビュー環境をナビゲートする必要があるエージェント環境ベースのベンチマークであるtextbfGeoAgentを紹介する。
我々の分析によると、現代のVLMは、国や大陸レベルでの予測を成功させながら、地域パターンの識別に苦慮している。
論文 参考訳(メタデータ) (2026-08-30T00:19:49Z) - ABot-N1: Toward a General Visual Language Navigation Foundation Model [27.085429358326504]
ABot-N1は、一般的なVisual Language Navigation基盤モデルへのステップである。
スロービジョン言語推論器は、画素ゴールを生成しながら明示的なChain-of-Thought推論を行う。
新しいベンチマークは、都市規模のナビゲーションの分野を前進させるためにオープンソースとしてリリースされている。
論文 参考訳(メタデータ) (2026-07-11T16:21:03Z) - ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation [53.95797153529148]
身体的エージェントは、主に部分的な自我中心の観測に依存するため、効率的なナビゲーションに苦しむことが多い。
本稿では,マルチモーダル大規模言語モデル(MLLM)と決定論的プランナを結合することにより,この理由に基づくパラダイムを運用する,人間にインスパイアされたフレームワークであるReasonNaviを紹介する。
論文 参考訳(メタデータ) (2026-01-26T19:09:20Z) - Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales [61.03549470159347]
視覚言語モデル (VLM) は急速に進歩しているが, オープンワールド環境における画像位置決め能力は, 網羅的に評価されていない。
我々は、視覚認識、ステップバイステップ推論、エビデンス利用を評価するVLM画像位置情報の総合ベンチマークであるEarthWhereを提示する。
論文 参考訳(メタデータ) (2025-10-13T01:12:21Z) - Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology [87.65242416688146]
TreeBenchは、ビジュアルグラウンド推論の診断ベンチマークである。
TreeVGRは、強化学習と共同でローカライゼーションと推論を監督する訓練パラダイムである。
論文 参考訳(メタデータ) (2025-07-10T17:59:58Z) - MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models [7.422346909538787]
MapEvalは、3つの異なるタスクにわたる基礎モデルを評価するために設計されたベンチマークである。
空間的関係、ナビゲーション、旅行計画、現実世界の地図の相互作用をカバーしている。
ロングコンテキスト推論、APIインタラクション、ビジュアルマップ分析を扱うモデルが必要です。
論文 参考訳(メタデータ) (2024-12-31T07:20:32Z) - PIGEON: Predicting Image Geolocations [44.99833362998488]
本稿では, セマンティックジオセル生成, マルチタスクコントラスト事前学習, 新たな損失関数を組み合わせた新しいジオローカライズシステムを提案する。
PIGEOTTOは、目に見えない場所に効果的に一般化する最初の画像ジオローカライズモデルである。
論文 参考訳(メタデータ) (2023-07-11T23:36:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。