論文の概要: Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos
- arxiv url: http://arxiv.org/abs/2608.16476v1
- Date: Mon, 17 Aug 2026 12:15:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.677239
- Title: Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos
- Title(参考訳): In-the-Wild Video によるスケーラブルな学習による都市ナビゲーションにおけるロングテールの抽出
- Authors: Bingyi Xia, Han Bao, Zhewei Chen, Hanjing Ye, Jingwen Yu, Yuhan Pang, Wenjun Xu, Jiankun Wang,
- Abstract要約: 我々は,Webスケールのインザワイルド・エゴセントリックなビデオからポイントゴール・アーバンナビゲーションを学習するためのフレームワークを提案する。
このフレームワークは、未処理のWebビデオにメトリックな軌跡と構造化されたナビゲーションセマンティクスで自動的に注釈を付ける。
Webビデオデータと実世界の都市ナビゲーションタスクの実験は、制約のないビデオからの効果的な知識伝達を実証している。
- 参考スコア(独自算出の注目度): 5.797135182843089
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learning embodied urban navigation policies from real-world data is constrained by the cost of task-specific data collection and the limited coverage of rare yet safety-critical scenarios. To address these challenges, we present a scalable framework for learning point-goal urban navigation from web-scale in-the-wild egocentric videos while systematically exposing its long tail. The framework automatically annotates uncurated web videos with metric trajectories and structured navigation semantics, which are then used to train a vision-language-action policy for interpretable navigation planning. We characterize the long tail based on model performance and the distribution of perception-motion patterns, and employ reflection-based analysis to diagnose recurring failure modes. Experiments on web-video data and real-world urban navigation tasks demonstrate effective knowledge transfer from unconstrained videos and reveal coherent long-tail structures beyond aggregate navigation performance.
- Abstract(参考訳): 実世界のデータから具体化された都市ナビゲーションポリシーを学習することは、タスク固有のデータ収集のコストと、稀だが安全クリティカルなシナリオを限定的にカバーすることによって制約される。
これらの課題に対処するために,Webスケールのインザワイルド・エゴセントリックなビデオからポイントゴール・アーバンナビゲーションを学習し,その長い尾を体系的に露呈するスケーラブルなフレームワークを提案する。
このフレームワークは、未処理のWebビデオにメトリックな軌跡と構造化されたナビゲーションセマンティクスを自動で注釈付けし、それを解釈可能なナビゲーション計画のための視覚言語アクションポリシーのトレーニングに使用する。
モデル性能と知覚-運動パターンの分布に基づいて長い尾を特徴付け、リフレクションに基づく解析を用いて繰り返し発生する故障モードの診断を行う。
Webビデオデータと実世界の都市ナビゲーションタスクの実験は、制約のないビデオからの効果的な知識伝達を示し、総合的なナビゲーション性能を超えた一貫性のあるロングテール構造を明らかにする。
関連論文リスト
- AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning [15.951251568937074]
我々は,大規模モデルの数十億のパラメータにシーンダイナミクスを暗黙的にエンコードする,生涯にわたる自己学習ナビゲーションフレームワークであるAllDayNavを提案する。
実験の結果、AllDayNavは100ドルに近い成功率を実現し、パス効率とロバストネスにおいて、強いマップベース、VLM、RLベースラインを一貫して上回っていることがわかった。
論文 参考訳(メタデータ) (2026-06-09T14:35:53Z) - From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning [59.88543114325153]
本稿では,航法基礎モデルの強化学習能力を高めるためのSeeing-to-Experiencingフレームワークを提案する。
S2Eは、ビデオの事前トレーニングとRLによるポストトレーニングの長所を組み合わせたものだ。
実世界のシーンを3DGSで再現した3D画像に基づく総合的なエンドツーエンド評価ベンチマークであるNavBench-GSを構築した。
論文 参考訳(メタデータ) (2025-07-29T17:26:10Z) - VideoExplorer: Think With Videos For Agentic Long-Video Understanding [117.68219930263153]
ロングビデオ理解はコンピュータビジョンにおいて難しい問題である。
ビデオによる思考の原則に基づくフレームワークであるVideoExplorerを提案する。
静的なコンテキストを推論する代わりに、VideoExplorerは、サブクエストを反復的に定式化し、関連するモーメントを特定し、タスク指向で時間的にスケーラブルなビデオ理解を実行する。
論文 参考訳(メタデータ) (2025-06-12T15:39:10Z) - NavigateDiff: Visual Predictors are Zero-Shot Navigation Assistants [24.689242976554482]
慣れ親しんだ環境をナビゲートすることは、家庭用ロボットにとって大きな課題となる。
既存の強化学習手法は、直接新しい環境に移行することはできない。
我々は、事前学習された基礎モデルの論理知識と一般化能力をゼロショットナビゲーションに転送しようと試みる。
論文 参考訳(メタデータ) (2025-02-19T17:27:47Z) - CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos [11.912608309403359]
我々は,人間のような都市ナビゲーションのためのスケーラブルでデータ駆動型アプローチを提案する。
われわれは何千時間もの間、何千時間もの街を歩きながらウェブから動画を流すエージェントを訓練している。
我々のモデルは、多様な課題や重要なシナリオを扱うために洗練されたナビゲーションポリシーを学びます。
論文 参考訳(メタデータ) (2024-11-26T19:02:20Z) - How To Not Train Your Dragon: Training-free Embodied Object Goal
Navigation with Semantic Frontiers [94.46825166907831]
Embodied AIにおけるオブジェクトゴールナビゲーション問題に対処するためのトレーニング不要のソリューションを提案する。
本手法は,古典的な視覚的同時ローカライゼーションとマッピング(V-SLAM)フレームワークに基づく,構造化されたシーン表現を構築する。
本手法は,言語先行情報とシーン統計に基づいてシーングラフのセマンティクスを伝搬し,幾何学的フロンティアに意味知識を導入する。
論文 参考訳(メタデータ) (2023-05-26T13:38:33Z) - Augmented reality navigation system for visual prosthesis [67.09251544230744]
反応ナビゲーションと経路計画のソフトウェアを組み込んだ視覚補綴用拡張現実ナビゲーションシステムを提案する。
対象を地図上に配置し、対象の軌道を計画し、対象に示し、障害なく再計画する。
その結果,目標を達成するための時間と距離を減らし,障害物衝突の回数を大幅に減らし,航法性能の向上を図っている。
論文 参考訳(メタデータ) (2021-09-30T09:41:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。