論文の概要: Robostral Navigate
- arxiv url: http://arxiv.org/abs/2607.20785v2
- Date: Fri, 24 Jul 2026 21:13:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 12:52:43.770293
- Title: Robostral Navigate
- Title(参考訳): ロボストラルナビゲート
- Abstract要約: Robostral Navigateは、大規模なナビゲーションシステムのための視覚言語モデルである。
モノラルなRGB画像のストリームのみを消費し、現在のカメラビューの次のターゲット位置を指して、ウェイポイントを予測する。
我々は、実世界のデータ収集への依存を減らすため、350kのシミュレートされたシーンに240万のトラジェクトリを生成します。
- 参考スコア(独自算出の注目度): 138.74472687550374
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deploying navigation systems at scale requires a recipe that minimizes sensor assumptions, generalizes across robot embodiments, and trains efficiently. Yet, today's best systems depend on depth sensors, multi-camera rigs, or pre-built maps, limiting the hardware they support and increasing deployment cost. We introduce Robostral Navigate, an 8B vision-language model built around this scalability objective. The model consumes only a stream of monocular RGB images - the most ubiquitous sensor across robotic platforms and predicts waypoints by pointing to the next target location in the current camera view. Operating purely in image space, rather than robot-specific coordinates, makes the policy naturally robust to changes in camera intrinsics and scene scale, enabling deployment across wheeled, legged, and aerial robots without recalibration. We generate 2.4 million trajectories across 350k simulated scenes to reduce the reliance on real-world data collection and scale easily. We further introduce a prefix-caching training recipe that packs entire episodes into single training sequences, reducing training tokens by 22x and cutting training time from months to days. A tree-based attention mask prevents conditioning on previous ground-truth actions, encouraging visually grounded action prediction, and reinforcement learning is used to further improve exploration and recovery capabilities. On the Room-to-Room and Room-Across-Room in Continuous Environments (R2R-CE and RxR-CE) benchmarks, Robostral Navigate sets a new state of the art. On R2R-CE, it achieves a 77.4% success rate, surpassing the best monocular method by 10.5 points and the strongest depth- or multi-camera system by 5.3 points despite using only a single RGB camera. On RxR-CE, it reaches 75.1% success rate, outperforming all monocular baselines.
- Abstract(参考訳): ナビゲーションシステムを大規模に展開するには、センサーの仮定を最小限に抑え、ロボットの体をまたいで一般化し、効率的に訓練するレシピが必要である。
しかし、今日の最高のシステムは、深度センサー、マルチカメラリグ、またはプレビルドマップに依存し、サポート対象のハードウェアを制限し、デプロイコストを増大させます。
このスケーラビリティの目標に基づいて構築された8Bビジョン言語モデルであるRobostral Navigateを紹介します。
モデルは単眼のRGB画像のストリームのみを消費し、ロボットプラットフォームにまたがる最もユビキタスなセンサーであり、現在のカメラビューで次のターゲット位置を指し示すことによって、経路ポイントを予測する。
ロボット固有の座標ではなく、純粋に画像空間で運用することで、このポリシーはカメラの内在とシーンスケールの変化に対して自然に堅牢になり、車輪付き、脚付き、空中ロボットを再校正せずに展開することができる。
350kのシミュレートされたシーンに240万のトラジェクトリを生成し、実世界のデータ収集への依存を減らし、スケールを容易にします。
さらに、エピソード全体を単一のトレーニングシーケンスにまとめ、トレーニングトークンを22倍に減らし、トレーニング時間を数ヶ月から数日に短縮するプレフィックスキャッシュトレーニングレシピを導入します。
木をベースとしたアテンションマスクは、以前の接地行動の条件付けを防止し、視覚的に接地された行動予測を奨励し、探索と回復能力をさらに改善するために強化学習を使用する。
Room-to-Room と Room-Across-Room in Continuous Environments (R2R-CE と RxR-CE) のベンチマークでは、Robostral Navigate が新たな最先端技術を設定している。
R2R-CEでは77.4%の成功率を記録し、10.5ポイント、RGBカメラのみを使用しながら最強の深度・マルチカメラシステム5.3ポイントを達成している。
RxR-CEでは75.1%の成功率に達し、全ての単分子ベースラインを上回っている。
関連論文リスト
- Revisiting Articulated Parts Perception in Robot Manipulation [53.043391395657835]
幾何一次構造(GPS)は、スケーラビリティと品質のバランスをとるために部分幾何学構造の抽象化である。
GPSはポータブルなVirtual Reality(VR)デバイスと統合されており、1つのオブジェクトシーケンスをアノテートするのに1分しかかからない。
この効率的なVR-GPSシステムにより、6つのクラスにわたる234個のオブジェクトに対して41Kフレームを収集し、単一のRGB-Dオブジェクトイメージを入力として一般化可能なGPSモデルを訓練する。
論文 参考訳(メタデータ) (2026-06-06T11:07:29Z) - Learning to Localize Reference Trajectories in Image-Space for Visual Navigation [11.2075405205209]
ロボットに依存しない画像空間ガイダンスを提供する視覚ナビゲーションモデルであるLoTISを提案する。
特定のロボットに関連付けられた動作を予測する代わりに、ロボットの現在のビューに現れるように、参照軌道のイメージ空間座標を予測する。
我々のモデルの予測は、多様な実施形態をまたいだゼロショットのガイダンスを提供する。
論文 参考訳(メタデータ) (2026-02-21T11:33:00Z) - NOVA: Navigation via Object-Centric Visual Autonomy for High-Speed Target Tracking in Unstructured GPS-Denied Environments [56.35569661650558]
我々はNOVAというオブジェクト中心のフレームワークを導入し、ロバストな目標追跡と衝突認識ナビゲーションを可能にした。
グローバルマップを構築するのではなく、NOVAはターゲットの参照フレーム内での知覚、推定、制御を定式化する。
我々は,都市迷路や森林の小道,間欠的なGPS損失を伴う建物内の繰り返し遷移など,現実の挑戦的なシナリオにまたがってNOVAを検証する。
論文 参考訳(メタデータ) (2025-06-23T14:28:30Z) - MTevent: A Multi-Task Event Camera Dataset for 6D Pose Estimation and Moving Object Detection [1.1083289076967895]
MTeventは、非常にダイナミックな環境での6次元ポーズ推定と移動物体検出のために設計されたデータセットである。
セットアップはステレオカメラとRGBカメラで、それぞれ平均16秒で75のシーンを撮影しています。
RGB画像上でNVIDIAのFoundationPoseを用いて6次元ポーズ推定を行い,0.22の平均リコールを実現した。
論文 参考訳(メタデータ) (2025-05-16T14:18:21Z) - CabiNet: Scaling Neural Collision Detection for Object Rearrangement
with Procedural Scene Generation [54.68738348071891]
私たちはまず、さまざまな日常環境において、650万以上の散らばったシーン(前よりも桁違いに多い)を生成します。
このデータから合成部分点雲をレンダリングし、それをCabiNetモデルアーキテクチャのトレーニングに使用します。
CabiNetは、オブジェクトとシーンポイントの雲を受け入れる衝突モデルである。
論文 参考訳(メタデータ) (2023-04-18T21:09:55Z) - CRN: Camera Radar Net for Accurate, Robust, Efficient 3D Perception [20.824179713013734]
カメラレーダ融合フレームワークであるカメラレーダネット(CRN)を提案する。
CRNは、様々なタスクに対して意味的にリッチで空間的に正確な鳥眼視(BEV)特徴マップを生成する。
リアルタイム設定のCRNは20FPSで動作し、nuScenes上のLiDAR検出器に匹敵する性能を実現している。
論文 参考訳(メタデータ) (2023-04-03T00:47:37Z) - AZTR: Aerial Video Action Recognition with Auto Zoom and Temporal
Reasoning [63.628195002143734]
本稿では,空中映像の行動認識のための新しい手法を提案する。
提案手法は,UAVを用いて撮影したビデオに対して設計されており,エッジやモバイルデバイス上でも動作可能である。
我々は、カスタマイズされたオートズームを使用して、人間のターゲットを自動的に識別し、適切にスケールする学習ベースのアプローチを提案する。
論文 参考訳(メタデータ) (2023-03-02T21:24:19Z) - Neural Scene Representation for Locomotion on Structured Terrain [56.48607865960868]
本研究では,都市環境を横断する移動ロボットの局所的な地形を再構築する学習手法を提案する。
搭載されたカメラとロボットの軌道からの深度測定のストリームを用いて、ロボットの近傍の地形を推定する。
ノイズ測定とカメラ配置の盲点からの大量の欠落データにもかかわらず,シーンを忠実に再構築する3次元再構成モデルを提案する。
論文 参考訳(メタデータ) (2022-06-16T10:45:17Z) - Rapid Exploration for Open-World Navigation with Latent Goal Models [78.45339342966196]
多様なオープンワールド環境における自律的な探索とナビゲーションのためのロボット学習システムについて述べる。
本手法のコアとなるのは、画像の非パラメトリックトポロジカルメモリとともに、距離と行動の学習された潜在変数モデルである。
学習方針を規則化するために情報ボトルネックを使用し、(i)目標のコンパクトな視覚的表現、(ii)一般化能力の向上、(iii)探索のための実行可能な目標をサンプリングするためのメカニズムを提供する。
論文 参考訳(メタデータ) (2021-04-12T23:14:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。