論文の概要: Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization
- arxiv url: http://arxiv.org/abs/2607.01079v1
- Date: Wed, 01 Jul 2026 15:37:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.96516
- Title: Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization
- Title(参考訳): 視覚言語モデルによるマルチモーダル局所化による意味地図の接地
- Abstract要約: 我々は,GPSを用いた屋内環境におけるロボットのローカライゼーションをセマンティック推論タスクとして再検討することで解決する。
人間が対象レベルの手がかりやラベル付き地図を使ってローカライズする方法に触発されて、正面カメラ画像が与えられた視覚言語モデルがロボットのポーズを推測できるかどうかを問う。
我々は、Qwen2.5-VL-7BをLoRAで微調整し、連続的なポーズ座標を予測する軽量回帰ヘッドを装着する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We address robot localization in GPS-denied indoor environments by reframing it as a semantic reasoning task rather than a geometric estimation problem. Motivated by how humans localize using object-level cues and labeled maps, we ask whether a vision-language model, given a front camera image, a polar LiDAR scan, and a top-down semantic grid map, can infer the robot pose. We fine-tune Qwen2.5-VL-7B with LoRA and attach a lightweight regression head that predicts continuous pose coordinates (x, y, theta) directly from the final hidden state, bypassing text generation. Training uses a composite position-and-direction loss with curriculum learning on a custom Gazebo dataset of 120,112 samples and 527 scenes. On the in-distribution test set of 18,017 samples, the model achieves 98.23 percent position accuracy, 98.00 percent direction accuracy, 96.75 percent full pose accuracy, a mean position error of 0.11 m, and a mean orientation error of 5.7 degrees at 0.62 s per sample. Position accuracy drops by only 7.2 percentage points on seven unseen object categories, reaching 90.99 percent, supporting semantic spatial reasoning rather than appearance memorization. With incomplete maps, fine-tuning recovers performance to 93.72 percent position accuracy, showing adaptability to stale or partial map information. Two ablations highlight cross-modal complementarity. Without LiDAR, using only camera and map inputs, position accuracy remains 95.06 percent, only 3.2 percentage points below the full system. However, when the camera sees no visible objects in a wall-facing view, LiDAR sustains 92.33 percent position accuracy, compared with 70.74 percent when neither LiDAR nor visible objects are available. This shows that LiDAR becomes the primary localization signal when camera semantics are unavailable and provides a reliable fallback under occlusion or sparse layouts.
- Abstract(参考訳): 我々は,GPSを用いた屋内環境におけるロボットのローカライゼーションを,幾何学的推定問題ではなく意味的推論タスクとして考えることで解決する。
対象レベルの手がかりとラベル付き地図を用いて、人間がどのようにローカライズするかによって、正面カメラ画像、極性LiDARスキャン、トップダウンセマンティックグリッドマップを与えられた視覚言語モデルがロボットのポーズを推測できるかどうかを問う。
我々は、LoRAでQwen2.5-VL-7Bを微調整し、連続的なポーズ座標(x、y、theta)を最終隠れ状態から直接予測する軽量回帰ヘッドをテキスト生成をバイパスする。
トレーニングは、120,112のサンプルと527のシーンからなるカスタムのGazeboデータセット上で、カリキュラムの学習を伴う複合的な位置と方向の損失を使用する。
18,017サンプルの分布内試験セットでは、98.23パーセントの位置精度、98.00パーセントの方向精度、96.75パーセントのフルポーズ精度、平均位置誤差が0.11m、平均方向誤差が0.62sである。
位置精度は7つの未確認対象カテゴリでわずか7.2ポイント低下し、90.99%に達した。
不完全なマップでは、微調整により、パフォーマンスは93.72パーセントまで回復し、古いマップ情報や部分的なマップ情報への適応性を示す。
2つのアブレーションは、クロスモーダルな相補性を強調します。
LiDARがなければ、カメラと地図入力のみを使用し、位置精度は95.06パーセントであり、全システムよりわずか3.2%低い。
しかし、壁面のビューで可視物体が見えない場合、LiDARは92.33パーセントの精度を保ち、LiDARも可視物体も使用できない場合の70.74パーセントに対して、カメラは92.33%の精度を保っている。
このことは、LiDARがカメラセマンティクスが利用できないときに主要なローカライズ信号となり、オクルージョンやスパースレイアウトの下で信頼性の高いフォールバックを提供することを示している。
関連論文リスト
- Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning [48.438568700670835]
モデルから潜在的知識を読み出す標準的な方法は、視覚言語モデルがイメージに根ざしたものを体系的に上書きすることができる。
本研究では,空間的推論において,一直線因果制御によって露呈した探究と操舵の両方に誤差が見えないことを示す。
論文 参考訳(メタデータ) (2026-06-30T07:33:18Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation [10.175661009911257]
我々はAnyImageNavを紹介した。AnyImageNavは、ImageNavをより要求の高い設定にプッシュする、トレーニング不要のシステムだ。
私たちのキーとなる洞察は、ゴールイメージを幾何学的なクエリとして扱うことができるということです。
我々の手法はギブソン(93.1%)とHM3D(82.6%)に最先端の航法成功率を設定する。
論文 参考訳(メタデータ) (2026-04-07T02:45:07Z) - Where on Earth? A Vision-Language Benchmark for Probing Model Geolocation Skills Across Scales [61.03549470159347]
視覚言語モデル (VLM) は急速に進歩しているが, オープンワールド環境における画像位置決め能力は, 網羅的に評価されていない。
我々は、視覚認識、ステップバイステップ推論、エビデンス利用を評価するVLM画像位置情報の総合ベンチマークであるEarthWhereを提示する。
論文 参考訳(メタデータ) (2025-10-13T01:12:21Z) - Loc$^2$: Interpretable Cross-View Localization via Depth-Lifted Local Feature Matching [80.57282092735991]
本稿では,高精度かつ解釈可能なクロスビューローカライズ手法を提案する。
地上画像の3自由度(DoF)のポーズを、その局所的な特徴と基準空中画像とをマッチングすることによって推定する。
実験では、クロスエリアテストや未知の向きといった挑戦的なシナリオにおいて、最先端の精度を示す。
論文 参考訳(メタデータ) (2025-09-11T18:52:16Z) - Object-Pose Estimation With Neural Population Codes [4.557963624437784]
オブジェクト対称性は、感覚入力のオブジェクト回転への直接マッピングを複雑にする。
ニューラルネットワークによる物体回転の表現は,これらの制限を克服することを示す。
我々は、Apple M1 CPU上で3.2ミリ秒で推論を行う。
論文 参考訳(メタデータ) (2025-02-19T03:23:43Z) - Telling Left from Right: Identifying Geometry-Aware Semantic Correspondence [80.6840060272386]
本稿では,意味的対応のための幾何学的認識の重要性を明らかにする。
この情報を活用することで,意味的対応性能が著しく向上することを示す。
提案手法は,SPair-71kデータセット上で,65.4(ゼロショット)と85.6(教師)のPCK@0.10スコアを達成する。
論文 参考訳(メタデータ) (2023-11-28T18:45:13Z) - Convolutional Cross-View Pose Estimation [9.599356978682108]
クロスビューポーズ推定のための新しいエンドツーエンド手法を提案する。
提案手法は,VIGORおよびKITTIデータセット上で検証される。
オックスフォード・ロボットカーのデータセットでは,エゴ車両の姿勢を時間とともに確実に推定することができる。
論文 参考訳(メタデータ) (2023-03-09T13:52:28Z) - Visual Cross-View Metric Localization with Dense Uncertainty Estimates [11.76638109321532]
本研究は、屋外ロボティクスにおける視覚的クロスビューメトリックローカライゼーションに対処する。
地上レベルのカラー画像と局地的な環境を含む衛星パッチが与えられた場合、衛星パッチ内の地上カメラの位置を特定することが課題である。
我々は、より高密度な衛星記述子、ボトルネックにおける類似性マッチング、およびマルチモーダルなローカライゼーションの曖昧さを捉えるための出力としての密度空間分布を備えた新しいネットワークアーキテクチャを考案した。
論文 参考訳(メタデータ) (2022-08-17T20:12:23Z) - Beyond Cross-view Image Retrieval: Highly Accurate Vehicle Localization
Using Satellite Image [91.29546868637911]
本稿では,地上画像と架空衛星地図とをマッチングすることにより,車載カメラのローカライゼーションの問題に対処する。
鍵となる考え方は、タスクをポーズ推定として定式化し、ニューラルネットベースの最適化によってそれを解くことである。
標準自動運転車のローカライゼーションデータセットの実験により,提案手法の優位性が確認された。
論文 参考訳(メタデータ) (2022-04-10T19:16:58Z) - Uncertainty-Aware Camera Pose Estimation from Points and Lines [101.03675842534415]
Perspective-n-Point-and-Line (Pn$PL) は、2D-3D特徴座標の3Dモデルに関して、高速で正確で堅牢なカメラローカライゼーションを目指している。
論文 参考訳(メタデータ) (2021-07-08T15:19:36Z) - 3D Lidar Mapping Relative Accuracy Automatic Evaluation Algorithm [7.4977759910523964]
3Dライダーに基づくHD(High Definition)マップは、自動運転車のローカライゼーション、計画、意思決定、知覚などにおいて重要な役割を果たす。
SLAMに関連する多くの3次元ライダーマッピング技術は、高い精度を確保するためにHDマップ構築に使用されている。
3次元ライダーマッピングの精度を評価するため、最も一般的な手法はポーズの基底真理を用いて推定されたポーズと基底真理の誤差を計算する。
本稿では,3次元ライダーマッピングで構築したHDマップの精度を自動的に評価する相対的精度評価アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-06-01T11:30:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。