Fugu-MT 論文翻訳(概要): Language as a Sensor: Calibrated Spatial Belief Estimation in 3D Scenes from Natural Language

論文の概要: Language as a Sensor: Calibrated Spatial Belief Estimation in 3D Scenes from Natural Language

arxiv url: http://arxiv.org/abs/2606.08666v1
Date: Sun, 07 Jun 2026 15:17:25 GMT
ステータス: 翻訳完了
システム内更新日: 2026-06-09 14:42:06.36634
Title: Language as a Sensor: Calibrated Spatial Belief Estimation in 3D Scenes from Natural Language
Title（参考訳）: センサとしての言語:自然言語からの3次元シーンにおける空間的信念の推定
Authors: Aryan Naveen, Jason Xinyu Liu, Luca Carlone, Andreea Bobu,
Abstract要約: 伝統的なメートル法-セマンティックマッピングは、世界の一部の言語記述を知覚的な視野を超えて無視する。言語センサモデル(LSM)を訓練し、各発話とそのシーングラフコンテキストをマルチモーダル分布にマッピングする。次に,VL-Map (Vision-Language Metric-Semantic Mapping) を紹介した。
参考スコア（独自算出の注目度）: 15.05613635418399
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Robots deployed in human-centric environments routinely receive natural-language descriptions of spatial information ("I left my backpack on the table") that reference parts of the world beyond their perceptual field of view. Traditional metric-semantic mapping ignores this signal, while off-the-shelf multimodal models remain limited in 3D spatial reasoning and are not directly amenable to fusion with other sensor modalities. To convert language observations into a calibrated spatial distribution, we train a Language Sensor Model (LSM) that maps each utterance and its scene-graph context to a multimodal distribution, with mixture weights encoding referential ambiguity (e.g., "which table") and component covariances encoding spatial uncertainty (e.g., where "on the table" the target lies). We then introduce VL-Map (Vision-Language Metric-Semantic Mapping), a probabilistic framework that treats these language predictions as stochastic observations and fuses them with onboard perception within a unified belief map. On the VLA-3D benchmark as well as on a real-world mobile robot, LSM is the only language predictor whose covariance estimates remain within the calibrated regime; fused into VL-Map, it leads to more accurate predictions of the target object location (~70% more probability mass on the true target compared to the strongest foundation-model baseline).
Abstract（参考訳）: 人間中心の環境に配備されたロボットは、知覚的な視野を超えた世界の一部を参照する空間情報の自然言語で記述される("I leave my backpack on the table")。従来のメトリック・セマンティックマッピングはこの信号を無視するが、オフザシェルフのマルチモーダルモデルは3次元空間的推論において制限され、他のセンサーと直接融合することができない。言語観測をキャリブレーションされた空間分布に変換するために,各発話とそのシーングラフコンテキストをマルチモーダル分布にマッピングするLanguage Sensor Model (LSM) を訓練する。次に,VL-Map (Vision-Language Metric-Semantic Mapping)を導入する。これは,これらの言語予測を確率的観測として扱う確率的フレームワークであり,統合された信念マップ内でのオンボード認識と融合する。 VLA-3Dベンチマークと実世界の移動ロボットでは、LSMが唯一の言語予測器であり、共分散推定は校正された状態のままであり、VL-Mapに融合してターゲット対象の位置をより正確に予測する。

関連論文リスト

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models [55.12929235609365]
現在の視覚言語アクション(VLA)モデルの視覚バックボーンは、主に3次元幾何学的監督を伴わない2次元画像データに事前訓練されている。既存の暗黙の接地法は、VLA特徴を3D認識基盤モデルと整合させることによって、この問題に部分的に対処する。 DINOv2-FiT3D の空間認識機能と VLA の視覚エンコーダの出力を直接一致させるフレームワーク VEGA を提案する。
論文参考訳（メタデータ） (2026-05-11T12:44:26Z)
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models [50.14156501544165]
空間的推論は3次元シーンにおける空間的関係に基づく対象物の位置決めに焦点を当てる。従来のアプローチでは、大規模言語モデルの入力空間に3Dシーン表現を注入しようと試みてきた。オブジェクト数に線形な入力長を持つ新しい位置埋め込み法であるQuatRoPEを提案する。
論文参考訳（メタデータ） (2026-03-25T18:46:23Z)
Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation [9.838782060508109]
視覚言語モデル(VLM)は、物理的に定義された空間におけるメートル法制約を推論するために明示的に設計されていないことを示す。言語クエリを構造化サブコンポーネントに分解し,各コンポーネントをグラウンド化するためにVLMをクエリするエージェントフレームワークであるMAPGを提案する。 MAPGは、これらの基底出力を確率的に構成し、3次元空間において計量的に一貫した行動可能な決定を生成する。
論文参考訳（メタデータ） (2026-03-19T17:20:56Z)
From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs [65.04549036809557]
我々は、ステレオカメラ、LiDAR、IMU/GPSセンサーで撮影された歩行者の視線映像から構築したベンチマークを紹介する。このデータセットは、計量的に正確な3D情報を提供し、空間的推論質問の自動生成を可能にする。評価の結果、構造化屋内ベンチマークで観測された性能向上は、オープンワールド環境では消滅することが明らかとなった。
論文参考訳（メタデータ） (2025-12-22T18:58:12Z)
VLG-Loc: Vision-Language Global Localization from Labeled Footprint Maps [5.851042749720534]
視覚言語モデル(VLM)は、地図に記録されているランドマークに対して、ロボットの多方向画像観測を探索するために使用される。次に、モンテカルロのローカライゼーションフレームワーク内でロボットのポーズを特定する。シミュレーションおよび実世界の小売環境における実験的検証は、既存のスキャンベース手法と比較して、優れた堅牢性を示す。
論文参考訳（メタデータ） (2025-12-14T18:22:00Z)
Multimodal Spatial Language Maps for Robot Navigation and Manipulation [32.852583241593436]
マルチモーダル空間言語マップは、事前訓練されたマルチモーダル特徴と環境の3次元再構成を融合する空間地図表現である。視覚言語マップ(VLMaps)と音声視覚言語マップ(AVLMaps)の拡張の2つの例を示す。これらの機能は、移動ロボットやテーブルトップマニピュレータに拡張され、視覚、オーディオ、空間的手がかりによって案内されるナビゲーションとインタラクションをサポートする。
論文参考訳（メタデータ） (2025-06-07T17:02:13Z)
Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models [14.442394137843923]
本稿では,まず空間的推論のコア要素を記述した詳細な分析を行う。次に、これらのモデルの性能を、合成画像と実画像の両方で評価する。
論文参考訳（メタデータ） (2025-03-25T14:34:06Z)
Volumetric Semantically Consistent 3D Panoptic Mapping [77.13446499924977]
非構造環境における自律エージェントに適したセマンティック3Dマップを生成することを目的としたオンライン2次元から3次元のセマンティック・インスタンスマッピングアルゴリズムを提案する。マッピング中にセマンティック予測の信頼性を統合し、セマンティックおよびインスタンス一貫性のある3D領域を生成する新しい方法を導入する。提案手法は,パブリックな大規模データセット上での最先端の精度を実現し,多くの広く使用されているメトリクスを改善した。
論文参考訳（メタデータ） (2023-09-26T08:03:10Z)
Kimera-Multi: Robust, Distributed, Dense Metric-Semantic SLAM for Multi-Robot Systems [92.26462290867963]
Kimera-Multiは、最初のマルチロボットシステムであり、不正なインターループとイントラロボットループの閉鎖を識別し拒否することができる。我々は、フォトリアリスティックシミュレーション、SLAMベンチマークデータセット、地上ロボットを用いて収集された屋外データセットの挑戦において、Kimera-Multiを実証した。
論文参考訳（メタデータ） (2021-06-28T03:56:40Z)
Spatial Language Understanding for Object Search in Partially Observed Cityscale Environments [21.528770932332474]
空間言語観測空間を導入し、部分観測可能なマルコフ決定プロセス(POMDP)の枠組みの下でモデルを定式化する。本稿では,言語提供者の参照の相対的フレーム(FoR)の環境コンテキストを予測する畳み込みニューラルネットワークモデルを提案する。本稿では,FOR予測モデルとオブジェクト探索システムの一般化可能性を示す。
論文参考訳（メタデータ） (2020-12-04T16:27:59Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。