論文の概要: LangLoc: "Tell Me What You See"
- arxiv url: http://arxiv.org/abs/2607.05077v1
- Date: Mon, 06 Jul 2026 13:39:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.165195
- Title: LangLoc: "Tell Me What You See"
- Title(参考訳): LangLoc: "Tell me what you see"
- Abstract要約: 自然言語からのきめ細かい屋内局所化に取り組む。
周囲の自由形式の記述を与えられた場合、観測者の2次元位置を推定し、既知の3次元環境内に向かう。
LangLocはCLIPセマンティック機能を備えたデュアルブランチのGATv2エンコーダを通じて正しいシーンを取得する。
- 参考スコア(独自算出の注目度): 62.742423478661316
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We tackle fine-grained indoor localization from natural language: given a free-form description of one's surroundings, estimate the observer's 2D position and heading within a known 3D environment. Language queries are lightweight, privacy-preserving, and need no camera - yet prior work stops at coarse scene retrieval and cannot resolve an intra-scene pose. We close this gap with LangLoc, a three-stage pipeline that (i) retrieves the correct scene via a dual-branch GATv2 encoder with CLIP semantic features, surpassing the previous best by 8 percentage points in Top-1 recall; (ii) estimates position and heading by scoring a dense floor grid through ray-cast object visibility, reaching a median error of 0.95 m; and (iii) resolves residual ambiguity through a Bayesian dialog module that asks targeted yes/no questions and updates a pose posterior until the location is pinpointed. To support this task we contribute a benchmark of $13{,}000{+}$ pose-indexed natural-language descriptions over $1{,}300{+}$ indoor 3D scans.
- Abstract(参考訳): 本研究は, 自然言語による室内の微粒化に取り組み, 周囲を自由な形状で記述し, 観測者の2次元位置を推定し, 既知の3次元環境内に向かう。
言語クエリは軽量で、プライバシ保護されており、カメラを必要としない。
このギャップを3段階のパイプラインであるLangLocで埋めます。
(i)CLIPセマンティック機能を備えたデュアルブランチのGATv2エンコーダを通じて正しいシーンを検索し、Top-1リコールにおいて、前回の最高率を8ポイント上回る。
(II)レイキャストオブジェクトの視認性を通して高密度の床格子を採点し、中央値の0.95mに達する位置と方向を推定する。
3) 目的のイエス/ノー質問を問うベイジアンダイアログモジュールを通じて残余の曖昧さを解消し、位置が特定されるまでポーズ後部を更新する。
このタスクをサポートするために、13{,}000{+}$ pose-indexed natural-lang descriptions over $1{,}300{+}$ indoor 3D scansというベンチマークを提出する。
関連論文リスト
- PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding [45.510721162264666]
3D Visual Groundingは、自然言語で記述された3Dシーンでターゲットオブジェクトをローカライズすることを目的としている。
既存のアプローチは通常、シーン全体を推論し、曖昧な予測と高い計算コストをもたらす。
3つのキーコンポーネント上に構築された3DVGのための効果的なプラグアンドプレイフレームワークPruneGroundを提案する。
論文 参考訳(メタデータ) (2026-06-30T05:21:11Z) - AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models [0.0]
3Dビジュアルグラウンド(3DVG)は、AIを具現化する上で不可欠な機能であり、自然言語の記述に基づいて、エージェントがオブジェクトを3Dシーンにローカライズする必要がある。
タスク固有の3Dトレーニングを必要とせずに,色のついた点クラウド上で直接動作する,ゼロショットの3Dビジュアルグラウンドティングフレームワークである。
論文 参考訳(メタデータ) (2026-05-25T14:29:04Z) - Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs [72.8641426724502]
MLLM(Multimodal Large Language Models)における3次元ローカライゼーションは、カメラ固有の曖昧さによって制限される。
本稿では,空間ツールを式変数として再活用する,等式対応型ツール利用フレームワークを提案する。
提案手法は,RGBのみのベースラインとツール拡張ベースラインよりも優れており,カメラがトレーニングスケールから最も逸脱する点において,大きな効果がある。
論文 参考訳(メタデータ) (2026-05-19T08:30:21Z) - LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight [105.9472902251177]
次世代の予測問題として3D検出を行うVLMネイティブレシピを提案する。
このモデルでは, 49.89 AP_3Dの精度を+15.51倍に向上した。
論文 参考訳(メタデータ) (2025-11-25T18:59:45Z) - ChangingGrounding: 3D Visual Grounding in Changing Scenes [92.00984845186679]
現実世界のロボットは自然言語からオブジェクトをローカライズするが、周囲のシーンは変化し続けている。
既存の3Dビジュアルグラウンドティング(3DVG)手法のほとんどは、再構築された最新の点雲を前提としている。
エージェントが過去の観測をいかにうまく活用できるかを明示的に測定する最初のベンチマークであるChangeingGroundingを紹介します。
論文 参考訳(メタデータ) (2025-10-16T17:59:16Z) - SLGaussian: Fast Language Gaussian Splatting in Sparse Views [15.0280871846496]
スパース視点から3次元意味体を構築するフィードフォワード手法であるSLGaussianを提案する。
SLGaussianは、3D空間に言語情報を効率よく埋め込むことができ、スパースビュー条件下で正確な3Dシーン理解のための堅牢なソリューションを提供する。
論文 参考訳(メタデータ) (2024-12-11T12:18:30Z) - EP2P-Loc: End-to-End 3D Point to 2D Pixel Localization for Large-Scale
Visual Localization [44.05930316729542]
本稿では,3次元点雲の大規模可視化手法EP2P-Locを提案する。
画像中の見えない3D点を除去する簡単なアルゴリズムを提案する。
このタスクで初めて、エンドツーエンドのトレーニングに差別化可能なツールを使用します。
論文 参考訳(メタデータ) (2023-09-14T07:06:36Z) - Soft Expectation and Deep Maximization for Image Feature Detection [68.8204255655161]
質問をひっくり返し、まず繰り返し可能な3Dポイントを探し、次に検出器を訓練して画像空間にローカライズする、反復的半教師付き学習プロセスSEDMを提案する。
以上の結果から,sdmを用いてトレーニングした新しいモデルでは,シーン内の下位3dポイントのローカライズが容易になった。
論文 参考訳(メタデータ) (2021-04-21T00:35:32Z) - VoxelPose: Towards Multi-Camera 3D Human Pose Estimation in Wild
Environment [80.77351380961264]
複数のカメラビューから複数の人の3Dポーズを推定する手法を提案する。
本稿では,3D空間で動作するエンドツーエンドのソリューションを提案する。
本稿では,各提案の詳細な3次元ポーズを推定するために,Pose Regression Network (PRN)を提案する。
論文 参考訳(メタデータ) (2020-04-13T23:50:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。