論文の概要: Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching
- arxiv url: http://arxiv.org/abs/2608.04568v1
- Date: Wed, 05 Aug 2026 07:58:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.781058
- Title: Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching
- Title(参考訳): Talk2Sensors: センサ適応物理キューマッチングによる自律走行における3次元視覚グラウンド
- Authors: Runwei Guan, Di Tian, Ningwei Ouyang, Ruixiao Zhang, Shaofeng Liang, Haocheng Zhao, Lianqing Zheng, Xiaokai Bai, Guotao Wang, Daizong Liu, Henghui Ding, Hui Xiong,
- Abstract要約: Talk2Sensorsは、カメラ、LiDAR、および4Dレーダ上に構築された最初のマルチセンサ3Dビジュアルグラウンドデータセットである。
本稿では,自動走行における言語誘導型3次元視覚グラウンドのためのトランスフォーマーベースの統合フレームワークTSFormerを提案する。
- 参考スコア(独自算出の注目度): 66.91228384649921
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As a key capability for embodied intelligence, 3D visual grounding (3DVG) has been predominantly studied in indoor scenes with RGB-D or point-cloud inputs, while existing outdoor extensions largely rely on monocular images alone. Both settings fall short of real-world outdoor perception, where heterogeneous sensors capture complementary yet distinct physical properties, such as visual texture, 3D geometry, and object kinematics, that are indispensable for flexible and robust query-adaptive grounding but remain under-exploited. To bridge this gap, we introduce Talk2Sensors, the first multi-sensor 3D visual grounding dataset built upon camera, LiDAR, and 4D radar. It contains 8,682 language instructions and 20,558 referred objects, with diverse prompts explicitly aligned with sensor-specific physical cues. Furthermore, we propose TSFormer, a unified Transformer-based framework for language-guided 3D visual grounding in autonomous driving. TSFormer adopts a coarse-to-fine property-aware fusion strategy: the Language-Routed Property Sampler first performs coarse text-conditioned feature retrieval by modulating sensor sampling weights with query-level linguistic cues, while the subsequent Sparse-Preserving Modality Arbiter module conducts fine-grained modality arbitration and text-guided refinement to determine the precise referred spatial location. This design enables dynamic routing of appearance, geometry, and motion cues according to the semantic requirements of each prompt, preventing dense modalities from overwhelming sparse but critical sensor signals. Extensive experiments demonstrate that TSFormer achieves state-of-the-art performance across multiple benchmarks: it improves over the strongest baseline by 8.05 mAP on Talk2Sensors, and transfers to the monocular Mono3DRefer benchmark with 53.05\% Acc@0.5.
- Abstract(参考訳): インテリジェンスを具現化するための重要な能力として、3Dビジュアルグラウンドティング(3DVG)は、RGB-Dまたはポイントクラウド入力を持つ屋内シーンで主に研究され、既存の屋外拡張はモノクロ画像のみに依存している。
両設定は現実世界の屋外認識に欠けており、異質なセンサーは視覚的テクスチャや3D幾何学、オブジェクトキネマティクスなど、相補的だが異なる物理的特性を捉えている。
このギャップを埋めるために、カメラ、LiDAR、および4Dレーダー上に構築された最初のマルチセンサー3DビジュアルグラウンドデータセットであるTalk2Sensorsを紹介します。
8,682の言語命令と20,558の参照オブジェクトが含まれており、センサー固有の物理的手がかりと明確に一致している。
さらに,自動走行における言語誘導型3次元視覚接地のためのトランスフォーマーベースの統合フレームワークTSFormerを提案する。
言語制御プロパティサンプリングは、まず、センササンプリング重みをクエリレベルの言語的手がかりで調節することで、粗いテキスト条件付き特徴検索を行う。
この設計により、各プロンプトのセマンティックな要求に応じて外観、幾何学、動きのキューを動的にルーティングすることができ、過度のスパースでもクリティカルなセンサー信号から密度の変調を防ぐことができる。
TSFormerはTalk2Sensors上で8.05 mAP向上し、Acc@0.5でモノクロMono3DReferベンチマークに転送する。
関連論文リスト
- Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM [54.042182747931925]
3D環境に関する自然言語クエリは、応答が検証可能で測定可能なときに実行可能である。
既存の3次元大規模マルチモーダルモデル (LMM) のアプローチは限定的である。
我々は,点雲と任意のRGB画像を入力として取り出す統一モデルであるGround3D-LMMを提案し,三次元空間会話をサポートする。
論文 参考訳(メタデータ) (2026-07-06T18:00:00Z) - 3DTMDet: A Dual-Path Synergy Network of Transformer and SSM for 3D Object Detection in Point Clouds [15.3066954300581]
3DTMDetは状態空間モデル(Mamba)とトランスフォーマーを組み合わせた新しい検出ネットワークである。
本研究では,SSM-Attention-SSMパイプラインを用いた3D Hybrid Mamba Transformer (3DHMT)ブロックを提案する。
KITTIとONCEのデータセットで行った実験では、3DTMDetは最先端の検出器よりも優れていた。
論文 参考訳(メタデータ) (2026-05-15T02:33:19Z) - SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation [63.48859753472547]
SpaceActorは、意味論と幾何学を明確に分離する堅牢なロボット操作のためのフレームワークである。
RLBenchの87.4%で最先端のパフォーマンスを達成し、ノイズの異なる条件下では13.9%から19.4%改善している。
論文 参考訳(メタデータ) (2025-11-12T18:59:08Z) - Zero-Shot 3D Visual Grounding from Vision-Language Models [10.81711535075112]
3Dビジュアルグラウンド(3DVG)は、自然言語記述を用いて、3Dシーンで対象物を見つけることを目的としている。
SeeGroundは、2Dビジョンランゲージモデル(VLM)を活用するゼロショット3DVGフレームワークで、3D特有のトレーニングの必要性を回避します。
論文 参考訳(メタデータ) (2025-05-28T14:53:53Z) - Talk2PC: Enhancing 3D Visual Grounding through LiDAR and Radar Point Clouds Fusion for Autonomous Driving [39.60518561679198]
我々は,プロンプト誘導点雲センサの組み合わせのパラダイムに基づく,最初の屋外3次元視覚グラウンドモデルであるTPCNetを提案する。
実験により、TPCNetはTalk2RadarとTalk2Carの両方のデータセット上で最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2025-03-11T11:48:27Z) - Talk2Radar: Bridging Natural Language with 4D mmWave Radar for 3D Referring Expression Comprehension [21.598751853520834]
4Dミリ波レーダは従来のレーダよりも密度の高い点雲を提供し、オブジェクトの意味的および物理的特性の両方を知覚する。
3次元視覚接地のためのレーダシーンにおける自然言語による文脈理解の開発を促進するため,最初のデータセットTalk2Radarを構築した。
本研究では,ポイントクラウド上での3次元参照表現のための新しいモデルであるT-RadarNetを提案し,Talk2Radarデータセット上でのステートオフ・ザ・アート(SOTA)性能を実現する。
論文 参考訳(メタデータ) (2024-05-21T14:26:36Z) - UniTR: A Unified and Efficient Multi-Modal Transformer for
Bird's-Eye-View Representation [113.35352122662752]
屋外3次元知覚のためのマルチモーダルバックボーンUniTRを提案する。
UniTRは、統一されたモデリングと共有パラメータで様々なモダリティを処理する。
UniTRは基本的にタスクに依存しないバックボーンであり、異なる3D知覚タスクを自然にサポートする。
論文 参考訳(メタデータ) (2023-08-15T12:13:44Z) - AGO-Net: Association-Guided 3D Point Cloud Object Detection Network [86.10213302724085]
ドメイン適応によるオブジェクトの無傷な特徴を関連付ける新しい3D検出フレームワークを提案する。
我々は,KITTIの3D検出ベンチマークにおいて,精度と速度の両面で最新の性能を実現する。
論文 参考訳(メタデータ) (2022-08-24T16:54:38Z) - Unifying Voxel-based Representation with Transformer for 3D Object
Detection [143.91910747605107]
マルチモード3Dオブジェクト検出のための統一フレームワークUVTRを提案する。
提案手法は, ボクセル空間におけるマルチモーダリティ表現を統一し, 高精度かつ堅牢な単一モード・クロスモーダリティ3D検出を実現することを目的とする。
UVTRは、69.7%、55.1%、71.1%のNDSで、それぞれLiDAR、カメラ、マルチモダリティの入力を行う。
論文 参考訳(メタデータ) (2022-06-01T17:02:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。