論文の概要: Scaling Diverse Language Generation for 3D Visual Grounding
- arxiv url: http://arxiv.org/abs/2606.20946v1
- Date: Thu, 18 Jun 2026 21:20:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 11:45:29.15334
- Title: Scaling Diverse Language Generation for 3D Visual Grounding
- Title(参考訳): 3次元視覚的グラウンドリングのためのスケーリング多言語生成
- Authors: Austin T. Wang, Dongchen Yang, Angel X. Chang,
- Abstract要約: ViGiL3D++は、多様なビジュアルグラウンドクエリを生成する、スケーラブルでシーンに依存しない方法である。
既存の大規模データセットよりも多様性があり、複数の3DVGベンチマークよりもモデル性能が向上していることを示す。
- 参考スコア(独自算出の注目度): 14.535096337338544
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Developing robust models for 3D visual grounding (3DVG), the localization of entities in a 3D scene described in natural language, is important for enabling agents to correspond spatial language with objects in the physical world. However, the lack of diverse descriptions at scale prevents models from generalizing beyond simple linguistic patterns. Recent such attempts lack diversity in the constraint types and language used to ground objects. Captioning methods cannot precisely contrast objects, which is important for visual grounding. We therefore propose ViGiL3D++, a scalable, scene-agnostic method that generates diverse visual grounding queries by combining constraint sampling in scene graphs with the language generation of LLMs. We show that it has greater diversity over existing scaled datasets and improves model performance over several 3DVG benchmarks but also illuminates outstanding limitations of VLMs.
- Abstract(参考訳): 3次元視覚的グラウンドリング(3DVG)のためのロバストなモデルを構築し、自然言語で記述された3次元シーンにおける実体の局所化は、エージェントが物理世界のオブジェクトと空間言語を対応付けるために重要である。
しかし、スケールでの多様な記述の欠如は、モデルが単純な言語パターンを超える一般化を妨げている。
最近の試みでは、オブジェクトを接地するのに使用される制約型や言語に多様性がない。
キャプション法は、視覚的な接地において重要なオブジェクトを正確にコントラストすることができない。
そこで我々は,シーングラフにおける制約サンプリングとLLMの言語生成を組み合わせることで,多様な視覚的グラウンドクエリを生成する,スケーラブルでシーンに依存しないViGiL3D++を提案する。
既存の大規模データセットよりも多様性があり、複数の3DVGベンチマークでモデル性能を向上させるとともに、VLMの際立った限界を照らしていることを示す。
関連論文リスト
- GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond [56.677984098204696]
マルチモーダル言語モデルは、VLM(3D Vision-Language Models)の開発を推進している
本稿では,言語とタスク認識のシーン表現を用いた3次元ガウシアンスプラットシーンのためのシーン中心の3次元VLMを提案する。
本稿では,標準RGB画像から導出した光リアルな3D表現を利用した最初のガウススプラッティングに基づくVLMを提案する。
論文 参考訳(メタデータ) (2025-07-01T15:52:59Z) - AugRefer: Advancing 3D Visual Grounding via Cross-Modal Augmentation and Spatial Relation-based Referring [49.78120051062641]
3Dビジュアルグラウンドティングは、自然言語記述と対象物とを3Dシーン内で関連付けることを目的としている。
既存のアプローチでは、トレーニング用に利用可能なテキスト3Dペアが不足しているのが一般的である。
AugReferは3次元視覚的接地を前進させる新しい手法である。
論文 参考訳(メタデータ) (2025-01-16T09:57:40Z) - ViGiL3D: A Linguistically Diverse Dataset for 3D Visual Grounding [9.289977174410824]
3Dビジュアルグラウンドティングは、自然言語テキストによって参照される3Dシーンでエンティティをローカライズする。
多様な言語パターンに対して視覚的接地手法を評価するための診断データセットである3D (ViGiL3D) の視覚的接地について紹介する。
論文 参考訳(メタデータ) (2025-01-02T17:20:41Z) - g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks [62.74304008688472]
Generalizable 3D-Language Feature Fields (g3D-LF)は、大規模な3D言語データセットで事前訓練された3D表現モデルである。
論文 参考訳(メタデータ) (2024-11-26T01:54:52Z) - Grounded 3D-LLM with Referent Tokens [58.890058568493096]
そこで我々は,Grounded 3D-LLMを提案する。
このモデルは、3Dシーンを参照するために特別な名詞句としてシーン参照トークンを使用する。
タスクごとの指示追従テンプレートは、3D視覚タスクを言語形式に翻訳する際の自然と多様性を保証するために使用される。
論文 参考訳(メタデータ) (2024-05-16T18:03:41Z) - SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding [37.47195477043883]
3D視覚言語グラウンドリングは、言語と3D物理環境の整合性に焦点を当て、エンボディエージェントの開発の基盤となっている。
約68Kの屋内シーンを含む最初の100万スケールの3Dビジョン言語データセットであるSceneVerseを紹介した。
このスケーリングにより、3次元視覚言語学習のための一貫した事前学習フレームワーク、Grounded Pre-training for Scenes (GPS) が実現可能であることを実証する。
論文 参考訳(メタデータ) (2024-01-17T17:04:35Z) - LanguageRefer: Spatial-Language Model for 3D Visual Grounding [72.7618059299306]
3次元視覚的グラウンドリング問題に対する空間言語モデルを構築した。
本稿では,ReferIt3Dが提案する視覚言語データセットに対して,本モデルが競合的に動作することを示す。
論文 参考訳(メタデータ) (2021-07-07T18:55:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。