論文の概要: DSSR-3D: Decoupled Reasoning for View-Dependent Referring in 3D Gaussians
- arxiv url: http://arxiv.org/abs/2610.00040v1
- Date: Thu, 03 Sep 2026 01:27:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.324865
- Title: DSSR-3D: Decoupled Reasoning for View-Dependent Referring in 3D Gaussians
- Title(参考訳): DSSR-3D:3次元ガウスにおけるビュー依存参照のための疎結合推論
- Abstract要約: 3Dガウススプラッティングは、意味知識を3D表現に蒸留することにより、オープン語彙とセグメンテーションの参照を可能にした。
既存の参照フィールドは、グローバルなビュー不変空間に言語特徴を埋め込むため、オブザーバ中心の空間関係を解決できない。
連続3次元ガウス場におけるビュー依存参照セグメンテーションのための推論時フレームワークDSSR-3Dを提案する。
- 参考スコア(独自算出の注目度): 9.002400034836967
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in 3D Gaussian Splatting have enabled open-vocabulary and referring segmentation by distilling semantic knowledge from 2D foundation models into 3D representations. However, existing referring fields embed language features in a globally view-invariant space, making them fundamentally unable to resolve observer-centric spatial relations (e.g., "to the left of") that depend on camera pose. We propose DSSR-3D, an inference-time framework for view-dependent referring segmentation on continuous 3D Gaussian fields, formalized as two interfaces - pose-invariant semantic localization and pose-conditioned spatial reasoning - such that any pair of functions satisfying these constraints yields a valid instantiation, requiring no retraining of the underlying semantic field and no reliance on discrete geometric proxies such as bounding boxes. We instantiate the two interfaces with a temperature-sharpened softmax localization mechanism and a projection-based directional scoring function, fused via a lightweight, training-free step, and show they transfer zero-shot to structurally distinct semantic fields without adaptation. We further propose ViewRef-GS, a benchmark isolating view-dependent segmentation on 3D Gaussian fields, evaluated jointly with an augmented Ref-LERF to provide a comprehensive testbed for viewpoint-dependent spatial grounding. Experiments show consistent gains over existing 3DGS-based referring methods, with no additional training beyond the base semantic field
- Abstract(参考訳): 近年の3次元ガウススプラッティングは2次元基礎モデルから3次元表現への意味的知識の蒸留によってオープン語彙とセグメンテーションの参照を可能にしている。
しかし、既存の参照フィールドは、グローバルなビュー不変空間に言語の特徴を埋め込むため、カメラのポーズに依存するオブザーバー中心の空間関係(例えば「左へ」)を根本的に解決することができない。
DSSR-3Dは連続した3次元ガウス場上のビュー依存参照セグメンテーションのための推論時フレームワークであり,2つのインタフェースとして定式化されている。
我々は,2つのインタフェースを,温度制限型ソフトマックス定位機構と投影型指向性スコアリング関数でインスタンス化し,軽量でトレーニング不要なステップで融合し,ゼロショットを適応せずに構造的に異なるセマンティックフィールドに転送することを示す。
さらに,3次元ガウス場におけるビュー依存セグメンテーションを分離するベンチマークであるViewRef-GSを提案する。
既存の3DGSベースの参照手法よりも一貫した利得を示し、基礎的意味論以外の追加の訓練は行わない。
関連論文リスト
- Geometry Without Coordinates: LiDAR Diffusion as a 3D Feature Bridge [0.0]
既成2次元基礎モデルから擬似ラベルを訓練したLiDAR条件拡散モデルを提案する。
モデルはLiDARで条件付けされているため、出力と中間のUNet機能はインプットポイントクラウドに投影することができる。
我々は,この表現を,生空間座標を明示的に除いた点-雲空間で直接研究する。
論文 参考訳(メタデータ) (2026-09-09T15:26:35Z) - USR-Drive: Unified Driving Scene Representation via Joint Denoising of 3D Gaussians and Boxes [57.4583999658488]
自律運転のための空間表現学習は、生の視覚信号を構造化された3次元シーン表現にマッピングすることを目的としている。
既存の方法は動的再構成とインスタンスレベルの認識を別々のタスクとして扱う。
共有シーン表現における高密度な動的幾何とインスタンスレベルのオブジェクトレイアウトを復元する統一条件生成フレームワークUSR-Driveを提案する。
論文 参考訳(メタデータ) (2026-08-19T15:29:06Z) - SAD-GS: Learning Reliable 3D Semantic Gaussian Fields via Dynamic Geo-Semantic Anchoring [27.855348377803164]
SAD-GSは動的ジオ・セマンティックアンカリングにより信頼性の高い3Dセマンティック・ガウス場を学習するためのフレームワークである。
SAD-GSはオープン語彙のローカライゼーションとセマンティックセグメンテーションの両方において、常に最高の全体的な性能を達成する。
論文 参考訳(メタデータ) (2026-06-28T12:52:46Z) - GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentation [38.12499404546835]
オープンな3次元セグメンテーションのための階層的幾何-セマンティック整合性を統合するフレームワークであるGeoGuideを提案する。
具体的には,不確実性に基づくスーパーポイント蒸留モジュールを導入し,幾何学的特徴と意味的特徴を融合させる。
ScanNet v2、Matterport3D、nuScenesに関する実験は、GeoGuideの優れた性能を示している。
論文 参考訳(メタデータ) (2026-03-27T10:29:19Z) - Joint Semantic and Rendering Enhancements in 3D Gaussian Modeling with Anisotropic Local Encoding [86.55824709875598]
本稿では,セマンティックとレンダリングの両方を相乗化する3次元セマンティックガウスモデリングのための統合拡張フレームワークを提案する。
従来の点雲形状符号化とは異なり、細粒度3次元形状を捉えるために異方性3次元ガウシアン・チェビシェフ記述子を導入する。
我々は、学習した形状パターンを継続的に更新するために、クロスシーンの知識伝達モジュールを使用し、より高速な収束と堅牢な表現を可能にします。
論文 参考訳(メタデータ) (2026-01-05T18:33:50Z) - CaRF: Enhancing Multi-View Consistency in Referring 3D Gaussian Splatting Segmentation [20.561664000265765]
Referring 3D Gaussian Splatting (R3DGS)は、自由形式の言語表現を解釈し、ガウスのフィールドで対応する3D領域をローカライズすることを目的としている。
既存のパイプラインは、言語と3D幾何の間のクロスモーダルアライメントに苦戦している。
本稿では,3次元ガウス空間で直接動作し,マルチビューの整合性を実現するフレームワークであるCamera Aware Referring Field (CaRF)を提案する。
この研究は、より信頼性が高く、一貫性のある3Dシーン理解を促進する。
論文 参考訳(メタデータ) (2025-11-06T02:24:04Z) - Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding [58.38294408121273]
CUA-O3Dと呼ばれるオープン語彙3次元シーン理解のためのクロスモーダル・不確実性認識アグリゲーションを提案する。
提案手法は,(1)空間認識型視覚基盤モデルの幾何学的知識とともに,VLMのセマンティックな先入観を取り入れること,(2)モデル固有の不確かさを捉えるために,新しい決定論的不確実性推定を用いること,の2つの課題に対処する。
論文 参考訳(メタデータ) (2025-03-20T20:58:48Z) - NeuraLoc: Visual Localization in Neural Implicit Map with Dual Complementary Features [50.212836834889146]
本稿では,補完的な特徴を持つニューラル暗黙マップに基づく,効率的で斬新な視覚的局所化手法を提案する。
具体的には、幾何学的制約を強制し、ストレージ要件を小さくするために、3Dキーポイント記述子フィールドを暗黙的に学習する。
記述子の意味的あいまいさにさらに対処するために、追加の意味的文脈的特徴体を導入する。
論文 参考訳(メタデータ) (2025-03-08T08:04:27Z) - Bootstraping Clustering of Gaussians for View-consistent 3D Scene Understanding [59.51535163599723]
FreeGSは、教師なしセマンティック組み込み3DGSフレームワークで、2Dラベルを必要とせずに、ビュー一貫性のある3Dシーン理解を実現する。
FreeGSは複雑なデータ前処理のワークロードを避けながら、最先端のメソッドと互換性がある。
論文 参考訳(メタデータ) (2024-11-29T08:52:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。