論文の概要: OutLangSplat: 3D Language Gaussian Splatting for UAV Outdoor Scenes
- arxiv url: http://arxiv.org/abs/2608.04560v1
- Date: Wed, 05 Aug 2026 07:54:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.778329
- Title: OutLangSplat: 3D Language Gaussian Splatting for UAV Outdoor Scenes
- Title(参考訳): OutLangSplat: UAV屋外シーンのための3D言語ガウススプレイティング
- Authors: Xia Yan, He Wu, Yanghui Xu, Zizhao Wu, Jiazhou Chen,
- Abstract要約: 3D言語 Gaussian Splattingはオープン語彙言語機能を3D言語 Gaussian Splattingに組み込む。
OutLangSplatは、特徴表現と集約信頼性を改善して、言語ガウス表現をUAV屋外シーンに適用する。
新しいデータセットは、UAV屋外シーンに対するオープン語彙の3Dシーン理解の最初のアクセス可能なデータセットである。
- 参考スコア(独自算出の注目度): 10.527630872188434
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D Language Gaussian Splatting embeds open-vocabulary language features into 3D Gaussian Splatting, providing an efficient explicit representation for text-driven 3D scene understanding. However, existing methods are limited to indoor or small-scale scenes, and tend to fail in Unmanned Aerial Vehicle (UAV) outdoor scenes, where severe occlusions and long distance viewpoints often lead to incorrect semantic activations and missing target responses. In this paper, we present OutLangSplat which adapts language Gaussian representations to UAV outdoor scenes by improving feature representation and aggregation reliability. For the feature representation, a 2D-3D dual-branch representation with region-based alignment and fusion is designed to improve spatial consistency, reducing incomplete target responses and background misactivations. For the feature aggregation, we introduce a training-free contribution and consistency-aware Gaussian feature aggregation strategy that leverages pixel contribution reliability and cross-view semantic consistency to suppress unreliable responses from noisy viewpoints. A new dataset is provided by manually annotating various objects on four real-world public UAV outdoor scene datasets. To the best of our knowledge, it is the first accessible dataset of open-vocabulary 3D scene understanding for UAV outdoor scenes. Quantitative evaluations and ablation studies demonstrate that OutLangSplat outperforms SOTA methods on both open-vocabulary semantic segmentation and instance localization tasks. The datasets and codes will be open-sourced.
- Abstract(参考訳): 3D Language Gaussian Splattingは、オープン語彙言語機能を3D Gaussian Splattingに組み込み、テキスト駆動の3Dシーン理解のための効率的な明示的な表現を提供する。
しかし、既存の方法は屋内や小規模のシーンに限られており、深刻な閉塞や遠距離の視点が誤ったセマンティックなアクティベーションやターゲットの反応を欠くような、無人航空機(UAV)の屋外シーンでは失敗する傾向がある。
本稿では,言語ガウス表現をUAV屋外シーンに適用するOutLangSplatを提案する。
特徴表現のために、領域ベースのアライメントと融合を伴う2D-3Dデュアルブランチ表現は、空間的整合性を改善し、不完全なターゲット応答とバックグラウンドの不活性化を低減するように設計されている。
特徴集約には,画素寄与の信頼性とクロスビューなセマンティックな一貫性を活用し,ノイズの観点から信頼できない応答を抑える,訓練不要なコントリビューションと一貫性を考慮したガウス的特徴集約戦略を導入する。
新しいデータセットは、現実世界の4つのUAV屋外シーンデータセットに、さまざまなオブジェクトを手動でアノテートすることによって提供される。
我々の知る限り、UAV屋外シーンのオープンな3Dシーン理解のための最初のアクセス可能なデータセットである。
OutLangSplatはオープン語彙セマンティックセグメンテーションとインスタンスローカライゼーションタスクの両方においてSOTA法より優れていることを示す。
データセットとコードはオープンソースになる。
関連論文リスト
- OpenInsGaussian: Open-vocabulary Instance Gaussian Segmentation with Context-aware Cross-view Fusion [89.98812408058336]
textbfOpenInsGaussian, textbfOpen-vocabulary textbfInstance textbfGaussian segmentation framework with Context-aware Cross-view Fusion。
OpenInsGaussianは、オープン語彙の3Dガウスのセグメンテーションにおける最先端の結果を達成し、既存のベースラインを大きなマージンで上回る。
論文 参考訳(メタデータ) (2025-10-21T03:24:12Z) - GALA: Guided Attention with Language Alignment for Open Vocabulary Gaussian Splatting [74.56128224977279]
GALAは3次元ガウススプラッティングを用いたオープンな3次元シーン理解のための新しいフレームワークである(3DGS)。
GALAは、自己教師付きコントラスト学習を通じてシーン固有の3Dインスタンス特徴フィールドを蒸留する。
シームレスな2Dおよび3Dオープン語彙クエリをサポートし、ガウス単位の高次元特徴学習を回避してメモリ消費を削減する。
論文 参考訳(メタデータ) (2025-08-19T21:26:49Z) - SemanticSplat: Feed-Forward 3D Scene Understanding with Language-Aware Gaussian Fields [33.113865514268085]
ホロスティックな3Dシーン理解は、拡張現実やロボットインタラクションといったアプリケーションには不可欠だ。
既存のフィードフォワード3Dシーン理解手法(例えば、LSM)は、シーンから言語ベースのセマンティクスを抽出することに限定されている。
フィードフォワード型セマンティック3D再構成手法であるSemanticSplatを提案する。
論文 参考訳(メタデータ) (2025-06-11T09:56:39Z) - CAGS: Open-Vocabulary 3D Scene Understanding with Context-Aware Gaussian Splatting [18.581169318975046]
3D Gaussian Splatting (3DGS) はシーン再構築のための強力な表現を提供するが、相互視の粒度の不整合は問題である。
空間コンテキストを3DGSに組み込んだ新しいフレームワークCAGSを提案する。
CAGSは3Dインスタンスのセグメンテーションを大幅に改善し、LERF-OVSやScanNetといったデータセットのフラグメンテーションエラーを低減する。
論文 参考訳(メタデータ) (2025-04-16T09:20:03Z) - ReasonGrounder: LVLM-Guided Hierarchical Feature Splatting for Open-Vocabulary 3D Visual Grounding and Reasoning [68.4209681278336]
Open-vocabulary 3D visual grounding and reasoningは、暗黙の言語記述に基づくシーン内のオブジェクトのローカライズを目的としている。
現在の方法は、3Dアノテーションとマスクの提案による微調整に大きく依存しているため、苦労している。
適応グルーピングのための階層型3次元特徴ガウス場を用いたLVLM誘導フレームワークであるReasonGrounderを提案する。
論文 参考訳(メタデータ) (2025-03-30T03:40:35Z) - Occam's LGS: An Efficient Approach for Language Gaussian Splatting [57.00354758206751]
言語3Dガウススプラッティングのための複雑なパイプラインは、単純に不要であることを示す。
我々は,オッカムのカミソリを手作業に適用し,高効率な重み付き多視点特徴集約技術を実現する。
論文 参考訳(メタデータ) (2024-12-02T18:50:37Z) - LidaRefer: Context-aware Outdoor 3D Visual Grounding for Autonomous Driving [1.0589208420411014]
3Dビジュアルグラウンドは、自然言語記述でガイドされた3Dシーン内のオブジェクトや領域を見つけることを目的としている。
大規模な屋外LiDARシーンは背景が支配的であり、フォアグラウンド情報も限られている。
LidaReferは、屋外シーンのためのコンテキスト対応の3D VGフレームワークである。
論文 参考訳(メタデータ) (2024-11-07T01:12:01Z) - GOI: Find 3D Gaussians of Interest with an Optimizable Open-vocabulary Semantic-space Hyperplane [53.388937705785025]
3Dオープンボキャブラリのシーン理解は、拡張現実とロボット応用の推進に不可欠である。
GOIは2次元視覚言語基礎モデルから3次元ガウススプラッティング(3DGS)に意味的特徴を統合するフレームワークである。
提案手法では,特徴空間内の超平面分割として特徴選択処理を扱い,クエリに関連性の高い特徴のみを保持する。
論文 参考訳(メタデータ) (2024-05-27T18:57:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。