論文の概要: Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding
- arxiv url: http://arxiv.org/abs/2608.21136v1
- Date: Fri, 21 Aug 2026 14:13:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.566714
- Title: Stream3Dv2: Geometric-Semantic Fusion Enhanced Streaming Zero-Shot 3D Scene Understanding
- Title(参考訳): Stream3Dv2:Geometric-Semantic Fusionの強化されたストリーミングゼロショット3Dシーン理解
- Abstract要約: Stream3Dv2は、堅牢なストリーミング3D知覚のために設計されたトレーニング不要のフレームワークである。
幾何学的ノイズと意味的あいまいさを解消する包括的幾何学的意味融合機構を導入する。
公開データセットの実験では、Stream3Dv2が、基礎となるオープン語彙のストリーミング3Dセグメンテーションと検出において、既存のベースラインを一貫して上回っていることが示されている。
- 参考スコア(独自算出の注目度): 7.823301846592561
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recently, open-vocabulary zero-shot 3D scene understanding using vision foundation models has emerged as a promising alternative to data-intensive supervised methods. However, deploying these models in real-world scenarios is severely hindered by their inability to efficiently handle streaming RGB-D inputs and their inherent vulnerability to noise 2D segmentation masks. To address these critical limitations, we propose Stream3Dv2, a novel training-free framework designed for robust streaming 3D perception. Stream3Dv2 processes sequential data through an original nested local-to-historical architecture, capturing multi-view consistency while circumventing the high computational overhead so as to support timely responses. At its core, we introduce a comprehensive geometric-semantic fusion mechanism that resolves geometric noise and semantic ambiguity by explicitly utilizing semantic guidance and formulating 3D segmentation as solving point-and-set merging and partitioning problems. Furthermore, we present an innovative manifold-distance-based point cloud refinement strategy. This approach leverages local manifold graphs for point-to-manifold optimization that mitigates the boundary delineation failures caused by Euclidean-distance metrics, and employs geometric bounding boxes to dynamically activate and update historical instances for achieving rapid manifold-to-manifold refinement. Extensive experiments on public datasets demonstrate that Stream3Dv2 consistently outperforms existing baselines in foundational open-vocabulary streaming 3D segmentation and detection. Finally, we show that integrating our framework with an LLM-based agent enables advanced language-driven 3D scene understanding, underscoring its potential for open-world embodied intelligence. Code will be updated at https://github.com/SubmissionsIn/Stream3D.
- Abstract(参考訳): 近年,視覚基盤モデルを用いたオープンボキャブラリゼロショット3Dシーン理解が,データ集約型教師付き手法の代替として期待されている。
しかし、これらのモデルを現実のシナリオにデプロイすることは、ストリーミングRGB-D入力を効率的に処理できないことと、ノイズ2Dセグメンテーションマスクに固有の脆弱性によって著しく妨げられている。
このような限界に対処するために,ロバストなストリーミング3D知覚のために設計された,新たなトレーニングフリーフレームワークStream3Dv2を提案する。
Stream3Dv2は、元来のネストされたローカル-履歴アーキテクチャを通してシーケンシャルなデータを処理し、マルチビューの一貫性を捉えながら、高い計算オーバーヘッドを回避し、タイムリーな応答をサポートする。
その中核となるのは、意味的ガイダンスを明示的に活用し、3Dセグメンテーションをポイント・アンド・セットのマージと分割問題として定式化し、幾何学的ノイズと意味的あいまいさを解消する包括的幾何学的意味融合機構である。
さらに, 斬新な多様体距離型点雲改善戦略を提案する。
このアプローチは局所多様体グラフを利用して、ユークリッド距離測定によって生じる境界行列の失敗を緩和し、幾何学的境界ボックスを用いて、高速な多様体から多様体への洗練を達成するために歴史的なインスタンスを動的に活性化・更新する。
公開データセットに関する大規模な実験は、Stream3Dv2が基礎となるオープン語彙ストリーミング3Dセグメンテーションと検出において、既存のベースラインを一貫して上回っていることを示している。
最後に、我々のフレームワークをLLMベースのエージェントと統合することで、先進的な言語駆動の3Dシーン理解が可能になり、オープンワールドの具体的インテリジェンスの可能性を示す。
コードはhttps://github.com/SubmissionsIn/Stream3Dで更新される。
関連論文リスト
- Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces [116.57196064763924]
我々は、高密度テーブルトップオブジェクトと明示的なマルチレベル機能関係を導入することで、ベンチマークカバレッジを拡大する。
この研究は、小規模、高密度、および類似のインスタンスにかかわる重要な課題を提起する。
2次元視覚的グラウンドリングと3次元グラフ最適化に基づくオープン語彙パイプラインを提案する。
論文 参考訳(メタデータ) (2026-05-15T09:14:50Z) - LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding [9.377694035678948]
本稿では,Sparse Voxel Rasterization (SVRaster) を構造的,不随伴な幾何学表現として活用する新しいフレームワークを提案する。
これにより、決定論的で信頼性に配慮した特徴登録プロセスが可能となり、3DGSに共通する意味的出血アーティファクトが抑制される。
提案手法は,Open Vocabulary 3D Object Retrieval と Point Cloud Understanding ベンチマークの最先端性能を実現する。
論文 参考訳(メタデータ) (2026-04-01T20:48:06Z) - 3D-IDE: 3D Implicit Depth Emergent [45.72771473431863]
3D-Implicit Depth Emergenceは、幾何学的自己視覚から派生した創発的特性として3D知覚を再構成する手法である。
本手法により,高密度領域において3次元知覚が暗黙的に出現し,不連続な特徴を呈することができる。
提案手法は,様々な下流タスクにおいて高い性能を維持しつつ,推論遅延を55%削減する。
論文 参考訳(メタデータ) (2026-03-28T00:54:19Z) - Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation [34.44214123004662]
本稿では,差別化可能な意味的・空間的批判のための枠組みであるVLM3Dを提案する。
我々のコアコントリビューションは、VLMの「Yes or No log-odds」から派生した2言語による批判信号です。
VLM3Dは、VLMの豊かな言語によるセマンティクスと空間の理解を多種多様な3D生成パイプラインに注入する、原則的で一般的な経路を確立している。
論文 参考訳(メタデータ) (2025-11-18T09:05:26Z) - EA3D: Online Open-World 3D Object Extraction from Streaming Videos [55.48835711373918]
オープンワールド3Dオブジェクト抽出のための統合オンラインフレームワークであるExtractAnything3D(EA3D)を提案する。
ストリーミングビデオが与えられると、EA3Dは視覚言語と2D視覚基盤エンコーダを使用して各フレームを動的に解釈し、オブジェクトレベルの知識を抽出する。
リカレントな共同最適化モジュールは、モデルの関心領域への注意を向け、幾何学的再構成と意味的理解の両面を同時に強化する。
論文 参考訳(メタデータ) (2025-10-29T03:56:41Z) - Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding [58.38294408121273]
CUA-O3Dと呼ばれるオープン語彙3次元シーン理解のためのクロスモーダル・不確実性認識アグリゲーションを提案する。
提案手法は,(1)空間認識型視覚基盤モデルの幾何学的知識とともに,VLMのセマンティックな先入観を取り入れること,(2)モデル固有の不確かさを捉えるために,新しい決定論的不確実性推定を用いること,の2つの課題に対処する。
論文 参考訳(メタデータ) (2025-03-20T20:58:48Z) - ALSTER: A Local Spatio-Temporal Expert for Online 3D Semantic
Reconstruction [62.599588577671796]
本稿では,RGB-Dフレームのストリームから3次元セマンティックマップを段階的に再構成するオンライン3次元セマンティックセマンティックセマンティクス手法を提案する。
オフラインの手法とは異なり、ロボット工学や混合現実のようなリアルタイムな制約のあるシナリオに直接適用できます。
論文 参考訳(メタデータ) (2023-11-29T20:30:18Z) - Flattening-Net: Deep Regular 2D Representation for 3D Point Cloud
Analysis [66.49788145564004]
我々は、任意の幾何学と位相の不規則な3次元点雲を表現するために、Flattning-Netと呼ばれる教師なしのディープニューラルネットワークを提案する。
我々の手法は、現在の最先端の競合相手に対して好意的に機能する。
論文 参考訳(メタデータ) (2022-12-17T15:05:25Z) - OPA-3D: Occlusion-Aware Pixel-Wise Aggregation for Monocular 3D Object
Detection [51.153003057515754]
OPA-3Dは、Occlusion-Aware Pixel-Wise Aggregationネットワークである。
密集した風景深度と、奥行きのある箱残量と物の境界箱を共同で推定する。
メインカーのカテゴリーでは最先端の手法よりも優れています。
論文 参考訳(メタデータ) (2022-11-02T14:19:13Z) - Cylindrical and Asymmetrical 3D Convolution Networks for LiDAR-based
Perception [122.53774221136193]
運転時のLiDARに基づく認識のための最先端の手法は、しばしば点雲を2D空間に投影し、2D畳み込みによって処理する。
自然な対策として、3Dボクセル化と3D畳み込みネットワークを利用する方法がある。
本研究では,3次元幾何学的パターンを探索するために,円筒状分割と非対称な3次元畳み込みネットワークを設計する,屋外LiDARセグメンテーションのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2021-09-12T06:25:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。