論文の概要: Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion
- arxiv url: http://arxiv.org/abs/2604.05780v1
- Date: Tue, 07 Apr 2026 12:17:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.814071
- Title: Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion
- Title(参考訳): 3次元セマンティックシーン完了のための空間的ボクセル留意と前景変調
- Authors: Yu Xue, Longjun Gao, Yuanqi Su, HaoAng Lu, Xiaoning Zhang,
- Abstract要約: Voxel sparsityとセマンティックインバランスを明示的にモデル化する統合フレームワークであるVoxSAMNetを提案する。
本研究は,3次元シーンを効率よく正確に仕上げるための空間認識と意味誘導設計の重要性を強調した。
- 参考スコア(独自算出の注目度): 3.252262201894531
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Monocular Semantic Scene Completion (SSC) aims to reconstruct complete 3D semantic scenes from a single RGB image, offering a cost-effective solution for autonomous driving and robotics. However, the inherently imbalanced nature of voxel distributions, where over 93% of voxels are empty and foreground classes are rare, poses significant challenges. Existing methods often suffer from redundant emphasis on uninformative voxels and poor generalization to long-tailed categories. To address these issues, we propose VoxSAMNet (Voxel Sparsity-Aware Modulation Network), a unified framework that explicitly models voxel sparsity and semantic imbalance. Our approach introduces: (1) a Dummy Shortcut for Feature Refinement (DSFR) module that bypasses empty voxels via a shared dummy node while refining occupied ones with deformable attention; and (2) a Foreground Modulation Strategy combining Foreground Dropout (FD) and Text-Guided Image Filter (TGIF) to alleviate overfitting and enhance class-relevant features. Extensive experiments on the public benchmarks SemanticKITTI and SSCBench-KITTI-360 demonstrate that VoxSAMNet achieves state-of-the-art performance, surpassing prior monocular and stereo baselines with mIoU scores of 18.2% and 20.2%, respectively. Our results highlight the importance of sparsity-aware and semantics-guided design for efficient and accurate 3D scene completion, offering a promising direction for future research.
- Abstract(参考訳): Monocular Semantic Scene Completion (SSC)は、単一のRGBイメージから完全な3Dセマンティックシーンを再構築することを目的としており、自動運転とロボティクスの費用対効果の高いソリューションを提供する。
しかしながら、93%以上のボクセルが空であり、前景のクラスは稀であり、本質的に不均衡なボクセル分布の性質は重大な課題を引き起こす。
既存の方法はしばしば、非形式的なボクセルの冗長な強調と、長い尾を持つカテゴリへの一般化の欠如に悩まされる。
これらの問題に対処するため,Voxel Sparsity-Aware Modulation Network(Voxel Sparsity-Aware Modulation Network)を提案する。
提案手法では,(1)共有ダミーノードを介して空のボクセルをバイパスするダミーショートカット (DSFR) モジュール,(2)フォアグラウンドドロップアウト (FD) とテキストガイド画像フィルタ (TGIF) を組み合わせたフォアグラウンド・モデレーション・ストラテジーを導入し,オーバーフィッティングを緩和し,クラス関連機能を強化する。
SemanticKITTI と SSCBench-KITTI-360 は、VoxSAMNet が、mIoU スコアが 18.2% と 20.2% である以前の単分子およびステレオベースラインをそれぞれ上回り、最先端のパフォーマンスを達成することを示した。
本研究は,3次元シーンを効率よく正確に再現するための空間認識と意味誘導設計の重要性を強調し,今後の研究に向けて有望な方向性を示すものである。
関連論文リスト
- Multi-Resolution Alignment for Voxel Sparsity in Camera-Based 3D Semantic Scene Completion [52.959716866316604]
カメラベースの3Dセマンティックシーン補完(SSC)は、周囲の3Dシーンにおける各ボクセルの幾何学的占有度と意味ラベルを画像入力で評価するためのコスト効率の良いソリューションを提供する。
既存の手法は、自律運転シナリオにおけるボクセルの大部分が空であるので、ボクセルの空間性という課題に直面している。
カメラを用いた3Dセマンティックシーン補完におけるボクセル空間の分散を緩和するために,textitMulti-Resolution Alignment (MRA) アプローチを提案する。
論文 参考訳(メタデータ) (2026-02-03T10:46:51Z) - VOIC: Visible-Occluded Decoupling for Monocular 3D Semantic Scene Completion [6.144392125326462]
カメラベースのセマンティックシーンコンプリートは、自律走行とロボットシーン理解にとって重要なタスクである。
既存の方法は、通常、エンドツーエンドの2D-to-3D機能リフトとボクセル補完に焦点を当てている。
本稿では,SSCを視覚領域の意味認識と隠蔽領域のシーン補完に明示的に分離する新しいデュアルデコーダフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-22T02:05:45Z) - Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion [23.76697700853566]
3Dセマンティックシーンコンプリート(SSC)は3D知覚において重要な役割を担っているため注目されている。
最近の進歩は、主に3Dシーンを構築するために、ボクセルレベルの特徴を精錬することに焦点を当てている。
我々は、インスタンスとシーンの両方のカテゴリでの学習を強化するために、textbfDisentangling InstanceとScene Contexts(DISC)を提案する。
論文 参考訳(メタデータ) (2025-07-11T12:57:14Z) - Zero-shot Inexact CAD Model Alignment from a Single Image [53.37898107159792]
1つの画像から3Dシーン構造を推測する実践的なアプローチは、データベースから密に一致する3Dモデルを検索し、画像内のオブジェクトと整列させることである。
既存のメソッドは、イメージによる教師付きトレーニングとアノテーションのポーズに依存しており、オブジェクトカテゴリの狭いセットに制限されている。
ポーズアノテーションを必要とせず、未知のカテゴリに一般化する不正確な3次元モデルの弱い教師付き9-DoFアライメント法を提案する。
論文 参考訳(メタデータ) (2025-07-04T04:46:59Z) - SketchFusion: Learning Universal Sketch Features through Fusing Foundation Models [80.90808879991182]
体系的な分析に基づいて、スケッチ理解のための基礎モデルの2つの基本的な限界を明らかにする。
SDとCLIPを戦略的に組み合わせることで,これらの制約に対処する。
CLIPの機能をSDのデノナイズプロセスに動的に注入し,セマンティックレベルでの機能を適応的に集約することにより,スケッチ検索における最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-03-18T10:47:46Z) - A Lesson in Splats: Teacher-Guided Diffusion for 3D Gaussian Splats Generation with 2D Supervision [65.33043028101471]
本稿では,2次元監視のみを用いた3次元画像調和拡散モデルの学習フレームワークを提案する。
既存の3D生成モデルは、大規模な3Dデータセットが不足しているため、完全に3Dの監視に依存している。
論文 参考訳(メタデータ) (2024-12-01T00:29:57Z) - Not All Voxels Are Equal: Hardness-Aware Semantic Scene Completion with Self-Distillation [23.85582400264946]
セマンティックコンプリート(セマンティックコンプリート、セマンティックコンプリート、セマンティックコンプリート、セマンティックコンプリート、セマンティックコンプリート)は、自動運転車に密集した幾何学的およびセマンティック情報を提供する。
既存の方法は通常、ボクセルの分類問題を定式化し、訓練中に各ボクセルを等しく扱う。
本稿では,シーンモデルを訓練するためのHアプローチを提案する。
論文 参考訳(メタデータ) (2024-04-18T07:25:59Z) - OV-NeRF: Open-vocabulary Neural Radiance Fields with Vision and Language Foundation Models for 3D Semantic Understanding [9.25233177676278]
OV-NeRFは、事前訓練されたビジョンと言語基盤モデルのポテンシャルを利用して、セマンティックフィールド学習を強化する。
提案手法は, Replica と ScanNet の mIoU 測定値において, 20.31% と 18.42% の大幅な改善を実現している。
論文 参考訳(メタデータ) (2024-02-07T08:19:57Z) - 3D Visibility-aware Generalizable Neural Radiance Fields for Interacting
Hands [51.305421495638434]
ニューラル放射場(NeRF)は、シーン、オブジェクト、人間の3D表現を約束する。
本稿では,手動操作のための一般化可能な視認可能なNeRFフレームワークを提案する。
Interhand2.6Mデータセットの実験により、提案したVA-NeRFは従来のNeRFよりも著しく優れていることが示された。
論文 参考訳(メタデータ) (2024-01-02T00:42:06Z) - Semantic Scene Completion with Cleaner Self [93.99441599791275]
セマンティックシーンコンプリート(SSC)は、単一のビュー深さと/またはRGB 2Dピクセルの画像を3Dボクセルに変換し、それぞれのセマンティックラベルが予測される。
SSCは、予測モデルが目に見える表面の背後にあるものを「想像する」必要があるため、よく知られた偽装問題であり、通常はTrncated Signed Distance Function (TSDF) によって表される。
我々は3Dボクセルを用いて、TSDF-CADと呼ばれる完全な可視表面を生成し、次に「クリーン」なSSCモデルを訓練する。
モデルはノイズフリーなので、期待できる。
論文 参考訳(メタデータ) (2023-03-17T13:50:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。