論文の概要: Sparse-Aware Vector Quantization for Bandwidth-Efficient Collaborative 3D Semantic Occupancy Prediction
- arxiv url: http://arxiv.org/abs/2607.01928v1
- Date: Thu, 02 Jul 2026 09:23:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.759063
- Title: Sparse-Aware Vector Quantization for Bandwidth-Efficient Collaborative 3D Semantic Occupancy Prediction
- Title(参考訳): バンド幅効率のよい3次元セマンティック占有予測のためのスパースアウェアベクトル量子化
- Abstract要約: 協調知覚は、複数の車両が相補的な知覚情報を交換できるようにすることで、単一エージェントの知覚を拡張する。
既存の方法は一般的に3D機能を2Dに圧縮し、空間情報を失う。
本稿では,帯域効率の良い協調ベクトル量子化セマンティック占有予測フレームワークを提案する。
提案手法は,通信容量を最大82倍に削減しつつ,最先端の性能を実現する。
- 参考スコア(独自算出の注目度): 5.902824856447626
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Collaborative perception extends single-agent perception by enabling multiple vehicles to exchange complementary perceptual information. However, it introduces an inherent trade-off between perception gain and communication overhead, which is particularly severe for 3D semantic occupancy prediction that relies on fine-grained spatial structures. Existing methods typically compress 3D features into 2D, causing severe spatial information loss, or transmit dense 3D representations, hindering real-world deployment. To overcome these limitations, we propose a bandwidth-efficient collaborative Vector Quantization Semantic Occupancy Prediction (VQSOP) framework. VQSOP employs a Sparse-Aware Vector Quantization (SAVQ) mechanism that exploits 3D scene sparsity to compactly encode informative regions, drastically reducing communication overhead while preserving complete geometric context. Furthermore, to enhance structural consistency and feature continuity, we design a Dual-Branch Adaptive Spatial Refinement (ASR) module that dynamically fuses local high-frequency details with broad contextual semantics. Extensive experiments demonstrate that our approach achieves state-of-the-art performance while reducing communication volume by up to 82x.
- Abstract(参考訳): 協調知覚は、複数の車両が相補的な知覚情報を交換できるようにすることで、単一エージェントの知覚を拡張する。
しかし、それは知覚の利得とコミュニケーションのオーバーヘッドの間に固有のトレードオフを導入し、特にきめ細かい空間構造に依存する3D意味的占有率予測には厳しい。
既存の方法は一般的に3D機能を2Dに圧縮し、空間情報を失うか、密集した3D表現を送信し、現実世界の展開を妨げる。
これらの制約を克服するために、帯域効率の協調ベクトル量子化Semantic Occupancy Prediction (VQSOP) フレームワークを提案する。
VQSOPはスパース・アウェア・ベクター量子化(SAVQ)機構を採用しており、3Dシーンの間隔を利用して情報領域をコンパクトに符号化し、完全な幾何学的コンテキストを維持しながら通信オーバーヘッドを大幅に削減する。
さらに、構造的一貫性と特徴連続性を高めるため、広義の文脈意味論で局所的な高周波の詳細を動的に融合するDual-Branch Adaptive Spatial Refinement (ASR)モジュールを設計する。
大規模実験により, 通信容量を最大82倍に抑えながら, 最先端の性能を実現することができた。
関連論文リスト
- FDR-Occ: Factorized Dense Routing for Full-Spectrum 3D Occupancy Prediction [63.738631229597274]
視覚に基づく3次元占有予測は、基本的に2次元から3次元のビュー変換に依存している。
現在のパラダイムは、厳密でスパースなカメラ線にルーティング行列を人工的に制限する明示的な物理射影を主に利用している。
本稿では,このボトルネックを解消するためにFDR(Facterized Dense Routing)を提案する。
本フレームワークは,Occ3D-nuScenesおよびOcc3D-Waymoベンチマークの最先端性能を実現する。
論文 参考訳(メタデータ) (2026-07-04T11:12:42Z) - SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video [88.79625979053873]
事前学習型視覚言語モデル(VLM)のための新しいフレームワークSpaceEraを提案する。
データ構築、モデル設計、トレーニング最適化、推論の促進にまたがる、SpaceEra++と呼ばれる、オリジナルのフレームワークを包括的なシステムに拡張します。
さらに,空間的推論を強化するために,絶対座標と相対空間関係を協調的に利用することにより,対物制約を強制するSpaceAlignを開発した。
論文 参考訳(メタデータ) (2026-07-02T06:56:29Z) - UnsOcc: 3D Semantic Occupancy Prediction in Unstructured Scene via Rendering Fusion [2.4196046716427393]
UnsOccは、非構造化環境における堅牢性を改善するマルチモーダルな3Dセマンティック占有予測フレームワークである。
その中核となるのはレンダリングベースの融合モジュールRenderFusionで、これはクロスモーダルな特徴アライメントを強化する。
提案手法は既存の最先端手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-06-02T12:50:14Z) - SUG-Occ: An Explicit Semantics and Uncertainty Guided Sparse Learning Framework for Real-Time 3D Occupancy Prediction [5.730573889498275]
SuG-Occは明示的なセマンティックスと不確実性ガイドによるスパース学習を可能とした3D職業予測フレームワークである。
まず、ビュー変換時の自由空間からの射影を抑えるために、意味的および不確実性事前を利用する。
次に、幾何整合性を高めるために明示的な符号なし距離符号化を用い、構造的に一貫したスパース3D表現を生成する。
論文 参考訳(メタデータ) (2026-01-16T16:07:38Z) - MCOP: Multi-UAV Collaborative Occupancy Prediction [40.58729551462363]
Current Bird's Eye View (BEV)ベースのアプローチには2つの大きな制限がある。
本稿では,複数UAV共同占有予測フレームワークを提案する。
提案手法は最先端の精度を達成し,既存の協調手法を著しく上回っている。
論文 参考訳(メタデータ) (2025-10-14T16:17:42Z) - Semantic Causality-Aware Vision-Based 3D Occupancy Prediction [63.752869043357585]
視覚に基づく3Dセマンティック占有予測は、3Dビジョンにおいて重要な課題である。
しかし、既存のメソッドは、しばしばモジュラーパイプラインに依存している。
本稿では,モジュール型2D-to-3Dトランスフォーメーションパイプラインの全体的,エンドツーエンドの監視を可能にする新たな因果損失を提案する。
論文 参考訳(メタデータ) (2025-09-10T08:29:22Z) - Vision-Only Gaussian Splatting for Collaborative Semantic Occupancy Prediction [12.80732853899807]
協調認識により、連結車両は情報を共有できる。
既存の3Dセマンティック占有予測のための視覚のみの手法は、一般的に密度の高い3Dボクセルに依存している。
本稿では,スパース3Dセマンティックスプラッティングを利用した3Dセマンティック占有予測手法を提案する。
論文 参考訳(メタデータ) (2025-08-12T19:50:34Z) - Ultra3D: Efficient and High-Fidelity 3D Generation with Part Attention [54.15345846343084]
品質を損なうことなくスパースボクセルモデリングを大幅に高速化する,効率的な3D生成フレームワークであるUltra3Dを提案する。
部分注意(Part Attention)は、意味的に一貫した部分領域内での注意計算を制限する幾何学的な局所的注意機構である。
実験により、Ultra3Dは1024の解像度で高解像度の3D生成をサポートし、視覚的忠実度とユーザの好みの両方で最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-07-23T17:57:16Z) - CompGS++: Compressed Gaussian Splatting for Static and Dynamic Scene Representation [60.712165339762116]
CompGS++はコンパクトガウスプリミティブを活用して正確な3Dモデリングを実現する新しいフレームワークである。
私たちの設計は、プリミティブ間の冗長性をなくすという原則に基づいている。
私たちの実装は、さらなる研究を促進するためにGitHubで公開されます。
論文 参考訳(メタデータ) (2025-04-17T15:33:01Z) - Which2comm: An Efficient Collaborative Perception Framework for 3D Object Detection [5.195291754828701]
協調認識は、リアルタイムのエージェント間の情報交換を可能にする。
実用シナリオにおける通信帯域幅の制限は、エージェント間データ転送量を制限する。
オブジェクトレベルのスパース機能を利用した新しいマルチエージェント3Dオブジェクト検出フレームワークであるH which2commを提案する。
論文 参考訳(メタデータ) (2025-03-21T14:24:07Z) - ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions [91.55655961014027]
シーン理解には3次元セマンティック占有とフロー予測が不可欠である。
本稿では,3つの改善点を目標とした視覚ベースのフレームワークを提案する。
我々の純粋な畳み込みアーキテクチャは、セマンティック占有率とジョイントセマンティックフロー予測の両方のために、複数のベンチマーク上で新しいSOTA性能を確立する。
論文 参考訳(メタデータ) (2024-11-12T11:32:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。