論文の概要: FPSGen: Flexible Point Cloud Scene Generation with BEV-Supported Transport Flows
- arxiv url: http://arxiv.org/abs/2607.26645v1
- Date: Wed, 29 Jul 2026 09:06:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.605768
- Title: FPSGen: Flexible Point Cloud Scene Generation with BEV-Supported Transport Flows
- Title(参考訳): FPSGen: BEV対応輸送流を用いたフレキシブルポイントクラウドシーン生成
- Authors: Wenzhe He, Meng Wang, JiaWei Qian, Jinfeng Xu, Ying Liu, Ruihui Li,
- Abstract要約: 既存の屋外シーンのポイントベース生成手法は主にLiDARの完成に焦点を当てている。
部分スキャンとは無関係に点源を構成するフレキシブルなフレームワークであるFPSGenを提案する。
- 参考スコア(独自算出の注目度): 16.463491547919155
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing point-based generative methods for outdoor scenes primarily focus on LiDAR-conditioned completion. During training, noisy point clouds are constructed by perturbing complete ground-truth scenes, whereas during inference, they are initialized by adding noise to duplicated partial scans. This train-inference mismatch inherits the sparsity and visibility bias of partial scans, leading to sparse distant regions and incomplete geometry in occluded areas. Moreover, the reliance on partial scans restricts generation when LiDAR observations are unavailable or replaced by layout cues. We present FPSGen, a flexible framework that constructs point sources independently of partial scans. FPSGen first predicts a bird's-eye-view (BEV) prior with density, height, and mask channels from the active cues. The density map is then sampled to form a BEV-supported point source, enabling both unconditional and conditioned initialization. A teacher-student approximate optimal transport scheme then uses teacher-predicted endpoints to learn a velocity field that induces straighter transport paths. By integrating BEV point source construction with path-straightening transport, FPSGen provides a unified framework for unconditional and flexible cue-conditioned scene generation. Extensive experiments show that FPSGen achieves state-of-the-art JSD and voxel IoU performance on SemanticKITTI completion while maintaining strong performance with a single point transport step. On KITTI-360 unconditional generation, it also achieves the best Coverage (COV) among the compared methods.
- Abstract(参考訳): 既存の屋外シーンのポイントベース生成手法は主にLiDAR条件付き完了に焦点を当てている。
トレーニング中、ノイズの多い点雲は、完全に接地されたシーンを摂動することで構成されるが、推論中は、重複部分スキャンにノイズを加えることで初期化される。
この列車干渉ミスマッチは部分走査の空間性と可視性バイアスを継承し、疎遠な領域と閉塞領域の不完全幾何をもたらす。
さらに、部分スキャンへの依存は、LiDAR観測が利用できない場合やレイアウトキューで置き換えられた場合、生成を制限する。
部分スキャンとは無関係に点源を構成するフレキシブルなフレームワークであるFPSGenを提案する。
FPSGenはまず、アクティブなキューからの密度、高さ、マスクチャネルに先立って、鳥の目視(BEV)を予測する。
その後、密度マップをサンプリングしてBEVをサポートする点源を形成し、無条件初期化と条件初期化の両方を可能にする。
教師による近似的最適輸送スキームは、教師予測エンドポイントを使用して、より直線的な輸送経路を誘導する速度場を学習する。
BEVポイントソース構築とパスストレート化トランスポートを統合することで、FPSGenは、無条件で柔軟なキュー条件のシーン生成のための統一されたフレームワークを提供する。
広汎な実験により,FPSGenはセマンティックKITTI完了時に最先端のJSDとボクセルIoUの性能を達成し,単一点輸送ステップで高い性能を維持した。
KITTI-360 の非条件生成では、比較した手法の中で最高のカバレッジ(COV)を達成する。
関連論文リスト
- Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction [77.75911117889915]
現在のエンドツーエンドのマルチビュー3D再構成手法は、目覚ましい結果を得るが、制限的な静的仮定に依存している。
この理想的な入力への依存は、最も高度なメソッドでさえ、現実世界の設定で失敗する原因となる。
非一貫性の視点から頑健な再構築を行うためのエンドツーエンドフレームワークであるWildにおけるビジュアルジオメトリトランスフォーマーを提案する。
論文 参考訳(メタデータ) (2026-06-22T02:52:22Z) - GOLD-BEV: GrOund and aeriaL Data for Dense Semantic BEV Mapping of Dynamic Scenes [2.209816278926315]
本稿では,時間同期空中画像を用いた密集した鳥眼環境マップ(BEV)を訓練中のみ監視する枠組みを提案する。
金-BEV対応の空中作物は直感的な目標空間を提供し、手作業を最小限に抑えた密集した意味的アノテーションを可能にする。
我々は,エゴセンサからの擬似空中BEV画像の合成を学習することによって,空域を超えて拡張する。
論文 参考訳(メタデータ) (2026-04-21T12:39:41Z) - CoFL: Continuous Flow Fields for Language-Conditioned Navigation [14.35468089349405]
CoFLは、鳥眼ビュー(BEV)観察と言語指導をナビゲーションのための連続フローフィールドにマッピングするエンドツーエンドのポリシーである。
混合分布の訓練により、CoFLはモジュラービジョン・ランゲージ・モデル(VLM)ベースのプランナーよりも大幅に優れている。
論文 参考訳(メタデータ) (2026-03-03T11:02:55Z) - Faster Training, Fewer Labels: Self-Supervised Pretraining for Fine-Grained BEV Segmentation [6.399280002773129]
細粒度道路マーキングセグメンテーションのための2段階トレーニング戦略を提案する。
自己教師付き事前トレーニングの間、BEVFormerの予測はイメージプレーンに異なる方法で再プロジェクションされる。
その後の教師付き微調整フェーズでは、データセットの50%しか必要とせず、トレーニング時間が大幅に短縮される。
論文 参考訳(メタデータ) (2026-02-20T08:37:58Z) - DANCE: Density-agnostic and Class-aware Network for Point Cloud Completion [1.7188280334580195]
ポイント雲の完成は、不完全な3Dスキャンから欠落した幾何学的構造を復元することを目的としている。
DANCEは、観測された幾何学を保ちながら、欠落した領域のみを完成させる新しいフレームワークである。
論文 参考訳(メタデータ) (2025-11-11T08:45:06Z) - PVNet: Point-Voxel Interaction LiDAR Scene Upsampling Via Diffusion Models [57.02789948234898]
拡散モデルに基づく点-ボクセル相互作用フレームワークであるPVNetを提案する。
具体的には、スパース点雲を誘導条件とし、近くのフレームから得られた合成点雲を入力とする。
さらに,各アップサンプリング点の環境認識能力を効率よく向上する点とボクセルの両方の機能を統合する点とボクセルの相互作用モジュールを提案する。
論文 参考訳(メタデータ) (2025-08-23T14:55:03Z) - Towards the Uncharted: Density-Descending Feature Perturbation for Semi-supervised Semantic Segmentation [51.66997548477913]
本稿では,DDFP(Dedentity-Descending Feature Perturbation)という特徴レベルの一貫性学習フレームワークを提案する。
半教師付き学習における低密度分離仮定にインスパイアされた私たちの重要な洞察は、特徴密度はセグメンテーション分類器が探索する最も有望な方向の光を放つことができるということである。
提案したDFFPは、機能レベルの摂動に関する他の設計よりも優れており、Pascal VOCとCityscapesのデータセット上でのアートパフォーマンスの状態を示している。
論文 参考訳(メタデータ) (2024-03-11T06:59:05Z) - BEV-IO: Enhancing Bird's-Eye-View 3D Detection with Instance Occupancy [58.92659367605442]
我々は,BEV表現をインスタンス占有情報で拡張する新しい3次元検出パラダイムであるBEV-IOを提案する。
BEV-IOは、パラメータや計算オーバーヘッドの無視できる増加しか加えず、最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-26T11:16:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。