論文の概要: T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- arxiv url: http://arxiv.org/abs/2606.30147v1
- Date: Mon, 29 Jun 2026 11:23:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.20423
- Title: T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation
- Title(参考訳): T2LDM++:リアルテキスト-LiDARシーン生成のための自己定義型表現誘導拡散モデル
- Abstract要約: SCRG(Self-Conditioned Representation Guidance)は、オブジェクトのオーバー・スムーシングを軽減するために用いられる。
幾何アノテーションの一般化戦略を用いて、2つの高品質テキスト-LiDARベンチマークを構築した。
T2LDM++は、無条件および条件設定でリッチな幾何学的詳細を持つ現実的なLiDARシーンを生成することができる。
- 参考スコア(独自算出の注目度): 63.89237657631886
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent progress in Text-to-Image generation benefits from large-scale Text-Image pairs. However, the scarcity of Text-LiDAR pairs often causes over-smoothed scenes and limited controllability. In this paper, we rethink the limitations of Text-LiDAR generation task, focusing on alleviating insufficient training priors and constructing controllable Text-LiDAR data. We propose a \textbf{T}ext-\textbf{to}-\textbf{L}iDAR \textbf{D}iffusion \textbf{M}odel for LiDAR scene generation, T2LDM++, with a Self-Conditioned Representation Guidance (SCRG). Specifically, to alleviate object over-smoothing, SCRG employs a Guidance Network (GN) to provide reconstruction-based soft supervision to the Denoising Network (DN). This enables DN to learn geometry-aware representations through reconstruction guidance, leading to more accurate denoising in DDPMs. Meanwhile, through analysis and design, SCRG exhibits more effective and lightweight, while decoupled in inference, avoiding computational overhead. Furthermore, we construct two high-quality Text-LiDAR benchmarks ($>$100K samples) using a generalized strategy of geometric annotations, along with a controllability metric. Moreover, a directional position prior is designed to mitigate street distortion, further improving scene fidelity. Additionally, T2LDM++ supports multiple conditions, including (Semantic, Box, BEV, Camera)-to-LiDAR, Sparse-to-Dense, and Dense-to-Sparse generation, by learning a control encoder via frozen DN. With effective prior modeling and high-quality Text-LiDAR benchmarks, T2LDM++ can generate realistic LiDAR scenes with rich geometric details in unconditional and conditional settings.
- Abstract(参考訳): 大規模テキスト画像ペアによるテキスト画像生成の最近の進歩
しかし、Text-LiDARペアの不足は、しばしば過度に滑らかなシーンと限定的な制御性を引き起こす。
本稿では、テキスト-LiDAR生成タスクの限界を再考し、不十分なトレーニング事前を緩和し、制御可能なテキスト-LiDARデータを構築することに焦点を当てる。
本稿では,LiDARシーン生成のためのSCRG (Self-Conditioned Representation Guidance) を用いた \textbf{T}ext-\textbf{L}iDAR \textbf{D}iffusion \textbf{M}odelを提案する。
具体的には、オブジェクトの過度な平滑化を緩和するため、SCRGはGuidance Network(GN)を使用して、Denoising Network(DN)に再構築ベースのソフト監視を提供する。
これにより、DNは再構成誘導を通じて幾何認識表現を学習することができ、DDPMのより正確な denoising につながる。
一方、分析と設計により、SCRGはより効率的で軽量であり、推論では分離され、計算オーバーヘッドは回避される。
さらに、幾何学的アノテーションの一般化戦略と可制御性指標を用いて、2つの高品質テキスト-LiDARベンチマーク($100K)を構築した。
さらに、道路の歪みを緩和し、さらにシーンの忠実度を向上させるために、前方方向の位置を設計する。
さらに、T2LDM++は(Semantic、Box、BEV、Camera)-to-LiDAR、Sparse-to-Dense、Dense-to-Sparse生成を含む複数の条件をサポートし、凍結DNを介して制御エンコーダを学習する。
効果的な事前モデリングと高品質なText-LiDARベンチマークにより、T2LDM++は非条件設定と条件設定でリッチな幾何学的詳細を持つリアルなLiDARシーンを生成することができる。
関連論文リスト
- TextLDM: Language Modeling with Continuous Latent Diffusion [89.69255520673248]
拡散変換器(DiT)は、VAEラテント空間におけるフローマッチングで訓練され、画像やビデオ間で統一された視覚生成を行う。
最小限のアーキテクチャ変更で視覚的潜伏拡散のレシピをテキスト生成に転送するTextLDMを提案する。
論文 参考訳(メタデータ) (2026-05-08T13:54:34Z) - Think Bright, Diffuse Nice: Enhancing T2I-ICL via Inductive-Bias Hint Instruction and Query Contrastive Decoding [10.961445998450008]
Text-to-Image In-Context Learningは、インターリーブされたテキストイメージの例を通じて、カスタマイズされた画像合成を可能にする。
既存の方法は、柔軟性を制限し、デプロイメントコストを増大させる、調整されたトレーニングに依存している。
2つの補完的な閉ループ機構を統合したトレーニングフリーフレームワークTBDNを提案する。
論文 参考訳(メタデータ) (2026-01-07T06:39:45Z) - A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation [41.43267776407459]
テキストからLiDAR生成は、下流タスクのためにリッチな構造と多様なシーンで3Dデータをカスタマイズできる。
しかし、Text-LiDARペアの不足は、トレーニング前の不足を招き、過度にスムーズな3Dシーンを生成することが多い。
SCRG(Self-Conditioned Representation Guidance)を用いたシーン生成のためのテキスト対LiDAR拡散モデルT2LDMを提案する。
論文 参考訳(メタデータ) (2025-11-24T11:32:15Z) - RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling [59.088798018184235]
textbfRAPO++は、クロスプラットフォームのプロンプト最適化フレームワークである。
トレーニングデータの整合性向上、テスト時の反復スケーリング、大規模言語モデルの微調整を統一する。
RAPO++は意味的アライメント、構成的推論、時間的安定性、物理的妥当性において大きな進歩を遂げている。
論文 参考訳(メタデータ) (2025-10-23T04:45:09Z) - La La LiDAR: Large-Scale Layout Generation from LiDAR Data [45.5317990948996]
現実的なLiDARシーンの制御可能な生成は、自律運転やロボット工学といった応用に不可欠である。
レイアウト誘導型大規模LiDAR生成モデル(La La LiDAR)を提案する。
La La LiDARは、LiDAR生成と下流認識の両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-08-05T17:59:55Z) - LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs [3.6016438645365834]
制御可能なT2I生成タスクの課題に対処するため, LLM_Control というフレームワークを提案する。
LLM_Controlは、接地性能を向上させることにより、事前学習した拡散モデルを正確に変調する。
我々はマルチモーダル LLM をグローバルコントローラとして利用し,空間レイアウトの配置,意味記述の強化,オブジェクト属性のバインドを行う。
論文 参考訳(メタデータ) (2025-07-26T12:57:02Z) - LiDAR-GS:Real-time LiDAR Re-Simulation using Gaussian Splatting [53.58528891081709]
都市景観におけるLiDARスキャンをリアルタイムかつ高忠実に再現するLiDAR-GSを提案する。
この手法は,公開可能な大規模シーンデータセットのレンダリングフレームレートと品質の両面において,最先端の結果を達成する。
論文 参考訳(メタデータ) (2024-10-07T15:07:56Z) - Text2LiDAR: Text-guided LiDAR Point Cloud Generation via Equirectangular Transformer [38.18396501696647]
テキスト制御可能なLiDARデータ生成モデルであるText2LiDARを提案する。
我々は、LiDAR特徴を捉えるために、設計した等方形アテンションを利用して、等方形トランスアーキテクチャを設計する。
我々は850のシーンから34,149個のLiDAR点雲に対して多様なテキスト記述子を提供するnuLiDARtextを構築した。
論文 参考訳(メタデータ) (2024-07-29T01:18:47Z) - SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models [84.71887272654865]
SparseCtrlは時間的にスパース信号で柔軟な構造制御を可能にする。
トレーニング済みのT2Vモデルに触ることなく、これらのスパース信号を処理するための追加条件が組み込まれている。
提案手法はスケッチ,深度マップ,RGB画像など,さまざまなモダリティと互換性がある。
論文 参考訳(メタデータ) (2023-11-28T16:33:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。