論文の概要: Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation
- arxiv url: http://arxiv.org/abs/2606.24206v1
- Date: Tue, 23 Jun 2026 06:48:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.807835
- Title: Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation
- Title(参考訳): 多視点連続合成3D生成のための包括的対話型衝突
- Authors: Chang Liu, Mingwen Shao, Xiang Lv, Xinyuan Chen, Lingzhuang Meng, Qiao Zhang, Zhengyi Gong, Jinghao Hu,
- Abstract要約: 我々は,多視点一貫した合成3Dアセットを合理的な相互作用で生成する新しい最適化手法であるI2C-3Dを提案する。
具体的には、合理的な相互作用領域に自然に現れるガウス的プリミティブを導くための包括的対話的衝突戦略を提案する。
マルチビュー整合性を高めるため,マルチビュー適応スコア蒸留サンプリング法を考案し,事前学習拡散モデルを用いて,複数ビュー整合性前とレイアウト前を抽出する。
- 参考スコア(独自算出の注目度): 25.750694245523217
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recent breakthroughs in 3D generation have advanced notably with the development of text-to-image diffusion model. However, existing methods remain two practical challenges: (1) They primarily generate single 3D object, but struggle to generate multi-object compositional 3D assets due to the lack of the modeling for Gaussian primitives in reasonable interactions. (2) They often suffer from cross-view inconsistency during 3D optimization, as Score Distillation Sampling inherently performs on each single view, inevitably resulting in cross-view hallucinations. To solve above issues, we propose I2C-3D, a novel optimization-based method to generate multi-view consistent compositional 3D assets with reasonable interactions. Specifically, we propose an Inclusive Interactive Collisions strategy to guide Gaussian primitives appearing in reasonable interaction regions naturally, thereby ensuring objects in the compositional scene interact in a physically plausible and visually coherent way. Additionally, to enhance multi-view consistency, Multi-View Adaptive Score Distillation Sampling is devised to distill multi-view consistency prior and layout prior from pre-trained diffusion model by modulating attention map of instance token and spatial token across viewpoints. Benefiting from above elaborate designs, I2C-3D not only generates high-fidelity multi-view consistent compositional 3D assets but also supports 3D editing flexibly, facilitating complex scene generation. Extensive experiments demonstrate our I2C-3D outperforms existing methods in generation quality and multi-view consistency.
- Abstract(参考訳): テキスト・ツー・イメージ拡散モデルの開発により,最近の3D生成の進展が顕著に進んでいる。
しかし、既存の手法は、(1)主に1つの3Dオブジェクトを生成するが、合理的な相互作用におけるガウス原始体のモデリングが欠如しているため、多目的合成3Dアセットを生成するのに苦労する。
2) スコア蒸留サンプリングは個々のビューに対して本質的に動作し,必然的にクロスビュー幻覚を生じさせるため,3次元最適化におけるクロスビューの不整合に悩まされることが多い。
上記の課題を解決するために,多視点一貫した合成3Dアセットを合理的な相互作用で生成する新しい最適化手法であるI2C-3Dを提案する。
具体的には、合理的な相互作用領域に自然に現れるガウス原始体を誘導する包括的対話型衝突戦略を提案し、それによって、構成シーン内の物体が物理的に可視かつ視覚的にコヒーレントな方法で相互作用することを保証する。
さらに,マルチビューの整合性を高めるため,複数ビュー適応スコア蒸留サンプリング法により,事前学習拡散モデルから,複数ビューの整合性事前とレイアウトを抽出し,視点をまたいだインスタンストークンと空間トークンのアテンションマップを変調することによって実現した。
上記の精巧な設計から得られたI2C-3Dは、高忠実な多視点一貫した合成3Dアセットを生成するだけでなく、柔軟に3D編集をサポートし、複雑なシーン生成を容易にする。
我々のI2C-3Dは、生成品質と多視点整合性において既存の手法より優れていることを示す。
関連論文リスト
- DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing [47.437239634403426]
自然言語による合成・オブジェクトレベルの制御が可能なテキスト誘導型3D編集のための新しいパーソナライズ手法を提案する。
本手法は,2次元のパーソナライゼーションの柔軟性を3次元に伝達し,忠実な編集とアイデンティティ保存を実現する。
論文 参考訳(メタデータ) (2026-05-16T13:21:22Z) - Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors [61.34273238077091]
本稿では,物体の単一画像からオービタルビデオを生成する新しい手法を提案する。
本手法は,最先端の手法と比較して,視覚的品質,形状リアリズム,多視点整合性を実現している。
論文 参考訳(メタデータ) (2026-04-14T05:35:46Z) - Interact3D: Compositional 3D Generation of Interactive Objects [31.12099147294145]
本稿では,3次元合成オブジェクト間の相互作用を物理的に妥当に生成する新しいフレームワークを提案する。
当社のアプローチは、まず先進的な先進的な先進的手法を活用して、高品質な個人資産をキュレートする。
これらの資産を物理的に構成するために、ロバストな2段階合成パイプラインを導入する。
論文 参考訳(メタデータ) (2026-03-17T03:21:06Z) - CDI3D: Cross-guided Dense-view Interpolation for 3D Reconstruction [25.468907201804093]
大規模再構成モデル (LRM) は, 2次元拡散モデルにより生成された多視点画像を利用して3次元コンテンツを抽出する際の大きな可能性を示している。
しかし、2次元拡散モデルはしばしば、強い多視点一貫性を持つ高密度画像を生成するのに苦労する。
CDI3Dは,高画質で高画質な3D画像生成を実現するためのフィードフォワードフレームワークである。
論文 参考訳(メタデータ) (2025-03-11T03:08:43Z) - SeMv-3D: Towards Concurrency of Semantic and Multi-view Consistency in General Text-to-3D Generation [122.47961178994456]
SeMv-3Dは、GT23D生成におけるセマンティックアライメントとマルチビュー一貫性を協調的に強化する新しいフレームワークである。
本稿では,TPL(Triplane Prior Learning)について紹介する。
我々はまた、一貫した任意のビュー合成を可能にする、三葉飛行機(SAT)における事前ベースセマンティックアライニング(Semantic Aligning)を提案する。
論文 参考訳(メタデータ) (2024-10-10T07:02:06Z) - Grounded Compositional and Diverse Text-to-3D with Pretrained Multi-View Diffusion Model [65.58911408026748]
複雑な合成文のプロンプトを正確に追従できる3Dアセットを生成するために,グラウンドド・ドレーマーを提案する。
まず,テキスト・ツー・3Dパイプラインのボトルネックとして,テキスト誘導4視点画像の活用を提唱する。
次に,テキストアラインな4ビュー画像生成を促すための注意再焦点機構を導入する。
論文 参考訳(メタデータ) (2024-04-28T04:05:10Z) - ComboVerse: Compositional 3D Assets Creation Using Spatially-Aware Diffusion Guidance [76.7746870349809]
複雑な構成で高品質な3Dアセットを生成する3D生成フレームワークであるComboVerseについて,複数のモデルを組み合わせることを学習して紹介する。
提案手法は,標準スコア蒸留法と比較して,物体の空間的アライメントを重視している。
論文 参考訳(メタデータ) (2024-03-19T03:39:43Z) - Wonder3D: Single Image to 3D using Cross-Domain Diffusion [105.16622018766236]
Wonder3Dは、単一視点画像から高忠実なテクスチャメッシュを効率的に生成する新しい手法である。
画像から3Dまでのタスクの品質,一貫性,効率性を総括的に改善するため,領域間拡散モデルを提案する。
論文 参考訳(メタデータ) (2023-10-23T15:02:23Z) - Multi-View Consistent Generative Adversarial Networks for 3D-aware Image
Synthesis [48.33860286920389]
3D認識画像合成は、3D表現を学習することにより、複数のビューからオブジェクトの画像を生成することを目的としている。
既存のアプローチには幾何学的制約がないため、通常はマルチビュー一貫性のある画像を生成することができない。
幾何制約付き高品質な3次元画像合成のためのマルチビュー一貫性ジェネレータネットワーク(MVCGAN)を提案する。
論文 参考訳(メタデータ) (2022-04-13T11:23:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。