論文の概要: Scaling 3D Generative Priors to Large-Scale Scene Meshes from Multi-View Images
- arxiv url: http://arxiv.org/abs/2609.06385v1
- Date: Sun, 06 Sep 2026 04:52:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 05:44:39.608894
- Title: Scaling 3D Generative Priors to Large-Scale Scene Meshes from Multi-View Images
- Title(参考訳): マルチビュー画像からの大規模シーンメッシュの3次元生成前処理のスケールアップ
- Abstract要約: 事前訓練された3D生成モデルは、詳細な幾何学と外観を生成するが、主に空間範囲の範囲内でオブジェクト中心の生成のために設計されている。
近年のアプローチでは、大きなシーンを小さな空間領域に分割し、各領域に事前訓練された3D生成前処理を適用することで、この制限に対処している。
マルチビュー画像から大規模テクスチャメッシュを生成するためのトレーニングフリーフレームワークを提案する。
- 参考スコア(独自算出の注目度): 5.787939851305456
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Pretrained 3D generative models produce detailed geometry and appearance but are primarily designed for object-centric generation within a limited spatial extent. Recent approaches address this limitation by partitioning large scenes into smaller spatial regions and applying pretrained 3D generative priors to each region. However, scaling tiled generation to large multi-view scenes makes it challenging to maintain local geometric continuity and global appearance consistency. We present a training-free framework for large-scale textured mesh generation from multi-view images. Our key idea is to scale tiled generation to large scenes with increased spatial detail while coordinating generation both locally and globally. We introduce local context tiled generation to improve geometric continuity between neighboring regions and global appearance alignment to reduce appearance discrepancies across distant regions. An adaptive scene decomposition further determines the number of tiles according to the input scene geometry. Experiments demonstrate improved geometric and appearance fidelity over existing approaches while enabling fine-grained generation of large-scale scenes.
- Abstract(参考訳): 事前訓練された3D生成モデルは、詳細な幾何学と外観を生成するが、主に空間範囲の範囲内でオブジェクト中心の生成のために設計されている。
近年のアプローチでは、大きなシーンを小さな空間領域に分割し、各領域に事前訓練された3D生成前処理を適用することで、この制限に対処している。
しかし、マルチビューシーンへの拡張は、局所的な幾何学的連続性とグローバルな外観整合性の維持を困難にしている。
マルチビュー画像から大規模テクスチャメッシュを生成するためのトレーニングフリーフレームワークを提案する。
我々のキーとなる考え方は、局所的にも世界的にも生成をコーディネートしながら、空間的詳細性を高めながら、タイル付き世代を大きなシーンにスケールすることだ。
周辺地域間の幾何的連続性を改善するために局所文脈型タイル生成を導入し,地球規模の外観アライメントを向上し,遠隔地における外観の相違を低減した。
適応シーン分解は、入力シーン形状に応じてタイル数をさらに決定する。
実験では、既存のアプローチよりも幾何的および外観忠実性が向上し、大規模シーンのきめ細かい生成を可能にした。
関連論文リスト
- SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration [32.39337008619354]
単一画像の3Dシーン生成を3つの構造化ステージに分解するマルチエージェントオーケストレーションフレームワークを提案する。
ポイントマップから導出される疎幾何学的事前情報によって教師される幾何学的レイアウト予測器を提案する。
本手法は,幾何学的精度,空間的整合性,知覚的リアリズムにおいて,従来手法よりも常に優れていた。
論文 参考訳(メタデータ) (2026-06-07T01:38:39Z) - GenRecon: Bridging Generative Priors for Multi-View 3D Scene Reconstruction [69.35136600319714]
マルチビューRGB画像から高忠実度3Dシーンを再現する手法を提案する。
シーン再構成を条件付き3次元生成として,空間的局所化,重なり合うチャンクの集合に配置した。
切刃再建法を16%上回る高忠実度結果を得た。
論文 参考訳(メタデータ) (2026-05-22T17:49:59Z) - SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation [7.655860434125127]
本稿では,各占有ボクセルが一定数の色付き表面サンプルを格納する離散表現である$-Voxfield gridに基づく3D生成フレームワークを提案する。
この表現を生成するために,局所的なボクセル近傍で動作する意味条件付き拡散モデルを訓練する。
重なり合う領域にプログレッシブな空間効果を生かして大きなシーンにスケールする。最後に、生成された$-Voxfield グリッドを遅延レンダリングモジュールで描画し、フォトリアリスティックな画像を得る。
論文 参考訳(メタデータ) (2026-04-07T17:24:29Z) - NuiWorld: Exploring a Scalable Framework for End-to-End Controllable World Generation [19.342379757491177]
我々は,次世代の課題に対処するためのフレームワークであるNuiWorldを紹介する。
さまざまなサイズとレイアウトのシーンを合成し、エンドツーエンドモデルをトレーニングするのに十分なデータを生成します。
筆者らのフレームワークは,擬似スケッチラベルによる制御性を実現し,以前は見つからなかったスケッチに対する一般化の度合いを示す。
論文 参考訳(メタデータ) (2026-01-27T00:04:02Z) - AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding [58.90269958632018]
シングルビュー屋内シーン生成は、様々な現実世界のアプリケーションにおいて重要な役割を担っている。
近年,拡散モデルと深度推定ネットワークを活用して進展している。
高忠実度形状で360度映像を生成する新しいゼロショットパイプラインAnchoredDreamを提案する。
論文 参考訳(メタデータ) (2026-01-23T08:08:12Z) - WorldGrow: Generating Infinite 3D World [75.81531067447203]
我々は、無限に拡張可能な3D世界、すなわちコヒーレントな幾何学と現実的な外観を持つ大規模で連続的な環境を生み出すという課題に取り組む。
本研究では,非有界な3次元シーン合成のための階層的フレームワークWorldGrowを提案する。
提案手法は,(1)高品質なシーンブロックを抽出し,シーン生成に適した3D構造化潜在表現を作成するデータキュレーションパイプライン,(2)コンテキスト認識シーン拡張を可能にする3Dブロックインペイント機構,(3)グローバルなレイアウトの妥当性と局所幾何学的/音声的忠実性の両立を保証する粗大かつ微細な生成戦略,の3つのコアコンポーネントを特徴とする。
論文 参考訳(メタデータ) (2025-10-24T17:39:52Z) - G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior [53.762256749551284]
我々は,3次元シーン再構成を効果的に活用するための基本的な前提条件として,正確な幾何学を同定する。
生成パイプライン全体にこの幾何学的ガイダンスを導入し、可視性マスク推定を改善し、新しいビュー選択をガイドし、ビデオ拡散モデルに着色した場合の多視点一貫性を向上させる。
本手法は,屋内および屋外の両方のシナリオにおいて,高い一般化性を有するシングルビュー入力とアンポーズ映像を自然にサポートする。
論文 参考訳(メタデータ) (2025-10-14T03:06:28Z) - MeshMosaic: Scaling Artist Mesh Generation via Local-to-Global Assembly [62.48017648785026]
MeshMosaicは,100K以上の三角形にスケールするアーティストメッシュ生成のための,新たなローカル・グローバルなフレームワークである。
MeshMosaicは,幾何学的忠実度とユーザの好みの両方において,最先端の手法を著しく上回ることを示す。
論文 参考訳(メタデータ) (2025-09-24T11:02:03Z) - X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability [49.4647778989539]
X-Sceneは大規模ドライビングシーン生成のための新しいフレームワークである。
幾何的複雑度と外観の忠実度の両方を実現し、フレキシブルな制御性を提供する。
X-Sceneは、大規模な運転シーン生成のための制御性と忠実性を大幅に向上させる。
論文 参考訳(メタデータ) (2025-06-16T14:43:18Z) - StarGen: A Spatiotemporal Autoregression Framework with Video Diffusion Model for Scalable and Controllable Scene Generation [12.016502857454228]
StarGenは、トレーニング済みのビデオ拡散モデルを長距離シーン生成のために自動回帰的に利用するフレームワークである。
各ビデオクリップの生成は、隣接する画像の3Dワープと、以前に生成されたクリップから時間的に重なる画像とに条件付けされる。
論文 参考訳(メタデータ) (2025-01-10T07:41:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。