論文の概要: MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
- arxiv url: http://arxiv.org/abs/2607.12000v1
- Date: Mon, 13 Jul 2026 17:51:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.923466
- Title: MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors
- Title(参考訳): MetaView: スケール・アウェア・インシシット・ジオメトリによるモノクルな新規ビュー合成
- Abstract要約: 拡散型モノクラービュー合成フレームワークであるMetaViewを提案する。
我々の重要な洞察は、暗黙の幾何学的モデリングと最小でも必須の明示的な3Dキューを組み合わせることである。
挑戦的なモノラルな大きな視点の変化の下で、MetaViewは既存のメソッドを著しく上回り、より優れた一般化を示している。
- 参考スコア(独自算出の注目度): 62.75160828228465
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Current visual generation models are capable of producing high-quality content, yet they lack a coherent perception of the spatial structure. Existing generative novel view synthesis methods typically introduce explicit geometry priors, which enforce spatial consistency but inherently restrict generalization in large view changes. In contrast, recent interactive generative methods favor implicit scene modeling, offering greater flexibility at the cost of precise camera control and geometry consistency. In this paper, we propose MetaView, a diffusion-based monocular novel view synthesis framework that enables rendering under large view changes from a single image. Our key insight is to combine implicit geometry modeling with minimal yet essential explicit 3D cues: we incorporate implicit geometry priors from a feed-forward geometry perception network to regularize structure without imposing restrictive reconstruction pipelines, while leveraging metric depth to anchor the generation to a metric scale. This design allows MetaView to achieve both geometry consistency and precise controllability. Extensive experiments demonstrate that, under challenging monocular large viewpoint changes, MetaView significantly outperforms existing methods and exhibits superior generalization. Our code is publicly available at https://github.com/KlingAIResearch/MetaView.
- Abstract(参考訳): 現在の視覚生成モデルは高品質なコンテンツを生成することができるが、空間構造のコヒーレントな認識は欠如している。
既存の生成的新しいビュー合成法は、通常、空間的一貫性を強制するが、大きなビュー変化の一般化を本質的に制限する、明示的な幾何学的先行を導入している。
対照的に、近年のインタラクティブな生成手法は暗黙的なシーンモデリングを好んでおり、正確なカメラ制御と幾何整合性のコストでより柔軟性を提供する。
本稿では,拡散型モノクラービュー合成フレームワークであるMetaViewを提案する。
我々の重要な洞察は、暗黙的幾何モデリングと最小限で必須な明示的な3次元キューを組み合わせることである。我々は、制限的な再構築パイプラインを課さずに構造を正規化するためにフィードフォワード幾何知覚ネットワークからの暗黙的な幾何先行を組み込んで、メートル法深度を利用して生成をメートル法スケールに固定する。
この設計により、MetaViewは幾何学的整合性と正確な制御性の両方を達成することができる。
大規模な実験により、単分子的な大きな視点変化の挑戦の下で、MetaViewは既存の手法を著しく上回り、より優れた一般化を示すことが示された。
私たちのコードはhttps://github.com/KlingAIResearch/MetaView.comで公開されています。
関連論文リスト
- WorldSculpt: Generating Compositional Worlds from Grounded Videos [50.427204240556854]
本研究では,数百個のオブジェクトを含む散在するシーンの合成3次元表現を生成する問題について検討する。
この課題は、物体が互いに強く干渉し合うような密集したシーンにおいて挑戦的であり、それぞれのビューはその幾何のごく一部しか明らかにしない。
多視点観察に先立ち、強い単物体3D生成を適応させることにより、数百個の物体からなる複雑なシーンを合成的に生成できることが示される。
論文 参考訳(メタデータ) (2026-09-04T17:59:35Z) - AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding [58.90269958632018]
シングルビュー屋内シーン生成は、様々な現実世界のアプリケーションにおいて重要な役割を担っている。
近年,拡散モデルと深度推定ネットワークを活用して進展している。
高忠実度形状で360度映像を生成する新しいゼロショットパイプラインAnchoredDreamを提案する。
論文 参考訳(メタデータ) (2026-01-23T08:08:12Z) - TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction [57.46712611558817]
3次元視覚基礎モデルでは、1つのフィードフォワードパスを通して、未校正画像からキー3D属性を再構成する際の強力な一般化が示されている。
近年の戦略は,グローバルトランスフォーメーションの解決によって連続的な予測と整合するが,本分析では,仮定の妥当性,局所的なアライメント範囲,雑音的幾何の下でのロバスト性といった基本的な限界を明らかにしている。
本研究では,グローバルに伝播する制御点を利用して空間的に異なる不整合を補正する,Tin Plate Splineに基づく高DOFおよび長期アライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-02T02:22:20Z) - IGGT: Instance-Grounded Geometry Transformer for Semantic 3D Reconstruction [82.53307702809606]
人間は自然に3次元世界の幾何学的構造と意味的内容を中間次元として知覚する。
本稿では,空間再構成とインスタンスレベルの文脈理解の両面での知識を統合するために,IGGT (InstanceGrounded Geometry Transformer) を提案する。
論文 参考訳(メタデータ) (2025-10-26T14:57:44Z) - AlignGS: Aligning Geometry and Semantics for Robust Indoor Reconstruction from Sparse Views [18.361136390711415]
屋内シーンのセマンティックにリッチな3Dモデルへの需要は急速に増加しており、拡張現実、仮想現実、ロボット工学の応用によって推進されている。
既存の手法は、しばしば意味論を、既に形成され、潜在的に欠陥のある幾何学に描かれた受動的特徴として扱う。
本稿では、このビジョンを実現する新しいフレームワークであるAlignGSを紹介し、幾何学と意味論の相乗的でエンドツーエンドの最適化を開拓する。
論文 参考訳(メタデータ) (2025-10-09T06:30:20Z) - Aligned Novel View Image and Geometry Synthesis via Cross-modal Attention Instillation [62.87088388345378]
ワーピング・アンド・インペインティング手法を用いて,新しいビューイメージと幾何学生成の整合性を実現する拡散型フレームワークを提案する。
手法は、既製の幾何学予測器を利用して、参照画像から見る部分的な幾何学を予測する。
生成した画像と幾何の正確なアライメントを確保するために, クロスモーダルアテンション蒸留法を提案する。
論文 参考訳(メタデータ) (2025-06-13T16:19:00Z) - MMGDreamer: Mixed-Modality Graph for Geometry-Controllable 3D Indoor Scene Generation [14.959772906099039]
MMGDreamerは、Mixed-Modality Graphを組み込んだシーン生成のための二重ブランチ拡散モデルである。
ビジュアルエンハンスメントモジュールは、テキスト埋め込みを使用して視覚表現を構築することで、テキストのみのノードの視覚的忠実度を高める。
我々の関係予測器はノード表現を利用してノード間の不連続な関係を推定し、より一貫性のあるシーンレイアウトをもたらす。
論文 参考訳(メタデータ) (2025-02-09T12:23:40Z) - G-NeRF: Geometry-enhanced Novel View Synthesis from Single-View Images [45.66479596827045]
我々は,幾何誘導多視点合成手法により,幾何先行性を高めるための幾何強調型NeRF(G-NeRF)を提案する。
単一視点画像に対する多視点監視の欠如に対処するために,深度認識型トレーニングアプローチを設計する。
論文 参考訳(メタデータ) (2024-04-11T04:58:18Z) - Geometry-Free View Synthesis: Transformers and no 3D Priors [16.86600007830682]
トランスフォーマーモデルでは,手作業による3次元バイアスを伴わずに全く新しいビューを合成できることを示す。
i)ソースビューとターゲットビューの長距離3D対応を暗黙的に学習するグローバルアテンションメカニズムによって実現される。
論文 参考訳(メタデータ) (2021-04-15T17:58:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。