論文の概要: NeoMap: Training-free Novel-View Synthesis from Single Images and Videos
- arxiv url: http://arxiv.org/abs/2607.01962v1
- Date: Thu, 02 Jul 2026 09:56:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.779784
- Title: NeoMap: Training-free Novel-View Synthesis from Single Images and Videos
- Title(参考訳): NeoMap: 単一画像とビデオからの学習不要なノベルビュー合成
- Authors: Jinxi Li, Tianyi Zhang, Yafei Yang, Zihui Zhang, Peng Huang, Koon Wing Macgyver Lin, Bo Yang,
- Abstract要約: 単眼映像や単眼映像から新しい視点映像を合成する際の課題について検討する。
既存の方法は、事前訓練されたビデオモデルにはネイティブなビュー合成能力がないという前提のもとに動作し、しばしばアーティファクトに悩まされ、グローバルなシーン一貫性を損なう。
我々は、一般的な事前学習ビデオモデルから高忠実でビューに一貫性のある新しいビューソリューションを見つけるために設計された、新しいトレーニングフリーフレームワークであるNeoMapを紹介する。
- 参考スコア(独自算出の注目度): 17.92443113042059
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study the challenging problem of novel view video synthesis from single images or monocular videos. Existing methods, which operate under the assumption that pre-trained video models lack native novel view synthesis capability and enforce view alignment via camera conditioning, task-specific fine-tuning, or stepwise hard denoising guidance, often suffer from artifacts and compromised global scene consistency. In this paper, we introduce NeoMap, a novel training-free framework designed to locate high-fidelity, view-consistent novel view solutions from general pre-trained video models. The key to our approach is the core insight that promising novel view solutions are inherently encoded within the natural video data manifold learned by pre-trained models, and the core challenge is simply to locate this optimal solution. We solve this via our core mechanism: convergent manifold alternating projection iterations that optimize the initial noise. Extensive experiments demonstrate that NeoMap significantly outperforms all existing methods across 3 standard novel view synthesis benchmarks, including the challenging Tanks-and-Temples, LLFF and DAVIS datasets, achieving state-of-the-art generation fidelity and top-tier view consistency.
- Abstract(参考訳): 単眼映像や単眼映像から新しい視点映像を合成する際の課題について検討する。
既存の方法は、事前訓練されたビデオモデルにはネイティブなビュー合成機能が欠けていると仮定し、カメラコンディショニング、タスク固有の微調整、ステップワイドなハードデノゲーションガイダンスを通じてビューアライメントを強制する。
本稿では、一般的な事前学習ビデオモデルから高忠実でビューに一貫性のある新しいビューソリューションを見つけるために設計された、新しいトレーニングフリーフレームワークであるNeoMapを紹介する。
このアプローチの鍵となるのは、期待できる新しいビューソリューションが、訓練済みのモデルによって学習された自然なビデオデータ多様体に本質的にエンコードされていること、そして、この最適なソリューションを見つけることにある。
収束多様体は、初期雑音を最適化する射影反復を交互に繰り返す。
大規模な実験により、NeoMapは3つの標準のビュー合成ベンチマークで既存のメソッドを著しく上回り、挑戦的なThant-and-Temples、LLFF、DAVISデータセット、最先端の世代の忠実さとトップレベルのビュー整合性を実現している。
関連論文リスト
- Stable Virtual Camera: Generative View Synthesis with Diffusion Models [51.71244310522393]
本稿では,シーンの新たなビューを生成する汎用拡散モデルであるスタブルバーチャルカメラ(Seva)を紹介する。
このアプローチは、シンプルなモデル設計、最適化されたトレーニングレシピ、柔軟なサンプリング戦略によってこれらの制限を克服する。
提案手法では,シームレスなループ閉鎖により,最大半分間の高品質なビデオを生成することができる。
論文 参考訳(メタデータ) (2025-03-18T17:57:22Z) - MultiDiff: Consistent Novel View Synthesis from a Single Image [60.04215655745264]
MultiDiffは、単一のRGB画像からシーンを一貫した新しいビュー合成のための新しいアプローチである。
以上の結果から,MultiDiffは,課題の多いリアルタイムデータセットであるRealEstate10KとScanNetにおいて,最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-06-26T17:53:51Z) - D-NPC: Dynamic Neural Point Clouds for Non-Rigid View Synthesis from Monocular Video [53.83936023443193]
本稿では,スマートフォンのキャプチャなどのモノクロ映像から動的に新しいビューを合成する手法を導入することにより,この分野に貢献する。
我々のアプローチは、局所的な幾何学と外観を別個のハッシュエンコードされたニューラル特徴グリッドにエンコードする暗黙の時間条件のポイントクラウドである、$textitdynamic Neural point cloudとして表現されている。
論文 参考訳(メタデータ) (2024-06-14T14:35:44Z) - Zero-to-Hero: Enhancing Zero-Shot Novel View Synthesis via Attention Map Filtering [16.382098950820822]
我々は、注目マップを操作することでビュー合成を強化する新しいテストタイムアプローチであるZero-to-Heroを提案する。
我々は、ソースビューからの情報を統合するために自己認識機構を変更し、形状歪みを低減する。
結果は、分散オブジェクトの多様なセットで検証された、忠実性と一貫性の大幅な改善を示す。
論文 参考訳(メタデータ) (2024-05-29T00:58:22Z) - ViVid-1-to-3: Novel View Synthesis with Video Diffusion Models [33.760292331843104]
単一のイメージからオブジェクトの新たなビューを生成することは、難しい作業です。
近年,拡散に基づくビュー合成法は大きな進歩を見せている。
本稿では,事前学習したビデオ拡散モデルを用いた簡単な方法を示す。
論文 参考訳(メタデータ) (2023-12-03T06:50:15Z) - Multi-object Video Generation from Single Frame Layouts [84.55806837855846]
本研究では,グローバルシーンを局所オブジェクトに合成するビデオ生成フレームワークを提案する。
我々のフレームワークは、画像生成手法からの非自明な適応であり、この分野では新しくなっています。
本モデルは広範に使用されている2つのビデオ認識ベンチマークで評価されている。
論文 参考訳(メタデータ) (2023-05-06T09:07:01Z) - Consistent View Synthesis with Pose-Guided Diffusion Models [51.37925069307313]
単一の画像から新しいビューを合成することは、多くのバーチャルリアリティーアプリケーションにとって画期的な問題である。
本稿では,ポーズ誘導拡散モデルを提案する。
論文 参考訳(メタデータ) (2023-03-30T17:59:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。