論文の概要: NAMVIS: Next-Scale Autoregressive Multi-View Image Synthesis
- arxiv url: http://arxiv.org/abs/2610.04722v1
- Date: Sat, 03 Oct 2026 19:22:02 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:03:22.089496
- Title: NAMVIS: Next-Scale Autoregressive Multi-View Image Synthesis
- Title(参考訳): NAMVIS:次世代自動回帰多視点画像合成
- Abstract要約: 我々は,多視点画像合成を幾何学条件の次スケール自己回帰として再構成する拡散フリーフレームワークであるNAMVISを紹介する。
NAMVISは、繰り返しの妄想を通してターゲットビューを生成する代わりに、少数の粗いスケールステップを通して離散的な視覚トークンを予測する。
NAMVISは、PSNR、SSIM、LPIPSの拡散ベースラインよりも優れ、評価された拡散ベースラインの3倍高速で動作する。
- 参考スコア(独自算出の注目度): 54.42964151716413
- License:
- Abstract: Sparse-view novel view synthesis is a central problem in 3D content creation, but diffusion-based approaches remain limited by iterative denoising, making multi-view generation expensive at inference time. We introduce NAMVIS, a diffusion-free framework that reformulates multi-view image synthesis as geometry-conditioned next-scale autoregression. Instead of generating target views through repeated denoising, NAMVIS predicts discrete visual tokens through a small number of coarse-to-fine scale steps, while sampling all tokens within each scale and across target views in parallel. To anchor this generation process to explicit camera geometry, we propose Multi-scale Projective Pose Encoding, which injects source and target camera transformations into both target-view self-attention and source-to-target cross-attention at every resolution. NAMVIS further combines global conditioning with dense geometry-aware cross-attention, enabling the model to preserve source-view appearance while maintaining target-view consistency. Across Objaverse, GSO, and OmniObject3D, NAMVIS outperforms diffusion-based baselines in PSNR, SSIM, and LPIPS, while running over 3 times faster than the evaluated diffusion baselines under the same evaluation setting. These results suggest that geometry-conditioned next-scale autoregression is a promising and efficient alternative to diffusion for sparse-view multi-view synthesis. Additional qualitative results, videos, and resources are available at https://corl-team.github.io/namvis/
- Abstract(参考訳): スパースビューの新規ビュー合成は3次元コンテンツ作成において中心的な問題であるが,拡散に基づくアプローチは反復的デノイングによって制限され,推論時に多視点生成が高価になる。
我々は,多視点画像合成を幾何学条件の次規模自己回帰として再構成する拡散フリーフレームワークであるNAMVISを紹介する。
NAMVISは、繰り返しデノベーションによってターゲットビューを生成する代わりに、少数の粗いスケールステップを通じて離散的な視覚トークンを予測し、各スケール内のすべてのトークンを並列にサンプリングする。
この生成過程を明示的なカメラ形状に固定するために,各解像度で目標視点の自己アテンションとソース・ツー・ターゲットのクロスアテンションの両方にソースとターゲットカメラの変換を注入するマルチスケール・プロジェクティブ・ポース・エンコーディングを提案する。
NAMVISはさらに、グローバルコンディショニングと密度の高いジオメトリ対応のクロスアテンションを組み合わせることで、ターゲットビューの一貫性を維持しながら、ソースビューの外観を維持することができる。
Objaverse、GSO、OmniObject3Dをまたいで、NAMVISはPSNR、SSIM、LPIPSの拡散ベースラインよりも優れ、同じ評価条件下で評価された拡散ベースラインよりも3倍高速で動作する。
これらの結果は、幾何学条件付き次スケール自己回帰がスパースビュー多視点合成における拡散の有望かつ効率的な代替となることを示唆している。
その他の質的な結果、ビデオ、リソースはhttps://corl-team.github.io/namvis/で公開されている。
関連論文リスト
- AR-1-to-3: Single Image to Consistent 3D Object Generation via Next-View Prediction [69.65671384868344]
拡散モデルに基づく新しい次世代予測パラダイムAR-1-to-3を提案する。
提案手法は,生成したビューと入力ビューとの整合性を大幅に改善し,高忠実度3Dアセットを生成する。
論文 参考訳(メタデータ) (2025-03-17T08:39:10Z) - PlacidDreamer: Advancing Harmony in Text-to-3D Generation [20.022078051436846]
PlacidDreamerは、マルチビュー生成とテキスト条件生成を調和させるテキストから3Dフレームワークである。
バランスの取れた飽和を達成するために、新しいスコア蒸留アルゴリズムを採用している。
論文 参考訳(メタデータ) (2024-07-19T02:00:04Z) - MultiDiff: Consistent Novel View Synthesis from a Single Image [60.04215655745264]
MultiDiffは、単一のRGB画像からシーンを一貫した新しいビュー合成のための新しいアプローチである。
以上の結果から,MultiDiffは,課題の多いリアルタイムデータセットであるRealEstate10KとScanNetにおいて,最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2024-06-26T17:53:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。