論文の概要: Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space
- arxiv url: http://arxiv.org/abs/2607.02712v1
- Date: Thu, 02 Jul 2026 18:56:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.401171
- Title: Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space
- Title(参考訳): 正規化オブジェクト座標空間における生成ビュー生成のためのグローバルポース制御
- Authors: Zhibing Li, Amogh Gupta, Behnoosh Parsa, Dan Casas,
- Abstract要約: カスタマイズ可能な正規化オブジェクトコーディネート空間(NOCS)における精密カメラ制御のための新しいアプローチを提案する。
提案手法は,NOCSにおけるターゲットビューの絶対カメラポーズのみで動作するため,入力画像の相対世界フレームやカメラポーズは不要である。
提案手法は,様々なカテゴリにまたがる任意のアンポーズ画像から,正確で一貫した配向を持つ新規なビューを確実に生成する。
- 参考スコア(独自算出の注目度): 8.745398364238406
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Novel View Synthesis (NVS) enables the generation of unseen views of a scene from a single or multiple images, allowing users to freely explore an object from any viewpoint. Despite the recent impressive qualitative improvements of generative models for this task, existing methods struggle to provide global and intuitive control of target viewpoints because they either use input-relative camera poses or are limited to generating sparse global views. This lack of global pose control severely limits the number of downstream tasks potentially enabled by NVS. To address this limitation, we propose a novel approach for precise camera control in a customizable Normalized Object Coordinate Space (NOCS), requiring single or few unposed images. Our method operates solely on the absolute camera pose of the target view in NOCS, eliminating the need for a relative world frame or camera poses of the input images. Unlike previous methods that treat NVS as a standalone generation task, we formulate it as an image editing problem and build upon state-of-the-art editing models to leverage their superior generalization capability. Camera information is injected as dedicated camera tokens via an in-context multi-modal conditioning strategy. To alleviate the inherent ambiguity of NOCS, we incorporate text descriptions that explicitly define the object's canonical coordinate frame, which also enhances generalization to unseen object categories. Furthermore, we curate a high-quality dataset with consistently aligned orientations and corresponding NOCS text definitions. Extensive experiments demonstrate that our method robustly generates novel views with accurate and consistent orientations from arbitrary unposed images across diverse categories, achieving state-of-the-art image quality and fidelity.
- Abstract(参考訳): 新規ビューシンセサイザー(NVS)は、1つまたは複数の画像からシーンの見えないビューを生成することができ、ユーザーは任意の視点から自由にオブジェクトを探索することができる。
従来の手法では, 入力相対カメラのポーズを利用するか, あるいは, 粗いグローバルビューの生成に制限があるため, 対象視点のグローバルかつ直感的な制御に苦慮している。
このグローバルなポーズコントロールの欠如は、NVSによって実現される可能性のあるダウンストリームタスクの数を著しく制限する。
この制限に対処するため,NOCS(Nocalized Object Coordinate Space)において,単一あるいは少数の画像を必要とする,精密なカメラ制御のための新しいアプローチを提案する。
提案手法は,NOCSにおけるターゲットビューの絶対カメラポーズのみで動作するため,入力画像の相対世界フレームやカメラポーズは不要である。
NVSを独立した生成タスクとして扱う従来の方法とは異なり、画像編集問題として定式化し、最先端の編集モデル上に構築し、それらの優れた一般化能力を活用する。
カメラ情報は、コンテキスト内マルチモーダルコンディショニング戦略を介して専用カメラトークンとして注入される。
NOCSの本質的あいまいさを軽減するため、対象の標準座標フレームを明確に定義したテキスト記述を取り入れ、また、対象カテゴリの一般化を促進する。
さらに、一貫した向きと対応するNOCSテキスト定義を持つ高品質なデータセットをキュレートする。
本手法は,様々なカテゴリにまたがる任意の未提案画像から,高精度で一貫したオリエントな視点を確実に生成し,最先端の画質と忠実さを達成できることを示す。
関連論文リスト
- Object Pose Transformer: Unifying Unseen Object Pose Estimation [54.20344997573707]
モデルなしのオブジェクトポーズ推定を未知のインスタンスで学習することは、3Dビジョンにおける根本的な課題である。
我々のチームは、RGB入力から深度、ポイントマップ、カメラパラメータ、正規化されたオブジェクト座標を共同で予測します。
当社はカメラ非依存で、カメラ固有の知識をオンザフライで学習し、メトリックスケールリカバリのためのオプションの深度入力をサポートします。
論文 参考訳(メタデータ) (2026-03-24T16:04:16Z) - LPA3D: 3D Room-Level Scene Generation from In-the-Wild Images [23.258004561060563]
LPA-GAN(LPA-GAN)は、LPAのカメラポーズの先行を推定するために、特定の修正を組み込んだ新しいNeRFベースの生成手法である。
本手法は,ビュー・ツー・ビューの整合性とセマンティック・ノーマル性に優れる。
論文 参考訳(メタデータ) (2025-04-03T07:18:48Z) - STAY Diffusion: Styled Layout Diffusion Model for Diverse Layout-to-Image Generation [4.769823364778397]
本稿では,写真リアルな画像を生成する拡散モデルを提案し,シーン内のスタイリングされたオブジェクトのきめ細かい制御を実現する。
提案手法は,各レイアウトのグローバルな条件と,重み変調のための自己教師付きセマンティックマップを学習する。
オブジェクトの関係を捉えるためのグローバル条件とイメージ特徴をクロスコンディションするために、新しいスタイルマスク注意(SM Attention)も導入された。
論文 参考訳(メタデータ) (2025-03-15T17:36:24Z) - Customizing Text-to-Image Diffusion with Object Viewpoint Control [53.621518249820745]
テキストから画像への拡散モデルのカスタマイズにおいて、オブジェクト視点の明示的な制御を可能にする新しいタスクを導入する。
これにより、カスタムオブジェクトのプロパティを変更し、テキストプロンプトを通じて、さまざまなバックグラウンドシーンでそれを生成することができます。
本稿では,対象視点からレンダリングした3次元オブジェクトの特徴に拡散過程を規定する。
論文 参考訳(メタデータ) (2024-04-18T16:59:51Z) - SPARF: Neural Radiance Fields from Sparse and Noisy Poses [58.528358231885846]
SPARF(Sparse Pose Adjusting Radiance Field)を導入し,新規な視点合成の課題に対処する。
提案手法は、NeRFを共同学習し、カメラのポーズを洗練するために、多視点幾何学的制約を利用する。
論文 参考訳(メタデータ) (2022-11-21T18:57:47Z) - Object-Centric Image Generation from Layouts [93.10217725729468]
複数のオブジェクトを持つ複雑なシーンを生成するレイアウト・ツー・イメージ生成法を開発した。
本手法は,シーン内のオブジェクト間の空間的関係の表現を学習し,レイアウトの忠実度の向上につながる。
本稿では,Fr'echet Inception Distanceのオブジェクト中心適応であるSceneFIDを紹介する。
論文 参考訳(メタデータ) (2020-03-16T21:40:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。