論文の概要: SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE
- arxiv url: http://arxiv.org/abs/2606.32033v1
- Date: Tue, 30 Jun 2026 17:57:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.348289
- Title: SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE
- Title(参考訳): SpheRoPE:球状RoPEを用いたゼロショット最適化フリー360パノラマ生成
- Abstract要約: 本研究では,事前学習した拡散変圧器に直接球状前駆体を注入することにより,360パノラマ画像とビデオを生成するフレームワークを提案する。
本稿では,Flux.1,Flux.2,LTX-Videoのバックボーンを用いて,テキストからパノラマまでを一般化し,ベースラインに対する競合性能を実現する。
- 参考スコア(独自算出の注目度): 12.307239950961446
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We present a zero-shot, training-free and optimization-free framework for generating 360 panoramic images and videos by directly injecting spherical priors into pre-trained diffusion transformers. Existing methods either rely on costly fine-tuning on scarce panoramic data that limits generalization, or leverage multi-step optimization that incurs prohibitive inference latency. We observe that contemporary generative models natively exhibit some panoramic priors from large-scale training. However, these emergent capabilities are insufficient, as the models fundamentally fail to satisfy the rigorous topological constraints imposed by equirectangular projection (ERP). We introduce a zero-shot and optimization-free approach that resolves these constraints at inference time. Spherical RoPE replaces standard rotary position embeddings: low-frequency channels are re-parameterized as 3D Cartesian coordinates to natively encode the spherical manifold, while high-frequency channels are harmonically quantized to enforce exact periodicity. Coupled with complementary Semantic Distortion classifier-free guidance (CFG) that explicitly steers geometry, we avoid retraining and inherit the full creative breadth of state-of-the-art models. Our approach generalizes across diverse backbones and 360 generation modalities. We demonstrate this across text-to-panorama using Flux.1, Flux.2, and LTX-Video backbones, achieving competitive performance against baselines, all while remaining training-free. Project page: https://orhir.github.io/SpheRoPE
- Abstract(参考訳): 予め訓練した拡散変圧器に球面前駆体を直接注入することにより360パノラマ画像とビデオを生成するゼロショット・トレーニングフリー・最適化フリーなフレームワークを提案する。
既存の手法は、一般化を制限する少ないパノラマデータにコストのかかる微調整を頼りにするか、あるいは禁忌な推論遅延を引き起こすマルチステップ最適化を利用する。
現代の生成モデルでは,大規模トレーニングによるパノラマ前兆が自然に現れることが観察された。
しかし、これらの創発的能力は、モデルが等方射影(ERP)によって課される厳密な位相的制約を根本的に満たさないため、不十分である。
推論時にこれらの制約を解消するゼロショットおよび最適化フリーなアプローチを導入する。
低周波チャネルは3次元カルト座標として再パラメータ化され、球面多様体をネイティブに符号化する一方、高周波チャネルは正確な周期性を強制するために調和的に量子化される。
幾何を明示的に操る相補的セマンティック・ディストーション・ディストーション・フリー・ガイダンス(CFG)と組み合わせて、我々は最先端のモデルの完全な創造的幅を再訓練し継承することを避けた。
我々のアプローチは、多様なバックボーンと360世代モダリティにまたがって一般化される。
本稿では,Flux.1,Flux.2,LTX-Videoのバックボーンを用いて,テキストからパノラマまでの動作を実演する。
プロジェクトページ: https://orhir.github.io/SpheRoPE
関連論文リスト
- Compact Neural Appearance Models for Efficient Gaussian Splatting [1.579851447355843]
低次球面調和(SH)を用いた3次元ガウス・スプラッティングのような原始的基礎放射場は、一般的にビュー依存の外観をモデル化する
本稿では、SHと最近の球面外見モデルとの徹底的なエンドツーエンド比較について述べる。
我々は、小さな共有パイプラインを使用して、コンパクトなプリミティブごとの潜伏符号をデコードする暗黙の代替手法を導入する。
論文 参考訳(メタデータ) (2026-09-04T15:18:54Z) - GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors [27.10799700736534]
Diffusion ModelsやFlow Matchingのような生成モデルは、高忠実度駆動ビデオの合成において顕著な能力を示している。
この非効率性は、連続するフレームが独立なガウスノイズである標準ガウス音源分布への依存から生じる。
明示的な幾何学的事前情報を活用することにより,効率的な運転映像生成を実現するための新しいフレームワークであるGeoFlowを提案する。
論文 参考訳(メタデータ) (2026-08-12T15:57:08Z) - Improving Sparse-View 3DGS Generalization via Flat Minima Optimization [37.65568887478836]
ニューラルレンダリングの最近の進歩は、新しいビュー合成のための高効率な表現として、3Dガウススティング(3DGS)を確立している。
しかし、3DGSは, 少ない視点でのみ監督を行う場合, 観察された画像に過度に適合し, 見えない視点に過度に一般化する傾向にある。
我々は,小パラメータ摂動下で安定な解を求めるフラット・ミニマ (FM) 最適化の観点から,この問題に対処する。
論文 参考訳(メタデータ) (2026-07-01T12:52:57Z) - Spherical-to-ERP Epipolar Rectification for Single-Axis Disparity in 360 Stereo [0.0]
球面から等方形への標準射影(ERP)を前処理ステップとして採用し, エピポーラ曲線を直線化し, 1次元の凹凸構造を復元する。
合成魚眼ステレオデータセットの実験により、この球面-ERP-to-RAFT+EACSパイプラインは、正確に、滑らかで、構造的に整合した不均一なマップをリアルタイムで生成することが示された。
論文 参考訳(メタデータ) (2026-06-23T17:27:07Z) - ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes [55.32681167870698]
Video-informed Pose Spaces (ViPS)は、自動リップメッシュのための有効な調律の潜時分布を検出するフィードフォワードフレームワークである。
ViPSは生成ビデオの先行値を所定のリグパラメータ化上の普遍分布に転送する。
評価の結果,VPSは,合成アーティストが作成した4Dデータに基づいて訓練した最先端の手法の性能と,妥当性と多様性の両面で一致していることがわかった。
論文 参考訳(メタデータ) (2026-04-19T21:21:11Z) - Spherical-GOF: Geometry-Aware Panoramic Gaussian Opacity Fields for 3D Scene Reconstruction [17.20174890101058]
Spherical-GOF(Spherical-GOF)は、ガウスのOpacity Fields(GOF)上に構築された一方向レンダリングフレームワークである。
GOFは球面上の単位球面に直接GOF線サンプリングを行い、パノラマ描画のための一貫した光-ガウス相互作用を可能にする。
標準的なパノラマベンチマークの実験は、競争力のある測光品質を示し、一貫性を大幅に改善した。
論文 参考訳(メタデータ) (2026-03-09T15:35:56Z) - TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction [57.46712611558817]
3次元視覚基礎モデルでは、1つのフィードフォワードパスを通して、未校正画像からキー3D属性を再構成する際の強力な一般化が示されている。
近年の戦略は,グローバルトランスフォーメーションの解決によって連続的な予測と整合するが,本分析では,仮定の妥当性,局所的なアライメント範囲,雑音的幾何の下でのロバスト性といった基本的な限界を明らかにしている。
本研究では,グローバルに伝播する制御点を利用して空間的に異なる不整合を補正する,Tin Plate Splineに基づく高DOFおよび長期アライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-02T02:22:20Z) - OracleGS: Grounding Generative Priors for Sparse-View Gaussian Splatting [78.70702961852119]
OracleGSは、Gaussian Splattingのスパースビューのために、生成的完全性と回帰的忠実性を調整している。
提案手法は,多視点幾何学的証拠に先立って強力な生成条件を定め,幻覚的アーティファクトをフィルタリングし,非拘束領域における可塑性完備を保存している。
論文 参考訳(メタデータ) (2025-09-27T11:19:32Z) - HoliGS: Holistic Gaussian Splatting for Embodied View Synthesis [59.25751939710903]
本稿では,長い単眼RGBビデオのエンボディドビュー合成に対処する,変形可能なガウススプラッティングフレームワークを提案する。
提案手法は,非可逆ガウス散乱変形ネットワークを利用して大規模動的環境を正確に再構築する。
その結果、現実のシナリオにおけるEVSの実用的でスケーラブルなソリューションが浮かび上がっています。
論文 参考訳(メタデータ) (2025-06-24T03:54:40Z) - SphereDiff: Tuning-free Omnidirectional Panoramic Image and Video Generation via Spherical Latent Representation [31.305851707485967]
そこで我々はSphereDiffを紹介した。これはシームレスな360度パノラマ画像とビデオ生成のための新しいアプローチである。
我々は,多次元拡散を球状潜在空間に拡張し,事前学習した拡散モデルの直接利用を可能にする球状潜在サンプリング法を提案する。
提案手法は,高忠実度を維持しながら360度パノラマコンテンツを生成する既存手法よりも優れており,没入型AR/VRアプリケーションのための堅牢なソリューションとなっている。
論文 参考訳(メタデータ) (2025-04-19T19:59:11Z) - Geometric Algebra Planes: Convex Implicit Neural Volumes [70.12234371845445]
GA-Planes はスパース低ランク係数と低分解能行列と等価であることを示す。
また,GA-Planeは既存の表現にも適用可能であることを示す。
論文 参考訳(メタデータ) (2024-11-20T18:21:58Z) - GauFRe: Gaussian Deformation Fields for Real-time Dynamic Novel View Synthesis [16.733855781461802]
インプシット変形可能表現は、通常、標準空間と時間依存の変形場を持つ運動をモデル化する。
GauFReは、フォワードウォーピング変形を使用して、シーン幾何学の非剛体変換を明示的にモデル化する。
実験により,提案手法は従来の最先端のNeRF法やガウス法よりも高い効率と競争結果が得られることが示された。
論文 参考訳(メタデータ) (2023-12-18T18:59:03Z) - InfoNeRF: Ray Entropy Minimization for Few-Shot Neural Volume Rendering [55.70938412352287]
ニューラルな暗黙表現に基づく数ショットの新規ビュー合成のための情報理論正規化手法を提案する。
提案手法は,不十分な視点で発生する潜在的な復元の不整合を最小化する。
複数の標準ベンチマークにおいて,既存のニューラルビュー合成手法と比較して一貫した性能向上を実現している。
論文 参考訳(メタデータ) (2021-12-31T11:56:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。