論文の概要: Feedforward Novel View Synthesis for Heterogeneous Cameras
- arxiv url: http://arxiv.org/abs/2610.03522v1
- Date: Fri, 02 Oct 2026 16:13:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.472012
- Title: Feedforward Novel View Synthesis for Heterogeneous Cameras
- Title(参考訳): 不均質カメラのためのフィードフォワード新しいビュー合成
- Abstract要約: 新規なビュー合成は、最近、スパースポーズ画像から有望な結果を示したが、既存のほとんどの方法は、コンテキストとターゲットビューが固定カメラファミリを共有すると仮定している。
この均質なカメラの仮定は、視界、魚眼、パノラマカメラが共存し、訓練中にターゲットの投影が見えないような、実用的なマルチセンサーシステムで破られる。
ヘテロジニアス中心カメラにおけるフィードフォワードNVSについて検討し、トークン化によって導入された重要な曖昧さを同定する。
画像グリッド座標を線誘発角座標に置き換えたプロジェクション対応2D RoPEを提案する。
- 参考スコア(独自算出の注目度): 51.04683774883066
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Feed-forward novel view synthesis has recently shown promising results from sparse posed images, but most existing methods assume that context and target views share a fixed camera family. This homogeneous-camera assumption breaks in practical multi-sensor systems, where perspective, fisheye, and panoramic cameras may coexist and where the target projection may be unseen during training. We study feed-forward NVS across heterogeneous central cameras and identify a key ambiguity introduced by tokenization: a visual token aggregates a projection-dependent bundle of pixel rays, while existing camera encodings mainly expose absolute rays or token-center relations. To address this, we combine token-center relative Camera Positional Encodings and proposed local raymaps, a token-level representation that explicitly describes the intra-patch ray distribution summarized by each token. We further propose projection-aware 2D RoPE, which replaces raw image-grid coordinates with ray-induced angular coordinates so that relative positional reasoning is aligned across camera projections. Together, these components treat diverse cameras as calibrated samplings of a shared ray space rather than separate visual domains. On ScanNet++ with heterogeneous-camera system, our method improves over camera-conditioned baselines under mixed-camera evaluation and demonstrates zero-shot generalization to panoramic views.
- Abstract(参考訳): フィードフォワード新規ビュー合成は、最近、スパースポーズ画像から有望な結果を示したが、既存のほとんどの方法は、コンテキストとターゲットビューが固定カメラファミリを共有すると仮定している。
この均質なカメラの仮定は、視界、魚眼、パノラマカメラが共存し、訓練中にターゲットの投影が見えないような、実用的なマルチセンサーシステムで破られる。
画像トークンは投影依存の画素光束を集約し,既存のカメラエンコーディングは絶対光線やトークン中心関係を主に露呈する。
これを解決するために、トークン中心の相対カメラ位置エンコーディングと、各トークンで要約されたパッチ内レイ分布を明示的に記述したトークンレベル表現であるローカルレイマップを組み合わせる。
さらに、画像グリッド座標を線誘発角座標に置き換え、相対的な位置推論をカメラ投影に合わせるプロジェクション対応2D RoPEを提案する。
これらのコンポーネントは、異なる視覚領域ではなく、共有光線空間の校正されたサンプリングとして、多様なカメラを扱う。
ヘテロジニアスカメラシステムを用いたScanNet++では、混合カメラ評価によりカメラ条件付きベースラインよりも向上し、パノラマビューに対するゼロショットの一般化を示す。
関連論文リスト
- Cameras as Relative Positional Encoding [37.675563572777136]
マルチビュートランスは3次元空間で視覚トークンを接地するためにカメラジオメトリを使用する必要がある。
フィードフォワード新規ビュー合成における相対カメラコンディショニングによる性能向上効果を示す。
次に、これらの利点が様々なタスク、ステレオ深度推定、識別的認知、およびより大きなモデルサイズに持続していることを検証する。
論文 参考訳(メタデータ) (2025-07-14T17:22:45Z) - Single-Scanline Relative Pose Estimation for Rolling Shutter Cameras [56.39904484784127]
本稿では,ラインプロジェクションの交差点と1枚の走査線を用いて,ローリングシャッターカメラ間の相対的なポーズを推定する手法を提案する。
あるいは、単一の画像内でスキャニングラインを選択することができ、ローリングシャッターカメラのスキャニングラインに対するシングルビュー相対ポーズ推定を可能にする。
論文 参考訳(メタデータ) (2025-06-27T10:00:21Z) - Multi-Camera Multi-Person Association using Transformer-Based Dense Pixel Correspondence Estimation and Detection-Based Masking [1.0937094979510213]
マルチカメラアソシエーション (Multi-camera Association, MCA) は、カメラビューを通してオブジェクトや個人を識別するタスクである。
我々は,高密度画素対応推定に基づく新しいマルチカメラマルチターゲットアソシエーションアルゴリズムについて検討する。
以上の結果から,このアルゴリズムは互いに近接するカメラ対の歩行者と極めてよく関連していることがわかった。
論文 参考訳(メタデータ) (2024-08-17T20:58:16Z) - Cameras as Rays: Pose Estimation via Ray Diffusion [54.098613859015856]
カメラのポーズを推定することは3D再構成の基本的な課題であり、まばらにサンプリングされたビューを考えると依然として困難である。
本稿では,カメラを光束として扱うカメラポーズの分散表現を提案する。
提案手法は回帰法と拡散法の両方で,CO3Dのカメラポーズ推定における最先端性能を示す。
論文 参考訳(メタデータ) (2024-02-22T18:59:56Z) - Cross-Camera View-Overlap Recognition [42.75360135783111]
本稿では、参照3Dマップを必要とせずに、自由に動くカメラ間で動作可能な分散ビューオーバラップ認識フレームワークを提案する。
ビューオーバーラップはビューマッチングと幾何学的検証によって認識され、間違ったマッチしたビューを破棄する。
論文 参考訳(メタデータ) (2022-08-24T16:55:52Z) - RelPose: Predicting Probabilistic Relative Rotation for Single Objects
in the Wild [73.1276968007689]
本稿では、任意のオブジェクトの複数の画像からカメラ視点を推定するデータ駆動手法について述べる。
本手法は, 画像の鮮明さから, 最先端のSfM法とSLAM法より優れていることを示す。
論文 参考訳(メタデータ) (2022-08-11T17:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。