論文の概要: G-ray: Ray-Level Relative Geometric Position Encoding in Multi-View Vision Transformers under Camera Heterogeneity
- arxiv url: http://arxiv.org/abs/2609.15018v2
- Date: Tue, 15 Sep 2026 11:44:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.091447
- Title: G-ray: Ray-Level Relative Geometric Position Encoding in Multi-View Vision Transformers under Camera Heterogeneity
- Title(参考訳): G線:カメラの不均一なマルチビュービジョン変換器におけるレイレベル相対幾何位置符号化
- Abstract要約: 本稿では、回転位相をカメラ局所的な角度でパラメータ化したG線について紹介する。
G線は既存の符号化と直接あるいは統合することができ、追加の学習パラメータなしで補完的な幾何学的手がかりを保持することができる。
我々は、3次元再構成と新規ビュー合成(NVS)の3つのホストエンコーディング(RoPE、GTA、RayRoPE)におけるG線の有効性を検証した。
- 参考スコア(独自算出の注目度): 44.82262218739513
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study relative position encoding for multi-view vision Transformers under camera heterogeneity, including varying fields of view (FoVs) or projection models. Existing rotary relative position encodings commonly use image-plane positional coordinates, producing projection-dependent relative phases and inconsistent geometric cues for cross-projection attention. We introduce G-ray, a ray-level relative position encoding whose rotary phases are parameterized by camera-local ray angles. The same camera-local ray pair induces the same relative phase across projections, providing projection-invariant positional consistency. G-ray can be used directly or integrated with existing encodings, retaining complementary geometric cues without additional learned parameters. We validate G-ray in three host encodings, RoPE, GTA, and RayRoPE, across 3D reconstruction and novel-view synthesis (NVS). Across three heterogeneous 3D reconstruction benchmarks at 50 views, G-ray leads all six averaged metrics and reduces mean pointmap relative error by 45.8% over MapAnything, with calibration supplied to both. Trained exclusively on homogeneous pinhole images, the 3D reconstruction model handles mixed pinhole and non-pinhole inputs without retraining and remains competitive on homogeneous pinhole 3D reconstruction protocols. For NVS, GTA and RayRoPE improve with G-ray under joint viewpoint and FoV variation. The project's webpage is available at https://g-ray-project.github.io/.
- Abstract(参考訳): 様々な視野(FoV)や投影モデルを含む、カメラの不均一性下でのマルチビュービジョン変換器の相対的位置符号化について検討する。
既存の回転相対位置符号化では、画像平面の位置座標が一般的であり、投影に依存した相対位相と、交差投影注意のための不整合幾何学的手がかりを生成する。
本稿では、回転位相をカメラ局所的な角度でパラメータ化したG線について紹介する。
同じカメラ局所線対はプロジェクションをまたいで同じ相対位相を誘導し、プロジェクション不変の位置整合を与える。
G線は既存の符号化と直接あるいは統合することができ、追加の学習パラメータなしで補完的な幾何学的手がかりを保持することができる。
我々は,3次元再構成とノベルビュー合成(NVS)の3つのホストエンコーディング(RoPE,GTA,RayRoPE)でG線を検証した。
50ビューで3つの不均一な3D再構成ベンチマークで、G線は平均6つのメトリクスをリードし、平均ポイントマップ相対誤差をマップAnythingの45.8%削減し、双方にキャリブレーションを供給した。
均質なピンホール画像のみを訓練した3D再構成モデルは、再トレーニングなしでピンホールと非ピンホールの混合入力を処理し、均質なピンホール3D再構成プロトコルと競合する。
NVSでは、GTAとRayRoPEは、G線を共同視点とFoV変動下で改善する。
プロジェクトのWebページはhttps://g-ray-project.github.io/.com/で公開されている。
関連論文リスト
- RayPE: Ray-Space Positional Encoding for 3D-Aware Video Generation [43.253222907352146]
RayPEは、位置エンコーディング拡張で、トークンごとの6D Plucker座標を、自己注意のクエリとキーに付加的に注入する。
結果として得られた注意スコアは、内容項、幾何学用語、および2つの内容と幾何学的相互項に分解される。
論文 参考訳(メタデータ) (2026-06-25T17:51:02Z) - SCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry [69.89196162649091]
SCOPE (Scale-Consistent One-Pass Estimation of 3D Geometry) は、拡張された単眼ビデオシーケンスから3次元幾何学を推定するための新しいアプローチである。
提案手法では,アフィン不変な3次元点マップを全列に共通パラメータで生成し,一貫したスケール不変表現を実現する。
論文 参考訳(メタデータ) (2026-06-19T10:23:25Z) - OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation [23.42968075775045]
DRIVE-CHOREOは、制御可能なマルチビュービデオ生成を潜在コレオグラフィとして再放送する。
NUScenesでは、DRIVE-CHOREOが新しい最先端のマルチビュー一貫性と競合するFVD (45.7) を備えたBEV mAP (21.6) を設定します。
論文 参考訳(メタデータ) (2026-06-16T05:25:55Z) - IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation [76.36174247570716]
ポーズレス多視点画像から連続的かつ一貫性のある幾何を暗黙的にモデル化するインプリシトビジュアル幾何変換器IVGTを提案する。
IVGTは標準座標系で連続的なニューラルネットワークシーン表現を学習し、任意の3D位置での連続的な空間クエリをサポートする。
連続的かつコヒーレントな表面形状の直接抽出を可能にし、任意の視点からRGB画像、深度マップ、表面正規写像のレンダリングを可能にする。
論文 参考訳(メタデータ) (2026-05-15T17:59:57Z) - URoPE: Universal Relative Position Embedding across Geometric Spaces [55.651792747815854]
URoPEは回転位置埋め込み(Rotary Position Embedding, RoPE)の普遍的な拡張である。
キー/値の画像パッチごとに、URoPEは事前に定義された奥行きアンカーで対応するカメラ線に沿って3Dポイントをサンプリングする。
標準2D RoPEは、投影されたピクセル座標を用いて適用することができる。
論文 参考訳(メタデータ) (2026-04-20T18:52:03Z) - RayRoPE: Projective Ray Positional Encoding for Multi-view Attention [46.94549341989407]
入力画像の集合からトークンを処理する多視点変換器の位置符号化について検討する。
我々は、パッチを一意に符号化し、SE(3)不変の注意を多周波数類似性で許容し、基礎となるシーンの幾何学に適応できるメカニズムを模索する。
RayRoPEは、関連する光線に基づいてパッチ位置を表すが、幾何認識符号化のための方向ではなく、線に沿って予測された点を利用する。
論文 参考訳(メタデータ) (2026-01-21T18:55:51Z) - LaRI: Layered Ray Intersections for Single-view 3D Geometric Reasoning [75.9814389360821]
層状光線交差(LaRI)は、1つの画像から未知の幾何学的推論を行う新しい方法である。
コンパクトで階層的な表現から恩恵を受けることで、LaRIは完全で効率的でビュー整合な幾何学的推論を可能にする。
3Dオブジェクトやシーンを含む、合成および実世界のデータのための完全なトレーニングデータ生成パイプラインを構築します。
論文 参考訳(メタデータ) (2025-04-25T15:31:29Z) - LucidFusion: Reconstructing 3D Gaussians with Arbitrary Unposed Images [23.96972213606037]
3次元再構成を画像から画像への変換として再構成し、相対座標マップ(RCM)を導入する。
RCMは、ポーズ推定なしで複数の未提示画像をメインビューにアライメントする。
RCMはプロセスを単純化するが、グローバルな3D監視の欠如によりノイズの多い出力が得られる。
我々のLucidFusionフレームワークは、任意の数の未用意な入力を処理し、数秒で堅牢な3D再構成を実現し、より柔軟でポーズなしの3Dパイプラインを実現する。
論文 参考訳(メタデータ) (2024-10-21T04:47:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。