論文の概要: Panoramic Scene Analysis: A Survey from Distortion-Aware Engineering to Sphere-Native Foundation Modeling
- arxiv url: http://arxiv.org/abs/2606.27745v1
- Date: Fri, 26 Jun 2026 05:54:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.390783
- Title: Panoramic Scene Analysis: A Survey from Distortion-Aware Engineering to Sphere-Native Foundation Modeling
- Title(参考訳): パノラマシーン分析:歪認識工学から球-負ファウンデーションモデリングへ
- Abstract要約: パノラマ画像は単一のフレームで完全な視覚球をキャプチャし、従来のカメラでは達成できない空間的コンテキストを提供する。
2次元球面を平面に忠実にマッピングすることはできず、すべての平面表現は標準視覚アーキテクチャの前提となる仮定に反する歪みを導入する。
本研究は,プロジェクションに基づく適応から歪み認識工学,スフィアネイティブモデリング,基礎モデルの幾何認識トークン化に至るまで,方法論的軌道に沿ったパノラマシーン解析の進化を辿るものである。
- 参考スコア(独自算出の注目度): 1.8625021794520016
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Panoramic images capture the complete visual sphere in a single frame, providing spatial context unattainable by conventional cameras. Yet this completeness comes at a geometric cost: the 2-sphere cannot be faithfully mapped to the plane, and every planar representation introduces distortions that violate the assumptions underlying standard vision architectures. This survey traces the evolution of panoramic scene analysis along a methodological trajectory, from projection-based adaptation, through distortion-aware engineering, to sphere-native modeling and geometry-aware tokenization for foundation models, and argues that this evolution reflects a progressive deepening of geometric commitment rather than a simple accumulation of techniques. We organize the literature along two orthogonal dimensions: architectural design (how operators interact with spherical geometry) and training paradigm (how knowledge is transferred across domains). Covering dense prediction (semantic segmentation, depth estimation, and room layout estimation), unified multi-task understanding, open-world perception, vision-language reasoning, and dynamic video analysis, we identify a central unresolved tension: among the methods surveyed, none simultaneously delivers strict spherical equivariance and full reuse of perspective-pretrained foundation-model weights, and we argue that this is a structural rather than incidental gap. We further expose five systematic gaps in current evaluation protocols, namely the absence of spherical-area-weighted metrics, seam-consistency testing, polar-robustness stratification, cross-projection generalization, and open-world protocol standardization, and propose a six-point research roadmap toward general-purpose panoramic intelligence. The corresponding repository is publicly available at: https://github.com/zhuqinfeng1999/Awesome-Panoramic-Scene-Analysis.
- Abstract(参考訳): パノラマ画像は単一のフレームで完全な視覚球をキャプチャし、従来のカメラでは達成できない空間的コンテキストを提供する。
2次元球面を平面に忠実にマッピングすることはできず、すべての平面表現は標準視覚アーキテクチャの前提となる仮定に反する歪みを導入する。
この調査は、プロジェクションに基づく適応から歪み認識工学、スフィアネイティブモデリングや基礎モデルの幾何認識トークン化に至るまで、方法論的軌道に沿ったパノラマシーン解析の進化を辿り、この進化は単純なテクニックの蓄積ではなく、幾何コミットメントの進歩的な深化を反映していると論じている。
文献を2つの直交次元に沿って整理する: 建築設計(オペレーターが球形幾何学とどのように相互作用するか)と訓練パラダイム(知識がドメイン間でどのように伝達されるか)である。
厳密な予測(セマンティックセグメンテーション,深度推定,室内配置推定),統合マルチタスク理解,オープンワールド認識,視覚言語推論,動的ビデオ解析を網羅し,集中的未解決の緊張関係を同定する。
さらに,現在の評価プロトコルにおける5つの体系的ギャップ,すなわち,球面面積重み付きメトリクスの欠如,シーム整合性試験,極ロバスト性階層化,クロスプロジェクションの一般化,オープンワールドプロトコルの標準化などを明らかにし,汎用パノラマインテリジェンスに向けた6点の研究ロードマップを提案する。
対応するリポジトリは、https://github.com/zhuqinfeng 1999/Awesome-Panoramic-Scene-Analysisで公開されている。
関連論文リスト
- SphereSOD: Geometry-Structure Coupled Learning for 360 Salient Object Detection [75.77856258186854]
360度高解像度物体検出は、全視野にわたって高解像度領域を正確に分割することを目的としている。
既存の手法は主に、パノラマ幾何学と健全な物体構造との相互作用を見越しながら、投影歪みを補正することに焦点を当てている。
SphereSODは、パノラマ幾何学と進化する塩分構造を結合したERPネイティブフレームワークである。
論文 参考訳(メタデータ) (2026-09-07T14:47:54Z) - Capsule Lens: Locating and Tracking Concept Geometry in Model Representations [8.78662595138283]
提案するCapsule Lensは、その領域のコンセプトを、シンプルで追跡可能な幾何学形式にマッチさせるフレームワークである。
静的表現では、様々なモデルにまたがる概念幾何学の発見方法と、スパン曲線とノルム曲線が重要な幾何学的特徴を明らかにする方法を示す。
動的表現について、異なるトレーニング設定によって誘導される表現のドリフトを追跡する3つのケーススタディを提示する。
論文 参考訳(メタデータ) (2026-09-04T09:15:04Z) - Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth [11.871264497562008]
本稿では,マルチビューモデルのスケール・アウェアな幾何学的先行をモノクロ深度基礎モデルに変換する新しいフレームワークを提案する。
具体的には,マルチビュー入力を必要とすることなく,単一ビュー予測モデルでエピポーラの注意パターンを維持し,幾何整合性を維持するためのエピポーラ蒸留(EpiDistillation, EpiDistill)を提案する。
論文 参考訳(メタデータ) (2026-07-17T03:49:14Z) - ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning [66.42476564611607]
拡散モデルは、反復的妄想を通して、世界規模で滑らかな場として深度を復元できると仮定する。
本稿では,構造的自己回帰生成として深度推定を定式化するARDepthを提案する。
提案手法は高い性能を達成し,スケールにわたって構造的に一貫した深度予測を実現する。
論文 参考訳(メタデータ) (2026-07-14T07:06:46Z) - Z-FLoc: Zero-Shot Floorplan Localization via Geometric Primitives [72.63181031215858]
そこで本研究では,ゼロショットフロアプランのローカライズ手法を提案する。
我々の重要な洞察は、支配的な幾何学的プリミティブが人間が作った環境でユビキタスであることである。
シミュレーションと実世界の両方のデータセットの実験により、我々のアプローチは、目に見えない環境における最先端の学習ベースの手法よりも優れています。
論文 参考訳(メタデータ) (2026-06-03T12:14:24Z) - SpatialEvo: Self-Evolving Spatial Intelligence via Deterministic Geometric Environments [75.60795462502949]
SpaceEvoは3D空間推論のための自己進化型フレームワークである。
16の空間推論タスクカテゴリを明示的な幾何学的検証規則で定式化する。
注釈のない3Dシーンをゼロノイズのインタラクティブなオラクルに変換し、モデルコンセンサスを客観的な物理的フィードバックに置き換える。
論文 参考訳(メタデータ) (2026-04-15T17:59:12Z) - Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective [91.23306722968509]
汎用的なフィードフォワード3D再構築は近年急速に進展している。
既存のフィードフォワードアプローチも同様に高いレベルのアーキテクチャパターンを共有している。
本稿では,出力形式に依存しないモデル設計戦略を中心とした新しい分類法を提案する。
論文 参考訳(メタデータ) (2026-04-15T16:07:18Z) - Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images [81.94999489820974]
UniSplat (UniSplat) は、未提示のマルチビュー画像から3D表現を学習するためのフィードフォワードフレームワークである。
エンコーダにおける幾何誘導を強化するデュアルマスキング戦略を導入する。
第2に,外見のセマンティックな矛盾を解消する粗大なガウス的スプレイティング戦略を開発する。
第3に、予測された3次元点と意味マップを画像平面に相互に関連付ける、ポーズ条件の補正機構を導入する。
論文 参考訳(メタデータ) (2026-04-12T10:36:18Z) - LatentGeo: Learnable Auxiliary Constructions in Latent Space for Multimodal Geometric Reasoning [32.39048489202347]
画素レベルのレンダリングや外部エグゼキュータを使わずに、連続潜時視覚表現を学習し、補助幾何学的構成を内部化するフレームワークを提案する。
LatentGeoは幾何学的推論タスク、特に補助的な構成を必要とするタスクでかなりの利益を得ている。
論文 参考訳(メタデータ) (2026-03-12T17:01:23Z) - GeoSurDepth: Spatial Geometry-Consistent Self-Supervised Depth Estimation for Surround-View Cameras [3.072321170197384]
GeoSurDepthは、サラウンドビューの深さ推定のための主要なキューとして、幾何整合性を利用するフレームワークである。
筆者らのフレームワークは,頑健な自己教師付き多視点深度推定のための幾何学的コヒーレンスと一貫性を活用することの重要性を強調した。
論文 参考訳(メタデータ) (2026-01-09T15:13:28Z) - GeoMoE: Divide-and-Conquer Motion Field Modeling with Mixture-of-Experts for Two-View Geometry [26.926348149152656]
ストリーム化フレームワークであるGeoMoEを用いて2次元形状の運動場モデリングを再構築する。
我々はまず,不整合確率信号を利用した確率的事前誘導分解戦略を考案し,運動場の構造を考慮した分解を行う。
次に,空間コンテキストやチャネルセマンティックパスに沿って各サブフィールドを拡大するMoE拡張Biパス整流器を提案する。
論文 参考訳(メタデータ) (2025-08-01T12:45:47Z) - Aligned Novel View Image and Geometry Synthesis via Cross-modal Attention Instillation [62.87088388345378]
ワーピング・アンド・インペインティング手法を用いて,新しいビューイメージと幾何学生成の整合性を実現する拡散型フレームワークを提案する。
手法は、既製の幾何学予測器を利用して、参照画像から見る部分的な幾何学を予測する。
生成した画像と幾何の正確なアライメントを確保するために, クロスモーダルアテンション蒸留法を提案する。
論文 参考訳(メタデータ) (2025-06-13T16:19:00Z) - Self-training Room Layout Estimation via Geometry-aware Ray-casting [27.906107629563852]
本研究では,未表示のシーンにおける室内レイアウト推定モデルのための幾何学的自己学習フレームワークを提案する。
提案手法では,異なる視点からの複数の推定値の集計にレイキャストの定式化を用いる。
論文 参考訳(メタデータ) (2024-07-21T03:25:55Z) - Towards Self-Supervised Category-Level Object Pose and Size Estimation [121.28537953301951]
本研究は,一深度画像からのカテゴリレベルのオブジェクトポーズとサイズ推定のための自己教師型フレームワークを提案する。
我々は、同じ形状の点雲における幾何学的整合性を利用して自己超越する。
論文 参考訳(メタデータ) (2022-03-06T06:02:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。