論文の概要: SphereSOD: Geometry-Structure Coupled Learning for 360 Salient Object Detection
- arxiv url: http://arxiv.org/abs/2609.07571v1
- Date: Mon, 07 Sep 2026 14:47:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 21:43:03.730433
- Title: SphereSOD: Geometry-Structure Coupled Learning for 360 Salient Object Detection
- Title(参考訳): SphereSOD:360度能動物体検出のための幾何構造結合学習
- Abstract要約: 360度高解像度物体検出は、全視野にわたって高解像度領域を正確に分割することを目的としている。
既存の手法は主に、パノラマ幾何学と健全な物体構造との相互作用を見越しながら、投影歪みを補正することに焦点を当てている。
SphereSODは、パノラマ幾何学と進化する塩分構造を結合したERPネイティブフレームワークである。
- 参考スコア(独自算出の注目度): 75.77856258186854
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 360° salient object detection (SOD) aims to accurately segment salient regions across a full field of view. However, equirectangular projection (ERP) introduces severe spatial distortion when mapping the spherical domain onto a planar representation. Existing methods mainly focus on compensating projection distortion while overlooking the interaction between panoramic geometry and salient object structure during feature perception and prediction refinement. To this end, we propose SphereSOD, an ERP-native framework that couples panoramic geometry with evolving salient structures. Specifically, spherical geometry governs feature sampling and spatial weighting, while coarse-grained saliency and contour prediction influence context aggregation during the progressive decoding process. SphereSOD first initializes deformable sampling based on spherical projection geometry and then employs bounded, content-adaptive offsets, yielding features that are better aligned with the underlying panoramic geometry. Subsequently, the decoder performs structure-guided context aggregation and progressive refinement to recover complete salient regions and accurate boundaries. Extensive experiments on three public 360° SOD benchmarks demonstrate state-of-the-art performance and a favorable accuracy-efficiency trade-off, supporting structurepreserving inference directly in ERP space as a promising alternative to projection-heavy panoramic pipelines.
- Abstract(参考訳): 360°高分解能物体検出(SOD)は、全視野にわたって高分解能領域を正確に分割することを目的としている。
しかし、等角射影 (ERP) は球面領域を平面表現にマッピングするときに激しい空間歪みをもたらす。
既存の手法は主に、パノラマ幾何学と特徴知覚と予測精細化の際の有意な物体構造との相互作用を見据えながら、投影歪みの補正に重点を置いている。
この目的のために,パノラマ幾何学とサルエント構造を結合したERPネイティブフレームワークであるSphereSODを提案する。
具体的には、球面形状は特徴サンプリングと空間重み付けを制御し、粗粒度と輪郭予測は進行復号過程におけるコンテキストアグリゲーションに影響を与える。
SphereSOD は、まず球面射影幾何学に基づいて変形可能なサンプリングを初期化し、次に有界なコンテンツ適応オフセットを使用し、基礎となるパノラマ幾何学に整合した特徴を与える。
その後、デコーダは構造誘導されたコンテキストアグリゲーションとプログレッシブリファインメントを行い、完全正当領域と正確な境界を回復する。
3つのパブリックな360度SODベンチマークの大規模な実験は、プロジェクション重パノラマパイプラインの有望な代替としてERP空間における構造保存推論を直接サポートする、最先端の性能と良好な精度と効率のトレードオフを示す。
関連論文リスト
- TDFNet: Tri-projection Deformable Fusion Network for Panoramic Salient Object Detection [13.394581946335949]
本研究では,パノラマサラリアン物体検出のための最初の三射影変形型核融合ネットワークであるTDFNetを提案する。
我々は,幾何歪みを緩和し,検出性能を向上させるために,相補的投影表現を利用する。
TDFNetは、グローバルな空間連続性、局所幾何学的詳細、きめ細かい境界情報を同時に保存する。
論文 参考訳(メタデータ) (2026-08-26T13:54:44Z) - Surfsvr: 2D Surface Priors as 3D Geometric Regularizers for Sparse Voxel Reconstruction [56.51413081953813]
SurfSVRは2次元表面の先行を明示的な3次元幾何正規化器として扱う新しいスパースボクセル再構成パラダイムである。
鮮明なボクセルの再現は、視認性と幾何学的特性が著しく異なる場面で一貫して改善される。
論文 参考訳(メタデータ) (2026-08-12T11:25:31Z) - SeeSE3: Emergence of 3D Space in Vision Features [54.140615953727355]
視覚特徴空間の構造とユークリッド変換群$SE(3)$の関係について検討する。
本研究は、3次元ユークリッド空間と非常に強く相関する潜在部分空間を有する自己監督型視覚モデルについて,原理的に3次元の直接監督やアクティブエージェンシーの訓練を受けていないことを示す。
本稿では,視覚計測と局所化を潜在空間で純粋に行う「潜時空間ナビゲーション」技術について,明示的な3次元再構成の必要性を回避して提案する。
論文 参考訳(メタデータ) (2026-07-15T18:00:31Z) - SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments [49.966170814478915]
UAV VLNのための幾何学誘導空間表現フレームワークを提案する。
明示的な3次元再構成を伴わないRGB観測において、SpatialFlyは幾何学誘導2次元表示アライメント機構を導入する。
実験結果から、SpatialFlyは現状のUAV VLNベースラインを目に見える環境と見えない環境の両方で一貫して上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-03-22T03:56:58Z) - GGPT: Geometry Grounded Point Transformer [22.64445696362087]
本稿では,GGPT(Geometry-Grounded Point Transformer)について紹介する。
この基礎の上に構築された幾何誘導型3次元点変換器は,比例的な部分幾何学的監督の下で高密度点マップを洗練する。
論文 参考訳(メタデータ) (2026-03-11T18:00:04Z) - GeoSurDepth: Spatial Geometry-Consistent Self-Supervised Depth Estimation for Surround-View Cameras [3.072321170197384]
GeoSurDepthは、サラウンドビューの深さ推定のための主要なキューとして、幾何整合性を利用するフレームワークである。
筆者らのフレームワークは,頑健な自己教師付き多視点深度推定のための幾何学的コヒーレンスと一貫性を活用することの重要性を強調した。
論文 参考訳(メタデータ) (2026-01-09T15:13:28Z) - Seamlessly Natural: Image Stitching with Natural Appearance Preservation [0.6089774484591287]
SENAは、パララックスと深度変化を特徴とする現実世界の挑戦的なシーンにおける構造的忠実度を優先する。
SENAは3つの重要なコントリビューションを通じて基本的な制限に対処する。
挑戦的なデータセットで行われた実験は、SENAが主要なホモグラフィーベースの手法に匹敵するアライメント精度を達成することを示した。
論文 参考訳(メタデータ) (2026-01-03T18:40:35Z) - SPAN: Spatial-Projection Alignment for Monocular 3D Object Detection [49.12928389918159]
既存の単分子3D検出器は典型的には、切り離された予測パラダイムを通じて、3D境界ボックスの顕著な非線形回帰をテームする。
本稿では2つの主成分を持つ新しい空間射影アライメント(SPAN)を提案する。
SPANは、予測された3次元境界ボックスと接地した3次元境界ボックスの間に明らかに大域的な空間的制約を課し、それによって非結合な特性回帰による空間的ドリフトを補正する。
3D-2Dプロジェクションアライメントは、投影された3Dボックスが、画像平面上の対応する2D検出バウンディングボックス内に密に整列していることを保証する。
論文 参考訳(メタデータ) (2025-11-10T04:48:48Z) - SGFormer: Spherical Geometry Transformer for 360 Depth Estimation [52.23806040289676]
パノラマ歪みは360度深度推定において大きな課題となる。
本稿では,SGFormer という球面形状変換器を提案し,上記の問題に対処する。
また、様々な解像度で空間構造を補うために、クエリベースの大域的条件位置埋め込みを提案する。
論文 参考訳(メタデータ) (2024-04-23T12:36:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。