論文の概要: GAP-GDRNet: Geometry-Aware Monocular Visual Pose Sensing on a Single-Target Synthetic Spacecraft Dataset
- arxiv url: http://arxiv.org/abs/2607.02360v2
- Date: Fri, 03 Jul 2026 05:45:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 13:04:58.561551
- Title: GAP-GDRNet: Geometry-Aware Monocular Visual Pose Sensing on a Single-Target Synthetic Spacecraft Dataset
- Title(参考訳): GAP-GDRNet:単一ターゲット合成宇宙機データを用いた幾何学的単眼画像センシング
- Abstract要約: 本稿では,単分子RGBを用いた6次元センシングのための幾何学拡張フレームワークであるGAP-GDRNetについて述べる。
この方法は、GDR-Netの幾何学誘導直接回帰パラダイムに従い、パイプライン内の2つの点を変更する。
回転誤差は1.96円、翻訳誤差は0.0165m、ADD@0.02mの精度は95.16%に達し、GDR-Netベースラインを3.88ポイント上回る。
- 参考スコア(独自算出の注目度): 7.240627719297504
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Monocular relative pose sensing is a central perception problem in non-cooperative rendezvous and on-orbit servicing. In spacecraft images, however, weak surface texture, thin appendages, illumination changes, and partial occlusion often leave only sparse and unstable geometric evidence. This article presents GAP-GDRNet, a geometry-aware attention-enhanced framework for monocular RGB-based 6D pose sensing. The method follows the geometry-guided direct regression paradigm of GDR-Net and modifies two points in the pipeline: an attention-based feature refinement (AFR) module is placed before dense geometric prediction, and a patch-level geometric self-attention (PGSA) module is inserted into Patch-PnP. AFR reinforces global spacecraft structure together with local weak-texture cues; PGSA then relates downsampled geometric patches before final pose regression. A Blender-based annotation process supplies target masks, visible-region masks, dense model-coordinate maps, camera intrinsics, and 6D pose labels for supervised training.The primary evaluation uses a single-target synthetic spacecraft dataset built from one CAD model. GAP-GDRNet reaches a rotation error of $1.96^\circ$, a translation error of 0.0165 m, and an ADD@0.02 m accuracy of 95.16\%, exceeding the reproduced GDR-Net baseline by 3.88 percentage points while running at 35.97 FPS for pose-network inference. Supplementary evaluations on T-LESS and LM-O give BOP AR gains of 6.8 and 3.1 percentage points over the reproduced baseline.
- Abstract(参考訳): 単眼の相対的ポーズセンシングは、非協調的ランデブーと軌道上サーベイシングにおいて中心的な知覚問題である。
しかし、宇宙船の画像では、弱い表面のテクスチャ、薄い付属物、照明の変化、部分的な閉塞は、しばしばスパースで不安定な幾何学的証拠のみを残している。
本稿では,モノクラーRGBに基づく6次元ポーズセンシングのための幾何学的注目度向上フレームワークであるGAP-GDRNetについて述べる。
この方法はGDR-Netの幾何誘導直接回帰パラダイムに従ってパイプライン内の2つの点を修正し、注目に基づく特徴改善(AFR)モジュールを密集した幾何学的予測の前に配置し、パッチレベルの幾何学的自己アテンション(PGSA)モジュールをPatch-PnPに挿入する。
AFRは局所的な弱テクスチュアキューと共にグローバルな宇宙船構造を強化し、PGSAは最終ポーズの回帰の前にサンプル化された幾何学的パッチを関連付ける。
Blenderベースのアノテーションプロセスは、ターゲットマスク、可視領域マスク、密集したモデル座標マップ、カメラ固有の6Dポーズラベルを教師あり訓練のために提供します。
GAP-GDRNetは1.96^\circ$の回転誤差、翻訳誤差0.0165m、ADD@0.02mの精度95.16\%に達し、再生したGDR-Netベースラインを35.97FPSで動作しながら3.88ポイント超えた。
T-LESSとLM-Oの補助評価により、BOPARは再生ベースラインに対して6.8ポイントと3.1ポイント上昇する。
関連論文リスト
- SphereSOD: Geometry-Structure Coupled Learning for 360 Salient Object Detection [75.77856258186854]
360度高解像度物体検出は、全視野にわたって高解像度領域を正確に分割することを目的としている。
既存の手法は主に、パノラマ幾何学と健全な物体構造との相互作用を見越しながら、投影歪みを補正することに焦点を当てている。
SphereSODは、パノラマ幾何学と進化する塩分構造を結合したERPネイティブフレームワークである。
論文 参考訳(メタデータ) (2026-09-07T14:47:54Z) - Generalizable 6D Pose Estimation of Textureless Objects with Planar-based Gaussian Splatting [16.377546056452495]
本研究では,Planarをベースとしたガウス整形と幾何学的ポーズ最適化を組み合わせた幾何対応フレームワークPG-Poseを提案する。
OnePose-LowTextureデータセットの評価では、PG-Poseの平均精度は94.2% ADD(S)@0.1dであり、最先端(SOTA)GSベースのアプローチと比較して平均精度は2.1%向上している。
論文 参考訳(メタデータ) (2026-09-07T08:49:10Z) - PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation [8.561613404715237]
3次元モデルに基づく測地前駆体は拡散モデルを導出し、スパースアングルのトレーニングデータから欠落したビューを合成する。
GeoDiff-SARは、ライトウェイトなマルチバウンス線トレーシングを構築し、結果の点雲を符号化し、テキストコンディショニングで融合する。
5台のMSTAR車の同じスパースアングルプロトコルは0.878のSSIMと0.917のアジマス一貫性が得られる。
論文 参考訳(メタデータ) (2026-07-25T00:09:58Z) - Reliability-Aware 3D Geometric Injection for Universal Person Re-identification [47.874819213762926]
本稿では,一貫性を考慮した信頼性ゲートとDual-Stream Residual Fusionによって駆動されるUniversal Monocular 3D-Enhanced ReIDフレームワークを提案する。
本手法は,クリーンドメイン上での競合性能を維持しながら,難易度,構造に敏感なシナリオを改善する。
論文 参考訳(メタデータ) (2026-07-21T08:54:25Z) - EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction [14.023396396575132]
EO-VGGT(英語版)は、凍結した遠近法駆動のモデルを、明示的な物理幾何学的埋め込みによる軌道観測に適応させるフレームワークである。
この結果から, 衛星3Dの高機能化には, 明確な物理形状と視野選択の最適化が不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-07-01T04:19:49Z) - GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation [6.488530751190965]
全体移動操作には移動基地とマニピュレータの調整が必要である。
我々は、シンプルな原理に基づいて構築された、エンドツーエンドの拡散ベースのフレームワークGeoHATを提案する。
ManiSkill-HABシミュレーションベンチマークの実験では、GeoHATが79.3%の成功率を達成した。
論文 参考訳(メタデータ) (2026-06-11T14:25:09Z) - Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images [81.94999489820974]
UniSplat (UniSplat) は、未提示のマルチビュー画像から3D表現を学習するためのフィードフォワードフレームワークである。
エンコーダにおける幾何誘導を強化するデュアルマスキング戦略を導入する。
第2に,外見のセマンティックな矛盾を解消する粗大なガウス的スプレイティング戦略を開発する。
第3に、予測された3次元点と意味マップを画像平面に相互に関連付ける、ポーズ条件の補正機構を導入する。
論文 参考訳(メタデータ) (2026-04-12T10:36:18Z) - SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments [49.966170814478915]
UAV VLNのための幾何学誘導空間表現フレームワークを提案する。
明示的な3次元再構成を伴わないRGB観測において、SpatialFlyは幾何学誘導2次元表示アライメント機構を導入する。
実験結果から、SpatialFlyは現状のUAV VLNベースラインを目に見える環境と見えない環境の両方で一貫して上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2026-03-22T03:56:58Z) - GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models [70.61152292499737]
このギャップは、幾何学的事前の不足から生じるものではなく、訓練パラダイムの誤った調整から生じるものである、と我々は主張する。
既存のアプローチでは、通常、特徴の結合を示唆し、幾何学的な監督なしに下流のタスクを直接最適化する。
本稿では,下流適応前の構造知覚を明示的に活性化する幾何学的事前学習パラダイムであるGAP-MLLMを提案する。
論文 参考訳(メタデータ) (2026-03-17T12:43:48Z) - GGPT: Geometry Grounded Point Transformer [22.64445696362087]
本稿では,GGPT(Geometry-Grounded Point Transformer)について紹介する。
この基礎の上に構築された幾何誘導型3次元点変換器は,比例的な部分幾何学的監督の下で高密度点マップを洗練する。
論文 参考訳(メタデータ) (2026-03-11T18:00:04Z) - GSAlign: Geometric and Semantic Alignment Network for Aerial-Ground Person Re-Identification [32.31970656501684]
Aerial-Ground person re-identification (AG-ReID) は、歩行者のイメージを根本的に異なる視点からマッチングすることを目的とした、新たな課題である。
この課題は、極端に視点のずれ、ワープ、空中画像と地上画像の間の領域ギャップのために重大な課題を生じさせる。
論文 参考訳(メタデータ) (2025-10-25T12:16:10Z) - GeoPurify: A Data-Efficient Geometric Distillation Framework for Open-Vocabulary 3D Segmentation [57.8059956428009]
2次元視覚言語モデルから3次元セマンティックセグメンテーションへ機能を移行しようとする最近の試みは、永続的なトレードオフを露呈している。
3次元教師モデルから抽出した幾何学的事前情報を用いて2次元VLM生成した3次元点特徴に小さな学生親和性ネットワークを適用したGeoPurifyを提案する。
遅延幾何学情報と学習された親和性ネットワークから恩恵を受けることで、GeoPurifyはトレードオフを効果的に軽減し、優れたデータ効率を実現する。
論文 参考訳(メタデータ) (2025-10-02T16:37:56Z) - Structural Energy-Guided Sampling for View-Consistent Text-to-3D [18.973527029488746]
テキスト・トゥ・3D生成はしばしばジャヌス問題に悩まされ、オブジェクトが他の角度から重複または歪んだ幾何学に崩壊する。
本研究では, 実時間で完全にマルチビューの整合性を実現する学習自由なプラグイン・アンド・プレイフレームワークSEGSを提案する。
論文 参考訳(メタデータ) (2025-08-23T06:26:04Z) - Geometry-Editable and Appearance-Preserving Object Compositon [67.98806888489385]
汎用オブジェクト合成(GOC)は、対象オブジェクトを望まれる幾何学的性質を持つ背景シーンにシームレスに統合することを目的としている。
近年のアプローチは意味的埋め込みを導出し、それらを高度な拡散モデルに統合し、幾何学的に編集可能な生成を可能にする。
本稿では,まずセマンティックな埋め込みを活用して,所望の幾何学的変換を暗黙的にキャプチャするDistangled Geometry-editable and Outearance-Preserving Diffusionモデルを提案する。
論文 参考訳(メタデータ) (2025-05-27T09:05:28Z) - DiMeR: Disentangled Mesh Reconstruction Model [29.827345186012558]
DiMeRは、疎視メッシュ再構成のための3次元監視を備えた、幾何学的・テクスチュアなアンタングルフィードフォワードモデルである。
性能/コストの低いモジュールを排除し,正規化損失を再設計し,メッシュ抽出のアルゴリズムを効率化する。
大規模な実験により、DiMeRはスパースビュー、シングルイメージ、テキストから3Dタスクにまたがって一般化し、ベースラインを一貫して上回ることを示した。
論文 参考訳(メタデータ) (2025-04-24T15:39:20Z) - MonoGSDF: Exploring Monocular Geometric Cues for Gaussian Splatting-Guided Implicit Surface Reconstruction [86.87464903285208]
高品質な再構成のための神経信号距離場(SDF)とプリミティブを結合する新しい手法であるMonoGSDFを紹介する。
任意のスケールのシーンを扱うために,ロバストな一般化のためのスケーリング戦略を提案する。
実世界のデータセットの実験は、効率を保ちながら、以前の方法よりも優れています。
論文 参考訳(メタデータ) (2024-11-25T20:07:07Z) - Boosting Cross-Domain Point Classification via Distilling Relational Priors from 2D Transformers [59.0181939916084]
従来の3Dネットワークは主に局所幾何学的詳細に焦点を当て、局所幾何学間の位相構造を無視する。
そこで本稿では,大規模画像上においてよく訓練されたトランスフォーマーから前駆体を抽出する,新しい先駆体蒸留法を提案する。
PointDA-10とSim-to-Realデータセットの実験は、提案手法が点クラウド分類におけるUDAの最先端性能を一貫して達成していることを検証する。
論文 参考訳(メタデータ) (2024-07-26T06:29:09Z) - RGB-based Category-level Object Pose Estimation via Decoupled Metric
Scale Recovery [72.13154206106259]
本研究では、6次元のポーズとサイズ推定を分離し、不完全なスケールが剛性変換に与える影響を緩和するパイプラインを提案する。
具体的には,事前学習した単分子推定器を用いて局所的な幾何学的情報を抽出する。
別個のブランチは、カテゴリレベルの統計に基づいてオブジェクトのメートル法スケールを直接復元するように設計されている。
論文 参考訳(メタデータ) (2023-09-19T02:20:26Z) - Learning Geometry-Disentangled Representation for Complementary
Understanding of 3D Object Point Cloud [50.56461318879761]
3次元画像処理のためのGDANet(Geometry-Disentangled Attention Network)を提案する。
GDANetは、点雲を3Dオブジェクトの輪郭と平らな部分に切り離し、それぞれ鋭い変化成分と穏やかな変化成分で表される。
3Dオブジェクトの分類とセグメンテーションベンチマークの実験は、GDANetがより少ないパラメータで最先端の処理を実現していることを示している。
論文 参考訳(メタデータ) (2020-12-20T13:35:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。