論文の概要: Cross-Modal RGB-D Fusion Transformer for 6D Pose Estimation of Non-Cooperative Spacecraft with Stereo-Derived Depth
- arxiv url: http://arxiv.org/abs/2605.08592v1
- Date: Sat, 09 May 2026 01:16:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.763204
- Title: Cross-Modal RGB-D Fusion Transformer for 6D Pose Estimation of Non-Cooperative Spacecraft with Stereo-Derived Depth
- Title(参考訳): 立体微分深度非協調宇宙機の6次元ポス推定のためのクロスモーダルRGB-D核融合変圧器
- Authors: Yongliang Zhen, Bo LÜ, Hang Yang, Xiaotian WU,
- Abstract要約: 学習に基づく単分子法は、宇宙船のポーズ推定に広く採用されている。
彼らは固有の深さの曖昧さの問題に悩まされ、軌道で遭遇する厳しい照明条件下では失敗する傾向にある。
アクティブな深度センサーは、基本的に幾何学的な曖昧さに対処できるが、そのパワーと質量の要求により、ほとんどの宇宙船のプラットフォームには適さない。
この研究は、非協力宇宙船の6自由度(6-DOF)ポーズ推定のための受動的ステレオビジョンフレームワークを通じてこれらの問題に対処する。
- 参考スコア(独自算出の注目度): 9.6704752180736
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-orbit servicing and active debris removal involving non-cooperative spacecraft require reliable pose estimation to supply accurate position and orientation data for autonomous visual navigation. Learning-based monocular methods have seen widespread adoption in spacecraft pose estimation, yet they suffer from an intrinsic depth ambiguity problem and tend to fail under the harsh illumination conditions routinely encountered in orbit. Active depth sensors could in principle address the geometric ambiguity, but their power and mass requirements make them poorly suited to most spacecraft platforms. This work addresses these issues through a passive stereo vision framework for six-degree-of-freedom (6-DOF) pose estimation of non-cooperative spacecraft. A binocular stereo matching network called TSCA-Stereo is developed to cope with weak-texture surfaces, specular highlights, and severe lighting variations typical of space imagery. A cross-modal fusion Transformer is introduced to combine RGB appearance information with stereo depth features in an adaptive manner, supporting reliable pose recovery. A synthetic binocular multimodal dataset is also built for the experiments, covering stereo disparity maps and 6-DOF pose annotations across a range of illumination scenarios, attitude configurations, and noise levels. Experimental results show that TSCA-Stereo outperforms the baseline across every evaluated metric on this space-specific dataset. The full pose estimation pipeline achieves a mean translation error of 0.0419 m and a mean orientation error of 0.8632° under varied imaging conditions, confirming that the passive stereo approach is both effective and resilient when operating under the demanding visual conditions of the space environment.
- Abstract(参考訳): 非協力宇宙船による軌道上サービスとアクティブデブリの除去には、自律的な視覚ナビゲーションのための正確な位置と方向データを供給するための信頼性の高いポーズ推定が必要である。
学習に基づく単分子法は、宇宙船のポーズ推定に広く採用されているが、本質的な深さの曖昧さの問題に悩まされ、通常軌道で発生する厳しい照明条件下では失敗する傾向がある。
アクティブな深度センサーは、基本的に幾何学的な曖昧さに対処できるが、そのパワーと質量の要求により、ほとんどの宇宙船のプラットフォームには適さない。
この研究は、非協力宇宙船の6自由度(6-DOF)ポーズ推定のための受動的ステレオビジョンフレームワークを通じてこれらの問題に対処する。
TSCA-Stereoと呼ばれる両眼ステレオマッチングネットワークは、弱いテクスチャ表面、特異なハイライト、空間画像に典型的な厳しい照明のバリエーションに対処するために開発された。
RGB外観情報とステレオ深度特徴を適応的に組み合わせ、信頼性の高いポーズ回復をサポートするクロスモーダル融合変換器が導入された。
ステレオディファリティマップと6-DOFのアノテーションを、照明シナリオ、姿勢設定、騒音レベルにわたってカバーする合成双眼鏡マルチモーダルデータセットもこの実験のために構築されている。
実験結果から、TSCA-Stereoは、この空間固有のデータセット上で評価された指標毎にベースラインを上回ります。
フルポーズ推定パイプラインは、様々な撮像条件下での平均翻訳誤差0.0419mと平均方位誤差0.8632°を達成し、宇宙環境の要求される視覚条件下での操作において、受動的ステレオアプローチが有効かつレジリエントであることを確認する。
関連論文リスト
- Tightly-Coupled Radar-Visual-Inertial Odometry [12.2300314007703]
提案手法は,反復拡張カルマンフィルタ(IEKF)内の画像特徴,レーダドップラー計測,慣性測定ユニット(IMU)計測をリアルタイムに融合する。
本手法は,室内および屋外の両方で実施した飛行実験により評価した。
論文 参考訳(メタデータ) (2026-03-24T10:47:04Z) - Towards Versatile Opti-Acoustic Sensor Fusion and Volumetric Mapping [2.064612766965483]
自動水中車両にはボリュームマッピングが不可欠である。
視覚に基づく知覚は高解像度のデータを提供するが、濁った状況では失敗する。
ソナーは光と濁りに強いが 解像度が低く 高さの曖昧さに悩まされている
本稿では,ステレオソナー対とモノクラーカメラを融合させて,様々な視認性条件下での安全なナビゲーションを実現するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-15T16:06:28Z) - Scale-Aware UAV-to-Satellite Cross-View Geo-Localization: A Semantic Geometric Approach [15.415356946083861]
UAV画像と衛星画像のクロスビュージオローカライゼーションは、標的位置決めとUAV自己配置において重要な役割を担っている。
既存の手法のほとんどは、UAVクエリと衛星ギャラリー間のスケール一貫性の理想的な仮定に依存している。
この不一致は視野のずれや特徴ミスマッチを引き起こし、CVGLの堅牢性を著しく低下させる。
意味アンカーを用いた単眼UAV画像から絶対距離を復元する幾何学的枠組みを提案する。
論文 参考訳(メタデータ) (2026-03-08T08:51:19Z) - VLM6D: VLM based 6Dof Pose Estimation based on RGB-D Images [7.044221981512693]
VLM6Dは、RGB-D入力からの視覚的および幾何学的データの強度を利用して、ロバストで正確なポーズ推定を行う新しいデュアルストリームアーキテクチャである。
我々は, VLM6D が Occluded-LineMOD に挑戦する上で, 新たな SOTA 性能を得るための総合実験を行った。
論文 参考訳(メタデータ) (2025-10-31T05:26:41Z) - WS-DETR: Robust Water Surface Object Detection through Vision-Radar Fusion with Detection Transformer [4.768265044725289]
水面オブジェクト検出は、ぼやけたエッジと多様なオブジェクトスケールの課題に直面します。
既存のアプローチは、モデルの堅牢性に悪影響を及ぼす、クロスモーダルな機能競合に悩まされている。
本稿では,SOTA(State-of-the-art)性能を実現する頑健なビジョンレーダ融合モデルWS-DETRを提案する。
論文 参考訳(メタデータ) (2025-04-10T04:16:46Z) - Boosting Omnidirectional Stereo Matching with a Pre-trained Depth Foundation Model [70.67610495024459]
カメラベースの設定は、立体深度推定を用いて高解像度の高解像度深度マップを生成することで、コスト効率のよい選択肢を提供する。
既存の全方位ステレオマッチング手法は、様々な環境において限られた深度精度しか達成できない。
DFI-OmniStereoは, 大規模事前学習基礎モデルを用いて, 相対的な単眼深度推定を行う新しい全方位ステレオマッチング法である。
論文 参考訳(メタデータ) (2025-03-30T16:24:22Z) - Unveiling the Depths: A Multi-Modal Fusion Framework for Challenging
Scenarios [103.72094710263656]
本稿では,学習に基づくフレームワークを用いて,支配的モダリティの奥行きを識別し,統合する手法を提案する。
本稿では,信頼度予測ネットワークを操り,潜在電位深度領域を特定する信頼マップを作成する新しい信頼損失を提案する。
得られた信頼度マップを用いて,最終深度をエンドツーエンドに融合するマルチモーダル融合ネットワークを提案する。
論文 参考訳(メタデータ) (2024-02-19T04:39:16Z) - On Robust Cross-View Consistency in Self-Supervised Monocular Depth Estimation [56.97699793236174]
本論文では,2種類の堅牢なクロスビュー整合性について検討する。
深度特徴空間と3次元ボクセル空間の時間的コヒーレンスを自己教師付き単眼深度推定に利用した。
いくつかのアウトドアベンチマークの実験結果から,本手法は最先端技術より優れていることが示された。
論文 参考訳(メタデータ) (2022-09-19T03:46:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。