論文の概要: Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation
- arxiv url: http://arxiv.org/abs/2603.27533v1
- Date: Sun, 29 Mar 2026 05:58:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.009586
- Title: Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation
- Title(参考訳): Demo-Pose:オブジェクトポス推定のための深度モノクローナルモダリティ融合
- Authors: Rachit Agarwal, Abhishek Joshi, Sathish Chalasani, Woo Jin Kim,
- Abstract要約: 本稿では,RGB-D入力からのカテゴリレベルの9-DoFポーズ推定の課題をCADモデルに頼らずに解決する。
深度に基づくグラフ畳み込み表現とセマンティック特徴を融合したハイブリッドアーキテクチャであるDeMo-Poseを提案する。
提案手法は,オブジェクトカテゴリ間のリアルタイム推論を実現し,最先端の手法を大幅に改善する。
- 参考スコア(独自算出の注目度): 5.466547563815996
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Object pose estimation is a fundamental task in 3D vision with applications in robotics, AR/VR, and scene understanding. We address the challenge of category-level 9-DoF pose estimation (6D pose + 3Dsize) from RGB-D input, without relying on CAD models during inference. Existing depth-only methods achieve strong results but ignore semantic cues from RGB, while many RGB-D fusion models underperform due to suboptimal cross-modal fusion that fails to align semantic RGB cues with 3D geometric representations. We propose DeMo-Pose, a hybrid architecture that fuses monocular semantic features with depth-based graph convolutional representations via a novel multimodal fusion strategy. To further improve geometric reasoning, we introduce a novel Mesh-Point Loss (MPL) that leverages mesh structure during training without adding inference overhead. Our approach achieves real-time inference and significantly improves over state-of-the-art methods across object categories, outperforming the strong GPV-Pose baseline by 3.2\% on 3D IoU and 11.1\% on pose accuracy on the REAL275 benchmark. The results highlight the effectiveness of depth-RGB fusion and geometry-aware learning, enabling robust category-level 3D pose estimation for real-world applications.
- Abstract(参考訳): オブジェクトのポーズ推定は、ロボット工学、AR/VR、シーン理解といった3Dビジョンにおける基本的なタスクである。
本稿では,RGB-D入力からのカテゴリレベルの9-DoFポーズ推定(6次元ポーズ+3次元サイズ)の課題に,推論中にCADモデルに依存することなく対処する。
既存の深度のみの手法は強い結果を得るが、RGBのセマンティックキューは無視するが、多くのRGB-D融合モデルは、セマンティックRGBキューと3次元幾何表現との整合に失敗する最適部分モーダル融合により、性能が低下する。
深度に基づくグラフ畳み込み表現を新しいマルチモーダル融合戦略により単分子的セマンティック特徴を融合するハイブリッドアーキテクチャであるDeMo-Poseを提案する。
幾何学的推論をさらに改善するために、推論オーバーヘッドを加えることなく、トレーニング中にメッシュ構造を利用する新しいメッシュポイント損失(MPL)を導入する。
提案手法は,3次元IoUではGPV-Poseベースラインが3.2\%,REAL275ベンチマークでは11.1\%に向上し,オブジェクトカテゴリ間のリアルタイム推論を実現している。
その結果, 深度RGB融合と幾何認識学習の有効性が強調され, 実世界のアプリケーションに対してロバストなカテゴリレベルの3Dポーズ推定が可能となった。
関連論文リスト
- DKPMV: Dense Keypoints Fusion from Multi-View RGB Frames for 6D Pose Estimation of Textureless Objects [18.011730388391232]
我々は,高密度キーポイントレベルの融合を実現するパイプラインDKPMVを提案する。
我々は,注目集約と対称性を考慮した学習により,キーポイントネットワークを強化した。
ROBIデータセットの実験により、DKPMVは最先端のマルチビューRGBアプローチより優れていることが示された。
論文 参考訳(メタデータ) (2025-10-13T02:45:55Z) - UniPose: Unified Cross-modality Pose Prior Propagation towards RGB-D data for Weakly Supervised 3D Human Pose Estimation [14.52285662885727]
We present UniPose, a unified cross-modality pose before propagation method for weak supervised 3D human pose Estimation。
UniPoseは、大規模RGBデータセットから自己教師付き学習を通じて3Dドメインに2Dアノテーションを転送する。
CMU PanopticとITOPデータセットの実験は、UniPoseが完全に教師されたメソッドと同等のパフォーマンスを達成していることを示している。
論文 参考訳(メタデータ) (2025-09-27T15:49:30Z) - Towards Human-Level 3D Relative Pose Estimation: Generalizable, Training-Free, with Single Reference [65.42565481489132]
人間は、単一のクエリ参照イメージペアのみを前提として、ラベル付けやトレーニングをすることなく、これまで見られなかったオブジェクトの相対的なポーズを容易に推論することができる。
RGB-D参照から3D/2.5D形状認識と2.5D形状認識を併用した新しい3次元一般化可能な相対ポーズ推定法を提案する。
RGBとセマンティックマップ(DINOv2がRGB入力から取得)によってテクスチャ化された2.5Dの回転可能なメッシュを識別し、新しいRGBとセマンティックマップを新しい回転ビューの下でレンダリングする。
論文 参考訳(メタデータ) (2024-06-26T16:01:10Z) - MatchU: Matching Unseen Objects for 6D Pose Estimation from RGB-D Images [57.71600854525037]
RGB-D画像からの6次元ポーズ推定のためのFuse-Describe-Match戦略を提案する。
MatchUは、2Dテクスチャと6Dポーズ予測のための3D幾何学的手がかりを融合する汎用的なアプローチである。
論文 参考訳(メタデータ) (2024-03-03T14:01:03Z) - Towards Two-view 6D Object Pose Estimation: A Comparative Study on
Fusion Strategy [16.65699606802237]
現在のRGBベースの6Dオブジェクトポーズ推定手法は、データセットや実世界のアプリケーションで顕著なパフォーマンスを達成した。
本稿では2枚のRGB画像から暗黙的な3D情報を学習する6次元オブジェクトポーズ推定フレームワークを提案する。
論文 参考訳(メタデータ) (2022-07-01T08:22:34Z) - Learning Stereopsis from Geometric Synthesis for 6D Object Pose
Estimation [11.999630902627864]
現在のモノクラーベース6Dオブジェクトポーズ推定法は、一般的にRGBDベースの手法よりも競争力の低い結果が得られる。
本稿では,短いベースライン2ビュー設定による3次元幾何体積に基づくポーズ推定手法を提案する。
実験により,本手法は最先端の単分子法よりも優れ,異なる物体やシーンにおいて堅牢であることが示された。
論文 参考訳(メタデータ) (2021-09-25T02:55:05Z) - Learning Geometry-Guided Depth via Projective Modeling for Monocular 3D Object Detection [70.71934539556916]
射影モデルを用いて幾何学誘導深度推定を学習し, モノクル3次元物体検出を推し進める。
具体的には,モノクロ3次元物体検出ネットワークにおける2次元および3次元深度予測の投影モデルを用いた原理的幾何式を考案した。
本手法は, 適度なテスト設定において, 余分なデータを2.80%も加えることなく, 最先端単分子法の検出性能を著しく向上させる。
論文 参考訳(メタデータ) (2021-07-29T12:30:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。