論文の概要: RYOPO: Bringing End-to-End Category-Level Object Pose Estimation into Real Time
- arxiv url: http://arxiv.org/abs/2610.03013v1
- Date: Fri, 02 Oct 2026 08:47:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.287668
- Title: RYOPO: Bringing End-to-End Category-Level Object Pose Estimation into Real Time
- Title(参考訳): RYOPO: エンド・ツー・エンドのカテゴリ・レベル・オブジェクト・ポーズ推定をリアルタイムに実現する
- Abstract要約: カテゴリーレベルのオブジェクトポーズ推定は、既知のカテゴリ内の見えないインスタンスの回転、翻訳、およびメートル法サイズを予測する。
多くの正確なRGB-D法は、外部のインスタンスセグメンテーションと作物ベースのポーズ推定に依存し、別々のステージとオブジェクト依存処理コストを導入している。
エンドツーエンドのトレーニング可能なRGB-Dセット予測器を提示する。
- 参考スコア(独自算出の注目度): 3.632189127068905
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Category-level object pose estimation predicts the rotation, translation, and metric size of unseen instances within known categories. Many accurate RGB-D methods rely on external instance segmentation and crop-based pose estimation, introducing separate stages and object-dependent processing costs that hinder real-time inference. To bring accurate pose estimation into real time, we present \ours{}, an end-to-end trainable query-based RGB-D set predictor. It jointly detects and segments objects and estimates their \mbox{9-DoF} poses without explicit CAD-derived shape priors or a separately trained instance segmentor. Shared image and scene encoding avoids repeated per-object crop encoding. A query-conditioned geometry pathway associates observed 3D points and RGB features with object queries and incorporates shared scene context. Object-centric refinement uses the resulting point descriptors to update an explicit pose state through pose-conditioned cross-attention and recurrent residual corrections. On NOCS, \ours{} substantially improves on published RGB-D joint detection and pose estimation results. It achieves competitive performance compared with two-stage methods under all-object evaluation on REAL275 and HouseCat6D, while enabling real-time full-frame pose estimation at $31.8$ FPS on an RTX~A6000. Project page: https://yopo-series.github.io/RYOPO-project-page/.
- Abstract(参考訳): カテゴリーレベルのオブジェクトポーズ推定は、既知のカテゴリ内の見えないインスタンスの回転、翻訳、およびメートル法サイズを予測する。
多くの正確なRGB-D法は、外部のインスタンスセグメンテーションと作物ベースのポーズ推定に依存しており、異なるステージとオブジェクト依存処理コストを導入し、リアルタイム推論を妨げている。
リアルタイムに正確なポーズ推定を実現するために,エンドツーエンドのトレーニング可能なRGB-Dセット予測器である \ours{} を提案する。
オブジェクトを共同で検出してセグメンテーションし、明示的なCAD由来の形状や個別に訓練されたインスタンスセグメンタを使わずに、それらの \mbox{9-DoF} のポーズを推定する。
共有画像とシーンエンコーディングは、オブジェクトごとの作物エンコーディングの繰り返しを避ける。
クエリ条件付き幾何経路は、観測された3DポイントとRGB特徴とオブジェクトクエリを関連付け、共有シーンコンテキストを組み込む。
オブジェクト中心のリファインメントは、結果のポイント記述子を使用して、ポーズ条件のクロスアテンションと繰り返しの残留修正を通じて明示的なポーズ状態を更新する。
NOCSでは、 \ours{}は発行されたRGB-D関節検出とポーズ推定結果を大幅に改善する。
REAL275とHouseCat6Dの2段階評価において、RTX~A6000でリアルタイムフルフレームポーズ推定を31.8ドルFPSで実現し、競合性能を実現する。
プロジェクトページ:https://yopo-series.github.io/RYOPO-project-page/
関連論文リスト
- UniPose9D: Universal Category-Agnostic Object Pose Estimation [10.964744555206243]
UniPose9Dは9次元オブジェクトのポーズ推定のためのカテゴリに依存しない基礎モデルである。
カテゴリーラベル、CADモデル、平均形事前、参照ビューのない回転、翻訳、およびメートル法サイズを推定する。
精度を向上させるために,適応しきい値を持つRANSAC N-hop Kabsch-Umeyamaアルゴリズムを導入する。
論文 参考訳(メタデータ) (2026-07-10T21:24:23Z) - UNOPose: Unseen Object Pose Estimation with an Unposed RGB-D Reference Image [86.7128543480229]
見えないオブジェクトのポーズ推定方法はCADモデルや複数の参照ビューに依存することが多い。
参照取得を簡略化するために,未提示のRGB-D参照画像を用いて未確認オブジェクトのポーズを推定することを目的とする。
単参照型オブジェクトポーズ推定のための新しいアプローチとベンチマークをUNOPoseと呼ぶ。
論文 参考訳(メタデータ) (2024-11-25T05:36:00Z) - LaPose: Laplacian Mixture Shape Modeling for RGB-Based Category-Level Object Pose Estimation [43.549593231397644]
LaPoseは、オブジェクトの形状をPose推定のためのLaplacian混合モデルとしてモデル化する、新しいフレームワークである。
各点を確率分布として表現することにより、形状の不確実性を明確に定量化する。
LaPoseは、カテゴリレベルのオブジェクトポーズ推定における最先端のパフォーマンスを得る。
論文 参考訳(メタデータ) (2024-09-24T04:20:18Z) - DVMNet++: Rethinking Relative Pose Estimation for Unseen Objects [59.51874686414509]
既存のアプローチでは、通常、接地構造オブジェクト境界ボックスと、多数の離散仮説を持つ近似3次元回転を用いて3次元翻訳を予測している。
本稿では,1回のパスで相対オブジェクトのポーズを計算するDeep Voxel Matching Network (DVMNet++)を提案する。
提案手法は,最先端手法と比較して計算コストの低い新しいオブジェクトに対して,より正確な相対的ポーズ推定を行う。
論文 参考訳(メタデータ) (2024-03-20T15:41:32Z) - RGB-based Category-level Object Pose Estimation via Decoupled Metric
Scale Recovery [72.13154206106259]
本研究では、6次元のポーズとサイズ推定を分離し、不完全なスケールが剛性変換に与える影響を緩和するパイプラインを提案する。
具体的には,事前学習した単分子推定器を用いて局所的な幾何学的情報を抽出する。
別個のブランチは、カテゴリレベルの統計に基づいてオブジェクトのメートル法スケールを直接復元するように設計されている。
論文 参考訳(メタデータ) (2023-09-19T02:20:26Z) - LocPoseNet: Robust Location Prior for Unseen Object Pose Estimation [69.70498875887611]
LocPoseNetは、見えないオブジェクトに先立って、ロバストにロケーションを学習することができる。
提案手法は,LINEMOD と GenMOP において,既存の作業よりも優れた性能を示す。
論文 参考訳(メタデータ) (2022-11-29T15:21:34Z) - CPPF: Towards Robust Category-Level 9D Pose Estimation in the Wild [45.93626858034774]
カテゴリーレベルのPPF投票法は、野生における正確で堅牢で一般化可能な9Dポーズ推定を実現する。
ノイズの多い点対のサンプルを排除し、個体群から最終的な予測を生成するために、新しい粗大な投票アルゴリズムを提案する。
我々の手法は実世界のトレーニングデータと同等である。
論文 参考訳(メタデータ) (2022-03-07T01:36:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。