論文の概要: Generalizable 6D Pose Estimation of Textureless Objects with Planar-based Gaussian Splatting
- arxiv url: http://arxiv.org/abs/2609.07231v1
- Date: Mon, 07 Sep 2026 08:49:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 01:09:11.606641
- Title: Generalizable 6D Pose Estimation of Textureless Objects with Planar-based Gaussian Splatting
- Title(参考訳): 平面型ガウススプレイティングによるテクスチャレス物体の一般化可能な6次元ポス推定
- Authors: Jie Lu, Hengtan Zhang, Li Gong, Pengpeng Wang, Xianjia Yu, Jinxiang Deng, Tomi Westerlund, Zhongxue Gan, Lirong Zheng, Zhuo Zou,
- Abstract要約: 本研究では,Planarをベースとしたガウス整形と幾何学的ポーズ最適化を組み合わせた幾何対応フレームワークPG-Poseを提案する。
OnePose-LowTextureデータセットの評価では、PG-Poseの平均精度は94.2% ADD(S)@0.1dであり、最先端(SOTA)GSベースのアプローチと比較して平均精度は2.1%向上している。
- 参考スコア(独自算出の注目度): 16.377546056452495
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Estimating the 6D pose of textureless objects without prior CAD models remains a critical challenge due to the lack of appearance features. While recent generalizable approaches alleviate the dependence on object-specific models, their performance on low-texture objects is often limited by insufficient geometric constraints in the underlying representations. In this work, we propose PG-Pose, a geometry-aware framework combining Planar-based Gaussian Splatting (PGS) reconstruction and Geometry-driven pose optimization. In the offline representation extraction stage, three distinct representations of the object are extracted from multi-view reference RGB images with known poses. PG-Pose reconstructs a 3D Gaussian representation and renders high-fidelity depth maps to generate 3D point clouds through back projection. In the online pose inference stage, the initial pose of the input image is estimated by 2D-3D correspondence matching between the input image and the reconstructed 3D point clouds, followed by a PGS-Refiner for iterative pose optimization. Evaluations on the OnePose-LowTexture datasets, PG-Pose achieves an average accuracy of 94.2% ADD(S)@0.1d, with a 2.1% improvement average accuracy compared with the state-of-the-art (SOTA) GS-based approach. To further demonstrate the effectiveness of PG-Pose for industrial robots in grasping tasks, we deploy it on a dual-arm industrial robot and successfully realize the grasping task on an unseen object.
- Abstract(参考訳): 従来のCADモデルを使わずにテクスチャレスオブジェクトの6Dポーズを推定することは、外観的特徴が欠如しているため、依然として重要な課題である。
最近の一般化可能なアプローチは、オブジェクト固有のモデルへの依存を緩和するが、低テクスチャオブジェクトに対するそれらのパフォーマンスは、下層の表現において不十分な幾何学的制約によって制限されることが多い。
本研究では,Planar-based Gaussian Splatting (PGS)とGeometry-driven pose optimizationを組み合わせた幾何対応フレームワークPG-Poseを提案する。
オフライン表現抽出段階では、既知のポーズを持つ多視点参照RGB画像から、オブジェクトの3つの異なる表現を抽出する。
PG-Poseは3次元ガウス表現を再構成し、高忠実度深度マップを描画し、後方投影を通して3次元点雲を生成する。
オンラインポーズ推論段階では、入力画像と再構成された3D点雲との2D-3D対応で入力画像の初期ポーズを推定し、続いて反復ポーズ最適化のためのPGS-Refinerを推定する。
OnePose-LowTextureデータセットの評価では、PG-Poseの平均精度は94.2% ADD(S)@0.1dであり、最先端(SOTA)GSベースのアプローチと比較して平均精度は2.1%向上している。
産業用ロボットにおけるPG-Poseの作業把握効果をさらに実証するため,両腕産業用ロボットに展開し,未確認物体の把握作業の実現に成功している。
関連論文リスト
- QuerySplat: Decoupling Geometry and Appearance Representations in 3DGS Prediction [25.05567017307621]
textbfQuerySplatは、幾何学的先行と明示的な外見の疎結合によって駆動されるフィードフォワード3DGSフレームワークである。
実験によると、QuerySplatは初期のクエリベースのモデルの曖昧なレンダリング問題を緩和する。
挑戦的なDL3DVベンチマークでは、ポーズフリーでポーズ要求のベースラインよりも平均2.30dBと1.04dBのPSNRゲインを持つ最先端の新規ビュー合成性能を達成している。
論文 参考訳(メタデータ) (2026-08-02T12:12:02Z) - PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects [36.94429692322632]
PIXIEは、オブジェクトの6Dポーズを、文脈のない3Dモデルのみを使用してRGB画像から推定するゼロショットフレームワークである。
我々は、広く使われている公開ベンチマークを評価し、オブジェクト固有のトレーニングを伴わずにテクスチャのないオブジェクトに対して結果を報告し、現実の応用性を示すための新しいデータセットを紹介した。
論文 参考訳(メタデータ) (2026-07-17T14:48:43Z) - DreamSat-Pose: Spacecraft Pose Estimation from Single-View 3D Reconstructions and Learned 2D-3D Feature Matching [0.5176742519438303]
本稿では,未知の宇宙船物体の単発形状とポーズ推定のための新しいフレームワークを提案する。
まず、ターゲットの3次元形状モデルを再構成し、密集した2D-3D対応を学習することにより、相対的な6自由度ポーズを推定する。
その結果、1枚の画像のみを用いて0.157度の平均ポインティング誤差を達成できる信頼性の高いポーズ推定値が得られた。
論文 参考訳(メタデータ) (2026-07-15T05:12:48Z) - Stereo-GS: Multi-View Stereo Vision Model for Generalizable 3D Gaussian Splatting Reconstruction [30.518107360632488]
一般化可能な3Dガウス・スプレイティング・リコンストラクションは、高度な画像から3Dコンテンツの作成を展示する。
methodは現実世界の3Dコンテンツ生成に効率的でスケーラブルなソリューションを提供する。
論文 参考訳(メタデータ) (2025-07-20T11:33:13Z) - FreeSplatter: Pose-free Gaussian Splatting for Sparse-view 3D Reconstruction [69.63414788486578]
FreeSplatterはスケーラブルなフィードフォワードフレームワークで、キャリブレーションされていないスパースビュー画像から高品質な3Dガウシアンを生成する。
当社のアプローチでは,自己注意ブロックが情報交換を容易にする合理化トランスフォーマーアーキテクチャを採用している。
包括的データセットに基づいて,オブジェクト中心とシーンレベルの再構築のための2つの特殊な変種を開発する。
論文 参考訳(メタデータ) (2024-12-12T18:52:53Z) - PF3plat: Pose-Free Feed-Forward 3D Gaussian Splatting [54.7468067660037]
PF3platは、設計選択を検証した包括的なアブレーション研究によってサポートされた、すべてのベンチマークに新しい最先端を設定します。
本フレームワークは,3DGSの高速,スケーラビリティ,高品質な3D再構成とビュー合成機能を活用している。
論文 参考訳(メタデータ) (2024-10-29T15:28:15Z) - GeoLRM: Geometry-Aware Large Reconstruction Model for High-Quality 3D Gaussian Generation [65.33726478659304]
GeoLRM(Geometry-Aware Large Restruction Model)は、512kガウスと21の入力画像で11GBのGPUメモリで高品質な資産を予測できる手法である。
従来の作品では、3D構造の本質的な空間性は無視されており、3D画像と2D画像の間の明示的な幾何学的関係は利用されていない。
GeoLRMは、3Dポイントを直接処理し、変形可能なクロスアテンション機構を使用する新しい3D対応トランスフォーマー構造を導入することで、これらの問題に対処する。
論文 参考訳(メタデータ) (2024-06-21T17:49:31Z) - GeoGS3D: Single-view 3D Reconstruction via Geometric-aware Diffusion Model and Gaussian Splatting [81.03553265684184]
単視点画像から詳細な3Dオブジェクトを再構成するフレームワークであるGeoGS3Dを紹介する。
本稿では,GDS(Gaussian Divergence Significance)という新しい指標を提案する。
実験により、GeoGS3Dはビュー間で高い一貫性を持つ画像を生成し、高品質な3Dオブジェクトを再構成することを示した。
論文 参考訳(メタデータ) (2024-03-15T12:24:36Z) - CheckerPose: Progressive Dense Keypoint Localization for Object Pose
Estimation with Graph Neural Network [66.24726878647543]
単一のRGB画像から固い物体の6-DoFのポーズを推定することは、非常に難しい課題である。
近年の研究では、高密度対応型解の大きな可能性を示している。
そこで本研究では,CheckerPoseというポーズ推定アルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-03-29T17:30:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。