論文の概要: OMNI-PoseX: A Fast Vision Model for 6D Object Pose Estimation in Embodied Tasks
- arxiv url: http://arxiv.org/abs/2604.02759v1
- Date: Fri, 03 Apr 2026 06:07:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-06 17:20:24.341988
- Title: OMNI-PoseX: A Fast Vision Model for 6D Object Pose Estimation in Embodied Tasks
- Title(参考訳): OMNI-PoseX: 身体的タスクにおける6次元オブジェクトポス推定のための高速ビジョンモデル
- Authors: Michael Zhang, Wei Ying, Fangwen Chen, Shifeng Bai, Hanwen Kang,
- Abstract要約: オープン語彙認識とSO(3)を意識したリフレクションフローマッチング・ポーズ・プロジェクタを一体化した視覚基礎モデルを提案する。
このアーキテクチャは、幾何一貫性のある回転推定からオブジェクトレベルの理解を分離し、軽量なマルチモーダル融合戦略を採用している。
堅牢性と一般化性を高めるため、モデルは大規模な6Dポーズデータセットに基づいて訓練される。
- 参考スコア(独自算出の注目度): 5.49148694940665
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Accurate 6D object pose estimation is a fundamental capability for embodied agents, yet remains highly challenging in open-world environments. Many existing methods often rely on closed-set assumptions or geometry-agnostic regression schemes, limiting their generalization, stability, and real-time applicability in robotic systems. We present OMNI-PoseX, a vision foundation model that introduces a novel network architecture unifying open-vocabulary perception with an SO(3)-aware reflected flow matching pose predictor. The architecture decouples object-level understanding from geometry-consistent rotation inference, and employs a lightweight multi-modal fusion strategy that conditions rotation-sensitive geometric features on compact semantic embeddings, enabling efficient and stable 6D pose estimation. To enhance robustness and generalization, the model is trained on large-scale 6D pose datasets, leveraging broad object diversity, viewpoint variation, and scene complexity to build a scalable open-world pose backbone. Comprehensive evaluations across benchmark pose estimation, ablation studies, zero-shot generalization, and system-level robotic grasping integration demonstrate the effectiveness of OMNI-PoseX. The OMNI-PoseX achieves SOTA pose accuracy and real-time efficiency, while delivering geometrically consistent predictions that enable reliable grasping of diverse, previously unseen objects.
- Abstract(参考訳): 正確な6Dオブジェクトのポーズ推定は、エンボディエージェントの基本的な能力であるが、オープンワールド環境では非常に困難である。
多くの既存の手法は、ロボットシステムにおける一般化、安定性、リアルタイム適用性を制限し、クローズドセットの仮定や幾何に依存しない回帰スキームに依存している。
OMNI-PoseXはオープン語彙認識をSO(3)対応のリフレクションフローマッチングポーズ予測器と統合する新しいネットワークアーキテクチャを導入したビジョン基盤モデルである。
このアーキテクチャは、幾何一貫性のある回転推定からオブジェクトレベルの理解を分離し、コンパクトなセマンティック埋め込みに回転感受性の幾何学的特徴を条件付け、効率的で安定した6次元ポーズ推定を可能にする軽量なマルチモーダル融合戦略を用いる。
堅牢性と一般化を強化するため、モデルは大規模な6Dポーズデータセットに基づいてトレーニングされ、幅広いオブジェクトの多様性、視点の変化、シーンの複雑さを活用して、スケーラブルなオープンワールドポーズバックボーンを構築する。
総合評価は,OMNI-PoseXの有効性を示す。
OMNI-PoseXはSOTAの精度とリアルタイムの効率を実現し、幾何学的に一貫した予測を提供することで、以前は見えなかった多様なオブジェクトを確実に把握することができる。
関連論文リスト
- Object Pose Transformer: Unifying Unseen Object Pose Estimation [54.20344997573707]
モデルなしのオブジェクトポーズ推定を未知のインスタンスで学習することは、3Dビジョンにおける根本的な課題である。
我々のチームは、RGB入力から深度、ポイントマップ、カメラパラメータ、正規化されたオブジェクト座標を共同で予測します。
当社はカメラ非依存で、カメラ固有の知識をオンザフライで学習し、メトリックスケールリカバリのためのオプションの深度入力をサポートします。
論文 参考訳(メタデータ) (2026-03-24T16:04:16Z) - Geo6DPose: Fast Zero-Shot 6D Object Pose Estimation via Geometry-Filtered Feature Matching [0.0]
Geo6DPoseは、ゼロショット6Dポーズ推定のための軽量で、完全にローカルで、トレーニング不要なパイプラインである。
Geo6DPoseは、1つのコモディティGPU上で、はるかに大きなゼロショットベースラインの平均リコールをマッチングしながら、サブ秒の推論を実現する。
論文 参考訳(メタデータ) (2025-12-11T14:20:17Z) - OPFormer: Object Pose Estimation leveraging foundation model with geometric encoding [2.1987601456703474]
オブジェクト検出とポーズ推定をシームレスに統合する統合されたエンドツーエンドフレームワークを導入する。
当システムではまずCNOS検出器を用いて対象物体のローカライズを行う。
検出毎に、新しいポーズ推定モジュールOPFormerが正確な6Dポーズを推測する。
論文 参考訳(メタデータ) (2025-11-16T14:19:52Z) - UnPose: Uncertainty-Guided Diffusion Priors for Zero-Shot Pose Estimation [19.76147681894604]
UnPoseはゼロショットでモデルなしの6Dオブジェクトのポーズ推定と再構成のためのフレームワークである。
事前訓練された拡散モデルから3Dの先行値と不確実性の推定値を利用する。
6次元ポーズ推定精度と3次元再構成品質の両方において、既存のアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2025-08-21T21:31:04Z) - Any6D: Model-free 6D Pose Estimation of Novel Objects [76.30057578269668]
我々は,6次元オブジェクトのポーズ推定のためのモデルフリーフレームワークであるAny6Dを紹介する。
新たなシーンでは、未知の物体の6Dポーズと大きさを推定するために、1枚のRGB-Dアンカー画像しか必要としない。
提案手法を5つの挑戦的データセットで評価する。
論文 参考訳(メタデータ) (2025-03-24T13:46:21Z) - Sparse-view Pose Estimation and Reconstruction via Analysis by Generative Synthesis [25.898616784744377]
観察されたビューの少ないセットを考えると、その観察は完全な正確な3Dを得るのに十分な直接的な証拠を与えていないかもしれない。
a) 新規なビュー合成に基づく生成先行を光度目標と組み合わせて、推定された3Dの質を向上させる方法、(b) アウトレーヤを明示的に推論し、連続最適化に基づく戦略による離散探索を用いて補正する手法であるSparseAGSを提案する。
論文 参考訳(メタデータ) (2024-12-04T18:59:24Z) - FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects [55.77542145604758]
FoundationPoseは、6Dオブジェクトのポーズ推定と追跡のための統合基盤モデルである。
我々のアプローチは、微調整なしで、テスト時に新しいオブジェクトに即座に適用できる。
論文 参考訳(メタデータ) (2023-12-13T18:28:09Z) - FS6D: Few-Shot 6D Pose Estimation of Novel Objects [116.34922994123973]
6Dオブジェクトポーズ推定ネットワークは、多数のオブジェクトインスタンスにスケールする能力に制限がある。
本研究では,未知の物体の6次元ポーズを,余分な訓練を伴わずにいくつかの支援ビューで推定する。
論文 参考訳(メタデータ) (2022-03-28T10:31:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。