論文の概要: DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation
- arxiv url: http://arxiv.org/abs/2607.17754v1
- Date: Mon, 20 Jul 2026 09:47:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.577666
- Title: DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation
- Title(参考訳): DAフュージョン:未確認オブジェクトインスタンスセグメンテーションのための変形性アテンションベースRGB-Dフュージョントランス
- Authors: Yesol Park, Hye-Jung Yoon, Juno Kim, Byoung-Tak Zhang,
- Abstract要約: ロジスティクスの自動化において、未確認物体の正確なセグメンテーションは、散らばった環境における効率的なロボット操作に不可欠である。
従来のRGBベースの手法では、テクスチャに依存しているため、オブジェクトを過剰に分離する傾向があり、一方、深さベースの手法は、主に幾何学的特徴に焦点をあてることによって、しばしば下位分離を行う。
本稿では, DA-Fusionを提案する。DA-Fusionは, 未確認オブジェクトのインスタンスセグメンテーション用に設計された, 変形可能な注目型RGB-D融合変換器である。
- 参考スコア(独自算出の注目度): 24.37584731810519
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In logistics automation, precise segmentation of unseen objects is crucial for efficient robotic manipulation in cluttered environments. Tasks such as bin-picking and shelf-picking require robust perception to handle occlusions, varying object shapes, and complex spatial arrangements. Traditional RGB-based methods tend to over-segment objects due to their reliance on texture, while depth-based methods often under-segment by focusing primarily on geometric features. To address these limitations, we propose DA-Fusion, a deformable attention-based RGB-D fusion Transformer designed for unseen object instance segmentation. DA-Fusion effectively combines the strengths of both RGB and depth data, enhancing segmentation accuracy in cluttered and multi-layered object environments. We also introduce the Object Clutter Bin Dataset (OCBD), a benchmark dataset specifically tailored for evaluating bin-picking scenarios in top-down views. Extensive evaluations demonstrate that DA-Fusion outperforms state-of-the-art methods across diverse environments, making it particularly suited for real-world logistics tasks.
- Abstract(参考訳): ロジスティクスの自動化において、未確認物体の正確なセグメンテーションは、散らばった環境における効率的なロボット操作に不可欠である。
ビンピッキングやシェルフピッキングのようなタスクは、オクルージョン、さまざまな物体形状、複雑な空間配置を扱うために頑健な知覚を必要とする。
従来のRGBベースの手法では、テクスチャに依存しているため、オブジェクトを過剰に分離する傾向があり、一方、深さベースの手法は、主に幾何学的特徴に焦点をあてることによって、しばしば下位分離を行う。
これらの制約に対処するために, DA-Fusion という, 変形可能な注目型 RGB-D 融合変換器を提案する。
DA-Fusionは、RGBと深度データの両方の強度を効果的に組み合わせ、散在および多層オブジェクト環境におけるセグメンテーション精度を高める。
また、トップダウンビューでビンピッキングシナリオを評価するためのベンチマークデータセットであるObject Clutter Bin Dataset (OCBD)も導入しています。
大規模評価では、DA-Fusionは様々な環境における最先端の手法よりも優れており、現実世界の物流業務に特に適している。
関連論文リスト
- FusionVision: A comprehensive approach of 3D object reconstruction and segmentation from RGB-D cameras using YOLO and fast segment anything [1.5728609542259502]
本稿では,RGB-D画像におけるオブジェクトの堅牢な3次元セグメンテーションに適応した,徹底的なパイプラインであるFusionVisionを紹介する。
提案したFusionVisionパイプラインでは、RGBイメージ領域内のオブジェクトの識別にYOLOを使用している。
これらのコンポーネント間の相乗効果と3次元シーン理解への統合により、オブジェクトの検出とセグメンテーションの密接な融合が保証される。
論文 参考訳(メタデータ) (2024-02-29T22:59:27Z) - Segment Any Events via Weighted Adaptation of Pivotal Tokens [85.39087004253163]
本稿では,Segment Anything Models (SAM) をイベントデータと統合する上で,難易度の高い課題に焦点を当てる。
本稿では,RGB画像とイベントデータからのトークン埋め込みのアライメントを最適化するマルチスケールな特徴蒸留手法を提案する。
論文 参考訳(メタデータ) (2023-12-24T12:47:08Z) - SupeRGB-D: Zero-shot Instance Segmentation in Cluttered Indoor
Environments [67.34330257205525]
本研究では,RGB-Dデータからゼロショットのインスタンスセグメンテーション(ZSIS)を探索し,意味的カテゴリに依存しない方法で未知のオブジェクトを識別する。
本稿では,注釈付きオブジェクトを用いて画素のオブジェクト性」を学習し,乱雑な屋内環境における未知のオブジェクトカテゴリに一般化する手法を提案する。
論文 参考訳(メタデータ) (2022-12-22T17:59:48Z) - Unseen Object Instance Segmentation with Fully Test-time RGB-D
Embeddings Adaptation [14.258456366985444]
最近では、大規模な合成データのRGB-D機能を活用し、実世界のシナリオにモデルを適用するのが一般的である。
本稿では,Sim2Realドメイン間の適応プロセスを再強調する。
本稿では,BatchNorm層のパラメータに基づいて,完全テスト時間RGB-D埋め込み適応(FTEA)を行うフレームワークを提案する。
論文 参考訳(メタデータ) (2022-04-21T02:35:20Z) - Self-Supervised Representation Learning for RGB-D Salient Object
Detection [93.17479956795862]
我々は、自己教師付き表現学習を用いて、クロスモーダルオートエンコーダと深さ-輪郭推定という2つのプレテキストタスクを設計する。
我々のプレテキストタスクは、ネットワークがリッチなセマンティックコンテキストをキャプチャする事前トレーニングを実行するのに、少数のRGB-Dデータセットしか必要としない。
RGB-D SODにおけるクロスモーダル核融合の固有の問題として,マルチパス核融合モジュールを提案する。
論文 参考訳(メタデータ) (2021-01-29T09:16:06Z) - Learning RGB-D Feature Embeddings for Unseen Object Instance
Segmentation [67.88276573341734]
合成データからRGB-D特徴埋め込みを学習し,オブジェクトのインスタンスセグメンテーションを未確認する手法を提案する。
距離学習損失関数を用いて画素単位の機能埋め込みを学習する。
新たな2段階クラスタリングアルゴリズムにより,セグメンテーションの精度をさらに向上する。
論文 参考訳(メタデータ) (2020-07-30T00:23:07Z) - Unseen Object Instance Segmentation for Robotic Environments [67.88276573341734]
本稿では,テーブルトップ環境において未確認のオブジェクトインスタンスをセグメント化する手法を提案する。
UOIS-Netは2つのステージで構成されている: まず、オブジェクトのインスタンス中心の投票を2Dまたは3Dで生成するために、深さでのみ動作する。
驚くべきことに、我々のフレームワークは、RGBが非フォトリアリスティックな合成RGB-Dデータから学習することができる。
論文 参考訳(メタデータ) (2020-07-16T01:59:13Z) - A Multi-Level Approach to Waste Object Segmentation [10.20384144853726]
カラー画像とオプションの深度画像から廃棄物を局所化する問題に対処する。
本手法は,複数の空間的粒度レベルでの強度と深度情報を統合する。
我々は, この領域における今後の研究を促進するために, 新たなRGBD廃棄物分節MJU-Wasteを作成している。
論文 参考訳(メタデータ) (2020-07-08T16:49:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。