論文の概要: DARP: A Calibrated Dual-Arm RGB-D-IR Dataset for Multi-View Robotic Perception
- arxiv url: http://arxiv.org/abs/2608.31002v2
- Date: Wed, 02 Sep 2026 19:13:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.207162
- Title: DARP: A Calibrated Dual-Arm RGB-D-IR Dataset for Multi-View Robotic Perception
- Title(参考訳): DARP:多視点ロボット知覚のための校正デュアルアームRGB-D-IRデータセット
- Authors: Manish Kansana, Mohammed Yusuf Mujawar, Sudip Mittal, Shahram Rahimi, Noorbakhsh Amiri Golilarz,
- Abstract要約: 本稿では,2つの独立移動眼内マニピュレータを用いた物体中心ロボット知覚のための校正デュアルアームRGB-D-IRデータセットであるDARPを提案する。
DARPには10のユニークなテーブルトップオブジェクトが含まれており、元のセンサー記録、ロボット状態ログ、オブジェクトレベルのメタデータ、キャリブレーション情報を保存する。
DARPは、多視点再構成、協調ロボット認識、マルチモーダル融合、アクティブな知覚、そして部分的な物体観察に対する将来の学習に基づく推論のための再利用可能なリソースとして意図されている。
- 参考スコア(独自算出の注目度): 4.077787659104315
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Robotic perception from a single viewpoint is often limited by self-occlusion and incomplete surface visibility. This paper presents DARP(Dual-Arm Robotic Perception) https://doi.org/10.21227/rmv3-be47, a calibrated dual-arm RGB-D-IR dataset for object-centered robotic perception using two independently moving eye-in-hand manipulators positioned on opposite sides of a shared tabletop workspace. Each arm carries an Intel RealSense sensor that continuously records RGB, depth, and stereo infrared data while synchronized robot joint states are logged for pose recovery. Objects are placed without fixed poses or marked locations, and the acquisition procedure performs automatic localization, cross-arm confirmation, adaptive viewpoint generation, and continuous multimodal recording. DARP contains ten unique tabletop objects and preserves the original sensor recordings, robot-state logs, object-level metadata, and calibration information required to reconstruct camera trajectories in a shared metric frame. To evaluate the geometric consistency of the acquisition, we implement a deterministic multi-view fusion pipeline that converts calibrated RGB-D observations into complementary partial point clouds and measured surface meshes without using learned or generative completion methods. Evaluation on 224 held-out RGB-D keyframes comprising 1,563,466 three-dimensional query points yields a median point-to-mesh distance of 2.13~mm and an RMSE of 4.04~mm, with 96.56\% of points within 10~mm of the measured-surface mesh. DARP is intended as a reusable resource for multi-view reconstruction, collaborative robotic perception, multimodal fusion, active perception, and future learning-based reasoning over partial object observations.
- Abstract(参考訳): 単一視点からのロボットの知覚は、しばしば自己閉塞と不完全な表面視認によって制限される。
本稿では,Dual-Arm Robotic Perception (DARP) https://doi.org/10.21227/rmv3-be47を提案する。
各アームには、RGB、深さ、ステレオ赤外線データを連続的に記録するIntel RealSenseセンサーがあり、同期されたロボット関節状態は、ポーズ回復のためにログされる。
オブジェクトは、固定されたポーズやマークされた位置なしで配置され、取得手順は、自動的なローカライゼーション、クロスアーム確認、適応的な視点生成、連続的なマルチモーダル記録を実行する。
DARPは10のユニークなテーブルトップオブジェクトを含み、オリジナルのセンサー記録、ロボット状態ログ、オブジェクトレベルのメタデータ、および共有メトリックフレームでカメラ軌跡を再構築するために必要な校正情報を保存する。
取得の幾何的整合性を評価するため,RGB-Dのキャリブレーションを学習・生成完了法を使わずに,補正されたRGB-Dの観測結果を相補的な部分点雲と測定された表面メッシュに変換する決定論的多視点融合パイプラインを実装した。
1,563,466個の3次元クエリポイントからなる224個のRGB-Dキーフレームの評価は、中央値の2.13〜mmとRMSEの4.04〜mmであり、測定された表面メッシュの10〜mmの範囲内で96.56\%のポイントを持つ。
DARPは、多視点再構成、協調ロボット認識、マルチモーダル融合、アクティブな知覚、そして部分的な物体観察に対する将来の学習に基づく推論のための再利用可能なリソースとして意図されている。
関連論文リスト
- Multi-View Unified Camera Fields: Geometry-Shaped Action-Facing Representations for RGB-Only Multi-Camera VLA Policies [12.27577524307746]
Multi-View Unified Camera Fields (MVUCF) は、ビューをまたいだ共有アクション対応潜在フィールドを形成するトレーニング専用フレームワークである。
ジオメトリインジェクション、奥行き、カメラキャリブレーション、補助ヘッドが取り除かれた後、配置は、追加の推論FLOPを持たない元のRGBのみのグラフを使用する。
論文 参考訳(メタデータ) (2026-08-03T07:36:09Z) - Articulated 3D Scene Graphs for Open-World Mobile Manipulation [55.97942733699124]
本報告では, セマンティックな3次元シーングラフを構築するためのフレームワークであるMoMa-SGについて述べる。
新たな統合的ツイスト推定法を用いて調音モデルを推定する。
また,Arti4D-Semanticデータセットについても紹介する。
論文 参考訳(メタデータ) (2026-02-18T10:40:35Z) - Real-Time Human-Robot Interaction Intent Detection Using RGB-based Pose and Emotion Cues with Cross-Camera Model Generalization [0.8839687029212673]
公共空間におけるサービスロボットは、自然な相互作用のための人間の行動意図をリアルタイムに理解する必要がある。
モノクラーRGBビデオから抽出した2次元骨格ポーズと顔の感情特徴を融合したフレーム精度の人-ロボットインタラクション意図検出のためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-18T08:44:22Z) - Semantic Segmentation and Scene Reconstruction of RGB-D Image Frames: An End-to-End Modular Pipeline for Robotic Applications [0.7951977175758216]
従来のRGB-D処理パイプラインは主に幾何学的再構成に焦点を当てている。
セマンティックセグメンテーション、ヒューマントラッキング、ポイントクラウド融合、シーン再構築を統合した、新しいエンドツーエンドのモジュールパイプラインを導入する。
我々は、ベンチマークデータセットと現実世界のKinect RGB-Dデータにアプローチを検証し、効率、精度、ユーザビリティを改善した。
論文 参考訳(メタデータ) (2024-10-23T16:01:31Z) - Memorize What Matters: Emergent Scene Decomposition from Multitraverse [54.487589469432706]
3次元ガウス写像は3次元ガウス写像をベースとしたカメラのみのオフラインマッピングフレームワークである。
3DGMは、同じ領域から複数のRGBビデオをガウスベースの環境マップに変換し、同時に2D短命なオブジェクトセグメンテーションを実行する。
We build the Mapverse benchmark, sourced from the Ithaca365 and nuPlan datasets, to evaluate our method in unsupervised 2D segmentation, 3D reconstruction, and Neural rendering。
論文 参考訳(メタデータ) (2024-05-27T14:11:17Z) - RGB-Only Reconstruction of Tabletop Scenes for Collision-Free
Manipulator Control [71.51781695764872]
世界のRGBビューのみを用いたロボットマニピュレータの無衝突制御システムを提案する。
テーブルトップシーンの知覚入力は、ロボットエンドエフェクタにハンドヘルドまたは装着されたRGBカメラの複数の画像によって提供される。
シーンの3次元形状を再構成するために、NeRFのようなプロセスが使用され、そこからユークリッド完全符号距離関数(ESDF)が計算される。
次に、モデル予測制御アルゴリズムを用いてマニピュレータを制御し、ESDFの障害物を避けながら所望のポーズに達する。
論文 参考訳(メタデータ) (2022-10-21T01:45:08Z) - RGB2Hands: Real-Time Tracking of 3D Hand Interactions from Monocular RGB
Video [76.86512780916827]
本稿では,1台のRGBカメラによる骨格ポーズのモーションキャプチャと手の表面形状をリアルタイムに計測する手法を提案する。
RGBデータの本質的な深さの曖昧さに対処するために,我々は新しいマルチタスクCNNを提案する。
RGBの片手追跡と3D再構築パイプラインの個々のコンポーネントを実験的に検証した。
論文 参考訳(メタデータ) (2021-06-22T12:53:56Z) - Nothing But Geometric Constraints: A Model-Free Method for Articulated
Object Pose Estimation [89.82169646672872]
本稿では,ロボットアームの関節構成を,モデルに先入観を持たずにRGBまたはRGB-D画像のシーケンスから推定する,教師なし視覚ベースシステムを提案する。
我々は,古典幾何学的定式化と深層学習を組み合わせることで,この課題を解決するために,極性多剛体制約を拡張した。
論文 参考訳(メタデータ) (2020-11-30T20:46:48Z) - Relation3DMOT: Exploiting Deep Affinity for 3D Multi-Object Tracking
from View Aggregation [8.854112907350624]
3Dマルチオブジェクトトラッキングは、自律ナビゲーションにおいて重要な役割を果たす。
多くのアプローチでは、トラッキングのための2次元RGBシーケンス内のオブジェクトを検出するが、これは3次元空間内のオブジェクトをローカライズする際の信頼性の欠如である。
本稿では,隣接フレーム内の各オブジェクト間の相関をよりよく活用するために,RelationConvという新しい畳み込み演算を提案する。
論文 参考訳(メタデータ) (2020-11-25T16:14:40Z) - Risk-Averse MPC via Visual-Inertial Input and Recurrent Networks for
Online Collision Avoidance [95.86944752753564]
本稿では,モデル予測制御(MPC)の定式化を拡張したオンライン経路計画アーキテクチャを提案する。
我々のアルゴリズムは、状態推定の共分散を推論するリカレントニューラルネットワーク(RNN)とオブジェクト検出パイプラインを組み合わせる。
本手法のロバスト性は, 複雑な四足歩行ロボットの力学で検証され, ほとんどのロボットプラットフォームに適用可能である。
論文 参考訳(メタデータ) (2020-07-28T07:34:30Z) - MoreFusion: Multi-object Reasoning for 6D Pose Estimation from
Volumetric Fusion [19.034317851914725]
本稿では,複数の既知の物体の接触と隠蔽の正確なポーズを,リアルタイムな多視点視から推定するシステムを提案する。
提案手法は,1枚のRGB-Dビューからの3Dオブジェクトのポーズ提案を行い,カメラが移動すると,複数のビューからのポーズ推定と非パラメトリック占有情報を蓄積する。
提案手法の精度とロバスト性を2つのオブジェクトデータセット(YCB-Video)で実験的に検証する。
論文 参考訳(メタデータ) (2020-04-09T02:29:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。