Fugu-MT 論文翻訳(概要): Towards Subcentimeter Accuracy Digital-Twin Tracking via An RGBD-based Transformer Model and A Comprehensive Mobile Dataset

論文の概要: Towards Subcentimeter Accuracy Digital-Twin Tracking via An RGBD-based Transformer Model and A Comprehensive Mobile Dataset

arxiv url: http://arxiv.org/abs/2309.13570v1
Date: Sun, 24 Sep 2023 07:06:45 GMT
ステータス: 翻訳完了
システム内更新日: 2023-09-26 18:50:52.179711
Title: Towards Subcentimeter Accuracy Digital-Twin Tracking via An RGBD-based Transformer Model and A Comprehensive Mobile Dataset
Title（参考訳）: RGBDを用いた変圧器モデルと包括的移動データを用いたサブセント精度デジタルツイントラッキング
Authors: Zixun Huang, Keling Yao, Seth Z. Zhao, Chuanyu Pan, Tianjian Xu, Weiyu Feng, Allen Y. Yang
Abstract要約: 雑音深度データによる課題に対処するために,変圧器を用いた6DoFポーズ推定器を提案する。我々は,最先端のモバイルセンサであるiPhone 14 Proを用いて,新しいRGBDデータセットを導入した。
参考スコア（独自算出の注目度）: 2.190269031876989
License: http://creativecommons.org/licenses/by-sa/4.0/
Abstract: The potential of digital twin technology, involving the creation of precise digital replicas of physical objects, to reshape AR experiences in 3D object tracking and localization scenarios is significant. However, enabling 3D object tracking with subcentimeter accuracy in dynamic mobile AR environments remains a formidable challenge. These scenarios often require a more robust pose estimator capable of handling the inherent sensor-level measurement noise. In this paper, recognizing the absence of comprehensive solutions in existing literature, we build upon our previous work, the Digital Twin Tracking Dataset (DTTD), to address these challenges in mobile AR settings. Specifically, we propose a transformer-based 6DoF pose estimator designed to withstand the challenges posed by noisy depth data. Simultaneously, we introduce a novel RGBD dataset captured using a cutting-edge mobile sensor, the iPhone 14 Pro, expanding the applicability of our approach to iPhone sensor data. Through extensive experimentation and in-depth analysis, we illustrate the effectiveness of our methods in the face of significant depth data errors, surpassing the performance of existing baselines. Code will be made publicly available.
Abstract（参考訳）: 3dオブジェクト追跡とローカライズシナリオでarエクスペリエンスを再構築する、物理的オブジェクトの正確なデジタルレプリカの作成を含むデジタルツイン技術の可能性は重要である。しかし、ダイナミックなモバイルAR環境での3Dオブジェクトの追跡を可能にすることは、非常に難しい課題である。これらのシナリオは、しばしば、固有のセンサーレベルの測定ノイズを扱うことができるより堅牢なポーズ推定器を必要とする。本稿では,既存の文献に包括的ソリューションがないことを認識し,モバイルAR設定におけるこれらの課題に対処するため,これまでの研究であるDigital Twin Tracking Dataset(DTTD)に基づいて構築する。具体的には,ノイズの深さデータによる課題に耐えるトランスベース6dofポーズ推定器を提案する。同時に、最先端のモバイルセンサーであるiPhone 14 Proを用いて、新しいRGBDデータセットを導入し、我々のアプローチをiPhoneセンサーデータに適用可能にする。広範囲な実験と詳細な分析を通じて,既存のベースラインの性能を上回っている奥行きデータエラーに対して,本手法の有効性を示す。コードは公開される予定だ。

関連論文リスト

Monocular One-Shot Metric-Depth Alignment for RGB-Based Robot Grasping [26.7709114619056]
単一のRGB画像から距離深度を復元する新しいフレームワークであるモノクロワンショット距離アライメント(MOMA)を提案する。 MOMAは、カメラキャリブレーション中のスケール回転シフトアライメントを実行する。テーブルトップ2指握りと吸引型ビンピッキングアプリケーションの実世界実験は、MOMAが多種多様なタスクで高い成功率を達成することを示している。
論文参考訳（メタデータ） (2025-06-20T16:11:20Z)
TacoDepth: Towards Efficient Radar-Camera Depth Estimation with One-stage Fusion [54.46664104437454]
一段核融合を用いた効率的かつ正確なレーダ・カメラ深度推定モデルであるTacoDepthを提案する。具体的には、グラフベースのRadar構造抽出器とピラミッドベースのRadar融合モジュールを設計する。従来の最先端のアプローチと比較して、TacoDepthは深さ精度と処理速度を12.8%、91.8%改善している。
論文参考訳（メタデータ） (2025-04-16T05:25:04Z)
DEPTHOR: Depth Enhancement from a Practical Light-Weight dToF Sensor and RGB Image [8.588871458005114]
本稿では,コンピュータビジョンにおける深度向上のための新しい補完方式DEPTHORを提案する。まず、合成データセットの正確な基底真理から実世界のdToFデータをシミュレートし、ノイズロバストトレーニングを可能にする。第2に,グローバルな深度関係と文脈情報を利用して,単眼深度推定(MDE)を組み込んだ新しいネットワークを設計し,課題領域の予測を改善する。
論文参考訳（メタデータ） (2025-04-02T11:02:21Z)
Bayesian Approximation-Based Trajectory Prediction and Tracking with 4D Radar [13.438311878715536]
3Dマルチオブジェクトトラッキング(MOT)は自動運転車には不可欠だが、LiDARとカメラベースの手法は悪天候下では劣化する。本研究では,4次元レーダベースMOTフレームワークであるBayes-4DRTrackを提案する。
論文参考訳（メタデータ） (2025-02-03T13:49:21Z)
Robust Depth Enhancement via Polarization Prompt Fusion Tuning [112.88371907047396]
様々な深度センサによる不正確な深度測定を改善するために偏光イメージングを利用するフレームワークを提案する。まず、偏光データとセンサ深度マップから高密度で完全な深度マップを推定するために、ニューラルネットワークを訓練した学習ベースの戦略を採用する。大規模データセット上で事前学習したRGBモデルを有効に活用するためのPPFT(Polarization Prompt Fusion Tuning)戦略を提案する。
論文参考訳（メタデータ） (2024-04-05T17:55:33Z)
RGB-based Category-level Object Pose Estimation via Decoupled Metric Scale Recovery [72.13154206106259]
本研究では、6次元のポーズとサイズ推定を分離し、不完全なスケールが剛性変換に与える影響を緩和するパイプラインを提案する。具体的には,事前学習した単分子推定器を用いて局所的な幾何学的情報を抽出する。別個のブランチは、カテゴリレベルの統計に基づいてオブジェクトのメートル法スケールを直接復元するように設計されている。
論文参考訳（メタデータ） (2023-09-19T02:20:26Z)
TransPose: A Transformer-based 6D Object Pose Estimation Network with Depth Refinement [5.482532589225552]
深度修正モジュールを用いた改良型トランスフォーマーベースの6次元ポーズ推定法であるTransPoseを提案する。アーキテクチャはRGB画像のみを入力として取り込むが、深度や熱画像などの追加の補正は行わない。次に、予測された中心、6Dポーズ、および6Dポーズの精度を向上するために、新しい深度補正モジュールが使用される。
論文参考訳（メタデータ） (2023-07-09T17:33:13Z)
Learning to Estimate 6DoF Pose from Limited Data: A Few-Shot, Generalizable Approach using RGB Images [60.0898989456276]
本稿では,数ショットの6DoFポーズ推定のためのCas6Dという新しいフレームワークを提案する。極めて少数の設定で対象物検出の偽陽性に対処するために,本フレームワークでは,自己教師付き事前学習型ViTを用いて,ロバストな特徴表現を学習する。 LINEMODとGenMOPデータセットの実験結果は、Cas6Dが32ショット設定で最先端の手法を9.2%、精度3.8%(Proj-5)で上回ることを示した。
論文参考訳（メタデータ） (2023-06-13T07:45:42Z)
Deep Metric Learning for Unsupervised Remote Sensing Change Detection [60.89777029184023]
リモートセンシング変化検出(RS-CD)は、マルチテンポラルリモートセンシング画像(MT-RSI)から関連する変化を検出することを目的とする。既存のRS-CD法の性能は、大規模な注釈付きデータセットのトレーニングによるものである。本稿では,これらの問題に対処可能なディープメトリック学習に基づく教師なしCD手法を提案する。
論文参考訳（メタデータ） (2023-03-16T17:52:45Z)
Consistent Direct Time-of-Flight Video Depth Super-Resolution [9.173767380836852]
飛行時間(dToF)センサーは、次世代のオンデバイス3Dセンシングを約束している。低分解能dToFイメージングによる空間的曖昧性を緩和する最初の多フレーム融合方式を提案する。動的オブジェクトと現実的なdToFシミュレータを備えた,最初の合成RGB-dToFビデオデータセットであるDyDToFを紹介する。
論文参考訳（メタデータ） (2022-11-16T04:16:20Z)
Det6D: A Ground-Aware Full-Pose 3D Object Detector for Improving Terrain Robustness [1.4620086904601473]
空間的・姿勢的制約を伴わない初の完全自由度3次元物体検出器であるDet6Dを提案する。ピッチやロールを含む全方向のポーズを予測するために,地上認識方向分岐を設計する。異なる地形における本手法の有効性とロバスト性について実験を行った。
論文参考訳（メタデータ） (2022-07-19T17:12:48Z)
FS6D: Few-Shot 6D Pose Estimation of Novel Objects [116.34922994123973]
6Dオブジェクトポーズ推定ネットワークは、多数のオブジェクトインスタンスにスケールする能力に制限がある。本研究では,未知の物体の6次元ポーズを,余分な訓練を伴わずにいくつかの支援ビューで推定する。
論文参考訳（メタデータ） (2022-03-28T10:31:29Z)
M2TR: Multi-modal Multi-scale Transformers for Deepfake Detection [74.19291916812921]
Deepfake技術によって生成された鍛造画像は、デジタル情報の信頼性に深刻な脅威をもたらします。本稿では,Deepfake検出のための微妙な操作アーチファクトを異なるスケールで捉えることを目的とする。最先端の顔スワッピングと顔の再現方法によって生成された4000のDeepFakeビデオで構成される高品質のDeepFakeデータセットSR-DFを紹介します。
論文参考訳（メタデータ） (2021-04-20T05:43:44Z)
PLUME: Efficient 3D Object Detection from Stereo Images [95.31278688164646]
既存の手法では、2つのステップでこの問題に対処する: 第一深度推定を行い、その深さ推定から擬似LiDAR点雲表現を計算し、3次元空間で物体検出を行う。この2つのタスクを同一のメトリック空間で統一するモデルを提案する。提案手法は,既存の手法と比較して推定時間を大幅に削減し,挑戦的なKITTIベンチマークの最先端性能を実現する。
論文参考訳（メタデータ） (2021-01-17T05:11:38Z)
3D Point-to-Keypoint Voting Network for 6D Pose Estimation [8.801404171357916]
3次元キーポイントの空間構造特性に基づくRGB-Dデータから6次元ポーズ推定のためのフレームワークを提案する。提案手法は, LINEMOD と OCCLUSION LINEMOD の2つのベンチマークデータセットで検証する。
論文参考訳（メタデータ） (2020-12-22T11:43:15Z)
Uncertainty-Aware Deep Calibrated Salient Object Detection [74.58153220370527]
既存のディープニューラルネットワークに基づくサルエントオブジェクト検出(SOD)手法は主に高いネットワーク精度の追求に重点を置いている。これらの手法は、信頼不均衡問題として知られるネットワーク精度と予測信頼の間のギャップを見落としている。我々は,不確実性を考慮した深部SODネットワークを導入し,深部SODネットワークの過信を防止するための2つの戦略を提案する。
論文参考訳（メタデータ） (2020-12-10T23:28:36Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。