論文の概要: TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects
- arxiv url: http://arxiv.org/abs/2607.21071v1
- Date: Thu, 23 Jul 2026 09:04:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.340794
- Title: TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects
- Title(参考訳): TransBiolab: 透明なバイオメディカルオブジェクトのリアルタイムマルチビューデータセット
- Abstract要約: TrainsBiolabは、キャリブレーションされたマルチビューシーケンスとしてキャプチャされた透明なバイオメディカルオブジェクトのリアルなRGB-Dデータセットである。
データセットは、オブジェクトカテゴリ、フレーム内のオブジェクトの総数、カメラ視点という、運用上の困難を反映した3つの軸に沿って編成される。
TrainsBiolabは、繰り返し透明なインスタンス、クラッタ、マルチビューのラボラトリーキャプチャに焦点を当て、セグメンテーション、深さ推定、6Dポーズ推定、マルチビュー推論のためのリソースを提供する。
- 参考スコア(独自算出の注目度): 18.329429850231442
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Autonomous biomedical laboratories increasingly rely on visual perception to recognize, localize, and manipulate transparent plasticware, yet high-quality real-world datasets for this setting remain limited. The scarcity of domain-relevant data is particularly restrictive in cluttered multi-object scenes, where mutual occlusion and view-dependent appearance changes remain challenging even for contemporary visual foundation models. Existing transparent-object datasets have advanced segmentation, depth, and pose estimation, but they usually do not evaluate the combined setting of multi-object clutter, occlusion, and calibrated multi-view capture that characterizes real laboratory manipulation scenes. To address this gap, we present TrainsBiolab, a real-world RGB-D dataset of cluttered transparent biomedical objects captured as calibrated multi-view sequences. TrainsBiolab contains 161,315 frames from 98 scenes and 1.03M instance annotations over 15 laboratory object types, including 6D poses, full and visible masks, depth, and per-frame camera calibration. The dataset is organized along three axes that reflect operational difficulty: object category, the total number of objects in a frame, and camera viewpoint. We further define dataset-centric benchmarks for segmentation, depth estimation and completion, and 6D pose estimation, and report a system-level robot manipulation evaluation enabled by the released annotations and calibrations. By focusing on repeated transparent instances, clutter, and multi-view laboratory capture, TrainsBiolab provides a resource for segmentation, depth estimation, 6D pose estimation, and multi-view reasoning in autonomous laboratory manipulation. Project page: https://dualtransparency.github.io/TransBiolab/.
- Abstract(参考訳): 自律的なバイオメディカル研究所は、透明なプラスチック製品の認識、ローカライズ、操作に視覚的認識に依存している。
ドメイン関連データの不足は、現代視覚基盤モデルにおいても、相互閉塞やビュー依存の外観の変化が困難な、散在する多目的シーンにおいて特に制限的である。
既存の透明物体のデータセットは、高度なセグメンテーション、深さ、ポーズ推定を持っているが、それらは通常、実際の実験室の操作シーンを特徴付けるマルチオブジェクト・クラッタ、オクルージョン、校正されたマルチビュー・キャプチャの組み合わせを評価しない。
このギャップに対処するため、我々はTrainsBiolabを紹介した。TrainsBiolabは、キャリブレーションされたマルチビューシーケンスとしてキャプチャされた透明なバイオメディカルオブジェクトの、現実世界のRGB-Dデータセットである。
TrainsBiolabには、98シーンの161,315フレームと、6Dポーズ、フル・可視マスク、奥行き、フレームごとのカメラキャリブレーションを含む15種類の実験用オブジェクトに対する1.03Mインスタンスアノテーションが含まれている。
データセットは、オブジェクトカテゴリ、フレーム内のオブジェクトの総数、カメラ視点という、運用上の困難を反映した3つの軸に沿って編成される。
さらに、セグメンテーション、深さ推定、完了、6次元ポーズ推定のためのデータセット中心のベンチマークを定義し、リリースしたアノテーションと校正によって実現されたシステムレベルのロボット操作評価を報告する。
TrainsBiolabは、繰り返し透明なインスタンス、クラッタ、複数ビューのラボラトリーキャプチャに焦点を当てることで、自律的なラボラトリー操作におけるセグメンテーション、深さ推定、6Dポーズ推定、マルチビュー推論のためのリソースを提供する。
プロジェクトページ:https://dualtransparency.github.io/TransBiolab/。
関連論文リスト
- An Evaluation Framework for Generating Multi-View Images of a Person in a Scene [8.826327162415287]
無料のカメラアングル変更を実行するための基礎モデルのトレーニングにおける主要なボトルネックは、特別なトレーニングデータがないことである。
本研究では,人物の周囲のカメラの動きを定量的に評価するために,頭部回転差(HSRD)尺度を提案する。
HSRDは、シーン内の人物の3次元空間視差を評価するために必要なパイプラインを提供し、高品質なマルチビュー合成データセットを確実に構築する方法を提供する。
論文 参考訳(メタデータ) (2026-09-04T01:02:12Z) - GraspClutter6D: A Large-scale Real-world Dataset for Robust Perception and Grasping in Cluttered Scenes [5.289647064481469]
GraspClutter6Dは、1,000の散らばったシーンと密集したアレンジメントを特徴とする、大規模な現実世界の把握データセットである。
我々は,最先端のセグメンテーション,オブジェクトポーズ推定,把握検出手法のベンチマークを行い,乱雑な環境における課題に対する重要な洞察を提供する。
トレーニングリソースとしてのデータセットの有効性を検証し、GraspClutter6Dでトレーニングされたネットワークの把握が、シミュレーションと実世界の実験の両方において、既存のデータセットでトレーニングされたネットワークよりも大幅に優れていることを示した。
論文 参考訳(メタデータ) (2025-04-09T13:15:46Z) - Counting Stacked Objects [57.68870743111393]
本稿では,タスクを2つの相補的なサブプロブレムに分解する新しい3Dカウント手法を提案する。
幾何学的再構成と深層学習に基づく深度解析を組み合わせることで,コンテナ内の同一物体を正確にカウントすることができる。
多様な実世界および大規模合成データセット上での3Dカウントパイプラインの検証を行う。
論文 参考訳(メタデータ) (2024-11-28T13:51:16Z) - Multi-Modal Dataset Acquisition for Photometrically Challenging Object [56.30027922063559]
本稿では,3次元視覚タスクにおける現在のデータセットの限界について,精度,サイズ,リアリズム,および光度に挑戦する対象に対する適切な画像モダリティの観点から検討する。
既存の3次元認識と6次元オブジェクトポーズデータセットを強化する新しいアノテーションと取得パイプラインを提案する。
論文 参考訳(メタデータ) (2023-08-21T10:38:32Z) - 6-DoF Pose Estimation of Household Objects for Robotic Manipulation: An
Accessible Dataset and Benchmark [17.493403705281008]
本稿では,ロボット操作研究を中心に,既知の物体の6-DoFポーズ推定のための新しいデータセットを提案する。
我々は、おもちゃの食料品の3Dスキャンされたテクスチャモデルと、難解で散らかったシーンにおけるオブジェクトのRGBD画像を提供する。
半自動RGBD-to-modelテクスチャ対応を用いて、画像は数ミリ以内の精度で実証された地上の真実のポーズで注釈付けされる。
また,ADD-Hと呼ばれる新しいポーズ評価尺度を提案し,対象形状の対称性に頑健なハンガリー代入アルゴリズムについて,その明示的な列挙を必要とせず提案する。
論文 参考訳(メタデータ) (2022-03-11T01:19:04Z) - ClearPose: Large-scale Transparent Object Dataset and Benchmark [7.342978076186365]
我々はClearPoseという名前の大規模現実世界のRGB-Depth透明オブジェクトデータセットをコントリビュートし、セグメンテーション、シーンレベルの深さ補完、オブジェクト中心のポーズ推定タスクのベンチマークデータセットとして機能する。
ClearPoseデータセットには、実世界のRGB-Depthフレームに350万以上のラベルが付けられ、63の家庭用オブジェクトをカバーする4Mインスタンスアノテーションが含まれている。
論文 参考訳(メタデータ) (2022-03-08T07:29:31Z) - Salient Objects in Clutter [130.63976772770368]
本稿では,既存の正当性オブジェクト検出(SOD)データセットの重大な設計バイアスを特定し,対処する。
この設計バイアスは、既存のデータセットで評価した場合、最先端のSODモデルのパフォーマンスの飽和につながった。
我々は,新しい高品質データセットを提案し,前回のsaliencyベンチマークを更新する。
論文 参考訳(メタデータ) (2021-05-07T03:49:26Z) - Self-supervised Human Detection and Segmentation via Multi-view
Consensus [116.92405645348185]
本稿では,トレーニング中に幾何学的制約を多視点一貫性という形で組み込むマルチカメラフレームワークを提案する。
本手法は,標準ベンチマークから視覚的に外れた画像に対して,最先端の自己監視的人物検出とセグメンテーション技術に勝ることを示す。
論文 参考訳(メタデータ) (2020-12-09T15:47:21Z) - SIDOD: A Synthetic Image Dataset for 3D Object Pose Recognition with
Distractors [10.546457120988494]
このデータセットには144kのステレオ画像ペアが含まれており、最大10個のオブジェクトと3つのフォトリアリスティック仮想環境の18のカメラ視点を合成的に組み合わせている。
ドメインのランダム化に対する我々のアプローチを説明し、データセットを作成した決定について考察する。
論文 参考訳(メタデータ) (2020-08-12T00:14:19Z) - Single View Metrology in the Wild [94.7005246862618]
本研究では,物体の3次元の高さや地上のカメラの高さで表現されるシーンの絶対的なスケールを再現する,単一ビューメロジに対する新しいアプローチを提案する。
本手法は,被写体の高さなどの3Dエンティティによる未知のカメラとの相互作用から,弱い教師付き制約を抑えるために設計されたディープネットワークによって学習されたデータ駆動の先行情報に依存する。
いくつかのデータセットと仮想オブジェクト挿入を含むアプリケーションに対して、最先端の定性的かつ定量的な結果を示す。
論文 参考訳(メタデータ) (2020-07-18T22:31:33Z) - Segmenting Transparent Objects in the Wild [98.80906604285163]
本研究は,手作業による注釈付き実シナリオの画像10,428枚からなるトランス10Kという,透明なオブジェクトセグメンテーションのための大規模データセットを提案する。
Trans10Kの有効性を評価するために,TransLabと呼ばれる新しい境界認識セグメンテーション手法を提案する。
論文 参考訳(メタデータ) (2020-03-31T04:44:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。