論文の概要: Lifting Unlabeled Internet-level Data for 3D Scene Understanding
- arxiv url: http://arxiv.org/abs/2604.01907v1
- Date: Thu, 02 Apr 2026 11:26:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-03 14:21:10.704644
- Title: Lifting Unlabeled Internet-level Data for 3D Scene Understanding
- Title(参考訳): 3次元シーン理解のためのラベルなしインターネットレベルデータのリフティング
- Authors: Yixin Chen, Yaowei Zhang, Huangyue Yu, Junchao He, Yan Wang, Jiangyong Huang, Hongyu Shen, Junfeng Ni, Shaofei Wang, Baoxiong Jia, Song-Chun Zhu, Siyuan Huang,
- Abstract要約: 念入りに設計されたデータエンジンは、Webでキュレーションされた未ラベルのビデオを利用して、トレーニングデータを自動的に生成できることを実証する。
自動データ生成におけるボトルネックを特定し解析し、ラベルのないデータから学習の効率と有効性を決定する重要な要因を明らかにする。
- 参考スコア(独自算出の注目度): 56.35787129098819
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Annotated 3D scene data is scarce and expensive to acquire, while abundant unlabeled videos are readily available on the internet. In this paper, we demonstrate that carefully designed data engines can leverage web-curated, unlabeled videos to automatically generate training data, to facilitate end-to-end models in 3D scene understanding alongside human-annotated datasets. We identify and analyze bottlenecks in automated data generation, revealing critical factors that determine the efficiency and effectiveness of learning from unlabeled data. To validate our approach across different perception granularities, we evaluate on three tasks spanning low-level perception, i.e., 3D object detection and instance segmentation, to high-evel reasoning, i.e., 3D spatial Visual Question Answering (VQA) and Vision-Lanugage Navigation (VLN). Models trained on our generated data demonstrate strong zero-shot performance and show further improvement after finetuning. This demonstrates the viability of leveraging readily available web data as a path toward more capable scene understanding systems.
- Abstract(参考訳): 注釈付き3Dシーンデータは入手が困難で費用がかかる。
本稿では,Webで作成した未ラベルビデオを利用してトレーニングデータを自動的に生成し,人間の注釈付きデータセットと並行して3Dシーン理解におけるエンドツーエンドモデルを容易にすることを,慎重に設計したデータエンジンで実証する。
自動データ生成におけるボトルネックを特定し解析し、ラベルのないデータから学習の効率と有効性を決定する重要な要因を明らかにする。
異なる知覚の粒度にまたがるアプローチを検証するため、3次元物体検出とインスタンスセグメンテーションの3つのタスクから、高次推論、すなわち3次元空間的視覚質問応答(VQA)とビジョン・ラニガジ・ナビゲーション(VLN)の3つのタスクを評価する。
生成されたデータに基づいてトレーニングされたモデルは、ゼロショット性能が強く、微調整後のさらなる改善を示す。
このことは、より有能なシーン理解システムへの道筋として、手軽に利用可能なWebデータを活用することの可能性を実証している。
関連論文リスト
- Few-Shot Learning in Video and 3D Object Detection: A Survey [1.8507330561392012]
少ないショット学習により、オブジェクト検出モデルでは、いくつかの例でのみ与えられた新しいクラスを認識できる。
少ない3D検出により、コストのかかる3Dアノテーションの必要性を最小限に抑えることで、実用的な自動運転の展開が可能になる。
論文 参考訳(メタデータ) (2025-07-22T23:37:20Z) - Open-Vocabulary High-Resolution 3D (OVHR3D) Data Segmentation and Annotation Framework [1.1280113914145702]
本研究の目的は,3次元セグメンテーションタスクのための包括的で効率的なフレームワークの設計と開発である。
このフレームワークはGrounding DINOとSegment Any Modelを統合し、3Dメッシュによる2D画像レンダリングの強化によって強化される。
論文 参考訳(メタデータ) (2024-12-09T07:39:39Z) - Articulate3D: Holistic Understanding of 3D Scenes as Universal Scene Description [56.69740649781989]
3Dシーン理解は、コンピュータビジョンにおける長年の課題であり、混合現実、ウェアラブルコンピューティング、そして具体化されたAIを実現する上で重要な要素である。
室内280のシーンに高品質な手動アノテーションを付加した専門的な3DデータセットであるArticulate3Dを紹介する。
我々はまた,部分分割を同時に予測できる新しい統一フレームワークUSDNetと,オブジェクトの動作属性の完全な仕様を提示する。
論文 参考訳(メタデータ) (2024-12-02T11:33:55Z) - Enhancing Generalizability of Representation Learning for Data-Efficient 3D Scene Understanding [50.448520056844885]
本研究では,実世界のパターンを持つ多様な合成シーンを生成可能なベイズネットワークを提案する。
一連の実験は、既存の最先端の事前学習手法に比べて、我々の手法が一貫した優位性を示す。
論文 参考訳(メタデータ) (2024-06-17T07:43:53Z) - AutoDecoding Latent 3D Diffusion Models [95.7279510847827]
本稿では,3次元オートデコーダをコアとした静的・明瞭な3次元アセットの生成に対して,新しいアプローチを提案する。
3D Autodecoderフレームワークは、ターゲットデータセットから学んだプロパティを潜時空間に埋め込む。
次に、適切な中間体積潜在空間を特定し、ロバストな正規化と非正規化演算を導入する。
論文 参考訳(メタデータ) (2023-07-07T17:59:14Z) - 3D Object Detection with a Self-supervised Lidar Scene Flow Backbone [10.341296683155973]
本稿では,下流3次元視覚タスクのための汎用クラウドバックボーンモデルを学習するために,自己指導型トレーニング戦略を提案する。
我々の主な貢献は、学習の流れと動きの表現を活用し、自己教師付きバックボーンと3D検出ヘッドを組み合わせることである。
KITTIとnuScenesベンチマークの実験により、提案した自己教師付き事前学習は3次元検出性能を著しく向上させることが示された。
論文 参考訳(メタデータ) (2022-05-02T07:53:29Z) - Learnable Online Graph Representations for 3D Multi-Object Tracking [156.58876381318402]
3D MOT問題に対する統一型学習型アプローチを提案します。
我々は、完全にトレーニング可能なデータアソシエーションにNeural Message Passing Networkを使用します。
AMOTAの65.6%の最先端性能と58%のIDスウィッチを達成して、公開可能なnuScenesデータセットに対する提案手法のメリットを示す。
論文 参考訳(メタデータ) (2021-04-23T17:59:28Z) - Uncertainty-aware Self-supervised 3D Data Association [20.853544785595343]
本稿では3次元オブジェクトトラッカーの自己教師付きメトリック学習による膨大なラベルなしデータセットの活用を提案する。
これらの自己教師付きアノテーションが、ポイントクラウドの埋め込みを学習するために、原則的にどのように使用できるかを示す。
我々は、フレーム間でオブジェクトを区別するために埋め込みを設計し、不確実性を認識した自己教師型トレーニングを用いてそれらを学ぶ。
論文 参考訳(メタデータ) (2020-08-18T22:34:07Z) - PointContrast: Unsupervised Pre-training for 3D Point Cloud
Understanding [107.02479689909164]
本研究では,3次元表現学習の研究を支援することを目的とする。
教師なし事前学習が3Dシーンの大規模なソースセットに与える影響を計測する。
論文 参考訳(メタデータ) (2020-07-21T17:59:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。