論文の概要: Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning
- arxiv url: http://arxiv.org/abs/2607.00514v1
- Date: Wed, 01 Jul 2026 06:49:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.76667
- Title: Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning
- Title(参考訳): Cross4D-JEPA: 4Dポイントクラウド表現学習のための高密度クロスモーダル対応蒸留
- Abstract要約: Cross4D-JEPA(クロス4D-JEPA)は、凍結した2D基礎モデル、イメージモデルDINOv2、ビデオモデルV-JEPA2を4Dポイントエンコーダに蒸留する方法である。
提案手法は,各3次元点を投影する教師パッチ特徴にマッピングする高密度なクロスモーダル対応と,マスクや陰性,デコーダを使わずに,これらの特徴を潜時空間でマッチングするように学生に訓練するポイントごとの目的とを組み合わせたものである。
- 参考スコア(独自算出の注目度): 4.898317787931965
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatic understanding of dynamic 4D point clouds, the 3D-point sequences captured over time by depth sensors and LiDAR, is central to robotics and embodied perception. Yet annotating them densely is expensive, making self-supervised pretraining the natural route to transferable representations. Existing pretext tasks, however, are almost entirely intra-modal, and the few methods that transfer knowledge from 2D foundation models rely on a single global embedding per clip, discarding the rich per-patch semantics that these models compute. To address this gap, we propose Cross4D-JEPA, a teacher-student method that distills a frozen 2D foundation model, an image model DINOv2, or a video model V-JEPA 2, into a 4D point encoder. The proposed method combines (1) a dense cross-modal correspondence that maps every 3D point to the teacher patch feature it projects to, and (2) a per-point objective that trains the student to match these features in latent space with no masking, negatives, or decoder. We evaluate Cross4D-JEPA on four benchmarks, MSR-Action3D, DeformingThings4D, NTU-RGB+D 60, and HOI4D, against intra-modal and global cross-modal baselines. Experimental results show that, under a matched protocol, the proposed method consistently outperforms intra-modal and global cross-modal baselines across the four benchmarks and is competitive with heavier published 4D methods; further analysis attributes this gain primarily to the granularity of the correspondence rather than the teacher modality. Beyond recognition accuracy, the dense representation learned by Cross4D-JEPA transfers across domains, improves label efficiency, and improves full-label fine-tuning under the same training budget, while a 13x smaller encoder matches a heavyweight pooling backbone.
- Abstract(参考訳): ダイナミックな4Dポイント雲(深度センサーとLiDARによって時間とともにキャプチャされた3Dポイントシーケンス)の自動理解は、ロボット工学と知覚の具体化の中心である。
しかし、それらに高密度に注釈を付けることは高価であり、移動可能な表現への自然経路を自己指導的に事前訓練する。
しかし、既存のプリテキストタスクは、ほとんど完全にモーダルであり、2Dファンデーションモデルから知識を伝達する数少ない方法は、クリップごとの単一のグローバルな埋め込みに依存しており、これらのモデルが計算するリッチなパッチごとのセマンティクスを捨てている。
そこで我々は,凍結した2D基礎モデル,イメージモデルDINOv2,ビデオモデルV-JEPA2を4Dポイントエンコーダに蒸留するCross4D-JEPAを提案する。
提案手法は,(1)各3次元点を投影する教師パッチ特徴にマッピングする高密度なクロスモーダル対応,(2)マスクや陰性,デコーダを伴わない潜在空間において,学生にこれらの特徴にマッチするように訓練する点ごとの目的とを組み合わせたものである。
MSR-Action3D, DeformingThings4D, NTU-RGB+D 60, HOI4Dの4つのベンチマークでCross4D-JEPAを評価する。
実験結果から, 提案手法は, 一致したプロトコルの下で, 4つのベンチマークにおいて, モーダル内およびグローバルなクロスモーダルベースラインを一貫して上回り, より重い4D手法と競合することが明らかとなった。
認識精度以外にも、Cross4D-JEPAによって学習された密度の高い表現はドメイン間で転送され、ラベルの効率が向上し、トレーニング予算でフルラベルの微調整が改善される一方、13倍小さいエンコーダは重厚なプールバックボーンにマッチする。
関連論文リスト
- Align then Adapt: Rethinking Parameter-Efficient Transfer Learning in 4D Perception [44.7850628565891]
動きとシーンのインタラクションを正確にエンコードするので、ポイントクラウドビデオの理解はロボティクスにとって重要である。
そこで我々は,パラメータ効率の変換学習を2段階に分割する新しい"Align then Adapt"(PointATA)パラダイムを開発した。
PointATAは、強力なフルチューニングモデルにマッチし、さらに性能も向上できることを示す。
論文 参考訳(メタデータ) (2026-02-26T14:58:59Z) - Decoupling Bidirectional Geometric Representations of 4D cost volume with 2D convolution [40.103929972279126]
本報告では,DBStereoの4次元コストアグリゲーションネットワークについて述べる。
純粋な2D畳み込みに基づいており、同時にリアルタイムのパフォーマンスと印象的な精度を達成する。
論文 参考訳(メタデータ) (2025-09-02T15:21:49Z) - TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP [52.79100775328595]
3Dビジュアルグラウンドティングは、人間の指示に基づいて現実世界の3D環境における視覚情報を理解するための具体的エージェントである。
既存の3Dビジュアルグラウンド法は、異なるモダリティの異なるエンコーダに依存している。
本稿では,3つのモードすべてを処理するために,統合された2次元事前学習型マルチモーダルネットワークを提案する。
論文 参考訳(メタデータ) (2025-07-20T10:28:06Z) - Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos [70.07088203106443]
既存の手法は運動を学ぶための明示的な知識に依存しており、結果として準最適表現をもたらす。
Masked Autoentangler (MAE)フレームワークは、4Dデータにおける低レベルの幾何学と高レベルのダイナミックスの間のギャップを埋めるのに苦労している。
本稿では,表現的,識別的,移動可能な4次元表現を学習するための,新しい自己異方性MAEを提案する。
論文 参考訳(メタデータ) (2025-04-07T08:47:36Z) - Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene [122.42861221739123]
本稿では,リッチな2次元視覚シーンアノテーションを活用して4次元シーン学習を促進する4D-PSG生成のための新しいフレームワークについて検討する。
本研究では,2次元SGアノテーションから4次元シーンへ空間的時間的特徴を効果的に伝達する2次元から4次元の視覚的シーン伝達学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-19T09:16:08Z) - GEAL: Generalizable 3D Affordance Learning with Cross-Modal Consistency [50.11520458252128]
既存の3Dアベイランス学習手法は、注釈付きデータに制限があるため、一般化と堅牢性に苦慮している。
本稿では,大規模事前学習型2Dモデルを活用することで,3次元アベイランス学習の一般化と堅牢性を高めるための新しいフレームワークであるGEALを提案する。
GEALは、既存のメソッドと、新しいオブジェクトカテゴリ、および破損したデータにおいて、一貫して優れています。
論文 参考訳(メタデータ) (2024-12-12T17:59:03Z) - Joint Beam Search Integrating CTC, Attention, and Transducer Decoders [53.297697898510194]
4つのデコーダが同一のエンコーダを共有するような共同モデリング手法を提案する。
4Dモデルは共同で訓練され、モデルの正規化とモデルの堅牢性を最大化する。
さらに,3つのデコーダを組み合わせることで,新しい3つのビーム探索アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-06-05T05:18:20Z) - PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models [20.379104447051155]
我々は、市販の視覚基盤モデルを利用して、3Dシーン認識タスクに対処する学習自由パラダイムであるPointSegを提案する。
PointSegは正確な3Dプロンプトを取得してフレーム間で対応するピクセルを調整することで、任意の3Dシーンを分割することができる。
ScanNet、ScanNet++、KITTI-360データセット上の14.1$%、12.3$%、12.6$%のmAPは、最先端のトレーニングフリーモデルを大きく上回っている。
論文 参考訳(メタデータ) (2024-03-11T03:28:20Z) - Unleash the Potential of Image Branch for Cross-modal 3D Object
Detection [67.94357336206136]
画像分岐のポテンシャルを2つの側面から解き放つことを目的として,新しい3Dオブジェクト検出器UPIDetを提案する。
まず、UPIDetは正規化された局所座標写像推定と呼ばれる新しい2次元補助タスクを導入する。
第2に,イメージブランチのトレーニング目標から逆転する勾配によって,ポイントクラウドバックボーンの表現能力を向上できることを見出した。
論文 参考訳(メタデータ) (2023-01-22T08:26:58Z) - Learning Parallel Dense Correspondence from Spatio-Temporal Descriptors
for Efficient and Robust 4D Reconstruction [43.60322886598972]
本稿では,点雲列からの4次元形状再構成の課題に焦点をあてる。
本稿では,クロスフレーム占有領域間の連続的変換関数を捉えることにより,人間の3次元形状の時間変化を学ぶための新しいパイプラインを提案する。
論文 参考訳(メタデータ) (2021-03-30T13:36:03Z) - Learning 2D-3D Correspondences To Solve The Blind Perspective-n-Point
Problem [98.92148855291363]
本稿では、6-DoFの絶対カメラポーズ2D--3D対応を同時に解決するディープCNNモデルを提案する。
実データとシミュレーションデータの両方でテストした結果,本手法は既存手法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2020-03-15T04:17:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。