論文の概要: VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification
- arxiv url: http://arxiv.org/abs/2608.02598v1
- Date: Mon, 03 Aug 2026 17:59:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.751314
- Title: VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification
- Title(参考訳): VR3D: 空中人物認識のための3D表示学習
- Authors: Chao Ji, Shiyu Xuan, Zechao Li,
- Abstract要約: 地上の人物の再識別は、クロスプラットフォームの視点の違いのために難しい課題である。
既存の手法は2次元画像空間内でのみビュー不変表現を学習しようとする。
映像を3次元座標空間にマッピングする,ビューロバストな3D表現学習フレームワークであるVR3Dを提案する。
- 参考スコア(独自算出の注目度): 35.655590576867574
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Aerial-ground person re-identification is a challenging task due to cross-platform viewpoint variations, which cause severe occlusion and geometric deformation. Existing methods attempt to learn view-invariant representations exclusively within the 2D image space, where drastic viewpoint variations cause the learned features to remain coupled with viewpoint bias. To address this, we propose VR3D, a View-Robust 3D Representation Learning framework that maps images into a unified 3D coordinate space to achieve view-independent feature interaction. Specifically, we introduce View-Robust 3D Representation Interaction, which leverages 3D priors extracted from single 2D observations to lift 2D appearance features into a canonical 3D space. VR3I employs 3D Geometry-Semantic Attention to establish interactions between 2D patches and 3D voxels from corresponding body parts based on their 3D spatial locations, effectively grounding 2D semantics within a 3D framework. In addition, as the reliability of these representations varies across samples due to viewpoint changes and 3D reconstruction errors, we introduce Reliability-Aware Fusion, which estimates sample-specific reliability and adaptively aggregates the multi-source representations. Extensive experiments on three benchmark datasets (CARGO, AG-ReID.v1, and AG-ReID.v2) demonstrate that VR3D outperforms recent methods. For example, it achieves a 5.63% improvement in Rank-1 on CARGO. Our code will be released.
- Abstract(参考訳): 空中人物再同定は, 高度閉塞, 幾何変形の原因となるクロスプラットフォームの視点変化による難易度の高い課題である。
既存の手法では、2次元画像空間内でのみビュー不変表現を学習しようとするが、その場合、劇的な視点変化は学習した特徴を視点バイアスと結合させ続ける。
これを解決するために、ビューに依存しない特徴相互作用を実現するために、画像を統一された3D座標空間にマッピングするView-Robust 3D Representation LearningフレームワークであるVR3Dを提案する。
具体的には、単一の2次元観測から抽出された3次元先行情報を活用して、標準3次元空間に2次元の外観特徴を持ち上げるビュー・ロバスト3D表現インタラクションを提案する。
VR3Iは、3Dの空間的位置に基づいて、対応する身体部分からの2Dパッチと3Dボクセル間の相互作用を確立するために、3Dの幾何学・セマンティック・アテンションを用いており、効果的に3Dフレームワーク内の2Dセマンティクスを基盤としている。
さらに,これらの表現の信頼性が視点変化や3次元再構成誤差によってサンプルによって異なるため,サンプル固有の信頼性を推定し,多元的表現を適応的に集約するReliability-Aware Fusionを導入する。
3つのベンチマークデータセット(CARGO、AG-ReID.v1、AG-ReID.v2)の大規模な実験は、VR3Dが最近の手法より優れていることを示した。
例えば、CARGOではランク1が5.63%向上している。
私たちのコードは解放されます。
関連論文リスト
- PandaPose: 3D Human Pose Lifting from a Single Image via Propagating 2D Pose Prior to 3D Anchor Space [62.10630827126755]
PandaPoseは3次元アンカー空間の前に2次元ポーズを伝播させることによって3次元のポーズリフトアプローチである。
われわれの3Dアンカー空間は、(1)標準座標系における関節回りの3Dアンカーから成り、2Dポーズ推定の不正確さを軽減するための正確で堅牢な事前情報を提供する。
論文 参考訳(メタデータ) (2026-02-01T08:20:40Z) - 3D Aware Region Prompted Vision Language Model [99.4106711584584]
SR-3Dは、共有された視覚トークン空間を介して、シングルビュー2D画像とマルチビュー3Dデータを接続する。
SR-3Dはフレキシブルな領域プロンプトをサポートしており、バウンディングボックス、任意のフレーム上のセグメンテーションマスク、あるいは直接3Dでアノテートできる。
論文 参考訳(メタデータ) (2025-09-16T17:59:06Z) - Unifying 2D and 3D Vision-Language Understanding [85.84054120018625]
2次元および3次元視覚言語学習のための統一アーキテクチャUniVLGを紹介する。
UniVLGは、既存の2D中心モデルと、エンボディシステムで利用可能なリッチな3Dセンサーデータのギャップを埋める。
論文 参考訳(メタデータ) (2025-03-13T17:56:22Z) - Multi-View Representation is What You Need for Point-Cloud Pre-Training [22.55455166875263]
本稿では,事前学習した2次元ネットワークを利用して3次元表現を学習するポイントクラウド事前学習手法を提案する。
我々は,新しい2次元知識伝達損失の助けを借りて,3次元特徴抽出ネットワークを訓練する。
実験結果から,事前学習したモデルを様々な下流タスクに転送できることが判明した。
論文 参考訳(メタデータ) (2023-06-05T03:14:54Z) - MvDeCor: Multi-view Dense Correspondence Learning for Fine-grained 3D
Segmentation [91.6658845016214]
そこで本研究では,2次元領域における自己教師型手法を,微細な3次元形状分割作業に活用することを提案する。
複数のビューから3次元形状を描画し、コントラスト学習フレームワーク内に密接な対応学習タスクを設置する。
その結果、学習された2次元表現はビュー不変であり、幾何学的に一貫性がある。
論文 参考訳(メタデータ) (2022-08-18T00:48:15Z) - Voxel-based 3D Detection and Reconstruction of Multiple Objects from a
Single Image [22.037472446683765]
入力画像から3次元特徴持ち上げ演算子を用いて3次元シーン空間に整合した3次元ボクセル特徴の正規格子を学習する。
この3Dボクセルの特徴に基づき,新しいCenterNet-3D検出ヘッドは3D空間におけるキーポイント検出として3D検出を定式化する。
我々は、粗度ボキセル化や、新しい局所PCA-SDF形状表現を含む、効率的な粗度から細度の再構成モジュールを考案する。
論文 参考訳(メタデータ) (2021-11-04T18:30:37Z) - AutoShape: Real-Time Shape-Aware Monocular 3D Object Detection [15.244852122106634]
形状認識型2D/3D制約を3D検出フレームワークに組み込む手法を提案する。
具体的には、ディープニューラルネットワークを用いて、2次元画像領域の区別された2Dキーポイントを学習する。
2D/3Dキーポイントの基礎的真理を生成するために、自動的なモデル適合手法が提案されている。
論文 参考訳(メタデータ) (2021-08-25T08:50:06Z) - 3D-to-2D Distillation for Indoor Scene Parsing [78.36781565047656]
大規模3次元データリポジトリから抽出した3次元特徴を有効活用し,RGB画像から抽出した2次元特徴を向上する手法を提案する。
まず,事前学習した3Dネットワークから3D知識を抽出して2Dネットワークを監督し,トレーニング中の2D特徴からシミュレーションされた3D特徴を学習する。
次に,2次元の正規化方式を設計し,2次元特徴と3次元特徴のキャリブレーションを行った。
第3に,非ペアの3dデータを用いたトレーニングのフレームワークを拡張するために,意味を意識した対向的トレーニングモデルを設計した。
論文 参考訳(メタデータ) (2021-04-06T02:22:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。