論文の概要: DINOcular: Self-Supervised Visuospatial Representations
- arxiv url: http://arxiv.org/abs/2608.27226v2
- Date: Thu, 03 Sep 2026 11:22:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.104789
- Title: DINOcular: Self-Supervised Visuospatial Representations
- Title(参考訳): DINOcular: 自己監督型視覚空間表現
- Authors: Farkhat Almukhamedov, Sami Azirar, Hermann Blum,
- Abstract要約: RGB-D観測から共同空間表現を学習するための自己教師型フレームワークを提案する。
本手法は, 深部からの幾何学的先駆体と, パッチ間およびパッチ内融合による視覚的バックボーンを融合する。
結果として得られた表現は、セマンティックトランスファーを保ちながら3D認識に有望な改善を示す。
- 参考スコア(独自算出の注目度): 7.360872501623849
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce a self-supervised framework for learning joint visuospatial representations from RGB-D observations. While modern vision foundation models are trained almost exclusively on RGB images, many embodied systems have access to explicit depth sensing, which provides geometric information that monocular inputs cannot recover. Our method integrates depth-derived geometric priors with a visual backbone through inter-patch and intra-patch fusion, enabling the model to encode both appearance and spatial structure efficiently. The resulting representation shows promising improvements on 3D awareness while preserving semantic transfer: it outperforms prior methods of comparable scale on multiple 3D geometry benchmarks, and remains competitive when probed for standard RGB-D semantic segmentation tasks.
- Abstract(参考訳): RGB-D観測から共同空間表現を学習するための自己教師型フレームワークを提案する。
現代の視覚基礎モデルは、ほとんどRGB画像にのみ訓練されているが、多くの具体化されたシステムは明示的な深度検出にアクセスでき、モノラル入力が回復できない幾何学的情報を提供する。
本手法は, 深部からの幾何学的先駆体を, パッチ間融合とパッチ内融合により視覚的バックボーンと統合し, 外観と空間構造の両方を効率的にエンコードする。
結果として得られた表現は、セマンティックトランスファーを保ちながら、有望な3D認識の向上を示す。これは、複数の3D幾何ベンチマークにおいて、同等のスケールの先行メソッドよりも優れており、標準のRGB-Dセマンティックセマンティックセマンティックセマンティクスタスクを探索しても競争力がある。
関連論文リスト
- GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation [75.85672467847631]
本稿では,3次元のコンパクトな特徴表現であるGeometry-Aware BEV (GA-BEV)を紹介する。
視覚的特徴を3次元空間に投影することで,RGB-D入力からBEV空間マップを構築する。
我々は,BEV空間に事前訓練された3Dファンデーションモデルの特徴を取り入れ,大規模3D再構築作業から学んだ構造的先行を注入する。
論文 参考訳(メタデータ) (2026-05-21T06:20:17Z) - Align3D-AD: Cross-Modal Feature Alignment and Dual-Prompt Learning for Zero-shot 3D Anomaly Detection [2.08058961865456]
ゼロショット3D異常検出は、ターゲットカテゴリからのトレーニングデータにアクセスすることなく、異常を識別することを目的としている。
既存の手法は主に幾何学的手がかりを主に捉える多視点表現に3D観測を投影することに依存している。
本稿では,補助カテゴリからのRGBモダリティをクロスモーダルガイダンスとして活用する2段階統合フレームワークAlign3D-ADを提案する。
論文 参考訳(メタデータ) (2026-05-07T08:24:44Z) - Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images [81.94999489820974]
UniSplat (UniSplat) は、未提示のマルチビュー画像から3D表現を学習するためのフィードフォワードフレームワークである。
エンコーダにおける幾何誘導を強化するデュアルマスキング戦略を導入する。
第2に,外見のセマンティックな矛盾を解消する粗大なガウス的スプレイティング戦略を開発する。
第3に、予測された3次元点と意味マップを画像平面に相互に関連付ける、ポーズ条件の補正機構を導入する。
論文 参考訳(メタデータ) (2026-04-12T10:36:18Z) - Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation [5.466547563815996]
本稿では,RGB-D入力からのカテゴリレベルの9-DoFポーズ推定の課題をCADモデルに頼らずに解決する。
深度に基づくグラフ畳み込み表現とセマンティック特徴を融合したハイブリッドアーキテクチャであるDeMo-Poseを提案する。
提案手法は,オブジェクトカテゴリ間のリアルタイム推論を実現し,最先端の手法を大幅に改善する。
論文 参考訳(メタデータ) (2026-03-29T05:58:04Z) - Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors [0.0]
本稿では,幾何処理と意味認識の相互作用を形式化する2重ストリームアーキテクチャであるSemGeo-AttentionNetを紹介する。
我々は、強化学習を通じて時間的スキャンパス生成にフレームワークを拡張した。
SAL3D, NUS3D, 3DVAデータセットの評価は大幅に改善されている。
論文 参考訳(メタデータ) (2026-02-06T06:15:38Z) - Joint Geometry-Appearance Human Reconstruction in a Unified Latent Space via Bridge Diffusion [57.09673862519791]
本稿では,幾何学と外観のモデリングを結合潜在表現に統一する新しいフレームワークである textbfJGA-LBD を紹介する。
実験により、JGA-LBDは、幾何学的忠実度と外観品質の両方の観点から、現在の最先端アプローチよりも優れていることが示された。
論文 参考訳(メタデータ) (2026-01-01T12:48:56Z) - Confidence-Aware RGB-D Face Recognition via Virtual Depth Synthesis [48.59382455101753]
2D顔認証は、照明、閉塞、ポーズの変化により、制約のない環境において課題に遭遇する。
近年の研究では、深度情報を組み込んだRGB-D顔認証に焦点が当てられている。
本研究では,まず,深度モデル事前学習のための3次元Morphable Modelsによって生成された多様な深度データセットを構築する。
そこで本研究では,手軽に利用できるRGBと深度モデルを利用したドメイン非依存の事前学習フレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-11T09:12:24Z) - Geometric-aware Pretraining for Vision-centric 3D Object Detection [77.7979088689944]
GAPretrainと呼ばれる新しい幾何学的事前学習フレームワークを提案する。
GAPretrainは、複数の最先端検出器に柔軟に適用可能なプラグアンドプレイソリューションとして機能する。
BEVFormer法を用いて, nuScenes val の 46.2 mAP と 55.5 NDS を実現し, それぞれ 2.7 と 2.1 点を得た。
論文 参考訳(メタデータ) (2023-04-06T14:33:05Z) - Exploring intermediate representation for monocular vehicle pose
estimation [38.85309013717312]
1枚のRGB画像からSO(3)の車両ポーズを復元する学習ベースの新しいフレームワークを提案する。
局所的な外観から観測角度へマッピングする以前の作品とは対照的に、我々は意味のある中間幾何学的表現(IGR)を抽出して進歩的なアプローチを探求する。
このアプローチは、知覚強度をIGRに変換するディープモデルを特徴とし、カメラ座標系における物体の向きを符号化する3次元表現にマッピングする。
論文 参考訳(メタデータ) (2020-11-17T06:30:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。