論文の概要: Adapting Vision Foundation Models to Acoustics for Pose-Free 3D Sonar Reconstruction
- arxiv url: http://arxiv.org/abs/2609.06261v1
- Date: Sat, 05 Sep 2026 21:03:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-12 06:20:11.932215
- Title: Adapting Vision Foundation Models to Acoustics for Pose-Free 3D Sonar Reconstruction
- Title(参考訳): 空間自由な3次元ソナー再構成のための視覚基礎モデルへのアコースティックスの適用
- Abstract要約: 大規模ソナーデータセットに基づいて訓練された音響基礎モデルは、水中ドメインで同様の機能を実現することができる。
無償で利用可能な大規模ソナーデータセットがないため、そのようなモデルをスクラッチからトレーニングするのは現実的ではない。
我々は,視覚基礎モデルがソナー設定に効率的に適応できることを実証した。
初めてソナーを用いたポーズレス3D再構成実験を行った。
- 参考スコア(独自算出の注目度): 24.97118608922145
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision foundation models trained on Internet-scale RGB datasets enable remarkable capabilities across a range of tasks, from text-to-video generation to few-shot 3D scene reconstruction. An acoustic foundation model trained on large-scale sonar datasets could enable similar capabilities in the underwater domain, where turbidity and low-visibility conditions make conventional RGB foundation models inapplicable. Unfortunately, a lack of freely available large-scale sonar datasets makes training such a model from scratch impractical. In this work, we demonstrate that vision foundation models can be efficiently adapted to the sonar setting by (1) exploiting the geometric relationship between the two sensing modalities and (2) employing accurate physics-based noise models for synthetic data generation. The resulting sonar adaptation models enable new capabilities: For the first time, we experimentally demonstrate sonar-based pose-free 3D reconstruction.
- Abstract(参考訳): インターネットスケールのRGBデータセットでトレーニングされたビジョンファウンデーションモデルは、テキストからビデオ生成から、数ショットの3Dシーンの再構築に至るまで、さまざまなタスクで顕著な機能を実現する。
大規模ソナーデータセットに基づいて訓練された音響基礎モデルは、濁度と低視認性条件が従来のRGB基盤モデルの適用を不可能にする水中領域で同様の機能を実現することができる。
残念ながら、無償で利用可能な大規模ソナーデータセットがないため、そのようなモデルをスクラッチからトレーニングするのは現実的ではない。
本研究では,(1)2つの知覚モーダル間の幾何的関係を利用し,(2)正確な物理に基づくノイズモデルを用いて合成データ生成を行うことにより,視覚基盤モデルをソナー設定に効率的に適用できることを実証する。
ソナーをベースとしたポーズレス3D再構成実験を初めて行った。
関連論文リスト
- S-MUSt3R: Sliding Multi-view 3D Reconstruction [17.018626984951823]
本研究はS-MUSt3Rを提案する。S-MUSt3Rは単分子3次元再構成のための基礎モデルの限界を拡張するシンプルで効率的なパイプラインである。
我々は,S-MUSt3Rが長いRGBシーケンス上で正常に動作し,高精度で一貫した3D再構成を実現することを示す。
論文 参考訳(メタデータ) (2026-02-04T13:07:14Z) - UniPre3D: Unified Pre-training of 3D Point Cloud Models with Cross-Modal Gaussian Splatting [64.31900521467362]
既存の事前学習方法は、オブジェクトレベルとシーンレベルの両方の点群に対して等しく有効である。
UniPre3Dは,任意のスケールの点群やアーキテクチャの3Dモデルに対してシームレスに適用可能な,最初の統合事前学習手法である。
論文 参考訳(メタデータ) (2025-06-11T17:23:21Z) - UVRM: A Scalable 3D Reconstruction Model from Unposed Videos [68.34221167200259]
従来の2次元視覚データを用いた3D再構成モデルのトレーニングには、トレーニングサンプルのカメラポーズに関する事前知識が必要である。
UVRMは、ポーズに関する情報を必要とせず、単眼ビデオでトレーニングし、評価できる新しい3D再構成モデルである。
論文 参考訳(メタデータ) (2025-01-16T08:00:17Z) - DistillNeRF: Perceiving 3D Scenes from Single-Glance Images by Distilling Neural Fields and Foundation Model Features [65.8738034806085]
DistillNeRFは、自動運転シーンにおける3D環境を理解するための自己教師型学習フレームワークである。
本手法は,スパースで単一フレームのマルチビューカメラ入力からリッチなニューラルシーン表現を予測する一般化可能なフィードフォワードモデルである。
論文 参考訳(メタデータ) (2024-06-17T21:15:13Z) - Zero123-6D: Zero-shot Novel View Synthesis for RGB Category-level 6D Pose Estimation [66.3814684757376]
本研究は,RGB 6Dのカテゴリレベルでのポーズ推定を向上するための拡散モデルに基づく新規ビュー合成器の実用性を示す最初の研究であるZero123-6Dを示す。
本手法は,データ要求の低減,ゼロショットカテゴリレベルの6Dポーズ推定タスクにおける深度情報の必要性の除去,およびCO3Dデータセットの実験により定量的に示された性能の向上を示す。
論文 参考訳(メタデータ) (2024-03-21T10:38:18Z) - UniDream: Unifying Diffusion Priors for Relightable Text-to-3D Generation [101.2317840114147]
We present UniDream, a text-to-3D generation framework by integration priors。
提案手法は,(1)アルベド正規配位型多視点拡散・再構成モデルを得るための2相学習プロセス,(2)訓練された再構成・拡散モデルを用いたスコア蒸留サンプル(SDS)に基づく幾何およびアルベドテクスチャのプログレッシブ生成手順,(3)安定拡散モデルに基づく固定アルベドを保ちながらPBR生成を確定するSDSの革新的な応用,の3つからなる。
論文 参考訳(メタデータ) (2023-12-14T09:07:37Z) - PonderV2: Pave the Way for 3D Foundation Model with A Universal Pre-training Paradigm [111.16358607889609]
本稿では,効率的な3D表現の獲得を容易にするために,新しいユニバーサル3D事前学習フレームワークを提案する。
PonderV2は、11の室内および屋外ベンチマークで最先端のパフォーマンスを達成したことで、その効果が示唆された。
論文 参考訳(メタデータ) (2023-10-12T17:59:57Z) - Robust Category-Level 3D Pose Estimation from Synthetic Data [17.247607850702558]
CADモデルから生成されたオブジェクトポーズ推定のための新しい合成データセットであるSyntheticP3Dを紹介する。
逆レンダリングによるポーズ推定を行うニューラルネットワークモデルをトレーニングするための新しいアプローチ(CC3D)を提案する。
論文 参考訳(メタデータ) (2023-05-25T14:56:03Z) - Shape, Pose, and Appearance from a Single Image via Bootstrapped
Radiance Field Inversion [54.151979979158085]
提案手法では,自然画像に対する基本的エンドツーエンド再構築フレームワークを導入し,正確な地平のポーズが得られない。
そこで,モデルが解の第一の推算を生成するハイブリッド・インバージョン・スキームを適用する。
当社のフレームワークでは,イメージを10ステップでデレンダリングすることが可能で,現実的なシナリオで使用することが可能です。
論文 参考訳(メタデータ) (2022-11-21T17:42:42Z) - Amodal 3D Reconstruction for Robotic Manipulation via Stability and
Connectivity [3.359622001455893]
学習に基づく3Dオブジェクト再構成により、3Dオブジェクトモデルの単一または少数ショット推定が可能となる。
既存の3D再構成技術は、通常、シャムファー距離またはボクセルIOUによって測定される視覚的再構成忠実度を最適化する。
本稿では,オブジェクト形状よりも先に安定性を導入するアモーダル3D再構成システムARMと,接続前の接続,マルチチャネル入力表現を提案する。
論文 参考訳(メタデータ) (2020-09-28T08:52:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。