論文の概要: AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images
- arxiv url: http://arxiv.org/abs/2606.31077v1
- Date: Tue, 30 Jun 2026 03:06:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.051641
- Title: AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images
- Title(参考訳): AnyMatch: 大規模一眼レフ画像によるユニバーサルマルチモーダル画像のスーパーチャージ
- Authors: Meng Yang, Zizhuo Li, Linfeng Tang, Fan Fan, Jiayi Ma,
- Abstract要約: 我々はAnyMatchを提案し、最小限のコストでリッチなマルチモーダルトレーニングデータを生成する。
AnyMatchは、単眼深度推定、3次元再投影、拡散ベースのインペインティング、およびクロスモーダル画像変換を統合している。
我々はAnyMatchを用いた大規模合成マルチモーダルデータセットであるAny-synを構築した。
- 参考スコア(独自算出の注目度): 46.95222327089868
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-modal image matching is essential for visual localization and multi-sensor fusion, but it is hindered by the scarcity of large-scale training data with precise geometric annotations. Existing real-world datasets suffer from prohibitive costs, limited scene diversity, and errors in SfM-MVS pipelines, while synthetic methods struggle to maintain 3D geometric consistency or achieve photorealistic appearance. To address this, we propose AnyMatch, a novel framework that leverages abundant, easily accessible single-view images at minimal cost to generate rich multi-modal training data. AnyMatch integrates monocular depth estimation, 3D reprojection, diffusion-based inpainting, and crossmodal image translation to synthesize multi-view, multi-modal image pairs with 3D geometric fidelity. Crucially, our method provides annotations that strictly adhere to 3D geometric consistency through explicit 3D reprojection, avoiding SfM-MVS error accumulation. Furthermore, AnyMatch offers strong scalability, enabling controllable scene diversity and annotation difficulty via adjustable input and camera parameters. We construct Any-syn, a large-scale synthetic multi-modal dataset using AnyMatch. Experimental results show that matching networks (e.g., LoFTR, EDM, RoMa) fine-tuned on Any-syn achieve substantial performance gains on multi-modal benchmarks, exhibiting superior generalization and robustness compared to models trained on existing data.
- Abstract(参考訳): マルチモーダル画像マッチングは視覚的ローカライゼーションやマルチセンサフュージョンには不可欠であるが、高精度な幾何学的アノテーションを用いた大規模トレーニングデータの不足によって妨げられている。
既存の実世界のデータセットは、SfM-MVSパイプラインの禁止コスト、シーンの多様性の制限、エラーに悩まされ、合成手法は3次元の幾何的整合性を維持したり、フォトリアリスティックな外観を達成するのに苦労する。
これを解決するために,AnyMatchを提案する。AnyMatchは,リッチなマルチモーダルトレーニングデータを生成するために,豊富でアクセスしやすい単一ビューイメージを最小限のコストで活用する,新しいフレームワークである。
AnyMatchは、単眼深度推定、3次元再投影、拡散ベースの塗装、およびクロスモーダル画像変換を統合し、3次元幾何学的忠実度を持つ多視点多モード画像ペアを合成する。
本手法は,SfM-MVS誤差の蓄積を回避し,明快な3次元再投影による3次元幾何的整合性に厳密に準拠するアノテーションを提供する。
さらに、AnyMatchは強力なスケーラビリティを提供し、調整可能な入力パラメータとカメラパラメータによって、制御可能なシーンの多様性とアノテーションの難しさを可能にする。
我々はAnyMatchを用いた大規模合成マルチモーダルデータセットであるAny-synを構築した。
実験結果から,Any-syn上で微調整されたマッチングネットワーク(例えばLoFTR,EDM,RoMa)は,既存のデータでトレーニングされたモデルよりも優れた一般化とロバスト性を示した。
関連論文リスト
- FusionBERT: Multi-View Image-3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder [17.364270724125447]
FusionBERTは、画像3Dマルチモーダル検索のための新しいフレームワークである。
クロスアテンションベースの多視点視覚アグリゲータを使用して、オブジェクトの多視点画像の特徴を適応的に統合する。
シングルビューとマルチビューの両方の設定で、SOTAのマルチモーダル大モデルよりもはるかに高い検索精度を実現する。
論文 参考訳(メタデータ) (2026-04-02T23:36:33Z) - MuSASplat: Efficient Sparse-View 3D Gaussian Splats via Lightweight Multi-Scale Adaptation [92.57609195819647]
MuSASplatは、ポーズなしフィードフォワード3Dガウスモデルの計算負担を劇的に削減する新しいフレームワークである。
我々のアプローチの中心は、ほんのわずかなトレーニングパラメータだけで、ViTベースのアーキテクチャを効率的に微調整できる軽量なマルチスケールアダプタである。
論文 参考訳(メタデータ) (2025-12-08T04:56:46Z) - MSMA: Multi-Scale Feature Fusion For Multi-Attribute 3D Face Reconstruction From Unconstrained Images [0.0]
1つの制約のない画像から3D顔を再構築することは、制約のない環境における様々な条件のため、依然として難しい問題である。
制約のない画像から3次元顔の再構成を行うための多次元特徴融合フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-15T10:30:08Z) - GenS: Generalizable Neural Surface Reconstruction from Multi-View Images [20.184657468900852]
GenSは、エンドツーエンドの一般化可能なニューラルサーフェス再構成モデルである。
我々の表現はより強力であり、グローバルな滑らかさを維持しながら高周波の詳細を回復することができる。
人気のあるベンチマーク実験により、我々のモデルは新たなシーンにうまく一般化できることが示された。
論文 参考訳(メタデータ) (2024-06-04T17:13:10Z) - IT3D: Improved Text-to-3D Generation with Explicit View Synthesis [71.68595192524843]
本研究では、これらの問題に対処するために、明示的に合成されたマルチビュー画像を活用する新しい戦略を提案する。
我々のアプローチは、高画質画像を生成するために、LCDによって強化されたイメージ・ツー・イメージ・パイプラインを活用することである。
組込み判別器では、合成したマルチビュー画像は実データと見なされ、最適化された3Dモデルのレンダリングは偽データとして機能する。
論文 参考訳(メタデータ) (2023-08-22T14:39:17Z) - Beyond First Impressions: Integrating Joint Multi-modal Cues for
Comprehensive 3D Representation [72.94143731623117]
既存の方法は、単に3D表現を単一ビューの2D画像と粗い親カテゴリテキストに整列させる。
十分でないシナジーは、堅牢な3次元表現は共同視覚言語空間と一致すべきという考えを無視している。
我々は,JM3Dと呼ばれる多視点共同モダリティモデリング手法を提案し,点雲,テキスト,画像の統一表現を求める。
論文 参考訳(メタデータ) (2023-08-06T01:11:40Z) - Multi-View Consistent Generative Adversarial Networks for 3D-aware Image
Synthesis [48.33860286920389]
3D認識画像合成は、3D表現を学習することにより、複数のビューからオブジェクトの画像を生成することを目的としている。
既存のアプローチには幾何学的制約がないため、通常はマルチビュー一貫性のある画像を生成することができない。
幾何制約付き高品質な3次元画像合成のためのマルチビュー一貫性ジェネレータネットワーク(MVCGAN)を提案する。
論文 参考訳(メタデータ) (2022-04-13T11:23:09Z) - DeepMultiCap: Performance Capture of Multiple Characters Using Sparse
Multiview Cameras [63.186486240525554]
deep multicapは、スパースマルチビューカメラを用いたマルチパーソンパフォーマンスキャプチャのための新しい手法である。
本手法では,事前走査型テンプレートモデルを用いることなく,時間変化した表面の詳細をキャプチャできる。
論文 参考訳(メタデータ) (2021-05-01T14:32:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。