論文の概要: Disentangle-then-Align: Non-Iterative Hybrid Multimodal Image Registration via Cross-Scale Feature Disentanglement
- arxiv url: http://arxiv.org/abs/2603.19623v1
- Date: Fri, 20 Mar 2026 04:03:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.986471
- Title: Disentangle-then-Align: Non-Iterative Hybrid Multimodal Image Registration via Cross-Scale Feature Disentanglement
- Title(参考訳): 非等角的ハイブリッドマルチモーダル画像レジストレーション
- Authors: Chunlei Zhang, Jiahao Xia, Yun Xiao, Bo Jiang, Jian Zhang,
- Abstract要約: マルチモーダル画像登録は、下流のクロスモーダル解析の基本的な課題であり、必須条件である。
我々は、安定な共有特徴空間と統一されたハイブリッド変換を共同学習するために、ハイブリッドマルチモーダル登録を定式化する。
Modality-Specific Batch Normalization (MSBN) の共有バックボーンはマルチスケールの特徴を抽出し、Cross-scale Disentanglement and Adaptive Projection (CDAP) モジュールはModality-private cuesを抑圧し、共有した機能をマッチング用の安定なサブスペースに分割する。
- 参考スコア(独自算出の注目度): 19.39282311652453
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal image registration is a fundamental task and a prerequisite for downstream cross-modal analysis. Despite recent progress in shared feature extraction and multi-scale architectures, two key limitations remain. First, some methods use disentanglement to learn shared features but mainly regularize the shared part, allowing modality-private cues to leak into the shared space. Second, most multi-scale frameworks support only a single transformation type, limiting their applicability when global misalignment and local deformation coexist. To address these issues, we formulate hybrid multimodal registration as jointly learning a stable shared feature space and a unified hybrid transformation. Based on this view, we propose HRNet, a Hybrid Registration Network that couples representation disentanglement with hybrid parameter prediction. A shared backbone with Modality-Specific Batch Normalization (MSBN) extracts multi-scale features, while a Cross-scale Disentanglement and Adaptive Projection (CDAP) module suppresses modality-private cues and projects shared features into a stable subspace for matching. Built on this shared space, a Hybrid Parameter Prediction Module (HPPM) performs non-iterative coarse-to-fine estimation of global rigid parameters and deformation fields, which are fused into a coherent deformation field. Extensive experiments on four multimodal datasets demonstrate state-of-the-art performance on rigid and non-rigid registration tasks. The code is available at the project website.
- Abstract(参考訳): マルチモーダル画像登録は、下流のクロスモーダル解析の基本的な課題であり、必須条件である。
共有機能抽出とマルチスケールアーキテクチャの最近の進歩にもかかわらず、2つの重要な制限が残っている。
まず、共有特徴を学習するために非絡み合いを用いる方法もあるが、主に共有部分の正則化により、モダリティプライベートなキューが共有空間に漏れることが可能である。
第二に、ほとんどのマルチスケールフレームワークは単一の変換タイプのみをサポートし、グローバルなミスアライメントと局所的な変形共存の際の適用性を制限している。
これらの問題に対処するために、我々は、安定な共有特徴空間と統一されたハイブリッド変換を共同学習するとして、ハイブリッドマルチモーダル登録を定式化する。
この観点から,表現の不整合とハイブリッドパラメータ予測を結合したハイブリッド登録ネットワークHRNetを提案する。
Modality-Specific Batch Normalization (MSBN) の共有バックボーンはマルチスケールの特徴を抽出し、Cross-scale Disentanglement and Adaptive Projection (CDAP) モジュールはModality-private cuesを抑圧し、共有した機能をマッチング用の安定なサブスペースに分割する。
この共有空間上に構築されたハイブリッドパラメータ予測モジュール(HPPM)は、大域的剛性パラメータと変形場を非定性的に粗大に推定し、コヒーレントな変形場に融合する。
4つのマルチモーダルデータセットに対する大規模な実験は、剛性および非剛性登録タスクにおける最先端のパフォーマンスを示す。
コードはプロジェクトのWebサイトで公開されている。
関連論文リスト
- Learnable Query Aggregation with KV Routing for Cross-view Geo-localisation [12.484512905649309]
クロスビュージオローカライゼーション(CVGL)は,大規模データベースの画像と照合することで,クエリ画像の地理的位置を推定することを目的としている。
これらの課題に対処するために,3つの改良点を取り入れたCVGLシステムを提案する。
論文 参考訳(メタデータ) (2025-12-30T01:51:52Z) - UniMPR: A Unified Framework for Multimodal Place Recognition with Heterogeneous Sensor Configurations [14.975915291012983]
マルチモーダル位置認識のための統合フレームワークUniMPRを提案する。
訓練された1つのモデルのみを使用して、共通の知覚的モダリティの組み合わせにシームレスに適応することができる。
7つのデータセットの実験は、UniMPRが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2025-12-20T09:01:18Z) - UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation [54.38636515750502]
コンテンツ対応レイアウト生成タスクのための統一拡散変換器UniLayDiffを提案する。
我々は、背景画像、レイアウト要素、および多様な制約の間の複雑な相互作用を捉えるために、マルチモード拡散トランスフォーマフレームワークを使用します。
実験により、UniLayDiffは条件のないタスクから様々な条件生成タスクにまたがって最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2025-12-09T18:38:44Z) - Bridging Modalities via Progressive Re-alignment for Multimodal Test-Time Adaptation [39.02105398462778]
テスト時間適応(TTA)は、未ラベルのテストデータのみを使用したオンラインモデル適応を可能にする。
マルチモーダルのシナリオでは、異なるモダリティをまたいだ分布の度合いの変化は複雑なカップリング効果をもたらす。
本稿では,BriMPR(Progressive Re-alignment)によるブリッジングモダリティ( Bridging Modalities)と呼ばれる新しいTTAフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-28T03:33:42Z) - Divide, Conquer and Unite: Hierarchical Style-Recalibrated Prototype Alignment for Federated Medical Image Segmentation [66.82598255715696]
フェデレートラーニング(Federated Learning)は、複数の医療機関がデータを共有することなく、グローバルなモデルをトレーニングすることを可能にする。
現在のアプローチは主に、重要なマルチレベルキューを見下ろす最終層機能に重点を置いている。
我々は,ドメイン不変のコンテキスト型プロトタイプアライメントを介して特徴表現ギャップをブリッジするFedBCSを提案する。
論文 参考訳(メタデータ) (2025-11-14T04:15:34Z) - Amplifying Prominent Representations in Multimodal Learning via Variational Dirichlet Process [55.91649771370862]
ディリクレ過程(DP)混合モデルは、最も顕著な特徴を増幅できる強力な非パラメトリック法である。
本稿では,DP駆動型マルチモーダル学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-23T16:53:24Z) - Learning Unified User Quantized Tokenizers for User Representation [32.942924291891636]
U2QT(Unified User Quantized Tokenizers)は、ドメイン間の知識伝達と異種ドメインの初期融合を統合する新しいフレームワークである。
まず、Qwen3 Embeddingモデルを用いて、コンパクトで表現力のある特徴表現を導出する。
第二に、マルチビューRQ-VAEは、共有およびソース固有のコードブックを通じて、因果埋め込みをコンパクトトークンに識別する。
論文 参考訳(メタデータ) (2025-08-01T08:35:32Z) - Learning Visual Representation from Modality-Shared Contrastive
Language-Image Pre-training [88.80694147730883]
本稿では,多種多様なモダリティ共有コントラスト言語-画像事前学習(MS-CLIP)フレームワークについて検討する。
学習条件下では、視覚と言語信号のためのほとんど統一されたエンコーダが、より多くのパラメータを分離する他のすべてのバリエーションより優れていることが観察された。
我々のアプローチは、24の下流視覚タスクのコレクションに基づいて、線形探索においてバニラCLIPを1.6ポイント上回ります。
論文 参考訳(メタデータ) (2022-07-26T05:19:16Z) - Learning Deep Multimodal Feature Representation with Asymmetric
Multi-layer Fusion [63.72912507445662]
本稿では,マルチモーダルな特徴を複数の層に融合する,コンパクトで効果的なフレームワークを提案する。
我々は、エンコーダ内のモダリティ固有のバッチ正規化層を単に維持するだけで、共有シングルネットワーク内でマルチモーダル機能を学習できることを検証する。
次に,マルチモーダルな特徴を段階的に活用できる双方向多層融合方式を提案する。
論文 参考訳(メタデータ) (2021-08-11T03:42:13Z) - AlignSeg: Feature-Aligned Segmentation Networks [109.94809725745499]
本稿では,機能集約プロセスにおける誤アライメント問題に対処するために,特徴適応型ネットワーク(AlignSeg)を提案する。
我々のネットワークは、それぞれ82.6%と45.95%という新しい最先端のmIoUスコアを達成している。
論文 参考訳(メタデータ) (2020-02-24T10:00:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。