論文の概要: BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion
- arxiv url: http://arxiv.org/abs/2607.24110v1
- Date: Mon, 27 Jul 2026 07:48:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.349504
- Title: BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion
- Title(参考訳): BeyondFusion: Calibration-free Infrared Super-Resolution と Infrared-Visible Fusion のための自己調整型潜伏拡散法
- Authors: Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang,
- Abstract要約: BeyondFusionは、キャリブレーションのない可視光誘導赤外線超解像および赤外線可視光融合タスクのためのフレームワークである。
提案フレームワークは,2つのタスクを最適化し,同じ生成プロセスの2つの読み出しとして実行する,タスク固有のトレーニングと共同トレーニングの両方をサポートする。
パブリックベンチマークとモバイル赤外線可視画像システムによる実験は、整列入力、低分解能赤外線観測、合成ミスアライメント、および非同期センサーによる実際のモバイルキャプチャーの性能を示す。
- 参考スコア(独自算出の注目度): 33.54822144332431
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mobile infrared-visible imaging typically pairs a compact infrared sensor with a high-resolution visible camera for complementary perception. While cross-sensor misalignment caused by different optics, viewpoints, fields of view, and exposure timings hinders practical deployment. In this paper, we propose BeyondFusion, a unified latent diffusion framework for calibration-free visible-guided infrared super-resolution and infrared-visible fusion tasks. The proposed framework supports both task-specific training and joint training where two tasks are optimized and executed as two readouts of the same generative process. Instead of relying on explicit registration or geometric warping, BeyondFusion introduces a cross-modal self-aligning (CMSA) module into the denoising U-Net. CMSA reorganizes infrared and visible latent tokens into a shared attention space to learn content-adaptive cross-modal correspondence during the denoising process. Together with misalignment augmentation module, the model is facilitated to exploit visible structural and semantic cues while preserving thermal consistency, enabling high-frequency infrared reconstruction and informative fused-image generation under uncalibrated conditions. Extensive experiments on public benchmarks and a mobile infrared-visible imaging system show strong performance across aligned inputs, low-resolution infrared observations, synthetic misalignments, and real mobile captures with unsynchronized sensors. Ablation studies, unified training analysis, and downstream pedestrian detection further validate the effectiveness of BeyondFusion for calibration-free multimodal imaging.
- Abstract(参考訳): モバイル赤外線可視画像は通常、コンパクトな赤外線センサーと高解像度の可視カメラを組み合わせて補完的な知覚を行う。
異なる光学、視点、視野、露光タイミングによって生じるクロスセンサーのミスアライメントは、実際の展開を妨げる。
本稿では, キャリブレーションのない可視光誘導赤外超解像および赤外可視光融合タスクのための統合潜在拡散フレームワークであるBeyondFusionを提案する。
提案フレームワークは,2つのタスクを最適化し,同じ生成プロセスの2つの読み出しとして実行する,タスク固有のトレーニングと共同トレーニングの両方をサポートする。
BeyondFusionは、明示的な登録や幾何学的ワープに頼る代わりに、デノイングU-Netにクロスモーダル自己調整(CMSA)モジュールを導入している。
CMSAは、赤外線および可視光潜在トークンを共有注意空間に再編成し、復調過程中にコンテンツ適応型クロスモーダル対応を学習する。
不整合加振モジュールとともに、熱的一貫性を維持しつつ、可視的構造的および意味的手がかりを活用できるようにし、非校正条件下での高周波赤外線再構成と情報融合画像生成を可能にする。
パブリックベンチマークとモバイル赤外線可視画像システムに関する大規模な実験は、整列入力、低分解能赤外線観測、合成ミスアライメント、および非同期センサーによる実際のモバイルキャプチャーの性能を示す。
アブレーション研究、統合トレーニング分析、下流歩行者検出は、キャリブレーションフリーマルチモーダルイメージングにおけるBeyondFusionの有効性をさらに検証する。
関連論文リスト
- FSCM: Frequency-Enhanced Spatial-Spectral Coupled Mamba for Infrared Hyperspectral Image Colorization [10.509841173943387]
本稿では、赤外色化のためのスペクトル情報誘導型GANフレームワークを提案する。
FSCM内では、カスケードFSBユニットからなる周波数増幅空間スペクトル状態空間ジェネレータが構築される。
実験により、FSCMは、視覚的品質と意味的忠実度において、既存の赤外色化法よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-05-13T15:48:58Z) - Perceptual Region-Driven Infrared-Visible Co-Fusion for Extreme Scene Enhancement [8.10747908396949]
マルチ露光とマルチモーダルイメージングを組み合わせた地域認識に基づく融合フレームワークを提案する。
このフレームワークは、極端環境における単一露光法制限を克服し、マルチモーダル・マルチ露光データを融合する。
合成データと実世界のデータの両方で行った実験は、最先端の手法と比較して画像の明瞭さが優れ、性能が向上した。
論文 参考訳(メタデータ) (2025-12-06T11:17:35Z) - DifIISR: A Diffusion Model with Gradient Guidance for Infrared Image Super-Resolution [32.53713932204663]
DifIISRは、視覚品質と知覚性能に最適化された赤外線画像超解像拡散モデルである。
我々は、視力を維持するために赤外線熱スペクトル分布制御を導入する。
下流の視覚課題に対する知覚的ガイダンスとして,様々な視覚基盤モデルを組み込んだ。
論文 参考訳(メタデータ) (2025-03-03T05:20:57Z) - Contourlet Refinement Gate Framework for Thermal Spectrum Distribution Regularized Infrared Image Super-Resolution [54.293362972473595]
画像超解像(SR)は、高解像度(HR)画像を低解像度(LR)画像から再構成することを目的としている。
SRタスクに対処する現在のアプローチは、RGB画像の特徴を抽出するか、同様の劣化パターンを仮定するものである。
スペクトル分布の忠実さを保ちつつ、赤外線変調特性を復元するコントゥーレット改質ゲートフレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-19T14:24:03Z) - Infrared-Assisted Single-Stage Framework for Joint Restoration and Fusion of Visible and Infrared Images under Hazy Conditions [9.415977819944246]
本稿では,赤外線画像を用いた統合学習フレームワークを提案する。
本手法は, ヘイズを除去しながらIR-VIS画像を効果的に融合させ, 鮮明で無害な融合結果をもたらす。
論文 参考訳(メタデータ) (2024-11-16T02:57:12Z) - Frequency Domain Modality-invariant Feature Learning for
Visible-infrared Person Re-Identification [79.9402521412239]
本稿では、周波数領域から見たモダリティの相違を低減するために、新しい周波数領域モダリティ不変特徴学習フレームワーク(FDMNet)を提案する。
我々のフレームワークでは、インスタンス適応振幅フィルタ(IAF)とPhrase-Preserving Normalization(PPNorm)という、2つの新しいモジュールを導入している。
論文 参考訳(メタデータ) (2024-01-03T17:11:27Z) - Breaking Modality Disparity: Harmonized Representation for Infrared and
Visible Image Registration [66.33746403815283]
シーン適応型赤外線と可視画像の登録を提案する。
我々は、異なる平面間の変形をシミュレートするためにホモグラフィーを用いる。
我々は、まず、赤外線と可視画像のデータセットが不一致であることを示す。
論文 参考訳(メタデータ) (2023-04-12T06:49:56Z) - Unsupervised Misaligned Infrared and Visible Image Fusion via
Cross-Modality Image Generation and Registration [59.02821429555375]
我々は、教師なし不整合赤外線と可視画像融合のための頑健な相互モダリティ生成登録パラダイムを提案する。
登録された赤外線画像と可視画像とを融合させるため,IFM (Feature Interaction Fusion Module) を提案する。
論文 参考訳(メタデータ) (2022-05-24T07:51:57Z) - Target-aware Dual Adversarial Learning and a Multi-scenario
Multi-Modality Benchmark to Fuse Infrared and Visible for Object Detection [65.30079184700755]
本研究は、物体検出のために異なるように見える赤外線と可視画像の融合の問題に対処する。
従来のアプローチでは、2つのモダリティの根底にある共通点を発見し、反復最適化またはディープネットワークによって共通空間に融合する。
本稿では、融合と検出の連立問題に対する二段階最適化の定式化を提案し、その後、核融合と一般的に使用される検出ネットワークのためのターゲット認識デュアル逆学習(TarDAL)ネットワークに展開する。
論文 参考訳(メタデータ) (2022-03-30T11:44:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。