論文の概要: LadleNet: Translating Thermal Infrared Images to Visible Light Images
Using A Scalable Two-stage U-Net
- arxiv url: http://arxiv.org/abs/2308.06603v2
- Date: Fri, 8 Sep 2023 13:03:24 GMT
- ステータス: 処理完了
- システム内更新日: 2023-09-11 17:23:23.862305
- Title: LadleNet: Translating Thermal Infrared Images to Visible Light Images
Using A Scalable Two-stage U-Net
- Title(参考訳): LadleNet:スケーラブルな2段階U-Netを用いた可視光画像への熱赤外画像の変換
- Authors: Tonghui Zou and Lei Chen
- Abstract要約: U-Netアーキテクチャに基づくアルゴリズムであるLadleNetを導入する。
LadleNetは2段階のU-Net結合構造を採用し、スキップ接続と洗練された機能集約技術で拡張されている。
本稿では,LadleNetのHandleモジュールを事前トレーニングしたDeepLabv3+ネットワークに置き換えるLadleNet+を提案する。
- 参考スコア(独自算出の注目度): 6.055135853772926
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The translation of thermal infrared (TIR) images to visible light (VI) images
presents a challenging task with potential applications spanning various
domains such as TIR-VI image registration and fusion. Leveraging supplementary
information derived from TIR image conversions can significantly enhance model
performance and generalization across these applications. However, prevailing
issues within this field include suboptimal image fidelity and limited model
scalability. In this paper, we introduce an algorithm, LadleNet, based on the
U-Net architecture. LadleNet employs a two-stage U-Net concatenation structure,
augmented with skip connections and refined feature aggregation techniques,
resulting in a substantial enhancement in model performance. Comprising
'Handle' and 'Bowl' modules, LadleNet's Handle module facilitates the
construction of an abstract semantic space, while the Bowl module decodes this
semantic space to yield mapped VI images. The Handle module exhibits
extensibility by allowing the substitution of its network architecture with
semantic segmentation networks, thereby establishing more abstract semantic
spaces to bolster model performance. Consequently, we propose LadleNet+, which
replaces LadleNet's Handle module with the pre-trained DeepLabv3+ network,
thereby endowing the model with enhanced semantic space construction
capabilities. The proposed method is evaluated and tested on the KAIST dataset,
accompanied by quantitative and qualitative analyses. Compared to existing
methodologies, our approach achieves state-of-the-art performance in terms of
image clarity and perceptual quality. The source code will be made available at
https://github.com/Ach-1914/LadleNet/tree/main/.
- Abstract(参考訳): 熱赤外(TIR)画像から可視光(VI)画像への変換は、TIR-VI画像の登録や融合など、様々な領域にまたがる潜在的な応用に向けた課題を示す。
TIR画像変換から得られた補助情報を活用することで、これらのアプリケーション間でのモデル性能と一般化を大幅に向上させることができる。
しかし、この分野で一般的な問題には、最適な画像の忠実さとモデルのスケーラビリティの制限が含まれる。
本稿では,U-Netアーキテクチャに基づくアルゴリズムであるLadleNetを紹介する。
LadleNetは2段階のU-Net結合構造を採用し、スキップ接続と改良された特徴集約技術で強化され、モデル性能が大幅に向上した。
ハンドル」モジュールと「ボウル」モジュールからなるladlenetのハンドルモジュールは抽象的な意味空間の構築を容易にし、ボウルモジュールはこの意味空間をデコードしてマッピングされたvi画像を生成する。
ハンドラモジュールは、ネットワークアーキテクチャをセマンティクスセグメンテーションネットワークに置き換えることで拡張性を示し、モデルの性能を高めるためにより抽象的なセマンティクス空間を確立する。
そこで我々は,LadleNetのHandleモジュールを事前学習したDeepLabv3+ネットワークに置き換えたLadleNet+を提案する。
提案手法は, 定量的および定性的分析を伴って, KAISTデータセット上で評価, 検証を行った。
既存の手法と比較して,本手法は画像の明瞭さと知覚品質の観点から最先端の性能を実現する。
ソースコードはhttps://github.com/Ach-1914/LadleNet/tree/main/で入手できる。
関連論文リスト
- Image2Sentence based Asymmetrical Zero-shot Composed Image Retrieval [92.13664084464514]
合成画像検索(CIR)の課題は,検索画像とユーザの意図を記述したテキストに基づいて画像を取得することである。
既存の手法は、CIRタスクにおける高度な大規模視覚言語(VL)モデルにおいて大きな進歩を遂げているが、それらは一般的に、モデルトレーニングのためのラベル付き三重項の欠如とリソース制限された環境への展開の困難という2つの大きな問題に悩まされている。
本稿では、VLモデルを利用して合成学習のためのラベルなし画像のみに依存する画像2Sentenceに基づく非対称ゼロショット合成画像検索(ISA)を提案する。
論文 参考訳(メタデータ) (2024-03-03T07:58:03Z) - DGNet: Dynamic Gradient-Guided Network for Water-Related Optics Image
Enhancement [77.0360085530701]
水中画像強調(UIE)は、水中環境によって引き起こされる複雑な劣化のために難しい課題である。
従来の手法では、劣化過程を理想化し、中音や物体の動きが画像の特徴の分布に与える影響を無視することが多い。
提案手法では,予測画像を用いて疑似ラベルを動的に更新し,動的勾配を加えてネットワークの勾配空間を最適化する。
論文 参考訳(メタデータ) (2023-12-12T06:07:21Z) - SENetV2: Aggregated dense layer for channelwise and global
representations [0.0]
我々は,Squeeze残余モジュール内に,多分岐密度層である新しい多層パーセプトロンを導入する。
この融合により、チャネルワイドパターンを捕捉し、グローバルな知識を持つネットワークの能力が向上する。
ベンチマークデータセットの広範な実験を行い、モデルを検証し、確立したアーキテクチャと比較する。
論文 参考訳(メタデータ) (2023-11-17T14:10:57Z) - Enhancing Low-light Light Field Images with A Deep Compensation
Unfolding Network [52.77569396659629]
本稿では,低光環境下で撮像した光場(LF)画像の復元に,DCUNet(Deep compensation network openfolding)を提案する。
このフレームワークは、中間拡張結果を使用して照明マップを推定し、展開プロセスで新しい拡張結果を生成する。
本稿では,LF画像の特徴を適切に活用するために,擬似明示的特徴相互作用モジュールを提案する。
論文 参考訳(メタデータ) (2023-08-10T07:53:06Z) - Cross-receptive Focused Inference Network for Lightweight Image
Super-Resolution [64.25751738088015]
トランスフォーマーに基づく手法は、単一画像超解像(SISR)タスクにおいて顕著な性能を示した。
動的に特徴を抽出するために文脈情報を組み込む必要がある変換器は無視される。
我々は,CNNとTransformerを混合したCTブロックのカスケードで構成される,軽量なクロスレセプティブ・フォーカスド・推論・ネットワーク(CFIN)を提案する。
論文 参考訳(メタデータ) (2022-07-06T16:32:29Z) - Learning Deep Context-Sensitive Decomposition for Low-Light Image
Enhancement [58.72667941107544]
典型的なフレームワークは、照明と反射を同時に推定することであるが、特徴空間にカプセル化されたシーンレベルの文脈情報を無視する。
本研究では,空間スケールにおけるシーンレベルのコンテキスト依存を生かした,コンテキスト依存型分解ネットワークアーキテクチャを提案する。
チャネル数を減らして軽量なCSDNet(LiteCSDNet)を開発する。
論文 参考訳(メタデータ) (2021-12-09T06:25:30Z) - Recurrence along Depth: Deep Convolutional Neural Networks with
Recurrent Layer Aggregation [5.71305698739856]
本稿では,従来のレイヤからの情報を再利用して,現在のレイヤの特徴をよりよく抽出する方法を説明するために,レイヤアグリゲーションの概念を紹介する。
我々は,深層CNNにおける層構造を逐次的に利用することにより,RLA(recurrent layer aggregate)と呼ばれる非常に軽量なモジュールを提案する。
私たちのRLAモジュールは、ResNets、Xception、MobileNetV2など、多くの主要なCNNと互換性があります。
論文 参考訳(メタデータ) (2021-10-22T15:36:33Z) - BoundarySqueeze: Image Segmentation as Boundary Squeezing [104.43159799559464]
本研究では,オブジェクトとシーンの微細な高画質画像分割のための新しい手法を提案する。
形態素画像処理技術による拡張と浸食に着想を得て,画素レベルのセグメンテーション問題をスクイーズ対象境界として扱う。
提案手法は,COCO,Cityscapesのインスタンス・セグメンテーション・セグメンテーション・セグメンテーションにおいて大きく向上し,同一条件下での精度・速度ともに従来のPointRendよりも優れていた。
論文 参考訳(メタデータ) (2021-05-25T04:58:51Z) - Efficient and Model-Based Infrared and Visible Image Fusion Via
Algorithm Unrolling [24.83209572888164]
赤外線および可視画像融合(IVIF)は、赤外線画像からの熱放射情報を保持する画像と、可視画像からテクスチャの詳細を取得することを期待している。
従来のCNNベースのIVIFモデルの欠点を克服するために,モデルベース畳み込みニューラルネットワーク(CNN)モデルを提案する。
論文 参考訳(メタデータ) (2020-05-12T16:15:56Z) - Spectrally Consistent UNet for High Fidelity Image Transformations [5.494315657902533]
畳み込みニューラルネットワーク(CNN)は、多くのイメージングタスクで使われている現在のデファクトモデルである。
本研究では、UNetsの構造バイアスとそれらが出力に与える影響を評価する方法を提案する。
スペクトル的に一貫した出力を提供する Guided Image Filter の新たな使用法に基づき,新しいアップサンプリングモジュールを提案する。
論文 参考訳(メタデータ) (2020-04-22T17:04:02Z) - Concurrently Extrapolating and Interpolating Networks for Continuous
Model Generation [34.72650269503811]
本稿では,一組の特定効果ラベル画像のみを必要とするモデル列を形成するための,シンプルで効果的なモデル生成戦略を提案する。
提案手法は一連の連続モデルの生成が可能であり,画像平滑化のための最先端手法よりも優れた性能が得られることを示す。
論文 参考訳(メタデータ) (2020-01-12T04:44:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。