論文の概要: TIRMamba: A Thermal-Prior-Modulated State-Space Network for Sub-Million-Parameter Infrared Image Super-Resolution
- arxiv url: http://arxiv.org/abs/2610.05182v1
- Date: Sun, 04 Oct 2026 12:45:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 22:51:43.828655
- Title: TIRMamba: A Thermal-Prior-Modulated State-Space Network for Sub-Million-Parameter Infrared Image Super-Resolution
- Title(参考訳): TIRMAMba: サブミリ波パラメータ赤外線画像超解像のための熱-パラメータ変調状態空間ネットワーク
- Abstract要約: TIRMambaは896Kから910Kのパラメータを持つ単一チャネルの熱画像のネットワークである。
TIRMAMBA-Radは、中間サイズの不変設計の3dBの原熱故障を補正する。
- 参考スコア(独自算出の注目度): 0.6117371161379208
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Infrared image super-resolution is currently led by Mamba-based networks with 26 to 37 million parameters, which are difficult to deploy on the airborne and handheld platforms where thermal imaging is most needed. This paper presents TIRMamba, a network with 896K to 910K parameters for single-channel thermal imagery. A Thermal Prior Highway computes gradient, local-contrast and spectral cues once at the input and, through one adapter per residual group, modulates a weight-tied bidirectional state-space trunk and gates its dual-scale detail branch; a tri-path reconstruction adds the learned residual to a bicubic radiometric baseline. Because the standard benchmark provides only 265 infrared training images and evaluates fusion products on full images, we train with a replay strategy: grayscale DIV2K pre-training followed by fine-tuning on 64-pixel patches drawn with equal probability from the infrared and natural corpora. At scale factor 4, TIRMamba matches the strongest protocol-trained methods on both official test sets with 29 to 40 times fewer parameters and 2.8 to 9.4 times lower latency; at scale factor 2 it gives the highest SSIM on both. A variant with prior-conditioned selectivity, TIRMamba-Rad, corrects a 3 dB raw-thermal failure of an intermediate size-invariant design and gives the best results at scale factor 4 on raw-thermal, unmanned-aerial-vehicle and independent-sensor test sets. Code and trained models will be released at https://github.com/julian135707/TIRMamba upon acceptance.
- Abstract(参考訳): 現在、赤外線画像の超解像は、26~3700万のパラメータを持つマンバベースのネットワークによって導かれており、熱画像が最も必要となる空中およびハンドヘルドプラットフォームに展開することが困難である。
本稿では,896Kから910KパラメータのネットワークであるTIRMambaについて述べる。
サーマル事前ハイウェイは、入力時に勾配、局所コントラスト、スペクトルのキューを1回計算し、残基ごとに1つのアダプタを通して重み付けされた双方向状態空間トランクを変調し、その2倍のディテールブランチをゲートする。
標準ベンチマークは265個の赤外線トレーニング画像のみを提供し、フルイメージ上で融合生成物を評価するため、グレースケールのDIV2K事前トレーニングに続いて、赤外線と自然コーパスから同等の確率で描画された64ピクセルパッチを微調整するリプレイ戦略でトレーニングする。
スケールファクタ4では、TIRMambaは2つの公式テストセットの最も強力なプロトコル訓練手法と29から40倍のパラメータと2.8から9.4倍のレイテンシで一致している。
TIRMamba-Radは、中間サイズ不変設計の3dBの原熱故障を補正し、原熱、無人航空機、独立センサーテストセットのスケールファクター4における最良の結果を与える。
コードとトレーニングされたモデルは、受け入れ次第https://github.com/julian135707/TIRMambaでリリースされる。
関連論文リスト
- IR275K: A Benchmark for Infrared Multi-Frame Super-Resolution Toward Efficient Remote Sensing [10.081515566603645]
594個の赤外線ビデオシーケンスと275,196個のフレームを含むキュレートされたベンチマークIR275Kを紹介する。
シーケンスレベルのトレイン/バリデーション/テストスプリットと再現可能なX4評価プロトコルを提供する。
CGMambaは10.90Mパラメータと112.14G FLOPを持つ軽量な状態空間モデルである。
論文 参考訳(メタデータ) (2026-07-24T15:06:17Z) - Representation Distribution Matching for One-Step Visual Generation [107.84208192304455]
表現分布マッチング(Representation Distribution Matching, RDM)の設計空間の解明
2つの設計軸、分布がどのように比較され、それらの表現が比較されるかを特定し、それに沿って制御された研究によって3つの結果が得られた。
同じレシピは4ステップのFLUX.2[klein]を1ステップのジェネレータに後付けし、GenEvalの4ステップバージョンである0.826から0.794、PickScoreの22.76から22.58を90 H200 GPU時間で上回った。
論文 参考訳(メタデータ) (2026-07-02T16:15:38Z) - Supercharging Thermal Gaussian Splatting with Depth Estimation [17.284356190513005]
本研究では, 熱画像のみを用いた温度-深度ガウス散乱法(TDg)を提案する。
平均的に、学習された知覚的イメージパッチ類似度(LPIPS)、構造的類似度指標(SSIM)、TDgのピーク信号対雑音比(PSNR)などのレンダリング品質指標は、ベースラインMSMG値よりも1.12%、0.034%、0.01%良い。
論文 参考訳(メタデータ) (2026-05-28T17:57:35Z) - Frequency-Guided Fusion For RGB-Thermal Semantic Segmentation [0.6187780920448871]
本稿では,2つのConvNeXt V2バックボーン上に構築されたマルチモーダル核融合アーキテクチャを提案する。
MFNetとPST900の実験では、我々の最も軽い変種はそれぞれ61.73%、86.24% mIoUであり、35.43Mのパラメータしか得られていない。
論文 参考訳(メタデータ) (2026-05-25T18:57:22Z) - Are Pretrained Image Matchers Good Enough for SAR-Optical Satellite Registration? [7.519268719195278]
クロスモーダル光SAR登録はリモートセンシングによる災害応答のボトルネックとなる。
現代の画像マーカは、ほとんど自然画像ドメインでベンチマークされる。
論文 参考訳(メタデータ) (2026-04-11T13:56:20Z) - Seeing Heat with Color -- RGB-Only Wildfire Temperature Inference from SAM-Guided Multimodal Distillation using Radiometric Ground Truth [5.343932820859596]
本稿では,RGB入力のみを用いた画素レベルの山火事温度予測とセグメンテーションのための新しいフレームワークSAM-TIFFを紹介する。
対のRGB-サーマル画像とラジオメトリックのTIFF地上真実を訓練したマルチモーダル教師ネットワークは、知識を単調なRGB学生ネットワークに蒸留し、熱センサレス推論を可能にする。
提案手法は,RGB UAVデータから画素あたりの温度レグレッションを初めて行い,最近のFLAME 3データセットに強い一般化を示すものである。
論文 参考訳(メタデータ) (2025-05-03T00:23:11Z) - Bringing RGB and IR Together: Hierarchical Multi-Modal Enhancement for Robust Transmission Line Detection [67.02804741856512]
高速かつ高精度なTL検出のために,RGBとIRデータを統合したHMMEN(Hierarchical Multi-Modal Enhancement Network)を提案する。
提案手法では,(1)階層的RGBおよびIR特徴写像を大まかに融合・拡張するMMEB,(2)デコーダ出力とIR特徴写像の不整合を変形可能な畳み込みを利用して補正するFAB,の2つの重要な構成要素を紹介する。
論文 参考訳(メタデータ) (2025-01-25T06:21:06Z) - RS-vHeat: Heat Conduction Guided Efficient Remote Sensing Foundation Model [59.37279559684668]
本稿では,効率的なマルチモーダルリモートセンシング基盤モデルであるRS-vHeatを紹介する。
具体的には、RS-vHeatは、O(N1.5)$の複雑さを持つ熱伝導演算子(HCO)と、大域的受容場を適用している。
注意に基づくリモートセンシング基礎モデルと比較して、メモリ使用量を84%削減し、FLOPを24%削減し、スループットを2.7倍改善する。
論文 参考訳(メタデータ) (2024-11-27T01:43:38Z) - Learning Enriched Illuminants for Cross and Single Sensor Color
Constancy [182.4997117953705]
ネットワークをトレーニングするためのクロスセンサ自己教師型トレーニングを提案する。
センサに依存しない方法で人工発光体をランダムにサンプリングすることでネットワークを訓練する。
実験により、我々のクロスセンサモデルとシングルセンサーモデルは、他の最先端手法よりも大きなマージンで優れていることが示された。
論文 参考訳(メタデータ) (2022-03-21T15:45:35Z) - Anchor-free Small-scale Multispectral Pedestrian Detection [88.7497134369344]
適応型単一段アンカーフリーベースアーキテクチャにおける2つのモードの効果的かつ効率的な多重スペクトル融合法を提案する。
我々は,直接的境界ボックス予測ではなく,対象の中心と規模に基づく歩行者表現の学習を目指す。
その結果,小型歩行者の検出における本手法の有効性が示唆された。
論文 参考訳(メタデータ) (2020-08-19T13:13:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。