論文の概要: Text2Thermal: Physics-Aware Thermal Image Synthesis from Textual Priors
- arxiv url: http://arxiv.org/abs/2609.03585v2
- Date: Tue, 08 Sep 2026 05:57:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.882446
- Title: Text2Thermal: Physics-Aware Thermal Image Synthesis from Textual Priors
- Title(参考訳): Text2Thermal:物理を意識したテクスチュアプライオリティからの熱画像合成
- Authors: Tayeba Qazi, Brejesh Lall, Prerana Mukherjee,
- Abstract要約: Text2Thermalは、物理対応の熱画像合成のためのフレームワークである。
Text2Thermalは、登録されたRGB画像を必要とすることなく、熱画像を合成する。
M3FDとFLIRでは、Text2Thermalは熱画像合成法の中で最先端のFIDを実現する。
- 参考スコア(独自算出の注目度): 7.213400161126316
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Thermal infrared imaging offers reliable perception in darkness and adverse weather, but thermal datasets remain scarce, motivating extensive work on translating abundant RGB images into thermal. Such translation is fundamentally ill-posed as thermal appearance is governed by surface emissivity and object temperature, neither of which is observable in the visible spectrum, so a single RGB image is consistent with many valid thermal outputs. We argue that language offers a natural means of resolving this ambiguity, and propose **Text2Thermal**, a framework for physics-aware thermal image synthesis from textual priors. Rather than inferring the unobservable radiometric factors from RGB, we supply them explicitly through thermally grounded captions encoding material, weather, time-of-day, and heat-emission state, and adapt a pre-trained Stable Diffusion backbone to the thermal domain. Because the radiometric content is determined entirely by the prompt, Text2Thermal synthesizes thermal imagery without requiring a registered RGB image at inference. Where spatial guidance is desired, an optional control signal imparts scene geometry without disturbing the prompt-specified radiometry. On M3FD and FLIR, Text2Thermal achieves state-of-the-art FID among thermal image synthesis methods, and we additionally report results on the FMB dataset, while offering text-level control that translation-based approaches cannot provide.
- Abstract(参考訳): 熱赤外画像は暗闇や悪天候に対する信頼性の高い認識を提供するが、熱データセットは乏しいままであり、豊富なRGB画像を熱に翻訳する広範な研究の動機となっている。
このような変換は基本的に、表面の放射率と物体温度によって制御されるため、可視光スペクトルでは観測できないため、単一のRGB画像は多くの有効な熱出力と一致しない。
我々は,この曖昧さを解消する自然な手段として言語を論じるとともに,物理を意識した熱画像合成フレームワーク*Text2Thermal*を提案する。
RGBから観測不可能な放射能因子を推定する代わりに, 物質, 気象, 日時, 熱放出状態をコードする熱接地キャプションを通じて明確に供給し, 予めトレーニングした安定拡散バックボーンを熱領域に適応させる。
放射量は完全にプロンプトによって決定されるので、Text2Thermalは、推論時に登録されたRGB画像を必要としない熱画像を生成する。
空間誘導が望まれている場合、任意制御信号は、即時特定ラジオメータを乱すことなくシーン形状を付与する。
M3FD と FLIR では、Text2Thermal は、熱画像合成法のうち最先端の FID を実現し、FMB データセットにさらに結果を報告するとともに、翻訳に基づくアプローチでは提供できないテキストレベル制御を提供する。
関連論文リスト
- Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception [45.307537865864994]
視覚言語モデル(VLM)は、RGB画像から主に学習されるため、低照度で失敗することが多い。
トレーニング可能な熱エンコーダとテキスト誘導デュアルアテンション融合モジュールで冷凍したMomo-7Bバックボーンを増強する波長対応VLMであるThermo-VLを提案する。
実験では、熱のみとRGB+熱的推論タスクに強い効果を示し、急速条件付き多スペクトル核融合の価値を強調した。
論文 参考訳(メタデータ) (2026-05-21T01:43:05Z) - Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection [41.947503656624285]
既存のオープンボキャブラリ検出器はRGB画像に焦点を合わせ、熱画像への一般化に失敗した。
熱画像用に調整された第1大言語モデル (LLM) のオープン語彙検出装置であるサーマルデットについて述べる。
論文 参考訳(メタデータ) (2026-05-11T07:41:37Z) - TherA: Thermal-Aware Visual-Language Prompting for Controllable RGB-to-Thermal Infrared Translation [12.591408054941027]
TherAは制御可能なRGB-to-TIR翻訳フレームワークで、シーンレベルでもオブジェクトレベルでも多彩で熱可塑性の画像を生成する。
TherAは最先端の翻訳性能を実現し、ゼロショット翻訳性能が改善された。
論文 参考訳(メタデータ) (2026-02-23T01:56:29Z) - ThermalGen: Style-Disentangled Flow-Based Generative Models for RGB-to-Thermal Image Translation [14.108149959967095]
ペアリングRGBサーマルデータは、視覚-サーマル・フュージョンとクロスモダリティ・タスクに不可欠である。
この課題を克服するため、RGB-to-Thermal (RGB-T)イメージ翻訳が有望なソリューションとして登場した。
本研究では,RGB-T画像変換のための適応型フローベース生成モデルであるHeatherGenを提案する。
論文 参考訳(メタデータ) (2025-09-29T14:55:51Z) - ThermoNeRF: Joint RGB and Thermal Novel View Synthesis for Building Facades using Multimodal Neural Radiance Fields [5.66229031510643]
熱環境の再構築は、建築エネルギー消費の分析や非破壊的なインフラ試験の実行など、様々な用途において大きな可能性を秘めている。
既存の手法は通常、密集したシーン計測を必要とし、しばしばRGBの画像を3次元の幾何学的再構成に頼り、再建後の熱情報を投影する。
本研究では,新しいRGBとシーンの熱像を共同で描画するニューラルラジアンス場に基づく新しいアプローチであるThermoNeRFと,建築ファサードの8つのシーンと日常の8つのシーンからなる2つのRGB+熱画像のデータセットであるThermoScenesを提案する。
論文 参考訳(メタデータ) (2024-03-18T18:10:34Z) - SAR-to-Optical Image Translation via Thermodynamics-inspired Network [68.71771171637677]
本稿では,SAR-to-Optical Image Translation (S2O-TDN) のための熱力学インスピレーションネットワークを提案する。
S2O-TDNは熱力学理論から導かれた明示的な設計原理に従い、説明可能性の利点を享受する。
公的なSEN1-2データセットの実験は、より繊細なテクスチャとより定量的な結果を持つ現在の手法よりも提案されたS2O-TDNの利点を示している。
論文 参考訳(メタデータ) (2023-05-23T09:02:33Z) - Does Thermal Really Always Matter for RGB-T Salient Object Detection? [153.17156598262656]
本稿では,RGB-T有意物体検出(SOD)タスクを解決するために,TNetというネットワークを提案する。
本稿では,画像のグローバル照度を推定するためのグローバル照度推定モジュールを提案する。
一方, 2段階の局所化と相補化モジュールを導入し, 熱的特徴の物体位置化キューと内部整合キューをRGBモダリティに転送する。
論文 参考訳(メタデータ) (2022-10-09T13:50:12Z) - T2V-DDPM: Thermal to Visible Face Translation using Denoising Diffusion
Probabilistic Models [71.94264837503135]
本稿では,熱可視(T2V)画像翻訳のための解法として,DDPM(Denoising Diffusion Probabilistic Model)を提案する。
トレーニング中、モデルは、対応する熱画像から可視像の条件分布を学習する。
複数のデータセットで最先端の結果が得られます。
論文 参考訳(メタデータ) (2022-09-19T07:59:32Z) - Exploring Thermal Images for Object Detection in Underexposure Regions
for Autonomous Driving [67.69430435482127]
アンダーエクスポージャー地域は、安全な自動運転のための周囲の完全な認識を構築するのに不可欠である。
サーマルカメラが利用可能になったことで、他の光学センサーが解釈可能な信号を捉えていない地域を探索するための重要な代替手段となった。
本研究は,可視光画像から熱画像へ学習を伝達するためのスタイル伝達手法を用いたドメイン適応フレームワークを提案する。
論文 参考訳(メタデータ) (2020-06-01T09:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。