論文の概要: IT-TextFusion: Iterative Text-Image Interaction with Text-Guided Residual Refinement for Degradation-Aware Image Fusion
- arxiv url: http://arxiv.org/abs/2609.01092v1
- Date: Tue, 01 Sep 2026 11:33:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.606327
- Title: IT-TextFusion: Iterative Text-Image Interaction with Text-Guided Residual Refinement for Degradation-Aware Image Fusion
- Title(参考訳): IT-TextFusion: 劣化を考慮した画像融合のためのテキストガイド残像の反復的テキスト・イメージインタラクション
- Authors: Siyang Liu, Peiyi Zhou, Tianle Jin, Rongrong Bian, Zheke Jin, Mengze Gao,
- Abstract要約: 本稿では,複数の融合・改良段階にまたがるテキスト条件付き特徴相互作用を組み込んだ反復的テキスト誘導画像融合フレームワークを提案する。
提案手法は,最深層クロスアテンション,マルチスケールクロスゲイト・フュージョン,ステージ固有テキスト条件変調を統合した。
いくつかのベンチマークデータセットの実験により,提案手法は情報保存と知覚品質の指標を改善した。
- 参考スコア(独自算出の注目度): 2.0260533411307304
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-guided image fusion has recently emerged as an effective paradigm for integrating multi-modal information while enabling flexible and task-oriented fusion control. However, existing text-guided fusion methods often rely on shallow semantic-visual interaction and limited attention mechanisms, which restrict their ability to robustly handle complex degradations and fully exploit textual guidance. In this paper, we propose an iterative text-guided image fusion framework that incorporates text-conditioned feature interaction across multiple fusion and refinement stages. The proposed method integrates deepest-level Cross-Attention, multi-scale Cross-Gate Fusion, and stage-specific text-conditioned modulation, allowing the global text embedding to condition hierarchical feature fusion and residual refinement. By repeatedly injecting the pooled text embedding across hierarchical decoder and refinement stages, the proposed framework provides degradation-aware global semantic conditioning while preserving complementary information from the visible and infrared modalities. Experiments on several benchmark datasets show that the proposed method improves several information-preservation and perceptual-quality metrics, while exhibiting metric-dependent trade-offs on some datasets.
- Abstract(参考訳): テキスト誘導画像融合は、フレキシブルかつタスク指向の融合制御を実現しつつ、マルチモーダル情報を統合するための効果的なパラダイムとして最近登場した。
しかし、既存のテキスト誘導融合法は、しばしば浅いセマンティック・視覚相互作用と限られた注意機構に依存し、複雑な劣化を頑健に処理し、テキストガイダンスを完全に活用する能力を制限する。
本稿では,複数の融合および改良段階にわたるテキスト条件付き特徴相互作用を組み込んだ反復的テキスト誘導画像融合フレームワークを提案する。
提案手法は,最深層クロスアテンション,マルチスケールクロスゲートフュージョン,ステージ固有のテキスト条件変調を統合し,大域的なテキストを条件階層的特徴融合と残像化に埋め込む。
階層型デコーダと改良段階にまたがるプールドテキストを繰り返し注入することにより,可視・赤外モードからの相補的情報を保存しつつ,劣化を意識したグローバルなセマンティックコンディショニングを実現する。
いくつかのベンチマークデータセットの実験では、提案手法はいくつかの情報保存と知覚品質の指標を改善しつつ、いくつかのデータセットにメートル法に依存したトレードオフを示す。
関連論文リスト
- Unleashing the Power of Text: Text-Guided Flow Matching for Image Fusion under Complex Degradations [50.60539317126614]
現実的な劣化シナリオ下での赤外線可視画像融合は難しい課題である。
最近の研究は、テキストが劣化特性に関する事前情報を提供できることを示している。
テキスト誘導型潜在空間フローマッチングフレームワークであるTGFusionを提案する。
論文 参考訳(メタデータ) (2026-08-01T08:43:26Z) - Text-Driven Fusion for Infrared and Visible Images: Achieving Image Scene Adaptation on Hyperbolic Space [63.220767051340005]
赤外線と可視画像の融合は相補的なモダリティを統合することを目的としている。
双曲的多様体学習によるテキスト駆動型融合フレームワークを提案する。
実験の結果,提案手法はベンチマークデータセットの最先端手法よりも優れていた。
論文 参考訳(メタデータ) (2026-06-13T04:33:33Z) - Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach [99.80480649258557]
DiTFuseは命令駆動のフレームワークで、単一のモデル内でセマンティクスを意識した融合を実行する。
パブリックなIVIF、MFF、MEFベンチマークの実験では、より優れた量的および質的な性能、よりシャープなテクスチャ、より優れたセマンティック保持が確認されている。
論文 参考訳(メタデータ) (2025-12-08T05:04:54Z) - TeSG: Textual Semantic Guidance for Infrared and Visible Image Fusion [55.34830989105704]
Infrared and visible image fusion (IVF) は、画像モダリティの相補的な情報を組み合わせることを目的としている。
テキスト意味論は,マスクの意味レベルとテキスト意味レベルという2つのレベルで導入する。
画像合成プロセスのガイドとなる赤外線・可視画像融合のためのテクスチュアル・セマンティック・ガイダンスを提案する。
論文 参考訳(メタデータ) (2025-06-20T03:53:07Z) - Text-DiFuse: An Interactive Multi-Modal Image Fusion Framework based on Text-modulated Diffusion Model [30.739879255847946]
既存のマルチモーダル画像融合法では、ソース画像に示される複合劣化に対処できない。
本研究では,テキスト変調拡散モデルであるText-DiFuseに基づく,インタラクティブなマルチモーダル画像融合フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-31T13:10:50Z) - Text-IF: Leveraging Semantic Text Guidance for Degradation-Aware and Interactive Image Fusion [26.809259323430368]
そこで本研究では,テキストIF(Text-IF)と呼ばれる画像融合タスクにおいて,意味的テキスト誘導画像融合モデルを活用する新しい手法を提案する。
テキストIFは、オールインワンの赤外線および可視画像劣化認識処理およびインタラクティブなフレキシブル融合結果にアクセスできる。
このように、Text-IFはマルチモーダル画像融合だけでなく、マルチモーダル情報融合も実現している。
論文 参考訳(メタデータ) (2024-03-25T03:06:45Z) - From Text to Pixels: A Context-Aware Semantic Synergy Solution for
Infrared and Visible Image Fusion [66.33467192279514]
我々は、テキスト記述から高レベルなセマンティクスを活用し、赤外線と可視画像のセマンティクスを統合するテキスト誘導多モード画像融合法を提案する。
本手法は,視覚的に優れた融合結果を生成するだけでなく,既存の手法よりも高い検出mAPを達成し,最先端の結果を得る。
論文 参考訳(メタデータ) (2023-12-31T08:13:47Z) - TextFusion: Unveiling the Power of Textual Semantics for Controllable
Image Fusion [38.61215361212626]
本稿では,高度な画像融合のためのテキスト誘導融合パラダイムを提案する。
テキスト注釈付き画像融合データセットIVTをリリースする。
我々のアプローチは、従来の外見に基づく融合法よりも一貫して優れています。
論文 参考訳(メタデータ) (2023-12-21T09:25:10Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。