論文の概要: LBTCap: A Lightweight Bilateral Transformer for Real-Time Remote Sensing Image Change Captioning
- arxiv url: http://arxiv.org/abs/2607.03320v1
- Date: Fri, 03 Jul 2026 13:38:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.588272
- Title: LBTCap: A Lightweight Bilateral Transformer for Real-Time Remote Sensing Image Change Captioning
- Title(参考訳): LBTCap:リアルタイムリモートセンシング画像変換用軽量バイラテラルトランス
- Authors: Licheng Zhang, Siew-Kei Lam, Naveed Akhtar,
- Abstract要約: リモートセンシング画像変化キャプション(RSICC)は、ペア化されたリモートセンシング画像(RSI)間の意味的変化の記述を生成する
LBTCapは、双方向トランスフォーマー上に構築された軽量RSICCフレームワークで、ペアリングされたRSIの効率的な処理のために、事前および変更後の機能を共同でモデル化する。
LBTCapは、パラメータをはるかに少なくし、推論速度を著しく高くしながら、最先端の手法の精度と一致または緊密に接近していることを示す実験である。
- 参考スコア(独自算出の注目度): 44.00535468968033
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Remote sensing image change captioning (RSICC) generates natural-language descriptions of semantic changes between paired remote sensing images (RSIs), supporting applications such as urban planning, disaster response, and environmental monitoring. Although recent methods achieve strong captioning accuracy, most overlook computational efficiency and inference speed, which are essential for real-time deployment in practice. To this end, we propose LBTCap, a lightweight RSICC framework built on a bilateral Transformer that jointly models pre- and post-change features for efficient processing of paired RSIs. Specifically, we introduce a bilateral attention mechanism for paired inputs: the two temporal images are projected into separate queries and keys by the same query and key matrices shared across the two images, the value is formed from their concatenation, and the two resulting attention maps are combined by a learnable, structurally bilateral weighting instead of a fixed subtraction. This design keeps both temporal branches explicit while remaining compact, and, together with a truncated backbone and grouped-query attention, LBTCap uses only 39.99M parameters, of which the change-aware encoder accounts for just 2.78M. Extensive experiments on two public RSICC datasets show that LBTCap matches or closely approaches the accuracy of state-of-the-art methods while using far fewer parameters and running at markedly higher inference speed, with the benefit of the bilateral formulation most pronounced in the low-resource setting, demonstrating a favorable accuracy-efficiency trade-off for practical RSICC.
- Abstract(参考訳): リモートセンシング画像のキャプション(RSICC)は、ペア化されたリモートセンシング画像(RSI)間のセマンティックな変化を自然言語で記述し、都市計画、災害対応、環境モニタリングなどの応用を支援する。
近年の手法では高いキャプション精度が達成されているが,ほとんどの場合,実時間展開に欠かせない計算効率と推論速度を見落としている。
この目的のために,両用トランスフォーマ上に構築された軽量RSICCフレームワークであるLBTCapを提案する。
具体的には、2つの時間的画像は、同じクエリと2つの画像間で共有されるキー行列によって、別々のクエリとキーに投影され、その値はその結合から形成され、得られた2つの注意マップは、固定サブトラクションではなく、学習可能で構造的に2つの重み付けによって結合される。
この設計は、コンパクトなまま、両方の時間枝を明示的に保ち、切り離されたバックボーンとグループ化されたクエリーアテンションと共に、LBTCapは39.99Mパラメータしか使用せず、変更を意識したエンコーダはわずか2.78Mである。
2つの公開RSICCデータセットに対する大規模な実験により、LBTCapは、非常に少ないパラメータを使用しながら、非常に高い推論速度で実行しながら、最先端の手法の精度と一致または密接なアプローチを示し、低リソース環境で最も顕著な2値の定式化の恩恵を受け、実用的なRSICCにとって好ましい精度効率のトレードオフを示す。
関連論文リスト
- DUET -- Dual User Embedding Transformers for Offsite Conversion Prediction [8.972672149050627]
計算レコメンデーションシステムにおいて,オフサイト変換率(OCVR)予測は重要なランキング問題である。
このタスクは、クリック信号が豊富で、短い時間的水平線を示すのに対して、変換信号は本質的に疎く、長い遅延があり、しばしば未配布である。
ユーザ行動データを2つのドメインコヒーレントなストリーム – クリックと変換 – に明示的に分割するフレームワークであるDUETを提案する。
論文 参考訳(メタデータ) (2026-06-08T23:13:58Z) - How Modality Shapes Perception and Reasoning: A Study of Error Propagation in ARC-AGI [7.226300346775942]
ARC-AGIとARC-AGI-2は、小さな色量子格子上の一般化スルー合成を測定する。
最近の命令ファーストシステムは、グリッドを生成-実行-選択ループで実行される簡潔な自然言語またはDSLルールに変換する。
論文 参考訳(メタデータ) (2025-11-11T19:06:41Z) - Bidirectional Feature-aligned Motion Transformation for Efficient Dynamic Point Cloud Compression [97.66080040613726]
特徴空間における動きを暗黙的にモデル化する双方向特徴整合運動変換(Bi-FMT)フレームワークを提案する。
Bi-FMTは、時間的に一貫した潜在表現を生成するために、過去と将来の両方のフレームで機能を調整する。
圧縮効率とランタイムの両方において, Bi-FMT が D-DPCC と AdaDPCC を上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-18T03:51:06Z) - Representation Discrepancy Bridging Method for Remote Sensing Image-Text Retrieval [15.503629941274621]
本研究では,Representation Discrepancy Bridging (RDB) 法を提案し,Remote Image-Text Retrieval (RSITR) タスクを提案する。
RSICDとRSITMDデータセットの実験により、提案手法はmR測定値の6%-11%の改善を達成している。
論文 参考訳(メタデータ) (2025-05-22T14:59:30Z) - FUSE: Label-Free Image-Event Joint Monocular Depth Estimation via Frequency-Decoupled Alignment and Degradation-Robust Fusion [92.4205087439928]
画像強調共同深度推定法は、頑健な知覚に相補的なモダリティを利用するが、一般化可能性の課題に直面している。
自己監督型転送(PST)と周波数デカップリング型フュージョンモジュール(FreDF)を提案する。
PSTは、画像基盤モデルとの遅延空間アライメントによるクロスモーダルな知識伝達を確立し、データ不足を効果的に軽減する。
FreDFは、低周波構造成分から高周波エッジ特性を明示的に分離し、モード比周波数ミスマッチを解消する。
この組み合わせのアプローチにより、FUSEはターゲットデータセットに対する軽量デコーダ適応のみを必要とするユニバーサルなイメージイベントを構築することができる。
論文 参考訳(メタデータ) (2025-03-25T15:04:53Z) - A Lightweight Sparse Focus Transformer for Remote Sensing Image Change Captioning [11.93705794906543]
本稿では、リモートセンシング画像変更キャプション(RSICC)タスクのためのスパースフォーカス変換器(SFT)を提案する。
提案するSFTネットワークは,スパースアテンション機構を組み込むことで,パラメータ数と計算複雑性を低減できる。
論文 参考訳(メタデータ) (2024-05-10T16:56:53Z) - ResiDualGAN: Resize-Residual DualGAN for Cross-Domain Remote Sensing
Images Semantic Segmentation [15.177834801688979]
アノテーション付きデータセットで事前訓練されたリモートセンシング(RS)画像のセマンティックセグメンテーションモデルの性能は、ドメインギャップのため、他のアノテーションなしデータセットでテストすると大幅に低下する。
画素レベルのドメインギャップを最小限に抑えるために、DualGANなどの逆生成法が未ペア画像から画像への変換に利用される。
本稿では,RS画像の変換においてResiDualGANを提案する。
論文 参考訳(メタデータ) (2022-01-27T13:56:54Z) - CSformer: Bridging Convolution and Transformer for Compressive Sensing [65.22377493627687]
本稿では,CNNからの詳細な空間情報を活用するためのハイブリッドフレームワークと,表現学習の強化を目的としたトランスフォーマーが提供するグローバルコンテキストを統合することを提案する。
提案手法は、適応的なサンプリングとリカバリからなるエンドツーエンドの圧縮画像センシング手法である。
実験により, 圧縮センシングにおける専用トランスアーキテクチャの有効性が示された。
論文 参考訳(メタデータ) (2021-12-31T04:37:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。