論文の概要: LALE: Lightweight-Transformer Architecture for Land-Cover Estimation
- arxiv url: http://arxiv.org/abs/2606.02092v1
- Date: Mon, 01 Jun 2026 11:18:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:31.88399
- Title: LALE: Lightweight-Transformer Architecture for Land-Cover Estimation
- Title(参考訳): LALE:土地被覆推定のための軽量変圧器アーキテクチャ
- Authors: Ümit Mert Çağlar, Alptekin Temizel,
- Abstract要約: 本稿では,エンド・ツー・エンドのリモートセンシング画像セグメンテーションアーキテクチャであるLALEについて述べる。
大規模なARAS400kリモートセンシングセグメンテーションベンチマークでは、LALEはCNN、トランスフォーマー、ハイブリッドベースラインに対して強力な効率とパフォーマンスのトレードオフを確立する。
我々の最小の変種(たった1.6Mパラメータ)は、最高のベースライン(UPerNet)の2.6F1ポイント以内まで到達し、4.5倍のパラメータ、7倍のストレージ、17倍のGMAC、1.8倍のスループットを提供する。
- 参考スコア(独自算出の注目度): 4.554894288663752
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Semantic segmentation of remote sensing imagery requires models that capture both global context and local detail under tight computational budgets. Prior work typically optimizes for one of these axes: attention for global context, convolution for local detail, or compactness for efficiency. While hybrid approaches aim to capture both, they require architectural changes and encoder backbones with computational overhead, limiting efficiency and performance. We present LALE (Lightweight-transformer Architecture for Land-cover Estimation), an end-to-end remote sensing image segmentation architecture, that bifurcates its encoder by resolution: lightweight ConvMixer stages handle high-resolution local features, while transformer stages handle low-resolution global context, confining the quadratic cost of self-attention to deep, downsampled feature maps. An all-MLP multi-scale decoder, together with RMSNorm and StarReLU throughout, further reduces compute and parameter count. On the large-scale ARAS400k remote-sensing segmentation benchmark, LALE establishes a strong efficiency-performance trade-off against CNN, transformer, and hybrid baselines. Our smallest variant, (just 1.6M parameters), reaches within 2.6 F1 points of the best baseline (UPerNet) while using 4.5x fewer parameters, 7x less storage, 17x fewer GMACs, and delivering 1.8x higher throughput.
- Abstract(参考訳): リモートセンシング画像のセマンティックセグメンテーションは、厳密な計算予算の下で、グローバルコンテキストとローカルディテールの両方をキャプチャするモデルを必要とする。
これまでの作業は、グローバルコンテキストの注意、局所的な詳細の畳み込み、効率のコンパクトさといった、これらの軸の1つを最適化するのが一般的だった。
ハイブリッドアプローチは両方をキャプチャすることを目指しているが、アーキテクチャの変更と計算オーバーヘッドを伴うエンコーダのバックボーンを必要とするため、効率とパフォーマンスが制限される。
本稿では,エンド・ツー・エンドのリモートセンシング画像セグメンテーションアーキテクチャであるLALE(Lightweight-transformer Architecture for Land-cover Estimation)を提案する。
オールMLPマルチスケールデコーダは、RMSNormとStarReLUと共に、計算量とパラメータ数をさらに削減する。
大規模なARAS400kリモートセンシングセグメンテーションベンチマークでは、LALEはCNN、トランスフォーマー、ハイブリッドベースラインに対して強力な効率とパフォーマンスのトレードオフを確立する。
我々の最小の変種(たった1.6Mパラメータ)は、最高のベースライン(UPerNet)の2.6F1ポイント以内まで到達し、4.5倍のパラメータ、7倍のストレージ、17倍のGMAC、1.8倍のスループットを提供する。
関連論文リスト
- Scale-DiT: Ultra-High-Resolution Image Generation with Hierarchical Local Attention [50.391914489898774]
Scale-DiTは、階層的な局所的注意を低解像度のグローバルガイダンスで導入する新しい拡散フレームワークである。
軽量なLoRA適応は、デノナイズ中のグローバルパスとローカルパスをブリッジし、構造と詳細の整合性を確保する。
実験によると、Scale-DiTは2ドル以上の高速な推論とメモリ使用量の削減を実現している。
論文 参考訳(メタデータ) (2025-10-18T03:15:26Z) - A Global-Local Cross-Attention Network for Ultra-high Resolution Remote Sensing Image Semantic Segmentation [1.833928124984226]
GLCANetはUHRリモートセンシングのための軽量セグメンテーションフレームワークである。
セルフアテンションメカニズムは、長距離依存関係を強化し、グローバル機能を強化し、セマンティック一貫性を改善するためにローカル詳細を保存する。
マスク付きクロスアテンション機構は、グローバルローカルな特徴を適応的に融合させ、グローバルコンテキストを活用しながら細かな詳細を選択的に強化し、セグメンテーション精度を向上させる。
論文 参考訳(メタデータ) (2025-06-24T08:20:08Z) - FullTransNet: Full Transformer with Local-Global Attention for Video Summarization [16.134118247239527]
本稿では,ビデオ要約のためのFullTransNetというトランスフォーマー型アーキテクチャを提案する。
ビデオ要約の代替アーキテクチャとしてエンコーダ・デコーダ構造を持つフルトランスフォーマーを使用する。
本モデルでは, Fスコアが54.4%, 63.9%であり, 比較的低い計算量とメモリ要件を維持している。
論文 参考訳(メタデータ) (2025-01-01T16:07:27Z) - MSDNet: Multi-Scale Decoder for Few-Shot Semantic Segmentation via Transformer-Guided Prototyping [1.1852406625172218]
少数のアノテーション付きの例だけで、クエリイメージ内のオブジェクトをセグメント化するという課題に、Semanticは対処している。
本稿では,Transformerアーキテクチャに基づく新しいFew-shot Semanticフレームワークを提案する。
論文 参考訳(メタデータ) (2024-09-17T16:14:03Z) - Progressive Token Length Scaling in Transformer Encoders for Efficient Universal Segmentation [67.85309547416155]
ユニバーサルセグメンテーションのための強力なアーキテクチャは、マルチスケールの画像特徴を符号化し、オブジェクトクエリをマスク予測にデコードするトランスフォーマーに依存している。
このようなモデルのスケーリングには効率性が優先されるため、最先端のMask2Formerでは、変換器エンコーダのみに計算の50%を使用しています。
これは、エンコーダ層ごとにすべてのバックボーン機能スケールのトークンレベルの完全な表現が保持されているためである。
論文 参考訳(メタデータ) (2024-04-23T01:34:20Z) - Low-Resolution Self-Attention for Semantic Segmentation [93.30597515880079]
我々は,グローバルコンテキストを計算コストの大幅な削減で捉えるために,低解像度自己認識(LRSA)機構を導入する。
我々のアプローチは、入力画像の解像度に関わらず、固定された低解像度空間における自己注意を計算することである。
本稿では,エンコーダ・デコーダ構造を持つビジョントランスであるLRFormerを構築することで,LRSA手法の有効性を示す。
論文 参考訳(メタデータ) (2023-10-08T06:10:09Z) - Head-Free Lightweight Semantic Segmentation with Linear Transformer [21.38163906180886]
本稿では,適応周波数変換器(Adaptive Frequency Transformer)というセマンティックセグメンテーションのためのヘッドフリー軽量アーキテクチャを提案する。
並列アーキテクチャを採用して、デコーダを置き換える特定の学習可能なローカル記述としてプロトタイプ表現を活用する。
デコーダの除去は計算の大部分を圧縮するが、並列構造の精度は依然として低い計算資源によって制限されている。
論文 参考訳(メタデータ) (2023-01-11T18:59:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。