論文の概要: Cross-Stage Attention Propagation for Efficient Semantic Segmentation
- arxiv url: http://arxiv.org/abs/2604.05431v1
- Date: Tue, 07 Apr 2026 04:55:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.632378
- Title: Cross-Stage Attention Propagation for Efficient Semantic Segmentation
- Title(参考訳): 効率的なセマンティックセグメンテーションのためのクロスステージアテンションプロパゲーション
- Authors: Beoungwoo Kang,
- Abstract要約: 本稿では,最も深い特徴尺度で注意を計算し,その結果の注目マップをより浅いステージに伝播するデコーダフレームワークを提案する。
CSAPはADE20Kで42.9% mIoUを5.5 GFLOPsで80.5%、COCO-Stuff 164Kで5.5 GFLOPsで40.9%、ADE20KでSegNeXt-Tinyを1.8%上回り、16.8%の浮動小数点演算を必要とする。
- 参考スコア(独自算出の注目度): 0.8460698440162889
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent lightweight semantic segmentation methods have made significant progress by combining compact backbones with efficient decoder heads. However, most multi-scale decoders compute attention independently at each feature scale, introducing substantial redundancy since the resulting attention distributions across scales are strongly correlated. We propose Cross-Stage Attention Propagation (CSAP), a decoder framework that computes attention at the deepest feature scale and propagates the resulting attention maps to shallower stages, bypassing query-key computation at those stages entirely. This design preserves multi-scale contextual reasoning while substantially reducing the decoder's computational cost. CSAP-Tiny achieves 42.9% mIoU on ADE20K with only 5.5 GFLOPs, 80.5% on Cityscapes with 21.5 GFLOPs, and 40.9% on COCO-Stuff 164K with 5.5 GFLOPs, surpassing SegNeXt-Tiny by +1.8% on ADE20K while requiring 16.8% fewer floating-point operations.
- Abstract(参考訳): 最近の軽量なセマンティックセグメンテーション法は、コンパクトなバックボーンと効率的なデコーダヘッドを組み合わせることで大きな進歩を遂げている。
しかし、ほとんどのマルチスケールデコーダは、各特徴尺度で独立して注意を計算し、その結果の注意分布が強く相関しているため、かなりの冗長性をもたらす。
提案するCSAP(Cross-Stage Attention Propagation)は,最も深い特徴尺度で注意を計算し,その結果の注目マップをより浅いステージに伝播するデコーダフレームワークである。
この設計は、デコーダの計算コストを大幅に削減しつつ、マルチスケールのコンテキスト推論を保存する。
CSAP-TinyはADE20Kで42.9% mIoUを5.5 GFLOPsで、Cityscapesで80.5%、21.5 GFLOPsで40.9%、COCO-Stuff 164Kで5.5 GFLOPsでSegNeXt-Tinyを1.8%上回り、16.8%の浮動小数点演算を必要とする。
関連論文リスト
- GLANCE: Gaze-Led Attention Network for Compressed Edge-inference [10.229095428511654]
AR/VRシステムにおけるリアルタイムオブジェクト検出は、厳格な電力予算内で10ms未満のレイテンシを必要とする、計算上の重要な制約に直面している。
生体の葉の視覚にインスパイアされた2段階のパイプラインを提案する。このパイプラインは、異なる重みのないニューラルネットワークを組み合わせ、超効率的な視線推定と、注意誘導された関心の領域検出を行う。
論文 参考訳(メタデータ) (2026-03-16T15:52:52Z) - MicroBi-ConvLSTM: An Ultra-Lightweight Efficient Model for Human Activity Recognition on Resource Constrained Devices [0.0]
リソース制約のあるウェアラブル上でのヒューマンアクティビティ認識(HAR)は、厳格なメモリと計算予算との精度のバランスをとるモデルを必要とする。
提案するMicroBi-ConvLSTMは, 平均11.4Kのパラメータを達成できる超軽量畳み込み並列アーキテクチャである。
論文 参考訳(メタデータ) (2026-02-06T09:26:29Z) - Learnable Conformal Prediction with Context-Aware Nonconformity Functions for Robotic Planning and Perception [4.694504497452662]
Learnable Conformal Predictionは、固定スコアを軽量なニューラル関数に置き換えて、コンテキスト認識の不確実性セットを生成する。
CPの理論的保証を維持しつつ、予測セットのサイズを18%減らし、検出間隔を52%減らし、経路計画の安全性を72%から91%に改善し、オーバーヘッドを最小限に抑えている。
ハードウェア評価では、LCPは1%未満のメモリと15.9%の推論オーバーヘッドを追加したが、検出タスクでは39 FPSを維持し、アンサンブルの7.4倍のエネルギー効率を保っている。
論文 参考訳(メタデータ) (2025-09-26T06:44:58Z) - Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions [0.0]
視覚変換器(ViT)はセマンティックセグメンテーションにおいて最先端のパフォーマンスを達成するが、高い計算とメモリコストによって妨げられる。
本稿では,動的パッチマージとトークンプルーニングを組み合わせたハイブリッドトークン還元フレームワークSTEPを提案する。
論文 参考訳(メタデータ) (2025-09-17T16:48:00Z) - ParallelComp: Parallel Long-Context Compressor for Length Extrapolation [51.68913021512016]
超長い文脈(テキスト長 >128K)の補間は、大きな言語モデル(LLM)にとって大きな課題である。
本研究では,メモリボトルネックを効果的に克服する並列長コンテキスト圧縮手法であるParallelCompを提案する。
チャンクスループットが1.76倍向上し、プリフィル段階では23.50倍の高速化を実現し、性能損失を無視できる。
論文 参考訳(メタデータ) (2025-02-20T07:10:43Z) - Collaborative Decoding Makes Visual Auto-Regressive Modeling Efficient [52.96232442322824]
CoDe(Collaborative Decoding)は、Visual Auto-Regressive (VAR)フレームワーク用に設計された、新しい効率的なデコーディング戦略である。
CoDeは、大規模でのパラメータ要求の大幅な削減と、異なるスケールでの排他的生成パターンという、2つの重要な観察に乗じている。
CoDeは1.7倍のスピードアップを実現し、メモリ使用量を約50%削減し、画像品質を1.95から1.98に改善した。
論文 参考訳(メタデータ) (2024-11-26T15:13:15Z) - Breaking the Memory Barrier: Near Infinite Batch Size Scaling for Contrastive Loss [59.835032408496545]
本稿では, コントラスト損失計算を任意の小ブロックに分割するタイルベースの戦略を提案する。
分散システムの階層構造を活用するためのマルチレベルタイリング戦略も導入する。
SOTAメモリ効率のソリューションと比較すると、同等の速度を維持しながら、メモリの2桁の削減を実現している。
論文 参考訳(メタデータ) (2024-10-22T17:59:30Z) - Guided Attention for Interpretable Motion Captioning [0.0]
本稿では,解釈可能性を重視してテキスト生成品質を向上させる新しいアーキテクチャを提案する。
そこで本研究では,人間ライクな推論を促すために,トレーニング中の注意を導く方法を提案する。
我々は解釈可能性を活用して人間の動きに関するきめ細かい情報を導き出す。
論文 参考訳(メタデータ) (2023-10-11T09:14:30Z) - Quantized Neural Networks for Low-Precision Accumulation with Guaranteed
Overflow Avoidance [68.8204255655161]
本稿では,推定時のアキュムレータの精度を下げる際に,数値オーバーフローを回避する量子化学習アルゴリズムを提案する。
本手法は,浮動小数点点ベースラインに対するモデル精度を維持しつつ,アキュムレータの精度を低減できることを示す。
論文 参考訳(メタデータ) (2023-01-31T02:46:57Z) - Revisiting Multi-Scale Feature Fusion for Semantic Segmentation [90.32746095413447]
本稿では,高精度なセマンティックセグメンテーションには高い内部分解能もアトラス畳み込みも不要であることを示す。
我々は,内部分解能が高く,高コストなアトラス畳み込みをもたない,ESegと呼ばれる簡易なセグメンテーションモデルを開発した。
我々の単純な手法は、複数のデータセットにまたがる先行技術よりも高速で精度を向上できる。
論文 参考訳(メタデータ) (2022-03-23T19:14:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。