論文の概要: A3-FPN: Asymptotic Content-Aware Pyramid Attention Network for Dense Visual Prediction
- arxiv url: http://arxiv.org/abs/2604.10210v1
- Date: Sat, 11 Apr 2026 13:38:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:15.904355
- Title: A3-FPN: Asymptotic Content-Aware Pyramid Attention Network for Dense Visual Prediction
- Title(参考訳): A3-FPN:高密度視覚予測のための漸近コンテンツ対応ピラミッド注意ネットワーク
- Authors: Meng'en Qin, Yu Song, Quanling Zhao, Xiaodong Yang, Yingtao Che, Xiaohui Yang,
- Abstract要約: A3-FPN (Asymptotic Content-Aware Pyramid Attention Network) を提案する。
A3-FPNはCOCOally Disentangledフレームワークとコンテンツ対応アテンションモジュールを通じて、マルチスケールの機能表現を強化している。
MS、VisDrone 2019-DET、Cityscapesの実験では、A3-FPNが最先端のCNNとTransformerベースのアーキテクチャに簡単に統合できることが示されている。
- 参考スコア(独自算出の注目度): 10.265032938091514
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Learning multi-scale representations is the common strategy to tackle object scale variation in dense prediction tasks. Although existing feature pyramid networks have greatly advanced visual recognition, inherent design defects inhibit them from capturing discriminative features and recognizing small objects. In this work, we propose Asymptotic Content-Aware Pyramid Attention Network (A3-FPN), to augment multi-scale feature representation via the asymptotically disentangled framework and content-aware attention modules. Specifically, A3-FPN employs a horizontally-spread column network that enables asymptotically global feature interaction and disentangles each level from all hierarchical representations. In feature fusion, it collects supplementary content from the adjacent level to generate position-wise offsets and weights for context-aware resampling, and learns deep context reweights to improve intra-category similarity. In feature reassembly, it further strengthens intra-scale discriminative feature learning and reassembles redundant features based on information content and spatial variation of feature maps. Extensive experiments on MS COCO, VisDrone2019-DET and Cityscapes demonstrate that A3-FPN can be easily integrated into state-of-the-art CNN and Transformer-based architectures, yielding remarkable performance gains. Notably, when paired with OneFormer and Swin-L backbone, A3-FPN achieves 49.6 mask AP on MS COCO and 85.6 mIoU on Cityscapes. Codes are available at https://github.com/mason-ching/A3-FPN.
- Abstract(参考訳): マルチスケール表現の学習は、高密度予測タスクにおけるオブジェクトスケールの変動に対処するための一般的な戦略である。
既存の特徴ピラミッドネットワークは、非常に高度な視覚認識を持っているが、固有の設計上の欠陥は、識別的特徴を捉え、小さな物体を認識することを妨げている。
本研究では、漸近的非絡み合いフレームワークとコンテンツ対応アテンションモジュールによるマルチスケール特徴表現を強化するために、A3-FPN(Asymptotic Content-Aware Pyramid Attention Network)を提案する。
具体的には、A3-FPNは水平方向のカラムネットワークを用いて、漸近的にグローバルな特徴相互作用を可能にし、すべての階層表現から各レベルをアンタングルする。
特徴融合では、隣接するレベルから補足的コンテンツを収集し、コンテキスト認識再サンプリングのための位置対応オフセットと重みを生成し、深いコンテキストリウェイトを学び、カテゴリ内の類似性を改善する。
機能再組換えでは、大規模識別的特徴学習をさらに強化し、情報内容と特徴マップの空間的変動に基づいて冗長な特徴を再組立てる。
MS COCO、VisDrone2019-DET、Cityscapesの大規模な実験は、A3-FPNが最先端のCNNやTransformerベースのアーキテクチャに容易に統合できることを示し、パフォーマンスが著しく向上した。
特にOneFormerとSwin-Lのバックボーンと組み合わせると、A3-FPNはMS COCOで49.6マスクAP、Cityscapesで85.6mIoUを達成した。
コードはhttps://github.com/mason-ching/A3-FPN.comで入手できる。
関連論文リスト
- PVAFN: Point-Voxel Attention Fusion Network with Multi-Pooling Enhancing for 3D Object Detection [59.355022416218624]
点とボクセルの表現の統合は、LiDARベースの3Dオブジェクト検出においてより一般的になりつつある。
PVAFN(Point-Voxel Attention Fusion Network)と呼ばれる新しい2段3次元物体検出器を提案する。
PVAFNはマルチプール戦略を使用して、マルチスケールとリージョン固有の情報を効果的に統合する。
論文 参考訳(メタデータ) (2024-08-26T19:43:01Z) - Augmenting Convolutional networks with attention-based aggregation [55.97184767391253]
我々は,非局所的推論を実現するために,注目に基づくグローバルマップを用いた畳み込みネットワークの強化方法を示す。
この学習集約層を2つのパラメータ(幅と深さ)でパラメータ化した単純パッチベースの畳み込みネットワークで接続する。
これは、特にメモリ消費の点で、精度と複雑さの間の驚くほど競争力のあるトレードオフをもたらす。
論文 参考訳(メタデータ) (2021-12-27T14:05:41Z) - Learning to Aggregate Multi-Scale Context for Instance Segmentation in
Remote Sensing Images [28.560068780733342]
特徴抽出のプロセスを改善するために,新しいコンテキスト集約ネットワーク(CATNet)を提案する。
提案モデルは,高密度特徴ピラミッドネットワーク(DenseFPN),空間コンテキストピラミッド(SCP),階層的関心抽出器(HRoIE)の3つの軽量プラグアンドプレイモジュールを利用する。
論文 参考訳(メタデータ) (2021-11-22T08:55:25Z) - Conformer: Local Features Coupling Global Representations for Visual
Recognition [72.9550481476101]
本稿では,畳み込み操作と自己アテンション機構を利用した表現学習のためのハイブリッドネットワーク構造,conformerを提案する。
実験では、コンフォーマーが同等のパラメータ複雑性の下で視覚変換器(DeiT-B)を2.3%上回ることが示されている。
論文 参考訳(メタデータ) (2021-05-09T10:00:03Z) - A^2-FPN: Attention Aggregation based Feature Pyramid Network for
Instance Segmentation [68.10621089649486]
アテンションアグリゲーションに基づく機能ピラミッドネットワーク(A2-FPN)を提案し、マルチスケール機能学習を改善します。
A2-FPNは、Cascade Mask R-CNNやHybrid Task Cascadeといった強力なベースラインに統合された場合、2.0%と1.4%のマスクAPを改善する。
論文 参考訳(メタデータ) (2021-05-07T11:51:08Z) - CARAFE++: Unified Content-Aware ReAssembly of FEatures [132.49582482421246]
この目標を達成するために、ユニバーサルで軽量で高効率なオペレータであるContent-Aware ReAssembly of FEatures(CARAFE++)を提案します。
CARAFE++は、インスタンス固有のコンテンツ認識処理を可能にするアダプティブカーネルをオンザフライで生成する。
計算のオーバーヘッドが無視できるすべてのタスクにおいて、一貫性と実質的な利益を示しています。
論文 参考訳(メタデータ) (2020-12-07T07:34:57Z) - Weakly Supervised Attention Pyramid Convolutional Neural Network for
Fine-Grained Visual Classification [71.96618723152487]
注意ピラミッド畳み込みニューラルネットワーク(AP-CNN)について紹介する。
AP-CNNは高レベルのセマンティックと低レベルの詳細な特徴表現の両方を学ぶ。
追加のバウンディングボックス/パートアノテーションを必要とせずに、エンドツーエンドでトレーニングすることができる。
論文 参考訳(メタデータ) (2020-02-09T12:33:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。