Fugu-MT 論文翻訳(概要): ReViT: Enhancing Vision Transformers with Attention Residual Connections for Visual Recognition

論文の概要: ReViT: Enhancing Vision Transformers with Attention Residual Connections for Visual Recognition

arxiv url: http://arxiv.org/abs/2402.11301v1
Date: Sat, 17 Feb 2024 14:44:10 GMT
ステータス: 翻訳完了
システム内更新日: 2024-02-20 21:58:12.519544
Title: ReViT: Enhancing Vision Transformers with Attention Residual Connections for Visual Recognition
Title（参考訳）: ReViT:視覚認識のための注意残差接続型視覚変換器
Authors: Anxhelo Diko, Danilo Avola, Marco Cascio, Luigi Cinque
Abstract要約: 視覚変換器(ViT)自己保持機構は、深い層に特徴的崩壊を特徴とする。本稿では,ViTに基づくアーキテクチャを改良するための新たな注意学習手法を提案する。
参考スコア（独自算出の注目度）: 9.146016080115613
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Vision Transformer (ViT) self-attention mechanism is characterized by feature collapse in deeper layers, resulting in the vanishing of low-level visual features. However, such features can be helpful to accurately represent and identify elements within an image and increase the accuracy and robustness of vision-based recognition systems. Following this rationale, we propose a novel residual attention learning method for improving ViT-based architectures, increasing their visual feature diversity and model robustness. In this way, the proposed network can capture and preserve significant low-level features, providing more details about the elements within the scene being analyzed. The effectiveness and robustness of the presented method are evaluated on five image classification benchmarks, including ImageNet1k, CIFAR10, CIFAR100, Oxford Flowers-102, and Oxford-IIIT Pet, achieving improved performances. Additionally, experiments on the COCO2017 dataset show that the devised approach discovers and incorporates semantic and spatial relationships for object detection and instance segmentation when implemented into spatial-aware transformer models.
Abstract（参考訳）: 視覚変換器 (ViT) の自己保持機構は, 深い層に特徴的崩壊が生じ, 低レベルの視覚的特徴が消失する。しかし、そのような特徴は画像内の要素を正確に表現し識別し、視覚ベースの認識システムの精度と堅牢性を高めるのに役立つ。そこで本研究では,vitベースのアーキテクチャを改良し,視覚的特徴の多様性とモデルロバスト性を高めるための,新しい残余注意学習法を提案する。このようにして、提案するネットワークは、重要な低レベル特徴をキャプチャして保存し、分析対象のシーン内の要素の詳細を提供する。提案手法の有効性とロバスト性は,ImageNet1k, CIFAR10, CIFAR100, Oxford Flowers-102, Oxford-IIIT Petの5つの画像分類ベンチマークで評価され, 性能が向上した。さらに、COCO2017データセットの実験では、空間認識トランスフォーマーモデルに実装された場合、オブジェクト検出とインスタンスセグメンテーションのための意味的および空間的関係を発見し、組み込むことが示されている。

関連論文リスト

Interpretable Vision Transformers in Image Classification via SVDA [5.8833115420537085]
視覚変換器(ViT)は画像分類において最先端のパフォーマンスを達成したが、その注意機構は不透明であり、密集した非構造的な振る舞いを示すことが多い。これまでに提案したSVD-Inspired Attention (SVDA) 機構を ViT アーキテクチャに適用し,解釈性,空間性,スペクトル構造を向上する幾何的に基底化された定式化を導入する。
論文参考訳（メタデータ） (2026-02-11T16:20:32Z)
GCRPNet: Graph-Enhanced Contextual and Regional Perception Network for Salient Object Detection in Optical Remote Sensing Images [68.33481681452675]
本稿では,GCRPNet(Graph-enhanced contextual and Regional Recognition Network)を提案する。これはMambaアーキテクチャの上に構築され、長距離依存関係を同時にキャプチャし、地域的特徴表現を強化する。マルチスケールの畳み込みによって処理される特徴マップに対して適応的なパッチスキャンを行い、リッチなローカル領域情報をキャプチャする。
論文参考訳（メタデータ） (2025-08-14T11:31:43Z)
DGIQA: Depth-guided Feature Attention and Refinement for Generalizable Image Quality Assessment [9.851063768646847]
非参照画像品質評価における長年の課題は、自然歪みを目にしない客観的な一般化の欠如である。我々は,シーンの深度と空間的特徴を構造認識表現に蒸留する,Depth-Guided Cross-attention and refinement 機構を新たに開発した。マルチモーダルアテンションベースプロジェクション関数としてTCBとDepth-CARを実装し,最も有用な特徴を選択する。実験により,提案したDGIQAモデルにより,総合的および真正なベンチマークデータセット上での最先端(SOTA)性能が得られた。
論文参考訳（メタデータ） (2025-05-29T20:52:56Z)
FE-UNet: Frequency Domain Enhanced U-Net with Segment Anything Capability for Versatile Image Segmentation [50.9040167152168]
CNNのコントラスト感度関数を実験的に定量化し,人間の視覚システムと比較した。本稿ではウェーブレット誘導分光ポーリングモジュール(WSPM)を提案する。人間の視覚系をさらにエミュレートするために、周波数領域拡張受容野ブロック(FE-RFB)を導入する。本研究では,SAM2 をバックボーンとし,Hiera-Large を事前学習ブロックとして組み込んだ FE-UNet を開発した。
論文参考訳（メタデータ） (2025-02-06T07:24:34Z)
Fiducial Focus Augmentation for Facial Landmark Detection [4.433764381081446]
本稿では,モデルによる顔構造理解を高めるために,新しい画像強調手法を提案する。我々は,Deep Canonical correlation Analysis (DCCA) に基づく損失を考慮した,シームズアーキテクチャに基づくトレーニング機構を採用している。提案手法は,様々なベンチマークデータセットにおいて,最先端のアプローチよりも優れている。
論文参考訳（メタデータ） (2024-02-23T01:34:00Z)
Feedback RoI Features Improve Aerial Object Detection [9.554951222327443]
神経科学研究は、人間の視覚系が低レベルの知覚を導くために高レベルのフィードバック情報を利用することを示した。本稿では、オブジェクト検出に類似したメカニズムを組み込むために、フィードバックマルチレベル機能エクストラクタ(Flex)を提案する。 Flexは、画像品質の変化と分類の不確実性に応じて、画像ワイドおよびインスタンスレベルのフィードバック情報に基づいて特徴選択を洗練する。
論文参考訳（メタデータ） (2023-11-28T16:09:09Z)
DAT++: Spatially Dynamic Vision Transformer with Deformable Attention [87.41016963608067]
Deformable Attention Transformer (DAT++)を提案する。 DAT++は、85.9%のImageNet精度、54.5および47.0のMS-COCOインスタンスセグメンテーションmAP、51.5のADE20KセマンティックセグメンテーションmIoUで、様々なビジュアル認識ベンチマークで最先端の結果を達成している。
論文参考訳（メタデータ） (2023-09-04T08:26:47Z)
Transformer Tracking with Cyclic Shifting Window Attention [17.73494432795304]
視覚オブジェクト追跡のためのマルチスケール巡回シフトウィンドウアテンションを備えた新しいトランスフォーマーアーキテクチャを提案する。本稿では,本手法の優れた性能を示すとともに,新しい最先端記録を5つの挑戦的データセットに設定する。
論文参考訳（メタデータ） (2022-05-08T07:46:34Z)
Understanding The Robustness in Vision Transformers [140.1090560977082]
自己注意は、改善された中レベルの表現を通して堅牢性を促進する。我々は、この能力を強化するために、フルアテンショナルネットワーク(FAN)のファミリーを提案する。我々のモデルは、76.8Mパラメータを持つImageNet-1kおよびImageNet-C上で、最先端の87.1%の精度と35.8%のmCEを達成する。
論文参考訳（メタデータ） (2022-04-26T17:16:32Z)
Vision Transformer with Convolutions Architecture Search [72.70461709267497]
本稿では,畳み込み型アーキテクチャサーチ(VTCAS)を用いたアーキテクチャ探索手法を提案する。 VTCASによって探索された高性能バックボーンネットワークは、畳み込みニューラルネットワークの望ましい特徴をトランスフォーマーアーキテクチャに導入する。これは、特に低照度屋内シーンにおいて、物体認識のためのニューラルネットワークの堅牢性を高める。
論文参考訳（メタデータ） (2022-03-20T02:59:51Z)
ViTAEv2: Vision Transformer Advanced by Exploring Inductive Bias for Image Recognition and Beyond [76.35955924137986]
我々は、内在性IBを畳み込み、すなわちViTAEから探索するビジョントランスフォーマーを提案する。 ViTAEはいくつかの空間ピラミッド縮小モジュールを備えており、入力イメージをリッチなマルチスケールコンテキストでトークンに埋め込む。我々は、ImageNet検証セット上で88.5%のTop-1分類精度と、ImageNet実検証セット上で最高の91.2%のTop-1分類精度を得る。
論文参考訳（メタデータ） (2022-02-21T10:40:05Z)
Intriguing Properties of Vision Transformers [114.28522466830374]
視覚変換器(ViT)は、様々なマシンビジョン問題にまたがって印象的な性能を誇示している。我々は、この問題を広範囲の実験を通して体系的に研究し、高性能畳み込みニューラルネットワーク(CNN)との比較を行った。 ViTsの効果的な特徴は、自己認識機構によって可能なフレキシブルな受容と動的場によるものであることを示す。
論文参考訳（メタデータ） (2021-05-21T17:59:18Z)
Vision Transformers are Robust Learners [65.91359312429147]
ビジョントランスフォーマー(ViT)の一般的な腐敗や摂動、分布シフト、自然逆転例に対する堅牢性について検討します。 ViTsが実際により堅牢な学習者である理由を説明するために、定量的および定性的な指標を提供する分析を提示します。
論文参考訳（メタデータ） (2021-05-17T02:39:22Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。