論文の概要: AT-ViT: Area-Targeted Multi-View Vision Transformer with Cross-Attention and Multi-Scale Patching for Plant Trait Recognition in Herbarium Images
- arxiv url: http://arxiv.org/abs/2608.21067v2
- Date: Mon, 24 Aug 2026 06:56:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.050572
- Title: AT-ViT: Area-Targeted Multi-View Vision Transformer with Cross-Attention and Multi-Scale Patching for Plant Trait Recognition in Herbarium Images
- Title(参考訳): AT-ViT ハーバリウム画像における植物系統認識のためのクロスアテンション・マルチスケールパッチ付きエリアターゲット多視点視覚変換器
- Abstract要約: 両ブランチビジョン変換器であるAT-ViTを導入し、生のハーバリウムスキャンとそのセグメント化したものを共同で符号化する。
AT-ViTは、植物関連領域を増幅し、背景駆動の特徴を弱めるマスク誘導パッチ重み付け機構を組み込んでいる。
一貫した精度向上を実現し、植物領域の注意の局在を改善し、合成背景摂動下での堅牢性を高める。
- 参考スコア(独自算出の注目度): 1.3651611781068242
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Automated plant traits recognition from herbarium images is essential for plant sciences, yet remains challenging because background elements (e.g., textual labels, mounting artifacts, and color charts) can introduce shortcut learning, leading models to rely on spurious non-plant cues rather than plant morphology. This bias degrades both generalization and interpretability. In this paper, we introduce AT-ViT, a dual-branch Vision Transformer that jointly encodes raw herbarium scans and their segmented-derived counterparts via a multi-scale, multi-view cross-attention fusion scheme. AT-ViT further incorporates a mask-guided patch weighting mechanism that amplifies plant-relevant regions and attenuates background-driven features. By learning from the original scans while being guided by segmentation masks through the mask-guided patch reweighting mechanism, the model is encouraged to focus on plant organs and learn plant-centric representations more effectively. Across multiple trait classification tasks (e.g., leaf base shape, thorns), AT-ViT delivers consistent accuracy gains, improves attention localization on plant regions, and exhibits increased robustness under synthetic background perturbations. Specifically, AT-ViT substantially improves spatial attention grounding, boosting plant-region alignment (Avg IoU_p: +15.66 to +18.03 pp) while reducing background overlap (Avg IoU_b: -27.92 to -31.02 pp) relative to CrossViT, and remains markedly more robust to background perturbations, outperforming ResNet101 by up to +32.32 accuracy points and CrossViT by up to +5.07 points under background-noise conditions.
- Abstract(参考訳): 草原画像から認識される植物形質の自動認識は、植物科学には不可欠であるが、背景要素(例えば、テキストラベル、実装アーティファクト、カラーチャート)がショートカット学習を導入し、植物形態学よりも刺激的な非植物形質に依存しているため、依然として困難である。
このバイアスは一般化と解釈可能性の両方を低下させる。
本稿では,マルチスケール・マルチビュー・クロスアテンション・フュージョン・スキームを用いて生ハーバリウムスキャンとそのセグメント化を共同で符号化するデュアルブランチ・ビジョン・トランスフォーマーAT-ViTを紹介する。
AT-ViTはさらに、植物関連領域を増幅し、バックグラウンド駆動の特徴を弱めるマスク誘導パッチ重み付け機構を組み込んでいる。
マスク誘導パッチ再重み付け機構を通じてセグメンテーションマスクによって導かれながら、元のスキャンから学習することにより、モデルは植物器官に集中し、植物中心の表現をより効果的に学習することが奨励される。
AT-ViTは複数の形質分類タスク(例えば、葉のベース形状、トーン)を通じて、一貫した精度向上を実現し、植物領域における注意の局在を改善し、合成背景摂動下での堅牢性を高める。
具体的には、AT-ViTは空間的注意基盤を著しく改善し、背景重なりを減少させながら(Avg IoU_p: +15.66 to +18.03 pp)、背景重なりを減少させ(Avg IoU_b: -27.92 to -31.02 pp)、背景摂動に対して顕著に頑健であり、ResNet101を最大+32.32精度ポイント、CrossViTを最大+5.07ポイント向上させる。
関連論文リスト
- Leveraging Swin Transformer for Local-to-Global Weakly Supervised
Semantic Segmentation [12.103012959947055]
本研究では、初期シードCAMの精度を高めるために「SWTformer」を提案することで、Swin Transformerの使用について検討する。
SWTformer-V1は、精度0.98%のmAPを実現し、最先端モデルより優れている。
SWTformer-V2は、追加情報を抽出するためにマルチスケールの機能融合機構を組み込んでいる。
論文 参考訳(メタデータ) (2024-01-31T13:41:17Z) - ROI-Aware Multiscale Cross-Attention Vision Transformer for Pest Image
Identification [1.9580473532948401]
我々は、新しいROI対応マルチスケール・クロスアテンション・ビジョン・トランス (ROI-ViT) を提案する。
提案したROI-ViTは、PestとROIブランチと呼ばれる2つのブランチを使って設計されている。
実験の結果、提案されたROI-ViTはそれぞれIP102、D0、SauTegの害虫データセットに対して81.81%、99.64%、84.66%を達成した。
論文 参考訳(メタデータ) (2023-12-28T09:16:27Z) - Affine-Consistent Transformer for Multi-Class Cell Nuclei Detection [76.11864242047074]
本稿では, 原子核位置を直接生成する新しいアフィン一貫性変換器 (AC-Former) を提案する。
本稿では,AAT (Adaptive Affine Transformer) モジュールを導入し,ローカルネットワークトレーニングのためのオリジナル画像をワープするための重要な空間変換を自動学習する。
実験結果から,提案手法は様々なベンチマークにおいて既存の最先端アルゴリズムを著しく上回ることがわかった。
論文 参考訳(メタデータ) (2023-10-22T02:27:02Z) - Laplacian-Former: Overcoming the Limitations of Vision Transformers in
Local Texture Detection [3.784298636620067]
Vision Transformer (ViT) モデルは、幅広いコンピュータビジョンタスクにおいてブレークスルーを実証している。
これらのモデルは、画像の高周波成分を捉えるのに苦労しており、局所的なテクスチャやエッジ情報を検出する能力を制限することができる。
本稿では,ラプラシアンピラミッド内の周波数情報を適応的に補正することで自己注意マップを向上する新しい手法であるラプラシアン・フォーマーを提案する。
論文 参考訳(メタデータ) (2023-08-31T19:56:14Z) - Improving FHB Screening in Wheat Breeding Using an Efficient Transformer
Model [0.0]
フサリウム・ヘッド・ブライト(Fusarium head blight)は、小さな穀物に毎年重大な経済的損失をもたらす壊滅的な病気である。
FHBの早期検出のために,教師付き機械学習アルゴリズムを用いて画像処理技術を開発した。
変圧器モデルにU-Netネットワークの局所表現機能を統合するために,新しいContext Bridgeを提案する。
論文 参考訳(メタデータ) (2023-08-07T15:44:58Z) - UIA-ViT: Unsupervised Inconsistency-Aware Method based on Vision
Transformer for Face Forgery Detection [52.91782218300844]
そこで我々は、UIA-ViTと呼ばれるビジョン変換器に基づく教師なし不整合認識手法を提案する。
自己注意機構により、パッチ埋め込み間の注意マップは自然に一貫性関係を表現し、一貫性表現学習に適した視覚変換器となる。
論文 参考訳(メタデータ) (2022-10-23T15:24:47Z) - Optimizing Relevance Maps of Vision Transformers Improves Robustness [91.61353418331244]
視覚的分類モデルは、しばしば画像背景に依存し、前景を無視し、分布の変化に対する頑丈さを損なうことが観察されている。
本稿では,モデルが前景オブジェクトに注目するように,モデルの関連性信号を監視して操作することを提案する。
これは、画像とそれに関連する前景マスクからなる比較的少数のサンプルを含む、微調整のステップとして行われる。
論文 参考訳(メタデータ) (2022-06-02T17:24:48Z) - Self-Promoted Supervision for Few-Shot Transformer [178.52948452353834]
SUN(Self-promoted sUpervisioN)は視覚変換器(ViT)のための数発の学習フレームワークである
SUNは、数ショットの学習データセットでViTを事前トレーニングし、各パッチトークンを導くために、個別のロケーション固有の監視を生成する。
実験によると、ViTを使ったSUNは、ViTを使った他の数発の学習フレームワークを大幅に上回っており、CNNの最先端技術よりも高いパフォーマンスを実現している。
論文 参考訳(メタデータ) (2022-03-14T12:53:27Z) - RAMS-Trans: Recurrent Attention Multi-scale Transformer forFine-grained
Image Recognition [26.090419694326823]
地域注意の局所化と増幅は重要な要素であり、畳み込みニューラルネットワーク(CNN)ベースのアプローチによって多くの研究がなされている。
本稿では,変圧器の自己注意を用いて識別領域の注意を学習する,繰り返し注意型マルチスケール変圧器(RAMS-Trans)を提案する。
論文 参考訳(メタデータ) (2021-07-17T06:22:20Z) - Intriguing Properties of Vision Transformers [114.28522466830374]
視覚変換器(ViT)は、様々なマシンビジョン問題にまたがって印象的な性能を誇示している。
我々は、この問題を広範囲の実験を通して体系的に研究し、高性能畳み込みニューラルネットワーク(CNN)との比較を行った。
ViTsの効果的な特徴は、自己認識機構によって可能なフレキシブルな受容と動的場によるものであることを示す。
論文 参考訳(メタデータ) (2021-05-21T17:59:18Z) - TFill: Image Completion via a Transformer-Based Architecture [69.62228639870114]
画像補完を無方向性シーケンス対シーケンス予測タスクとして扱うことを提案する。
トークン表現には,小かつ重複しないRFを持つ制限型CNNを用いる。
第2フェーズでは、可視領域と発生領域の外観整合性を向上させるために、新しい注意認識層(aal)を導入する。
論文 参考訳(メタデータ) (2021-04-02T01:42:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。