論文の概要: DnA: Denoising Attention for Visual Tasks
- arxiv url: http://arxiv.org/abs/2606.27372v1
- Date: Thu, 25 Jun 2026 17:59:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.398921
- Title: DnA: Denoising Attention for Visual Tasks
- Title(参考訳): DnA: 視覚タスクの注意を喚起する
- Abstract要約: まず,どの画像特徴が正しいクラスに属するかを正の問合せで識別し,負の問合せで密接に関連しているが無関係な画像特徴を識別する。
提案したDnAは,VT-Bのバックボーンを用いてImageNet-1Kにおいて,ベースラインに比べて0.8%向上した。
- 参考スコア(独自算出の注目度): 17.668969717830937
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The softmax activation in multihead attention (MHA) is the de facto standard for attention-based models in visual perception tasks. However, standard softmax can produce noisy attention patterns that dilute relevant features and degrade its performance. In this paper, we propose Denoising Attention or DnA, in which, first, a positive query identifies which image features belong to the correct class, and a negative query identifies closely associated but irrelevant image features. DnA then projects these interactions into two distinct subspaces with larger principal angles, promoting subspace separation and improved discriminability. Using a ViT-B backbone, our proposed DnA achieves an absolute gain of 0.8% on ImageNet-1K compared to the baseline. We further show improvements across multiple visual understanding tasks, including video understanding with video transformers (1.8%) and video LLMs (0.5%). Our extensive empirical analyses justify the design choices involving two interacting subspaces and the denoising effect of DnA.
- Abstract(参考訳): マルチヘッドアテンション(MHA)におけるソフトマックスアクティベーションは、視覚知覚タスクにおけるアテンションベースモデルのデファクトスタンダードである。
しかし、標準的なソフトマックスは、関連する特徴を減らし、性能を低下させるノイズの多い注意パターンを生成することができる。
本稿では、まず、どの画像特徴が正しいクラスに属するのかを正の問合せで識別し、負の問合せで密接に関連があるが無関係な画像特徴を識別するDnA(Denoising Attention)を提案する。
その後、DnAはこれらの相互作用をより大きな主角を持つ2つの異なる部分空間に射影し、部分空間分離を促進し、識別性を向上させる。
提案したDnAは,VT-Bのバックボーンを用いてImageNet-1Kにおいて,ベースラインに比べて0.8%向上した。
さらに,ビデオトランスフォーマによる映像理解(1.8%)やビデオLLM(0.5%)など,複数の視覚的理解タスクの改善を示す。
2つの相互作用する部分空間とDnAの認知的効果を含む設計選択を、我々の広範な経験的分析により正当化する。
関連論文リスト
- DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues [54.31138496553705]
DiCoBenchは、きめ細かい知覚のための包括的でマルチイメージの高解像度のベンチマークである。
評価の結果,人的精度 (98.3%) と比較して顕著な性能差がみられた。
DiCoBenchは、自律的で高解像度のマルチイメージ知覚における将来の研究を促進するための、挑戦的なテストベッドとして機能すると考えています。
論文 参考訳(メタデータ) (2026-06-25T05:02:38Z) - One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination [46.864482139261675]
現在のトレーニングフリー手法は、MLLM幻覚に異なる戦略で取り組む。
本稿では,コアアセットであるビジョントークンに着目した統一フレームワークを提案する。
これら2つの役割を調和させることで、我々のフレームワークは視覚言語バランスを効果的に回復する。
論文 参考訳(メタデータ) (2026-03-11T03:19:46Z) - Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials [34.77694214755808]
MHSA(Multi-Head Self-Attention)の代替品であるVCA(Visual-Contrast Attention)を導入する。
VCAは、O(N N C) から O(N n C) への理論複雑性を n N で減少させながら、識別の明示的な概念を注入する。
モジュールはDeiT-Tinyのバックボーンに0.3M以下のパラメータを追加し、追加のFLOPを必要とせず、完全にアーキテクチャに依存しない。
論文 参考訳(メタデータ) (2025-11-02T07:04:12Z) - Learning 1D Causal Visual Representation with De-focus Attention Networks [108.72931590504406]
本稿では,1次元因果モデルを用いた画像表現の実現可能性について検討する。
本稿では,学習可能な帯域通過フィルタを用いて様々な注意パターンを生成するDe-focus Attention Networksを提案する。
論文 参考訳(メタデータ) (2024-06-06T17:59:56Z) - DVANet: Disentangling View and Action Features for Multi-View Action
Recognition [56.283944756315066]
本稿では,学習した行動表現を映像中の視覚関連情報から切り離すための多視点行動認識手法を提案する。
本モデルとトレーニング方法は,4つの多視点行動認識データセットにおいて,他のユニモーダルモデルよりも有意に優れている。
論文 参考訳(メタデータ) (2023-12-10T01:19:48Z) - Egocentric Audio-Visual Noise Suppression [11.113020254726292]
本稿では,エゴセントリックビデオの音声・視覚ノイズ抑圧について検討する。
ビデオカメラは、外界のオフスクリーンスピーカーのビューをエミュレートします。
まず,エゴセントリックな視覚情報が騒音抑制に有効であることを示す。
論文 参考訳(メタデータ) (2022-11-07T15:53:12Z) - Visual Perturbation-aware Collaborative Learning for Overcoming the
Language Prior Problem [60.0878532426877]
本稿では,視覚的摂動校正の観点から,新しい協調学習手法を提案する。
具体的には、異なる摂動範囲で2種類のキュレートされた画像を構築するための視覚コントローラを考案する。
2つの診断VQA-CPベンチマークデータセットの実験結果は、その効果を明らかに示している。
論文 参考訳(メタデータ) (2022-07-24T23:50:52Z) - Dual Cross-Attention Learning for Fine-Grained Visual Categorization and
Object Re-Identification [19.957957963417414]
本稿では,自己意図学習と協調する2つのクロスアテンション学習(DCAL)アルゴリズムを提案する。
まず,グローバル・ローカル・クロスアテンション(GLCA)を提案する。
第2に、画像ペア間の相互作用を確立するために、ペアワイズ・クロスアテンション(PWCA)を提案する。
論文 参考訳(メタデータ) (2022-05-04T16:14:26Z) - ASCNet: Self-supervised Video Representation Learning with
Appearance-Speed Consistency [62.38914747727636]
本研究では,1)明示的な監督のためのラベルの欠如,2)構造化されていない,ノイズの多い視覚情報による自己指導型映像表現学習について検討する。
既存の方法は、主にビデオクリップをインスタンスとしてコントラスト損失を使用し、互いにインスタンスを識別することで視覚的表現を学ぶ。
本稿では,ロバストな映像表現を学ぶ上で,正のサンプル間の一貫性が鍵となることを観察する。
論文 参考訳(メタデータ) (2021-06-04T08:44:50Z) - Temporal Distinct Representation Learning for Action Recognition [139.93983070642412]
2次元畳み込みニューラルネットワーク (2D CNN) はビデオの特徴付けに用いられる。
ビデオの異なるフレームは同じ2D CNNカーネルを共有しており、繰り返し、冗長な情報利用をもたらす可能性がある。
本稿では,異なるフレームからの特徴の識別チャネルを段階的にエキサイティングにするためのシーケンシャルチャネルフィルタリング機構を提案し,繰り返し情報抽出を回避する。
本手法は,ベンチマーク時相推論データセットを用いて評価し,それぞれ2.4%,1.3%の可視性向上を実現している。
論文 参考訳(メタデータ) (2020-07-15T11:30:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。