論文の概要: Automated Background Swapping for Robustness against Spurious Backgrounds
- arxiv url: http://arxiv.org/abs/2606.32018v1
- Date: Tue, 30 Jun 2026 17:50:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.34306
- Title: Automated Background Swapping for Robustness against Spurious Backgrounds
- Title(参考訳): 鮮明な背景に対するロバストネスのための自動バックグラウンドスワッピング
- Authors: Cesar Roder, Kajetan Schweighofer,
- Abstract要約: AutoBackSwapは、フォアグラウンドとバックグラウンドをアンタングルし、続いてインフィルして完全なバックグラウンドを合成し、最終的に異なるフォアグラウンドとインペイントされたバックグラウンドを組み合わせてトレーニングデータを拡張する。
パッチワイドなラベル付けによって、セカンダリネットワークをトレーニングし、課題の画像分類タスクの完全なトレーニングを自動で強化するのに、数百のサンプルだけで十分であることが分かりました。
- 参考スコア(独自算出の注目度): 1.76179873429447
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Classifiers based on Deep Neural Networks exhibit strong performance across domains, yet can fail catastrophically if they rely on spurious correlations, i.e., features that are predictive of the target label in the training data but are not causally linked and thus fail to generalize. For the vision domain, many such spurious correlations manifest themselves within the background of the image, where only the foreground is predictive of the class label. In this paper, we introduce Automated Background Swapping (AutoBackSwap) to reduce the reliance of classifiers on such spurious backgrounds. AutoBackSwap uses a secondary network to disentangle the foreground and background, followed by infilling to synthesize complete backgrounds, and finally combines different foregrounds and inpainted backgrounds to augment the training data. We find that patch-wise labeling of just a few hundred samples suffices to train the secondary network and automatically augment the full training dataset on challenging image classification tasks. In contrast to many previous methods, AutoBackSwap proves very effective even if there is not a single sample in the training data breaking the spurious correlation. Across a range of image classification tasks with spurious backgrounds, AutoBackSwap consistently outperforms prior methods.
- Abstract(参考訳): ディープニューラルネットワークに基づく分類器は、ドメイン間で強い性能を示すが、訓練データ中のターゲットラベルを予測できるが因果的にリンクされていないため、一般化に失敗するといった、急激な相関に依存する場合、破滅的に失敗する可能性がある。
視覚領域では、こうした刺激的な相関関係が画像の背景に現れ、前景のみがクラスラベルの予測を行う。
本稿では,自動バックグラウンドスワップ(AutoBackSwap)を導入し,このような素早い背景に対する分類器の依存度を低減する。
AutoBackSwapは、フォアグラウンドとバックグラウンドをアンタングルするためにセカンダリネットワークを使用し、続いてインフィルを使用して完全なバックグラウンドを合成し、最終的に異なるフォアグラウンドとインペイントされたバックグラウンドを組み合わせてトレーニングデータを拡張する。
パッチワイドなラベル付けによって、セカンダリネットワークをトレーニングし、課題の画像分類タスクに関する完全なトレーニングデータセットを自動的に強化できるのです。
従来の多くの手法とは対照的に、AutoBackSwapは、スプリアス相関を破るトレーニングデータに1つのサンプルが存在しない場合でも、非常に効果的である。
さまざまな背景を持つ画像分類タスクの中で、AutoBackSwapは、常に以前のメソッドよりも優れています。
関連論文リスト
- Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training [55.12082817901671]
我々はMasked and Permuted Vision Transformer(MaPeT)という自己教師型事前学習手法を提案する。
MaPeTは、自動回帰および置換予測を使用して、パッチ内依存関係をキャプチャする。
以上の結果から,MaPeTはベースラインやコンペティターと同一のモデル設定で比較して,ImageNet上での競合性能を実証した。
論文 参考訳(メタデータ) (2023-06-12T18:12:19Z) - PRSNet: A Masked Self-Supervised Learning Pedestrian Re-Identification
Method [2.0411082897313984]
本論文は, 強靭性を有する事前学習モデルを得るために, マスク再構築の前タスクを設計する。
センタロイドに基づいて三重項損失を改善することにより、ネットワークのトレーニング最適化を行う。
この手法は、既存の自己教師型学習歩行者再識別法よりも、Marker1501およびCUHK03データ上で約5%高いmAPを達成する。
論文 参考訳(メタデータ) (2023-03-11T07:20:32Z) - Location-Aware Self-Supervised Transformers [74.76585889813207]
画像部品の相対的な位置を予測し,セマンティックセグメンテーションのためのネットワークを事前訓練する。
参照パッチのサブセットを問合せのサブセットにマスキングすることで,タスクの難しさを制御します。
実験により,この位置認識事前学習が,いくつかの難解なセマンティックセグメンテーションベンチマークに競合する表現をもたらすことが示された。
論文 参考訳(メタデータ) (2022-12-05T16:24:29Z) - Invariant Learning via Diffusion Dreamed Distribution Shifts [121.71383835729848]
拡散ドリーム分布シフト(D3S)と呼ばれるデータセットを提案する。
D3Sは、テキストプロンプトを用いてStableDiffusionを通じて生成された合成画像と、サンプルフォアグラウンドイメージを背景テンプレートイメージにペーストした画像ガイドから構成される。
拡散モデルの驚くべきフォトリアリズムのため、我々の画像は以前の合成データセットよりも自然な画像に近い。
論文 参考訳(メタデータ) (2022-11-18T17:07:43Z) - Semantic-aware Dense Representation Learning for Remote Sensing Image
Change Detection [20.761672725633936]
ディープラーニングに基づく変化検出モデルのトレーニングはラベル付きデータに大きく依存する。
最近のトレンドは、リモートセンシング(RS)データを使用して、教師付きまたは自己教師型学習(SSL)を通じてドメイン内表現を取得することである。
複数のクラスバランス点をサンプリングし,RS画像CDに対する意味認識事前学習を提案する。
論文 参考訳(メタデータ) (2022-05-27T06:08:33Z) - Enhanced Performance of Pre-Trained Networks by Matched Augmentation
Distributions [10.74023489125222]
列車-テストの分散シフトに対処するための簡単な解を提案する。
テスト画像に対して、複数のランダムな作物に対して結果を合成する。
これは列車の時間拡張と一致するだけでなく、入力画像の完全なカバレッジも提供する。
論文 参考訳(メタデータ) (2022-01-19T22:33:00Z) - Rectifying the Shortcut Learning of Background: Shared Object
Concentration for Few-Shot Image Recognition [101.59989523028264]
Few-Shot画像分類は、大規模なデータセットから学んだ事前学習された知識を利用して、一連の下流分類タスクに取り組むことを目的としている。
本研究では,Few-Shot LearningフレームワークであるCOSOCを提案する。
論文 参考訳(メタデータ) (2021-07-16T07:46:41Z) - Leveraging Self-Supervision for Cross-Domain Crowd Counting [71.75102529797549]
混雑したシーンで人をカウントするための最先端の方法は、群衆密度を推定するために深いネットワークに依存します。
われわれのネットワークは、通常の画像から逆さまの実際の画像を認識できるように訓練し、その不確実性を予測する能力を組み込む。
このアルゴリズムは、推論時に余分な計算をせずに、最先端のクロスドメイン群をカウントするアルゴリズムを一貫して上回る。
論文 参考訳(メタデータ) (2021-03-30T12:37:55Z) - Background Splitting: Finding Rare Classes in a Sea of Background [55.03789745276442]
我々は,少数の稀なカテゴリの画像分類のための,高精度な深層モデルの訓練という現実的な問題に焦点をあてる。
これらのシナリオでは、ほとんどの画像はデータセットの背景カテゴリに属します(データセットの95%は背景です)。
非バランスなデータセットをトレーニングするための標準的な微調整アプローチと最先端アプローチの両方が、この極端な不均衡の存在下で正確な深層モデルを生成していないことを実証する。
論文 参考訳(メタデータ) (2020-08-28T23:05:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。