論文の概要: Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning
- arxiv url: http://arxiv.org/abs/2607.05850v1
- Date: Tue, 07 Jul 2026 05:13:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.40403
- Title: Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning
- Title(参考訳): 生成ランダム化と多変量自己監督学習による純粋相関の破滅
- Abstract要約: 経験的リスク最小化でトレーニングされたディープニューラルネットワークは、分散シフト時に失敗することが多い。
最近の生成的アプローチでは、コンテキストが変化した反ファクト画像を作成することでこの問題に対処している。
生成的介入を用いて背景不変の視覚表現を明示的に学習する2段階のフレームワークを提案する。
- 参考スコア(独自算出の注目度): 0.871725390496537
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Deep neural networks trained with Empirical Risk Minimization (ERM) often fail under distribution shifts because they exploit spurious correlations between object labels and background context. Recent generative approaches address this issue by creating counterfactual images with altered contexts, but typically use these samples as standard data augmentation, leaving the model free to retain background-sensitive representations. We propose a two-stage framework that uses generative intervention to explicitly learn background-invariant visual representations. First, we isolate the foreground object using zero-shot segmentation and generate context-shifted variants with a structure-preserving diffusion model, preserving object identity while varying the surrounding environment. We then introduce Cross-Variant Self-Supervised Learning, where variants of the same object under different backgrounds form positive pairs in a contrastive objective. This encourages the encoder to align object-centric representations while suppressing background-specific cues. Then, we fine-tune the pretrained encoder using an ERM warm-up followed by GroupDRO with layer-wise learning rates. Experiments on distribution-shift benchmarks demonstrate best worst-group performance, achieving 92.5% on Waterbirds, 81.7% on MetaShift, and 87.4% on NICO++. Code: https://github.com/surajyadav-research/GRSSL
- Abstract(参考訳): 経験的リスク最小化(ERM)でトレーニングされたディープニューラルネットワークは、オブジェクトラベルと背景コンテキストの急激な相関を利用するため、分散シフト時に失敗することが多い。
最近の生成的アプローチでは、コンテキストが変化した反ファクト画像を作成することでこの問題に対処しているが、典型的にはこれらのサンプルを標準データ拡張として使用し、背景に敏感な表現を保持することは自由である。
生成的介入を用いて背景不変の視覚表現を明示的に学習する2段階のフレームワークを提案する。
まず、ゼロショットセグメンテーションを用いて前景オブジェクトを分離し、周囲環境を変動させながらオブジェクトの同一性を保存する構造保存拡散モデルを用いてコンテキストシフト変種を生成する。
次に、異なる背景下で同じ対象の変種が対照的な目的において正の対を形成するクロスバリアント自己監督学習を紹介する。
これにより、エンコーダは、バックグラウンド固有のキューを抑えながら、オブジェクト中心の表現を調整することができる。
次に、ERMウォームアップを用いて事前学習したエンコーダを微調整し、次に、レイヤワイズ学習率のGroupDROを用いる。
分散シフトベンチマークの実験では、Waterbirdsで92.5%、MetaShiftで81.7%、NICO++で87.4%を達成している。
コード:https://github.com/surajyadav-research/GRSSL
関連論文リスト
- Where Does Generative Difficulty Reside? An Empirical Study of Target Representations [62.54876287800644]
ターゲット表現は、イメージジェネレータが学ぶ必要がある分布を定義するが、しばしば交換可能なインターフェースとして扱われる。
マスク付き自己回帰整流モデルにおいて,生画素,SD-VAE潜伏剤,DINOv2,MAE表現-オートエンコーダの特徴について検討した。
その結果, 圧縮, 再構成忠実度, トークン次元, 可視的セマンティッククラスタリングは生成挙動を個別に予測できないことがわかった。
論文 参考訳(メタデータ) (2026-08-01T12:32:31Z) - Making Training-Free Diffusion Segmentors Scale with the Generative Power [118.72472901404814]
一連の研究は、事前学習された拡散モデルを、それ以上の訓練をせずに意味的セグメンテーションに適応することに焦点を当てている。
本稿では,自動アグリゲーションと画素単位の再スケーリングという2つの手法を提案する。
論文 参考訳(メタデータ) (2026-03-06T11:35:37Z) - Hierarchical Identity Learning for Unsupervised Visible-Infrared Person Re-Identification [81.3063589622217]
教師なし可視赤外線人物再識別(USVI-ReID)は、ラベルのないクロスモーダルな人物データセットからモダリティ不変の画像特徴を学習することを目的としている。
論文 参考訳(メタデータ) (2025-09-15T05:10:43Z) - DDB: Diffusion Driven Balancing to Address Spurious Correlations [24.940576844328408]
経験的リスク最小化でトレーニングされたディープニューラルネットワークは、アウト・オブ・ディストリビューションのサンプルに一般化できないことが多い。
テキストと画像の拡散モデルを用いたトレーニングサンプルを生成するための拡散駆動バランス(DDB)手法を提案する。
実験の結果,本手法は既存の最先端手法よりもグループ精度がよいことがわかった。
論文 参考訳(メタデータ) (2025-03-21T15:28:22Z) - Multilevel Saliency-Guided Self-Supervised Learning for Image Anomaly
Detection [15.212031255539022]
異常検出(AD)はコンピュータビジョンの基本課題である。
そこで我々は,サリエンシガイダンスを活用して意味的手がかりを付加するCutSwapを提案する。
CutSwapは、2つの主流ADベンチマークデータセット上で最先端のADパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-11-30T08:03:53Z) - SepVAE: a contrastive VAE to separate pathological patterns from healthy ones [2.619659560375341]
コントラスト分析VAE(Contrastive Analysis VAE)は、背景データセット(BG)と対象データセット(TG)の共通要因を分離することを目的とした変分自動エンコーダ(VAE)のファミリーである。
3つの医療応用と自然画像データセット(CelebA)における従来のCA-VAEs法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2023-07-12T14:52:21Z) - Divide and Contrast: Source-free Domain Adaptation via Adaptive
Contrastive Learning [122.62311703151215]
Divide and Contrast (DaC) は、それぞれの制限を回避しつつ、両方の世界の善良な端を接続することを目的としている。
DaCは、ターゲットデータをソースライクなサンプルとターゲット固有なサンプルに分割する。
さらに、ソースライクなドメインと、メモリバンクベースの最大平均離散性(MMD)損失を用いて、ターゲット固有のサンプルとを整合させて、分散ミスマッチを低減する。
論文 参考訳(メタデータ) (2022-11-12T09:21:49Z) - Decoupled Multi-task Learning with Cyclical Self-Regulation for Face
Parsing [71.19528222206088]
顔解析のための周期的自己統制型デカップリング型マルチタスク学習を提案する。
具体的には、DML-CSRは、顔解析、バイナリエッジ、カテゴリエッジ検出を含むマルチタスクモデルを設計する。
提案手法は,Helen,CelebA-HQ,LapaMaskのデータセット上での最先端性能を実現する。
論文 参考訳(メタデータ) (2022-03-28T02:12:30Z) - Self-Conditioned Generative Adversarial Networks for Image Editing [61.50205580051405]
Generative Adversarial Networks (GAN) はバイアスの影響を受けやすい。
我々は、このバイアスが公平性だけでなく、分布のコアから逸脱する際の潜在トラバース編集手法の崩壊に重要な役割を果たしていると論じる。
論文 参考訳(メタデータ) (2022-02-08T18:08:24Z) - Unsupervised Controllable Generation with Self-Training [90.04287577605723]
GANによる制御可能な世代は依然として困難な研究課題である。
本稿では,自己学習を通じてジェネレータを制御する潜伏符号の分布を学習するための教師なしフレームワークを提案する。
我々のフレームワークは、変分オートエンコーダのような他の変種と比較して、より良い絡み合いを示す。
論文 参考訳(メタデータ) (2020-07-17T21:50:35Z) - Variational Clustering: Leveraging Variational Autoencoders for Image
Clustering [8.465172258675763]
変分オートエンコーダ(VAE)は、潜在空間におけるデータ分布の学習に自然に役立ちます。
画像のクラスタリングに先立ってガウス混合を用いるVAEに基づく手法を提案する。
提案手法は,画像の潜伏分布と後部を捉える前処理を同時に学習し,データポイント間の識別に役立てる。
論文 参考訳(メタデータ) (2020-05-10T09:34:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。