論文の概要: Association Restoration Test: Revealing Restorable Shortcuts after Unlearning
- arxiv url: http://arxiv.org/abs/2607.05726v1
- Date: Tue, 07 Jul 2026 01:20:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.361373
- Title: Association Restoration Test: Revealing Restorable Shortcuts after Unlearning
- Title(参考訳): アソシエーション・リカバリ・テスト:アンラーニング後に修復可能なショートカットを発見
- Abstract要約: アソシエーション・アンラーニングは、学習したラベル属性のショートカットを無効にしつつ、タスクのパフォーマンスを維持することを目的としている。
本稿では,機能的ショートカット修復性診断のためのアソシエーション・リカバリ・テスト(ART)を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Association unlearning aims to disable learned label-attribute shortcuts while preserving task performance. Existing evaluations mainly measure output-level robustness or probe whether shortcut attributes remain readable in frozen features, but neither test determines whether a retained association remains functionally usable by the original classifier. We propose the Association Restoration Test (ART), a post-hoc diagnostic for functional shortcut restorability. ART estimates class-conditional association directions, amplifies residual components, and evaluates the modified features with the original classifier head. Across Waterbirds, CelebA, SpuCoDogs, and an ISIC timestamp-artifact extension, we show that output metrics, representation probes, and ART characterize distinct aspects of shortcut mitigation. These findings motivate restoration-aware evaluation for unlearning and shortcut-mitigation methods that target learned associations rather than individual classes or concepts.
- Abstract(参考訳): アソシエーション・アンラーニングは、学習したラベル属性のショートカットを無効にしつつ、タスクのパフォーマンスを維持することを目的としている。
既存の評価は、主に出力レベルのロバスト性を測定したり、凍結した特徴においてショートカット属性が可読かどうかを調査するが、元の分類器が保持したアソシエーションが機能的に使用可能なかどうかを判定しない。
本稿では,機能的ショートカット修復性に対するポストホック診断であるアソシエーション・リカバリ・テスト(ART)を提案する。
ARTは、クラス条件関連方向を推定し、残留成分を増幅し、修正された特徴を元の分類器ヘッドで評価する。
Waterbirds, CelebA, SpuCoDogs, およびISICタイムスタンプ・アーティファクト拡張において, 出力指標, 表現プローブ, ARTがショートカット緩和の異なる側面を特徴付けることを示す。
これらの知見は、個々のクラスや概念ではなく、学習した関連をターゲットとした、未学習およびショートカット緩和手法の復元意識評価を動機付けている。
関連論文リスト
- Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations [12.535445487099393]
本研究では,SAE潜伏剤と人間注釈概念のアライメントを定量化する人為的評価フレームワークを提案する。
対象属性の摂動によるマッチングを検証する。
我々のフレームワークは、中程度の辞書サイズが最良のトレードオフをもたらし、最も解釈可能なSAEをもたらすことを示唆している。
論文 参考訳(メタデータ) (2026-06-23T15:39:29Z) - SAGE: Retain-Aware Post-Hoc Sanitization of Final Unlearning Vector [32.30497427199285]
現在のアンラーニング手法は、すべて、アンラーニングと保持の間のトレードオフを含んでいる。
また, 保持行動バイアスは, 保持に影響を及ぼす未学習手法による損傷の定量化にも有効であることがわかった。
これにより、ポストホックアプローチを用いて、未学習のメソッドの保持性能を復元できる。
論文 参考訳(メタデータ) (2026-06-16T08:29:43Z) - An Illusion of Unlearning? Assessing Machine Unlearning Through Internal Representations [16.917151304941967]
最終層の特徴と分類器のミスアライメントが主な原因で,最先端の非学習手法が成功していることを示す。
隠れた特徴は相変わらず差別的であり、単純な線形探索は、ほぼ原産地の精度を回復することができる。
論文 参考訳(メタデータ) (2026-04-09T14:02:23Z) - ResAD++: Towards Class Agnostic Anomaly Detection via Residual Feature Learning [52.11294707895649]
本稿では,クラス非依存型異常検出(AD)の問題点について検討する。
目的は、ターゲットデータの再トレーニングや微調整をせずに、異なるドメインから様々な新しいクラスの異常を一般化して検出できる、クラスに依存しないADモデルをトレーニングすることである。
8つの実世界のADデータセットに関する総合的な実験は、ResAD++が新しいクラスで直接使用されると、素晴らしいAD結果が得られることを示した。
論文 参考訳(メタデータ) (2025-09-28T08:41:05Z) - CLEAR: Unlearning Spurious Style-Content Associations with Contrastive LEarning with Anti-contrastive Regularization [4.171555557592296]
反対正則化(CLEAR)を用いたコントラストLearningを提案する。
CLEARは、訓練中に必要不可欠な(タスク関連)特性と表在的(タスク非関連)特性を分離し、テスト時に表在的特性がシフトするときのパフォーマンスを向上させる。
その結果, CLEAR-VAEは, (a) コンテンツのスワップと補間を行い, (b) 以前に見つからなかったコンテンツとスタイルの組み合わせの存在下で, 下流の分類性能を向上させることができることがわかった。
論文 参考訳(メタデータ) (2025-07-24T20:31:21Z) - Collaborative Feature-Logits Contrastive Learning for Open-Set Semi-Supervised Object Detection [75.02249869573994]
オープンセットのシナリオでは、ラベルなしデータセットには、イン・ディストリビューション(ID)クラスとアウト・オブ・ディストリビューション(OOD)クラスの両方が含まれている。
このような設定で半教師付き検出器を適用すると、OODクラスをIDクラスとして誤分類する可能性がある。
我々は、CFL-Detector(Collaborative Feature-Logits Detector)と呼ばれるシンプルで効果的な方法を提案する。
論文 参考訳(メタデータ) (2024-11-20T02:57:35Z) - Learning to Detour: Shortcut Mitigating Augmentation for Weakly Supervised Semantic Segmentation [7.5856806269316825]
弱いラベルを用いた弱教師付きセマンティックセグメンテーション(WSSS)は,画素レベルのラベルを取得するためのアノテーションコストを軽減するために活発に研究されている。
本稿では,WSSS のためのショートカット緩和機能 (SMA) を提案する。これは,トレーニングデータに見られないオブジェクトと背景の組み合わせの合成表現を生成し,ショートカット機能の使用を減らす。
論文 参考訳(メタデータ) (2024-05-28T13:07:35Z) - Spurious Feature Eraser: Stabilizing Test-Time Adaptation for Vision-Language Foundation Model [86.9619638550683]
視覚言語基礎モデルは、画像とテキストのペアデータに拡張性があるため、多数の下流タスクで顕著な成功を収めている。
しかし、これらのモデルは、決定ショートカットの結果、きめ細かな画像分類などの下流タスクに適用した場合に重大な制限を呈する」。
論文 参考訳(メタデータ) (2024-03-01T09:01:53Z) - Which Features are Learnt by Contrastive Learning? On the Role of
Simplicity Bias in Class Collapse and Feature Suppression [59.97965005675144]
コントラスト学習(CL)は,ラベル管理の有無に関わらず,表現学習の強力な技術として登場した。
CLによって学習される特徴を判定する,理論的に厳密な最初の統合フレームワークを提供する。
本稿では,2つの理論的動機付けされた解として,埋め込み次元の増大とデータ拡張の質の向上について述べる。
論文 参考訳(メタデータ) (2023-05-25T23:37:22Z) - Exploiting Semantic Attributes for Transductive Zero-Shot Learning [97.61371730534258]
ゼロショット学習は、視覚的特徴と、そのクラスから学んだ意味的属性の関係を一般化することにより、目に見えないクラスを認識することを目的としている。
本稿では,未知データの意味的属性を生成し,生成過程に付加する新しいZSL法を提案する。
5つの標準ベンチマーク実験により,本手法がゼロショット学習の最先端結果をもたらすことが示された。
論文 参考訳(メタデータ) (2023-03-17T09:09:48Z) - Latent Embedding Feedback and Discriminative Features for Zero-Shot
Classification [139.44681304276]
ゼロショット学習は、トレーニング中にデータが利用できない、見えないカテゴリを分類することを目的としている。
Generative Adrial Networksは、クラス固有のセマンティック埋め込みを利用して、目に見えないクラス機能を合成する。
我々は,ゼロショット学習のすべての段階において,意味的一貫性を強制することを提案する。
論文 参考訳(メタデータ) (2020-03-17T17:34:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。