論文の概要: UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers
- arxiv url: http://arxiv.org/abs/2608.09209v1
- Date: Mon, 10 Aug 2026 07:31:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.125851
- Title: UNMASK: Discovering and Causally Verifying Spurious Shortcuts in Text Classifiers
- Title(参考訳): UNMASK:テキスト分類器における清潔なショートカットの発見と因果検証
- Authors: Chidaksh Ravuru, Shashank Srivastava,
- Abstract要約: 大規模クラウドソースコーパスで訓練されたニューラル言語モデルは、真の言語的・因果的関連性のないターゲットラベルに結びついている刺激的な表面パターンをしばしば活用する。
既存のアプローチでは、機能の語彙を手動で指定するか、発見を部分的に自動化すればよい。
我々は,完全自動パイプラインであるUN M ASKについて,テキスト表現の素早い相関を発見し,因果検証し,緩和する。
- 参考スコア(独自算出の注目度): 9.827138852806305
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Neural language models trained on large crowdsourced corpora frequently exploit spurious surface patterns tied to target labels without true linguistic or causal relevance, boosting benchmark performance while failing on adversarial or out-of-distribution inputs. Existing approaches either require manual specification of the feature vocabulary or automate discovery only partially, leaving the gap between dataset-level correlation and model-level exploitation unaddressed. We present U N M ASK, a fully automated pipeline that discovers, causally verifies, and mitigates spurious correlations in text classifiers without additional human annotation. Given unlabeled training examples, U N M ASK generates candidate surface patterns as executable boolean expressions, filters them through a statistical validation protocol with independent replication, and establishes causal model dependence via verified counterfactual interventions. Causally confirmed features then serve as annotation-free group definitions for Deep Feature Reweighting, eliminating the group labels that standard DFR requires. Applied to BERT and RoBERTa trained on MNLI, our pipeline independently rediscovers established lexical-overlap and negation biases, verifying 9 of 10 features on BERT and 6 on RoBERTa, and improving HANS accuracy by up to 12.58 pp. On CivilComments-WILDS, programmatic groups match the 70.1% worst- group accuracy of hand-labeled DFR (Kirichenko et al., 2023) without demographic annotation. We further demonstrate that the discovery and validation stages generalize to reward model preference data, surfacing interpretable spurious correlations in RewardBench2.
- Abstract(参考訳): 大規模なクラウドソースコーパスでトレーニングされたニューラル言語モデルは、真の言語的あるいは因果関係のないターゲットラベルに結びついている急激な表面パターンを頻繁に利用し、敵対的またはアウト・オブ・ディストリビューションの入力に失敗しながら、ベンチマークのパフォーマンスを向上する。
既存のアプローチでは、機能の語彙を手動で指定するか、部分的にだけ発見を自動化するか、データセットレベルの相関とモデルレベルのエクスプロイトのギャップを埋める必要がある。
U N M ASKは、人間のアノテーションを付加せずにテキスト分類器の素早い相関を発見し、因果検証し、緩和する完全自動化パイプラインである。
UN M ASKは、ラベルのないトレーニング例を前提として、実行可能なブール式として候補表面パターンを生成し、独立した複製を伴う統計的検証プロトコルを通じてそれらをフィルタリングし、検証済みの反事実的介入を通じて因果モデル依存性を確立する。
因果的に確認された機能は、Deep Feature Reweightingのためのアノテーションのないグループ定義として機能し、標準のDFRに必要なグループラベルを排除します。
MNLIをトレーニングしたBERTおよびRoBERTaに対して,我々のパイプラインは,それぞれ独立に語彙オーバーラップと否定バイアスを確立し,BERTとRoBERTaの10つの特徴のうち9つを検証し,HANSの精度を最大12.58ppm向上させた。
CivilComments-WILDSでは、プログラムグループは人口統計学的注釈なしで手書きDFR(Kirichenko et al , 2023)の70.1%最悪のグループ精度と一致している。
さらに、RewardBench2における解釈可能なスプリアス相関を克服したモデル選好データに対して、発見と検証の段階が一般化されることを実証した。
関連論文リスト
- Generative Classifiers Avoid Shortcut Solutions [84.23247217037134]
分類に対する差別的なアプローチは、しばしば、分配されるが、小さな分布シフトの下で失敗するショートカットを学習する。
生成型分類器は、主にスパイラルな特徴ではなく、コアとスパイラルの両方の全ての特徴をモデル化することでこの問題を回避することができることを示す。
拡散型および自己回帰型生成型分類器は,5つの標準画像およびテキスト分散シフトベンチマークにおいて最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-12-31T18:31:46Z) - Let Samples Speak: Mitigating Spurious Correlation by Exploiting the Clusterness of Samples [11.727747752958436]
ディープラーニングモデルは、トレーニング中にクラスラベルと急激な相関関係を持つ機能を学ぶが、予測タスクとは無関係である。
既存の手法は通常、潜在的なスパイラルな属性を注釈付けしたり、経験的な仮定に基づいてスパイラルな特徴をフィルタリングすることでこの問題に対処する。
本稿では,深層学習モデルにおける突発的相関を緩和するデータ指向手法を提案する。
論文 参考訳(メタデータ) (2025-12-28T10:54:51Z) - Fighting Spurious Correlations in Text Classification via a Causal Learning Perspective [2.7813683000222653]
本稿では,因果関係へのモデル依存を軽減するために,因果相関ロバスト (CCR) を提案する。
CCRは、逆確率重み付け(IPW)損失関数とともに、反ファクト推論に基づく因果的特徴選択法を統合する。
グループラベルを持たないメソッド間でのCCRの最先端性能を示し、場合によってはグループラベルを利用するモデルと競合する。
論文 参考訳(メタデータ) (2024-11-01T21:29:07Z) - Trained Models Tell Us How to Make Them Robust to Spurious Correlation without Group Annotation [3.894771553698554]
経験的リスク最小化(ERM)モデルは、ターゲットと高い刺激的な相関を持つ属性に依存する傾向がある。
これにより、これらの属性を欠いた未表現(または'マイナー')グループのパフォーマンスを低下させることができる。
本稿では,環境に基づく検証と損失に基づくサンプリング(EVaLS)を提案する。
論文 参考訳(メタデータ) (2024-10-07T08:17:44Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - Model-based causal feature selection for general response types [8.228587135343071]
Invariant causal prediction (ICP) は、不均一な設定からのデータを必要とする因果的特徴選択の手法である。
我々は変換モデル(TRAM)ベースのICPを開発し、連続的、分類的、カウント型、非形式的に検閲された応答を可能にする。
我々は、オープンソースのRパッケージ「tramicp」を提供し、シミュレーションデータに対する我々のアプローチを評価し、重篤な患者の生存の因果的特徴を調査する事例研究を行った。
論文 参考訳(メタデータ) (2023-09-22T12:42:48Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z) - Breaking the Spurious Causality of Conditional Generation via Fairness
Intervention with Corrective Sampling [77.15766509677348]
条件生成モデルは、トレーニングデータセットから急激な相関を継承することが多い。
これは別の潜在属性に対して不均衡なラベル条件分布をもたらす。
この問題を緩和するための一般的な2段階戦略を提案する。
論文 参考訳(メタデータ) (2022-12-05T08:09:33Z) - Examining and Combating Spurious Features under Distribution Shift [94.31956965507085]
我々は、最小限の統計量という情報理論の概念を用いて、ロバストで刺激的な表現を定義し、分析する。
入力分布のバイアスしか持たない場合でも、モデルはトレーニングデータから急激な特徴を拾い上げることができることを証明しています。
分析から着想を得た結果,グループDROは,グループ同士の相関関係を直接考慮しない場合に失敗する可能性が示唆された。
論文 参考訳(メタデータ) (2021-06-14T05:39:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。