論文の概要: Latent space bias directions in LLMs capture confidence, not fairness
- arxiv url: http://arxiv.org/abs/2610.08559v1
- Date: Tue, 06 Oct 2026 15:42:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.089875
- Title: Latent space bias directions in LLMs capture confidence, not fairness
- Title(参考訳): LLMにおける潜時空間偏差方向は不公平ではなく信頼を捉える
- Abstract要約: 本研究では,アクティベーションステアリングに使用されるデバイアスの方向が実際にどう符号化されるかを検討した。
この方向は、活性化空間における高確率トークンと低確率トークンの領域を指して、モデルの信頼性に支配されている。
QAベンチマークでは、このステアリングが、公正度指標を改善する副作用として、モデルに回答を控えるよう促すことが分かりました。
- 参考スコア(独自算出の注目度): 4.782322901897837
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Activation steering has gained popularity as a lightweight inference-time debiasing technique for large language models. However, prior work reports that steering vectors generalise poorly, with unintended effects on model performance and limited transfer to new datasets. Our work analyses what the debiasing direction used for activation steering actually encodes, in order to shed light on its inconsistent performance. We study the linear debiasing direction obtained by contrasting the activations of anti-biased and biased prompts, and evaluate it as a steering intervention across bias and general knowledge benchmarks. We find that this direction is dominated by model confidence, pointing from regions of high to low-probability tokens in activation space rather than encoding a meaningful representation of model bias. Steering along it does reduce measured bias, but this is a consequence of reducing model confidence: on QA benchmarks we find that this steering drives the model to abstain from answering, with a side effect of improving fairness metrics. Our experiments show that model confidence is the dominant separating factor between biased and anti-biased prompts in hidden space, indicating that isolating a linear representation of bias which is disentangled from model confidence is difficult and steering-based debiasing results should be interpreted with care. In short, steering appears to reduce bias, not by correcting the model's underlying preferences, but by making it less confident, even on tasks unrelated to bias.
- Abstract(参考訳): アクティベーションステアリングは、大規模言語モデルのための軽量な推論時デバイアス技術として人気を集めている。
しかし、以前の研究報告では、ステアリングベクトルはモデル性能に意図しない影響と、新しいデータセットへの限定的な転送により、あまり一般化していない。
我々の研究は、アクティベーションステアリングに使用されるデバイアスの方向が実際にどのように符号化されているかを分析し、一貫性のない性能に光を当てる。
本研究では,反バイアスおよび偏りのあるプロンプトの活性化と対比して得られる線形偏り方向について検討し,偏りと一般知識のベンチマークを横断するステアリング介入として評価する。
この方向はモデルバイアスの有意義な表現を符号化するよりも、アクティベーション空間における高確率トークンと低確率トークンの領域を指して、モデル信頼に支配されている。
QAベンチマークでは、このステアリングが、公正度の測定値を改善する副作用を伴って、モデルの応答を妨げていることが分かりました。
実験の結果, モデル信頼度は, 隠れ空間における偏りと反偏りを区別する要因であり, モデル信頼度から遠ざかっている偏りの線形表現の分離は困難であり, ステアリングに基づく偏りの解消は注意を要することが明らかとなった。
簡単に言うと、ステアリングは、モデルの基本的嗜好を修正することによってではなく、バイアスとは無関係なタスクであっても、信頼性を低下させることによってバイアスを減少させるように見える。
関連論文リスト
- How Does Alignment Tuning Shape Representations of Sycophancy and Related Cue-Induced Biases in LLMs? [53.58941416780391]
本研究は, この感受性, 潜伏性および関連キュー誘発バイアスがモデル内に存在するかを研究する。
我々は、隠れた状態からバイアスごとの方向を抽出し、探索、1つのデータセットの移動、因果的介入の3つの手段によってそれを三角測量する。
論文 参考訳(メタデータ) (2026-07-20T16:10:06Z) - Activation Steering for Bias Mitigation: An Interpretable Approach to Safer LLMs [0.5076419064097734]
大規模言語モデル(LLM)は、社会システムにますます統合されている。
バイアスを軽減する従来の方法は、しばしばデータフィルタリングやポストホック出力のモデレーションに依存している。
我々は、機械的解釈可能性の手法を用いてバイアスを特定し、積極的に軽減する完全なエンドツーエンドシステムを導入する。
論文 参考訳(メタデータ) (2025-08-12T15:34:18Z) - Looking at Model Debiasing through the Lens of Anomaly Detection [11.113718994341733]
ディープニューラルネットワークはデータのバイアスに敏感である。
本研究は,偏りと偏りの一致したサンプルを正確に予測することの重要性を示す。
本稿では,異常検出に基づく新しいバイアス同定手法を提案する。
論文 参考訳(メタデータ) (2024-07-24T17:30:21Z) - Feature-Level Debiased Natural Language Understanding [86.8751772146264]
既存の自然言語理解(NLU)モデルは、特定のデータセットで高いパフォーマンスを達成するために、データセットバイアスに依存することが多い。
本稿では, バイアスの潜在特性を緩和し, バイアスの動的性質を無視するために, DCT(Debiasing contrastive learning)を提案する。
DCTは、ディストリビューション内のパフォーマンスを維持しながら、アウトオブディストリビューションデータセットの最先端のベースラインを上回ります。
論文 参考訳(メタデータ) (2022-12-11T06:16:14Z) - Self-supervised debiasing using low rank regularization [59.84695042540525]
純粋な相関は、ディープニューラルネットワークの強いバイアスを引き起こし、一般化能力を損なう可能性がある。
ラベルのないサンプルと互換性のある自己監督型脱バイアスフレームワークを提案する。
注目すべきは,提案フレームワークが自己教師付き学習ベースラインの一般化性能を著しく向上させることである。
論文 参考訳(メタデータ) (2022-10-11T08:26:19Z) - How Gender Debiasing Affects Internal Model Representations, and Why It
Matters [26.993273464725995]
内因性バイアスは、標準のWEAT測定値よりもデバイアスの指標として優れていることを示す。
当社のフレームワークは,NLPモデルのバイアスを包括的に把握し,より情報のある方法でNLPシステムのデプロイに適用することができる。
論文 参考訳(メタデータ) (2022-04-14T08:54:15Z) - General Greedy De-bias Learning [163.65789778416172]
本稿では,関数空間における勾配降下のような偏りのあるモデルとベースモデルを優雅に訓練する一般グリーディ・デバイアス学習フレームワーク(GGD)を提案する。
GGDは、事前知識を持つタスク固有バイアスモデルと、事前知識を持たない自己アンサンブルバイアスモデルの両方の設定の下で、より堅牢なベースモデルを学ぶことができる。
論文 参考訳(メタデータ) (2021-12-20T14:47:32Z) - Towards Robustifying NLI Models Against Lexical Dataset Biases [94.79704960296108]
本稿では、語彙的データセットバイアスに対するモデル強化のための、データレベルとモデルレベルのデバイアス法の両方について検討する。
まず、データ拡張と拡張によってデータセットをデバイアスするが、この方法でモデルバイアスを完全に除去することはできないことを示す。
第2のアプローチでは、バーオブワードのサブモデルを使用して、バイアスを悪用する可能性のある機能をキャプチャし、元のモデルがこれらのバイアス付き機能を学ぶのを防ぐ。
論文 参考訳(メタデータ) (2020-05-10T17:56:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。