論文の概要: A Probe Shift Is Not a Fairness Fix: The Limits of Representation Steering in Speech Models
- arxiv url: http://arxiv.org/abs/2609.18533v1
- Date: Wed, 16 Sep 2026 12:01:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.789956
- Title: A Probe Shift Is Not a Fairness Fix: The Limits of Representation Steering in Speech Models
- Title(参考訳): プローブシフトは公正な修正ではない:音声モデルにおける表現ステアリングの限界
- Abstract要約: 我々は、事前訓練されたASRエンコーダから線形に読み取れる話者リンク属性が、グループ単語エラー率のギャップを減らすのに有用な方向を与えるかどうかを問う。
本研究は,表現,伝播,タスクレベルでの発話バイアス介入の評価を動機づけるものである。
- 参考スコア(独自算出の注目度): 9.715150075665354
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Automatic speech recognition (ASR) systems exhibit unequal error rates across speaker groups, motivating interventions on their internal representations. We ask whether speaker-linked attributes that are linearly readable from pretrained ASR encoders yield useful directions for reducing group word-error-rate (WER) gaps. Across Whisper-medium, HuBERT-large, and Wav2Vec2-large on Common Voice and the Speech Accent Archive, we probe every encoder layer for metadata-derived sex/gender, age, and native/accent labels; construct centroid and probe-derived directions; inject them at selected layers; and compare downstream probe trajectories with matched WER changes. Sex labels are highly decodable (best macro-F1 0.924--0.941), native/accent labels are also above chance (0.544--0.696), and age is weaker (0.354--0.397). Of 22 post-selected reruns, nine have 95% paired-bootstrap intervals entirely below zero, yet every absolute source-group WER reduction is below 0.7 percentage points. Conversely, a local target-class probe rate can rise from 8.09% to 99.87% while WER worsens. Linear readability is therefore neither evidence of causal use nor a reliable mitigation method. Our results motivate evaluating speech-bias interventions jointly at representation, propagation, and task levels.
- Abstract(参考訳): 自動音声認識(ASR)システムは話者グループ間で不等な誤り率を示し、内部表現への介入を動機付けている。
我々は、事前訓練されたASRエンコーダから線形に読み取ることができる話者リンク属性が、グループワードエラーレート(WER)ギャップを減らすのに有用な方向を与えるかどうかを問う。
Whisper-medium, HuBERT-large, Wav2Vec2-large on Common Voice and the Speech Accent Archive, we probe every encoder layer for metadata- derived sex/gender, age, and native-accent labels; construct centroid and probe- derived directions; inject them at selected layer; and comparison downstream probe trajectories with matched WER changes。
性ラベルは(最も高いマクロ-F1 0.924--0.941)、ネイティブ/アクセントラベルも(0.544-0.696)、年齢はより弱い(0.354-0.397)。
ポストセレクション後の22回のうち、9回は95%のペアリングブートストラップ間隔がゼロ以下であるが、全ての絶対源群WER還元は0.7ポイント未満である。
逆に、WERが悪化する一方、局所目標級プローブレートは8.09%から99.87%に上昇する。
したがって、線形可読性は因果的使用の証拠でも、信頼性のある緩和方法でもない。
本研究は,表現,伝播,タスクレベルでの発話バイアス介入の評価を動機づけるものである。
関連論文リスト
- When Do Internal Probes Beat Reading the Answer? Miscalibrated Readouts and Behavior-Concealed Knowledge in Language Models [0.0]
1200の論理的結論の検証を依頼された言語モデルは、毎回YESに答える。
隠れた状態の線形プローブは、0.96 AUCで正しい判定を読み取った。
判決がどこで失われるかを問うと、支配的な失敗は1つのスカラーであることがわかった。
診断は、90のセマンティックラベル構成で、5つのモデル、3つのファミリーの因子的、行動的精度が閾値オフセットの1つの関数に崩壊する。
論文 参考訳(メタデータ) (2026-09-04T00:26:45Z) - Advancing Speaker-Based Vocal Effort Classification with WavLM and Data Augmentation in Naturalistic Non-Calibrated Speech Recordings [28.280450577162622]
発声作業分類において初めてWavLMを導入し,wav2vec2 と HuBERT に対してベンチマークを行った。
Augmentation は WavLM を継続的に改善し、+0.6% から+1.8% まで上昇した。
我々の最良システムは、緩やかな凍結、拡張、ガウス近傍のソフトラベルを持つWavLM-BASEであり、平均精度は78.2%である。
論文 参考訳(メタデータ) (2026-06-25T20:46:48Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition [61.712328155788434]
現実世界のシステムは、ラベル付きデータに制限のある、目に見えないアクセントとドメインに遭遇する。
擬似ラベルは、しばしばフィルタリングが修正に失敗するシステマティックでアクセント固有のエラーをもたらす。
そこで本研究では,これらの繰り返しバイアスを目的の真理を含まない簡単なパラメータ空間補正を提案する。
論文 参考訳(メタデータ) (2025-10-09T10:31:47Z) - DENOASR: Debiasing ASRs through Selective Denoising [5.544079217915537]
本稿では,2つの性別グループ間の単語誤り率の相違を低減するために,選択的なデノケーション手法であるDeNOASRを提案する。
一般的な2つの音声認識手法である「DEMUCS」と「LE」を組み合わせることで、全体的な性能を損なうことなく、ASRの相違を効果的に軽減できることがわかった。
論文 参考訳(メタデータ) (2024-10-22T05:39:24Z) - Adversarial Training For Low-Resource Disfluency Correction [50.51901599433536]
ディフルエンシ補正(DC)のための逆学習型シーケンスタグ付けモデルを提案する。
提案手法の利点は,3つのインド語でDCに対して評価することで,合成された非流動データに大きく依存することを示す。
また,本手法は,音声障害によって導入されたASR文字の破面的不一致の除去にも有効である。
論文 参考訳(メタデータ) (2023-06-10T08:58:53Z) - Robust Unstructured Knowledge Access in Conversational Dialogue with ASR
Errors [10.912392792200812]
音声言語理解(SLU)の性能は自動音声認識(ASR)エラーで劣化させることができる。
ASRエラーシミュレータを用いてクリーントレーニングテキストをランダムに破損させることにより,SLUのロバスト性を改善する新しい手法を提案する。
提案するエラーシミュレータでは,ASRデコーダから生成した混乱ネットワークを人間の書き起こしなしで利用し,モデルトレーニングのための様々なエラーパターンを生成する。
論文 参考訳(メタデータ) (2022-11-08T04:04:02Z) - Speaker Embedding-aware Neural Diarization for Flexible Number of
Speakers with Textual Information [55.75018546938499]
本稿では,話者埋め込み認識型ニューラルダイアリゼーション(SEND)手法を提案する。
本手法は,ターゲット話者の音声活動検出よりも低いダイアリゼーション誤差率を実現する。
論文 参考訳(メタデータ) (2021-11-28T12:51:04Z) - HuBERT: Self-Supervised Speech Representation Learning by Masked
Prediction of Hidden Units [81.53783563025084]
本稿では、BERTのような予測損失に対して、アライメントされたターゲットラベルを提供するオフラインクラスタリングステップを提案する。
提案手法の重要な要素は,マスク領域にのみ予測損失を適用することである。
HuBERTは、より困難なdev-otherおよびtest-other評価サブセットに対して、最大19%と13%の相対的なWER削減を示す。
論文 参考訳(メタデータ) (2021-06-14T14:14:28Z) - A Second-Order Approach to Learning with Instance-Dependent Label Noise [58.555527517928596]
ラベルノイズの存在は、しばしばディープニューラルネットワークのトレーニングを誤解させる。
人間による注釈付きラベルのエラーは、タスクの難易度レベルに依存する可能性が高いことを示しています。
論文 参考訳(メタデータ) (2020-12-22T06:36:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。