論文の概要: A Multi-Dimensional Evaluation of Explainability in Media Bias Detection
- arxiv url: http://arxiv.org/abs/2607.19954v1
- Date: Wed, 22 Jul 2026 09:29:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.048134
- Title: A Multi-Dimensional Evaluation of Explainability in Media Bias Detection
- Title(参考訳): メディアバイアス検出における説明可能性の多次元評価
- Abstract要約: 本稿では,Bias s By Expertsデータセットを用いたエンコーダによるメディアバイアス検出における説明可能性の多次元評価を行う。
我々は,BERTとRoBERTaを,予測性能,説明妥当性,機械的忠実性の3つの相補的軸に沿った分類器として検討した。
本研究は, 予測性能, 帰属確率, 機械的忠実度が, モデル行動の異なる側面を特徴付けることを示唆している。
- 参考スコア(独自算出の注目度): 10.798797986346914
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Detecting media bias automatically is difficult because biased framing is often subtle, yet in domains such as news analysis, accurate predictions alone are insufficient without explanations that reflect the model's underlying reasoning. We present a multi-dimensional evaluation of explainability in encoder-based media bias detection using the Bias Annotations By Experts (BABE) dataset. Specifically, we study BERT and RoBERTa as classifiers (base and large variants) along three complementary axes: predictive performance, explanation plausibility (token-level alignment with expert rationales), and mechanistic faithfulness (whether compact sets of attention heads recover predictive signal under counterfactual rationale masking). To induce variation in plausibility, we additionally investigate attention-supervised finetuning, which incorporates expert rationale annotations as an auxiliary training signal. Attention supervision serves as an intervention on attribution plausibility, while the effectiveness of attribution methods varies substantially across architectures. Circuit analysis further reveals substantial variation in mechanistic recoverability across architectures, suggesting that model scale alone does not determine circuit compressibility. Taken together, our findings suggest that predictive performance, attribution plausibility, and mechanistic faithfulness characterize different aspects of model behavior and should be evaluated separately when studying explainability in media bias detection.
- Abstract(参考訳): メディアバイアスの自動検出は、バイアスフレーミングが微妙な場合が多いため困難であるが、ニュース分析のような領域では、モデルの基本的推論を反映した説明なしで正確な予測が不十分である。
本稿では,Bias Annotations By Experts (BABE) データセットを用いて,エンコーダを用いたメディアバイアス検出における説明可能性の多次元評価を行う。
具体的には,BERT と RoBERTa を3つの相補的軸に沿って分類器(ベースおよび大きな変種)として検討し,予測性能,説明的妥当性(有理量との整合性),機械的忠実度(対実的有理数マスキング下での予測信号の回復性)について検討した。
また,有能な合理性アノテーションを補助的訓練信号として組み込んだ注意制御微調整についても検討した。
注意監督は帰属確率の介入として機能し、帰属手法の有効性は建築によって大きく異なる。
回路解析により、アーキテクチャ間での機械的回復可能性のかなりの変動が明らかとなり、モデルスケールだけでは回路圧縮性は決定できないことが示唆された。
その結果, メディアバイアス検出において, 予測性能, 帰属妥当性, 機械的忠実度は, モデル行動の異なる側面を特徴付けることが示唆され, メディアバイアス検出における説明可能性の研究において, 別々に評価されるべきであることがわかった。
関連論文リスト
- Uncertainty-Aware Deepfake Detection via Multi-View Structural Learning [6.951909224842812]
セキュリティクリティカルなバイオメトリックおよび法医学的応用は、特に分布シフトの下で、正確な予測と信頼性の高い信頼推定を必要とする。
相補的な証拠源間の不整合による操作を識別する不確実性を考慮したディープフェイク検出フレームワークを提案する。
証拠ストリーム間の矛盾を予測的不確実性にリンクする不一致不確実性モデリング機構であるIBDC(Inter-Branch Disagreement)を導入する。
論文 参考訳(メタデータ) (2026-07-30T18:42:01Z) - Beyond the Mean: Modelling Annotation Distributions in Continuous Affect Prediction [3.3187704612685267]
ベータ分布を用いたアノテーションのコンセンサスをモデル化する分散対応フレームワークを提案する。
モデルでは、単一の影響値を予測する代わりに、アノテーション分布の平均と標準偏差を推定する。
その結果、このモデルは感情知覚の中心的な傾向だけでなく、アノテータ応答における変動性、非対称性、不確実性も捉えている。
論文 参考訳(メタデータ) (2026-04-08T15:26:56Z) - Decoding the Critique Mechanism in Large Reasoning Models [50.821607345799386]
大規模推論モデル(LRM)は、バックトラックと自己検証メカニズムを示し、中間ステップを修正して正しい解に到達できるようにする。
中間推論ステップに算術ミスを挿入することにより,現在のLEMがエラーからどのように回復するかを検討する。
チェーン・オブ・シークレットを伝播する誤りにもかかわらず、モデルは依然として正しい最終解に達している。
論文 参考訳(メタデータ) (2026-03-17T10:03:30Z) - On the Effects of Adversarial Perturbations on Distribution Robustness [25.334167445566496]
対向ロバスト性(英: Adversarial robustness)とは、入力の摂動に抵抗するモデルの能力を指す。
分散ロバスト性は、データシフト時のモデルの性能を評価する。
以前の研究は、流通と敵の堅牢性におけるトレードオフを明らかにしていた。
論文 参考訳(メタデータ) (2026-01-23T05:49:46Z) - Explaining News Bias Detection: A Comparative SHAP Analysis of Transformer Model Decision Mechanisms [0.2538209532048867]
本稿では,BABEデータセットに微調整されたバイアス検出モデルと,BABEデータセットに微調整されたドメイン適応型RoBERTaモデルとの2つのバイアス検出モデルの比較解釈可能性について述べる。
モデルアーキテクチャの違いが言語バイアスをどう操作するかを特徴付けるために、正しい予測と不正確な予測にまたがる単語レベルの属性を分析する。
論文 参考訳(メタデータ) (2025-12-29T19:58:11Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - Identifiable Latent Neural Causal Models [82.14087963690561]
因果表現学習は、低レベルの観測データから潜伏した高レベルの因果表現を明らかにすることを目指している。
因果表現の識別可能性に寄与する分布シフトのタイプを決定する。
本稿では,本研究の成果を実用的なアルゴリズムに翻訳し,信頼性の高い潜在因果表現の取得を可能にする。
論文 参考訳(メタデータ) (2024-03-23T04:13:55Z) - Quantification of Predictive Uncertainty via Inference-Time Sampling [57.749601811982096]
本稿では,データあいまいさの予測不確実性を推定するためのポストホックサンプリング手法を提案する。
この方法は与えられた入力に対して異なる可算出力を生成することができ、予測分布のパラメトリック形式を仮定しない。
論文 参考訳(メタデータ) (2023-08-03T12:43:21Z) - Feature Perturbation Augmentation for Reliable Evaluation of Importance
Estimators in Neural Networks [5.439020425819001]
ポストホック解釈可能性法は、ディープニューラルネットワークの内部動作をより解釈可能にしようとする。
最も一般的な評価フレームワークの1つは、解釈可能性メソッドによって重要とみなされる機能を摂動させることである。
モデルトレーニング中に摂動画像を生成し,付加する特徴摂動増強(FPA)を提案する。
論文 参考訳(メタデータ) (2023-03-02T19:05:46Z) - Self-supervised debiasing using low rank regularization [59.84695042540525]
純粋な相関は、ディープニューラルネットワークの強いバイアスを引き起こし、一般化能力を損なう可能性がある。
ラベルのないサンプルと互換性のある自己監督型脱バイアスフレームワークを提案する。
注目すべきは,提案フレームワークが自己教師付き学習ベースラインの一般化性能を著しく向上させることである。
論文 参考訳(メタデータ) (2022-10-11T08:26:19Z) - Deconfounding to Explanation Evaluation in Graph Neural Networks [136.73451468551656]
我々は、全グラフと部分グラフの間に分布シフトが存在し、分布外問題を引き起こすと論じる。
本稿では,モデル予測に対する説明文の因果効果を評価するために,Decon founded Subgraph Evaluation (DSE)を提案する。
論文 参考訳(メタデータ) (2022-01-21T18:05:00Z) - Investigating Bias in Image Classification using Model Explanations [0.0]
モデル説明が識別特徴を強調することで画像分類のバイアスを効率的に検出できるかどうかを評価する。
バイアス検出の重要な特徴を定式化し,モデルのバイアスの程度が変化するにつれて説明がどのように変化するかを観察した。
論文 参考訳(メタデータ) (2020-12-10T05:27:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。