論文の概要: Beyond Aggregate Calibration: Decomposing Income-Conditional Recall Disparities in Automated Credit Default Prediction
- arxiv url: http://arxiv.org/abs/2608.08202v1
- Date: Sat, 08 Aug 2026 15:57:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.721185
- Title: Beyond Aggregate Calibration: Decomposing Income-Conditional Recall Disparities in Automated Credit Default Prediction
- Title(参考訳): 集約キャリブレーションを超えて - 自動クレジットデフォルト予測におけるインカム・コンディショナル・リコールの相違を分解する
- Abstract要約: 高所得既定者は低所得既定者に対してラベルノイズとして不均等に分類される。
16.86パーセントのポイントギャップは、最終的にデフォルトとなった高所得者と低所得者の間で真の正のレート(リコール)である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Data-centric curation pipelines frequently rely on model confidence scores to flag and filter noisy or mislabeled training instances. Evaluating this filtering convention on a large-scale consumer lending sample (LendingClub, N = 1,344,936) uncovers an underlying demographic asymmetry: high-income defaulters are disproportionately classified as label noise relative to low-income defaulters (Cramer's V approximately 0.03-0.07). Re-examining this behavior through the lens of equal opportunity [Hardt et al., 2016] reveals a far more severe discrepancy: a 16.86 percentage point gap in true positive rate (recall) between high- and low-income borrowers who ultimately defaulted. Implementing a sequential feature-blinding methodology allows us to isolate the drivers of this disparity across three distinct mechanisms: (1) direct reliance on self-reported applicant income; (2) algorithmic absorption of upstream institutional bias encoded within origination interest rates; and (3) a residual disparity (3.55 percentage points in cross-validation; 2.56 percentage points on a held-out test partition, Z = -4.04, p < 0.0001) that remains even after purging both income and interest rates from the model. Out-of-sample signed SHAP valuations demonstrate that this residual gap is maintained by structural proxies, most notably loan amount and home ownership status. These empirical findings show that simply blinding an algorithm to sensitive attributes fails to ensure fairness when institutional pricing decisions and behavioral proxy variables collectively reconstruct the omitted signals. We outline the practical implications of these findings for auditing data-centric AI workflows within regulated financial institutions.
- Abstract(参考訳): データ中心のキュレーションパイプラインは、しばしば、ノイズの多いトレーニングインスタンスやラベルの間違えたトレーニングインスタンスをフラグやフィルタするために、モデルの信頼性スコアに依存する。
大規模消費者貸出サンプル(LendingClub, N = 1,344,936)上のこのフィルタリング規則を評価すると、下層の非対称性が明らかになる。
平等な機会のレンズ(Hardt et al , 2016)を通してこの行動を再検討すると、はるかに深刻な相違が明らかになる: 最終的にデフォルトとなった高所得者と低所得者の間では、真の正の率(リコール)の16.86ポイントの差がある。
1)自己申告申告申告者所得への直接的な依存,(2)起因利率に符号化された上流機関バイアスのアルゴリズム的吸収,(3)残差(クロスバリデーションにおける3.55ポイント),2.56ポイントの保持テストパーティション,Z = -4.04, p < 0.0001) の3つのメカニズムにより,この格差の要因を分離することができる。
サンプル外署名のSHAP評価は、この残差が構造的プロキシ(特にローン金額と住宅所有状況)によって維持されていることを示している。
これらの経験的知見は、アルゴリズムを機密属性に無視するだけで、制度的な価格決定や行動代行変数が省略された信号をまとめて再構築した場合、公平性を確保することができないことを示している。
規制金融機関におけるデータ中心型AIワークフローの監査におけるこれらの知見の実践的意義について概説する。
関連論文リスト
- The Magnitude Mirage: Rethinking Confidence for Reasoning-Intensive Retrieval [22.82938587928396]
多くのRAGシステムは、生の類似度スコアをしきい値にし、スコアの大きさを信頼信号として暗黙的に扱うことにより、検索停止を実装している。
クエリはセマンティックマッチング以上の推論を必要とするため,このプラクティスは体系的に劣化することを示す。
計算コストのかかる代替手段を使わずにこの問題に対処するため、我々は3つの認知層にわたる6つのゼロコストクエリパフォーマンス予測(QPP)メトリクスを大規模に検討した。
論文 参考訳(メタデータ) (2026-09-14T13:49:24Z) - Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay [0.6768558752130311]
単一エージェント環境において,実行されたリプレイからポリシー条件の真偽を検査する。
段階的な信用シグナルは、限界整合シャッフル制御以上の信頼度の高いインクリメンタル忠実度を示すものではない。
信頼のみのルータは、チャンスレベルにおいて重要なステップを回復するが、1ターンあたりの審査コストを13.1%削減する。
論文 参考訳(メタデータ) (2026-08-20T08:04:00Z) - PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と1万個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - From Observation to Intervention: A Causal Audit of Expert Importance in Mixture-of-Experts Models [0.2230291569252836]
本研究では,Mixture-of-Experts (MoE) プルーニングにおけるルーティング統計の利用について検討する。
あらゆるモデルにおいて因果的専門家の重要性を予測する観察的指標は見つからない。
以上の結果から, 人口レベルの観察結果から, 専門家の重要度に関するトークンレベルの介入主張まで, 共通の推論段階に対する明確な反例が得られた。
論文 参考訳(メタデータ) (2026-06-09T11:04:19Z) - Do Fair Models Reason Fairly? Counterfactual Explanation Consistency for Procedural Fairness in Credit Decisions [0.0]
既存の結果フェアモデルは、個人に対して根本的に異なる推論を適用可能であることを示す。
本稿では,このバイアスを検出し緩和するフレームワークであるCECを提案する。
主なコントリビューションには、最寄りのカウンターファクト生成方法、統合勾配比較のための修正ベースライン、およびそれに対応するトレーニング損失が含まれる。
論文 参考訳(メタデータ) (2026-05-12T19:54:25Z) - Towards Anytime-Valid Statistical Watermarking [63.02116925616554]
我々は、任意の時間価推論で最適なサンプリングを統一する、最初のe-value-based watermarking frameworkであるAnchored E-Watermarkingを開発した。
本フレームワークはサンプル効率を大幅に向上させ,最先端のベースラインに対して,検出に必要な平均トークン予算を13~15%削減する。
論文 参考訳(メタデータ) (2026-02-19T18:32:26Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Dependence-Aware Label Aggregation for LLM-as-a-Judge via Ising Models [55.94503936470247]
大規模なAI評価は、審査員を含む、$K$アノテータからのバイナリ判断を集約することにますます依存している。
ほとんどの古典的なメソッドは、アノテータが条件的に独立であると仮定するが、真のラベルは$Yin0,1$であり、この仮定は LLM の審査員によってしばしば違反される。
我々はIsingグラフィカルモデルと潜在因子に基づく依存認識モデルの階層構造を通してラベルアグリゲーションを研究する。
論文 参考訳(メタデータ) (2026-01-29T21:26:50Z) - Empirical Likelihood-Based Fairness Auditing: Distribution-Free Certification and Flagging [18.71249153088185]
リシビズム予測や人事自動選択といった高度な応用における機械学習モデルは、しばしば体系的な性能格差を示す。
本稿では,モデル性能の相違に対する頑健な統計的尺度を構築するための実験的可能性ベース(EL)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-28T05:36:19Z) - Matchings Under Biased and Correlated Evaluations [18.002268181853527]
2つの異なるグループからの候補を評価できる2施設の安定マッチングモデルについて検討した。
マッチングプロセスによって選択された不利な候補に対する表現比、すなわち不利な候補の割合について検討する。
論文 参考訳(メタデータ) (2025-10-24T00:33:52Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。