論文の概要: Shapley Value Estimation for Multi-Site Data with Blockwise-Missing Features
- arxiv url: http://arxiv.org/abs/2609.14902v1
- Date: Mon, 14 Sep 2026 01:42:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:06.029714
- Title: Shapley Value Estimation for Multi-Site Data with Blockwise-Missing Features
- Title(参考訳): ブロックワイズを考慮したマルチサイトデータの共有値推定
- Abstract要約: textbfFUSHAP (textbfFusion textbfShapley textbfAttribution from textbfPartially-observed data)を提案する。
FUSHAP は単サイト推定値よりも 3$--$8times$ MSE が低く、2$--$3times$ MSE が命令ベースラインより低い。
- 参考スコア(独自算出の注目度): 16.556294814062348
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Shapley value (SV)-based methods are the prevailing framework for feature attribution in machine learning, yet existing population-level Shapley estimators generally assume that observations used to evaluate the coalitional game are fully observed under a common feature space. This assumption is routinely violated in multi-site studies across biomedicine, social science, and environmental monitoring, where institutions record different features under different protocols, producing systematic blockwise missingness across sources. We first show that the standard remedy of imputing missing features before computing Shapley values introduces systematic, coalition-dependent bias into the resulting attributions. We then propose \textbf{FUSHAP} (\textbf{Fu}sion \textbf{Sh}apley \textbf{A}ttribution from \textbf{P}artially-observed data), a method that leverages partially-observed auxiliary sites to reduce the variance of a preliminary single-site Shapley estimate without imputation. A permutation-based screening step detects and excludes sites whose data distributions are incompatible with the target population. In synthetic experiments, FUSHAP achieves $3$--$8\times$ lower MSE than the single-site estimator and $2$--$3\times$ lower MSE than imputation baselines without incurring imputation-induced bias, and the screening procedure identifies misaligned sites with $82\%$ power at moderate misalignment and $100\%$ for strong misalignment. On multi-site air quality and multi-center clinical data, FUSHAP reduces MSE by approximately $3$--$7\times$ relative to the single-site estimator; in the clinical application, standard imputation can increase MSE above the single-site baseline.
- Abstract(参考訳): 共有値(SV)に基づく手法は、機械学習における特徴属性の一般的なフレームワークであるが、既存の集団レベルの共有値推定器は、連立ゲームを評価するために使われる観測が共通の特徴空間下で完全に観察されていると一般的に仮定する。
この仮定は、バイオメディシン、社会科学、環境モニタリングの多地点研究において、異なるプロトコルの下で異なる特徴を記録し、ソース間の体系的なブロックワイドな欠如を生み出すという、日常的に違反している。
最初に、共有値の計算に先立って欠落した特徴を示唆する標準的な治療法が、結果として生じる属性に体系的、連立依存バイアスをもたらすことを示す。
次に、部分観測された補助的部位を活用して、予備的な単サイトシェープ推定値の分散を計算なしで低減する手法である \textbf{FUSHAP} (\textbf{Fu}sion \textbf{Sh}apley \textbf{A}ttribution from \textbf{P}artially-observed data) を提案する。
置換ベースのスクリーニングステップは、データ分布がターゲットの人口と互換性のないサイトを検出して除外する。
総合的な実験では、FUSHAPは単サイト推定値よりも3ドル~8ドル~8ドル~2ドル~3ドル~3ドル~1ドル~2ドル~3ドル~2ドル~3ドル~2ドル~3ドル~2ドル~3ドル~2ドル~3ドル~2ドル~3ドル~2ドル~3ドル~2ドル~3ドル~2ドル~3ドル~2ドル~3ドル~2ドル~3ドル~3ドル~。
多地点の空気質と多施設の臨床データについて、FUSHAPは単地点推定器と比較して、MSEを約3ドル~7ドル値で削減する。
関連論文リスト
- What Do Medical Vision-Language Models Learn in Radiology? Transfer, Alignment, and Source-Proxy Leakage Under Distribution Shift [3.5023163663015286]
医療ビジョン言語モデル(VLM)は、取得ドメイン、ペア管理、評価プロトコルの変更で失敗しながら、ドメイン内で信頼性の高いように見える。
まず、教師なしドメイン適応診断からソースのみのクロスデータセットのビジュアルトランスファーを分離する。
次に、厳密なペアインデックス検索の下でマルチモーダルアライメントを評価し、メタデータ由来のソースプロキシ情報を定量化する。
論文 参考訳(メタデータ) (2026-08-26T00:19:45Z) - How Useful is Causal Invariance for Domain Adaptation in Finite-Sample Settings? [58.740078141879984]
機械学習モデルは、トレーニングされたソースディストリビューションとは異なるターゲットディストリビューションにデプロイされると、しばしば劣化する。
因果関係に基づく領域一般化における最近の研究は、共用因果構造が不変な予測因子を誘導する方法を示している。
本稿では,完全あるいは部分的な因果知識が,教師付きドメイン適応を確実に改善できるかどうかについて検討する。
論文 参考訳(メタデータ) (2026-06-10T21:07:49Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - Discovery of Hidden Miscalibration Regimes [52.452902154360565]
モデルは何らかの入力を体系的に過信し、他人を過信することがある。
対応する誤校正分野を定義し,それを推定するための診断フレームワークを提案する。
提案手法は,入力空間のキャリブレーションを意識した表現を学習し,学習幾何学におけるカーネルの平滑化による符号付き局所的誤校正を推定する。
論文 参考訳(メタデータ) (2026-05-13T13:07:50Z) - Active Multiple-Prediction-Powered Inference [2.1710524042938073]
医療のデプロイ後のモニタリングには統計的に有効なラベル効率の方法が必要であるが、クリニックチャートのゴールドスタンダードラベルは高価である。
我々は,各インスタンスをコスト適切な予測器にルーティングし,金標準ラベルを比例してサンプリングし,単一のデプロイ時間に予測を再現する予測能動型推論(AM-PPI)を提案する。
論文 参考訳(メタデータ) (2026-05-08T19:48:57Z) - Tight Convergence Rates for Online Distributed Linear Estimation with Adversarial Measurements [66.94250413799232]
分散パラメータ-サーバ-ワーカー設定における乱数ベクトル$X$の推定について検討する。
主な課題は、敵の計測と非同期である。
その結果, 分散線形推定におけるロバスト性, 識別性, 統計的効率の統一的有限時間評価が得られた。
論文 参考訳(メタデータ) (2026-04-07T11:45:55Z) - Perfect Clustering for Sparse Directed Stochastic Block Models [1.3464152928754485]
スパース指向SBMにおけるコミュニティ検出のための非スペクトル2段階手法を提案する。
提案手法はまず,非対称設定に適した近傍平滑化スキームを用いて有向確率行列を推定する。
提案手法は,有向スペクトル法とスコア法が劣化した状況下で確実に動作可能であることを示す。
論文 参考訳(メタデータ) (2026-01-23T03:53:20Z) - Conformal Prediction for Multi-Source Detection on a Network [59.17729745907474]
マルチソース検出問題について検討する。
グラフ上のノード感染状況のスナップショットが与えられた場合、伝播を開始するソースノードのセットを推定する。
本稿では,ソースセット検出のための統計的に有効なリコール保証を提供する新しいコンフォメーション予測フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-12T01:09:56Z) - Federated Causal Inference from Multi-Site Observational Data via Propensity Score Aggregation [0.0]
因果推論は通常、個々のレベルのデータへの集中的なアクセスを仮定する。
本稿では,フェデレートラーニング(FL)手法を用いて,分散化された観測データから平均処理効果(ATE)を推定することにより,この問題に対処する。
論文 参考訳(メタデータ) (2025-05-23T14:32:57Z) - Localizing Anomalies via Multiscale Score Matching Analysis [13.898576482792173]
本稿では,脳MRIにおける異常局所化のための新しい教師なし手法であるSpatial-MSMAを紹介する。
パッチ位置とグローバル画像の特徴を条件としたフレキシブルな正規化フローモデルを用いて、パッチワイド異常スコアを推定する。
この方法は、通常発達している幼児の1,650T1およびT2重み付き脳MRIのデータセットで評価される。
論文 参考訳(メタデータ) (2024-06-28T17:57:12Z) - Causality Pursuit from Heterogeneous Environments via Neural Adversarial Invariance Learning [12.947265104477237]
データから因果関係を抽出することは、科学的発見、治療介入、伝達学習における根本的な問題である。
本稿では,複数の環境における回帰モデルにおける非パラメトリック不変性と因果学習に対処するアルゴリズムを提案する。
提案したFocused Adrial Invariant Regularizationフレームワークは、逆検定により回帰モデルを予測不変解へ向ける革新的なミニマックス最適化手法を利用する。
論文 参考訳(メタデータ) (2024-05-07T23:37:40Z) - Test-time Batch Statistics Calibration for Covariate Shift [66.7044675981449]
我々は,推論中に深層モデルを新しい環境に適応させることを提案する。
バッチ統計の校正に$alpha$-BNの一般的な定式化を提案する。
また、統合テスト時間適応フレームワークCoreを形成するための新しい損失関数も提示する。
論文 参考訳(メタデータ) (2021-10-06T08:45:03Z) - Batch Stationary Distribution Estimation [98.18201132095066]
サンプル遷移の組を与えられたエルゴードマルコフ鎖の定常分布を近似する問題を考える。
与えられたデータに対する補正比関数の復元に基づく一貫した推定器を提案する。
論文 参考訳(メタデータ) (2020-03-02T09:10:01Z) - GenDICE: Generalized Offline Estimation of Stationary Values [108.17309783125398]
重要なアプリケーションでは,効果的な推定が依然として可能であることを示す。
我々のアプローチは、定常分布と経験分布の差を補正する比率を推定することに基づいている。
結果として得られるアルゴリズム、GenDICEは単純で効果的である。
論文 参考訳(メタデータ) (2020-02-21T00:27:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。