論文の概要: Data-Poisoning Audits for Causal Effect Estimation
- arxiv url: http://arxiv.org/abs/2607.19692v1
- Date: Wed, 22 Jul 2026 02:46:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.954339
- Title: Data-Poisoning Audits for Causal Effect Estimation
- Title(参考訳): 因果効果推定のためのデータ収集監査
- Abstract要約: 逆確率重み付き推定のためのデータポゾン監査法を開発した。
このフレームワークは、より信頼性の高い因果報告とソースレベルのセーフガードの設計をサポートする。
- 参考スコア(独自算出の注目度): 4.727838288363022
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Observational causal analyses increasingly pool records across sites, vendors, and collection systems, creating vulnerability to append-only attacks in which plausible records are strategically selected to alter a reported treatment effect. We develop a data-poisoning audit for augmented inverse-probability-weighted estimation. The analyst specifies a finite catalog of feasible records, an append budget, and nested source capacities, and the adversary selects a feasible subset to maximize movement in a prespecified direction. With preprocessing and nuisance fits held fixed, we propose a greedy scan that computes the exact finite-sample worst-case movement at every append budget. To account for nuisance refitting, we go on to derive a total-influence score combining each record's direct contribution with its effect through the propensity and outcome models. We further obtain a conservative finite-budget bound for the fully refitted estimate. Extensive simulations validate the exact result and show that total influence improves local refit prediction, while multisite and public-data analyses demonstrate material sensitivity at small append budgets. By translating adversarial data-composition risk into movement curves and critical budgets, the framework supports more reliable causal reporting and the design of source-level safeguards.
- Abstract(参考訳): 観測因果解析は、サイト、ベンダー、収集システムにまたがって記録をプールし、報告された治療効果を変更するために、信頼できる記録を戦略的に選択した追加専用攻撃に対する脆弱性を生じる。
逆確率重み付き推定のためのデータポゾン監査法を開発した。
アナリストは、実行可能なレコードの有限カタログ、追加予算、ネストされたソース容量を特定し、敵は、所定の方向に移動を最大化するために実行可能なサブセットを選択する。
プリプロセッシングとニュアンスフィッティングが固定された状態で,各アタッチメント予算において,正確な有限サンプル最悪の動作を計算できるグリーディスキャンを提案する。
ニュアンス・リフィッティングを考慮し、各レコードの直接寄与と結果モデルによる効果とを組み合わせた総影響スコアを導出する。
さらに、完全再構成された見積もりに対して、保守的な有限予算境界を得る。
大規模なシミュレーションにより, 全体の影響が局所的適合予測を改善することを示すとともに, 多地点および公共データ分析により, 小予算での材料感度が示された。
逆データ構成リスクを移動曲線や臨界予算に翻訳することにより、より信頼性の高い因果報告とソースレベルの安全設計を支援する。
関連論文リスト
- Causal-Privacy Audit Workflow for Synthetic and Distilled Data in Dropout Support [16.74684135093015]
本研究では, 学生データ評価のための意思決定対応型因果監査ワークフローであるCaP-Evalを紹介する。
これは、予測ユーティリティ、治療効果の忠実さ、代替推定器、局所訓練記録近接性に関する、オリジナルの、蒸留された、逆合成、統計合成、および DPGNet のプライバシ指向のデータと比較する。
論文 参考訳(メタデータ) (2026-06-14T17:44:44Z) - How Useful is Causal Invariance for Domain Adaptation in Finite-Sample Settings? [58.740078141879984]
機械学習モデルは、トレーニングされたソースディストリビューションとは異なるターゲットディストリビューションにデプロイされると、しばしば劣化する。
因果関係に基づく領域一般化における最近の研究は、共用因果構造が不変な予測因子を誘導する方法を示している。
本稿では,完全あるいは部分的な因果知識が,教師付きドメイン適応を確実に改善できるかどうかについて検討する。
論文 参考訳(メタデータ) (2026-06-10T21:07:49Z) - PRISM: Differentially Private Synthetic Data with Structure-Aware Budget Allocation for Prediction [9.016539021471845]
差分プライバシー(DP)は、相手が解放されたデータからどんな個人について学べるかを制限する数学的保証を提供する。
既存のDP合成データ手法は、データが特定の予測タスクに役立つ場合でも、全ての特徴を対称に扱い、ノイズを均一に拡散する。
我々は、利用可能な構造知識に依存して、3つの体制で機能する予測中心のアプローチを開発する。
論文 参考訳(メタデータ) (2026-02-10T19:17:55Z) - Conformal Thinking: Risk Control for Reasoning on a Compute Budget [60.65072883773352]
大規模言語モデル(LLM)の推論により、トークンの予算が増加するにつれて、データセットレベルの精度が向上する。
我々は、予算設定問題をリスクコントロールとして再設定し、計算を最小化しながらエラー率を制限する。
我々のフレームワークは、モデルが自信のあるときに推論を停止する上位しきい値と、未解決のインスタンスを事前に停止させる新しい下位しきい値を導入する。
論文 参考訳(メタデータ) (2026-02-03T18:17:22Z) - Reasoning-Enhanced Rare-Event Prediction with Balanced Outcome Correction [45.88028371034407]
本稿では,予測のためのLPCORP(Low-Prevalence CORrector for Prediction)*を提案する。
医療・消費者サービス分野における実世界のデータセット上でLPCORPを評価する。
論文 参考訳(メタデータ) (2026-01-23T02:34:29Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - Distributionally Robust Optimization with Adversarial Data Contamination [49.89480853499918]
凸リプシッツ損失関数を持つ一般化線形モデルに対するワッサーシュタイン-1 DRO 目標の最適化に焦点をあてる。
私たちの主な貢献は、データ汚染のトレーニングに対するロバストネスと分散シフトに対するロバストネスを統合した、新しいモデリングフレームワークです。
この研究は、データ汚染と分散シフトという2つの課題の下で学習するために、効率的な計算によって支援される最初の厳密な保証を確立する。
論文 参考訳(メタデータ) (2025-07-14T18:34:10Z) - Graph-Based Prediction Models for Data Debiasing [6.221408085892461]
データ収集におけるバイアスは、低レポートと過剰レポートの両方から発生し、医療と公共の安全において重大な課題を提起する。
グラフベースのOver- and Under-Reporting Debiasing (GROUD) は,真のインシデント数と関連するレポートバイアス確率を共同で推定することにより,レポートデータを排除する新しいグラフベースの最適化フレームワークである。
GROUDは、アトランタの緊急電話や新型コロナウイルスワクチンの有害事象報告を含む、挑戦的なシミュレーション実験と実世界のデータセットの両方で検証する。
論文 参考訳(メタデータ) (2025-04-12T21:34:49Z) - Semiparametric conformal prediction [79.6147286161434]
ベクトル値の非整合性スコアの結合相関構造を考慮した共形予測セットを構築する。
スコアの累積分布関数(CDF)を柔軟に推定する。
提案手法は,現実の回帰問題に対して,所望のカバレッジと競争効率をもたらす。
論文 参考訳(メタデータ) (2024-11-04T14:29:02Z) - Rejection via Learning Density Ratios [50.91522897152437]
拒絶による分類は、モデルを予測しないことを許容する学習パラダイムとして現れます。
そこで我々は,事前学習したモデルの性能を最大化する理想的なデータ分布を求める。
私たちのフレームワークは、クリーンでノイズの多いデータセットで実証的にテストされます。
論文 参考訳(メタデータ) (2024-05-29T01:32:17Z) - Which Invariance Should We Transfer? A Causal Minimax Learning Approach [18.71316951734806]
本稿では、因果的観点からの包括的ミニマックス分析について述べる。
最小の最悪のリスクを持つサブセットを探索する効率的なアルゴリズムを提案する。
本手法の有効性と有効性は, 合成データとアルツハイマー病の診断で実証された。
論文 参考訳(メタデータ) (2021-07-05T09:07:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。