論文の概要: Diverse Geometries, Frozen Weights: Robust Heterogeneous Treatment-Effect Estimation via Causal Expert Ensembles
- arxiv url: http://arxiv.org/abs/2609.29974v2
- Date: Fri, 25 Sep 2026 14:41:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.058584
- Title: Diverse Geometries, Frozen Weights: Robust Heterogeneous Treatment-Effect Estimation via Causal Expert Ensembles
- Title(参考訳): 多様な測地線, 凍結重量:ロバストな不均一な処理-因果的専門家の集まりによる影響評価
- Abstract要約: 我々はGeoACE(Geometry-Diverse Anchor-Correction Expert Ensemble)を紹介する。
GeoACEは一般的なアンカー補正推定器と相補的な重複認識と結果誘導測度を組み合わせたものである。
我々はGeoACEを8つのベンチマークプロトコル上で11個のコンパレータに対して評価する。
- 参考スコア(独自算出の注目度): 0.29057513016551234
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Estimating heterogeneous treatment effects from observational data is difficult because the most appropriate inductive bias varies with overlap, treatment imbalance, prognostic structure, and sample size. We introduce the Geometry-Diverse Anchor-Correction Expert Ensemble (GeoACE), a five-expert framework that combines a common anchor-correction estimator with complementary overlap-aware and outcome-guided geometries. Its task-level ensemble weights are learned only from internal validation predictions, frozen before test evaluation, and then applied to experts refitted on the complete development sample. The fifth expert, O-Phi-ACE, constructs an outcome-free, overlap-aware statistical projection from covariates and treatment assignment and replaces the anchor input with this lower-dimensional geometry. We evaluate GeoACE against 11 comparators on eight benchmark protocols. Adding O-Phi-ACE reduced mean sqrt(PEHE) relative to the four-expert ensemble on all seven benchmarks with individual-effect truth, winning 998 of 1,225 paired tasks; the change on JOBS policy risk was negligible. The five-expert ensemble ranked first on IHDP100, IHDPA, and IHDPB and second on NEWS, differing from the NEWS leader by 0.13%. Across the seven sqrt(PEHE) benchmarks it obtained the lowest observed average rank (3.714), although the omnibus Friedman and Iman-Davenport tests were not significant (p=0.328 and p=0.330). Using the same five frozen experts, inverse-DR weighting was consistently better than winner-take-all selection, convex DR fitting, R-stacking, and causal Q-aggregation in benchmark-balanced analyses, but was statistically indistinguishable from equal weighting and DR ridge shrinkage. The evidence therefore supports geometry-diverse expert libraries and leakage-free aggregation as a robustness strategy, not universal superiority of either GeoACE or one weighting rule.
- Abstract(参考訳): 観測データから不均一な処理効果を推定することは、最も適切な誘導バイアスは重なり合い、治療不均衡、予後構造、サンプルサイズによって異なるため困難である。
GeoACE(Geometry-Diverse Anchor-Correction Expert Ensemble)は、一般的なアンカー補正推定器と相補的な重複認識と結果誘導測地を組み合わせた5つの専門的なフレームワークである。
そのタスクレベルのアンサンブルウェイトは、内部の検証予測からのみ学習され、テスト評価の前に凍結され、完全な開発サンプルに適合した専門家に適用される。
第5のエキスパートであるO-Phi-ACEは、共変量と処理の代入から結果のない重複認識の統計予測を構築し、アンカー入力をこの低次元幾何学に置き換える。
我々はGeoACEを8つのベンチマークプロトコル上で11個のコンパレータに対して評価する。
O-Phi-ACEを追加することで、個々の実効性のある7つのベンチマークで4つの専門的なアンサンブルに対して平均sqrt(PEHE)が減少し、1,225のペアタスクのうち998が勝利した。
IHDP100、IHDPA、IHDPBで第1位、NEWSで第2位となり、NEWSのリーダーと0.13%異なる。
7つのsqrt(PEHE)ベンチマークで観測された平均ランクは3.714であったが、Omnibus Friedman と Iman-Davenport の試験は重要ではなかった(p=0.328 と p=0.330)。
同じ5つの凍結した専門家を用いて、逆DR重み付けは、ベンチマークバランス解析において、勝者の総選択、凸DRフィッティング、R-スタッキング、因果Q-アグリゲーションよりも一貫して優れていたが、等重み付けとDR尾根の収縮とは統計的には区別がつかなかった。
この証拠は、GeoACEや重み付け規則の普遍的な優位性ではなく、ロバストネス戦略として、幾何学的多様性の専門家ライブラリとリークフリーアグリゲーションを支持している。
関連論文リスト
- Does Reasoning Improve Psychological Depth in Large Language Models? It Depends on Who's Judging [41.62710134204231]
短い物語において、心理学的深度を通して失敗モードを研究する。
審査員の、その開発セットにおける人間の評価との相関は、アウトプットが密に一致し、人間の嗜好が主観的である場合、有効な測定を保証できない可能性がある。
これらの結果から, 開発段階の性能は, シフト分布におけるデプロイメントの有効性の証拠として不十分であることが示唆された。
論文 参考訳(メタデータ) (2026-09-12T07:34:54Z) - Feature Priming in Online Linear Regression: Sparse-Regret Lower Bounds and a Tight Univariate Rate [47.36630149538994]
高次元のオンライン予測では、最良の予測子はいくつかの機能にのみ依存する可能性があるため、後悔は周囲の次元ではなく、疎らさでスケールすべきである。
WarmuthとAmidはCOLT 2023で、これらの3つのルールのいずれかが競合するオンライン後悔の保証を認めているかどうかを尋ねた。
安価なニュアンスは、リフィットが真の予測座標を過度に重くする原因となる。
論文 参考訳(メタデータ) (2026-08-18T09:32:03Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets [4.193537335690018]
本稿では,構造抽出とサブプリンシプル固有評価器を組み合わせたマルチエージェントフレームワークであるAgentFAIRを提案する。
それぞれが0-3の成熟度スコア、エビデンス、レコメンデーションを生成します。
15データセットの専門家による予備的な研究では、フライスのカッパは0.71で、82%が専門家のコンセンサスと一致している。
論文 参考訳(メタデータ) (2026-07-17T09:32:54Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - Metric Aggregation Divergence: A Hidden Validity Threat in Agent-Based Policy Optimization and a Contractual Remedy [7.1976264551575895]
メートル法アグリゲーション分散(英: Metric aggregate divergence、MAD)は、エージェントベースのモデルにおいて、異なるパイプラインステージで発生するサイレント不整合である。
私たちは、ディスパッチ時に実施される単一の呼び出し可能なランタイムであるメトリックコントラクトを、対策として紹介します。
論文 参考訳(メタデータ) (2026-06-27T18:17:33Z) - Constraint-Aware Optimization for Robust Protein Stability Prediction [0.3316543849024811]
逆フォールディング表現を用いたタンパク質言語モデルの統合によるMultimodal $G$は,Megascaleデータセット上で強力な分布精度を実現する。
既存のアプローチは、これらの制限に主に追加のアーキテクチャコンポーネントを通して対処する。
本稿では, 平衡平均二乗誤差, シームズ反対称正則化器と, 位置推定器の特徴表現における新しいOODマージン損失を組み合わせた制約対応最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-06T11:04:52Z) - Beyond Point Estimates: Benchmarking Uncertainty Quantification Methods on the AION-1 Astronomical Foundation Model [47.71489969727656]
Conformalized Quantile Regression (CQR)は、最も貧弱なモデル予測で、ビン内で最高のカバレッジを提供する。
局所的妥当性判別(Locally Valid and Discriminative, LVD)フレームワークのみが、有限サンプルの局所的妥当性を提供する。
論文 参考訳(メタデータ) (2026-06-05T18:29:19Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。