論文の概要: The Confounder Trap: Treatment-Encoding Representations in Causal Inference with Text
- arxiv url: http://arxiv.org/abs/2607.26309v1
- Date: Tue, 28 Jul 2026 22:10:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.490213
- Title: The Confounder Trap: Treatment-Encoding Representations in Causal Inference with Text
- Title(参考訳): 共同創設者のトラップ:テキストによる因果推論における処理-エンコード表現
- Abstract要約: 本稿では,レキシコンなどの語彙情報を通じて符号化された潜時テキスト処理について検討する。
表現学習の前にこの語彙処理信号を除去するマスキングに基づく調整表現を提案する。
- 参考スコア(独自算出の注目度): 40.629939397543765
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Estimating causal effects of linguistic properties from observational text is difficult because the same document can contain both the treatment of interest and the non-treatment textual attributes needed for adjustment. Existing approaches often learn representations from the full text to capture latent confounding, but when treatment status is itself encoded by words in the text, these representations can directly encode treatment. This creates a confounder trap: richer representations can make treated and control documents separable, inducing overlap violations even when the underlying causal problem satisfies overlap. We study latent text treatments that are encoded through lexicons or other treatment-defining lexical information, and propose masking-based adjustment representations that remove this lexical treatment signal before representation learning. We formalize representation-induced overlap failure, prove that deletion masking preserves overlap for bag-of-words/topic-model representations, and characterize replacement masking as a natural relaxation for large language models that hides treatment-defining tokens while preserving word order and context. Across simulations, masking improves overlap diagnostics, stabilizes treatment effect estimates, and reduces bias relative to adjustment methods that learn from the unmasked text.
- Abstract(参考訳): 観察テキストから言語特性の因果的影響を推定することは困難である。
既存のアプローチでは、完全テキストから表現を学習して潜伏したコンバウンディングをキャプチャすることが多いが、処理状態がテキスト中の単語によってエンコードされている場合、これらの表現は直接的に処理をエンコードすることができる。
よりリッチな表現はドキュメントを分離しやすくし、根底にある因果的問題が重複している場合でもオーバーラップ違反を引き起こす。
辞書などの語彙情報を通じて符号化された潜時テキスト処理について検討し、表現学習の前にこの語彙処理信号を除去するマスキングに基づく適応表現を提案する。
我々は,表現による重複障害を形式化し,削除マスキングが単語のバッグ・オブ・ワード/トピック・モデル表現の重複を保っていることを証明し,置換マスキングを単語の順序と文脈を保ちながら処理定義トークンを隠蔽する大規模言語モデルの自然な緩和として特徴付ける。
シミュレーション全体を通じて、マスキングは重複診断を改善し、治療効果の推定を安定化し、未一致のテキストから学習する調整方法に対するバイアスを低減する。
関連論文リスト
- SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation [5.487826115955642]
ビジョン言語による事前訓練は、医学的マルチモーダル表現学習の基盤となる。
textbfLLM-textbfPowered textbfEncoder textbfLearning による textbfSemantic textbfCross-modal textbfAlignment フレームワーク textbfSCALPEL を提案する。
論文 参考訳(メタデータ) (2026-07-29T13:12:32Z) - Token-to-Token Alignment of Text Embeddings for Semantic Blending [55.88554156801394]
本稿では,プロンプト間のトークン間の明示的な意味的対応を確立するフレームワークであるToken-to-Tokenアライメントを紹介する。
この結果から,テキストから画像への埋め込み空間は,表現が適切に整列されたときにアクセス可能な連続的な意味構造を暗黙的に符号化していることがわかった。
論文 参考訳(メタデータ) (2026-06-22T23:54:40Z) - Detecting and Mitigating Treatment Leakage in Text-Based Causal Inference: Distillation and Sensitivity Analysis [7.710436567988377]
治療漏れは、治療状態の予測信号を含むテキストが、相反する情報を含む場合に発生する。
テキスト・アズ・ア・共同創業者のアプリケーションにおいて、治療漏れを識別し緩和するための体系的な方法はない。
本研究では,共同創設者情報を保存しながら,治療予測内容の除去を目的とした4つのテキスト蒸留手法を提案する。
論文 参考訳(メタデータ) (2025-12-30T20:36:09Z) - FaNe: Towards Fine-Grained Cross-Modal Contrast with False-Negative Reduction and Text-Conditioned Sparse Attention [19.49398094732301]
False Negatives (FaNe) は意味論的に類似したテキストによって誘導され、微粒なクロスモーダルアライメントが不十分である。
FaNeは画像分類、オブジェクト検出、セマンティックセグメンテーションにまたがって最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-11-15T13:37:21Z) - PathDiff: Histopathology Image Synthesis with Unpaired Text and Mask Conditions [38.32128533564591]
公開データセットには、同じ病理像に対するペアテキストとマスクデータがない。
マスクテキストデータから効果的に学習する拡散フレームワークPathDiffを提案する。
PathDiffは、構造的特徴と文脈的特徴を正確に制御し、高品質で意味論的に正確な画像を生成する。
論文 参考訳(メタデータ) (2025-06-30T00:31:03Z) - Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs [51.93737995405164]
LVLM(Large Vision-Language Models)は幻覚の影響を受けやすいモデルである。
本稿では,条件付きポイントワイド・ミューチュアル・インフォメーション(C-PMI)キャリブレーション・デコーディング・ストラテジーを導入する。
提案手法は,復号効率を保ちながら,LVLMの幻覚を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-05-26T08:36:10Z) - Open-Vocabulary Segmentation with Unpaired Mask-Text Supervision [87.15580604023555]
Unpair-Segは、弱制御されたオープン語彙セグメンテーションフレームワークである。
未ペア画像マスクと画像テキストペアから学習し、独立して効率的に収集することができる。
ADE-847とPASCAL Context-459データセットで14.6%と19.5%のmIoUを達成した。
論文 参考訳(メタデータ) (2024-02-14T06:01:44Z) - Pixel Sentence Representation Learning [67.4775296225521]
本研究では,視覚表現学習プロセスとして,文レベルのテキスト意味論の学習を概念化する。
タイポスや単語順シャッフルのような視覚的に接地されたテキスト摂動法を採用し、人間の認知パターンに共鳴し、摂動を連続的に認識できるようにする。
我々のアプローチは、大規模に教師なしのトピックアライメントトレーニングと自然言語推論監督によってさらに強化されている。
論文 参考訳(メタデータ) (2024-02-13T02:46:45Z) - MaskDiffusion: Boosting Text-to-Image Consistency with Conditional Mask [84.84034179136458]
テキスト・イメージのミスマッチ問題に繋がる重要な要因は、モダリティ間の関係学習の不十分さである。
本稿では,注目マップと迅速な埋め込みを条件とした適応マスクを提案し,画像特徴に対する各テキストトークンの寄与度を動的に調整する。
この手法はMaskDiffusionと呼ばれ、トレーニング不要で、一般的な事前学習拡散モデルに対してホットプラグ可能である。
論文 参考訳(メタデータ) (2023-09-08T15:53:37Z) - Disentangling Representations of Text by Masking Transformers [27.6903196190087]
トランスウェイトや隠れたユニット上のバイナリマスクを学習し、特定の変動要因と相関する特徴のサブセットを明らかにします。
本稿では,映画評論における感情表現をジャンルから切り離す能力,つぶやきにおける方言からの「毒性」,意味論からの構文について評価する。
論文 参考訳(メタデータ) (2021-04-14T22:45:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。