論文の概要: Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?
- arxiv url: http://arxiv.org/abs/2607.29484v1
- Date: Fri, 31 Jul 2026 14:49:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.77317
- Title: Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?
- Title(参考訳): エビデンス型競争: いつインターベンショナルデータ学習言語モデルが因果方向をモデル化できるのか?
- Authors: Xining Xun,
- Abstract要約: 介入データは 因果推論の モデルを教えるための金の基準として 広く見なされている
我々は、この仮定を、因果効果に対する観察的相関を考慮し、完全に制御された合成環境において検証する。
介入証拠が使用されているかどうかを規定するものは、トレーニングミックスではなく、推論時に文脈に存在するエビデンスタイプである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Interventional data is widely regarded as the gold standard for teaching models causal reasoning. We test this assumption in a fully controlled synthetic environment pitting observational correlation against causal effect, and find it fails instructively. In Simpson's-paradox worlds, where the two have systematically opposite signs, increasing the fraction of interventional samples in pretraining does not improve causal direction: the magnitude of the model's do()-response grows monotonically, yet its sign is copied from the observational context. What governs whether interventional evidence is used is not the training mixture but the evidence type present in the context at inference time. Under an identical training recipe, a purely observational context induces systematic sign reversal in 29/50 worlds, a mixed context in 19/50, while aligned interventional probes alone yield 41/50 correct. Erasing observational evidence from the context immediately releases the suppressed causal interpolation ability (ratio_true = +0.56); a four-state content manipulation shows the switch is content-mediated and graded. The suppression is stable across training seeds (11/11 strong reversals persist on a matched-protocol second seed) and robust as a rate at 0.93B parameters (31.8% vs. 6% reversals in the matched probe-only arm), even as absolute gains shrink four-fold. An external audit on CLadder exposes a learned positive-effect prior with a two-layer structure: sign-randomized retraining removes it in-distribution but not out-of-distribution. We summarize: the capability lives in the weights; the switch lives in the context, and activation patching localizes the switch to the middle layers' observational rows. We further quantify the sampling noise floor of probe-based causal evaluation and an evidence-averaging protocol that cuts sign errors from 26% to 9%.
- Abstract(参考訳): インターベンショナルデータは、因果推論のモデルを教えるための金の標準として広く見なされている。
我々は、この仮定を、因果効果に対する観察的相関を考慮し、完全に制御された合成環境で検証し、命令的に失敗することを確認した。
シンプソンのパラドックスの世界では、両者が体系的に反対の符号を持つため、事前訓練における介入サンプルの割合の増加は因果方向を改善しない:モデルの do()-応答の大きさは単調に成長するが、その記号は観測的文脈からコピーされる。
介入証拠が使用されているかどうかを規定するものは、トレーニングミックスではなく、推論時に文脈に存在するエビデンスタイプである。
同一のトレーニングレシピの下では、純粋な観測コンテキストは29/50の世界で、19/50の混合コンテキストにおいて、系統的な手逆転を誘導する。
文脈からの観察的証拠の消去は、直ちに抑制された因果補間能力(ratio_true = +0.56)を放出する。
この抑制は、訓練種子(11/11の強い逆転がマッチした第2シードに持続する)間で安定であり、絶対ゲインが4倍に縮小したとしても、0.93Bパラメータ(マッチしたプローブのみの腕では31.8%対6%の逆転)で堅牢である。
CLadderの外部監査では、2層構造で学習された陽性効果が露呈する。
スイッチはコンテキストに存在し、アクティベーションパッチは、中間層の観察行にスイッチをローカライズします。
さらに、プローブに基づく因果評価のサンプリングノイズフロアと、符号誤りを26%から9%に削減するエビデンス改善プロトコルを定量化する。
関連論文リスト
- Beyond Tracking or Shortcut: Composition-Bounded Predictive States in Poker Autoregressive Models [4.810191717262418]
隠れ状態プローブはしばしば不完全情報系列モデルで潜伏ラベルを復元する。
本稿では, 行動目標と価値目標のみに基づいて訓練された, ノーレンジリミットホールドム自己回帰モデルにおける, この曖昧さについて検討する。
論文 参考訳(メタデータ) (2026-06-13T15:56:26Z) - Hallucination as Trajectory Commitment: Causal Evidence for Asymmetric Attractor Dynamics in Transformer Generation [0.0]
自己回帰言語モデルにおける幻覚は非対称的な誘引力学によって制御される。
高速分岐法を用いて、軌道力学をインパルスレベルから分離する。
論文 参考訳(メタデータ) (2026-04-16T12:16:53Z) - Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models [6.431677598656395]
競合するドメインでは、命令調整言語モデルは、コンテキスト内証拠に対する忠実さに対するユーザ調整のプレッシャーをバランスさせなければならない。
我々は,0.27Bから32Bのパラメータにまたがる19の命令調整モデルに対して,エビデンス組成と不確実性を詳細に説明する。
論文 参考訳(メタデータ) (2026-03-20T17:38:23Z) - Before the First Token: Scale-Dependent Emergence of Hallucination Signals in Autoregressive Language Models [6.5607014897534865]
7個の自己回帰変換器の幻覚表現の時間的ダイナミクスについて検討した。
4M以下のモデルでは、生成位置毎に確率レベルプローブの精度を示す。
7Bスケールでは、Pythia-6.9Bは平坦な時間プロファイルを、Qwen2.5-7Bは支配的な前世代効果を示す。
論文 参考訳(メタデータ) (2026-03-20T02:30:01Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Counterfactual Realizability [52.85109506684737]
本稿では, 正規化可能性の定義, 分布からサンプルを抽出する能力を導入し, 任意の反事実分布が実現可能であるかどうかを判定する完全アルゴリズムを開発する。
本稿では、因果的公正さと因果的強化学習のモチベーション例を用いて、この新たな反ファクト的データ収集フレームワークの意義を説明する。
論文 参考訳(メタデータ) (2025-03-14T20:54:27Z) - Can Active Sampling Reduce Causal Confusion in Offline Reinforcement
Learning? [58.942118128503104]
因果的混乱(英: Causal confusion)とは、エージェントがデータ中の不完全な急激な相関を反映するポリシーを学ぶ現象である。
この現象は特にロボット工学などの領域で顕著である。
本稿では,オフライン強化学習における因果的混乱について検討する。
論文 参考訳(メタデータ) (2023-12-28T17:54:56Z) - Nonparametric Identifiability of Causal Representations from Unknown
Interventions [63.1354734978244]
本研究では, 因果表現学習, 潜伏因果変数を推定するタスク, およびそれらの変数の混合から因果関係を考察する。
我々のゴールは、根底にある真理潜入者とその因果グラフの両方を、介入データから解決不可能なあいまいさの集合まで識別することである。
論文 参考訳(メタデータ) (2023-06-01T10:51:58Z) - Adversarial Robustness through the Lens of Causality [105.51753064807014]
ディープニューラルネットワークの敵対的脆弱性は、機械学習において大きな注目を集めている。
我々は、因果関係を敵対的脆弱性の軽減に組み込むことを提案する。
我々の手法は、敵の脆弱性を緩和するために因果性を利用する最初の試みと見なすことができる。
論文 参考訳(メタデータ) (2021-06-11T06:55:02Z) - On Disentangled Representations Learned From Correlated Data [59.41587388303554]
相関データに対する最も顕著な絡み合うアプローチの挙動を解析することにより、現実のシナリオにギャップを埋める。
本研究では,データセットの体系的相関が学習され,潜在表現に反映されていることを示す。
また、トレーニング中の弱い監督や、少数のラベルで事前訓練されたモデルを修正することで、これらの潜伏相関を解消する方法を実証する。
論文 参考訳(メタデータ) (2020-06-14T12:47:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。