論文の概要: Certified Interventional Fidelity: Anytime-Valid, Adaptive Evaluation of Causal Claims in Mechanistic Interpretability
- arxiv url: http://arxiv.org/abs/2607.08349v1
- Date: Thu, 09 Jul 2026 10:55:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.505249
- Title: Certified Interventional Fidelity: Anytime-Valid, Adaptive Evaluation of Causal Claims in Mechanistic Interpretability
- Title(参考訳): 相互整合性認定:機械的解釈性における因果関係の適応的評価
- Abstract要約: Certified Interventional Fidelity (CIF)は、介入解釈可能性評価のための統計層である。
CIFは、高忠実性クレームを認定し、明らかな方法の違いが統計的にサポートされていないことを示し、介入分布に対する感度を明示する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mechanistic interpretability often evaluates explanations by intervening on a model: swapping hidden states, patching activations, ablating components, or comparing a compressed model to the original one. These experiments are usually summarized by a point estimate, even though the evaluation may be monitored while it runs or adapted toward suspected failures. This makes it hard to tell whether a reported fidelity or patching effect is a stable causal claim or a consequence of finite sampling and evaluation choices. We introduce Certified Interventional Fidelity (CIF), a statistical layer for interventional interpretability evaluations. CIF first writes the quantity being reported as a causal estimand: an expectation of a bounded score over a stated input distribution and a stated intervention distribution. It then provides confidence intervals and anytime-valid confidence sequences for this estimand, including under adaptive intervention sampling via bounded mixture importance weighting. We instantiate CIF with Hoeffding-style sequences and variance-adaptive betting sequences, the latter reducing certification cost by 10-30x in our experiments. On MNIST abstractions and GPT-2 Small IOI circuits, CIF certifies high-fidelity claims, shows when apparent method differences are not statistically supported, and makes sensitivity to the intervention distribution explicit.
- Abstract(参考訳): 機械的解釈可能性(Mechanistic Interpretability)は、隠れた状態を交換したり、アクティベーションにパッチを当てたり、コンポーネントを非難したり、圧縮されたモデルを元のものと比較したりすることで、モデルに介入することによって説明を評価する。
これらの実験は、通常点推定によって要約されるが、その評価は、実行中に監視されるか、疑わしい失敗に適応される。
これにより、報告された忠実性やパッチ効果が安定した因果的クレームなのか、あるいは有限サンプリングと評価選択の結果なのかを判断することが困難になる。
本稿では,介入解釈可能性評価のための統計層であるCIF(Certified Interventional Fidelity)を紹介する。
CIFはまず、因果推定として報告される量について記述する: 入力分布と介入分布に対する有界スコアの期待。
次に、結合混合重み付けによる適応的介入サンプリングを含む、この推定値に対する信頼区間および任意の時間価信頼シーケンスを提供する。
我々は,提案実験において,CIFをHoeffdingスタイルのシーケンスと分散適応ベッティングシーケンスでインスタンス化し,後者は認証コストを10~30倍削減する。
MNIST の抽象化と GPT-2 の小型IOI 回路では、CIF は高忠実性クレームを認証し、明らかな方法の違いが統計的にサポートされていないことを示し、介入分布に対する感度を明示する。
関連論文リスト
- Diffusion-Guided Search via Exponential Tilting (DiffTilt): An Application to Falsification of Safety-Critical Systems [3.963282613048148]
既存のファルシフィケーションアプローチは、環境とシステム実行に関する共同分布を規定する条件付きサンプリング戦略に依存している。
本稿では,拡散モデルにより誘導される共同分布を環境や実行に対して指数関数的に傾ける分散フレームワークであるDiffTiltを開発する。
論文 参考訳(メタデータ) (2026-07-25T10:28:47Z) - Accelerating A/B-Tests with Counterfactual Estimation: Reducing Variance through Policy Overlap [8.291484471359633]
標準A/Bテストプロトコルにおける重要な非効率性を同定する。
治療とコントロールポリシーが行動に一致した場合、その結果はノイズに寄与するが、治療効果に関する信号はない。
本稿では,この重なり合いを利用して実験を加速する新しい実験プロトコルを提案する。
論文 参考訳(メタデータ) (2026-07-16T06:08:52Z) - Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques [62.94836578759359]
AIVAT推定の不確かさを定量化するために、不確実性がどのように伝播できるかを示す。
実験では,1万本のポーカーハンドのデータセットを用いて,病態と不確実性を示す。
論文 参考訳(メタデータ) (2026-05-14T02:04:26Z) - FACTOR: Counterfactual Training-Free Test-Time Adaptation for Open-Vocabulary Object Detection [63.91351553178842]
FACTORはオープン語彙オブジェクト検出のためのトレーニング不要なテスト時間適応である。
属性依存性の予測を選択的に抑制するために、属性の感度、意味的関連性、予測のバリエーションを定量化する。
PASCAL-C, COCO-C, FoggyCityscapes の実験では、FACTOR が従来の TTA 法より一貫して優れていたことが示されている。
論文 参考訳(メタデータ) (2026-05-05T02:31:18Z) - FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning [49.65751420291115]
CoT(Chain-of-Thought)プロンプトはLSM推論を改善したが、モデルはしばしば不誠実な中間ステップを含むコヒーレントな説明を生成する。
我々は、CoTの品質を評価するための因果性に着想を得たフレームワークであるFACT-Eを提案する。
FACT-Eは推論・軌道選択を改善し、文脈内学習を強くすることを示す。
論文 参考訳(メタデータ) (2026-04-12T15:35:08Z) - SPAN: Continuous Modeling of Suspicion Progression for Temporal Intention Localization [26.07264704956791]
本稿では,個別分類から連続回帰へ移行するSuspicion Progression Analysis Network (SPAN)を提案する。
SPANは低周波のケースでは2.74%のmAPゲインを達成し、微妙な行動変化を捉える優れた能力を示している。
論文 参考訳(メタデータ) (2025-10-23T04:20:07Z) - Adaptive Individual Uncertainty under Out-Of-Distribution Shift with Expert-Routed Conformal Prediction [8.306260695214972]
信頼度の高い適応区間(TESSERA)のスケールド推定を用いた信頼度エキスパートスプリット・コンフォーマルを導入する。
TESSERAは、絶対誤差を追跡する信頼性の高いカバレッジ保証、情報的かつ適応的な予測間隔幅を備えたサンプル単位の不確実性を提供する。
タンパク質-リガンド結合親和性予測は, 独立および同一分布 (d.d.) と足場ベースアウト・オブ・ディストリビューション (OOD) の双方で評価した。
論文 参考訳(メタデータ) (2025-10-17T01:51:33Z) - Proximity-Based Evidence Retrieval for Uncertainty-Aware Neural Networks [6.9681910774977815]
本研究は,不確実性を考慮した意思決定のためのエビデンス・検索機構を提案する。
それぞれのテストインスタンスに対して、例題は埋め込み空間で検索され、それらの予測分布はデンプスター・シェーファー理論を介して融合される。
支持する証拠は明確であるため、決定は透明で監査可能である。
論文 参考訳(メタデータ) (2025-09-11T13:12:22Z) - TrustLoRA: Low-Rank Adaptation for Failure Detection under Out-of-distribution Data [62.22804234013273]
本稿では,共変量および意味的シフトの両条件下での拒絶による分類を統一し,促進する,単純な故障検出フレームワークを提案する。
キーとなる洞察は、障害固有の信頼性知識を低ランクアダプタで分離し、統合することにより、障害検出能力を効果的かつ柔軟に向上できるということです。
論文 参考訳(メタデータ) (2025-04-20T09:20:55Z) - ACTIVA: Amortized Causal Effect Estimation via Transformer-based Variational Autoencoder [7.987204219322316]
本稿では,アモータライズされた因果推論のための条件付き変分自動エンコーダアーキテクチャであるACTIVAを提案する。
ACTIVAは、観測入力と介入クエリに条件づけられた潜伏表現を学習し、ゼロショット推論を可能にする。
我々は、ACTIVAが観察的に等価な因果モデルよりも混合として介入分布を予測することを示す理論的洞察を提供する。
論文 参考訳(メタデータ) (2025-03-03T08:28:25Z) - Error-quantified Conformal Inference for Time Series [55.11926160774831]
時系列予測の不確かさの定量化は、時系列データの時間的依存と分布シフトのために困難である。
量子化損失関数をスムースにすることで,iError-quantified Conformal Inference (ECI)を提案する。
ECIは有効な誤発見制御と、他のベースラインよりも厳密な予測セットを出力することができる。
論文 参考訳(メタデータ) (2025-02-02T15:02:36Z) - Mitigating LLM Hallucinations via Conformal Abstention [70.83870602967625]
我々は,大言語モデルが一般ドメインでの応答をいつ無視すべきかを決定するための,原則化された手順を開発する。
我々は、幻覚率(エラー率)の厳密な理論的保証の恩恵を受けるため、共形予測手法を活用して、禁忌手順を開発する。
実験によって得られた共形禁忌法は, 種々の閉書, オープンドメイン生成質問応答データセットに, 幻覚率を確実に拘束する。
論文 参考訳(メタデータ) (2024-04-04T11:32:03Z) - The Implicit Delta Method [61.36121543728134]
本稿では,不確実性のトレーニング損失を無限に正規化することで機能する,暗黙のデルタ法を提案する。
有限差分により無限小変化が近似された場合でも, 正則化による評価の変化は評価推定器の分散に一定であることを示す。
論文 参考訳(メタデータ) (2022-11-11T19:34:17Z) - Logical Satisfiability of Counterfactuals for Faithful Explanations in
NLI [60.142926537264714]
本稿では, 忠実度スルー・カウンタファクトの方法論について紹介する。
これは、説明に表される論理述語に基づいて、反実仮説を生成する。
そして、そのモデルが表現された論理と反ファクトの予測が一致しているかどうかを評価する。
論文 参考訳(メタデータ) (2022-05-25T03:40:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。