論文の概要: A Theory of Conditional Collapse under Low-Rank Weight-Space Ablations: I. The Single-Block Theory and Synthetic Validation
- arxiv url: http://arxiv.org/abs/2608.03620v2
- Date: Fri, 07 Aug 2026 15:43:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:30.985486
- Title: A Theory of Conditional Collapse under Low-Rank Weight-Space Ablations: I. The Single-Block Theory and Synthetic Validation
- Title(参考訳): 低ランク空間アブレーション下における条件付き崩壊の理論:I. 単ブロック理論と合成検証
- Authors: Abdallah Khemais,
- Abstract要約: アクティベーションパッチと重み空間のアブレーションはどちらも、コンポーネントが振舞いに対して因果的に責任があると主張しているが、それらは異なるオブジェクトに作用する。
本研究では,残差ストリームを通じて条件計算を付加的に行う理想モデルについて検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Activation patching and weight-space ablation both claim a component is causally responsible for a behavior, yet they act on different objects: one forward pass versus the parameters behind every forward pass. We ask when they agree. We study an idealized model where a conditional computation is carried additively through a residual stream, $F(x)=F_0(x)+\sum_iα_i(x)v_i$, read out by a linear functional, and prove three exact results. First, deleting a subset of carriers collapses a matched input pair onto the same unconditional output \emph{if and only if} the removal is symmetric on the pair and leaves no outside contrast; the error is deterministic, and we give its exact form even when the two conditions hold only approximately. Second, patching a carrier moves the readout by its donor-receiver \emph{contrast}, while ablating it moves the readout by its \emph{absolute level}; neither bounds the other, and we construct pairs where every single-carrier patch flips the decision while no single-carrier ablation does. Third, for an attention head composed with its own layer's normalization and MLP, we derive an exact first-order interaction formula with a provably second-order remainder, vanishing identically when only the MLP is ablated but not, in general, when a head is. Small transformers trained on a synthetic conditional task illustrate all three predictions: across thirty-nine ablation configurations the measured interaction is strongly rank-correlated with the idealized model's predictive accuracy (Spearman $-0.83$), and a second task and architecture reproduces the same pattern, including a further polarity reversal. The single-block interaction result extends past one residual block, and the synthetic validation is tested against a real pretrained model, in a companion paper that takes this theory further along both axes.
- Abstract(参考訳): アクティベーションパッチと重み空間のアブレーションはどちらも、コンポーネントが振舞いに対して因果的に責任があると主張しているが、それらは異なるオブジェクトに作用する: 1つのフォワードパスと全てのフォワードパスの背後にあるパラメータ。
彼らがいつ同意するか尋ねる。
本研究では,条件計算を残差ストリーム(F(x)=F_0(x)+\sum_iα_i(x)v_i$,線形汎関数で読み出し,3つの正確な結果を示す。
まず、キャリアのサブセットを削除すると、一致した入力ペアを同じ無条件の出力 \emph{if に分解し、除去がペア上で対称であり、外部コントラストを残さない場合に限り、エラーは決定論的であり、2つの条件がほぼ保たれている場合でも、その正確な形を与える。
第二に、キャリアがリードアウトをドナー-受信者 \emph{contrast} で移動させ、一方、リードアウトを \emph{absolute level} で移動させる。
第3に,自己のレイヤーの正規化とMLPで構成される注目ヘッドに対して,頭部が消滅するが一般的には消滅しない場合にのみ,証明可能な第2次残差を持つ正確な第1次相互作用公式を導出する。
30個のアブレーション構成において、測定された相互作用は理想化されたモデルの予測精度(Spearman $-0.83$)と強く相関しており、第二のタスクとアーキテクチャは同じパターンを再現し、さらに極性反転する。
単ブロック相互作用の結果は1つの残留ブロックを超越し、この理論を両軸に沿って進める共用紙において、実際の事前訓練されたモデルに対して合成検証を行う。
関連論文リスト
- Cross-Layer Interaction under Weight-Space Ablation: A Closed-Form Attention Jacobian Bound and a Test on a Real Pretrained Model [0.0]
本稿では, 理想化モデルにおいて, 活性化パッチと重み空間のアブレーションが一致する場合について検討する。
これは、正規化のみを減らし、ヘッドも減らせば二階境界となる、正確な一階相互作用公式を導出する。
本論文は,両限界を超えて結果を拡張し,まず,複数の層を切断するキャリアからの相互作用を,正確に同じブロック項に分解する。
第二に、残りの部分は2つの層に対して、混合二階微分の二重積分として正確に分離し、それを束縛するために必要な欠成分を、注意サブブロックに対するヤコビアン境界(Jacobian bound for the attention sub-block)と呼ぶ。
論文 参考訳(メタデータ) (2026-08-04T13:14:55Z) - A cubical formalisation of topos causal models: intervention, sheaf gluing, and the intuitionistic do-calculus [5.076419064097734]
1-toposコアの最初のマシンチェックをCuical Agdaで行います。
我々はすべてのトポロジーの下で介入とパールの規則が安定していることを示す。
我々は、そのプログラムが考慮しない現象、すなわち、マシンチェックされた文脈性障害を加える。
論文 参考訳(メタデータ) (2026-07-17T05:05:31Z) - Bayesian Wind Tunnels for Model Selection [0.4779196219827507]
変圧器は固定仮説クラス内で正確にベイズフィルタを行うことができることを示す。
離散統計学が算術を必要とする場合、モデル選択は整数トークンで成功する。
定常性制御は、安定なセマンティクスであり、整数のアイデンティティではなく回路のコンパイルを可能にする。
論文 参考訳(メタデータ) (2026-07-01T04:05:08Z) - CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis [49.596677723190886]
スケッチベースの似顔絵合成は、基本的な失敗モードに悩まされる。
アイデンティティと形状の条件は拡散モデルに組み合わされ、地味な肖像画や認識不能な歪みに対して崩壊する。
並列な未汚染拡散経路を通じてこの汚染を明示的に解消する最初の訓練不要な手法であるCaricHarmonyを提案する。
論文 参考訳(メタデータ) (2026-06-11T22:57:59Z) - Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback [50.89125374999765]
NLHFにおける最適乗算重み更新(mathtOMWU$)に対する最初の収束保証を提供する。
本分析では, 稀に発生する行動の確率が指数関数的に小さい値から指数関数的に増大する新たな限界収束挙動を同定する。
論文 参考訳(メタデータ) (2025-12-31T12:08:29Z) - Learning What's Missing: Attention Dispersion and EMA Stabilization in Length Generalization [3.8776893257232032]
本研究では, 変圧器における長さ一般化について, 集合補題を用いて検討する。
モデルは入力シーケンスから欠落したトークンに対する均一な分布を予測しなければならない。
そのようなモデルが長さ 1 と 2 の平衡ロジット変位を達成した場合、より長い列に一般化する必要があることを示す。
論文 参考訳(メタデータ) (2025-10-09T15:26:48Z) - Fundamental limits to contrast reversal of self-fidelity correlations [0.0]
測定設計においては、アンチコントラストのリードアウトを設計することが一般的である。
広義の入力アンサンブルに対して2つの進化を均一に反対にできるかどうかを問う。
我々は、ピアソン相関係数を、2つの進化の間の大域的対立のデバイスに依存しない尺度として採用する。
論文 参考訳(メタデータ) (2025-09-30T15:07:28Z) - Neuro-Symbolic Entropy Regularization [78.16196949641079]
構造化予測では、目的は構造化されたオブジェクトをエンコードする多くの出力変数を共同で予測することである。
エントロピー正則化(Entropy regularization)という1つのアプローチは、決定境界が低確率領域にあるべきであることを示唆している。
我々は、モデルが有効対象を確実に予測することを奨励する損失、ニューロシンボリックエントロピー正規化を提案する。
論文 参考訳(メタデータ) (2022-01-25T06:23:10Z) - Nested Counterfactual Identification from Arbitrary Surrogate
Experiments [95.48089725859298]
観測と実験の任意の組み合わせからネスト反事実の同定について検討した。
具体的には、任意のネストされた反事実を非ネストされたものへ写像できる反ファクト的非ネスト定理(英語版)(CUT)を証明する。
論文 参考訳(メタデータ) (2021-07-07T12:51:04Z) - Causal Expectation-Maximisation [70.45873402967297]
ポリツリーグラフを特徴とするモデルにおいても因果推論はNPハードであることを示す。
我々は因果EMアルゴリズムを導入し、分類的表現変数のデータから潜伏変数の不確かさを再構築する。
我々は、反事実境界が構造方程式の知識なしにしばしば計算できるというトレンドのアイデアには、目立たずの制限があるように思える。
論文 参考訳(メタデータ) (2020-11-04T10:25:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。