論文の概要: Do Active SAE Feature Planes Carry More Holonomy? A Preregistered Reversal in Gemma
- arxiv url: http://arxiv.org/abs/2607.20522v1
- Date: Thu, 09 Jul 2026 05:04:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.216659
- Title: Do Active SAE Feature Planes Carry More Holonomy? A Preregistered Reversal in Gemma
- Title(参考訳): アクティブなSAE特徴はホロノミーを増すか? Gemmaで事前登録された逆転
- Authors: Larry Richards,
- Abstract要約: 本稿では, Gemma 2 2B において, ホロノミーが活性スパースオートエンコーダ (SAE) の特徴面に集中するかどうかを検証した。
アクティブ・フューチャー・プレーンは、ミックス・フューチャー・コントロールよりもホロノミーが低い。
原因は、活性化強度幾何、特徴エンゲージメントの程度、辞書幾何、一致した中心変位、アクティベーション・マニフォールド近接、および生きた代替品としての輸送せん断である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper tests whether holonomy concentrates on active sparse-autoencoder (SAE) feature planes in Gemma 2 2B, a concrete operationalization of the broader semantic-concentration prediction. Holonomy is measured at the final-token layer-12 to layer-13 residual-stream readout by carrying a local frame around small loops using the instrument's restricted-Jacobian transport rule, then normalizing the resulting rotation by enclosed area. The design, materiality threshold, analysis, and verdict rules were preregistered and frozen before the analysed measurements were inspected. The prediction was falsified in reverse: active-feature planes carried less holonomy than matched mixed-feature controls, with an adjusted log contrast of -0.29439 and 95% interval [-0.43989, -0.14889]. A magnitude-only explanation was not supported in this design, while the three-way ordering across random, mixed-feature, and active-feature planes was undefined at matched magnitude because common support failed. Post-freeze diagnostics at the same readout supported the area law on a small validation subset, bounded matched-center displacement under a simple paired regression, and identified transport distortion as a live mechanism or confound. The result is therefore a narrow, auditable operational reversal, not a causal claim that meaning suppresses holonomy. The cause remains open, with activation-strength geometry, degree of feature engagement, dictionary geometry, matched-center displacement, activation-manifold proximity, and transport shear as live alternatives.
- Abstract(参考訳): 本稿では,ホロノミーが Gemma 2 2B のアクティブスパースオートエンコーダ (SAE) 特徴面に集中しているかどうかを,より広範な意味集中予測の具体的な運用化として検討する。
ホロノミーは、測定器の制限されたジャコビアン輸送規則を用いて、局所的なフレームを小さなループの周りに持ち込み、閉領域による回転を正規化することで、最終トーケン層12から13層の残留ストリーム読み出しまで測定される。
設計、物質性しきい値、分析、判定規則は、分析された測定結果が検査される前に事前登録され、凍結された。
アクティブ・フィーチャー・プレーンは、マッチした混合・フィーチャー・コントロールよりもホロノミーが低く、調整されたログコントラストは-0.29439と95%間隔 [-0.43989, -0.14889] であった。
この設計では、マグニチュードのみの説明はサポートされなかったが、ランダム、混合、アクティブな3方向の注文は、共通のサポートが失敗したため、一致したマグニチュードで定義されなかった。
同じリードアウトでの凍結後診断は、小さな検証サブセットで領域法を支持し、単純なペアレグレッションの下で一致した中心変位を境界にし、輸送歪みをライブメカニズムまたはコンファウンドとして同定した。
したがって、結果は狭く監査可能な操作逆転であり、ホロノミーを抑制するという因果的な主張ではない。
原因は、活性化強度幾何、特徴エンゲージメントの程度、辞書幾何、一致した中心変位、アクティベーション・マニフォールド近接、および生きた代替品としての輸送せん断である。
関連論文リスト
- Robust Activation Map Rectification for Weakly Supervised Volumetric Segmentation: Temporal Coherence as a Free Lunch [31.156115062163412]
弱教師付きセグメンテーションは、最初にターゲット領域をローカライズするためにクラスアクティベーションマップ(CAM)に大きく依存している。
既存の治療法は、通常、追加のトレーニングステージやプロトタイプ学習を導入し、計算コストを増大させ、堅牢性を低下させる。
本研究では, 容積データの時間的・構造的コヒーレンスをフリーランチとして利用することにより, 信頼できないCAMを修正できる, トレーニング不要なプロトタイプフリーフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-22T08:07:38Z) - Estimating Rare Events in Language Models with Proper Evaluation [16.1901795614153]
GA-AMLS(Gradient Activation Adaptive Multi-Level Splitting)を導入する。
GA-AMLSは、言語モデルの連続活性化空間に希少なモンテカルロ法を適用する。
また、ゼロ推定に対して有限な適切なスコアリング規則であるシフトパワー・ブレグマン(SPB)ロス(英語版)を提案する。
論文 参考訳(メタデータ) (2026-07-20T19:07:43Z) - Geometric Collapse: When Vision Models Fail to Verify Physical Causality [52.43819179934414]
スクランブルドエッジ(Scrambled Edges)は、サリアントエッジのようなキューを注入する制御されたカウンターファクトである。
エネルギー整合制御と構造整合制御により, 高周波エネルギーとエッジ間隔から支持エッジエビデンスの効果を分離する。
CNN/ViT/SSL深度予測器を通して、Scrambled Edgesはエネルギー整合ノイズよりもクリーンな予測から最大3.2倍大きな偏差を誘導する。
論文 参考訳(メタデータ) (2026-07-08T00:04:02Z) - From Sparse Features to Trustworthy Proxies: Certifying SAE-Based Interpretability [53.681678236115836]
我々は,SAEに基づく説明を,基盤となる凍結LMの忠実な見方として扱うことができるかを検討した。
この枠組みは, 4つの測定可能な量を用いて, 基本モデルの予測リスクの上限を導出する。
我々は, GPT-2 Small, Gemma-2B, Llama-3-8B のサンプルサイズにおいて, 境界が非空洞となることを示す。
論文 参考訳(メタデータ) (2026-06-16T18:28:23Z) - Conformal calibration and look-elsewhere effect in anomaly detection for new-physics searches [0.0]
機械学習による異常検出は、新しい物理学の探索を再構築している。
本稿では,共形予測に基づく校正層を提案する。
論文 参考訳(メタデータ) (2026-06-11T18:00:02Z) - FreeBridge: Variational Schrödinger Bridges for Cellular Transition Dynamics [48.14051378654045]
FreeBridgeはエンドポイントのみを監督する単一セル遷移モデリングのためのSchrdinger Bridgeである。
FreeBridgeは、統合評価プロトコルの下で、競合的または改善されたエンドポイントの忠実性とメカニズムの保持を維持している。
論文 参考訳(メタデータ) (2026-06-09T16:46:59Z) - Measuring the Symmetry--Data Exchange Rate [0.2538209532048867]
同一の軌道サイズと一致した計算値を持つ間違った群制御は制約を伴わないよりも悪いことを示す。
相対交換率beta_diff = 1.28は、理論ブートストラップ1.0と符号と桁違いに一致している。
手法的貢献 -- 共有拡散の欠点をキャンセルする相対レート推定器、間違ったグループ制御、および予め特定された失敗分類 - は、強度をパラメータ化できる帰納バイアスに転送される。
論文 参考訳(メタデータ) (2026-05-31T08:17:40Z) - Unsupervised Domain Shift Detection with Interpretable Subspace Attribution [48.553902624178995]
ドメインシフトはデータセットの確率分布の微妙な違いである。
高次元特徴空間における局所密度異常を検出するアルゴリズムを用いて,これらのシフトを同定する。
ドメインシフトを小さな機能セットにトレースすることで、シフトを解釈できます。
論文 参考訳(メタデータ) (2026-05-15T12:58:00Z) - A Gauge Theory of Superposition: Toward a Sheaf-Theoretic Atlas of Neural Representations [0.0]
本研究では,大言語モデル(LLM)における重ね合わせの枠組みを開発し,局所意味チャートの層理論的アトラスに置き換える。
コンテキストは階層化されたコンテキスト複合体にクラスタ化され、各チャートは局所的な特徴空間と局所的な情報幾何学的計量を持つ。
これにより、フィッシャー重み付き干渉エネルギーと3つの測定可能な障害物が大域的解釈可能性に結びつく。
論文 参考訳(メタデータ) (2026-02-28T22:05:14Z) - On the Structural Non-Preservation of Epistemic Behaviour under Policy Transformation [51.56484100374058]
このような情報条件の相互作用パターンを振る舞い依存として定式化する。
これにより、$$-behavioural equivalenceというプローブ相対的な概念と、政治内行動距離が導かれる。
その結果、共通政策変換の下でプローブ条件の挙動分離が保存されない構造条件が明らかになった。
論文 参考訳(メタデータ) (2026-02-24T22:55:21Z) - Localization Uncertainty Estimation for Anchor-Free Object Detection [48.931731695431374]
アンカーベース物体検出のための既存の不確実性推定手法にはいくつかの制限がある。
アンカーフリー物体検出のためのUADと呼ばれる新しい位置推定不確実性推定手法を提案する。
本手法は,ボックスオフセットの4方向の不確かさを均一に捉え,どの方向が不確実であるかを判断する。
論文 参考訳(メタデータ) (2020-06-28T13:49:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。