論文の概要: Lagged Coupling: Internal Representations Become Readable Before They Become Causal
- arxiv url: http://arxiv.org/abs/2609.01048v1
- Date: Tue, 01 Sep 2026 10:46:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.585295
- Title: Lagged Coupling: Internal Representations Become Readable Before They Become Causal
- Title(参考訳): タグ付きカップリング:内部表現は因果関係になる前に読みやすい
- Authors: Xining Xun,
- Abstract要約: 内部可読性は因果効果を体系的に上回り、ラグはスケールとともに縮小しない。
予め登録されたOLMo-2複製は、減衰した大きさで方向を保存する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Across the full Pythia suite (160M-12B, eight checkpoints, four task families), a linear probe can read a target variable from the residual stream as early as step 1,000 at every scale -- yet steering along that same reading direction remains null-equivalent in 43 of 48 model-checkpoint cells. Internal readability systematically outruns causal efficacy, and the lag does not shrink with scale. We call this structure lagged coupling and decompose it into three dissociable tracks: (i) internal readability, saturated (AUROC >= 0.990) from the first checkpoint everywhere; (ii) behavioral readability, which develops gradually and progressively later at larger scales (12B reaches 0.909 only at the final checkpoint); (iii) causal efficacy, almost always null-equivalent, occasionally counterproductive early, with one isolated positive pulse (12B, step 8,000, z = +2.49) our grid cannot resolve. The ordering is dominantly read-before-write (11/11 units, no inversion). Representation headroom along the probe direction grows up to 57x with training and scale while causal write-in stays below 0.11% of headroom -- the variable is increasingly written into the representation and increasingly ignored by the readout. Under a fully pre-registered protocol, both single-onset hypotheses resolve INDETERMINATE (scale slope +0.24, 95% CI [-0.60, +0.87]; time vote 3:3) -- a disciplined negative explained by the three-track decomposition. A pre-registered OLMo-2 replication preserves the direction at attenuated magnitude. Our results caution against inferring steerability from probe accuracy and establish a developmental bottleneck: representation formation reliably outpaces causal readout consolidation.
- Abstract(参考訳): 完全なPythiaスイート(160M-12B、8つのチェックポイント、4つのタスクファミリ)全体にわたって、線形プローブは、各スケールでステップ1,000まで、残ストリームからターゲット変数を読み取ることができる。
内部可読性は因果効果を体系的に上回り、ラグはスケールとともに縮小しない。
私たちはこの構造をラグ結合と呼び、それを3つの解離可能なトラックに分解します。
(i)初回チェックポイントから内部可読性、飽和(AUROC>=0.990)
(二)行動可読性(12Bは最終チェックポイントでのみ0.909に達する)
三 因果効果、ほとんど常にヌル等価で、時折反生産的であり、1つの孤立した正パルス(12B、ステップ8,000、z = +2.49)は、我々の格子は解決できない。
順序付けは、主に読み書き(11/11単位、反転なし)である。
プローブ方向に沿った表現ヘッドルームはトレーニングとスケールで57倍に増加し、因果書き込みはヘッドルームの0.11%未満にとどまる。
完全に事前登録されたプロトコルの下で、どちらの単発仮説もINDETERMINATE (scale slope +0.24, 95% CI [-0.60, +0.87]; time vote 3:3)を解決している。
予め登録されたOLMo-2複製は、減衰した大きさで方向を保存する。
本研究は,プローブの精度からステアビリティの推測と発達ボトルネックの確立に留意し,表現形成が因果的読み出し統合を確実に上回ることを示した。
関連論文リスト
- Located but Not Releasable: Silent Gate Inversion and Bounded Linear Release [0.0]
完全なパイプライン -- 検出、ローカライズ、リリース -- を、25.7Mトランス上で完全に事前登録されたストレステストに送信します。
中層層の観測エビデンスチャネルでの干渉は、他の抑圧された世界における標的の挙動を復元する。
配当外のキャリブレーションをゼロにするために調整された検出器は、6.9-7.3%の配当前の世代と、実際にそれを必要とする2,400世代のうちゼロにトリガーをトリガーする。
論文 参考訳(メタデータ) (2026-08-12T09:04:54Z) - Orientation, not magnitude: the causal structure of task-vector interference in merged language models [0.0]
タスク算術はそうでなければ機能し、フィールドはマグニチュードで原因を診断する。
層状フラックスの正確な分解は、既存の断続輸送の増幅によって支配されていることを示している。
ナイーブのbfloat16生成の「ユニバーサリティ」は、量子化粗さであることが判明した。
論文 参考訳(メタデータ) (2026-08-12T08:40:24Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Controlling Transient Amplification Improves Long-horizon Rollouts [33.85418321772749]
ロールアウト軌道周りの過渡摂動をロールアウト誤差を駆動するメカニズムとして同定する。
可換正則化: 個々のヤコビアンの正規性欠陥を低減するために設計された2つの罰則の組み合わせを提案する。
本手法は,新しいデータを用いることなく,ERA5のFourNet気候予測を改善した。
論文 参考訳(メタデータ) (2026-05-09T10:10:30Z) - Tracing Uncertainty in Language Model "Reasoning" [46.61902399979181]
言語モデル(LM)は、一般的にChain-of-Thoughtまたはテストタイムスケーリングと呼ばれ、しばしばベンチマークのパフォーマンスを改善する。
本研究では,LMが生成する中間トークン列である「推論」トレースを進化的モデル状態として扱うことにより,これらのダイナミクスを考察する。
論文 参考訳(メタデータ) (2026-05-08T14:16:37Z) - Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes [4.738949927143789]
隠れ状態における線形デオード可能な故障信号が、それらの故障を修正するために活用できるかどうかを検討する。
固定されたリニアステアリングファミリーが修正に利用できない場合でも、デオード可能な故障構造がポストジェネレーションの信頼性評価をサポートすることがわかった。
論文 参考訳(メタデータ) (2026-05-07T05:58:38Z) - Architectural Observability Collapse in Transformers [0.0]
トレーニングは、出力信頼が露呈しない内部的な意思決定品質のシグナルを保持します。
信頼制御は、平均60.3%の生プローブ信号を6つのファミリーの14モデルで吸収する。
Llama 3.1 8Bは、同じ32層、32頭、4096面の形状で崩壊する。
論文 参考訳(メタデータ) (2026-04-27T02:39:02Z) - Hallucination as Trajectory Commitment: Causal Evidence for Asymmetric Attractor Dynamics in Transformer Generation [0.0]
自己回帰言語モデルにおける幻覚は非対称的な誘引力学によって制御される。
高速分岐法を用いて、軌道力学をインパルスレベルから分離する。
論文 参考訳(メタデータ) (2026-04-16T12:16:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。