論文の概要: Looped Transformers with Source-Centered State Evolution
- arxiv url: http://arxiv.org/abs/2607.27656v1
- Date: Thu, 30 Jul 2026 04:13:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.392754
- Title: Looped Transformers with Source-Centered State Evolution
- Title(参考訳): ソース中心状態進化を用いたループ変換器
- Abstract要約: Looped Transformerは、同じTransformerブロックをリユースすることで、トレインとテストタイムの計算軸を作る。
加算インジェクションループ変換器では、繰り返しステップ毎に入力条件の信号が再導入される。
本稿では,入力条件と参照保存共有繰り返しを照合するソース中心状態進化法を提案する。
- 参考スコア(独自算出の注目度): 38.624504791098545
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Looped Transformers create a useful train- and test-time compute axis by reusing the same Transformer block over recurrent depth, increasing effective depth at a fixed parameter count. However, that shared block must then govern an entire trajectory of varying hidden states over trained and extrapolated depths. Furthermore, in additive-injection looped Transformers, an input-conditioned signal is reintroduced at every recurrent step, so applying the shared transition at an input-conditioned reference can still move the hidden state. In this paper, we propose Source-Centered State Evolution (SCSE), which is designed to reconcile input conditioning with reference-preserving shared recurrence. Specifically, SCSE retains input dependence through its learned anchor and initial deviation, allows nonzero deviations to drive recurrent computation while mapping zero deviation to zero, and guarantees exact anchor invariance through its zero-deviation mask. The designated anchor is thereby a one-step fixed point by construction. The zero-deviation forcing bias is the next deviation produced from the anchor itself and vanishes in SCSE, while nonzero deviations remain active and support state-dependent recurrent computation. Our theory shows that the zero-deviation forcing bias is a design degree of freedom whose task effect can be harmful, neutral, or beneficial; SCSE resolves this choice in favor of exact anchor invariance by setting the bias to zero. Across WikiText-2, WikiText-103, direct web-corpus pretraining, held-out web-text transfer, and LAMBADA completion, SCSE improves the controlled recurrent quality frontier. Ablation studies identify the learned anchor and the anchor-coordinate deviation recurrence as the primary contributors to the gain, and a trained-model case study grounds the anchor-response diagnostic in observed recurrent motion.
- Abstract(参考訳): Looped Transformerは、同じTransformerブロックを繰り返しの深さで再利用し、固定パラメータ数で効果的な深さを増大させることで、有用なTrain-とTest-timeの計算軸を生成する。
しかし、その共有ブロックは、訓練された深さと外挿された深さよりも、様々な隠れ状態の軌道全体を管理する必要がある。
さらに、加算インジェクションループ変換器では、繰り返しステップ毎に入力条件信号が再導入されるので、入力条件参照での共有遷移の適用は依然として隠れ状態を動かすことができる。
本稿では,入力条件と参照保存共有繰り返しを整合するソース中心状態進化(SCSE)を提案する。
具体的には、SCSEは、学習されたアンカーと初期偏差による入力依存を維持し、ゼロ偏差をゼロにマッピングしながら、ゼロ偏差のない非ゼロ偏差が繰り返し計算を駆動し、ゼロ偏差マスクによる正確なアンカー不変性を保証する。
これにより、指定アンカーは、建設により一段固定点となる。
ゼロ偏差強制バイアスはアンカー自体から生成されSCSEで消滅する次の偏差であり、非零偏差はアクティブであり、状態依存の逐次計算をサポートする。
我々の理論は、ゼロ偏差強制バイアスは、タスク効果が有害、中立、または有益である設計の自由度であり、SCSEは、偏差をゼロにすることで、正確なアンカー不変性を優先して、この選択を解決している。
WikiText-2, WikiText-103, 直接Webコーパス事前訓練, ホールドアウトWebテキスト転送, LAMBADA完了などを通じて, SCSEは制御されたリカレント品質フロンティアを改善している。
アブレーション研究は、学習されたアンカーとアンカー座標偏差再発を利得の主要因としており、訓練されたモデルケーススタディは、観測された反復運動におけるアンカー応答の診断を根拠にしている。
関連論文リスト
- Scale-Consistent Posterior Dynamics for Diffusion Inverse Problems [16.685352002333225]
事前訓練された拡散前の後方サンプリングは、一般に難易度成分を有する条件付きスコアによって管理される。
クリーン後部にターゲットが近づいた騒音条件付き経路が連続的なサロゲートSDEを生成することを示す。
FFHQ と ImageNet の100点評価実験により,超解像および分解能の競争再現性を示す。
論文 参考訳(メタデータ) (2026-08-15T09:38:41Z) - Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL [7.803284875836737]
ブートストラップは オフライン強化学習における 推定誤差を増幅する
本稿では,ベルマンのバックアップをサンプル値のターゲットとして表現し,CHN局所補正を行うConvex Hull Neborhood Smooth Dual Generalizationを提案する。
Gym-MuJoCoとAntMazeの実験は、強力な集約性能と安定した値推定を示す。
論文 参考訳(メタデータ) (2026-08-04T04:30:02Z) - An Adjoint-Sensitivity Framework for Lost-in-the-Middle Phenomena in Causal Residual Transformers [1.4180331276028662]
我々は, 因果残差変換器における位置影響に対する随伴感度フレームワークを開発した。
我々は、独立にチェック可能なエネルギー、相関、および局所チャネル境界の下で境界の利点を述べる。
論文 参考訳(メタデータ) (2026-07-20T08:44:31Z) - Branch-resolved Pauli-block spectroscopy of residual conditional phase in two-qubit gates [0.0]
分岐分解パウリブロック分光法を導入し, サイクルごとの残留ZZ回転角theta_cをその符号で推定する。
このアプローチは、標準忠実度ベンチマークが先行順序で未解決である残条件相の低オーバーヘッド符号付きサイクル当たりの予測を与える。
論文 参考訳(メタデータ) (2026-07-11T10:32:05Z) - Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping [56.14767235650558]
共有トランスブロックを繰り返し適用するLooped Transformerは、可変長の計算タスクに自然に適合するアーキテクチャである。
この差分を、列長とループ数の間の単純なアルゴリズムタスクにおける突発的相関に追従する。
私たちの研究は、"停止する時"は単なる推論時間割当ルールではなく、トレーニング設計の選択として扱われるべきであることを示唆しています。
論文 参考訳(メタデータ) (2026-06-29T08:58:09Z) - A Doeblin-Anchored Contrastive Chart for Learning Markov Transition Kernels [1.2691047660244335]
本稿では,トランジションカーネルを対照的な目的から学習するための統計的・動的座標フレームワークを提案する。
固定された相対的リスクは、固定された遷移密度を識別し、過剰なリスクを密度誤差に校正することを証明する。
論文 参考訳(メタデータ) (2026-06-01T13:26:44Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - Diffusion Controller: Framework, Algorithms and Parameterization [54.82539154511621]
本稿では,逆拡散サンプリングを(一般化された)線形解法マルコフ決定過程における状態のみの制御として活用する統一的な制御理論的視点を提案する。
このフレームワークでは、制御はトレーニング済みのリバースタイムのトランジションカーネルを再重み付けし、端末の目的と$f$分割コストのバランスをとる。
安定拡散v1.4の実験では、選好調整の勝利率が一貫した上昇を示し、品質効率のトレードオフを改善した。
論文 参考訳(メタデータ) (2026-03-07T01:49:59Z) - Deterministic Continuous Replacement: Fast and Stable Module Replacement in Pretrained Transformers [0.7829352305480287]
冷間開始再活性化は凍結した背骨を安定化させるが、制御された研究でこのコア安定性の課題を分離する。
単座研究において、DCRは、制御された注意置換に基づくゲーティングや蒸留ベースラインよりも早く収束し、より強いアライメントを得ることができ、不均一なオペレータスワップの基礎を確立した。
論文 参考訳(メタデータ) (2025-11-24T00:55:14Z) - PseudoNeg-MAE: Self-Supervised Point Cloud Learning using Conditional Pseudo-Negative Embeddings [55.55445978692678]
PseudoNeg-MAEは、ポイントクラウドマスマスキングオートエンコーダのグローバルな特徴表現を強化する。
本研究では,ネットワークが識別的表現を保ちながら,よりリッチな変換キューをキャプチャできる新たな損失を提案する。
論文 参考訳(メタデータ) (2024-09-24T07:57:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。