論文の概要: Learning Length-Extrapolatable Recurrent Models
- arxiv url: http://arxiv.org/abs/2609.09157v1
- Date: Tue, 08 Sep 2026 17:59:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.72878
- Title: Learning Length-Extrapolatable Recurrent Models
- Title(参考訳): 長さ伸長可能なリカレントモデルの学習
- Abstract要約: 我々は、パラメーター更新に貢献する前に、将来の損失が以前のリカレントステートに到達するシグナルであるステートクレジットを調査する。
本稿では,時間による信用安定化(CST)を提案する。
CSTはトレーニングの地平線を超えてパフォーマンスを改善し、トレーニング長の最大128倍のゲインを観測する。
- 参考スコア(独自算出の注目度): 10.309804228780584
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recurrent models provide a natural path to long-context modeling, yet models trained with backpropagation through time (BPTT) often fail beyond their training horizon. Classical analyses emphasize gradients that vanish or explode along temporal paths. However, dense per-token losses can still train a shared recurrent rule despite severe decay, showing that decay alone does not determine whether learning fails. We instead study state credit: the signal through which future losses reach earlier recurrent states before contributing to parameter updates. Accordingly, we intervene directly on state credit and propose Credit Stabilization through Time (CST). During backward propagation, CST locally rescales the state-credit signal to stabilize its norm without rotating the component being corrected, while leaving the forward computation unchanged. Because controlled synthetic tasks and real data exhibit different credit dynamics, we specialize CST to each regime. In both settings, CST improves performance beyond the training horizon, with gains observed at up to 128x the training length.
- Abstract(参考訳): リカレントモデルは、長期コンテキストモデリングへの自然な経路を提供するが、時間によるバックプロパゲーション(BPTT)で訓練されたモデルは、しばしばトレーニングの地平線を越えて失敗する。
古典的な分析は、時間的経路に沿って消滅または爆発する勾配を強調する。
しかし、高密度のトーケン当たりの損失は、深刻な崩壊にもかかわらず共有の繰り返し則を訓練することができるため、崩壊だけでは学習が失敗するかどうかを判断できない。
パラメータ更新にコントリビュートする前に、将来の損失が以前のリカレントステートに到達するためのシグナルです。
したがって、我々は国家信用に直接介入し、時間による信用安定化(CST)を提案する。
後方伝播中、CSTは、前処理をそのまま残しながら、部品を回転させることなく、状態クレディット信号を局所的に再スケールし、その標準を安定化させる。
制御された合成タスクと実データは異なる信用力学を示すため、各レギュレーションにCSTを専門化する。
両方の設定で、CSTはトレーニングの地平線を超えてパフォーマンスを改善し、トレーニングの長さの最大128倍のゲインを観測する。
関連論文リスト
- Large-Small Model Collaboration for Zero-Shot Surgical Phase Recognition [45.191945465591374]
外科的位相認識のためのタスク固有の軽量モデルは、時間的ダイナミクスを捉えるのに優れているが、ドメインシフト下での一般化は不十分である。
textbfLarge-textbfSmall textbfTemporal adaptation (textbfLaST)を提案する。
論文 参考訳(メタデータ) (2026-08-24T07:06:52Z) - Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning [17.543161067319023]
大規模言語モデルの大規模事前学習における学習率スケジューリングの役割について検討する。
Warmup-Stable-Only (WSO) は温暖化後に一定の学習率を維持している。
論文 参考訳(メタデータ) (2026-03-17T05:17:07Z) - SSR: A Training-Free Approach for Streaming 3D Reconstruction [53.19807901585702]
自己表現型シーケンス規則化(Self Expressive Sequence Regularization、SSR)は、推論中にグラスマン列の正則性を強制するプラグアンドプレイ演算子である。
本研究では,SSRが連続的にドリフトを低減し,複数のストリーミング3D再構成タスクにおける再構成品質を向上させることを示す。
論文 参考訳(メタデータ) (2026-03-16T02:55:14Z) - When and Where to Reset Matters for Long-Term Test-Time Adaptation [4.470869789416921]
連続的なテスト時間適応(TTA)は長期にわたって持続し、モデルにエラーが蓄積され、全ての入力に対して少数のクラスしか予測しない。
最近の研究では、これらの蓄積したエラーを完全に消去するリセット戦略が検討されている。
提案手法は,リセットのタイミングと場所を動的に決定し,(2)リセットによって失われる本質的な知識を回復するための重要認識正規化器,(3)ドメインシフトの挑戦による適応性向上のためのオンザフライ適応調整スキームである。
論文 参考訳(メタデータ) (2026-03-04T07:19:25Z) - Efficient Continual Learning in Language Models via Thalamically Routed Cortical Columns [0.16921396880325779]
アーキテクチャレベルでの継続的な学習に対処するデコーダのみのバックボーンであるTRC$2(Thalamically Routed Cortical Columns)を導入します。
結果として得られるブロックはスパースでチャンク並列であり、各サブシステムのクリーンなアブレーションを維持しながら、効率的なトレーニングと推論を可能にする。
論文 参考訳(メタデータ) (2026-02-25T23:38:16Z) - A Unified Noise-Curvature View of Loss of Trainability [8.602734307457387]
継続的学習におけるトレーニング容易性(LoT)の喪失は、タスクが進化するにつれて、ステップが改善されなくなります。
バッチサイズ対応勾配雑音境界と曲率ボラティリティ制御境界の2つの相補的基準を導入する。
このしきい値を用いることで、各レイヤを安全な限界以下に維持する、単純なレイヤごとのスケジューラを構築します。
論文 参考訳(メタデータ) (2025-09-24T02:11:13Z) - Large Continual Instruction Assistant [59.585544987096974]
CIT(Continuous Instruction Tuning)は、大規模モデルにデータによる人間の意図データに従うよう指示するために用いられる。
既存の更新勾配は、CITプロセス中に前のデータセットのパフォーマンスを著しく損なうことになる。
本稿では,この課題に対処する汎用的な連続的命令チューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-08T11:24:59Z) - Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective [66.80315289020487]
Warmup-Stable-Decay (WSD) スケジュールは、一定の学習率を使用して、所定の計算予算なしで無限に継続できるイテレーションのメインブランチを生成する。
プレトレーニング損失は,河底に川がある深い谷に類似した河谷景観を呈することを示す。
この理論にインスパイアされたWSD-Sは、従来のチェックポイントの崩壊フェーズを再利用し、メインブランチを1つだけ保持するWSDの変種である。
論文 参考訳(メタデータ) (2024-10-07T16:49:39Z) - Efficient local linearity regularization to overcome catastrophic
overfitting [59.463867084204566]
単段階逆行訓練におけるカタストロフィックオーバーフィッティング(CO)は、逆行性テスト精度(最大0%まで)の急激な低下をもたらす。
我々は,従来のAT評価においてCOを効果的かつ効率的に緩和するために,ELLEと呼ばれる正規化項を導入する。
論文 参考訳(メタデータ) (2024-01-21T22:55:26Z) - ScaleLong: Towards More Stable Training of Diffusion Model via Scaling
Network Long Skip Connection [152.01257690637064]
UNetにおけるLCCの係数は,UNetの前方・後方伝播の安定性とロバスト性に大きな影響を及ぼすことを示す。
UNet における LSC の係数をスケールし,UNet のトレーニング安定性を向上する,効果的な係数スケーリングフレームワーク ScaleLong を提案する。
論文 参考訳(メタデータ) (2023-10-20T14:45:52Z) - Disentangling Spatial and Temporal Learning for Efficient Image-to-Video
Transfer Learning [59.26623999209235]
ビデオの空間的側面と時間的側面の学習を両立させるDiSTを提案する。
DiSTの非絡み合い学習は、大量の事前学習パラメータのバックプロパゲーションを避けるため、非常に効率的である。
5つのベンチマークの大規模な実験は、DiSTが既存の最先端メソッドよりも優れたパフォーマンスを提供することを示す。
論文 参考訳(メタデータ) (2023-09-14T17:58:33Z) - Infinity Learning: Learning Markov Chains from Aggregate Steady-State
Observations [13.973232545822247]
本研究では, 連続時間マルコフ連鎖(CTMC)シーケンスモデルを, シーケンスの例を伴わずに学習する作業について考察する。
定常状態に必要な無限の和を避けるためにランダムに停止した推定器を用いる勾配降下法であるinfty$-SGDを提案する。
実世界のテストベッドと合成実験に$infty$-SGDを適用し、その精度、定常状態分布を観測されていない状態に外挿する能力を示す。
論文 参考訳(メタデータ) (2020-02-11T03:29:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。