論文の概要: Loop Dropout: Regularizing Shared Updates in Looped Language Models
- arxiv url: http://arxiv.org/abs/2609.34218v1
- Date: Mon, 28 Sep 2026 03:24:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 22:49:16.985388
- Title: Loop Dropout: Regularizing Shared Updates in Looped Language Models
- Title(参考訳): Loop Dropout: ループ言語モデルにおける共有更新の定期化
- Abstract要約: ループ言語モデルは、同じ変圧器ブロックを繰り返し適用することで、パラメータカウントから計算深度を分離する。
我々の経験的分析によると、標準低ランク適応(LoRA)における遅延ループバイアスは顕著である。
本稿では,更新強度を維持するために,逆サバイバル再スケーリングによるアダプタアプリケーションのマスキングを低減するループドロップアウトを提案する。
- 参考スコア(独自算出の注目度): 18.32401643802363
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Looped language models separate computational depth from parameter count by repeatedly applying the same transformer block. Adapting these models requires a shared update that remains effective as hidden states evolve throughout the recurrent computation. Our empirical analysis reveals a pronounced late-loop bias in standard low-rank adaptation (LoRA): the shared update is more effective at later loop positions. This imbalance motivates training shared updates under varying combinations of their applications. Randomly omitting adapter applications alone, however, does not improve task performance; it reduces expected update strength during training while leaving inference unchanged. We introduce Loop Dropout, which couples stochastic masking of adapter applications with inverse-survival rescaling to preserve expected update strength and promote effective adaptation across loops. Extensive experiments demonstrate improved mathematical reasoning across model sizes, adapter ranks and training recipes, with benefits extending to general instruction tuning and code generation. Loop Dropout outperforms existing LoRA variants and adapter regularizers, while further analysis shows stronger early-loop adaptation. Every backbone loop remains active, and inference applies the adapter at all loops using standard LoRA without additional trainable parameters or inference computation.
- Abstract(参考訳): ループ言語モデルは、同じ変圧器ブロックを繰り返し適用することで、パラメータカウントから計算深度を分離する。
これらのモデルに適応するには、リカレントな計算を通じて隠れた状態が進化するにつれて、効果的な共有更新が必要である。
我々の経験的分析では、標準低ランク適応(LoRA)における遅延ループバイアスが顕著に示されており、共有更新は後続のループ位置においてより効果的である。
この不均衡は、アプリケーションのさまざまな組み合わせの下で共有更新のトレーニングを動機付けます。
しかし、アダプタアプリケーションのみをランダムに省略することは、タスクパフォーマンスを向上するものではなく、推論をそのままにしてトレーニング中に期待される更新強度を低下させる。
本稿では,アダプタアプリケーションの確率的マスキングと逆サバイバル再スケーリングを併用したループドロップアウトを提案する。
大規模な実験では、モデルサイズ、アダプタランク、トレーニングレシピの数学的推論が改善され、一般的な命令チューニングやコード生成にまで拡張された。
Loop Dropout は既存の LoRA 変種およびアダプタ正則化器より優れており、さらに解析により早期ループ適応がより強いことを示している。
すべてのバックボーンループは引き続きアクティブであり、推論はトレーニング可能なパラメータや推論計算を追加せずに標準のLoRAを使用してすべてのループでアダプタを適用する。
関連論文リスト
- REER-PT: Reverse-Engineered Reasoning for Perplexity-Guided Pre-training Data Augmentation [64.84437332310516]
我々は,Reverse-Engineered Reasoning (REER) を生の事前学習データに拡張するスケーラブルなフレームワークである textbfREER-PT を紹介する。
REER-PTは予測が難しいが、それ以前のコンテキストから推論できる継続を識別し、コンテキストと継続の間の欠落した接続を再構築する簡潔な推論アノテーションを挿入する。
このスパース変換は、ソーステキストを保存し、トレーニング前のオンライン推論ロールアウトを避けることで、標準的な次世代の予測と互換性を維持します。
論文 参考訳(メタデータ) (2026-08-31T11:34:19Z) - PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits [3.976291254896486]
言語モデル学習における前頭前歯列強化のアプローチ
XSum と CNN/DailyMail の実験では、PARALLEL は ROUGE-1 と ROUGE-2 の96.9--98.6% のスコアを維持している。
その結果、各サンプルをいつ、どのように更新するかの学習が、安定かつ効率的なデプロイ後ストリーム適応をサポートすることがわかった。
論文 参考訳(メタデータ) (2026-07-31T03:20:14Z) - Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping [56.14767235650558]
共有トランスブロックを繰り返し適用するLooped Transformerは、可変長の計算タスクに自然に適合するアーキテクチャである。
この差分を、列長とループ数の間の単純なアルゴリズムタスクにおける突発的相関に追従する。
私たちの研究は、"停止する時"は単なる推論時間割当ルールではなく、トレーニング設計の選択として扱われるべきであることを示唆しています。
論文 参考訳(メタデータ) (2026-06-29T08:58:09Z) - REVES: REvision and VErification--Augmented Training for Test-Time Scaling [53.197756110943395]
本稿では,オンラインデータ/プロンプト拡張とポリシー最適化を交互に行う2段階反復フレームワークを提案する。
我々は、RLベースライン上の+6.5点と、標準マルチターントレーニングにおける+4.0点の利得を観察する。
論文 参考訳(メタデータ) (2026-06-17T10:37:23Z) - Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers [13.254740124473935]
我々は、再帰エンコーダ深さを制御可能なテスト時間計算軸に変換する、深さ条件付きループ変換器 LARM を導入する。
LibriSpeechでは、推論ループの数が増加するにつれて、LARMはWERを改善している。
この結果から, 自動回帰言語モデル推論から連続非自己回帰音声認識まで, テストタイムの計算スケーリングが拡張できることが示唆された。
論文 参考訳(メタデータ) (2026-06-03T10:01:45Z) - Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training [50.86545293331458]
強化学習は、教師付き学習よりも構造的に難しい。
本稿では,固定クリッピングを政策比率の正規化された有効サンプルサイズに置き換える,単純かつ効果的なバッチ適応目的を提案する。
論文 参考訳(メタデータ) (2026-05-12T16:44:47Z) - Enhancing Auto-regressive Chain-of-Thought through Loop-Aligned Reasoning [47.06427150903487]
CoT(Chain-of-Thought)プロンプトは、言語モデルの推論能力を高めるための強力なテクニックとして登場した。
ループ変換器は目覚ましい長さの一般化能力を有するが、その限定的な一般化と適応性により、自己回帰解の代替として機能することができない。
ループ変換器の強度をよりよく活用するためのRELAYを提案する。
論文 参考訳(メタデータ) (2025-02-12T15:17:04Z) - Adaptive Adapter Routing for Long-Tailed Class-Incremental Learning [55.384428765798496]
新しいデータは、Eコマースプラットフォームレビューのような、長期にわたる流通を示す。
これは、忘れずに不均衡なデータを連続的なモデルで学習する必要がある。
LTCILの例として,AdaPtive Adapter Routing (APART) を提案する。
論文 参考訳(メタデータ) (2024-09-11T17:52:00Z) - Group Orthogonalization Regularization For Vision Models Adaptation and
Robustness [31.43307762723943]
同じ層内のフィルタ群間の正則性を促進する計算効率の良い正規化手法を提案する。
実験により,近年の拡散モデルと視覚変換器(ViT)の適応手法に組み込むと,この正規化により下流タスクの性能が向上することが示された。
論文 参考訳(メタデータ) (2023-06-16T17:53:16Z) - Finetuning Pretrained Transformers into RNNs [81.72974646901136]
トランスフォーマーは自然言語生成においてリカレントニューラルネットワーク(RNN)を上回っている。
線形複雑リカレント変種は自己回帰生成に適していることが証明されている。
この研究は、事前訓練された変換器を効率の良い再帰変換器に変換することを目的としている。
論文 参考訳(メタデータ) (2021-03-24T10:50:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。