論文の概要: Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets
- arxiv url: http://arxiv.org/abs/2608.11233v1
- Date: Fri, 31 Jul 2026 03:02:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.588452
- Title: Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets
- Title(参考訳): 繰り返し深度を事前訓練言語モデルに再適合させる:2つのパラメータ予算におけるインストール、外挿、転送、保持
- Abstract要約: 密集した事前訓練された言語モデルは、繰り返しの深さで再適合することができる。
同様の大きさのスクラッチパッドを訓練したモデルは、学習した地平線内での繰り返しモデルと一致したが、その先で崩壊した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: A dense, pretrained language model can be retrofitted with recurrent depth and learn an iterative latent transition that persists after outcome-only annealing. Qwen2.5-0.5B-Instruct is split into a Prelude, a weight-tied Recurrent Block, and a Coda, with an identity-preserving one-loop path and a re-entry bridge on later loops. At loop 1 the retrofit remains non-inferior to its base on a preregistered ARC battery. Three findings. First, the mechanism is a reusable procedure rather than terminal-answer lookup, and installs at two budgets: 6M trained parameters over frozen base weights and 180M full-block. With intermediate-step supervision, the model computes one task step per loop and persists when only final answers are graded. The adapter matched the full block overall (83.8% versus 84.0%), led through depth 11, and trailed beyond. Verbal fine-tuning reached 79-86% on controlled verbal renderings (zero-shot transfer was minimal), and adapter verbal training begun from the installed mechanism outpaced matched fresh training by 18.6 points, including on a held-out test set. Second, the operation extrapolates to roughly 1.5 times its supervised depth, holding 70% accuracy through depth 18. Third, a same-size scratchpad-trained model matched the recurrent model within its learned horizon but collapsed beyond it. The recurrent model won overall, 84% versus 72%, retained 53% versus 2.5% beyond depth 10, and answered 7.6 times faster. An iterative transformer can therefore perform deeper reasoning in latent space faster than comparable or larger models fine-tuned on the same task, in a system-level comparison. A second task, running the rule in reverse, exposed the limits: the inverse was learnable in isolation, but no continuation acquired it while preserving the installed mechanism and general capability, a catastrophic-interference boundary. Learned depth selection remains open.
- Abstract(参考訳): 密集した事前訓練された言語モデルは、繰り返しの深さで再現することができ、結果のみのアニール後に持続する反復的な潜伏遷移を学ぶことができる。
Qwen2.5-0.5B-インストラクトは、プレルード、重み付けされたリカレントブロック、コダに分割され、アイデンティティ保護のワンループパスと後続のループに再突入橋が設けられている。
ループ1では、再調整は未登録のARC電池のベースにないままである。
3つの発見。
第一に、このメカニズムはターミナル・アンサー・ルックアップではなく再利用可能な手順であり、凍結ベースウェイトに対する6Mのトレーニングされたパラメータと180Mのフルブロックの2つの予算にインストールされる。
中間段階の監視により、モデルはループ毎に1つのタスクステップを計算し、最終回答のみがランク付けされたときに持続する。
アダプタは全ブロック(83.8%対84.0%)と一致し、ディープ11を通り、さらに後を追った。
言語微調整は、制御された言語レンダリング(ゼロショット転送は最小限)で79~86%に達し、インストールされたメカニズムから開始されたアダプタ言語訓練は、ホールドアウトテストセットを含む18.6ポイントで一致した。
第2に、操作は監督された深さの約1.5倍まで外挿し、深さ18を介して精度を70%保持する。
第三に、同じ大きさのスクラッチパッドを訓練したモデルは、学習した地平線内での繰り返しモデルと一致したが、その先で崩壊した。
合計84%対72%のリカレントモデルが勝利し、53%対2.5%のデプス10を上回り、7.6倍の速さで回答した。
したがって、反復変換器は、システムレベルの比較において、同一タスクで微調整された類似モデルや大型モデルよりも高速に潜時空間でより深い推論を行うことができる。
2つ目のタスクはルールを逆で実行するもので、逆は独立して学習可能であるが、インストールされたメカニズムと一般的な能力、破滅的・干渉境界を維持しながらそれを取得することはなかった。
学習した深度選択は依然としてオープンである。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness [76.6324710887112]
NeoHorse-1は、エージェントのポストトレーニングを通じてこの経路を探索するために開発されたエージェントネイティブモデルのファミリーである。
本システムでは,異種モデルプールとインテリジェントなルーティング,予測能力要求,選択されたサービス層,およびその後のユーザ毎のインタラクションを結合する。
論文 参考訳(メタデータ) (2026-09-08T03:14:54Z) - PROOF-Gen: From Optimized Data to Better Distillation [6.158612515104146]
ツール呼び出しエージェントを駆動するポストトレーニングパイプラインは、毎日または毎週のケイデンスでこのステージを再実行し、フロンティアと教師の費用を各サイクルに支払う。
2ベンチでは、教員試験の57%が失敗し、その3分の2がほぼミスである。
本稿では,これらの故障からゴールデントラジェクトリを回復するPROOF-Genを,シナリオごとのプロンプト最適化により導入する。
論文 参考訳(メタデータ) (2026-08-24T23:33:56Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter [0.0]
内在的,6/9タスク,rhoが8倍まで)、奥行きが活発に痛む(逆転,2/9,rhoが0.87倍まで)、あるいは奥行きがほとんど問題にならない(平ら)。
インバージョンは、トランスフォーマー予測子の下で再現されるが、そのマニフェストは構成に依存し、メトリック空間、水平線、エンコーダ、バックボーン、そして最も強い -- トレーニングデータでシフトする。
より多くの計算が世界モデルに役立つかどうかはタスクの特性ではない。
論文 参考訳(メタデータ) (2026-07-11T08:27:33Z) - Learning to Solve Generative ODEs Beyond the Linear Span [50.13853710831612]
空間残留演算子を用いてスカラー係数更新を増強する軽量ニューラルソルバであるSpanLiftを提案する。
SpanLiftは、ピクセル空間の拡散、潜水流のマッチング、降水は今、最先端の数ステップのサンプリングを実現している。
論文 参考訳(メタデータ) (2026-06-07T15:22:13Z) - Reversible Foundations: Training a 120B Sparse MoE through State-Preserving Scaling [0.0]
LightningLM 0.1Vは、小さな高密度の種から460の経路を持つ専門家を持つ120Bモデルまで、4段階で成長した反復バックボーン言語モデルである。
全系統は8Kコンテキストでより大きなステージである単一ノード上で実行され、120Bスケールで1.78のトレーニング損失がリリースされている。
論文 参考訳(メタデータ) (2026-06-05T15:48:42Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - CRMA: A Spectrally-Bounded Backbone for Modular Continual Fine-Tuning of LLMs [0.0]
我々は、内部混合行列 M がシンクホーン正規化による全ての前方通過において二重確率である残留アダプタ CRMA を紹介する。
5つのドメインにまたがるMistral-7Bでは、モジュラー・パー・タスクのLoRAは、+42.96%+/-5.5(ナイーブ微調整)から-0.17%+/-0.17までのバックボーンの損失相対的ドリフトを仲介する。
論文 参考訳(メタデータ) (2026-05-29T21:50:23Z) - Ouroboros: Dynamic Weight Generation for Recursive Transformers via Input-Conditioned LoRA Modulation [0.0]
Ouroborosは、コンパクトなコントローラハイパーネットワークを再帰変換ブロックにアタッチするシステムである。
コントローラは現在の隠れ状態を観察し、ステップごとの対角変調ベクトルを生成し、凍ったSVD-d LoRAベースに適用する。
Qwen2.5-3BはPrelude/Recurrent/Codaアーキテクチャに分割され、Ouroborosは修正されていない17層ベースラインのトレーニング損失を43.4%削減した。
完全なシステムでは、9.2Mのトレーニング可能なパラメータ(コントローラ、ゲート、ステップごとのノルム)しか追加されていないが、同等の大きさの静的LORAを1.44ロスで上回っている。
論文 参考訳(メタデータ) (2026-04-02T13:52:32Z) - Valid Stopping for LLM Generation via Empirical Dynamic Formal Lift [6.908972852063454]
シーケンシャルEDFLは、シーケンシャルベースラインに対して22~28%生成を減少させる。
EDFLは第1段階のフィルタとして機能し、検証負荷を83%削減する。
論文 参考訳(メタデータ) (2025-10-07T21:28:53Z) - Re^2TAL: Rewiring Pretrained Video Backbones for Reversible Temporal
Action Localization [65.33914980022303]
時間的行動ローカライゼーション(TAL)は、様々な期間と複雑な内容の行動を予測するために、長期的推論を必要とする。
ほとんどのメソッドは、ローカライズ問題に最適化することなく、事前抽出された機能のみをトレーニングできる。
本稿では,既存のビデオバックボーンを可逆性talにリワイヤリングする,新しいエンドツーエンド手法Re2TALを提案する。
論文 参考訳(メタデータ) (2022-11-25T12:17:30Z) - Deep Model Reassembly [60.6531819328247]
我々はDeep Model Reassembly(DeRy)と呼ばれる新しい知識伝達タスクを探索する。
DeRyの目標は、まず各モデルを固有のビルディングブロックに分割し、それから派生したブロックを選択的に再組み立てて、カスタマイズされたネットワークを生成することである。
ImageNetでは、最高の再組み立てモデルは微調整なしで78.6%のトップ1の精度を実現している。
論文 参考訳(メタデータ) (2022-10-24T10:16:13Z) - Faster Depth-Adaptive Transformers [71.20237659479703]
深さ適応型ニューラルネットワークは入力単語の硬さに応じて動的に深さを調整することができる。
従来の作業は一般的に、計算が各レイヤで続行するか停止するかを決定するために停止ユニットを構築する。
本稿では,停止ユニットを除去し,必要な深さを事前に推定し,より高速な深度適応モデルを生成する。
論文 参考訳(メタデータ) (2020-04-27T15:08:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。