論文の概要: Towards Looped Models Done Right, Part II: Rethinking at Fixed Points
- arxiv url: http://arxiv.org/abs/2610.06833v1
- Date: Mon, 05 Oct 2026 17:58:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 22:18:52.877052
- Title: Towards Looped Models Done Right, Part II: Rethinking at Fixed Points
- Title(参考訳): ループモデルが正しく行うための第2部:固定点の再考
- Abstract要約: 頻繁な状態が固定点に達するほど、その経路が重要になる。
我々は、これらの固定点を形成するトレーニングの2つのコンポーネント、すなわち、深さ前と入力注入を改善する。
100Mから1.6Bのパラメータから、学習された先行および注入は、ハギンの先行および既存の注入方式と比較して、各スケールでのパープレキシティが低い。
- 参考スコア(独自算出の注目度): 22.011559933859868
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Every recurrence of a looped language model adds cost in training, decoding, prefill, and reinforcement learning (RL). The closer recurrent states get to fixed points, the less the path to them matters. This enables truncated backpropagation in training; terminal key-value (KV) sharing for decoding with almost no loss in accuracy; a distilled student that prefills up to 1.79x faster; and RL updates that compute gradients from saved rollout states, 2x faster than backpropagating through the replayed trajectory. We therefore improve the two components of training that shape these fixed points: the depth prior and input injection. Fixed-depth training breaks KV sharing, and Huginn's broad depth prior supports sharing but dilutes supervision at the target depth more than sharing requires; we learn the prior from prediction feedback, with an entropy term that keeps it broad. Existing injection schemes let the state's component along the input amplify or cancel the injection; we remove this component with orthogonal injection. From 100M to 1.6B parameters, the learned prior and orthogonal injection lower perplexity at every scale relative to Huginn's prior and existing injection schemes, respectively. At 1.6B, the learned prior with a 3x smaller KV cache matches the downstream average of fixed-depth training with the full cache.
- Abstract(参考訳): ループ言語モデルの繰り返しは、トレーニング、デコード、プリフィル、強化学習(RL)のコストを増大させる。
より近いリカレント状態が固定点に達すると、それらへのパスが重要になる。
これにより、トレーニングで切り離されたバックプロパゲーション、ほとんど精度を損なわないデコードのための端末キー値(KV)共有、最大1.79倍高速でプリフィルする蒸留された学生、保存されたロールアウト状態からの勾配を計算するRL更新、リプレイされた軌跡を通るバックプロパゲーションよりも2倍高速になる。
したがって、これらの固定点を形成するトレーニングの2つのコンポーネント、すなわち、深さ前と入力注入を改善する。
固定深度トレーニングはKV共有を破り、Huginn氏の広範な深度は共有をサポートするが、共有よりも目的の深度での監督を希釈する。
既存のインジェクションスキームでは、状態のコンポーネントがインジェクションを増幅またはキャンセルする。
100M と 1.6B のパラメータから、学習された先行射出法と直交射出法は、それぞれハギンの先行射出法と既存の射出法に比較して、各スケールで低いパープレキシティを示した。
1.6Bでは、学習前の3倍のKVキャッシュは、固定深度トレーニングの下流平均とフルキャッシュとを一致させる。
関連論文リスト
- SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing [77.91660464664615]
Diffusion Transformers (DiTs) はビデオ生成において主要なバックボーンとなっているが、その二次的注意コストは依然として大きなボトルネックとなっている。
本稿では,不足しているコントリビューションをトレーニングなしで回収できることを示す。
パラメータフリーな線形補償分岐であるSVG-EARを導入する。
論文 参考訳(メタデータ) (2026-03-09T22:15:31Z) - DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning [134.03095505580276]
Doing Length pEnalty Right (DLER)は、バッチワイド報酬正規化、高いクリッピング、ダイナミックサンプリング、単純なトランケーション長ペナルティを組み合わせたトレーニングレシピである。
DLERは最先端の精度-効率のトレードオフを実現し、出力長を70%以上削減し、以前のベースライン精度をすべて上回っている。
論文 参考訳(メタデータ) (2025-10-16T20:05:57Z) - REPA Works Until It Doesn't: Early-Stopped, Holistic Alignment Supercharges Diffusion Training [58.33728862521732]
Diffusion Transformer (DiTs)は最先端の画像品質を提供するが、訓練は依然として遅い。
最近の治療 -- DiT の隠された特徴と非生成的教師(例えば DINO)の特徴とを一致させる表現アライメント(REPA) -- は、初期のエポックを劇的に加速させるが、その後パフォーマンスを低下させる。
生成学習者が共同データ分布をモデル化し始めると、教師の低次元埋め込みと注意パターンがガイドではなくストラトジャケットになる。
HASTEを紹介する
論文 参考訳(メタデータ) (2025-05-22T15:34:33Z) - REPA-E: Unlocking VAE for End-to-End Tuning with Latent Diffusion Transformers [52.55041244336767]
従来のディープラーニングの知恵は、エンド・ツー・エンドのトレーニングが可能な限り望ましいと判断する。
遅延拡散変換器では,標準拡散損失を用いたVAEと拡散モデルの両方のエンドツーエンドトレーニングが有効でないことが観察された。
拡散損失は非効率であるが,表現アライメント(REPA)の損失によってエンドツーエンドのトレーニングをアンロックできることが示されている。
論文 参考訳(メタデータ) (2025-04-14T17:59:53Z) - Improving the Training of Rectified Flows [14.652876697052156]
拡散モデルは画像生成とビデオ生成に大いに期待できるが、最先端モデルからのサンプリングには高コストの数値積分が必要である。
この問題に対処するための1つのアプローチは整流流であり、これは繰り返し、トランケーションエラーの影響を受けにくい滑らかなODEパスを学習する。
本研究は,NFEの低い環境下においても,改質流れを訓練するための改良手法を提案する。
改良された改質流は, 整合蒸留, 進行蒸留といった最先端蒸留法を1段階, 2段階で上回った。
論文 参考訳(メタデータ) (2024-05-30T17:56:04Z) - SVD-DIP: Overcoming the Overfitting Problem in DIP-based CT
Reconstruction [2.104138432097827]
我々は、学習を特異値の適応に制限する新しい戦略を採用することにより、事前訓練されたDIPの規則化された微調整に基づいて構築する。
ノイズへのオーバーフィットを克服することにより,DIP最適化の安定性が大幅に向上したことを報告した。
論文 参考訳(メタデータ) (2023-03-28T06:08:32Z) - Online Convolutional Re-parameterization [51.97831675242173]
2段階のパイプラインであるオンライン畳み込み再パラメータ化(OREPA)は、複雑なトレーニング時間ブロックを単一の畳み込みに絞ることで、巨大なトレーニングオーバーヘッドを低減することを目的としている。
最先端のre-paramモデルと比較して、OREPAはトレーニング時間のメモリコストを約70%削減し、トレーニング速度を約2倍向上させることができる。
また、オブジェクト検出とセマンティックセグメンテーションの実験を行い、下流タスクに一貫した改善を示す。
論文 参考訳(メタデータ) (2022-04-02T09:50:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。