論文の概要: FlashLoop: Fast and Memory-Efficient Looped Transformers via Lazy Updates
- arxiv url: http://arxiv.org/abs/2609.29812v2
- Date: Mon, 28 Sep 2026 15:33:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-29 21:31:51.802336
- Title: FlashLoop: Fast and Memory-Efficient Looped Transformers via Lazy Updates
- Title(参考訳): FlashLoop:遅延更新による高速でメモリ効率の良いループ変換器
- Abstract要約: 我々は,トークンスパース更新,スパースアテンション,KV残差量子化によるクロスループ冗長性を低減する,トレーニングフリーな推論フレームワークであるFlashLoopを紹介した。
いくつかのLooped Transformersモデルで、FlashLoopは最大1.64$times$エンドツーエンドのスピードアップと最大6$times$KV-cacheメモリリダクションを提供する。
- 参考スコア(独自算出の注目度): 25.238023242968524
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Looped Transformers have attracted substantial attention as a parameter-efficient approach to increasing computational depth through repeated application of shared Transformer blocks. However, their practical advantages over conventional Transformers remain under debate: each additional loop incurs another Transformer pass and requires caching another set of KV states, causing inference FLOPs and KV-cache memory to grow continuously with loop depth. This overhead becomes particularly severe at large loop counts and long context, preventing the parameter efficiency of Looped Transformers from translating into practical inference efficiency. In this paper, we find that much of the additional computation and storage introduced by looping is redundant. As recurrence proceeds, state changes become increasingly concentrated on a small subset of tokens; attention-output differences are dominated by a sparse and stable subset of key columns; and KV residuals between adjacent loops become progressively more amenable to low-bit quantization. Building on these observations, we introduce FlashLoop, a training-free inference framework that reduces cross-loop redundancy through token-sparse updates, sparse attention, and KV-residual quantization. Across several Looped Transformers models, FlashLoop delivers lossless accuracy while achieving up to 1.64$\times$ end-to-end speedup and up to 6$\times$ KV-cache memory reduction, substantially improving the practicality of scaling Looped Transformers to greater computational depths and longer context.
- Abstract(参考訳): ループ変換器は、共有変換器ブロックの繰り返し適用により計算深度を増大させるパラメータ効率のアプローチとして、かなりの注目を集めている。
しかし、従来のトランスフォーマーよりも実践的な利点は議論の的であり、各ループは別のトランスフォーマーパスを発生させ、別のKV状態のキャッシュを必要とするため、推論FLOPとKV-cacheメモリはループ深さとともに連続的に成長する。
このオーバーヘッドは、大きなループ数と長いコンテキストにおいて特に深刻になり、ループ変換器のパラメータ効率が実用的な推論効率に変換されるのを防ぐ。
本稿では,ループ処理によって導入された余剰計算やストレージの多くが冗長であることを示す。
再帰が進むにつれて、状態変化はトークンの小さなサブセットに集中するようになり、注意出力の違いはキー列のスパースと安定なサブセットに支配され、隣接するループ間のKV残差は徐々に低ビット量子化に寄与する。
これらの観測に基づいて、トークンスパース更新、スパースアテンション、KV残差量子化によるクロスループ冗長性を低減する、トレーニング不要な推論フレームワークであるFlashLoopを紹介した。
いくつかのLooped Transformersモデル全体で、FlashLoopは最大1.64$\times$ end-to-end Speedup、最大6$\times$ KV-cacheメモリリダクションを実現し、より深い計算深度と長いコンテキストにループトランスフォーマーをスケールする実用性を大幅に改善する。
関連論文リスト
- SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers [50.00050394179417]
ループ変換器はレイヤの共有ブロックを繰り返すことで効果的な深さを増大させるが、ほとんどの評価は固定モデルサイズと比較される。
混合演算変換器のループ化について検討し, トーケン毎のFLOP, 総非埋め込みパラメータ, およびKVキャッシュを密にマッチングする。
一連のアブリケーションを通じて、私たちはSMELTと呼ばれるレシピに到達します。これは3つの予算のすべてで未ループのBaselineにマッチしながら、レイヤの中央半分を2回ループします。
論文 参考訳(メタデータ) (2026-09-01T14:52:57Z) - LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling [72.71005779366162]
本研究では,ゲインコストの観点から,ループ数選択について検討する。
この研究は18Tトークンのスクラッチからループ数が異なるループ数でLoopCoder-v2をトレーニングし、それにマッチした命令チューニングと評価を行う。
実証的には、この2ループ版はコード生成、コード推論、エージェントソフトウェアエンジニアリング、ツールスベンチマークなど、非ループベースラインよりも幅広い利益をもたらしている。
論文 参考訳(メタデータ) (2026-06-16T15:03:05Z) - Déjà View: Looping Transformers for Multi-View 3D Reconstruction [109.98721386523641]
最近のフィードフォワード3次元再構成変換器は10億以上のパラメータに拡張されている。
モデルの深さは、部分的にイテレーションを購入し、ユニークなパラメータで非効率に支払い、代わりにアーキテクチャでそのイテレーションを明示することを示しています。
我々のモデルであるDéjViewは、1つのループ変換ブロックをK精細ステップのビュー毎の機能に繰り返し適用する。
論文 参考訳(メタデータ) (2026-05-28T16:47:48Z) - Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior [107.2098567818173]
Latent Recurrent Transformer (LRT) は自己回帰変換器の軽量化である。
LRTは、次のトークンのリカレントメモリとして、前のトークンから高レベルなソース層隠れステートを再利用する。
論文 参考訳(メタデータ) (2026-05-26T10:10:26Z) - DeepCoT: Deep Continual Transformers for Real-Time Inference on Data Streams [63.27233749591346]
トランスフォーマーベースのモデルは、ますます複雑なタスクに取り組むために、そのサイズとパラメータ数を劇的に増加させてきた。
ストリームデータ推論は通常、スライディング時間ウィンドウ上で実行され、非常に冗長な計算に繋がる。
提案するDeep Continual Transformer(DeepCoT)は冗長性のないエンコーダのみのモデルであり,最小限の変更で既存のディープエンコーダアーキテクチャに適用できる。
論文 参考訳(メタデータ) (2025-11-21T16:15:43Z) - Parallel Loop Transformer for Efficient Test-Time Computation Scaling [34.8255648599522]
大規模言語モデル(LLM)は強力だが、推論中に現実世界で使うには遅すぎるしコストもかかる。
ループ変換器は、複数の計算ステップで同じ重みを再利用することでパラメータを節約する。
ループが次々と実行され、各追加ループで推論遅延とメモリ要求が増大する。
論文 参考訳(メタデータ) (2025-10-28T15:35:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。