論文の概要: Enabling Dynamic Computation in Looped LMs
- arxiv url: http://arxiv.org/abs/2610.09013v1
- Date: Tue, 06 Oct 2026 19:09:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.565971
- Title: Enabling Dynamic Computation in Looped LMs
- Title(参考訳): ループ型LMにおける動的計算の高速化
- Abstract要約: ループ化されたLMは動的計算を約束する(簡単にトークンにメモリとFLOPを保存)
ループ反復がそれぞれ独自の KV-cache を必要とするため、Ouro モデルは実際にそれを認識していない。
そこで本稿では,KVキャッシング戦略として,パフォーマンスと深さの両面で新たなフロンティアを創出する,シンプルなKVキャッシング戦略を提案する。
- 参考スコア(独自算出の注目度): 11.457423385491994
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Looped LMs are parameter efficient and promise dynamic computation (saving memory and FLOPs on easy tokens). However, state-of-the-art open Looped LMs trained with this dynamic computation capability (Ouro models) do not realize it in practice as each loop iteration (depth) requires its own level of KV-cache, necessitating all loop computations. Moreover, Ouro's early-exit prior is enforced on each token equally, which results in static lower-depth like processing of all tokens regardless of difficulty. In this work, we propose a simple "best-available" KV caching strategy that works out-of-the-box, creating a new frontier in the performance vs depth space. Our approach enables up to 30% reduction in FLOPs and KV memory while retaining full-depth performance, showing the true flexibility of Looped LMs. Furthermore, training looped LMs with awareness about this KV caching strategy improves performance and efficiency. Finally, we apply a small but effective fix to the early-exit prior enforcement objective that makes tokens exit at truly heterogeneous depths based on effort. Our findings are validated on Ouro models as well as smaller looped LMs pre-trained from scratch.
- Abstract(参考訳): ループ化されたLMはパラメータ効率が良く、動的計算を約束する(メモリを節約し、FLOPをトークンに保存する)。
しかし、この動的計算能力(Ouroモデル)で訓練された最先端のオープンループ型LMは、ループの繰り返し(深さ)ごとに独自のKV-cacheを必要とするため、実際には実現しない。
さらに、Ouroの早期終了前は各トークンに等しく適用されるため、難易度に関わらず、すべてのトークンの静的な低深度処理が実現される。
そこで本研究では,KVキャッシング戦略を提案する。このKVキャッシング戦略は最初から動作し,性能対深度空間における新たなフロンティアを創出する。
提案手法では,全深度性能を維持しつつ,最大30%のFLOPとKVメモリの削減が可能であり,ループ型LMの真の柔軟性を示す。
さらに、このKVキャッシュ戦略を意識したトレーニングループLMは、性能と効率を向上させる。
最後に、トークンを真のヘテロジニアスな深さで退避させる早期執行目標に対して、努力に基づいて、小さなが効果的な修正を施す。
本研究は,Ouroモデルおよびスクラッチから事前学習した小さなループ型LMを用いて検証した。
関連論文リスト
- SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers [50.00050394179417]
ループ変換器はレイヤの共有ブロックを繰り返すことで効果的な深さを増大させるが、ほとんどの評価は固定モデルサイズと比較される。
混合演算変換器のループ化について検討し, トーケン毎のFLOP, 総非埋め込みパラメータ, およびKVキャッシュを密にマッチングする。
一連のアブリケーションを通じて、私たちはSMELTと呼ばれるレシピに到達します。これは3つの予算のすべてで未ループのBaselineにマッチしながら、レイヤの中央半分を2回ループします。
論文 参考訳(メタデータ) (2026-09-01T14:52:57Z) - Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models [8.430043498727617]
メモリ効率のよいループ変換器(MELT)は、メモリ消費から奥行きを分離する新しいアーキテクチャである。
この結果から,MELTはLoopLM性能を犠牲にすることなく,定数メモリ反復推論を実現することを示す。
論文 参考訳(メタデータ) (2026-05-08T13:25:27Z) - Fast KVzip: Efficient and Accurate LLM Inference with Gated KV Eviction [50.99402504483692]
凍結重み付き言語モデルのための新しいゲーティングベースのKVキャッシュ消去手法を提案する。
私たちのアプローチは、プリフィルとデコードの両方の段階にシームレスに統合されます。
実験の結果,KVキャッシュの最大70%を除去しながら,ほぼ無作為な性能を維持していることがわかった。
論文 参考訳(メタデータ) (2026-01-25T03:07:54Z) - Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction [53.83828564664595]
大規模言語モデル(LLM)は、キー値(KV)キャッシュを使用して、シーケンス処理中に履歴情報を格納する。
KVキャッシュ消去の現在の方法は、通常、プレフィルフェーズからの最後のウィンドウをクエリとして利用し、消去のためのKV重要度スコアを計算する。
ソフトトークンリストを組み込んだ新しいトレーニング手法であるジャッジQを提案する。
論文 参考訳(メタデータ) (2025-09-13T03:34:12Z) - Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration [42.60904284683844]
トークンの削減を3つの段階に分解するフレームワークを提案する。冗長トークンのフィルタリング,破棄された情報を保存トークンに関連付けること,冗長性を最小化するためにトークンを圧縮することである。
FiCoCo は LLaVA-1.5-7B/LLaVA-NeXT-7B で最大 5.7x/14.7x FLOPs の 92.8%/93.6% の性能保持を実現している。
論文 参考訳(メタデータ) (2024-11-26T18:53:51Z) - LoRC: Low-Rank Compression for LLMs KV Cache with a Progressive Compression Strategy [59.1298692559785]
キーバリュー(KV)キャッシュは、トランスフォーマーベースの自己回帰型大言語モデル(LLM)を提供する上で重要なコンポーネントである。
この問題を緩和するためのアプローチとしては、(1) アップサイクルステージに統合された効率的な注意変動、(2) テスト時のKVキャッシュ圧縮、(3) テスト時のKVキャッシュ圧縮がある。
そこで我々は,KV重み行列の低ランク近似を提案し,モデル再学習なしに既存のトランスフォーマーベースLCMとのプラグイン統合を実現する。
本手法は,テスト段階におけるアップサイクリング段階のモデルチューニングやタスク固有のプロファイリングを伴わずに機能するように設計されている。
論文 参考訳(メタデータ) (2024-10-04T03:10:53Z) - Bypass Back-propagation: Optimization-based Structural Pruning for Large Language Models via Policy Gradient [57.9629676017527]
本研究では,プルーンドモデルの損失を最適化することにより,確率空間におけるプルーニングマスクを直接学習する最適化に基づく構造的プルーニングを提案する。
我々は、基底となるベルヌーイ分布をサンプルのバイナリ・プルーニングマスクに学習することでこれを実現する。
LLaMA, LLaMA-2, LLaMA-3, Vicuna, Mistral モデルによる実験により, 本手法の有効性と有効性を示すことができた。
論文 参考訳(メタデータ) (2024-06-15T09:31:03Z) - VeLoRA: Memory Efficient Training using Rank-1 Sub-Token Projections [35.133698935322634]
大規模言語モデル(LLM)は、最近、多くの言語処理タスクに対処するための強力なツールとして登場した。
勾配勾配勾配を用いた効率的なモデル収束に必要な重要な成分を同定し,特徴付ける。
この結果から, 微調整と事前学習の両方のための, 安価かつメモリ効率のよいアルゴリズムが得られた。
論文 参考訳(メタデータ) (2024-05-28T09:23:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。