論文の概要: Almost Free State Prediction Separation
- arxiv url: http://arxiv.org/abs/2609.03807v3
- Date: Tue, 08 Sep 2026 15:13:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.907896
- Title: Almost Free State Prediction Separation
- Title(参考訳): ほぼ自由状態予測分離
- Abstract要約: 本稿は、状態予測分離をほぼ自由にする。
キーや値がまったく書けない予測ストリームで、シーケンスの既存の位置に乗るのです。
- 参考スコア(独自算出の注目度): 25.82506789380018
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: State--prediction separation (SPS) relieves a language model's hidden state of two competing burdens---summarizing the context and predicting the next token---by splitting the forward pass into a state stream and a prediction stream. The separation works, but it is expensive: the prediction stream is a second pass over the whole backbone, costing $\sim$1.9$\times$ the pretraining FLOPs, and even more in terms of wall-clock time when using a flexible attention mask. This paper makes state--prediction separation almost free. We take the separation to its limit with a free pause token: a prediction stream that writes no keys or values at all and so rides the sequence's existing positions. It improves next-token prediction of a standard Transformer by 2-3 centinats in practice on a 1B parameter model, and because it adds no position it costs nothing at inference---no added context length, no KV cache, no decode steps, and essentially no latency, with the growth in inference flops typically irrelevant as it is not the active bottleneck on throughput. The cost is therefore entirely in training where we use four mechanisms to drive it down: a two-pass split that keeps FlashAttention kernels viable, the $w{=}0$ prediction window, a shared gated FFN that evaluates one FFN per position rather than one per stream, and phasing the separation onto the tail of the run. Together these bring the overhead versus an optimized pretraining pipeline to $1.33\times$ wall-clock while recovering ~94% of the gain compared to SPS, and to as low as $1.09\times$ along a graceful quality/compute tradeoff. Furthermore, the FFN optimization reduces the raw flops required at inference time. The result is an isoflop, isoparameter, and isotoken improvement over standard next token trained transformers.
- Abstract(参考訳): 状態予測分離(State-prediction separation, SPS)は、言語モデルの2つの競合する負荷の隠れ状態を緩和する - コンテキストを推定し、次のトークンを予測する - フォワードパスを状態ストリームと予測ストリームに分割することで。
予測ストリームはバックボーン全体の第2パスであり、事前訓練されたFLOPの費用は$$\sim$1.9$\times$であり、フレキシブルなアテンションマスクを使用する場合のウォールタイムは更に高くなる。
本稿は、状態予測分離をほぼ自由にする。
キーや値がまったく書けない予測ストリームで、シーケンスの既存の位置に乗るのです。
1Bパラメータモデルで実際に2~3セントの精度で標準のTransformerの次のトーケン予測を改善し、ロケーションを追加せず、推論に何のコストもかからないため、---追加コンテキスト長、KVキャッシュなし、デコードステップなし、本質的に遅延なし、推論フロップの増加は、スループットのアクティブなボトルネックではないため、一般的には無関係である。
FlashAttentionカーネルを有効に保つ2パスのスプリット、$w{=}0$の予測ウィンドウ、ストリーム毎に1つではなく1つの位置でFFNを評価する共有ゲートFFN、ランの尾に分離をフォーカスする。
これらを合わせると、最適化されたプレトレーニングパイプラインに対するオーバーヘッドは、SPSと比較して利益の約94%を回復し、優雅な品質/計算トレードオフと共に1.09\times$に低下する。
さらに、FFN最適化は、推論時に必要となる生のフロップを減らす。
その結果、標準の次のトークントレーニングトランスよりも、イソフロップ、イソパラメータ、イソトケンの改善が実現した。
関連論文リスト
- Decay versus dephasing in Rydberg analog optimization: exchange rate, mechanism, and schedule design [0.05427878000393745]
ノイズレスリドバーグ原子最適化はデコヒーレンスとデフォーカスの観点から研究されている。
一階摂動理論はノイズのない伝播だけで$$を再現する。
コストモデル全体がノイズを伴わないため、ノイズのないシミュレーションをすることなく、スケジュールをデバイスのチャネルミックスに調整することができる。
論文 参考訳(メタデータ) (2026-08-30T15:41:02Z) - Fast Weight Attention for Continual Learning [75.34672054079408]
リカレント高速記憶と選択状態空間モデルは、拡張コンテキストを固定サイズのリカレント状態に圧縮する。
正則化された二乗誤差回帰と負の内積目標の1次更新を導出する。
我々は、数値的に安定な正のデカイ再正規化とともに、繰り返し、マスクパラレル、チャンクパラレル形式を提供する。
論文 参考訳(メタデータ) (2026-08-27T22:55:11Z) - SANE: State Anomaly Neutralization for Stable Extreme-Context Delta-Rule Models [53.86918766240095]
Delta-Ruleリカレントモデルは固定サイズの状態を維持しており、$O(1)$の推論メモリが可能であるが、極端なコンテキスト外挿では不安定になる可能性がある。
我々は,チャンク内並列構造を保ちながら,チャンク境界における適応$tanh$圧縮を適用したtextbfState Anomaly Neutralization (SANE)を提案する。
論文 参考訳(メタデータ) (2026-08-23T10:41:07Z) - Improving Few-Step Language Flows with Untied Self-Conditioning [17.95725125716772]
フローマッチング言語モデルは、すべてのトークン位置を並列に洗練し、遅延のためのサンプリングステップを交換することができる。
我々は、この劣化の原因を、前述の自己条件における列車間ミスマッチに遡る。
このミスマッチは、自己条件入力とソルバ更新の両方を劣化させ、モデル自身の構造から各修正を導出することを示す。
論文 参考訳(メタデータ) (2026-08-23T06:46:17Z) - Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction [24.266851703305004]
Viベースの天気予報モデルは、近くの大気グリッドポイントが時間とともに同様の値や領域を含む場合であっても、すべての空間トークンにわたって計算を適用する。
パラメータフリーなプラグインルーティングモジュールであるSparse-Reslimを導入する。
ERA5の解像度は0.25textdegree標準と2つのモデルファミリ、決定論的トランスフォーマーと拡散モデルまでで、Sparse-Reslimは評価変数の予測精度を著しく向上し、コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-07-02T23:43:01Z) - Don't Pause! Every prediction matters in a streaming video [55.509551643600794]
一般的なストリーミング知覚とアシスト機能を評価するマルチターンプロアクティブクエリを特徴とするSPOT-Benchを提案する。
SPOT-BenchにはTimeliness-F1が付属している。
i)オフラインモデルは、確実にイベントを検知するが、スパム予測は失敗する; (ii) サイレントをトレーニングした後、スパムを減らし、応答を低下させる; (iii) ストリーミングビデオの半分は応答を期待しない。
論文 参考訳(メタデータ) (2026-04-27T11:07:03Z) - Scaling Attention via Feature Sparsity [50.64995497733461]
超長期のコンテキストにトランスフォーマーをスケールすることは、自己注意のコスト$O(n2 d)$コストによってボトルネックとなる。
本稿では,高次元表現性を維持するために,クエリとキーを$k$sparseコードとして表現するスパース特徴注意法を提案する。
GPT-2とQwen3の事前トレーニングで、SFAは密度の高いベースラインにマッチし、最高2.5タイムのスピードを向上し、FLOPとKVキャッシュを50%近く削減した。
論文 参考訳(メタデータ) (2026-03-17T08:41:50Z) - AdaPonderLM: Gated Pondering Language Models with Token-Wise Adaptive Depth [23.442686851761298]
AdaPonderLMは、事前トレーニング中にトークン単位の早期終了を学習する、自己教師型リカレント言語モデルである。
AdaPonderLMは、比較可能な言語モデリングの難易度と競合する下流の精度を維持しながら、推論計算を約10%削減する。
論文 参考訳(メタデータ) (2026-03-02T14:28:16Z) - StreamingTOM: Streaming Token Compression for Efficient Video Understanding [6.9203477336374775]
既存のアプローチはLLM後のkv-cacheのみを規制し、コストのかかるLLM前のプリフィルは変わらない。
StreamingTOMは,LLM前とLLM後の両方のボトルネックに,予測可能なレイテンシで対処する,トレーニングフリーでプラグイン&プレイの2段階フレームワークです。
実験では, 従来のSOTAと比較して, 15.7 時間で kv-cache 圧縮, 12 時間で低ピークメモリ, 2 時間で速い TTFT 圧縮を実現している。
論文 参考訳(メタデータ) (2025-10-21T03:39:41Z) - Pipeline Parallelism is All You Need for Optimized Early-Exit Based Self-Speculative Decoding [73.67253077506672]
大規模言語モデル(LLM)は、優れた生成品質を提供するが、非常に高い推論コストをもたらす。
早期排他的自己投機的復号法(EESD)がこのコストを軽減するために登場した。
ドラフトと検証作業を完全にパイプライン化するパイプライン・パラレル自己スペクティブ・デコーディング(PPSD)を提案する。
論文 参考訳(メタデータ) (2025-09-19T04:51:41Z) - Beyond Next Token Prediction: Patch-Level Training for Large Language Models [69.67438563485887]
大規模言語モデル(LLM)に対するパッチレベルのトレーニングを導入する。
パッチレベルのトレーニングでは、言語モデルの短いパッチシーケンスをフィードし、次のパッチを予測するようにトレーニングします。
パッチレベルのトレーニングは、モデルのパフォーマンスを損なうことなく、全体のトレーニングコストを0.5$times$に削減できることを示す。
論文 参考訳(メタデータ) (2024-07-17T15:48:39Z) - Think before you speak: Training Language Models With Pause Tokens [73.61375226378712]
言語モデルは、即座に連続して一連のトークンを生成して応答を生成する。
代わりに、$(K+1)th$トークンを出力する前に、モデルに$K+10$隠れベクターを操作させるとしたらどうでしょう?
私たちは、(学習可能な)$textitpause$トークンを使って、言語モデルでトレーニングと推論を行うことで、このアイデアを運用します。
論文 参考訳(メタデータ) (2023-10-03T17:32:41Z) - Prune Spatio-temporal Tokens by Semantic-aware Temporal Accumulation [89.88214896713846]
STAスコアは、時間的冗長性と意味的重要性の2つの重要な要因を考慮に入れている。
市販のビデオトランスフォーマーとビデオウィンにSTAモジュールを適用する。
結果: Kinetics-400 と something-Something V2 は 30% のオーバーシェルフ削減を実現し,0.2% の精度低下を実現した。
論文 参考訳(メタデータ) (2023-08-08T19:38:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。