論文の概要: Express Language Modeling
- arxiv url: http://arxiv.org/abs/2606.10944v1
- Date: Tue, 09 Jun 2026 14:48:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-10 15:40:58.565659
- Title: Express Language Modeling
- Title(参考訳): 高速言語モデリング
- Authors: Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi, Lester Mackey,
- Abstract要約: 本稿では,非因果的注意近似を因果近似に変換するための新しいツールExpressを紹介する。
最先端のThinformer近似と組み合わせることで、Expressは最もよく知られた因果的注意保証を改善する。
- 参考スコア(独自算出の注目度): 21.616783407336424
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce a new tool, Express, for converting a non-causal attention approximation into a causal approximation with matching approximation guarantees. When combined with the state-of-the-art Thinformer approximation, Express improves upon the best known causal attention guarantees, delivering $\log^{3/2}(n)/s$ approximation error with only $O(s)$ memory and $O(s^2 \log^2(n))$ compression overhead for a sequence of length $n$. We pair these developments with an efficient I/O-aware Triton implementation, demonstrate substantial speedups over FlashAttention 2, and use Express to overcome four resource bottlenecks in the language modeling pipeline: long-context prefill, KV cache compression, long-form memory-constrained decoding, and long-form compute-constrained decoding.
- Abstract(参考訳): 我々は,非因果的注意近似を,一致した近似保証を伴う因果近似に変換するための新しいツールExpressを導入する。
最先端のThinformer近似と組み合わせると、Expressは最もよく知られた因果的アテンションの保証を改善し、$\log^{3/2}(n)/s$アロキシメーションエラーをわずか$O(s)$メモリと$O(s^2 \log^2(n))$の圧縮オーバーヘッドで提供します。
我々は、これらの開発を効率的なI/O-aware Triton実装と組み合わせ、FlashAttention 2よりも大幅にスピードアップし、Expressを使用して言語モデリングパイプラインの4つのリソースボトルネックを克服する:長文プリフィル、KVキャッシュ圧縮、長文メモリ制約デコーディング、長文計算制約デコーディング。
関連論文リスト
- End-to-End Context Compression at Scale [81.70601323130997]
長期コンテキスト言語モデル推論は、KVキャッシュがコンテキスト長とともに増加するにつれて、メモリによってボトルネックとなる。
KVキャッシュを圧縮する最近の技術は、モデル品質を著しく低下させるか、あるいはかなりの時間を要するか、1つの長いプロンプトを圧縮するために計算する。
既存のアプローチは、精度-効率のフロンティア上のKVキャッシュ圧縮と競合しない。
論文 参考訳(メタデータ) (2026-06-08T15:43:16Z) - Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding [6.702271454978951]
長いコンテキストは、大きな言語モデルの能力を改善するが、深刻なハードウェアの課題を生じさせる。
本稿では,ハードウェア・ソフトウェア共同設計による長期的注意喚起のためのハードウェアアクセラレータを提案する。
私たちの設計では、A100よりも3.82倍のスピードアップと74.19倍のエネルギー効率を実現しています。
論文 参考訳(メタデータ) (2026-04-27T14:06:21Z) - Transformer Based Linear Attention with Optimized GPU Kernel Implementation [10.235738752130803]
線形注意(LA)機構はO(ND2)$の線形時間複雑性を提供し、通常の注意に匹敵する精度を示している。
本稿では,高度に最適化された実装とともに,LAの前方・後方通過のための新しい手法を提案する。
我々は、14億のパラメータ言語モデルをトレーニングすることにより、これらの改善を単層とエンドツーエンドの両方の設定で検証する。
論文 参考訳(メタデータ) (2025-10-24T18:32:20Z) - SAGA: Selective Adaptive Gating for Efficient and Expressive Linear Attention [10.607730369798551]
入力適応型学習ゲートを導入し,情報集約をKV$特徴写像に選択的に変調する。
SAGAはスループットが1.76$times$改善され、PVT-Tと比較してピークGPUメモリが2.69$times$削減された。
ImageNetデータセットでトップ1の精度を最大4.4%向上させ、計算効率とモデルの有効性を実証する。
論文 参考訳(メタデータ) (2025-09-16T08:36:05Z) - Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache [67.47789629197857]
本稿では,トランスヘッド次元の不均一な役割を生かした学習自由フレームワークを提案する。
フーリエアテンションは、長コンテキスト非感性次元をフーリエ基底に投影することにより、その時間的進化を固定長のスペクトル係数で近似する。
本稿では,FourierAttention が LongBench と Needle-In-A-Haystack 上で最高の長文精度を実現することを示す。
論文 参考訳(メタデータ) (2025-06-13T15:35:54Z) - Scaling Embedding Layers in Language Models [61.939921364422936]
$SCONE$は入力埋め込み層を拡張して言語モデルのパフォーマンスを向上させる新しいメソッドである。
SCONE$は、n-gramの頻繁なセットに埋め込みを導入しながら、元の語彙を保持します。
これらの埋め込みは、各入力トークンに対してコンテキスト化された表現を提供し、トレーニング中に別のモデルで学習する。
$SCONE$は、n-gram埋め込みの数を増やし、それらを学ぶために使用するモデルをスケーリングする、という2つの新しいスケーリング戦略を可能にします。
論文 参考訳(メタデータ) (2025-02-03T18:59:32Z) - SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications [13.948608558319307]
投機的復号化は、大規模言語モデル(LLM)推論の遅延を低減するために広く採用されている。
エージェントフレームワークは繰り返しの推論要求を送信し、その結果、長く予測可能な計算結果が得られる。
本稿では,効率的な接尾辞木を用いて長いトークン列をキャッシュする新しい手法であるemphSuffixDecodingを紹介する。
論文 参考訳(メタデータ) (2024-11-07T18:49:33Z) - Hardware-Aware Parallel Prompt Decoding for Memory-Efficient Acceleration of LLM Inference [23.633481089469836]
LLM(Large Language Models)の自動回帰デコーディングは、ハードウェアの性能に大きなオーバーヘッドをもたらす。
トレーニング可能なパラメータを0.0002$%しか必要とせず,A100-40GBのGPUをたった16時間で効率的にトレーニングできる並列プロンプトデコーディングを提案する。
我々のアプローチでは、最大2.49$times$ スピードアップを示し、最小のメモリオーバーヘッドは0.0004$%である。
論文 参考訳(メタデータ) (2024-05-28T22:19:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。