論文の概要: The Key to Going Linear: Analysis-Driven Transformer Linearization
- arxiv url: http://arxiv.org/abs/2607.07706v1
- Date: Wed, 08 Jul 2026 17:59:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.488452
- Title: The Key to Going Linear: Analysis-Driven Transformer Linearization
- Title(参考訳): 線形化の鍵:解析駆動型変圧器線形化
- Abstract要約: ソフトマックスは、なぜデルタスタイルのネットワークが純粋に累積よりも優れているのかを解明し、キー依存のランク1プロジェクションに依存していることを示す。
近似誤差の潜在的な原因を特定し、特にトークンのシンク、短い畳み込み、固定予算キャッシュルーティングといった構造的介入を導入する。
- 参考スコア(独自算出の注目度): 8.56204304015324
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: The quadratic cost of causal self-attention severely bottlenecks long-context transformer inference. While numerous post hoc linearization pipelines exist, it is difficult to identify which components preserve model quality. This work isolates the effect of state update design in a strict frozen-backbone regime. We show that softmax relies on key-dependent, rank-1 orthogonal projections, elucidating why delta-style networks outperform purely gated accumulation. We identify a potential source of approximation errors and introduce structural interventions, specifically sink tokens, short convolutions, and fixed-budget cache routing, which reduces the remaining gap. We scale this linearization approach across LLaMA and Qwen models up to 32B parameters, outperforming prior post hoc baselines on MMLU and matching the long-context retrieval of complex adaptive-caching frameworks.
- Abstract(参考訳): 因果自己注意の二次コストは、長期コンテキストトランスフォーマー推論を著しくボトルネックにする。
多くのポストホック線形化パイプラインが存在するが、どのコンポーネントがモデル品質を保存するかを特定するのは難しい。
この作業は、厳密な凍結バックボーン状態における状態更新設計の効果を分離する。
ソフトマックスは鍵依存のランク1直交射影に依存しており、なぜデルタスタイルのネットワークが純粋に累積よりも優れているのかを解明する。
近似誤差の潜在的な原因を特定し、トークンのシンク、短い畳み込み、固定予算キャッシュルーティングなどの構造的介入を導入し、残りのギャップを減らす。
我々はLLaMAおよびQwenモデル間の線形化アプローチを32Bパラメータまで拡張し、MMLUのポストホックベースラインよりも優れ、複雑な適応キャッシングフレームワークの長文検索に適合する。
関連論文リスト
- CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing [90.63350360476294]
本稿ではCRISP(Cliff-awaRe Input-adaptive Sparse Prefilling)を提案する。
ルーティング決定は、プロキシアテンションマップの構造から直接読み取ることができることを示す。
ソフトマックス後の質量崖を定式化し、厳密な累積被覆閾値が長い文脈でO(n)バックグラウンドノイズを蓄積することを理論的に示す。
論文 参考訳(メタデータ) (2026-09-01T22:49:46Z) - Scaling Interpretable Transformers with Parity Bottleneck Layers [0.0]
GPT-2スケールアーキテクチャを導入し、中間表現は設計によって効率的で広小である。
Deep Parity Bottleneck (DPB) は、学習されたオーバーコンプリート基底をパラメータフリー代数辞書に置き換える。
ParityTransformerの機能は、モデルフォワードがコンストラクションによって通過するのにネイティブであり、SAEsプローブが計算時に実際に使用する機能に対処する。
論文 参考訳(メタデータ) (2026-07-22T18:25:16Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - COREY: Entropy-Guided Runtime Chunk Scheduling for Selective Scan Kernels [11.316541559874864]
プロトタイプスケジューラは、固定幅ヒストグラムを用いて推定したアクティベーションエントロピーを、チャンクサイズ選択のランタイム信号として利用する。
COREYはConcept and Feasibilityのコントリビューションとして位置づけられている。
この作業には、Tier 2aとTier 2bを接続する完全なエンドツーエンド実行が含まれていない。
論文 参考訳(メタデータ) (2026-04-12T12:07:48Z) - Graph-RHO: Critical-path-aware Heterogeneous Graph Network for Long-Horizon Flexible Job-Shop Scheduling [26.97705087364345]
Graph-RHOは、新しいクリティカルパス対応グラフベースのRHOフレームワークである。
マルチリレーショナルエッジを持つ演算マシングラフとしてサブプロブレムを符号化するトポロジ対応ヘテロジニアスグラフネットワークを提案する。
トレーニング中に誘導バイアスを注入し、高感度なボトルネック操作とロバストな操作を区別するクリティカルパス認識機構を組み込んだ。
論文 参考訳(メタデータ) (2026-04-11T07:35:09Z) - Memory-Conditioned Flow-Matching for Stable Autoregressive PDE Rollouts [0.0]
自己回帰生成型PDEソルバは1歩前進し、長いロールアウトでドリフトする。
未解決変数の除去はマルコフ項で完全に解決された進化をもたらすことを示す。
次に、条件生成誤差からメモリ近似を分離する離散的なGrnwallロールアウト境界を導出する。
論文 参考訳(メタデータ) (2026-02-06T13:21:52Z) - READER: Retrieval-Assisted Drafter for Efficient LLM Inference [0.0386965802948046]
自己回帰言語モデルはトークンシーケンスよりも分解された確率をインスタンス化するが、その厳密なシーケンシャルなデコーディングプロセスは、遅延推論に固有の低いバウンドを課す。
このボトルネックは、大規模生成モデルのスケーラブルなデプロイにおける中心的な障害として現れています。
本稿では,補助的ドラフトモデルのトレーニングを回避した投機的復号化フレームワークREADERを提案する。
論文 参考訳(メタデータ) (2025-08-12T16:47:48Z) - Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache [67.47789629197857]
本稿では,トランスヘッド次元の不均一な役割を生かした学習自由フレームワークを提案する。
フーリエアテンションは、長コンテキスト非感性次元をフーリエ基底に投影することにより、その時間的進化を固定長のスペクトル係数で近似する。
本稿では,FourierAttention が LongBench と Needle-In-A-Haystack 上で最高の長文精度を実現することを示す。
論文 参考訳(メタデータ) (2025-06-13T15:35:54Z) - Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free [81.65559031466452]
我々は、ゲーティング強化ソフトマックスアテンションの変種を調べる実験を行った。
SDPA(Scaled Dot-Product Attention)後の頭部特異的シグモイドゲートを簡易に修正することで,性能が向上することがわかった。
論文 参考訳(メタデータ) (2025-05-10T17:15:49Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - Haar Wavelet based Block Autoregressive Flows for Trajectories [129.37479472754083]
歩行者等の軌道予測は,自律型エージェントの性能向上に不可欠である。
本稿では分割結合を利用した新しいハールウェーブレットに基づくブロック自己回帰モデルを提案する。
実世界の2つのデータセット上で、多種多様な正確な軌跡を生成するアプローチの利点について説明する。
論文 参考訳(メタデータ) (2020-09-21T13:57:10Z) - Generalizing Variational Autoencoders with Hierarchical Empirical Bayes [6.273154057349038]
確率的生成モデルのための計算的に安定なフレームワークである階層的経験的ベイズオートエンコーダ(HEBAE)を提案する。
鍵となる貢献は2つであり、まず、符号化分布を階層的に優先することで、再構成損失関数の最小化と過正規化の回避とのトレードオフを適応的にバランスさせることで、利益を得る。
論文 参考訳(メタデータ) (2020-07-20T18:18:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。