論文の概要: CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention
- arxiv url: http://arxiv.org/abs/2606.27229v2
- Date: Sun, 28 Jun 2026 10:17:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 13:45:02.162457
- Title: CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention
- Title(参考訳): CARVE: チャンクパラレル線形注意のための値効率を考慮したコンテンツ認識リカレント
- Abstract要約: リカレントモデルは思い出すために忘れなければならないが、芸術の状態は保存されているものを参照せずに、何を削除するかを決定する。
このメモリブラインドゲーティングは、主要なデルタルールアーキテクチャ(GDN-2)における3つの結合欠陥の1つである。
我々はCARVEを導入し、鍵軸のみを消去するという3つの問題を1つの原理で解決する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recurrent models must forget in order to remember, yet the state of the art decides what to erase without consulting what is stored -- the gate sees only the arriving token, not the memory it is about to modify. This memory-blind gating is one of three coupled defects in the leading delta-rule architecture (GDN-2): the value-axis erase mask wastes parameters at the scale of the value projection, and -- as we prove -- mathematically prevents the WY-form triangular chunk solver that makes recurrent training competitive with Transformers. We introduce CARVE (Content-Aware Recurrent with Value Efficiency), which resolves all three problems through one principle: erase only on the key axis. This is provably necessary and sufficient for the WY-form solver to remain valid. Within it, CARVE reuses the recurrent output tensor -- already written to GPU memory -- as a free content signal for the erase gate, and replaces the per-value write-gate projection with a single scalar per head. At initialisation CARVE is bit-identical to GDN-2; any quality difference emerges from what the content gate learns. At 1.3B parameters trained on 100B tokens, CARVE achieves WikiText perplexity 15.72 (minus 0.18 vs. GDN-2, a 4.5-sigma effect), leads every recurrent baseline on nine common-sense reasoning benchmarks, and sets state of the art on every RULER retrieval probe -- at 0.4% throughput overhead, 13% lower peak memory, and 19% fewer parameters. Six formal theorems cover memory capacity, Lyapunov stability, gradient flow, expressivity separation, Pareto-optimal chunk size, and hybrid optimality.
- Abstract(参考訳): リカレントモデルは思い出すために忘れなければならないが、最先端のモデルでは、格納されているものを参照せずに、何を消去するかを決めている。
このメモリブラインドゲーティングは、主要なデルタルールアーキテクチャ(GDN-2)の3つの結合欠陥の1つであり、値軸消去マスクは値プロジェクションのスケールでパラメータを浪費する。
我々はCARVE(Content-Aware Recurrent with Value Efficiency)を導入し,鍵軸のみを消去するという3つの問題を1つの原理で解決する。
これは確実に必要であり、WY形式の解法が有効であるのに十分である。
内部では、CARVEは消去ゲートのフリーコンテント信号として(GPUメモリにすでに書き込まれている)繰り返し出力テンソルを再利用し、値ごとの書き込みゲートプロジェクションを1つのスカラーに置き換える。
初期化時には、CARVEはGDN-2とビット識別され、コンテンツゲートが学習するものと品質差が生じる。
100Bトークンでトレーニングされた1.3Bパラメータで、CARVEはWikiTextのパープレキシティ15.72(ミナス0.18対GDN-2、4.5シグマ効果)を達成し、9つの共通センス推論ベンチマークのすべてのリカレントベースラインを導き、RULER検索プローブのステート・オブ・ザ・アートを -- 0.4%のスループットオーバーヘッド、13%のピークメモリ、19%のパラメータで設定する。
6つの公式な定理は、メモリ容量、リャプノフ安定性、勾配流、表現性分離、パレート最適チャンクサイズ、ハイブリッド最適性を含んでいる。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - RecurrentGPT: Expressive Depth through Recurrent Modulation in Transformers [8.085475675888045]
リカレントGPT(RecurrentGPT)は、固定深度前処理とコダブロックが1つの共有コア繰り返しR回ブラケットする再カレント深さ変換器である。
ゲート型リカレントニューラルネットワークにインスパイアされた私たちは、ライトウェイトプロジェクションとエレメントワイズ更新ゲートを使用して、リカレント更新を変調する。
この結果から,適応的深度再利用は品質の取引パラメータの原則的戦略であることが示唆された。
論文 参考訳(メタデータ) (2026-08-15T06:22:00Z) - Forgetful Attention: A Trainable Support-Vector Memory with Certified Selection and Exact Unlearning [0.16921396880325776]
固定ボックスパラメータCの1クラスSfpの支持係数が重みを持つメモリであるSupport Vector Attention(SV-Attention)を導入する。
アクティブセットのパーティションは、リザーブトークンを正確にゼロウェイト、出力ウェイトを与え、インクリメンタルインクリメンタルソルバトークンは、同じCの下で再トレーニングせずに生成した状態を回復する。
また,実文埋め込み上での外科的排除,正確な編集,患者記録の削除,忘れやすい検索メモリも示す。
論文 参考訳(メタデータ) (2026-07-13T23:13:57Z) - How Much Capacity Does EEG Denoising Need? Ultra-Compact Networks reveal Benchmark Saturation and Metric-Utility Gap [0.0]
深層学習EEG(Deep Learning EEG Denoising Architectures)は、数万から数千万のパラメータに拡張されているが、実験変数としてモデルキャパシティを分離した以前の研究はない。
アーキテクチャ,損失,データ分割,トレーニングレシピの両ギャップに対処し,最小限の深さ分離可能な畳み込みU-Netで1.05Kから40.26Kパラメータまでのチャネル幅を網羅する。
論文 参考訳(メタデータ) (2026-06-07T12:17:25Z) - CART: Context-Anchored Recurrent Transformer -- A Parameter-Efficient Architecture with Learned Stability [0.0]
CART(Context-Anchored Recurrent Transformer)は、パラメータ効率のよい言語モデルで、1つの共有コアブロックをR倍の深さで再利用する。
我々は1つのコンシューマGPU上でCARTを2段階に分けて評価した: 64-configuration screen at 3,000 steps, then 36 configurations (P=6, R in 6,8,10, three seed) training for 30500 steps (1B tokens)。
256,512,768,1024: 事前深さPはループ数Rを支配し、Rのステージ1ランクはフルトレーニング時に逆になる(R=6は最高になる)。
論文 参考訳(メタデータ) (2026-05-31T23:26:27Z) - Universal Transformers Need Memory: Depth-State Trade-offs in Adaptive Recursive Reasoning [0.0]
本研究では,SudokuExtreme上の単一ブロックユニバーサルトランス (UT) のスクラッチパッドとして学習したメモリトークンについて検討した。
メモリトークンは、テストされたすべての構成で、メモリトークンのない構成は、非自明なパフォーマンスです。
論文 参考訳(メタデータ) (2026-04-23T18:30:01Z) - Harnessing Lightweight Transformer with Contextual Synergic Enhancement for Efficient 3D Medical Image Segmentation [59.711744386226194]
モデル効率を実現するための軽量トランスであるLight-UNETRを提案する。
Light-UNETRは軽量次元減少(LIDR)モジュールを備えており、空間次元とチャネル次元を減少させる。
また,変換器のデータ効率向上を目的としたCSE学習戦略も導入した。
論文 参考訳(メタデータ) (2026-03-24T16:24:19Z) - LINA: Linear Autoregressive Image Generative Models with Continuous Tokens [56.80443965097921]
連続トークンを持つ自己回帰モデルは、特にテキスト・トゥ・イメージ(T2I)合成において、視覚生成に有望なパラダイムを形成する。
このフレームワーク内での計算効率のよい線形アテンションの設計法について検討する。
LINAは、線形注意に基づくシンプルで計算効率の良いT2Iモデルであり、ユーザ命令から高忠実度1024x1024画像を生成することができる。
論文 参考訳(メタデータ) (2026-01-30T06:44:33Z) - ECO: Quantized Training without Full-Precision Master Weights [58.97082407934466]
Error-Compensating (ECO)は、量子化されたパラメータに直接更新を適用することで、マスターウェイトを除去する。
ECO は最適値の定数半径近傍に収束するが、素早いマスターウェイト除去は学習率に逆比例する誤差を生じさせる。
論文 参考訳(メタデータ) (2026-01-29T18:35:01Z) - What Layers When: Learning to Skip Compute in LLMs with Residual Gates [66.23658560048241]
GateSkipは、デコーダのみのLMにおけるトークンワイド層スキップを可能にする残差ストリームゲーティング機構である。
各Attention/MLPブランチは、残ストリームに再入力する前に、ブランチの出力を凝縮するシグモイドリニアゲートを備えている。
論文 参考訳(メタデータ) (2025-10-13T16:31:50Z) - Simple linear attention language models balance the recall-throughput tradeoff [60.06020449520365]
線形およびすべり窓の注意を結合したシンプルなアーキテクチャであるBASEDを提案する。
我々は、最大1.3bパラメータの言語モデルをトレーニングし、BASEDがパープレキシティにおいて最強のサブクワッドラティックモデルと一致し、実世界のリコール集約タスクにおいて6.22の精度ポイントでそれらのモデルを上回っていることを示す。
論文 参考訳(メタデータ) (2024-02-28T19:28:27Z) - Attention Map Guided Transformer Pruning for Edge Device [98.42178656762114]
視覚トランスフォーマー (ViT) は, 全体的かつ隠蔽された人物再識別 (Re-ID) タスクにおいて, 有望な成功を収めた。
本稿では、冗長なトークンとヘッドの両方を除去する新しいアテンションマップガイド(AMG)トランスフォーマープルーニング法を提案する。
Occluded DukeMTMC と Market-1501 に関する総合的な実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2023-04-04T01:51:53Z) - TinyTL: Reduce Activations, Not Trainable Parameters for Efficient
On-Device Learning [78.80707950262214]
デバイス上での学習により、エッジデバイスはAIモデルを新しいデータに継続的に適応できる。
既存の作業は、トレーニング可能なパラメータの数を減らすことで、この問題を解決する。
メモリ効率の高いオンデバイス学習のためのTiny-Transfer-Learning(TinyTL)を提案する。
論文 参考訳(メタデータ) (2020-07-22T18:39:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。