論文の概要: DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling
- arxiv url: http://arxiv.org/abs/2608.02032v1
- Date: Mon, 03 Aug 2026 10:30:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.487353
- Title: DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling
- Title(参考訳): DART: 逐次状態に対するデコードアテンション
- Abstract要約: 本稿では,共有メモリ表現が繰り返し圧縮と注目スタイル検索の両方をサポートするかどうかを検討する。
本研究では,チャンク状態記憶としてMamba-2チャンクスキャンによって生成されたチャンク状態のコントリビューションを保持するDARTを提案する。
Mamba-2と比較して、DARTは一般的な言語モデリングの品質を維持しながら、連想的リコールと検索を大幅に改善する。
- 参考スコア(独自算出の注目度): 8.96129547422103
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern language models are built primarily from Transformers, recurrent models, and their hybrid architectures. Transformers rely on token-level attention memories, while recurrent models such as state space models (SSMs) and linear attention maintain compact recurrent states. These architectures are typically instantiated separately or interleaved at the layer level, leaving open whether a shared memory representation can support both recurrent compression and attention-style retrieval. We study this question through the state space duality (SSD) view of Mamba-2, where the SSM state can be interpreted as a compressed associative key--value (KV) cache. We observe that Mamba-2 decodes token-conditioned values from this state but does not decode token-conditioned keys. Based on this observation, we propose DART (Decoded Attention over Recurrent sTates), which retains the chunk state contributions produced by the Mamba-2 chunked scan as chunk state memories, decodes token-conditioned keys and values from these memories, and performs state-memory attention (SMA) over the resulting KV pairs. The retrieved output is then combined with the native Mamba-2 output through a gated residual connection. DART supports practical training by reusing the Mamba-2 chunked scan and implementing SMA as a FlashAttention-style computation. Our analysis and experiments show that DART substantially reduces the length-dependent inference cache compared with a matched attention baseline (e.g., $75\%$ savings when the chunk size is $S=256$ and the state size is $N=128$). Compared with Mamba-2, DART substantially improves associative recall and retrieval while preserving general language-modeling quality.
- Abstract(参考訳): 現代の言語モデルは、主にトランスフォーマー、リカレントモデル、およびそれらのハイブリッドアーキテクチャから構築されている。
トランスフォーマーはトークンレベルのアテンションメモリに依存し、ステートスペースモデル(SSM)やリニアアテンションのようなリカレントモデルでは、コンパクトなリカレントステートを維持している。
これらのアーキテクチャは通常、個別にインスタンス化されるか、層レベルでインターリーブされる。
本研究では,SSM状態を圧縮連想鍵値(KV)キャッシュとして解釈できるMamba-2の状態空間双対性(SSD)ビューを用いて,この問題を考察する。
Mamba-2はこの状態からトークン条件の値をデコードするが、トークン条件のキーをデコードしない。
そこで本研究では,Mamba-2チャンクスキャンによって生成されたチャンク状態のコントリビューションをチャンク状態記憶として保持し,トークン条件のキーと値をこれらのメモリから復号し,その結果のKVペアに対して状態メモリアテンション(SMA)を実行するDARTを提案する。
得られた出力は、ゲート残差接続を介してネイティブのMamba-2出力と結合される。
DARTは、Mamba-2チャンクスキャンを再利用し、FlashAttentionスタイルの計算としてSMAを実装することで、実践的なトレーニングをサポートする。
我々の分析と実験により、DARTは一致した注目ベースライン(チャンクサイズが$S=256$で状態サイズが$N=128$の場合に$75\%$セーブするなど)と比較して、長さ依存型推論キャッシュを大幅に削減することが示された。
Mamba-2と比較して、DARTは一般的な言語モデリングの品質を維持しながら、連想的リコールと検索を大幅に改善する。
関連論文リスト
- MambaADv2: Evolving Duality-enhanced State Space Model for Unsupervised Anomaly Detection [108.36437360254605]
本稿では,マルチクラス非教師付き異常検出に適したフレームワークであるMambaADv2を提案する。
MambaADv2は、事前訓練されたエンコーダと、複数のスケールにわたるDuality-enhanced State Space (DSS)モジュールを備えたMambaインスパイアされたデコーダで構成される。
HSS(Hybrid State Space)ブロックの構造は、SSDベースのMambaラインに従って調整され、Mamba3スタイルの位置認識状態空間モデリングが組み込まれている。
論文 参考訳(メタデータ) (2026-06-22T10:14:06Z) - Blurry Window Attention [14.486130218956612]
本稿では,SSMにインスパイアされたABC方式Blurry Window Attention (BLA)を紹介する。
BLAはディリクレのカーネルの解像度に依存するスライディングウインドウ・アテンション(SWA)の一般化と解釈できる。
BLAの状態効率はSWAよりも8$times$良いことを示し、一般的な線形アテンションモデルと競合することを示した。
論文 参考訳(メタデータ) (2026-05-31T17:43:06Z) - Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion [61.57938553036056]
ARL2は、二次的なクロスフレームアテンションを固定サイズのリカレント状態に置き換えるハイブリッドアテンションモジュールである。
本研究では,フレーム内ソフトマックスブランチとフレーム間リカレント線形ブランチの2つに分割し,ストリームコンテキストの固定サイズ状態を維持する。
75%の層がハイブリッドリニアアテンションに置き換えられ、最大2.26ウォールクロックのスピードアップと54%のメモリ削減を実現した。
論文 参考訳(メタデータ) (2026-05-15T19:33:45Z) - Characterizing Mamba's Selective Memory using Auto-Encoders [49.83619099242128]
状態空間モデル(SSM)は、推論中に固定メモリを使用するため、言語モデリングのためのトランスフォーマーに代わる有望な代替品である。
これまでの研究では、この情報損失が発生するシーケンス長について研究されてきたが、SSM言語モデル(LM)が忘れがちな情報のタイプを特徴付けていない。
我々は、SSM LMによってよく忘れられるトークンの種類(たとえば、音声の一部、名前付きエンティティ)とシーケンス(例えば、コード、数学の問題)を識別する。
論文 参考訳(メタデータ) (2025-12-17T18:05:25Z) - SCOUT: Toward Sub-Quadratic Attention via Segment Compression for Optimized Utility in Transformers [15.142822497807236]
固定サイズセグメント内でトークンを局所的に圧縮し,これらの圧縮表現にのみ注目するハイブリッドアーキテクチャであるSCOUTを提案する。
SCOUTは、計算コストとメモリコストを大幅に削減しつつ、完全な注意の表現力を保っている。
SCOUTの計算とメモリ効率を解析し、長文言語モデリングおよび推論タスクで経験的に評価する。
論文 参考訳(メタデータ) (2025-08-31T17:08:33Z) - A2Mamba: Attention-augmented State Space Models for Visual Recognition [45.68176825375723]
本稿では,トランスフォーマー-マンバハイブリッドネットワークアーキテクチャであるA2Mambaを提案する。
A2SSMのキーステップは、空間的にSSMの隠された状態を集約することで、異種交叉アテンションを実行する。
私たちのA2Mambaは、視覚認識タスクにおいて、以前のConvNet-、Transformer-、およびMambaベースのアーキテクチャよりも優れています。
論文 参考訳(メタデータ) (2025-07-22T14:17:08Z) - Spatial-Mamba: Effective Visual State Space Models via Structure-aware State Fusion [46.82975707531064]
SSM(Selective State Space Model)は、1Dシーケンシャルデータにおける長距離依存関係のキャプチャに優れる。
本研究では,地域間直接接続を実現する新しいアプローチであるSpatial-Mambaを提案する。
画像分類,検出,セグメンテーションにおいて,空間マンバは,単一のスキャンであっても,最先端のSSMベースのモデルを達成したり,超えたりしていることを示す。
論文 参考訳(メタデータ) (2024-10-19T12:56:58Z) - B'MOJO: Hybrid State Space Realizations of Foundation Models with Eidetic and Fading Memory [91.81390121042192]
我々はB'MOJOと呼ばれるモデル群を開発し、構成可能なモジュール内で理想的メモリと暗黙的メモリをシームレスに結合する。
B'MOJOのイデオティックメモリとフェードメモリを変調する能力は、32Kトークンまでテストされた長いシーケンスの推論をより良くする。
論文 参考訳(メタデータ) (2024-07-08T18:41:01Z) - MambaByte: Token-free Selective State Space Model [71.90159903595514]
マンババイト(英: MambaByte)は、マンバSSMがバイト配列で自己回帰的に訓練したトークンレス適応である。
MambaByteは、言語モデリングタスクにおいて、最先端のサブワードトランスフォーマーよりも優れています。
論文 参考訳(メタデータ) (2024-01-24T18:53:53Z) - VMamba: Visual State Space Model [98.0517369083152]
状態空間言語モデルであるMambaを、線形時間複雑性を持つビジョンバックボーンであるVMambaに適合させる。
VMambaのコアには2D Selective Scan (SS2D)モジュールを備えたVisual State-Space (VSS)ブロックのスタックがある。
論文 参考訳(メタデータ) (2024-01-18T17:55:39Z) - Mamba: Linear-Time Sequence Modeling with Selective State Spaces [31.985243136674146]
ファンデーションモデルは、ほぼ普遍的にTransformerアーキテクチャとコアアテンションモジュールに基づいている。
このようなモデルの重大な弱点は、コンテンツベースの推論を実行できないことである。
我々はこれらの選択的なSSMを、注意やブロック(Mamba)を使わずに、単純化されたエンドツーエンドニューラルネットワークアーキテクチャに統合する(Mamba)。
一般的なシーケンスモデルバックボーンとして、Mambaは言語、オーディオ、ゲノミクスといったいくつかのモードで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-12-01T18:01:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。