論文の概要: Raven: High-Recall Sequence Modeling with Sparse Memory Routing
- arxiv url: http://arxiv.org/abs/2607.25357v1
- Date: Tue, 28 Jul 2026 07:04:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.739877
- Title: Raven: High-Recall Sequence Modeling with Sparse Memory Routing
- Title(参考訳): Raven: スパースメモリルーティングによる高速リコールシーケンスモデリング
- Abstract要約: メモリスロットの固定セットを維持する線形時間シーケンスモデルであるRavenを導入し、各ステップにおいて、学習された入力依存ルーティングによって選択されたサブセットのみを減衰・更新する。
リコール集約ベンチマーク全体では、Ravenは以前のリニアタイムベースラインと競合するか、より優れており、SWAとSSMの両方が大幅に低下する強いロングコンテキストリコールを実現している。
- 参考スコア(独自算出の注目度): 88.47618436676748
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-context recall in linear-time sequence models highlights a tradeoff in how they write to memory. State-based linear models, such as state-space models (SSMs) and linear Transformers, write densely, updating the entire state for each newly arrived token, which leads to interference and makes specific past tokens hard to recover. Sliding-window attention (SWA) exhibits the opposite behavior: it writes sparsely by storing explicit token representations, but only within a fixed window, so recall drops once the relevant token is evicted. Interpolating between these models, we introduce Raven, a linear-time sequence model that maintains a fixed set of memory slots and, at each step, decays and updates only a selected subset via learned, input-dependent routing. This lets Raven mitigate SWA's position-based overwriting and hard eviction while reducing interference from dense state updates in SSMs, thereby preserving long-range content much more effectively. Across recall-intensive benchmarks, Raven is competitive with or outperforms prior linear-time baselines, achieving strong long-context recall where both SWA and SSMs sharply degrade. It remains effective when extrapolating to context lengths as large as 16x its training length, with similar gains in hybrid architectures.
- Abstract(参考訳): 線形時間シーケンスモデルにおける長いコンテキストのリコールは、メモリへの書き込み方法におけるトレードオフを強調している。
状態空間モデル(SSM)や線形トランスフォーマーのような状態ベースの線形モデルは、密に書き込み、新しく到着したトークンごとに状態全体を更新する。
スライディング・ウインドウ・アテンション(SWA)は、明示的なトークン表現を格納するが、固定されたウィンドウ内でのみ、スライディング・ウインドウ・アテンション(sliding-window attention, SWA)は、スライディング・ウインドウ・アテンション(英語版)とは逆の振る舞いを示す。
これらのモデル間を補間し、メモリスロットの固定セットを維持する線形時間シーケンスモデルRavenを導入し、各ステップにおいて、学習された入力依存ルーティングを介して選択されたサブセットのみを減衰・更新する。
これにより、RavenはSWAの位置ベースのオーバーライトとハードエヴィジョンを緩和し、SSMの高密度な状態更新からの干渉を低減し、より効果的に長距離コンテンツを保存することができる。
リコール集約ベンチマーク全体では、Ravenは以前のリニアタイムベースラインと競合するか、より優れており、SWAとSSMの両方が大幅に低下する強いロングコンテキストリコールを実現している。
コンテキスト長への外挿はトレーニング長の16倍にもなり、ハイブリッドアーキテクチャでも同様の効果がある。
関連論文リスト
- MARCH: Scaling Recurrent Memory with Content-Routed State Anchors [41.39470291507015]
トランスフォーマーはその強い長文検索能力の多くを、コンテキスト長で成長するトークンレベルのメモリに負っている。
リカレントな代替手段は、履歴全体を固定サイズの状態に圧縮することで効率的な復号化を提供する。
メモリ・アンカー・ルーティング(Memory-Anchor Routing across Context History, MARCH)は、状態空間モデルを固定次元を超えて効果的にスケールするネットワークアーキテクチャである。
論文 参考訳(メタデータ) (2026-08-12T13:45:01Z) - Remembering Distinct Items, Not Tokens: A Learnable Dirichlet-Process Cache Between State-Space Models and Attention [0.48342038441006796]
本稿では,入力が新規である場合にのみスロットを割り当てるスパースキャッシュについて検討する。
固定濃度の静的キャッシュと,最近の新規性率に追従したサプライズ適応変種という2つの形態で開発する。
論文 参考訳(メタデータ) (2026-07-10T18:28:21Z) - SHARP: Sleep-based Hierarchical Accelerated Replay for Long Range Non-Stationary Temporal Pattern Recognition [7.555597360852762]
SHARP(Sleep-based Hierarchical Accelerated Replay)は、時間学習を2つの補完的なコンポーネントに分解するフレームワークである。
SHARPは、緩やかな睡眠中に、げっ歯類で観察される加速されたリプレイにインスパイアされ、時間的に構造化されたメモリトレースをアクセラレーションされた形で再生するオフライン(スリープ)フェーズを組み込む。
論文 参考訳(メタデータ) (2026-05-30T13:55:02Z) - Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference [58.46323651532913]
本研究では,モデルが周期的に最新のコンテキストを持続的な高速重みに変換する睡眠様統合機構について検討する。
睡眠中、モデルは蓄積したコンテキストにN$のオフラインリカレントパスを実行し、状態空間モデルの高速な重みを更新する。
睡眠時間の増加は,より深い推論を必要とする例では最大で,我々のモデルではN$の上昇がパフォーマンスを向上させることを示す。
論文 参考訳(メタデータ) (2026-05-25T17:55:39Z) - SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent [51.274445160155864]
ロングホライゾンのエージェント推論は、思考、ツールコール、観察、部分的な結論を含む長い相互作用履歴を通して行動するために大きな言語モデルを必要とする。
既存のアプローチでは、インタラクション履歴の切り抜き、短いサロゲートに圧縮、あるいは再利用のために選択した部分を取得することで、この問題に対処している。
我々は、インテント駆動リコールのための生のトラジェクトリページを保持しながら、継続的なインタラクションをコンパクトなメモリキューに統合するスタンドアロンフレームワークであるState-Adaptive Memoryを提案する。
論文 参考訳(メタデータ) (2026-05-23T08:37:16Z) - Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion [61.57938553036056]
ARL2は、二次的なクロスフレームアテンションを固定サイズのリカレント状態に置き換えるハイブリッドアテンションモジュールである。
本研究では,フレーム内ソフトマックスブランチとフレーム間リカレント線形ブランチの2つに分割し,ストリームコンテキストの固定サイズ状態を維持する。
75%の層がハイブリッドリニアアテンションに置き換えられ、最大2.26ウォールクロックのスピードアップと54%のメモリ削減を実現した。
論文 参考訳(メタデータ) (2026-05-15T19:33:45Z) - Adaptive Memory Decay for Log-Linear Attention [1.0099625992507715]
シーケンスモデルは、メモリ容量と計算効率の根本的なトレードオフに直面している。
ログ線形の注意は、Fenwickツリー階層をまたいでメモリを整理することで、このトレードオフをナビゲートする。
我々は、軽量な2層構造を用いて入力から直接学習し、位置よりもコンテンツに適応する、トーケン毎のレベル減衰を生成することを提案する。
論文 参考訳(メタデータ) (2026-05-07T21:05:28Z) - Efficient Sparse Selective-Update RNNs for Long-Range Sequence Modeling [16.27516369166629]
Selective-Update RNN(suRNN)は、入力が冗長であるときにメモリを保存することを学習する非線形アーキテクチャである。
情報イベントのみをオープンするニューロンレベルのバイナリスイッチを使用することで、SuRNNは、繰り返し更新を生のシーケンス長から切り離す。
Long Range Arena、WikiText、その他の総合ベンチマークの実験では、SuRNNはより複雑なモデルの精度と一致するか、超えるかを示している。
論文 参考訳(メタデータ) (2026-02-11T14:50:07Z) - Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression [53.48692193399171]
Gated KalmaNet(GKA)は、次のトークンを予測する際に、すべての過去を説明することによってギャップを低減するレイヤである。
テスト時間におけるオンラインリッジ回帰問題を一定メモリと線形計算コストで解決する。
ロングコンテキストでは、GKAは現実世界のRAGタスクとLongQAタスクを最大128kトークンまで拡張し、他の薄型メモリベースラインよりも10ドル%以上の相対的な改善を実現している。
論文 参考訳(メタデータ) (2025-11-26T03:26:37Z) - CItruS: Chunked Instruction-aware State Eviction for Long Sequence Modeling [52.404072802235234]
本稿では,下流タスクに有用な注目度を隠蔽状態の消去プロセスに統合する新しいモデリング手法であるChunked Instruction-Aware State Eviction(CItruS)を紹介する。
トレーニング不要な手法は,メモリ予算が同じ条件下で,複数の強いベースライン上での長いシーケンス理解および検索タスクにおいて,優れた性能を示す。
論文 参考訳(メタデータ) (2024-06-17T18:34:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。