論文の概要: Dynamic Compression in Recurrent Networks
- arxiv url: http://arxiv.org/abs/2608.17896v1
- Date: Tue, 18 Aug 2026 15:29:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.37647
- Title: Dynamic Compression in Recurrent Networks
- Title(参考訳): リカレントネットワークにおける動的圧縮
- Abstract要約: リカレントモデルは、履歴を固定サイズの状態に圧縮することで、長いコンテキストを効率的に処理する。
動的圧縮を導入し、過去のトークンを選択的に再検討し、その固定サイズの状態を修正できるようにする。
動的圧縮は, 正確な再利用に必要な再帰状態を著しく低減し, 保存関数の数が増加するにつれて, より良好にスケールする。
- 参考スコア(独自算出の注目度): 10.562527255330536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recurrent models process long contexts efficiently by compressing their history into a fixed-size state, but modern architectures typically do so in a single causal pass over the sequence. Each input must therefore be compressed before the model knows how it will later be used, forcing a limited state to compromise across possible future demands. We introduce dynamic compression, which allows a recurrent model to selectively revisit past tokens and revise its fixed-size state through additional recurrent updates. The model need not preserve every part of the history at uniformly high fidelity in its recurrent state, because lower-fidelity information can be revisited from the retained raw sequence when it becomes relevant. We study this in a controlled setting where the model first learns multiple functions in-context and, later in the same sequence, encounters a series of few-shot tasks that each require it to identify and reuse one of those functions. A single-pass model must preserve every function at sufficient fidelity for any future task, whereas selective re-scanning allows the model to revisit and refine only the function currently needed. We find that dynamic compression substantially reduces the recurrent state required for accurate reuse and scales more favorably as the number of stored functions grows. These results demonstrate a computation--memory tradeoff in which recurrent models can spend more computation revisiting their history to make more effective use of a fixed-size state.
- Abstract(参考訳): リカレントモデルは、履歴を固定サイズの状態に圧縮することで、長いコンテキストを効率的に処理するが、現代のアーキテクチャは通常、シーケンスを1つの因果パスで処理する。
したがって、モデルが後でどのように使用されるかを知る前に、各入力は圧縮されなければならない。
動的圧縮を導入し、リカレントモデルで過去のトークンを選択的に再検討し、追加のリカレント更新によってその固定サイズ状態を修正できるようにします。
このモデルは、その再帰状態において、履歴のすべての部分を均一に高い忠実度で保存する必要はない。
モデルが最初にコンテキスト内で複数の関数を学習し、後に同じシーケンスで、それらの関数の1つを識別および再利用するために必要となる、一連の数発のタスクに遭遇する、制御された環境でこれを研究する。
シングルパスモデルは、将来のタスクに十分な忠実さですべての関数を保存する必要があるが、選択的な再スキャンにより、モデルが現在必要とされる関数のみを再検討し、洗練することができる。
動的圧縮は, 正確な再利用に必要な再帰状態を著しく低減し, 保存関数の数が増加するにつれて, より良好にスケールする。
これらの結果は、リカレントモデルが、より効率的な固定サイズの状態の利用のために、その履歴を再考するためにより多くの計算に費やすことができる計算-メモリのトレードオフを示す。
関連論文リスト
- Rethinking Convolutional Networks for Attribute-Aware Sequential Recommendation [6.846413131554734]
属性対応シーケンシャルレコメンデーションでは、ユーザが過去のインタラクションの時系列的に順序付けられた履歴に基づいて、次に対話するアイテムを予測する。
既存の方法は典型的には、シーケンス全体を統一表現に集約するために自己認識機構を利用する。
本稿では,畳み込み層を階層的かつ低スケールに利用して,コンパクトかつ表現力のあるシーケンス表現を生成するConvRecを提案する。
論文 参考訳(メタデータ) (2026-05-06T10:18:43Z) - EmbeddingRWKV: State-Centric Retrieval with Reusable States [12.535698360263988]
State-Centric Retrievalは、埋め込みモデルと再ランカを接続するブリッジとして"states"を利用する統一的な検索パラダイムである。
テストの結果,システム全体の効率を大幅に向上させながら,高品質な検索と再ランク付けを実現していることがわかった。
論文 参考訳(メタデータ) (2026-01-10T03:29:43Z) - Model Inversion with Layer-Specific Modeling and Alignment for Data-Free Continual Learning [19.12792297140574]
継続的な学習は、以前のタスクのパフォーマンスを維持しながら、一連のタスクでモデルを漸進的にトレーニングすることを目的としています。
データの保存と再生は、プライバシやセキュリティ上の制約によって不可能になることが多い。
単層最適化における高速収束にインスパイアされたPMI(Per-layer Model Inversion)を提案する。
論文 参考訳(メタデータ) (2025-10-30T09:58:48Z) - The Curious Case of In-Training Compression of State Space Models [49.819321766705514]
ステートスペースモデル(SSM)は、並列化可能なトレーニングと高速推論の両方を提供する。
鍵となる設計上の課題は、表現力の最大化と計算負荷の制限の間の適切なバランスを打つことだ。
我々のアプローチである textscCompreSSM はリニアリカレントユニットのような線形時間不変SSMに適用されるが、選択モデルにも拡張可能である。
論文 参考訳(メタデータ) (2025-10-03T09:02:33Z) - Quantifying Memory Utilization with Effective State-Size [73.52115209375343]
「我々は、テキスト・メモリ利用の尺度を策定する。」
この計量は、textitinput-invariant および textitinput-variant linear operator を持つシステムの基本的なクラスに適合する。
論文 参考訳(メタデータ) (2025-04-28T08:12:30Z) - Streamlining the Collaborative Chain of Models into A Single Forward Pass in Generation-Based Tasks [13.254837575157786]
Retrieval-Augmented Generation(RAG)やエージェントベースのフレームワークでは、"Chain of Models"アプローチが広く使われている。
最近の進歩は、複数のタスクに適応する共有ベースモデルを可能にするプロンプトチューニングを適用することで、この問題に対処しようとしている。
本稿では,隠れ状態の共有を可能にする新しいプロンプトチューニング手法であるFTHSSを紹介する。
論文 参考訳(メタデータ) (2025-02-16T11:37:14Z) - Stuffed Mamba: Oversized States Lead to the Inability to Forget [53.512358993801115]
Mambaベースのモデルは、内蔵の忘れ物機構であっても、以前のトークンを効果的に忘れるのに苦労していることを示す。
モデルの学習に必要な最小トレーニング長は状態サイズと線形に一致し,5桁パスキーの精度向上のための最大コンテキスト長は状態サイズと指数関数的に一致した。
我々の研究は、将来のRNN設計は、状態サイズ、トレーニング期間、長いコンテキストタスクにおいて堅牢なパフォーマンスを達成するためのメカニズムを忘れることの間の相互作用を考慮しなければならないことを示唆している。
論文 参考訳(メタデータ) (2024-10-09T17:54:28Z) - CItruS: Chunked Instruction-aware State Eviction for Long Sequence Modeling [52.404072802235234]
本稿では,下流タスクに有用な注目度を隠蔽状態の消去プロセスに統合する新しいモデリング手法であるChunked Instruction-Aware State Eviction(CItruS)を紹介する。
トレーニング不要な手法は,メモリ予算が同じ条件下で,複数の強いベースライン上での長いシーケンス理解および検索タスクにおいて,優れた性能を示す。
論文 参考訳(メタデータ) (2024-06-17T18:34:58Z) - Recurrent Action Transformer with Memory [39.58317527488534]
本稿では,情報保持を規制するリカレントメモリ機構を組み込んだ新しいモデルアーキテクチャを提案する。
メモリ集約環境(ViZDoom-Two-Colors, T-Maze, Memory Maze, Minigrid-Memory)、古典的アタリゲーム、MuJoCo制御環境について実験を行った。
その結果、メモリの使用は、古典的な環境における結果の維持や改善をしながら、メモリ集約環境におけるパフォーマンスを著しく向上させることができることがわかった。
論文 参考訳(メタデータ) (2023-06-15T19:29:08Z) - Continuous-time convolutions model of event sequences [46.3471121117337]
イベントシーケンスは不均一でスパースであり、従来のモデルは不適当である。
我々は、時間とともに一様でない事象の発生を処理するために設計された効率的な畳み込みニューラルネットワークに基づくCOTICを提案する。
COTICは、次のイベント時間とタイプを予測する際に既存のモデルよりも優れており、最も近いライバルの3.714と比較して平均1.5のランクに達している。
論文 参考訳(メタデータ) (2023-02-13T10:34:51Z) - Self-learning sparse PCA for multimode process monitoring [2.8102838347038617]
本稿では,逐次モードの自己学習能力を有するスパース主成分分析アルゴリズムを提案する。
従来のマルチモードモニタリング方法とは異なり、モニタリングモデルは現在のモデルと新しいモードが到着したときに新しいデータに基づいて更新される。
論文 参考訳(メタデータ) (2021-08-07T13:50:16Z) - Stabilizing Equilibrium Models by Jacobian Regularization [151.78151873928027]
ディープ均衡ネットワーク(Deep equilibrium Network, DEQs)は、単一非線形層の固定点を見つけるために従来の深さを推定する新しいモデルのクラスである。
本稿では、平衡モデルの学習を安定させるために、固定点更新方程式のヤコビアンを明示的に正規化するDECモデルの正規化スキームを提案する。
この正規化は計算コストを最小限に抑え、前方と後方の両方の固定点収束を著しく安定化させ、高次元の現実的な領域に順応することを示した。
論文 参考訳(メタデータ) (2021-06-28T00:14:11Z) - Closed-form Continuous-Depth Models [99.40335716948101]
連続深度ニューラルモデルは高度な数値微分方程式解法に依存している。
我々は,CfCネットワークと呼ばれる,記述が簡単で,少なくとも1桁高速な新しいモデル群を提示する。
論文 参考訳(メタデータ) (2021-06-25T22:08:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。