論文の概要: Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
- arxiv url: http://arxiv.org/abs/2607.27919v1
- Date: Thu, 30 Jul 2026 09:30:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.488117
- Title: Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
- Title(参考訳): 大規模メモリデコーダ - トレーニング済み,パラメトリックな長期メモリ
- Abstract要約: メモリデコーダはパラメトリックな長期記憶モジュールを導入するが、比較的小さなスケールでしか研究しない。
メモリデコーダをスケールし、メモリモデルを6.9Bパラメータまで拡張し、300Bトークンで事前トレーニングします。
メモリにより多くのパラメータを割り当てると、ベースモデルのみをスケーリングするよりも、パラメータ性能のトレードオフの方が優れていることが分かりました。
- 参考スコア(独自算出の注目度): 39.928280043928325
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Decoder-only language models entangle long-term memory and reasoning in a single parameter set, making it difficult to scale memory capacity independently. Memory Decoder introduces a parametric long-term memory module but only studies it at a relatively small scale. In this work, we present Memory Decoder at Scale, scaling memory models up to 6.9B parameters and pretraining them on 300B tokens. At this data scale, the combined cost of indexing and search makes a standard Faiss pipeline infeasible. We address this bottleneck with a distributed pipeline for Faiss indexing and retrieval, together with sparse, batch-wise loading of kNN distributions. Across model scales, we find that allocating more parameters to memory yields a better parameter-performance tradeoff than scaling the base model alone. On 17 benchmarks, pairing a 6.9B general memory with Pythia-410M raises its average score from 29.86 to 37.34, surpassing Pythia-12B (37.24) with 39% fewer total parameters. For Qwen3 Base models ranging from 0.6B to 14B, 1.7B domain memories improve the average score across the three domains by more than 9 points at every scale. Overall, our results demonstrate that independently scaling pretrained memory offers a more parameter efficient path to improving language model performance.
- Abstract(参考訳): デコーダのみの言語モデルは、長期記憶と推論を単一のパラメータセットで絡み合わせるため、メモリ容量を独立して拡張することは困難である。
メモリデコーダはパラメトリックな長期記憶モジュールを導入するが、比較的小さなスケールでしか研究しない。
本研究では,メモリデコーダをスケールし,最大6.9Bパラメータまでのメモリモデルをスケールアップし,300Bトークンで事前トレーニングする。
このデータスケールでは、インデックスと検索の組み合わせコストにより、標準のFaissパイプラインが実現不可能になる。
このボトルネックには、分散パイプラインによるFaissインデクシングと検索と、kNNディストリビューションのスパースでバッチワイドなロードを併用して対処する。
モデルスケール全体にわたって、より多くのパラメータをメモリに割り当てると、ベースモデルのみをスケールするよりもパラメータ性能のトレードオフが優れていることが分かりました。
17のベンチマークでは、Pythia-410Mと6.9Bの一般メモリをペアリングすると、平均スコアが29.86から37.34に上昇し、Pythia-12B (37.24)を39%下回った。
Qwen3ベースモデルは0.6Bから14Bの範囲で、ドメインメモリ1.7Bは3つのドメインの平均スコアを1スケールで9ポイント以上改善する。
全体として、トレーニング済みメモリを独立にスケーリングすることは、言語モデルの性能を改善するためのよりパラメータ効率の良い経路を提供することを示す。
関連論文リスト
- Memory Grafting: Scaling Language Model Pre-training via Offline Conditional Memory [65.39827296429527]
条件付きメモリのスケーリングは、言語モデルのキャパシティを向上する有望な方法である。
Engramのような既存の方法は、事前トレーニング中にスクラッチから大きなメモリテーブルを学習する。
本研究では, グラフトモデルから凍結した隠蔽状態を条件n-gramメモリとして利用する条件記憶スケーリング手法であるメモリグラフトを提案する。
論文 参考訳(メタデータ) (2026-05-20T09:35:04Z) - Not All Bits Are Equal: Scale-Dependent Memory Optimization Strategies for Reasoning Models [10.604862875916103]
4ビット量子化は、非推論モデルとスケールにわたるゼロショットタスクのメモリ最適選択として登場した。
モデルサイズではなくKVキャッシュがメモリを支配できるような推論モデルでは,この万能処方は失敗することを示す。
8ビットの4Bパラメータ未満の有効サイズを持つモデルでは、より長い生成ではなく、メモリをより多くの重みに割り当てることで、精度が向上する。
論文 参考訳(メタデータ) (2025-10-13T03:14:28Z) - Pretraining with hierarchical memories: separating long-tail and common knowledge [32.22296691842835]
我々は,世界知識を符号化する大規模階層型パラメトリックメモリバンクにアクセスする小型言語モデルを提案する。
事前トレーニングと推論の間、小さなコンテキスト依存のメモリブロックを取得し、それをモデルに追加します。
我々の事前学習は、記憶パラメータに長い世界知識を格納することを学び、一方、小言語モデルは一般的な推論能力を捉えるアンカーとして機能する。
論文 参考訳(メタデータ) (2025-09-29T17:59:50Z) - Memory Layers at Scale [67.00854080570979]
この研究はメモリ層を概念実証以上のものにし、現代の規模でその有用性を証明している。
ダウンストリームタスクでは、改善されたメモリ層で強化された言語モデルは、予算の2倍以上の高密度モデルよりも優れており、計算とパラメータの両方にマッチする場合の熟練モデルの混合も優れている。
最大128Bのメモリパラメータを持つスケーリング法則を1兆トークンまで事前訓練し,最大8Bパラメータを持つベースモデルと比較した,完全な並列化可能なメモリレイヤの実装を提供する。
論文 参考訳(メタデータ) (2024-12-12T23:56:57Z) - QLoRA: Efficient Finetuning of Quantized LLMs [66.58009990713134]
我々は,48GBのGPU上で65Bパラメータモデルを微調整するのに十分なメモリ使用量を削減する,効率的な微調整手法QLoRAを提案する。
QLoRAは凍結した4ビット量子化事前学習言語モデルを通して低ランクアダプタ(LoRA)に逆伝搬する
最高のモデルファミリであるGuanacoは、Vicunaベンチマークでリリースされたすべてのモデルより優れています。
論文 参考訳(メタデータ) (2023-05-23T17:50:33Z) - A Model or 603 Exemplars: Towards Memory-Efficient Class-Incremental
Learning [56.450090618578]
CIL(Class-Incremental Learning)は、この要件を満たすために、限られたメモリサイズでモデルをトレーニングすることを目的としている。
モデルサイズを総予算にカウントし,メモリサイズに整合する手法を比較すると,保存モデルは常に機能しないことを示す。
本稿では,メモリ効率のよい拡張可能なMOdelのための MEMO という,シンプルで効果的なベースラインを提案する。
論文 参考訳(メタデータ) (2022-05-26T08:24:01Z) - Differentiable Random Access Memory using Lattices [0.0]
サイズに関係なく$O(1)$の異なるランダムアクセスメモリモジュールを導入する。
設計は選択された格子の点にエントリを格納し、対称性を利用して任意の点の最も近い近傍を効率的に計算する。
論文 参考訳(メタデータ) (2021-07-07T20:55:42Z) - Memformer: A Memory-Augmented Transformer for Sequence Modeling [55.780849185884996]
本稿では、シーケンスモデリングのための効率的なニューラルネットワークであるMemformerを紹介する。
我々のモデルは長いシーケンスを処理する際に線形時間複雑性と一定メモリ空間複雑性を実現する。
論文 参考訳(メタデータ) (2020-10-14T09:03:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。