論文の概要: Absorber LLM: Harnessing Causal Synchronization for Test-Time Training
- arxiv url: http://arxiv.org/abs/2604.20915v1
- Date: Wed, 22 Apr 2026 02:58:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-24 14:40:06.09166
- Title: Absorber LLM: Harnessing Causal Synchronization for Test-Time Training
- Title(参考訳): 吸収型LDM:テスト時間トレーニングにおける因果同期のハーネス化
- Authors: Zhixin Zhang, Shabo Zhang, Chengcan Wu, Zeming Wei, Meng Sun,
- Abstract要約: トランスフォーマーは、自己注意のためのシーケンス長で成長する高い計算コストに悩まされる。
RNNのような定型メモリの代替手段は、履歴を一定サイズの状態に圧縮し、長い尾の依存関係を失う。
本稿では,長期継続を自己教師付き因果同期として定式化するAbsorber LLMを提案する。
- 参考スコア(独自算出の注目度): 11.369402753246396
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Transformers suffer from a high computational cost that grows with sequence length for self-attention, making inference in long streams prohibited by memory consumption. Constant-memory alternatives such as RNNs and SSMs compress history into states with fixed size and thus lose long-tail dependencies, while methods that memorize contexts into parameters, such as Test-Time Training (TTT), are prone to overfitting token-level projection and fail to preserve the causal effect of context in pretrained LLMs. We propose Absorber LLM, which formulates long-context retention as a self-supervised causal synchronization: after absorbing historical contexts into parameters, a contextless model should match the original model with full context on future generations. We optimize this objective by synchronizing internal behaviors of the updated model with the original one, ensuring context absorption and generalization. Experiments on long-context and streaming benchmarks show that Absorber LLM reduces inference memory and improves accuracy over prior parameter-as-memory baselines.
- Abstract(参考訳): トランスフォーマーは、自己アテンションのためのシーケンス長とともに成長する高い計算コストに悩まされ、メモリ消費によって禁止される長いストリームの推論を行う。
RNNやSSMのような定数メモリの代替手段は、履歴を一定サイズの状態に圧縮し、長いテールの依存関係を失う。一方、テストタイムトレーニング(TTT)のようなパラメータにコンテキストを記憶するメソッドは、トークンレベルのプロジェクションを過度に適合させる傾向があり、事前訓練されたLLMにおけるコンテキストの因果効果を保存できない。
本稿では,長期コンテキスト保持を自己教師付き因果同期として定式化するAbsorber LLMを提案する。
我々は、更新されたモデルの内部動作と元のモデルとを同期させ、コンテキストの吸収と一般化を保証することで、この目的を最適化する。
長期コンテキストとストリーミングベンチマークの実験では、Absorber LLMは推論メモリを削減し、以前のパラメータ・アズ・メモリのベースラインよりも精度を向上させる。
関連論文リスト
- Developing Adaptive Context Compression Techniques for Large Language Models (LLMs) in Long-Running Interactions [0.0]
大規模言語モデル(LLM)は、コンテキスト長、メモリ飽和、計算オーバーヘッドの増大により、長時間にわたる相互作用の間、性能劣化を経験することが多い。
本稿では,重要メモリ選択,コヒーレンス・インテリジェンス・フィルタリング,動的予算配分を統合し,コンテキスト成長を制御しながら,重要な会話情報を保持する適応型コンテキスト圧縮フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-31T02:57:48Z) - MemDLM: Memory-Enhanced DLM Training [56.40248490616793]
Diffusion Language Models (DLM)は、Auto-Regressive (AR)モデルよりも優れた利点を提供する。
彼らは列車の干渉ミスマッチに悩まされている。
本稿では,模擬復調処理をトレーニングに組み込んだメモリ拡張DLMを提案する。
論文 参考訳(メタデータ) (2026-03-23T17:39:56Z) - TS-Haystack: A Multi-Scale Retrieval Benchmark for Time Series Language Models [4.387988928531881]
時系列言語モデル(TSLM)は、自然言語における連続的な信号の推論のための統一モデルとして登場している。
既存のモデルは通常、短いシーケンスでトレーニングされ、評価されるが、現実の時系列センサーストリームは数百万のデータポイントにまたがる。
TS-Haystackは4つのカテゴリにまたがる10のタスクタイプからなる長期コンテキストの時間的評価ベンチマークである。
論文 参考訳(メタデータ) (2026-02-15T15:50:02Z) - Recurrent Preference Memory for Efficient Long-Sequence Generative Recommendation [27.325586037888]
本稿では,長いユーザインタラクション履歴をコンパクトなPreference Memoryトークンに圧縮するフレームワークRec2PMを紹介する。
実験の結果、Rec2PMは推論遅延とメモリフットプリントを著しく低減し、フルシーケンスモデルよりも精度が高いことがわかった。
論文 参考訳(メタデータ) (2026-02-12T05:51:52Z) - TS-Memory: Plug-and-Play Memory for Time Series Foundation Models [63.21390142212087]
Time Series Foundation Models (TSFM) は大規模な事前訓練を通じて強力なゼロショット予測を実現する。
パラメトリック適応は破滅的な忘れを招き、非パラメトリック検索は予測を改善するが、データストア検索によってレイテンシが高くなる。
本稿では, TSFM を拡張した軽量メモリアダプタ TS-Memory としてParametric Memory Distillation を提案し,実装する。
論文 参考訳(メタデータ) (2026-02-12T04:16:19Z) - Latent Context Compilation: Distilling Long Context into Compact Portable Memory [13.768393657432027]
本稿では,コンテキスト処理を適応からコンパイルへシフトするフレームワークであるLatent Context Compilationを提案する。
使い捨てのLoRAモジュールをコンパイラとして利用することにより、長いコンテキストをコンパクトなバッファトークンに抽出する。
Llama-3.1-8Bによる実験では、遅延コンテキストコンパイルは詳細な詳細と推論能力を保持する。
論文 参考訳(メタデータ) (2026-01-31T08:38:07Z) - Mixture of Contexts for Long Video Generation [72.96361488755986]
我々は長文ビデオ生成を内部情報検索タスクとして再放送する。
本稿では,学習可能なスパークアテンション・ルーティング・モジュールであるMixture of Contexts (MoC) を提案する。
データをスケールしてルーティングを徐々に分散させていくと、そのモデルは計算を適切な履歴に割り当て、アイデンティティ、アクション、シーンを数分のコンテンツで保存する。
論文 参考訳(メタデータ) (2025-08-28T17:57:55Z) - Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache [67.47789629197857]
本稿では,トランスヘッド次元の不均一な役割を生かした学習自由フレームワークを提案する。
フーリエアテンションは、長コンテキスト非感性次元をフーリエ基底に投影することにより、その時間的進化を固定長のスペクトル係数で近似する。
本稿では,FourierAttention が LongBench と Needle-In-A-Haystack 上で最高の長文精度を実現することを示す。
論文 参考訳(メタデータ) (2025-06-13T15:35:54Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。