論文の概要: MemSFT: Mitigating Alignment Tax with an External Parametric Memory
- arxiv url: http://arxiv.org/abs/2607.25614v1
- Date: Tue, 28 Jul 2026 11:45:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.818871
- Title: MemSFT: Mitigating Alignment Tax with an External Parametric Memory
- Title(参考訳): MemSFT:外部パラメトリックメモリによるアライメント税の緩和
- Authors: Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi Wang, Zhiqi Yang, Qipeng Guo, Bowen Zhou, Zhouhan Lin,
- Abstract要約: 大規模言語モデルを専門ドメインに適合させると、しばしばアライメント税が発生する。
バックボーンパラメータの更新からドメインの特殊化を分離することでアライメント税を軽減できるMemSFTを提案する。
我々は,MemSFTが全般的な性能の低下を無視して一貫してドメイン性能を向上するのに対して,完全なSFTは一般的なタスクを忘れることに悩まされていることを示す。
- 参考スコア(独自算出の注目度): 39.4211715596737
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adapting Large Language Models (LLMs) to specialized domains often incurs an alignment tax, as fine-tuning on domain-specific tasks can cause catastrophic forgetting and substantially degrade performance on general tasks. We propose MemSFT, which mitigates the alignment tax by decoupling domain specialization from backbone parameter updates through a plug-and-play parametric memory. The memory is trained to imitate the behavior of a non-parametric retriever operating over domain data, thereby memorizing knowledge and patterns that would otherwise be accessed through retrieval. Once trained on a specific domain, the memory can be reused across LLMs of different sizes. During generation, a learned router dynamically fuses the output distributions of the memory and backbone at each decoding step, allowing domain expertise to be invoked selectively. Across biology, geoscience, and law, evaluations with models ranging from Qwen3-8B to Qwen3-235B-A22B show that MemSFT consistently improves domain performance with negligible degradation in general performance, whereas full SFT suffers severe forgetting on general tasks. Overall, our results demonstrate a practical path to decoupling general model capabilities from domain-specific knowledge at the parameter level, thereby equipping LLMs with new specialized capabilities without compromising their general capabilities.
- Abstract(参考訳): 特定のドメインに大規模言語モデル(LLM)を適用すると、しばしばアライメント税が発生する。
バックボーンパラメータの更新からプラグ・アンド・プレイ・パラメトリックメモリを通じてドメインの特殊化を分離することでアライメント税を軽減できるMemSFTを提案する。
メモリはドメインデータを操作する非パラメトリックレトリバーの振舞いを模倣するように訓練され、それによって検索を通じてアクセスされる知識やパターンを記憶する。
特定のドメインでトレーニングされたメモリは、異なるサイズのLCMで再利用できる。
生成中、学習ルータはデコードステップ毎にメモリとバックボーンの出力分布を動的にフューズし、ドメインの専門知識を選択的に呼び出す。
Qwen3-8B から Qwen3-235B-A22B までのモデルによる生物学、地球科学、法学全般にわたる評価は、MemSFT が全般的な性能の劣化を無視できるようなドメイン性能を一貫して改善する一方で、完全な SFT は一般的なタスクをひどく忘れることに苦しむことを示している。
本研究の結果は,汎用モデル能力をパラメータレベルでのドメイン固有知識から切り離すための実践的な方法を示し,汎用能力を損なうことなくLLMに新たな特殊能力を持たせるものである。
関連論文リスト
- UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams [77.52140119830241]
自律型メモリ管理のためのセルフルーティングフレームワークUniMemを提案する。
UniMemは学習可能なルーティングトークンをメモリコントローラとして使用し、相補的なメモリ経路間の適応的な調整を可能にする。
長距離ストリーミングタスクシーケンスの実験では、UniMemは実行の忠実さを維持しながらベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-28T17:28:21Z) - MILE: Mixture of Incremental LoRA Experts for Continual Semantic Segmentation across Domains and Modalities [19.243037567371875]
連続的なセマンティックセグメンテーションは、以前に学んだタスクのパフォーマンスを犠牲にすることなく、新しいドメインやモダリティに適応するモデルを必要とする。
MILEは、ドメインとモダリティをまたいだ連続的なセグメンテーションのための、モジュール的でパラメータ効率のよいフレームワークである。
論文 参考訳(メタデータ) (2026-05-05T09:27:31Z) - Memory Transfer Learning: How Memories are Transferred Across Domains in Coding Agents [56.078070829341534]
メモリベースの自己進化は、コーディングエージェントにとって有望なパラダイムとして登場した。
ヘテロジニアスドメインからの統一メモリプールを利用して、textbfMemory Transfer Learning (MTL) について検討する。
論文 参考訳(メタデータ) (2026-04-15T15:50:29Z) - MEMTS: Internalizing Domain Knowledge via Parameterized Memory for Retrieval-Free Domain Adaptation of Time Series Foundation Models [51.506429027626005]
Memory for Time Series (MEMTS) は、時系列予測における検索不要領域適応のための軽量かつプラグアンドプレイ方式である。
MEMTSの鍵となるコンポーネントは知識永続化モジュール(KPM)であり、ドメイン固有の時間力学を内部化する。
このパラダイムシフトにより、MEMTSは定数時間推論とニアゼロレイテンシによる正確なドメイン適応を実現することができる。
論文 参考訳(メタデータ) (2026-02-14T14:00:06Z) - Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models [46.59786740489401]
本稿では,プリトレーニング済みメモリであるメモリデコーダを紹介する。このメモリデコーダは,元のモデルのパラメータを変更することなく,効率的なドメイン適応を実現する。
実験により、メモリデコーダは、様々なQwenモデルとLlamaモデルを3つの専門分野(バイオメディシン、ファイナンス、法)に効果的に適応し、平均6.17ポイントのパープレキシティを低減できることが示された。
論文 参考訳(メタデータ) (2025-08-13T15:16:29Z) - MemOS: A Memory OS for AI System [116.87568350346537]
大規模言語モデル(LLM)は、人工知能(AGI)にとって不可欠な基盤となっている。
既存のモデルは、主に静的パラメータと短命なコンテキスト状態に依存しており、ユーザの好みを追跡したり、長い期間にわたって知識を更新する能力を制限する。
MemOSはメモリを管理可能なシステムリソースとして扱うメモリオペレーティングシステムである。
論文 参考訳(メタデータ) (2025-07-04T17:21:46Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z) - TAIA: Large Language Models are Out-of-Distribution Data Learners [30.57872423927015]
効果的な推論時間介入手法を提案する:全てのパラメータを訓練するが、注意のみで推論する(trainallInfAttn)。
trainallInfAttnは、ほとんどのシナリオで完全に調整されたモデルとベースモデルの両方と比較して、優れた改善を実現している。
trainallInfAttnのデータのミスマッチに対する高い耐性は、jailbreakのチューニングに耐性を持ち、一般的なデータを使った特別なタスクを強化する。
論文 参考訳(メタデータ) (2024-05-30T15:57:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。