論文の概要: CRMA: A Spectrally-Bounded Backbone for Modular Continual Fine-Tuning of LLMs
- arxiv url: http://arxiv.org/abs/2606.00382v1
- Date: Fri, 29 May 2026 21:50:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.374596
- Title: CRMA: A Spectrally-Bounded Backbone for Modular Continual Fine-Tuning of LLMs
- Title(参考訳): CRMA: LLMの連続微調整のためのスペクトル境界バックボーン
- Abstract要約: 我々は、内部混合行列 M がシンクホーン正規化による全ての前方通過において二重確率である残留アダプタ CRMA を紹介する。
5つのドメインにまたがるMistral-7Bでは、モジュラー・パー・タスクのLoRAは、+42.96%+/-5.5(ナイーブ微調整)から-0.17%+/-0.17までのバックボーンの損失相対的ドリフトを仲介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sequential fine-tuning of large language models forces a choice: let the shared substrate keep learning and accept catastrophic forgetting, or freeze it after task one and foreclose cross-task refinement. Per-task adapter methods (LoRAHub, AdapterFusion, PackNet, Progressive Networks) take the second path. We introduce CRMA (Constrained Residual Mixing Adapter), a residual adapter whose internal mixing matrix M is doubly-stochastic at every forward pass via Sinkhorn normalization, so by Birkhoff's theorem ||M||_2 <= 1 holds by construction -- a structural bound, not a penalty. CRMA's spectrally bounded backbone provides a continuously trained shared substrate that earlier modular methods could not, while preserving their forgetting guarantees. On Mistral-7B across 5 sequential domains and 3 seeds, modular per-task LoRA on a CRMA backbone reduces loss-relative drift from +42.96% +/- 5.5 (naive sequential fine-tuning) to -0.17% +/- 0.17, with disjoint per-seed ranges, and improves prior-task holdout loss by 1.99% +/- 0.54 over a matched frozen-substrate baseline. Three independent experimental setups (Mistral-7B 4-domain controlled ablation, TinyLlama 3-domain contamination-controlled replication, Mistral-7B cross-domain probes at 7B) all show positive backward transfer -- without replay buffers, without growing per-task memory, and without distillation. An inference-time ablation on Gemma-2-9B confirms CRMA mediates access to sequentially trained knowledge: 98/100 vs. 38/100 on the same weights and same questions with only CRMA injection toggled. 867 logged training steps verify ||M||_2 = 1.0 within float32 precision (max deviation 1.2 x 10^-7). The forgetting-prevention effect holds across 1.1B-9.2B parameters and four architecture families.
- Abstract(参考訳): 大規模な言語モデルの連続的な微調整は、共有基板を学習し続け、破滅的な忘れを受け入れるか、タスク1の後にそれを凍結し、クロスタスクの洗練を前倒しにする、という選択を強制する。
タスクごとのアダプタメソッド(LoRAHub、AdapterFusion、PackNet、Progressive Networks)が第2の経路を踏む。
CRMA (Constrained Residual Mixing Adapter) は、内部混合行列 M がシンクホーン正規化を経由するすべての前方通過において二重確率的である残差アダプタであり、バーホフの定理 ||M||_2 <= 1 は構成によって成り立つ。
CRMAのスペクトル的にバウンドされたバックボーンは、以前のモジュラーメソッドではできなかったように、継続的にトレーニングされた共有基板を提供する。
5つのシーケンシャルドメインと3つのシードからなるMistral-7Bでは、CRMAのバックボーン上のモジュラータスク毎のLoRAは、損失相対的ドリフトを+42.96% +/- 5.5(5つのシーケンシャルな微調整)から-0.17% +/- 0.17に減らし、マッチした凍結基板ベースライン上でのプレタスクホールドアウト損失を1.99% +/- 0.54改善する。
3つの独立した実験装置(Mistral-7B 4ドメイン制御アブレーション、TinyLlama 3ドメイン汚染制御複製、7BのMistral-7Bクロスドメインプローブ)はいずれもバッファーを再生せず、タスク単位のメモリを増大せず、蒸留もしていない。
Gemma-2-9Bの推論時間アブレーションでは、CRMAはシーケンシャルに訓練された知識へのアクセスを仲介する。
867のログ化されたトレーニングステップは、float32精度(最大偏差1.2 x 10^-7)で||M||_2 = 1.0を検証する。
忘れ防止効果は1.1B-9.2Bパラメータと4つのアーキテクチャファミリにまたがる。
関連論文リスト
- ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - Long-Range Indirect Control-Flow Prediction in Stripped Binaries via Dual Virtual Hubs and Multi-Task Graph Learning [44.79384874347874]
本稿では,長い範囲のIDF予測を行う統合フレームワークICFlowNetを提案する。
ICFlowNetは、候補を意識したDual Virtual Hubs、Global Code Hub、Global Data Hubを導入している。
また,パッケージレベルの分割,関数レベルのmnemonic-hash重複,クリーンなテストプロトコルを備えた,リーク対応のノイズ制御パイプラインを開発した。
論文 参考訳(メタデータ) (2026-09-03T02:17:23Z) - XMerge: Cross-Axis Selection and Reconstructive Layer Merging for LLM Depth Compression [0.0]
交叉軸選択は、相対マグニチュードの低いブロックと角状隠れ状態の変化を識別する。
局所的な境界再構成は、元の2ブロック出力と一致するように、隣接した生存ブロックに適合する。
XMergeはタスクラベルやエンドツーエンドの微調整は使用しない。
論文 参考訳(メタデータ) (2026-09-02T04:12:44Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - TALAN: Task-Aligned Latent Adaptation Networks for Targeted Post-Training of Large Language Models [8.47008876232157]
本稿では, TALAN (Task-Aligned Latent Adaptation Networks) を導入する。
TALANはアクティブシーケンスを潜在メモリに圧縮し、トークンレベルの摂動にリミックスし、制御された残留更新を通じて書き戻す。
4つのQwen3ファミリーのバックボーンと4つのSTEM/コードベンチマークで、TALANは一致したLoRAとDoRAベースラインを改善している。
論文 参考訳(メタデータ) (2026-06-05T04:34:50Z) - Reliable Extraction of Clinical Follow-Up Instructions: A Hybrid Neural-Symbolic Pipeline [43.0484058393522]
我々は,ニューラルシンボリックなハイブリッドパイプラインを直接生成に対して試験する。
本研究は,2000点の合成外用コーパスについて検討した。
論文 参考訳(メタデータ) (2026-05-26T05:14:33Z) - Decomposing Evolutionary Mixture-of-LoRA Architectures: The Routing Lever, the Lifecycle Penalty, and a Substrate-Conditional Boundary [3.151184728006369]
我々は、LoRAシステムの進化的混合を、ルータの書き換え、ドメイン単位の離脱評価スコープ、死のライフサイクル、アルファブレンド継承、SVD突然変異、スロット再配置の3つの要因に分解する。
合成サンドボックスは、制御チャネル上の進化的探索は、タスクに予め整列している場合にのみ負荷を受ける。
論文 参考訳(メタデータ) (2026-05-11T18:59:11Z) - The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs [52.709361620508595]
ListOPDは、パラメータの5分の1で8B-SFTベースラインで、学生をドメイン内に持ち込む。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔テスト、小さなクリップのクロス予測 — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
論文 参考訳(メタデータ) (2026-05-09T06:48:00Z) - SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models [48.335262141752715]
拡散モデルのための後トレーニングパイプラインには、キュレートされたデータに対する教師付き微調整(SFT)と報酬モデルによる強化学習(RL)の2段階がある。
本稿では,このギャップを埋めるバイアス補正ポストトレーニング法であるSOAR(Self-Correction for Optimal Alignment and Refinement)を提案する。
オンライン政治であり、報酬なしであり、クレジット割り当ての問題なく、時間ごとの密集した監督を提供する。
論文 参考訳(メタデータ) (2026-04-14T11:45:15Z) - Ouroboros: Dynamic Weight Generation for Recursive Transformers via Input-Conditioned LoRA Modulation [0.0]
Ouroborosは、コンパクトなコントローラハイパーネットワークを再帰変換ブロックにアタッチするシステムである。
コントローラは現在の隠れ状態を観察し、ステップごとの対角変調ベクトルを生成し、凍ったSVD-d LoRAベースに適用する。
Qwen2.5-3BはPrelude/Recurrent/Codaアーキテクチャに分割され、Ouroborosは修正されていない17層ベースラインのトレーニング損失を43.4%削減した。
完全なシステムでは、9.2Mのトレーニング可能なパラメータ(コントローラ、ゲート、ステップごとのノルム)しか追加されていないが、同等の大きさの静的LORAを1.44ロスで上回っている。
論文 参考訳(メタデータ) (2026-04-02T13:52:32Z) - S0 Tuning: Zero-Overhead Adaptation of Hybrid Recurrent-Attention Models [0.0]
リカレント層毎に1つの初期状態行列をチューニングし、オーバーヘッドゼロでLoRAを+10.8 pp(HumanEvalのp wenSpider)で上回る。
S0 チューニングと呼ばれるチューニングメソッドは、greedy pass@1 を +23.6 +/- 1.7 pp (10 種) で改善します。
クロスドメイン転送はMATH-500 (+4.8 pp, p = 0.00002, 8 seed) と GSM8K = 0.0003, 10 seed で重要である。
論文 参考訳(メタデータ) (2026-04-01T17:21:15Z) - Low-Rank Adaptation Reduces Catastrophic Forgetting in Sequential Transformer Encoder Fine-Tuning: Controlled Empirical Evidence and Frozen-Backbone Representation Probes [3.305265383862785]
コンパニオン表現プローブを用いたシーケンシャルトランスフォーマーエンコーダにおけるローランド適応(LoRA)の実証的研究について述べる。
RTE->MRPC->CoLA->SST-2配列上の5つのフルバリデーションBERTベースでは、フル微調整の収率は19.9%+/-で、標準のLoRA(r、クエリ/バリューモジュール)は0.6%+/-1.4%である。
論文 参考訳(メタデータ) (2026-03-29T14:14:36Z) - RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy [34.723296971298424]
LLMエージェントは、厳密な前提条件を満たす必要があるため、クローズドワールドの実施環境で失敗することが多い。
P1) 無効な動作生成と(P2) 状態ドリフトの2つの構造的結合型障害モードを同定する。
本稿では、構造化ルール検索によるアクション実現性を強制する、コンフリクト管理アーキテクチャRPMSを提案する。
論文 参考訳(メタデータ) (2026-03-18T15:26:00Z) - SLA-Aware Distributed LLM Inference Across Device-RAN-Cloud [44.19683744405876]
Embodied AIはRadio Access Network(RAN)の近くで秒未満の推論を必要とする
我々は,5G Standalone (SA) AI-RANテストベッドから,リピータビリティのための固定ベースラインポリシーを用いて測定を行った。
論文 参考訳(メタデータ) (2026-02-27T06:43:47Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - TD3 with Reverse KL Regularizer for Offline Reinforcement Learning from
Mixed Datasets [118.22975463000928]
エージェントが複数の行動ポリシーをロールアウトすることで収集したデータセットから学習する必要があるオフライン強化学習(RL)について考察する。
1) RL信号の最適化と行動クローニング(BC)信号の最適なトレードオフは、異なる行動ポリシーによって引き起こされる行動カバレッジの変化によって異なる状態に変化する。
本稿では,TD3アルゴリズムに基づくBC正規化器として,適応重み付き逆KL(Kulback-Leibler)分散を用いることにより,両課題に対処する。
論文 参考訳(メタデータ) (2022-12-05T09:36:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。