論文の概要: SSM Adapters via Hankel Reduced-order Modeling: Injection Site Determines Task Suitability in Long-Context Fine-Tuning
- arxiv url: http://arxiv.org/abs/2606.26290v1
- Date: Wed, 24 Jun 2026 18:36:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.054163
- Title: SSM Adapters via Hankel Reduced-order Modeling: Injection Site Determines Task Suitability in Long-Context Fine-Tuning
- Title(参考訳): HankelによるSSM適応器の低次モデリング:ロングコンテキストファインチューニングにおけるタスク適合性を決定するインジェクションサイト
- Abstract要約: 本稿では,Hankel Reduced Order Model (HRM) をSSMベースの残余モジュールとして導入する。
システム行列 $barA$ の時間不変性を利用することで、HRM は正確な FFT ベースの並列スキャンを可能にし、LoRA との計算等価性を達成できる。
ゲート解析により、HRMはリカレンスを効果的に修正し、長文シーケンスモデリングのための低ランク適応に頑健なアーキテクチャ上の代替手段を提供することが明らかとなった。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: While parameter-efficient fine-tuning (PEFT) typically targets attention projectors, its efficacy for tasks requiring sequential state accumulation remains under-explored. We examine if PEFT for such tasks can benefit from state space model (SSMs) adapters, and if MLP blocks are better injection sites. We introduce Hankel Reduced order Model (HRM) adapter, an SSM-based residual module initialized via Balanced Truncation of empirical Hankel Grammians. By leveraging the time-invariance of the system matrix $\bar{A}$, HRM enables an exact FFT-based parallel scan, achieving computational parity with LoRA across all context lengths. In iso-parametric evaluations on Mistral-7B (8.4M trainable parameters), HRM outperforms LoRA variants on LongBench tasks, including QuALITY (+34.8\% relative accuracy) and QMSum (+71.6\% relative ROUGE-1). HRM further demonstrates consistent superiority across 18 configurations of synthetic state-tracking (DFA, Parity) and character-level language modeling (enwik8). Gate analysis reveals that HRM adapters effectively learn to modulate recurrence, providing a robust architectural alternative to low-rank adaptation for long-context sequence modeling.
- Abstract(参考訳): パラメータ効率の良い微調整(PEFT)は一般的に注意プロジェクタをターゲットにしているが、シーケンシャルな状態の蓄積を必要とするタスクに対する有効性は未探索のままである。
このようなタスクに対するPEFTは、状態空間モデル(SSM)アダプタの恩恵を受けることができるのか、また、MPPブロックがより良いインジェクションサイトであるかどうかを検討する。
実験的なハンケル文法のバランストラニケートにより初期化されたSSMベースの残留モジュールであるハンケル還元順序モデル(HRM)を導入する。
システム行列 $\bar{A}$ の時間不変性を利用することで、HRM は正確な FFT ベースの並列スキャンを可能にし、すべてのコンテキスト長にわたってLORA との計算パリティを達成する。
Mistral-7B (8.4Mのトレーニング可能なパラメータ)の等パラメトリック評価では、HRMはQualITY (+34.8\%の精度)やQMSum (+71.6\%の相対ROUGE-1)を含むLongBenchタスクのLoRA変異よりも優れている。
HRMはさらに、合成状態追跡(DFA、Parity)と文字レベルの言語モデリング(enwik8)の18の構成で一貫した優位性を示している。
ゲート解析により、HRMアダプタはリカレンスを効果的に修正し、長文シーケンスモデリングのための低ランク適応に頑健なアーキテクチャ上の代替となることが明らかとなった。
関連論文リスト
- SMoA: Spectrum Modulation Adapter for Parameter-Efficient Fine-Tuning [57.85676271833619]
低ランク適応 (LoRA) は、全パラメータの微調整をシミュレートするために低ランク更新法を用いる。
ランクが大きくなるにつれて、より主特異な方向が保存され、一般にモデルの性能が向上する。
textbfSpectrum textbfModulation textbfAdapterを提案する。
論文 参考訳(メタデータ) (2026-05-20T13:19:28Z) - Adaptive Linear Path Model-Based Diffusion [52.84663832658799]
リニアパスモデルベース拡散(LP-MBD)を導入し、分散保存スケジュールをフローマッチング線形確率パスに置き換える。
また,適応型LP-MBD(ALP-MBD)を提案し,タスクの複雑さや環境条件に応じて拡散ステップやノイズレベルを調整する。
論文 参考訳(メタデータ) (2026-02-02T21:33:03Z) - High-Rank Structured Modulation for Parameter-Efficient Fine-Tuning [57.85676271833619]
低ランク適応 (LoRA) は、全パラメータの微調整をシミュレートするために低ランク更新法を用いる。
textbfStructured textbfMOdulation textbfAdapterは、より高いランクを維持しながらトレーニング可能なパラメータを少なくする。
論文 参考訳(メタデータ) (2026-01-12T13:06:17Z) - Adapting SAM with Dynamic Similarity Graphs for Few-Shot Parameter-Efficient Small Dense Object Detection: A Case Study of Chickpea Pods in Field Conditions [7.500556611536649]
本研究では,Segment Anything Model (SAM) に適応する動的類似性に基づくグラフ適応(DSGA)モジュールを提案する。
DSGAは4.00Mのトレーニング可能なパラメータしか持たない堅牢な空間的および動的類似性表現を確立しており、これはオリジナルのSAMの4.26%である。
提案手法は農業用自動監視装置の実用性を示し, 精度の高いポッド計数が可能であり, 調整したR-squaredは0.8987である。
論文 参考訳(メタデータ) (2025-09-30T05:26:06Z) - Hierarchical Evaluation Function: A Multi-Metric Approach for Optimizing Demand Forecasting Models [0.479839492673697]
ハイパーパラメータ最適化のためのマルチメトリックフレームワークとして階層評価関数(HEF)を提案する。
HEFは説明力(R2)、過度エラーに対する感度(RMSE)、平均精度(MAE)を統合している。
HEFの性能は予測領域で広く認識されている4つのベンチマークデータセットを用いて評価した。
論文 参考訳(メタデータ) (2025-08-18T16:25:49Z) - Singular Value Decomposition on Kronecker Adaptation for Large Language Model [0.8747606955991707]
大規模な事前訓練されたトランスフォーマーモデルは、様々な言語や推論タスクにまたがって最先端の結果が得られる。
完全な微調整は、かなりのストレージ、メモリ、計算オーバーヘッドを発生させる。
我々は, Kronecker-product tensor factorization と SVD-driven initialization と Dynamic rank selection を組み合わせた新しい PEFT 戦略である SoKA を提案する。
論文 参考訳(メタデータ) (2025-06-18T08:28:53Z) - Discriminative Policy Optimization for Token-Level Reward Models [55.98642069903191]
プロセス報酬モデル(PRM)は、結果報酬モデル(ORM)と比較して、よりきめ細かい監督を提供する。
Q-RMは、微粒なアノテーションに頼ることなく、優先データからトークンレベルのQ関数を明示的に学習する。
Q-RMによる強化学習は、トレーニング効率を大幅に向上させ、GSM8KでのORMの12倍、MATHでのステップレベルPRMの11倍の収束を実現した。
論文 参考訳(メタデータ) (2025-05-29T11:40:34Z) - HSplitLoRA: A Heterogeneous Split Parameter-Efficient Fine-Tuning Framework for Large Language Models [30.345920952847752]
大規模言語モデル(LLM)は、自然言語処理領域などに革命をもたらし、目覚ましいブレークスルーを達成した。
膨大なパラメータサイズのため、様々な下流タスクのためのプライベートデータでこれらのモデルを微調整することが主流になっている。
本研究では,分割学習(SL)と低ランク適応(LoRA)に基づくフレームワークであるHSplitLoRAを提案する。
論文 参考訳(メタデータ) (2025-05-05T17:09:19Z) - Reinforced Model Merging [53.84354455400038]
本稿では,タスク統合に適した環境とエージェントを含むRMM(Reinforced Model Merging)という,革新的なフレームワークを提案する。
評価プロセス中にデータサブセットを利用することで、報酬フィードバックフェーズのボトルネックに対処し、RMMを最大100倍高速化する。
論文 参考訳(メタデータ) (2025-03-27T08:52:41Z) - MSPLoRA: A Multi-Scale Pyramid Low-Rank Adaptation for Efficient Model Fine-Tuning [5.412348391086257]
我々は,グローバル共有ロラ,ミッドレベル共有ロラ,レイヤ特化ロラを導入して,グローバルパターン,中間レベル特徴,きめ細かい情報をキャプチャするMPPLoRAを提案する。
様々なNLPタスクの実験により、MPPLoRAはトレーニング可能なパラメータの数を著しく減らしながら、より効率的な適応とより良い性能を実現することが示された。
論文 参考訳(メタデータ) (2025-03-27T07:01:50Z) - SSMLoRA: Enhancing Low-Rank Adaptation with State Space Model [11.90104174705911]
低ランク行列を相互接続するための低ランク適応(LoRA)の拡張であるSSMLoRA(State Space Model Low-Rank Adaptation)を提案する。
本手法は一般言語評価(GLUE)ベンチマークでLoRAに匹敵する性能を達成し,パラメータの半分しか使用していない。
論文 参考訳(メタデータ) (2025-02-07T14:22:35Z) - SIGMA: Selective Gated Mamba for Sequential Recommendation [56.85338055215429]
最近の進歩であるMambaは、時系列予測において例外的なパフォーマンスを示した。
SIGMA(Selective Gated Mamba)と呼ばれる,シークエンシャルレコメンデーションのための新しいフレームワークを紹介する。
以上の結果から,SIGMAは5つの実世界のデータセットにおいて,現在のモデルよりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2024-08-21T09:12:59Z) - Accurate and Efficient Fine-Tuning of Quantized Large Language Models Through Optimal Balance [20.659750151408186]
大規模言語モデル(LLM)は、様々な領域で素晴らしいパフォーマンスを示している。
パラメータ量子化とローランド適応(LoRA)を組み合わせた既存ソリューション
QA-BLoRA(Quantization-Aware Fine-tuning with Balanced Low-Rank Adaptation)を提案する。
論文 参考訳(メタデータ) (2024-07-24T06:16:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。