論文の概要: Data-Free Layer-Adaptive Merging via Fisher Information for Long-to-Short Reasoning LLMs
- arxiv url: http://arxiv.org/abs/2603.21705v1
- Date: Mon, 23 Mar 2026 08:45:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.575554
- Title: Data-Free Layer-Adaptive Merging via Fisher Information for Long-to-Short Reasoning LLMs
- Title(参考訳): 長短LLMのための漁業情報によるデータフリー層適応マージ
- Abstract要約: 層適応型マージの最初の理論的正当性を提供する。
ランダムトークン入力のみを用いて対角線FIMを演算する textbfFIM-Merging を提案する。
我々のフレームワークはまた、ACMのような既存の層適応手法が統一的な統合を実証的に上回っている理由について、統一的な理論的説明を提供する。
- 参考スコア(独自算出の注目度): 3.18088418556364
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model merging has emerged as a practical approach to combine capabilities of specialized large language models (LLMs) without additional training. In the Long-to-Short (L2S) scenario, merging a base model with a long-chain-of-thought reasoning model aims to preserve reasoning accuracy while reducing output length. Existing methods rely on Task Arithmetic and its variants, which implicitly assume that model outputs vary linearly with the merging coefficient -- an assumption we show is systematically violated in L2S settings. We provide the first theoretical justification for layer-adaptive merging: we prove that merging error is bounded by a term proportional to the per-layer Hessian norm (Proposition~1), and establish that the Fisher Information Matrix (FIM) is a principled, computable proxy for this bound via the Fisher-Hessian equivalence at local optima. Building on this theory, we propose \textbf{FIM-Merging}, which computes diagonal FIM using only random token inputs (no domain-specific calibration data required) and uses it to assign per-layer merging coefficients. On the 7B L2S benchmark, FIM-TIES achieves state-of-the-art performance on five out of six evaluation benchmarks, including a \textbf{+6.2} point gain on MATH500 over ACM-TIES (90.2 vs.\ 84.0), while requiring no calibration data. On the 1.5B benchmark, FIM-TIES achieves an average accuracy of \textbf{47.3}, surpassing the previous best ACM-TIES (43.3) by \textbf{+3.9} points, while reducing average response length by \textbf{91.9\%} relative to the long-CoT model. Our framework also provides a unified theoretical explanation for why existing layer-adaptive methods such as ACM empirically outperform uniform merging.
- Abstract(参考訳): モデルマージは、特別な大規模言語モデル(LLM)の能力を追加トレーニングなしで組み合わせるための実践的なアプローチとして登場した。
ロング・トゥ・ショート(L2S)シナリオでは、ベースモデルをロングチェーン・オブ・ソート推論モデルにマージすることは、出力長を削減しつつ、推論の精度を維持することを目的としている。
既存の方法はTask Arithmeticとその変種に依存しており、モデル出力がマージ係数と線形に変化すると暗黙的に仮定している。
我々は、層適応的なマージに対する最初の理論的正当性を与える: マージ誤差が層ごとのヘッセンノルム(命題~1)に比例する項で有界であることが証明され、Fisher Information Matrix (FIM) が局所オプティマでのFisher-Hessian同値性を介して、この境界に対する原理的、計算可能なプロキシであることを示す。
この理論に基づいて、ランダムトークン入力(ドメイン固有の校正データを必要としない)のみを用いて対角線FIMを計算し、層ごとのマージ係数を割り当てる「textbf{FIM-Merging}」を提案する。
7B L2S ベンチマークでは、FIM-TIES は ACM-TIES (90.2 対) に対して MATH500 上の \textbf{+6.2} ポイントゲインを含む6つの評価ベンチマークのうち5つで最先端のパフォーマンスを達成した。
84.0)だが、キャリブレーションデータを必要としない。
1.5B のベンチマークでは、FIM-TIES は \textbf{47.3} の平均精度を達成し、以前の最高の ACM-TIES (43.3) を \textbf{+3.9} ポイントで上回り、長いCoT モデルに対して \textbf{91.9\%} で平均応答長を減らした。
我々のフレームワークはまた、ACMのような既存の層適応手法が統一的な統合を実証的に上回っている理由について、統一的な理論的説明を提供する。
関連論文リスト
- Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models [2.1665689529884697]
本稿では,コンパクトな埋め込みモデルと汎用SLMの2つのコンポーネントからなる効率的なRAGアーキテクチャであるB1adeについて述べる。
5つの事前訓練エンコーダのパラメータフリー融合により構築された335Mパラメータ検索モデルであるB1ade-embedは、追加トレーニングをゼロとした500M未満モデルの上位MTEBスコアを達成する。
B1ade-1Bは42.4%の反応で回収された通路を引用し、トレーニング分布の寄与率を5.5ポイント上回っている。
論文 参考訳(メタデータ) (2026-07-29T22:41:25Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - Closed-Form Spectral Regularization for Multi-Task Model Merging [96.82449201305234]
モデルマージは、個別に調整された複数の専門家をトレーニングデータなしで単一のマルチタスクモデルに結合する。
State-of-the-art merging method formulate merging as a layer-wise interference problem。
本稿では,逐次降下の勾配-流路に一致するソフト指数フィルタを組み合わせた閉形式手法SWUDIを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:00:47Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - Bayesian Model Merging [17.887004278413915]
モデルマージは、複数のタスク固有のエキスパートモデルを、共同トレーニングなしで単一のモデルに結合することを目的としている。
本稿では,プラグインとプレイの双方向最適化フレームワークであるBayesian Model Merging (BMM)を紹介する。
BMMは、すべてのプラグアンドプレイアンカーベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-13T00:36:47Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - Functionality-Oriented LLM Merging on the Fisher--Rao Manifold [14.349284217707575]
重み空間のマージは、複数の微調整LDMを再訓練せずに単一のモデルに組み合わせることを目的としている。
我々は,標準を守り,マルチエキスパートマージに直接一般化する軽量な球面プロキシを用いて,実用的な固定点アルゴリズムを導出する。
論文 参考訳(メタデータ) (2026-03-05T09:08:38Z) - Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning [11.179446105672461]
教師付き微調整と強化学習を組み合わせた多段階効率的な推論手法を提案する。
提案手法は,8Bモデルでは平均28%,32Bモデルでは40%の応答長を減少させる。
より複雑な最先端の効率的な推論手法に比べて、優れたトレードオフを実現する。
論文 参考訳(メタデータ) (2026-01-06T12:31:51Z) - DiSC-AMC: Token- and Parameter-Efficient Discretized Statistics In-Context Automatic Modulation Classification [19.190236060870184]
大規模言語モデル(LLM)は、微調整なしで、オープンセットで自動変調分類(AMC)を実行することができる。
文脈自動変調分類(DiSC-AMC)における離散統計量について述べる。
DiSC-AMCは、高次の統計と累積をコンパクトなシンボルトークンに識別するトークンおよびパラメータ効率の変種である。
論文 参考訳(メタデータ) (2025-09-30T22:20:57Z) - LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models [95.77351099118323]
Masked Diffusion Models (MDM) は言語モデリングにおいて有望なパラダイムである。
この課題は、優先最適化に必要なエビデンス・ロウアー・バウンド(ELBO)に基づく推定値の高分散から生じる。
本稿では,ELBO推定器の偏差を公式に解析し,優先最適化勾配の偏差と偏差を導出するフレームワークであるVRPOを提案する。
論文 参考訳(メタデータ) (2025-05-25T16:36:20Z) - Token-Efficient RL for LLM Reasoning [0.02488650627593658]
本稿では,大規模言語モデル (LLM) において,厳密なメモリと計算限界下での推論に適した強化学習戦略を提案する。
ベースラインサブトラクションを用いた早期ポリシー勾配法に基づいて,出力トークンの小さな情報サブセット上で動作する批判のない手法を設計する。
提案手法は,SVAMPベンチマークの精度を46%から70%以上に向上し,マルチ桁乗算において高い性能を示した。
論文 参考訳(メタデータ) (2025-04-29T14:58:43Z) - Training Deep Learning Models with Norm-Constrained LMOs [56.00317694850397]
線形最小化オラクル(LMO)を用いて問題の幾何学に適応する新しいアルゴリズム群を提案する。
我々は,Adamに頼らずに,我々のアルゴリズムであるScionを用いたナノGPTトレーニングの大幅な高速化を示す。
論文 参考訳(メタデータ) (2025-02-11T13:10:34Z) - ProofAug: Efficient Neural Theorem Proving via Fine-grained Proof Structure Analysis [50.020850767257095]
本稿では,LLMに様々な粒度で自動化手法を付加するProofAugを提案する。
本手法は,オープンソースのDeep-math-7bベースモデルとIsabelle証明アシスタントを用いて,MiniF2Fベンチマークで検証した。
また、ProofAugのLean 4バージョンを実装し、Kimina-Prover-seek-Distill-1.5Bのパス@1のパフォーマンスを44.3%から50.4%に改善します。
論文 参考訳(メタデータ) (2025-01-30T12:37:06Z) - Generative Lines Matching Models [2.6089354079273512]
本研究では,2つの分布を補間する全直線に一致した新しい確率フローモデルを提案する。
その結果,LMMが生成する流れ場は時間的整合性に優れ,直線性スコアの優れた軌道が得られた。
全体として、LMMは確立されたベンチマークデータセット上で、最小限のNFEで最先端のFIDスコアを達成する。
論文 参考訳(メタデータ) (2024-12-09T11:33:38Z) - Bypass Back-propagation: Optimization-based Structural Pruning for Large Language Models via Policy Gradient [57.9629676017527]
本研究では,プルーンドモデルの損失を最適化することにより,確率空間におけるプルーニングマスクを直接学習する最適化に基づく構造的プルーニングを提案する。
我々は、基底となるベルヌーイ分布をサンプルのバイナリ・プルーニングマスクに学習することでこれを実現する。
LLaMA, LLaMA-2, LLaMA-3, Vicuna, Mistral モデルによる実験により, 本手法の有効性と有効性を示すことができた。
論文 参考訳(メタデータ) (2024-06-15T09:31:03Z) - DFedADMM: Dual Constraints Controlled Model Inconsistency for
Decentralized Federated Learning [52.83811558753284]
分散学習(DFL)は、中央サーバーを捨て、分散通信ネットワークを確立する。
既存のDFL手法は依然として、局所的な矛盾と局所的な過度なオーバーフィッティングという2つの大きな課題に悩まされている。
論文 参考訳(メタデータ) (2023-08-16T11:22:36Z) - Squeezeformer: An Efficient Transformer for Automatic Speech Recognition [99.349598600887]
Conformerは、そのハイブリッドアテンション・コンボリューションアーキテクチャに基づいて、様々な下流音声タスクの事実上のバックボーンモデルである。
Squeezeformerモデルを提案する。これは、同じトレーニングスキームの下で、最先端のASRモデルよりも一貫して優れている。
論文 参考訳(メタデータ) (2022-06-02T06:06:29Z) - Autoregressive Score Matching [113.4502004812927]
自動回帰条件スコアモデル(AR-CSM)を提案する。
AR-CSMモデルでは、このデータ分布とモデル分布のばらつきを効率的に計算し、最適化することができ、高価なサンプリングや対向訓練を必要としない。
本研究では,合成データに対する密度推定,画像生成,画像復調,暗黙エンコーダを用いた潜在変数モデルの訓練に応用できることを示す。
論文 参考訳(メタデータ) (2020-10-24T07:01:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。