論文の概要: Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning
- arxiv url: http://arxiv.org/abs/2608.13596v1
- Date: Fri, 31 Jul 2026 03:51:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-23 14:54:39.903619
- Title: Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning
- Title(参考訳): アクティベーション誘導プルーニングによるモデルスケール間の学習自由な知識伝達
- Abstract要約: アーキテクチャ上のミスマッチに拘わらず,より強力なドナーを持つ小型の受取言語モデルを改善するという,未探索のクロススケール環境について検討する。
本研究は,ニューロンのセマンティックアライメントを明示することなく,有用な機能を伝達できるかどうかを問う。
クロススケール核融合のための活性化誘導フレームワークである Activation-Prune Activation-Merge (APM) を提案する。
- 参考スコア(独自算出の注目度): 5.86953159718795
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Heterogeneous model fusion seeks to combine models that differ in tasks, initializations, architectures, or scales. We study an underexplored cross-scale setting: improving a small recipient language model with a stronger donor despite substantial architectural mismatch. We ask whether useful capabilities can be transferred without explicit neuron-wise semantic alignment. Building on the observation that truncating a large model to a smaller architecture and injecting it with a tiny mixing weight can already improve the recipient, we propose Activation-Prune-Merge (APM), an activation-guided framework for cross-scale fusion. APM constructs task-conditioned activation maps on the donor, selects salient layers, hidden dimensions, attention heads, and MLP neurons to prune it to the recipient architecture, and injects the resulting donor slice into the original recipient using a micro interpolation coefficient. This formulation treats the donor as a source of concentrated functional components rather than requiring precise structural transplantation. Across 16 benchmarks spanning reasoning, mathematics, code generation, instruction following, and classification, APM improves the overall average accuracy from 55.5% to 60.6% over the original 3B recipient. RTE accuracy increases from 64.3% to 82.3%, QNLI from 52.3% to 65.7%, and BoolQ from 70.8% to 79.2%. Analyses of injection ratios and sequential multi-stage fusion further suggest that activation-guided extraction improves the quality of the transferable donor slice while preserving the small-ratio fusion regime. These results provide evidence that cross-scale heterogeneous fusion can succeed without explicit semantic alignment when the donor contribution is sufficiently concentrated and carefully selected.
- Abstract(参考訳): 不均一モデル融合は、タスク、初期化、アーキテクチャ、スケールが異なるモデルを組み合わせることを目指している。
アーキテクチャ上のミスマッチに拘わらず,より強力なドナーを持つ小型の受取言語モデルを改善するという,未探索のクロススケール環境について検討する。
本研究は,ニューロンのセマンティックアライメントを明示することなく,有用な機能を伝達できるかどうかを問う。
大型モデルの小型化と少量の混合重み付けによる注入により, 受給者の改善が期待できるという観測に基づいて, クロススケール核融合のための活性化誘導フレームワークである Activation-Prune-Merge (APM) を提案する。
APMは、ドナー上でタスク条件付アクティベーションマップを構築し、サルエント層、隠れ次元、アテンションヘッド、MLPニューロンを選択して受信者アーキテクチャにプルークし、マイクロ補間係数を用いて元の受信者にドナースライスを注入する。
この定式化は、ドナーを正確な構造移植を必要とせず、高機能成分の供給源として扱う。
推論、数学、コード生成、命令追従、分類を含む16のベンチマークで、APMは、最初の3B受信者よりも全体の平均精度を55.5%から60.6%に改善した。
RTEの精度は64.3%から82.3%、QNLIは52.3%から65.7%、BoolQは70.8%から79.2%に向上する。
インジェクション比と逐次多段核融合の解析により, 活性化誘導抽出は低比核融合状態を維持しつつ, 転写可能なドナースライスの品質を向上させることが示唆された。
これらの結果は、ドナーの寄与が十分に集中し、慎重に選択されたときに、明示的なセマンティックアライメントを伴わずに、大規模な異種核融合が成功できることを示す。
関連論文リスト
- MAPLE: MoE Adaptive Plug-and-play Layer-wise Expert allocation [8.26092809964631]
スパースアクティベートされたMixture-of-Experts (MoE) トランスフォーマーは、すべての層にまたがる同じ数のルーティングされた専門家を普遍的に修正する。
我々は,事前訓練されたMOE LLMの層にまたがって,経路付きエキスパート予算を均質に再配置するプラグイン・アンド・プレイ・フレームワークであるMAPLEを提案する。
論文 参考訳(メタデータ) (2026-08-15T16:10:28Z) - MSCGC-KAN: Multi-scale Causal Graph Convolution and Kolmogorov-Arnold Feature Mapping for EEG Emotion Recognition [4.244312032484765]
本稿では,MSCGC-KANと呼ばれる感情認識手法を提案する。
MSCGC-KANはマルチスケール因果グラフ畳み込みとKolmogorov-Arnold特徴写像からなる構造化タスクヘッドである。
提案手法はFACEDおよびSEED-VIIデータセット上で60.66%のバランス精度と60.40%の重み付きF1スコアを実現する。
論文 参考訳(メタデータ) (2026-05-26T07:02:13Z) - Discovery of a Hematopoietic Manifold in scGPT Yields a Method for Extracting Performant Algorithms from Biological Foundation Model Internals [0.0]
scGPTは内部的に発達分岐構造を持つコンパクトな造血多様体を符号化していることを示す。
本稿では,凍結した注意重みから直接操作子を輸出する3段階抽出法を提案する。
コンパクト作用素の機械論的解釈性は、66.2%のアブレーション効果を説明する4要素コアが集中していることを示している。
論文 参考訳(メタデータ) (2026-03-10T22:44:12Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - AMGFormer: Adaptive Multi-Granular Transformer for Brain Tumor Segmentation with Missing Modalities [6.461582089537306]
AMGFormerを提案し、3つの相乗的モジュールによる安定性を著しく向上させる。
BraTS 2018では、89.33%のWT、82.70%のTC、67.23%のET Diceスコアが15のモードの組み合わせで0.5%のばらつきで達成されている。
単一モダリティETセグメンテーションは、最先端手法よりも40~81%改善している。
論文 参考訳(メタデータ) (2026-01-27T08:29:02Z) - DRBD-Mamba for Robust and Efficient Brain Tumor Segmentation with Analytical Insights [54.87947751720332]
脳腫瘍の正確なセグメンテーションは、臨床診断と治療に重要である。
マンバを拠点とするState Space Modelsは、有望なパフォーマンスを示している。
本稿では,計算オーバーヘッドを最小限に抑えながら,マルチスケールの長距離依存関係をキャプチャするマルチ解像度双方向マンバを提案する。
論文 参考訳(メタデータ) (2025-10-16T07:31:21Z) - Dumpling GNN: Hybrid GNN Enables Better ADC Payload Activity Prediction Based on Chemical Structure [53.76752789814785]
DumplingGNNは、化学構造に基づいてADCペイロードのアクティビティを予測するために特別に設計された、ハイブリッドなグラフニューラルネットワークアーキテクチャである。
DNAトポイソメラーゼIインヒビターに着目した包括的ADCペイロードデータセットで評価を行った。
特別なADCペイロードデータセットに対して、例外的な精度(91.48%)、感度95.08%)、特異性(97.54%)を示す。
論文 参考訳(メタデータ) (2024-09-23T17:11:04Z) - Hepatic vessel segmentation based on 3Dswin-transformer with inductive
biased multi-head self-attention [46.46365941681487]
Indu BIased Multi-Head Attention Vessel Net という,堅牢なエンドツーエンドのコンテナセグメンテーションネットワークを提案する。
正確な肝血管のボクセルを見つけるために,パッチワイド埋め込みよりもボクセルワイド埋め込みを導入する。
一方,絶対位置埋め込みから帰納的バイアス付き相対的位置埋め込みを学習する帰納的バイアス付きマルチヘッド自己アテンションを提案する。
論文 参考訳(メタデータ) (2021-11-05T10:17:08Z) - Data Augmentation in High Dimensional Low Sample Size Setting Using a
Geometry-Based Variational Autoencoder [0.1529342790344802]
幾何に基づく変分オートエンコーダを用いて高次元低サンプルサイズ(HDLSS)設定でデータ拡張を行う新しい手法を提案する。
我々のアプローチは、リーマン多様体として見られるVAEの適切な潜在空間モデリングと、より有意義なサンプルを生成する新しい生成スキームを組み合わせる。
論文 参考訳(メタデータ) (2021-04-30T18:10:33Z) - Inception Convolution with Efficient Dilation Search [121.41030859447487]
拡散畳み込みは、効果的な受容場を制御し、オブジェクトの大規模な分散を処理するための標準的な畳み込みニューラルネットワークの重要な変異体である。
そこで我々は,異なる軸,チャネル,層間の独立な拡散を有する拡張畳み込みの新たな変異体,すなわち開始(拡張)畳み込みを提案する。
本稿では,データに複雑なインセプション・コンボリューションを適合させる実用的な手法を探索し,統計的最適化に基づく簡易かつ効果的な拡張探索アルゴリズム(EDO)を開発した。
論文 参考訳(メタデータ) (2020-12-25T14:58:35Z) - Segmentation of the Myocardium on Late-Gadolinium Enhanced MRI based on
2.5 D Residual Squeeze and Excitation Deep Learning Model [55.09533240649176]
本研究の目的は,LGE-MRIを用いた心筋境界領域の深部学習モデルに基づく正確な自動セグメンテーション法を開発することである。
合計320回の試験(平均6回の試験)と28回の試験が行われた。
ベーススライスとミドルスライスにおけるアンサンブルモデルの性能解析は, サーバ内調査と同等であり, アトピーススライスではわずかに低かった。
論文 参考訳(メタデータ) (2020-05-27T20:44:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。