論文の概要: Beyond Variance: Knowledge-Aware LLM Compression via Fisher-Aligned Subspace Diagnostics
- arxiv url: http://arxiv.org/abs/2601.07197v1
- Date: Mon, 12 Jan 2026 04:41:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-13 19:08:01.212017
- Title: Beyond Variance: Knowledge-Aware LLM Compression via Fisher-Aligned Subspace Diagnostics
- Title(参考訳): 変量を超えて:漁業適応型サブスペース診断による知識認識型LLM圧縮
- Abstract要約: トレーニング後のアクティベーション圧縮は、リソース制約のあるハードウェア上に大規模言語モデルをデプロイするために不可欠である。
Singular Value Decomposition (SVD)のような標準的手法はグラデーション・ブラインドである。
本稿では,知識対応圧縮フレームワークであるFisher-Aligned Subspace Compression (FASC)を紹介する。
- 参考スコア(独自算出の注目度): 6.908972852063454
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Post-training activation compression is essential for deploying Large Language Models (LLMs) on resource-constrained hardware. However, standard methods like Singular Value Decomposition (SVD) are gradient-blind: they preserve high-variance dimensions regardless of their impact on factual knowledge preservation. We introduce Fisher-Aligned Subspace Compression (FASC), a knowledge-aware compression framework that selects subspaces by directly modeling activation-gradient coupling, minimizing a second-order surrogate of the loss function. FASC leverages the Fisher Information Matrix to identify dimensions critical for factual knowledge, which often reside in low-variance but high-gradient-sensitivity subspaces. We propose the Dependence Violation Score (\r{ho}) as a general-purpose diagnostic metric that quantifies activation-gradient coupling, revealing where factual knowledge is stored within transformer architectures. Extensive experiments on Mistral-7B and Llama-3-8B demonstrate that FASC preserves 6-8% more accuracy on knowledge-intensive benchmarks (MMLU, LAMA) compared to variance-based methods at 50% rank reduction, effectively enabling a 7B model to match the factual recall of a 13B uncompressed model. Our analysis reveals that \r{ho} serves as a fundamental signal of stored knowledge, with high-\r{ho} layers emerging only when models internalize factual associations during training.
- Abstract(参考訳): トレーニング後のアクティベーション圧縮は、リソース制約のあるハードウェア上に大規模言語モデル(LLM)をデプロイするために不可欠である。
しかし、Singular Value Decomposition (SVD) のような標準的な手法は、実際的な知識保存への影響にかかわらず、高分散次元を保っている。
我々は、アクティベーション-グラディエント結合を直接モデル化し、損失関数の2次サロゲートを最小化することによって、サブスペースを選択する知識対応圧縮フレームワークであるFisher-Aligned Subspace Compression (FASC)を紹介する。
FASCはFisher Information Matrixを利用して、しばしば低分散だが高感度な部分空間に存在する事実知識にとって重要な次元を識別する。
本稿では,アクティベーション・グラディエント・カップリングを定量化する汎用診断指標としてDependence Violation Score (\r{ho})を提案する。
Mistral-7B と Llama-3-8B の大規模な実験により、FASC は知識集約型ベンチマーク (MMLU, LAMA) の6-8% の精度を50% の精度で評価できることを示した。
分析の結果, モデルが学習中に事実関連を内部化する場合のみ, 高次層が出現し, 記憶された知識の基本的なシグナルとして機能することが判明した。
関連論文リスト
- Test-Time Unlearning via Sparse Autoencoder [55.4290003355764]
ARIAは,モデルウェイトをそのまま残して,世代が無視関連状態に入る場合にのみ,不要な知識へのアクセスをゲートするテスト時アンラーニング手法である。
ARIAは、思考モデルと命令モデルの両方にわたるウェイトベースベースラインに対する忘れがちなトレードオフを改善します。
論文 参考訳(メタデータ) (2026-09-14T18:58:09Z) - Linear Algebra Foundations of Efficient Attention: A Phase Reversal in Rank Collapse Under SVD Compression [0.0]
線形代数は、現代の人工知能がニューラルネットワークを通じて情報をエンコードし、圧縮し、伝達するために使用する概念の枠組みを提供する。
本稿では、トランスフォーマーに基づく基礎モデル研究の文脈において、これらの技術の使用法を分析する14の別個の研究をまとめる。
論文 参考訳(メタデータ) (2026-09-06T02:27:01Z) - The Asymmetric Harms of LLM Compression [9.45803162325743]
大規模言語モデル(LLM)圧縮は、デプロイメントコストを削減しますが、パープレキシティや精度といった標準的な集約メトリクスは、基礎となる振る舞いシフトを隠蔽します。
本研究では,11個の圧縮法にまたがる3つのLLMを体系的に評価し,圧縮が知識保持,モデル信頼,社会的偏見に及ぼす影響について検討した。
論文 参考訳(メタデータ) (2026-08-20T06:06:14Z) - LACE-SVD: Loss-Aware SVD with Cumulative Error Correction for LLM Compression [4.953709812007795]
LLM圧縮に累積誤差補正を施したLos-Aware SVDフレームワークであるLACE-SVDを提案する。
LACE-SVDはまず、候補層ワイド圧縮比によって誘導されるキャリブレーション負-log-like-hood増加を推定する。
その後、圧縮されたモデルをクローズドフォームのローカル更新で洗練し、残ストリーム出力モジュールに対する伝搬認識補正を導入する。
論文 参考訳(メタデータ) (2026-07-03T07:46:13Z) - Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression [68.1291440835878]
分解は有望な方向として現れ、トランスフォーマーの重み構造に適したコンパクトなパラメータ化を提供する。
既存の研究では、これらの手法を狭い環境で評価しており、大規模展開においてテンソル化が有効かどうかは不明である。
我々は高密度およびMoEのテンソル圧縮を体系的に評価し、経験的解析と理論的解析の両方に基礎を置いた性能トレードオフを確立する。
論文 参考訳(メタデータ) (2026-06-02T10:45:21Z) - Provably Learning Diffusion Models under the Manifold Hypothesis: Collapse and Refine [60.669081685261965]
拡散モデルは、顕著な品質で高次元データを生成する。
彼らのトレーニングがいかに効率的にスコア関数を学習するかは理論的には説明がつかないままである。
我々はこの原理をScore-induced Latent Diffusion (SiLD)として定式化する。
論文 参考訳(メタデータ) (2026-05-16T16:51:10Z) - Learning domain-invariant features through channel-level sparsification for Out-Of Distribution Generalization [19.292845489957077]
アウト・オブ・ディストリビューションの一般化は、画像解析システムを評価するための主要な指標となっている。
ディープラーニングモデルはドメイン固有のコンテキストをキャプチャする傾向があり、非因果的機能への依存関係をショートカットする。
チャネルレベルの因果マスクを用いて特徴空間を強制する手法である階層因果ドロップアウト(HCD)を提案する。
論文 参考訳(メタデータ) (2026-03-26T06:36:42Z) - When Does Sparsity Mitigate the Curse of Depth in LLMs [53.137717161619484]
本研究では,分散伝播の規制として空間空間が機能し,深度利用が向上することを示す。
以上の結果から,大規模な言語モデルにおいて,より効率的な深度スケーリングを実現するための重要なメカニズムとして,スパーシリティが明らかとなった。
論文 参考訳(メタデータ) (2026-03-16T15:04:16Z) - PRAC: Principal-Random Subspace for LLM Activation Compression and Memory-Efficient Training [5.275001711555517]
LLM Activation Compression (PRAC) のためのプライマリランサム部分空間を提案する。
PRACはアクティベーションを2つのコンポーネントに分解する: SVDで取得した主部分空間は支配的な情報を保持するために、そして直交補体からサンプリングされたランダム部分空間は尾部を近似する。
事前トレーニングおよび微調整タスクの実験により、PRACは、無視できる性能劣化と最小計算コストで最大36%のメモリ削減を達成した。
論文 参考訳(メタデータ) (2026-02-26T15:23:34Z) - Effective MoE-based LLM Compression by Exploiting Heterogeneous Inter-Group Experts Routing Frequency and Information Density [30.94369556247692]
Mixture-of-Experts (MoE) ベースのLarge Language Models (LLM) は優れたパフォーマンスを実現している。
複数の専門家ネットワークを格納することによる大量のメモリオーバーヘッドは、実践的なデプロイメントを著しく妨げます。
我々は、不均一なルーティング周波数と情報密度を利用して、MoE圧縮のための効果的なフレームワークRFID-MoEを提案する。
論文 参考訳(メタデータ) (2026-02-10T01:24:28Z) - Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration [56.074760766965085]
PRISMは、モデルの既存の知識との認知的対立度に基づいてデータを調停する動的認識フレームワークを実現する。
この結果から,内部最適化方式に基づくデータ分離が,スケーラブルでロバストなエージェントアライメントに不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-01-12T05:43:20Z) - Fragile Knowledge, Robust Instruction-Following: The Width Pruning Dichotomy in Llama-3.2 [0.0]
我々は,MAW誘導幅の刈り取りが選択フィルタとして機能し,行動アライメントを保ちつつパラメトリック知識を減少させることを示す。
プルーニングされた構成は、エネルギー消費(J/Token)を最大で23%削減するが、単一要求レイテンシで罰則が生じる。
論文 参考訳(メタデータ) (2025-12-27T18:09:57Z) - Decomposed Trust: Exploring Privacy, Adversarial Robustness, Fairness, and Ethics of Low-Rank LLMs [2.1311014724439845]
低ランクの要因化が、プライバシー、敵の堅牢性、公正性、倫理的整合性にどのように影響するかを研究する。
低ランク圧縮は、トレーニングデータのプライバシを保護または改善するが、会話中のPII保護を弱める。
敵の強靭性は一般に保存され、しばしば強化される。
倫理的推論はゼロショット設定では劣化するが、ほとんどショットのプロンプトで部分的に回復する。
論文 参考訳(メタデータ) (2025-11-27T04:40:56Z) - Feedback Alignment Meets Low-Rank Manifolds: A Structured Recipe for Local Learning [7.034739490820967]
バックプロパゲーション(BP)を用いたディープニューラルネットワーク(DNN)のトレーニングは、最先端の精度を実現するが、大域的なエラー伝搬と完全なパラメータ化が必要である。
ダイレクトフィードバックアライメント(DFA)は、メモリ要件の低いローカルで並列化可能な更新を可能にする。
低ランク多様体上で直接動作する構造化局所学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-29T15:03:46Z) - Optimizing Singular Spectrum for Large Language Model Compression [95.7621116637755]
SVDの分解したコンポーネントをデータ駆動で再スケールする新しい圧縮フレームワークであるSoCoを紹介する。
学習可能な特異スペクトルのおかげで、SoCoは重要度スコアに応じて成分を適応的にプーンする。
複数のLLMおよびベンチマークでの実験的な評価は、SoCoがモデル圧縮における最先端の手法を超越していることを示している。
論文 参考訳(メタデータ) (2025-02-20T23:18:39Z) - Continuous Knowledge-Preserving Decomposition with Adaptive Layer Selection for Few-Shot Class-Incremental Learning [73.59672160329296]
CKPD-FSCILは、事前訓練された重量の未使用容量を解放する統合フレームワークである。
本手法は,適応性と知識保持の両面で,最先端の手法より一貫して優れている。
論文 参考訳(メタデータ) (2025-01-09T07:18:48Z) - UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective [85.08718140718707]
UNCompは不確実性を認識したフレームワークで、適応圧縮に使用できる空間パターンを明らかにする。
スパーシティパターンを詳細に分析する不確実性に注目して、UNCompはKVキャッシュサイズを4.74%に削減し、6%のプリフィルスピードアップを実現し、スループットを6.4倍改善した。
論文 参考訳(メタデータ) (2024-10-04T02:32:36Z) - DCID: Deep Canonical Information Decomposition [84.59396326810085]
本稿では,2つの1次元目標変数間で共有される信号の同定について考察する。
そこで本研究では,地中トラスラベルの存在下で使用可能な評価指標であるICMを提案する。
また、共有変数を学習するための単純かつ効果的なアプローチとして、Deep Canonical Information Decomposition (DCID)を提案する。
論文 参考訳(メタデータ) (2023-06-27T16:59:06Z) - Disentanglement via Latent Quantization [60.37109712033694]
本研究では,組織化された潜在空間からの符号化と復号化に向けた帰納的バイアスを構築する。
本稿では,基本データレコーダ (vanilla autoencoder) と潜時再構成 (InfoGAN) 生成モデルの両方に追加することで,このアプローチの広範な適用性を実証する。
論文 参考訳(メタデータ) (2023-05-28T06:30:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。