論文の概要: RAZOR: Pruning Replaceable Experts in LLMs
- arxiv url: http://arxiv.org/abs/2609.30465v3
- Date: Tue, 29 Sep 2026 03:48:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.540216
- Title: RAZOR: Pruning Replaceable Experts in LLMs
- Title(参考訳): RAZOR: LLMで代替可能なエキスパートの育成
- Abstract要約: 完全熟練プルーニングはプールを縮小するが、推論モデルの場合、推論能力を損なうことなく専門家を排除しなければならない。
RAZORは,コンセンサス残量から置き換え可能性を評価する学習自由度法である。
RAZORは評価プルーニング法のうち,9つの推論中心タスクで最大マクロ平均を達成した。
- 参考スコア(独自算出の注目度): 19.95776080082138
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mixture-of-experts (MoE) models activate only a few experts per token yet store the entire expert pool. Whole-expert pruning shrinks that pool, but for reasoning models it must remove experts without eroding reasoning ability. Common scores rank experts by routing frequency or output magnitude, which measures isolated contribution rather than deletion damage. What decides the damage is functional replaceability, whether the surviving computation can reproduce what is removed. A large contribution may be replaceable by the remaining mixture, whereas a small one may carry a direction the survivors cannot recover. We introduce RAZOR, a training-free method that scores replaceability from consensus residuals, the deviations of individual expert outputs from their original weighted mixture. Holding the layer input fixed, these residuals yield the exact output change from deleting one expert, including survivor reweighting and the replacement expert promoted by router refill. RAZOR aggregates this change over calibration tokens and prunes to a layerwise budget using forward passes alone, without gradients, subset search, or recovery training. On GLM-4.7-Flash, Qwen3.6-35B-A3B, DeepSeek-V4-Flash-0731, and Hy3 at 25% and 50% expert removal, RAZOR attains the highest macro average over nine reasoning-centered tasks among the evaluated pruning methods in all eight model-budget settings. Against REAP on GLM-4.7-Flash and Qwen3.6-35B-A3B, it gains 2.12-5.59 points on this average and lowers reverse KL in all four comparisons. Retained accuracy is not the whole picture, as pruned Qwen3.6-35B-A3B still shifts in response diversity, formatting, and termination.
- Abstract(参考訳): Mixture-of-experts(MoE)モデルはトークン毎に数名の専門家のみをアクティベートするが、専門家プール全体を格納する。
完全熟練プルーニングはプールを縮小するが、推論モデルの場合、推論能力を損なうことなく専門家を排除しなければならない。
共通のスコアは、削除損傷ではなく、独立したコントリビューションを測定するルーティング周波数または出力マグニチュードによって専門家をランク付けする。
損傷を決定するものは機能的な置換性であり、生き残った計算が削除されたものを再現できるかどうかである。
大きなコントリビューションは残りの混合物で置き換えることができるが、小さなコントリビューションは生存者が回復できない方向を運ぶことができる。
RAZORは,コンセンサス残量から代替可能性,元の重み付け混合物からの個々の専門家出力の偏差をスコアする学習自由手法である。
入力された層を固定すると、これらの残余は、サバイバルリウェイトやルータリフィルによって推進される代替専門家を含む1人の専門家を削除して、正確な出力変更をもたらす。
RAZORはこの変更をキャリブレーショントークンとプルーネを、勾配、サブセットサーチ、リカバリトレーニングなしでフォワードパスのみを使用して階層的に予算に集約する。
GLM-4.7-Flash、Qwen3.6-35B-A3B、DeepSeek-V4-Flash-0731、Hy3の25%と50%のエキスパート除去では、RAZORは8つのモデル予算設定で評価されたプルーニングメソッドの中で、9つの推論中心タスクで最高マクロ平均を達成した。
GLM-4.7-FlashとQwen3.6-35B-A3BのREAPに対して、この平均で2.12-5.59ポイントを獲得し、4つの比較で逆KLを下げる。
プルーニングされたQwen3.6-35B-A3Bは依然として応答の多様性、フォーマッティング、終了が変化している。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration [84.10540890311843]
再学習後、必然的に確率質量をいくつかの報奨モード、即時多様性を消去するモード崩壊に集中させる。
本稿では、内部の確率質量再校正により、高逆低ダイバーシティアダプタを修復するReNFTを提案する。
PickScoreとGenEvalでは、ReNFTはNFTの報酬の98.9%と99.0%を保持し、DreamSim-Divは58.8%、55.0%改善している。
論文 参考訳(メタデータ) (2026-08-30T14:13:50Z) - SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs [18.494055578192015]
本稿では,各プルーニングサイトに線形残差アダプタを挿入するトレーニング不要なポストプルーニング修正フレームワークShift-LLMを紹介する。
各LRAは元の残基の同一性経路を保持し、軽量なアフィン残基補正を追加する。
5つのモデルファミリ,6つの層選択基準,および7つのゼロショットベンチマーク実験により,ShiFT-LLMは深絞りによって失われる精度を常に回復することを示した。
論文 参考訳(メタデータ) (2026-08-25T19:01:58Z) - Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA [0.0]
CARE(Confidence-Adaptive Routing of Experts)を紹介します。
CAREは一致した計算における固定トップkのMoE-LoRAよりも改善され、固定k=4のベースラインと一致し、専門家のアクティベートは少ない。
同じ信頼と不一致の信号は、MSP、エントロピー、マルチパスプロキシに対する分布外検出も改善する。
論文 参考訳(メタデータ) (2026-07-28T17:59:16Z) - When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL [10.399451281089318]
我々はMiniGridをコア評価として,MuJoCoを境界応力試験として用いたPPO訓練剤について検討した。
私たちの監査では、報酬の洪水とセマンティック/API誤解という、2つの主要なワンショット障害モードを見つけました。
本稿では,トレーニング診断と障害モード分類ガイドが報酬関数の修正を対象とする,診断駆動反復改善法を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:57:43Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models [31.422773877490613]
推論 LLM (Reasoning LLMs) はチェーン・オブ・ソート・ジェネレーションを通じて強力な多段階推論を実現する。
RLMの大きなモデルサイズと長いデコードタイムのアウトプットは、リソース制約のある設定にデプロイするのにコストがかかり、不適当である。
我々は、構造化されたプルーニングフレームワークであるRESPを紹介し、プルーニング決定とモデルの推論力学を一致させる。
論文 参考訳(メタデータ) (2025-12-01T20:27:05Z) - MAgICoRe: Multi-Agent, Iterative, Coarse-to-Fine Refinement for Reasoning [80.15393178083607]
大規模言語モデル(LLM)推論は、テストタイムアグリゲーション戦略、すなわち、複数のサンプルを生成し、生成されたサンプル間で投票することで改善することができる。
Refinementは、LLM生成したフィードバックを使ってソリューションの品質を改善する方法を提供する。
本稿では,問題の難易度を,難易度や難易度に分類することで,過度な改善を回避するMagICoReを提案する。
論文 参考訳(メタデータ) (2024-09-18T17:12:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。