論文の概要: ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2607.13124v1
- Date: Tue, 14 Jul 2026 17:50:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.540956
- Title: ShortOPD: Recovering Pruned LLMs with Short-to-Long On-Policy Distillation
- Title(参考訳): ShortOPD:ショート・ツー・ロングオン・ポリシィ蒸留による精製LCMの回収
- Authors: Qingyu Zhang, Qianhao Yuan, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun, Xiang Li, Ming Xu, Jiarui Li, Xiuyin Zhao,
- Abstract要約: textscpass@$k$は圧縮後にほぼ消滅するが、textscpass@$k$は繰り返しサンプリングの下でほぼ回復する。
回復は、密集したトークンレベルの監督の下で、圧縮されたモデル自身のオン政治状態で訓練すべきである。
我々は,教師が確認した反復接尾辞を検知する短時間のOPDスケジュールであるtextbfshortopdを提案する。
- 参考スコア(独自算出の注目度): 72.54604107217669
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Structured pruning is a hardware-friendly way to compress LLMs, but it is mostly validated on multiple-choice recognition tasks, while the same compressed checkpoints can collapse on the free-form generation that deployment actually requires. Two observations trace this gap. First, greedy \textsc{pass}@$1$ nearly vanishes after compression, yet \textsc{pass}@$k$ recovers substantially under repeated sampling: useful generations are demoted, not erased. Second, the recoverable regime fails mainly through suffix repetition. Recovery should therefore train on the compressed model's own on-policy states with dense token-level supervision, which On-Policy Distillation (OPD) provides by reusing the pre-compression model as a frozen teacher. However, long on-policy rollouts spend early recovery budget on low-information repetitive suffixes, delaying loss descent. To mitigate this waste, we propose \textbf{\shortopd}, a short-to-long OPD schedule that detects teacher-confirmed repetitive suffixes, treats the surviving prefix as each rollout's effective length, and allocates future rollout budgets to the effective lengths the policy can currently use. Across math, code, and open-ended generation, \shortopd\ raises the compressed model's score to about $9\times$ its unrecovered value and $1.6$--$4.4\times$ standard recovery recipes (SFT w/o KD, KD, and SeqKD), and it matches a fixed $8192$-token rollout horizon within two points using a quarter of the training time ($8.5$ vs.\ $35.9$ hours) and $71\%$ fewer rollout tokens. We hope this recipe helps move structured pruning beyond marginal gains on perplexity and multiple-choice benchmarks, a step closer to deployment-ready generation quality.
- Abstract(参考訳): 構造化プルーニング(Structured pruning)は、LCMを圧縮するためのハードウェアフレンドリーな方法であるが、主にマルチ選択認識タスクで検証されている。
2つの観測結果がこのギャップを辿っている。
まず、greedy \textsc{pass}@$1$は圧縮後にほぼ消滅するが、 \textsc{pass}@$k$は繰り返しサンプリングの下で実質的に回復する。
第二に、回復可能な体制は主に接尾辞の繰り返しによって失敗する。
したがって、リカバリは、プレ圧縮モデルを凍結教師として再利用することで、密集したトークンレベルの監督で、圧縮されたモデル自身のオン政治状態をトレーニングする必要がある。
しかし、長期にわたる政策上のロールアウトは、低情報繰り返しサフィックスの早期回復予算に費やし、損失の減少を遅らせている。
この無駄を軽減するために,教師が確認した反復接尾辞を検出し,残余の接頭辞を各ロールアウトの有効長として扱い,現在利用可能な有効長に将来のロールアウト予算を割り当てる,短から長のOPDスケジュールである「textbf{\shortopd」を提案する。
数学、コード、そしてオープンエンド世代全体で、Shashortopdは圧縮されたモデルのスコアを約9\times$その未発見値と1.6$--$4.4\times$標準回復レシピ(SFT w/o KD、KD、SeqKD)に引き上げ、トレーニング時間の4分の1(8.5ドル対8.5ドル)で固定された819ドルのロールアウト地平線と一致する。
$35.9$ hours)、$711\%$少額のロールアウトトークン。
このレシピは、構造的プルーニングが、難易度と複数選択ベンチマークの限界的なゲインを超えて、デプロイメント対応の世代品質に一歩近づくのに役立つことを願っています。
関連論文リスト
- DeepLoop: Depth Scaling for Looped Transformers [91.7922038545625]
ループ変換器は、複数のラウンドにコンパクトな物理ブロックのスタックを適用することで、シーケンシャルな計算をスケールする。
我々は、この密着した深さ効果を、訪問配向係数によって制御された一階の摂動によって定式化する。
結果のメソッド textbfDeepLoop は Post-LN DeepNorm アーキテクチャを保持し、非ロール深度に対して $= (2N)1/2$ と $=(8N)-1/2$ をセットする。
論文 参考訳(メタデータ) (2026-07-15T06:37:05Z) - PARTREP: Learning What to Repeat for Decoder-only LLMs [12.053018926036678]
PartRepは、最も情報性の高いトークンのみを付加する選択的な拡張方法である。
我々は、初期層隠れ状態から高NLLトークンを予測する軽量ゲートを訓練する。
PartRep は KV キャッシュの 59.4% と 79.0% のプレフィル FLOP を使用しながら、フル繰り返しの利益のほとんどを維持している。
論文 参考訳(メタデータ) (2026-07-02T07:07:28Z) - Entropy Gate: Entropy Quenching for Near-Lossless Token Compression in LLM Pipelines [0.0]
LLMパイプラインは、低情報コンテンツにかなりのトークン予算を浪費する。
エントロピー・クエンチングを適用したトークン圧縮フレームワークであるエントロピー・ゲートを紹介する。
フレームワークはステートレスで、モデルに依存しず、OpenAI互換のHTTPプロキシとしてデプロイされる。
論文 参考訳(メタデータ) (2026-06-02T14:55:02Z) - Shortcuts in the Tail: Debiasing via Post-Hoc Spectral Compression of Fine-Tuning Updates [0.47963487028876156]
微調整は、しばしばタスク知識と急激な相関を導入し、不足したグループに体系的な失敗を引き起こす。
W = W_mathrmft - W_mathrmbase$のSVDのテールを切断することで、タスク精度を維持しながら、スプリアスグループギャップを低減できる。
論文 参考訳(メタデータ) (2026-05-29T05:18:25Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - RACER: Retrieval-Augmented Contextual Rapid Speculative Decoding [80.12789199134511]
大規模言語モデル(LLM)における自己回帰デコーディングは、ステップ毎に1つのトークンを生成し、高い推論遅延を引き起こす。
我々は,検索した正確なパターンとロジット駆動の将来の手がかりを統合する軽量でトレーニング不要な $textbfRACER を提案する。
Spec-Bench、HumanEval、MGSM-ZHの実験では、RACERは推論を継続的に加速し、自動回帰デコーディングよりも2倍以上のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-04-16T11:23:55Z) - SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models [25.509962883211]
大きな推論モデル(LRM)は、チェーン・オブ・ソート(CoT)推論プロセスで線形に成長するため、重要なキー値(KV)キャッシュのオーバーヘッドがかかることが多い。
粗い文レベルのシーケンスを除去するKV圧縮手法である textbfSkipKV を提案する。
論文 参考訳(メタデータ) (2025-12-08T19:32:06Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z) - WR-ONE2SET: Towards Well-Calibrated Keyphrase Generation [57.11538133231843]
キーワード生成は、入力文書を要約する短いフレーズを自動的に生成することを目的としている。
最近登場したONE2SETパラダイムは、キーフレーズをセットとして生成し、競争性能を達成した。
本稿では, ONE2SET を拡張した WR-ONE2SET を提案する。
論文 参考訳(メタデータ) (2022-11-13T09:56:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。