論文の概要: CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield
- arxiv url: http://arxiv.org/abs/2606.31796v1
- Date: Tue, 30 Jun 2026 15:14:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.280572
- Title: CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield
- Title(参考訳): CHERRY: Recurrent Representational Yiveld による階層的エキスパートの圧縮
- Abstract要約: 計算効率のよい言語モデルを学習するための3つの手法について検討する。
SGTはセマンティックペイロードを持つ出力トークンの15%を監督する。
リカレントリカバリによる 深度圧縮
韓国の基盤モデルであるCHERRY-1.8Bでこれらの手法を検証する。
- 参考スコア(独自算出の注目度): 1.2203679037551938
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study three complementary techniques for training compute-efficient language models. (1) Selective supervision and per-token efficiency. Selective Ground Truth Token Training (SGT) concentrates supervision on the ~15% of output tokens that carry semantic payload. Through positive gradient coupling in position-shared transformer weights -- a token-level instance of auxiliary-task transfer -- the remaining 85% of unsupervised tokens still improve substantially, giving a 4.5x per-supervised-token efficiency (at the step-100 eval optimum, ~67% of the full-sequence loss reduction is recovered from 15% of the supervision). We prove that this improvement on unsupervised tokens is guaranteed whenever the gradient coupling coefficient gamma-bar = 0.72 is positive (Theorem 1), and show the effect is a property of natural-language structure: it collapses on shuffled text. (2) Depth compression with recurrent recovery. A 48-layer, 1B-parameter transformer is compressed to 6 layers (227M) by averaging adjacent layers and restored through learned recurrent unrolling. With 34 effective recurrent layers it reaches a held-out loss of 2.934, within measurement noise of a 566M dense model at 2.926 -- a 2.5x reduction in parameters. (3) Fusion of compressed experts. Assembling several compressed models as a Mixture of Efficient Experts (MoEE) with multi-token prediction improves over each single expert at comparable active parameters: a 2-expert MoEE reaches loss 2.789 versus 2.926 for the best single compressed model. We validate these techniques on CHERRY-1.8B, a Korean foundation model whose every trainable parameter derives from our own training runs. We are explicit throughout about the scope of the evidence (one model family, Korean data, loss-based metrics) and about which claims are established versus prospective.
- Abstract(参考訳): 計算効率のよい言語モデルを学習するための3つの補完手法について検討する。
1) 選抜監督及び選抜効率。
SGT(Selective Ground Truth Token Training)は、セマンティックペイロードを持つ出力トークンの15%を監督する。
補助タスク転送のトークンレベルインスタンスである位置共有トランスフォーマー重みの正の勾配結合により、残りの85%の無監督トークンは依然として大幅に改善され、教師付きトークン当たりの効率は4.5倍になる(ステップ100の最適値では、全シーケンス損失の約67%が監督者の15%から回収される)。
非教師付きトークンに対するこの改善は、勾配結合係数 gamma-bar = 0.72 が正であるときに保証されることを証明し(Theorem 1)、その効果が自然言語構造の性質であることを示す。
2)リカレントリカバリによる深さ圧縮
48層1Bパラメータ変圧器は、隣接層を平均化して6層(227M)に圧縮され、学習された再帰的アンロールにより復元される。
34の効果的なリカレント層を持ち、566M密度モデルの2.926での計測ノイズ(パラメータの2.5倍の減少)の中で、2.934の保留損失に達する。
(3)圧縮専門家の融合
複数の圧縮されたモデルをMixture of Efficient Experts (MoEE) として構成し、マルチトークンの予測により、同等のアクティブパラメータで各専門家よりも改善される: 2-expert MoEEは、最高の圧縮されたモデルでは2.789対2.926である。
韓国のCHERRY-1.8Bは、トレーニング可能なパラメータはすべて、我々のトレーニングランから派生した基礎モデルである。
証拠の範囲全体(1つのモデルファミリー、韓国のデータ、損失ベースのメトリクス)と、どのクレームが将来的かどうかについて明確にしています。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - How Much Capacity Does EEG Denoising Need? Ultra-Compact Networks reveal Benchmark Saturation and Metric-Utility Gap [0.0]
深層学習EEG(Deep Learning EEG Denoising Architectures)は、数万から数千万のパラメータに拡張されているが、実験変数としてモデルキャパシティを分離した以前の研究はない。
アーキテクチャ,損失,データ分割,トレーニングレシピの両ギャップに対処し,最小限の深さ分離可能な畳み込みU-Netで1.05Kから40.26Kパラメータまでのチャネル幅を網羅する。
論文 参考訳(メタデータ) (2026-06-07T12:17:25Z) - On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning [63.41902113656453]
長いチェーン・オブ・ソート(CoT)軌道上でのSFT(Supervised Fine-Tuning)は、大きな推論モデルを構築する上で重要なフェーズとなっている。
2つの競合モデルによって生成された2つの検証されたCoT軌道源を用いて比較研究を行う。
textttDeepSeek-R1-0528データ上のSFTは、トレーニング損失を著しく低減するが、一般化性能は著しく低下する。
論文 参考訳(メタデータ) (2026-04-02T07:00:54Z) - Low-Rank Adaptation Reduces Catastrophic Forgetting in Sequential Transformer Encoder Fine-Tuning: Controlled Empirical Evidence and Frozen-Backbone Representation Probes [3.305265383862785]
コンパニオン表現プローブを用いたシーケンシャルトランスフォーマーエンコーダにおけるローランド適応(LoRA)の実証的研究について述べる。
RTE->MRPC->CoLA->SST-2配列上の5つのフルバリデーションBERTベースでは、フル微調整の収率は19.9%+/-で、標準のLoRA(r、クエリ/バリューモジュール)は0.6%+/-1.4%である。
論文 参考訳(メタデータ) (2026-03-29T14:14:36Z) - Separating Constraint Compliance from Semantic Accuracy: A Novel Benchmark for Evaluating Instruction-Following Under Compression [0.0]
大規模言語モデル(LLM)は、即時圧縮の下で劣化した性能を示す。
制約コンプライアンス(CC)と意味精度(SA)を測定するベンチマークであるCompressionDecay Test(CDCT)を導入する。
制約コンプライアンス(97.2%の有病率)における普遍的なU曲線パターンを観察する。
論文 参考訳(メタデータ) (2025-12-02T13:25:48Z) - E$^3$-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models [24.195465096877196]
レイヤープルーニング(Layer pruning)は、モデル圧縮のためのハードウェアフレンドリーなアプローチである。
微分可能なマスク最適化法と、エントロピー対応の適応的知識蒸留戦略である。
96%の精度で オリジナルのモデルから たったの0.8%の低下です
論文 参考訳(メタデータ) (2025-11-21T12:32:01Z) - Unifying Mixture of Experts and Multi-Head Latent Attention for Efficient Language Models [1.7272658301768147]
MoE-MLA-RoPEは、Mixture of Experts (MoE)とMulti-head Latent Attention (MLA)とRotary Position Embeddings (RoPE)を組み合わせた、効率的な言語モデリングのための新しいアーキテクチャの組み合わせである。
提案手法は,3つの重要なイノベーションを通じて,モデル容量と計算効率の基本的なトレードオフに対処する。
論文 参考訳(メタデータ) (2025-08-02T08:33:30Z) - Mixture Compressor for Mixture-of-Experts LLMs Gains More [71.0473038084673]
我々は、Mixture-of-Experts Large Language Model (MoE-LLMs) のためのトレーニング不要なMixture-Compressorを提案する。
我々のMCは静的量子化と動的プルーニングを統合し、より少ない精度でMoE-LLMの極端な圧縮を実現する。
例えば、2.54ビットでは、MCは76.6%を圧縮し、平均精度損失は3.8%である。
論文 参考訳(メタデータ) (2024-10-08T18:09:38Z) - Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning [63.43972993473501]
視覚変換器(ViT)の訓練と推論を高速化するトークン圧縮
しかし、下流タスクに適用した場合、圧縮度はトレーニングと推論の段階で不一致となる。
本稿では,2段階間の圧縮度を分離するモデル演算フレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-13T10:36:43Z) - Sub-token ViT Embedding via Stochastic Resonance Transformers [51.12001699637727]
Vision Transformer (ViT) アーキテクチャは、画像を高次元のベクトル化トークンの集合として表現し、それぞれが長方形の非重複パッチに対応する。
我々は「確率共鳴」にインスパイアされた無訓練法を提案する。
結果として得られるSRT(Stochastic Resonance Transformer)は、元の表現のリッチな意味情報を保持するが、空間的トークン化の粗い効果を軽減し、より微細な空間領域に基盤を置いている。
論文 参考訳(メタデータ) (2023-10-06T01:53:27Z) - (Certified!!) Adversarial Robustness for Free! [116.6052628829344]
逆方向の摂動が0.5の2ノルム以内であることに制約された場合,ImageNetでは71%の精度が証明された。
これらの結果は,モデルパラメータの微調整や再学習を必要とせず,事前学習した拡散モデルと画像分類器のみを用いて得られる。
論文 参考訳(メタデータ) (2022-06-21T17:27:27Z) - ERNIE-SPARSE: Learning Hierarchical Efficient Transformer Through
Regularized Self-Attention [48.697458429460184]
情報ボトルネック感度と異なる注目トポロジ間の不整合の2つの要因がスパース変換器の性能に影響を及ぼす可能性がある。
本稿では,ERNIE-Sparseというモデルを提案する。
i) 局所情報とグローバル情報を逐次統一する階層スパース変換器(HST) と、(ii) 注意トポロジの異なる変換器の距離を最小化する自己注意正規化(SAR) の2つの特徴がある。
論文 参考訳(メタデータ) (2022-03-23T08:47:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。