論文の概要: SPECTRUM: Proximal Spectral Modulation for Looped Self-Distillation
- arxiv url: http://arxiv.org/abs/2610.07237v1
- Date: Mon, 05 Oct 2026 18:43:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.601482
- Title: SPECTRUM: Proximal Spectral Modulation for Looped Self-Distillation
- Title(参考訳): SPECTRUM : ループ型自己蒸留のための近位スペクトル変調
- Abstract要約: Looped Self-Distillationは、モデルが自身の生出力から繰り返し生成し、学習するコード生成のためのフレームワークである。
SPECTRUMは初期モデルの64サンプルの精度の89.9%を維持しており、バニラ自己蒸留では66.4%、サブスペース投射制御では65.5%である。
- 参考スコア(独自算出の注目度): 7.270051853969119
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A model that learns from its own outputs inherits more than their correctness: it inherits which solutions it produces. We formulate Looped Self-Distillation, a self-evolution framework for code generation in which a model repeatedly generates and learns from its own raw outputs, under a fixed information budget, without ongoing external assessment or test-based selection of the generated samples. We identify a consequential separation: correctness can improve while the breadth of correct implementations contracts. We introduce SPECTRUM, which re-estimates loss-sensitive key/value geometry from a fixed reference anchor at each round and converts it into full-rank proximal spectral modulation. All generated completions train a single student, whose subsequent inference requires no intervention. After five rounds of experiments on MBPP, SPECTRUM retains 89.9% of the initial model's 64-sample correct AST richness, compared with 66.4% for Vanilla self-distillation and 65.5% for a subspace-projection control. The advantage persists at matched correct-sample counts. Without further training or recalibration, the resulting student also achieves higher matched-correct richness than Vanilla SD on HumanEval+ and APPS Intro, demonstrating transfer of the diversity benefit. These findings establish correct-solution retention as a complementary objective of recursive self-improvement (RSI) and show that generation-time intervention can improve the solution repertoire retained by subsequent students.
- Abstract(参考訳): 独自のアウトプットから学習するモデルは、その正確性以上のものを継承する。
モデルが繰り返し生成・学習するコード生成のための自己進化フレームワークであるLooped Self-Distillationを、外部評価やテストベースで生成したサンプルの選択を行なわずに、固定情報予算の下で定式化する。
適切な実装の幅が契約されている間、正確さは改善できます。
本稿では、各ラウンドにおける固定基準アンカーから損失感受性キー/値の幾何を再推定し、これをフルランク近位スペクトル変調に変換するSPECTRUMを紹介する。
すべての生成された完了は1人の学生を訓練し、その後の推論は介入を必要としない。
5回のMBPP実験の後、SPECTRUMは初期モデルの64サンプルの精度の89.9%を保ち、バニラ自己蒸留では66.4%、サブスペース投射制御では65.5%である。
利点は一致した正サンプル数で持続する。
さらなるトレーニングや再校正を行わず、結果として得られた学生は、HumanEval+のVanilla SDやAPPS Introよりも高い一致した正当性を達成する。
これらの結果から,再帰的自己改善(RSI)の補完的目的として正解保持が確立され,世代間介入がその後の学生の解決レパートリーを改善できることが示唆された。
関連論文リスト
- Activation-Conditioned Self-Distillation [25.28242612860113]
オンラインの自己蒸留は、モデルを独自の教師として利用し、推論のための密集した監督を提供する。
本稿では, 自己生成トラジェクトリの活性化を対比することにより, ステアリングベクトルを抽出する, アクティベーション・コンディション・セルフ蒸留(ACSD)を導入する。
ACSDは評価手法の中で4つの数学的ベンチマークよりも高い平均精度を達成している。
論文 参考訳(メタデータ) (2026-09-29T18:06:56Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - ISO: An RLVR-Native Optimization Stack [50.40395312897848]
アイソスペクトル最適化(ISO)としてスペクトル継承を運用する
オフラインでは、ISO-Mergerは共有ベーススペシャリストのフレーム変更を単一の固定スペクトルモデルに統合する。
オンラインのISO-Mergerは、AdamWやMuonを含む選択されたベースをフレーム変数に適用し、ベーススペクトルを固定する。
論文 参考訳(メタデータ) (2026-07-21T17:51:36Z) - Correctness-Optimized Residual Activation Lens (CORAL): Transferrable and Calibration-Aware Inference-Time Steering [3.7758197704962835]
重み付きデカイプローブを用いて、モデル内部のアクティベーションから正当性信号を捕捉する正規化時間ステアリング法であるCORALを導入する。
コラルは、常に精度を10%改善し、期待キャリブレーション誤差(ECE)を平均50%改善する。
本結果は,個々のニューロンが不十分な場合,正規化プローブを用いてモデル内部の分散情報を抽出できるという仮説を支持する。
論文 参考訳(メタデータ) (2026-02-05T18:55:56Z) - LaSeR: Reinforcement Learning with Last-Token Self-Rewarding [54.72617309922891]
RLVR(Reinforcement Learning with Verifiable Rewards)は、Large Language Models(LLM)の推論能力を高めるためのコアパラダイムとして登場した。
従来、LLMは2つの異なるプロンプトテンプレートを使用してソリューションと自己検証をシーケンシャルに生成し、効率を大幅に低下させる必要があった。
本稿では,従来のRLVR損失をMSE損失で増大させるアルゴリズムであるLaSeR(Reinforcement Learning with Last-Token Self-Rewarding)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:55:11Z) - AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners [35.730489673985936]
Self-Taughters (STaR)は、自己改善推論言語モデル(LM)のトレーニングパイプラインの不可欠な部分である。
本稿では,2つの適応サンプリング原理を組み込んだ新しいアルゴリズムであるAdaptive STaR(AdaSTaR)を紹介する。
AdaSTaRは全てのインスタンスで最高のテスト精度を達成し、幅広いベースラインリストに対して平均58.6%のトレーニングFLOPを削減している。
論文 参考訳(メタデータ) (2025-05-22T07:24:11Z) - Multi-Granularity Semantic Revision for Large Language Model Distillation [66.03746866578274]
LLM蒸留における多粒性セマンティックリビジョン法を提案する。
シーケンスレベルでは、シーケンス修正と再生戦略を提案する。
トークンレベルでは、蒸留目的関数として、Kulback-Leibler損失を補正する分布適応クリッピングを設計する。
スパンレベルでは、シーケンスのスパン前処理を利用して、スパン内の確率相関を計算し、教師と学生の確率相関を一貫性に制約する。
論文 参考訳(メタデータ) (2024-07-14T03:51:49Z) - Learnable Distribution Calibration for Few-Shot Class-Incremental
Learning [122.2241120474278]
FSCIL(Few-shot class-incremental Learning)は、古いクラス分布を記憶し、少数のトレーニングサンプルから新しいクラス分布を推定するという課題に直面している。
本稿では,これら2つの課題を統一フレームワークを用いて体系的に解決することを目的とした,学習可能な分布校正手法を提案する。
論文 参考訳(メタデータ) (2022-10-01T09:40:26Z) - Training Discrete Deep Generative Models via Gapped Straight-Through
Estimator [72.71398034617607]
再サンプリングのオーバーヘッドを伴わずに分散を低減するため, GST (Gapped Straight-Through) 推定器を提案する。
この推定子は、Straight-Through Gumbel-Softmaxの本質的な性質に着想を得たものである。
実験により,提案したGST推定器は,2つの離散的な深部生成モデリングタスクの強いベースラインと比較して,優れた性能を享受できることが示された。
論文 参考訳(メタデータ) (2022-06-15T01:46:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。