論文の概要: SMOPD: Selective Token-Entropy Masking for Dirty-History Multi-Turn On-Policy Self-Distillation
- arxiv url: http://arxiv.org/abs/2608.14647v1
- Date: Thu, 30 Jul 2026 08:40:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-23 14:54:39.940475
- Title: SMOPD: Selective Token-Entropy Masking for Dirty-History Multi-Turn On-Policy Self-Distillation
- Title(参考訳): SMOPD:多年連続多年連続自己蒸留のための選択的トケンエントロピーマスキング
- Authors: Chenyang Jiang, Changhan Huang,
- Abstract要約: SMOPD(Selective Masking for On-Policy Distillation)は多ターンOPSDにおける損失のみの安定化手法である。
生成した中ターン応答ごとに、SMOPDは学生エントロピーによってトークンの位置をランク付けし、クリッピングされたジェンセン・シャノン蒸留損失から最低エントロピー20%を除去する。
この設計は、粗い軌道結果よりもトークンレベルの不確実性を目標とし、パラメータを追加せず、推論時のオーバーヘッドもゼロである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Dirty-history rollouts make multi-turn on-policy self-distillation (OPSD) brittle: once a student emits an erroneous intermediate reply, later turns are conditioned on that reply, and uniform distillation can spend loss on tokens that carry little corrective signal. We introduce SMOPD (Selective Masking for On-Policy Distillation), a loss-only stabilization method for multi-turn OPSD. For each generated middle-turn reply, SMOPD ranks token positions by student entropy and removes the lowest-entropy 20% from the clipped generalized Jensen-Shannon distillation loss; final-answer and FULL-preservation losses are unchanged. This design targets token-level uncertainty rather than coarse trajectory outcomes, adds no parameters, and has zero inference-time overhead. We compare SMOPD with a correctness-scaling variant that multiplies a common detached reliability proxy using final-answer correctness. On LiC with Qwen3 models, SMOPD improves SHARDED-view accuracy by 1.0-2.5 percentage points in single-seed 1.7B, 4B, and 8B comparisons, and a small 4B multi-seed check shows a +1.7pp mean SHARDED gain over baseline (two-tailed p = 0.022). Adding the outcome scalar is harmful without masking at 1.7B (-4.0pp) and remains scale-dependent when combined with masking (+1.3pp at 4B, neutral at 1.7B, and -0.5pp at 8B). These archived aggregate results suggest that token-level uncertainty is a more reliable stabilization signal than scalar final-answer correctness in this evaluated dirty-history OPSD setting, while leaving causal mechanism tests and broader benchmark validation to future work.
- Abstract(参考訳): 学生が誤った中間応答を発行すると、その後、その応答に条件付けされ、一様蒸留は矯正信号がほとんどないトークンに損失を被る。
SMOPD(Selective Masking for On-Policy Distillation)は多ターンOPSDにおける損失のみの安定化手法である。
生成した中ターン応答ごとに、SMOPDは学生エントロピーによってトークンの位置をランク付けし、クリッピングされたジェンセン・シャノン蒸留損失から最低エントロピー20%を除去し、最終回答とFULL保存損失は変化しない。
この設計は、粗い軌道結果よりもトークンレベルの不確実性を目標とし、パラメータを追加せず、推論時のオーバーヘッドもゼロである。
我々は、SMOPDと、最終回答の正しさを用いて、共通の分離された信頼性プロキシを乗じる正しさスケーリングの変種を比較した。
Qwen3モデルのLiCでは、SMOPDはシングルシード1.7B、4B、8Bの比較でSHARDED-viewの精度を1.0-2.5ポイント改善し、小さな4Bマルチシードチェックではベースラインよりも+1.7ppの平均SHARDEDゲイン(2尾p = 0.022)を示している。
結果スカラーは1.7B(4.0pp)でマスキングすることなく有害であり、マスキング(4Bでは+1.3pp、1.7Bでは中性、8Bでは-0.5pp)と組み合わせるとスケール依存する。
これらのアーカイブされた集計結果から,トークンレベルの不確実性はスカラー最終回答正当性よりも信頼性の高い安定化信号であり,因果メカニズムテストやより広範なベンチマーク検証は今後の作業に委ねられていることが示唆された。
関連論文リスト
- WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - Guidance Breaks the Fitted Operator: A Terminal-Fitted Repair for Classifier-Free Guidance [0.6768558752130311]
インテグレータ分析レンズを用いて拡散フリーガイダンス(CFG)を解析する。
このガイダンスは, 判別部分空間を, 異常な1+wに正確に再シュミレーションすることを示す。
DDIMはもはや装着されておらず、粗いメッシュ上では、sigma_minがゼロになるにつれて、ガイドされた残基が分岐する。
論文 参考訳(メタデータ) (2026-07-08T17:21:51Z) - Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning [36.34371525731833]
Independent Combinatorial Tokens (ICT) フレームワークを導入し、スカラー不確実性からトークンロジットの分布特性へ最適化の焦点を移す。
シャノンと2階レニイエントロピーの両方に基礎を置く我々の理論的分析は、これらのトークンを選択的に更新することが政策集中を調節していることを証明している。
実証的な結果は、Qwen2.5 (0.5B/1.5B/7B)モデル上のユニークなトークンの上位10%だけを更新すると、平均パス@4の改善が4.58%、最大14.9%、GRPO、20エントロピー、STAPOベースラインよりも向上したことを示している。
論文 参考訳(メタデータ) (2026-06-18T04:11:56Z) - The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs [52.709361620508595]
ListOPDは、パラメータの5分の1で8B-SFTベースラインで、学生をドメイン内に持ち込む。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔テスト、小さなクリップのクロス予測 — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
論文 参考訳(メタデータ) (2026-05-09T06:48:00Z) - Low-Rank Adaptation Reduces Catastrophic Forgetting in Sequential Transformer Encoder Fine-Tuning: Controlled Empirical Evidence and Frozen-Backbone Representation Probes [3.305265383862785]
コンパニオン表現プローブを用いたシーケンシャルトランスフォーマーエンコーダにおけるローランド適応(LoRA)の実証的研究について述べる。
RTE->MRPC->CoLA->SST-2配列上の5つのフルバリデーションBERTベースでは、フル微調整の収率は19.9%+/-で、標準のLoRA(r、クエリ/バリューモジュール)は0.6%+/-1.4%である。
論文 参考訳(メタデータ) (2026-03-29T14:14:36Z) - When Does Margin Clamping Affect Training Variance? Dataset-Dependent Effects in Contrastive Forward-Forward Learning [0.0]
コントラストフォワード(Contrastive Forward-Forward, CFF)学習は、教師付きコントラスト目標に対して、ビジョントランスフォーマーを層別に層状化する。
比較損失における正対辺のマージンは、類似度クランプの飽和により適用される。
対数確率の後にマージンを減じる別の定式化が、平均-上-正の還元の下で勾配ニュートラルであることを証明する。
論文 参考訳(メタデータ) (2026-03-01T07:00:38Z) - Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning [17.384089089363382]
既存の手法が見落としている根本原因を同定する。
現在のアプローチでは、グループ内のすべての誤ったロールアウトを同一に扱う。
非対称信頼度を考慮した誤り罰(ACE)を提案する。
論文 参考訳(メタデータ) (2026-02-24T22:46:43Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Adapt in the Wild: Test-Time Entropy Minimization with Sharpness and Feature Regularization [85.50560211492898]
テスト時適応(TTA)は、テストデータが分散シフトが混在している場合、モデルの性能を改善または損なう可能性がある。
これはしばしば、既存のTTAメソッドが現実世界にデプロイされるのを防ぐ重要な障害である。
両面からTTAを安定化させるため,SARと呼ばれる鋭く信頼性の高いエントロピー最小化手法を提案する。
論文 参考訳(メタデータ) (2025-09-05T10:03:00Z) - Robust Fine-tuning of Zero-shot Models via Variance Reduction [56.360865951192324]
微調整ゼロショットモデルの場合、このデシドラトゥムは細調整モデルで、分布内(ID)と分布外(OOD)の両方で優れる。
トレードオフを伴わずに最適なIDとOODの精度を同時に達成できるサンプルワイズアンサンブル手法を提案する。
論文 参考訳(メタデータ) (2024-11-11T13:13:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。