論文の概要: CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2607.16955v1
- Date: Sat, 18 Jul 2026 20:16:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.309378
- Title: CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation
- Title(参考訳): CADENCE:カバー・アダプティブオン・ポリシィ蒸留による推論ギャップの閉鎖
- Abstract要約: CADENCEは統合されたフレームワークで、各障害モードに対してターゲットとなる修正を行う。
DRIFTは、学生サンプル軌道上の前方KLと逆KLのサロゲートを混合したトーケンの凸をスケジュールする。
A)COVA、(B)FTB、(B)大域正規化エントロピー参照による高エントロピー位置での勾配集中、(D)LAP、可視性優先正しいロールアウト強化、(E)エントロピー非依存キャリブレーション
- 参考スコア(独自算出の注目度): 2.587194279527956
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy knowledge distillation transfers reasoning from large teachers to compact students, but existing approaches suffer three compounding failure modes: (i) cold-start collapse, where a fresh student assigns near-zero mass to teacher-preferred tokens; (ii) state-agnostic divergence scheduling, where time-only forward/reverse-KL interpolation ignores the student's coverage state; and (iii) binary reward sparsity, where pass/fail signals discard information from partially correct traces. We present CADENCE, a unified framework with a targeted fix for each. Its DRIFT mechanism schedules a per-token convex mixture of forward-KL and reverse-KL surrogate objectives on student-sampled trajectories (per-token surrogates, not sequence-level KL gradient estimators). Six components extend it: (A) COVA, a coverage-adaptive $β$ schedule accelerating the forward-to-reverse transition; (B) FTB, a forking-token boost concentrating gradient at high-entropy positions via a globally-normalized entropy reference; (C) CCD, a dense reward adding numerical-proximity partial credit for incorrect-but-close traces; (D) LAP, brevity-preferential correct-rollout reinforcement; (E) EMR, an entropy-matching calibration regularizer; (F) BSD, a bootstrapped self-distillation phase. On GSM8K and MATH-500 (corrected 512-token protocol, 5 seeds, reported std), CADENCE distills a 0.5B student from a 1.5B teacher to 69.8 $\pm$ 0.5% GSM8K pass@1 (from 48.7% pretrained; 63.2% of the teacher gap closed) and to 72.1 $\pm$ 0.4% with a 3B teacher (76.2% closed), beating the strongest matched-compute label-using baseline (DRIFT+binary reward) by +4.4 $\pm$ 0.7 points. All experiments run on a single Apple Mac Studio (M-series, 64GB unified memory), showing principled distillation reaches strong reasoning quality without datacenter-scale hardware.
- Abstract(参考訳): オンライン知識蒸留は、大規模教師からコンパクトな学生へ推論を伝達するが、既存のアプローチは3つの複合的な失敗モードに苦しむ。
(i)新入生が教師が優先するトークンにほぼゼロ質量を割り当てるコールドスタート崩壊
(二)時間のみ前方/逆KL補間が生徒のカバレッジ状態を無視する状態非依存の分岐スケジューリング
三 パス/フェイル信号が部分的に正しい痕跡から情報を破棄する二分報酬空間
CADENCEは,それぞれを対象とする,統一的なフレームワークである。
DRIFT機構は、学生がサンプリングした軌道(列レベルのKL勾配推定器ではなく、学生ごとの代理)上の前方KLと逆KLのサロゲートの混合凸をスケジュールする。
A) COVA, a coverage-adaptive $β$ schedule accelerating the forward-to-reverse transition; (B) FTB, a forking-token boost concentrating gradient at high-entropy reference through a global-normalized entropy reference; (C) CCD, a dense reward add numerical-proximity partial credit for incorrect-but-close traces; (D) LAP, brevity-preferential correct-rollout reinforcement; (E) EMR, a entropy-matching calibration regularizer; (F) BSD, a bootstrapped self-distill phase。
GSM8K と MATH-500 (修正 512-token Protocol, 5 seed, reported std) では、CADENCE が 1.5B の教師から 0.5B の学生を 69.8 $\pm$ 0.5% GSM8K pass@1 (48.7% の事前訓練、63.2% の教師ギャップ) に蒸留し、72.1 $\pm$ 0.4% に 3B の教師(76.2% のクローズ)と共に 72.1 $\pm$ 0.4% となり、最強のマッチ式ラベル使用ベースライン (DRIFT+binary reward) を +4.4 $\pm$ 0.7 で破った。
すべての実験は単一のApple Mac Studio(Mシリーズ、64GB統一メモリ)で動作し、データセンタースケールのハードウェアを使わずに、蒸留の原理が強い推論品質に達することを示す。
関連論文リスト
- Bounded Adjustment with Reliability-Guided Embedding for Imbalanced Learning with Noisy Labels [7.047239027940408]
本稿では,BARGE (Bounded Adjustment with Reliability-Guided Embeddings) を導入する。
CIFAR-10, CIFAR-100, Tiny ImageNetで, 長期・ステップ不均衡, クリーンラベル, 20%, 40%のランダムな不正ラベル置換条件下で評価を行った。
論文 参考訳(メタデータ) (2026-09-14T21:41:28Z) - Coverage, Not Targeting: A Structural Regime in Multi-Turn Agent Credit Assignment [5.864346468963738]
マルチターンエージェントRLは、ますますターゲット問題としてクレジット割り当てを扱うようになっている。
端末状態検証器は、ターゲットが間違った軸である低V_d方式で深い位置にあることを示す。
論文 参考訳(メタデータ) (2026-09-02T10:37:12Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning [61.67411833252235]
本稿では,プロンプトの隠蔽表現と生成された継続の間に,選択したTransformer層に最適化可能な潜在状態を挿入するGradCuitを紹介する。
5つの命令調整されたバックボーン、3つの推論ベンチマーク、2つの回答フォーマットで、GradCuitの平均精度は64.5%である。
解釈可能性について、トークンレベルの勾配属性は、遅延の影響が推論・接続子トークンに集中していることを明らかにする一方、層解析は、初期から中間のトランスフォーマー層を最も効果的な最適化空間として認識する。
論文 参考訳(メタデータ) (2026-08-03T17:55:24Z) - Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control [0.0]
グループ相対ポリシー最適化は、シミュレートされた四重項連続制御タスクのための小さな言語モデルを微調整することができる。
このベンチマークでは、25Hzの4乗子速度制御のためのQwen-0.5BのバニラGRPO微調整が、自明なゼロ作用に崩壊する。
Crazyflie 2.1 ダイナミックスを用いた高忠実度シミュレーションは、ホバー領域のトレーニングと分配のギャップを表面化する。
論文 参考訳(メタデータ) (2026-07-07T17:14:19Z) - CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning [4.663685189987781]
自己蒸留剤強化学習は、トークンレベルの蒸留損失で軌跡レベルの報酬を増大させる。
一般的なレシピでは、この損失を1つのスカラー、すなわち教師と学生の対数確率のギャップで埋める。
CRAFTは2つの制限に対処する3ピラー・クレジット・アサインメント方式である。
論文 参考訳(メタデータ) (2026-06-28T16:11:47Z) - Deterministic Decisions for High-Stakes AI. A Zero-Egress Pipeline with the Deployability of RAG and the Accuracy of Machine Learning [0.0]
インターベンションバイアス(英語: Intervention bias)は、大規模言語モデル教育アドバイザリーエージェントの以前には確立されていなかった障害モードである。
教師付き政策学習は、このバイアスを排除していることを示す。
LLM-as-judge score is blind to intervention bias, rewarding fluent over-prescription rather than decision quality。
論文 参考訳(メタデータ) (2026-06-28T08:58:17Z) - PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation [17.919178151901573]
大規模言語モデルに対する標準オンライン蒸留 (OPD) は, 実際に厳しい訓練病理に苦しむことを示す。
PowerOPD は、Alpha > 0 でパラメータ化された Box-Cox 電力変換の符号一貫性の報酬であり、対数比は退化 α -> 0 の極限である。
ベンチマーク平均のAvg@8/Pass@8はバニラPDで+6.37/+5.71、ポストホック安定化で+3.01/+3.54、フルボキャブラリPDで+2.59/+8.90となる。
論文 参考訳(メタデータ) (2026-06-15T18:37:51Z) - CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis [49.596677723190886]
スケッチベースの似顔絵合成は、基本的な失敗モードに悩まされる。
アイデンティティと形状の条件は拡散モデルに組み合わされ、地味な肖像画や認識不能な歪みに対して崩壊する。
並列な未汚染拡散経路を通じてこの汚染を明示的に解消する最初の訓練不要な手法であるCaricHarmonyを提案する。
論文 参考訳(メタデータ) (2026-06-11T22:57:59Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Non-Vacuous Certification of Transport MCMC via Oscillation-Controlled Normalizing Flows [3.8549131582427303]
運輸MCMCは、プレコンディションのメトロポリス-ハスティングの提案に正規化の流れを訓練する。
我々は、このようなサンプルに対して、初めて非空白で厳密なスペクトルギャップを定めている。
論文 参考訳(メタデータ) (2026-05-31T07:46:48Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs [52.709361620508595]
ListOPDは、パラメータの5分の1で8B-SFTベースラインで、学生をドメイン内に持ち込む。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔テスト、小さなクリップのクロス予測 — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
論文 参考訳(メタデータ) (2026-05-09T06:48:00Z) - SHIFT: Robust Double Machine Learning for Average Dose-Response Functions under Heavy-Tailed Contamination [0.0]
ShiFT(Self-calibrated Heavy-tail Inlier-Fit with Tempering)は、強力なDML推定器である。
代数的非凸性により最適化されたカーネル局所ウェルシュロス第二段階とクロスフィットニュアンス化を組み合わせる。
1400個のメインスウィープにまたがる、競争力のある最悪の形状のリカバリがある。
論文 参考訳(メタデータ) (2026-04-30T19:51:35Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。