論文の概要: Not Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2608.04408v1
- Date: Wed, 05 Aug 2026 03:32:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.70341
- Title: Not Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy Distillation
- Title(参考訳): すべての多様性が抑制されるべきではない: オンライン蒸留における事実上の回復可能性
- Authors: De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma,
- Abstract要約: 我々は,この決定を反実的回復性として定式化し,予算に整合した教師継続とロールバックのブランチを通じて各エラー状態を再現する。
凍結評価全体では、リカバリ性を考慮した制御が最強の記録性能を達成し、ホールドアウトのAIME2025で0.578の成功を収めた。
以上の結果から,OPDの選択的監督のための結果ベース決定変数としての回復可能性が確認された。
- 参考スコア(独自算出の注目度): 2.038560872025072
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) supervises student-visited trajectories, yet divergence-based rules cannot determine whether an erroneous prefix remains correctable. We formulate this decision as counterfactual recoverability and replay each error state through budget-matched teacher-continuation and rollback branches. Based on their relative success, states are categorized as recoverable, irreversible-but-avoidable, or ambiguous, and these labels guide whether training retains, rolls back, or conventionally supervises the corresponding trajectory. On AIME branch diagnostics, the mean continuation-minus-rollback effect is 0.185 for recoverable states and -1.000 for irreversible-but-avoidable states, demonstrating opposite intervention preferences. A branch-derived recoverability proxy achieves an AUC of 1.000, substantially outperforming divergence alone at 0.392. Across frozen evaluations, recoverability-aware control achieves the strongest recorded performance, reaching 0.578 success on held-out AIME2025 compared with 0.517 for the best baseline. It also improves AIME2024-2025 average@32 from 0.2656 to 0.3125 and GPQA-Diamond average@32 from 0.2702 to 0.3070. Component ablations further show that retaining teacher-correctable prefixes provides the largest individual contribution. These findings establish recoverability as an outcome-grounded decision variable for selective supervision in OPD.
- Abstract(参考訳): オンライン蒸留(OPD)は、学生が視認する軌跡を監督するが、分岐に基づく規則では、誤った接頭辞が修正可能であるかどうかを判断できない。
我々は,この決定を反実的回復性として定式化し,予算に整合した教師継続とロールバックのブランチを通じて各エラー状態を再現する。
比較的の成功に基づいて、状態は回復可能、可逆的、不可逆的、曖昧と分類され、これらのラベルはトレーニングが維持されるか、ロールバックされるか、または通常、対応する軌道を監督するかをガイドする。
AIMEブランチの診断では、平均継続-最小ロールバック効果は回復可能な状態が0.185、不可逆な状態が-1.000であり、反対の介入傾向を示す。
ブランチ由来のリカバリビリティプロキシは、AUCが1.000であり、0.392でばらつきを著しく上回っている。
凍結評価全体では、回復性を考慮した制御が最強の記録性能を達成し、最良ベースラインの0.517と比較してホールドアウトのAIME2025で0.578に到達した。
AIME2024-2025 average@32を0.2656から0.3125に改善し、GPQA-Diamond average@32を0.2702から0.3070に改善した。
コンポーネントの短縮により、教師が修正可能な接頭辞を保持すれば、最大の個人貢献が得られます。
以上の結果から,OPDの選択的監督のための結果ベース決定変数としての回復可能性が確認された。
関連論文リスト
- Cross-Fitted Residual Utility for Primary-Preserving Cognitive Decision Correction in Automatic Modulation Classification [1.547549252134621]
本稿では,クロスフィット型残効ユーティリティとプライマリ保存型認知決定ポリシーを用いて,推論後の問題について検討する。
構造化されたkan-Fourier分類器はデフォルトの確率を提供し、ニューラルおよび非ニューラル候補は観測可能な証拠を提供する。
RMLA、RMLB、HISARでは、完全なシステムは全体の精度を63.632%から66.332%、65.161%から66.168%、77.769%から79.867%に改善している。
論文 参考訳(メタデータ) (2026-08-03T11:07:37Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Consistent Evidence, Robust Recognition: Faithful Attribution Regularization under Geometric Transformations [42.90321348046055]
画像領域のサブモジュール探索に基づくアノテーションのない属性正規化フレームワークを提案する。
候補部分集合がモデル出力にどのように影響するかを測定することで、探索は、コンパクトでクラス識別的な証拠を探索由来の監督として抽出する。
ImageNet-100の実験結果から,VT-B/16の属性安定性,挿入性,削除性は0.28ポイントの精度低下で大幅に向上することがわかった。
論文 参考訳(メタデータ) (2026-07-26T20:41:38Z) - From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth [0.0]
RouteCastはモデル生成型戦略ルートの仕組みをインスタンス化する。
暫定予測が作成され、後の結果で予測が評価される。
将来的な校正、因果決定の改善、経路分割の優位性、ドメイン間の妥当性は確立していない。
論文 参考訳(メタデータ) (2026-07-13T00:36:48Z) - SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions [17.763106379903228]
物理ロボット上での強化学習エージェントの訓練は、転倒によってプラットフォームが損傷し、シミュレータのリセットのように解除できないため、すべての転倒をコストがかかる。
標準緩和ハンドコントロールは、設計者が指定した安全領域を離れるたびに、別の回復ポリシーに制御する。
我々は、近位政策最適化(PPO)のドロップイン修正により、このバイアスに対処する。
我々のアルゴリズムは、標準的なPPOよりも、HalfCheetah、Ant、Unitree Go1上の233x、48x、26xの要素でトレーニング時間の低下を減らす。
論文 参考訳(メタデータ) (2026-07-09T20:41:45Z) - HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation [50.53459634301361]
HEROは、次の環境観測を局所的に整列したフィードバックとして利用する、後向きの自己蒸留フレームワークである。
HEROはタスク成功を改善し、環境フィードバックのみの自己蒸留とGRPOに対する不要なターンを減らす。
論文 参考訳(メタデータ) (2026-06-10T01:35:34Z) - Not All Flips Are Conformity: Decomposing Stance Convergence in Multi-Agent LLM Debate [5.650336594658653]
従来の解答フリップは, 自発的不安定性, 姿勢による適合性, 推論による説得の3つのメカニズムを混同している。
我々の3ソース分解フレームワークは、制御された対策条件によってそれぞれを分離する。
論文 参考訳(メタデータ) (2026-05-30T17:41:11Z) - When Does Adaptive Guidance Help? Belief-Aware Privileged Distillation for Autonomous Driving Under Partial Observability [0.0]
Guided Soft Actor-Critic (GSAC)は、特権のあるフルステートの教師から、自律運転のための部分観察学生に知識を蒸留する。
本稿では,Belief-Aware GSAC(BAGSAC)について述べる。
論文 参考訳(メタデータ) (2026-05-24T04:41:30Z) - When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning [45.79647925282674]
On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-05-20T18:14:03Z) - Trajectory-Aware Eligibility Traces for Off-Policy Reinforcement
Learning [44.50394347326546]
多段階リターンからのオフ政治学習は、サンプル効率の強化学習に不可欠である。
オフ政治バイアスは、決定ごとに修正されるが、トレースが完全にカットされると、その効果は逆転できない。
本稿では,多段階演算子を提案する。
論文 参考訳(メタデータ) (2023-01-26T18:57:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。