論文の概要: Outcome-Confounded Local Supervision in On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2607.23731v1
- Date: Sun, 26 Jul 2026 16:03:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.212886
- Title: Outcome-Confounded Local Supervision in On-Policy Distillation
- Title(参考訳): オンライン蒸留におけるアウトカム・コンファレントローカルスーパービジョン
- Abstract要約: オンライン蒸留は生徒を自身の軌道で訓練し、教師は生徒が訪問する接頭辞に密集したトークンレベルを供給している。
いずれの読解も、完成した軌跡の結果によって構築されていることを示す。
最終回答の正しさを両立させた結果解決診断法を提案する。
- 参考スコア(独自算出の注目度): 0.5937989874256571
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) trains a student on its own trajectories while a teacher supplies dense token-level likelihoods at student-visited prefixes. These likelihoods are often read locally: agreement appears safe to imitate, whereas disagreement appears to identify an error. We show that both readings are confounded by the outcome of the completed trajectory. We introduce an outcome-resolved diagnostic that crosses pointwise teacher-student divergence with final-answer correctness, separating safe imitation, productive divergence, harmful divergence, and agreement-on-failure. In an eight-seed mathematical-reasoning study with a Qwen3-8B student and Qwen3-32B teacher, agreement-on-failure constitutes 67.84% of pooled response-token mass; with a Qwen2.5-7B/32B pair it remains 67.68%. The result persists across threshold, sequence-level, format, and truncation audits. Even on prompts that the Qwen3 teacher solves in all four independent attempts, student accuracy rises to 86.91% but agreement-on-failure remains 14.76%. We then run three matched training probes that use the available signals to imitate, mask, or contrast whole trajectories; none consistently reduces agreement-on-failure. The result points to a localization limitation: local divergence paired with a trajectory-level outcome does not identify where a failed trajectory became unrecoverable. Addressing this limitation requires additional positional information, such as process labels, teacher continuations from student prefixes, or token-level alignment across rollouts. Our contribution is therefore diagnostic rather than a new training method.
- Abstract(参考訳): オンライン蒸留(OPD)は生徒を自身の軌道で訓練し、教師は学生が訪問する接頭辞に密集したトークンレベルを供給している。
これらの可能性はしばしばローカルで読まれる:合意は模倣するために安全であるように見えるが、不一致は誤りを識別しているように見える。
いずれの読解も、完成した軌跡の結果によって構築されていることを示す。
本稿では,教師と学生の相違を最終回答の正しさと交差させ,安全な模倣,生産的な相違,有害な相違,合意の相違を分離する結果解決診断手法を提案する。
Qwen3-8Bの学生とQwen3-32Bの教師による8シードの数学的推論研究では、プールされた応答トーケン質量の67.84%を占めており、Qwen2.5-7B/32B対は67.68%である。
その結果はしきい値、シーケンスレベル、フォーマット、トランケーション監査にまたがって持続する。
Qwen3の教師が4つの独立した試みを全て解決したと示唆しても、学生の正確さは86.91%まで上昇するが、合意は14.76%にとどまる。
次に、利用可能な信号を使って軌道全体を模倣、マスク、コントラストする3つのマッチしたトレーニングプローブを実行します。
軌道レベルの結果と組み合わせた局所的な発散は、軌道が失敗した場所を特定できない。
この制限に対処するには、プロセスラベル、学生プレフィックスからの教師継続、ロールアウト間のトークンレベルのアライメントといった追加の位置情報が必要である。
したがって、我々の貢献は、新しい訓練方法ではなく診断である。
関連論文リスト
- A Token-Level Analysis of Sampled-Token Reverse-KL On-Policy Distillation [59.43605629311855]
学生ログに対する逆KLのトーケンK2推定器の勾配を解析した。
そこで我々は,SuReを1つの経験的インスタンス化として,K2推定器で訓練した逆KL OPDの勾配レベル評価を行った。
論文 参考訳(メタデータ) (2026-08-26T11:14:42Z) - Mismatch Matters: On-Policy Distillation Beyond Token Agreement [27.396104103072844]
ミスマッチトークンは,主に学生不足トークンと学生不足トークンの2種類に分類される。
そこで本研究では,有界ヘリンジャー成形法を応用し,最も重大なサンプル過剰を抑えるためのTIDEと,欠陥のある確率質量を復元するための分析教師の上位K$インジェクションを提案する。
論文 参考訳(メタデータ) (2026-08-10T16:53:14Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries [82.41764922522565]
BOUNDは、永続的な探索ドリフトのための短いガイド付き修正選好蒸留フレームワークである。
Trajectory SFT は Bamboogle で 5.6 EM 、BrowseComp-Plus で 4.8 の精度で上回っている。
論文 参考訳(メタデータ) (2026-08-09T15:32:16Z) - Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning [22.776663901175663]
本稿では,一貫したターンアライメントプロトコルを備えたトラジェクトリ相対的ヒンドサイト蒸留フレームワークであるTRIALを紹介する。
各決定ターンに対して、TRIALは、その決定が実現した結果の結果を抽出し、通常および後向きの文脈下で同じ反応を評価する。
WebShopとALFWorldの異なるバックボーンによる実験では、TRIALは、バックボーン、環境、評価指標の8つの組み合わせでGRPOを上回っている。
論文 参考訳(メタデータ) (2026-08-07T16:12:58Z) - Correcting What You Cannot See: Credit Assignment for Perception Distillation in Multimodal Reasoners [34.39191083253229]
認識障害を識別するラベルフリー手法であるtextbfPerception-Correction Distillation (PCD) を導入する。
我々はベイズ証拠の組み合わせを通じてこのルールを動機付け、乗法がどちらの証人もいないときに消える唯一の正規化された双線型ゲートであることを示す。
論文 参考訳(メタデータ) (2026-07-30T15:03:55Z) - Pass the Baton: Trajectory-Relayed On-Policy Distillation [23.50689651536186]
オンライン蒸留は、学生自身の軌道におけるトークンレベルの監督を基礎としているが、プレフィックスの失敗に悩まされている。
Relay On-Policy Distillation (Relay-OPD)において、失敗プレフィックス上の教師-学生継続非対称性を特定し、ラベルなしハンドオフトリガに変換する。
トレーニング中、Relay-OPDは、教師が検出されたトリガーポイントを一時的に引き継ぎ、教師の足を生成し、その後、生徒が再開し、その結果の軌道に最適化することで、リレーの軌跡を構築する。
論文 参考訳(メタデータ) (2026-07-28T17:59:46Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Geometric Self-Distillation for Reasoning Generalization [12.38444431260744]
オンライン蒸留は、大規模言語モデルの訓練後の実践的なレシピである。
特権的内容の自己蒸留では、教師と学生は同じプレフィックスで条件付けられた同じモデルである。
我々は,このドリフトを学生の予測行動の運動として扱う幾何学的自己蒸留の目的であるGeoSDを紹介する。
論文 参考訳(メタデータ) (2026-07-07T23:16:19Z) - Benchmarking Federated Learning and Knowledge Distillation for Point Cloud Classification [5.584060970507507]
本稿では,3次元点雲分類のための連成学習(FL)と知識蒸留(KD)を併用して評価する。
13のFLアルゴリズムと10のKD目標(130対のクロスプロダクト)を504のトレーニング実行に当てはめ、ModelNet40と臨床クラニオシノスタシスデータセットで評価されている。
論文 参考訳(メタデータ) (2026-06-30T20:12:27Z) - Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning [12.363923974156636]
検証可能な報酬からの強化学習は、ロールアウト毎に1つのスカラーを割り当てる。
オンラインの自己蒸留は、特権情報に基づいて同じモデルを教師として振る舞うことでこの問題に対処する。
本研究では,教師がピアロールアウトに成功したことを条件に,HSD(Hindsight Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-06-14T03:37:27Z) - Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories [0.0]
LLMベースのコーディングエージェントは、時には自身の推論で問題を認識し、いずれにせよ前進する。
我々はClaude Sonnet 4.6のジャッジを構築し、完全なトラジェクトリとフラグがパターンの発生する場所にまたがる。
Qwen3.5-35B-A3Bのバックボーンを用いて44個の終端ベンチ2軌道上で評価を行った。
論文 参考訳(メタデータ) (2026-06-05T22:52:16Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance [10.04930078540686]
On-Policy Distillation(英語版)は、教師の監督のもと、自身の方針からサンプリングされた軌道上の学生モデルを訓練することにより、大きな言語モデル推論を改善する。
この「軌跡サンプリング型だがトークン学習型」機構は,教師の軌跡に対する生徒の軌跡を確実に橋渡しできないことを示す。
提案するトラジェクティブ・アウェアPDは,近未来のトラジェクトリ情報を用いて,現実の発散状態を識別し,将来的なトークン間でガイダンスを配布する。
論文 参考訳(メタデータ) (2026-05-29T19:32:07Z) - Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation [81.10000755917712]
オンライン蒸留は,教師からのトークンレベルのフィードバックを用いて,学生モデルを自作の軌道上で訓練することにより,推論能力を伝達する。
生徒が生成した接頭辞が長くなるにつれて、教師の次点の分布は自信を減らし、差別性が低下する。
SFDを緩和するため, textbfLookahead Group Reward (ours) を導入する。
論文 参考訳(メタデータ) (2026-05-29T04:39:20Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z) - GATES: Self-Distillation under Privileged Context with Consensus Gating [89.62339954332248]
我々は、監督が信頼できない環境で自己蒸留を研究する。
非対称な文脈で回答する文書に焦点をあてる。
複数の文書ベース推論トレースをサンプリングすることにより、教師のコンセンサスからオンラインでの監督を導出する。
論文 参考訳(メタデータ) (2026-02-24T05:56:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。