論文の概要: When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2609.20511v1
- Date: Thu, 17 Sep 2026 14:53:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:54.33057
- Title: When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
- Title(参考訳): EOSが診断を下すとき: オンデマンド蒸留における長さのインフレの理解
- Abstract要約: 本研究では,この行動の重要な源泉として,初等生と後任教師のエフェターミネーション・トケンミスマッチを同定する。
Qwen3、Llama、Gemmaの2つのモデルは、宣言された停止集合が同一であっても、異なるEOSトークンに停止確率を置くことができる。
機能的に等価なEOSトークンを共有意味停止アクションとして扱いながら,デコード停止セットを単独で調整することは不十分であることを示す。
- 参考スコア(独自算出の注目度): 47.87944000003073
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study length inflation in on-policy distillation (OPD), where student responses can become excessively long and even exhaust the generation budget. We identify \emph{termination-token mismatch} between base students and post-trained teachers as an important source of this behavior. Across Qwen3, Llama, and Gemma, the two models can place their stopping probability on different EOS tokens, even when their declared stopping sets are identical. This mismatch can suppress the student's preferred termination action without reliably transferring the teacher-preferred alternative. We show that aligning the decoding stopping set alone is insufficient, while treating functionally equivalent EOS tokens as a shared semantic stopping action substantially mitigates mismatch-induced length inflation across all three model families. To further understand how termination behavior evolves over training, we study OPD across different K2-Horizon training stages. This stage-wise analysis shows that termination preferences can shift substantially during training, while also revealing a distinct length inflation late in the OPD run that persists beyond termination alignment. Together, these results identify termination mismatch as an important, but not exhaustive, source of OPD length dynamics. We release an implementation incorporating the proposed termination-handling corrections.
- Abstract(参考訳): オンライン蒸留(OPD)において,学生の反応が過度に長くなり,世代予算を浪費することのできる長さインフレーションについて検討した。
本研究では,この行動の重要な源泉として,小学校教員と教員の「emph{termination-token mismatch}」を同定した。
Qwen3、Llama、Gemmaの2つのモデルは、宣言された停止集合が同一であっても、異なるEOSトークンに停止確率を置くことができる。
このミスマッチは、教師が優先する代替手段を確実に転送することなく、生徒の好む終了動作を抑制することができる。
機能的に等価なEOSトークンを共有意味停止作用として扱いながら,デコード停止セットを単独で調整するには不十分であることを示す。
終末行動がトレーニング中にどのように進化するかをさらに理解するために,異なるK2-水平訓練段階にわたるOPDについて検討する。
この段階的な分析は、終端選好がトレーニング中に大きく変化することを示し、同時に、終端選好が終端アライメントを超えて継続するPD実行の後半に異なる長さのインフレーションが現れることを示している。
これらの結果から, 終端ミスマッチは, OPD長ダイナミクスの源泉として重要であるが, 網羅的ではないことが明らかとなった。
提案する終端処理補正を組み込んだ実装をリリースする。
関連論文リスト
- SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning [54.402550664505576]
オンライン蒸留(OPD)は、より強力な教師モデルから短文の学生に推論能力を伝達する有望な方法を提供する。
長文推論モデル SU-01 から短文学習者モデルへの証明推論能力の移譲により,この設定について検討する。
Qwen3, Qwen3.5, Intern-S2, GLM-4.7, Gemma-4を含む同族および異族の両方の実験は、数学的推論において一貫した利得を示している。
論文 参考訳(メタデータ) (2026-08-14T12:57:02Z) - Mismatch Matters: On-Policy Distillation Beyond Token Agreement [27.396104103072844]
ミスマッチトークンは,主に学生不足トークンと学生不足トークンの2種類に分類される。
そこで本研究では,有界ヘリンジャー成形法を応用し,最も重大なサンプル過剰を抑えるためのTIDEと,欠陥のある確率質量を復元するための分析教師の上位K$インジェクションを提案する。
論文 参考訳(メタデータ) (2026-08-10T16:53:14Z) - OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models [39.15861870749305]
OPTD, On-Policy Transition Distillation with consistency-guided Adaptive compression。
これは、数段階の学生自身の軌跡から部分的な状態をサンプリングし、凍結した質問のみの教師を使用して結果に整合した将来の候補者を特定し、現状の信頼でそれらを注文する。
品質効率のトレードオフを継続的に改善し、評価された数ステップのベースラインの中で、全体的な品質に制約のあるAUPを最強に達成します。
論文 参考訳(メタデータ) (2026-08-03T23:09:43Z) - Outcome-Confounded Local Supervision in On-Policy Distillation [0.5937989874256571]
オンライン蒸留は生徒を自身の軌道で訓練し、教師は生徒が訪問する接頭辞に密集したトークンレベルを供給している。
いずれの読解も、完成した軌跡の結果によって構築されていることを示す。
最終回答の正しさを両立させた結果解決診断法を提案する。
論文 参考訳(メタデータ) (2026-07-26T16:03:33Z) - Less is More: Early Stopping Rollout for On-Policy Distillation [39.392596318514244]
早期停止ロールアウト(Early Stopping Rollout, ESR)は, ロールアウト生成を第1応答トークンに限定した簡易かつ効果的な蒸留戦略である。
その結果,ESRはモデルサイズ,家族,タスク,トレーニング体制全体にわたって,フルロールアウトのOPD性能を上回っていることがわかった。
論文 参考訳(メタデータ) (2026-05-26T13:49:37Z) - Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation [28.572361799234784]
生のKL不一致が学習価値の粗いプロキシであることを示す。
我々はこの局所的な互換性をトークンの教育可能性として定式化する。
軽量なトークン配置選択法であるTeachability-Aware OPDを提案する。
論文 参考訳(メタデータ) (2026-05-26T10:56:46Z) - Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning [66.52232008796294]
Prune-OPDはトレーニング予算と監督品質を動的に調整する。
トレーニング時間を37.6%減らし-68.0%削減すると同時に、しばしば改善され、挑戦的なベンチマークのパフォーマンスが向上する。
論文 参考訳(メタデータ) (2026-05-08T14:38:53Z) - TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents [55.27396165691312]
マルチターンエージェント設定におけるバニラOPDの鍵となる制限を,トラジェクトリレベルKL不安定(Trajectory-Level KL Instability)と呼ぶ。
学生に露出する軌道深度を制御し,カリキュラムのスケジュールを段階的に拡張するフレームワークであるTCODを提案する。
4組の生徒と教師のペアによる実験結果から,TCODはKLのエスカレーションを軽減し,トレーニングを通してKLの安定性を高め,バニラPDよりも最大18ポイントのエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2026-04-27T03:38:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。