論文の概要: The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs
- arxiv url: http://arxiv.org/abs/2605.08737v1
- Date: Sat, 09 May 2026 06:48:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.847663
- Title: The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs
- Title(参考訳): ほぼ決定論的構造出力のオンポリシィ蒸留における外挿クリフ
- Authors: Xin Li, Hao Jiang, Annan Wang, Yichi Zhang, Chau Yuen,
- Abstract要約: ListOPDは、パラメータの5分の1で8B-SFTベースラインで、学生をドメイン内に持ち込む。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔テスト、小さなクリップのクロス予測 — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
- 参考スコア(独自算出の注目度): 52.709361620508595
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) is widely used for LLM post-training. When pushed with a reward-extrapolation coefficient lambda > 1, the student can lift past the teacher in domain, but past a threshold lambda* the same step violates the output contract on structured-output tasks. In a single-position Bernoulli reduction, we derive a closed-form base-relative clip-safety threshold lambda*(p,b,c) determined by three measurable quantities: the teacher modal probability, the warm-start mass, and the importance-sampling clip strength. Above lambda*, the extrapolated fixed point exits the clip-safe region, changing training from format-preserving to format-collapsing. We extend the rule to calibrated K-ary listwise JSON tasks where a single binding equivalence class dominates the output contract and SFT retains parse headroom. On Amazon Fashion, three pre-registered tests--a fine-grid cliff interval, a budget-extension test, and a small-clip cross-prediction--fall within their locked prediction windows, with the small-clip value matching the closed-form prediction below grid resolution. Operating just below lambda*, ListOPD brings a 1.7B Qwen3 student to in-domain parity with an 8B-SFT baseline at one-fifth the parameters. The gain is driven primarily by format adherence: NDCG@1 on parsed outputs remains flat across lambda, while parse validity sharply changes at the predicted boundary. The cliff diagnostic is rubric-independent, whereas the parity claim uses a Gemini-graded rubric and inherits that evaluator's exposure.
- Abstract(参考訳): オンライン蒸留(OPD)はLLM後訓練に広く用いられている。
reward-extrapolation coefficient lambda > 1でプッシュされると、学生はドメイン内の教師を追い越すことができるが、しきい値のラムダ*を過ぎると、構造化出力タスクの出力契約に違反する。
単座ベルヌーイ還元では、教師のモーダル確率、ウォームスタート質量、重要サンプリングクリップ強度の3つの測定可能な量で決定される閉形式のベース相対クリップセーフティしきい値lambda*(p,b,c)を導出する。
ラムダ*の上に、外挿された固定点がクリップセーフな領域を終了し、フォーマット保存からフォーマットラップングへのトレーニングを変更する。
単一バインディング等価クラスが出力契約を支配し、SFTがパースヘッドルームを保持している場合、K-aryリストワイズJSONタスクのキャリブレーションにルールを拡張します。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔、予算拡張テスト、小さなクリップのクロスプレディション — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
lambda*のすぐ下に運用されているListOPDは、1.7B Qwen3の学生を8B-SFTのベースラインをパラメータの5分の1でドメイン内のパリティにもたらす。
NDCG@1 on parsed outputs are flat across lambda, while parse correctly change at the prediction boundary。
崖の診断はルーブリックに依存しないが、パリティの主張はジェミニグレードのルーブリックを使用し、その評価器の露出を継承する。
関連論文リスト
- KL for a KL: On-Policy Distillation with Control Variate Baseline [13.281263788199219]
On-Policy Distillation (OPD) は、大規模言語モデルのトレーニング後の主要なパラダイムとして登場した。
本稿では,OPDを政策段階RLとするvOPDを提案する。
VOPDはバニラOPDより一貫して優れており,最も高価な全語彙ベースラインと一致している。
論文 参考訳(メタデータ) (2026-05-08T15:24:51Z) - Two Calls, Two Moments, and the Vote-Accuracy Curve of Repeated LLM Inference [4.28787537081191]
条件-i.d.呼び出しの繰り返しLLM推論における二項正当性層について検討した。
固定された多数決投票の予算は、鋭い分布のない2つの呼び出し間隔を持つ。
QNLI と QQP に対する LLM の呼出実験により, 投射した2発呼領域に3発と5発の発声アキュラシーが含まれていることが示された。
論文 参考訳(メタデータ) (2026-05-05T05:40:09Z) - When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning [60.714416943748866]
シングルストリームの自己回帰インターフェースでは、同じトークンがモデル状態を更新し、不可逆的な公約を構成する。
そこで我々は,Side-by-Side (SxS) Interleaved Reasoningを導入する。
論文 参考訳(メタデータ) (2026-05-05T02:59:58Z) - Posterior Augmented Flow Matching [64.1559809786948]
後拡張フローマッチング(PAFM)はフローマッチング(FM)の一般化である
PAFMは、異なるモデルスケールで最大3.4FID50KでFMよりも改善されていることを示す。
論文 参考訳(メタデータ) (2026-05-01T17:59:59Z) - PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners [9.324642081509756]
大規模言語モデル(LLM)推論には、モデル自身のテスト時間状態とトークンレベルの情報の両方に整合した監視が必要である。
近年の独占型自己蒸留は,同じモデルによる学生のロールアウトを,検証済みのソリューションコンテキスト下で評価することによって中等地を探索している。
ロールアウト-参照重なりに応じて検証された解を隠蔽し、エントロピー-ミスマッチトークンのスパースセットに小さなエネルギー空間を適用したPAINTを提案する。
論文 参考訳(メタデータ) (2026-04-29T11:56:07Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - Conformal Tradeoffs: Guarantees Beyond Coverage [0.02648566468224904]
配置されたコンフォーマル予測器は、有限操作ウィンドウ上で稼働する長期間の意思決定基盤である。
マージのカバレッジは、デプロイメントに直面する量を特定しません。
私たちは、範囲を超えて運用の認証と計画のためのフレームワークを提供しています。
論文 参考訳(メタデータ) (2026-02-20T07:58:25Z) - Ensemble Threshold Calibration for Stable Sensitivity Control [0.0]
本稿では,数千万組の幾何対もの幾何に対して,過度に分散した正確なリコールを実現するエンド・ツー・エンドのフレームワークを提案する。
我々のアプローチは、小さなエラーで常にリコールターゲットにヒットし、他のキャリブレーションと比較して冗長な検証を減らし、単一のTPU v3コア上でエンドツーエンドで実行します。
論文 参考訳(メタデータ) (2025-10-02T15:22:28Z) - On the Practicality of Differential Privacy in Federated Learning by
Tuning Iteration Times [51.61278695776151]
フェデレートラーニング(FL)は、分散クライアント間で機械学習モデルを協調的にトレーニングする際のプライバシ保護でよく知られている。
最近の研究では、naive flは勾配リーク攻撃の影響を受けやすいことが指摘されている。
ディファレンシャルプライバシ(dp)は、勾配漏洩攻撃を防御するための有望な対策として現れる。
論文 参考訳(メタデータ) (2021-01-11T19:43:12Z) - Sparse Feature Selection Makes Batch Reinforcement Learning More Sample
Efficient [62.24615324523435]
本稿では,スパース線形関数近似を用いた高次元バッチ強化学習(RL)の統計的解析を行う。
候補となる機能が多数存在する場合,提案手法がバッチRLをより効率的にサンプリングできるという事実に光を当てる。
論文 参考訳(メタデータ) (2020-11-08T16:48:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。