論文の概要: ALRA: Adaptive Local Relational Alignment for Logit-Based Pre-training Distillation of Autoregressive Language Models
- arxiv url: http://arxiv.org/abs/2609.03355v1
- Date: Thu, 03 Sep 2026 04:26:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.924573
- Title: ALRA: Adaptive Local Relational Alignment for Logit-Based Pre-training Distillation of Autoregressive Language Models
- Title(参考訳): ALRA:自動回帰言語モデルのログベース事前学習蒸留のための適応的局所関係アライメント
- Abstract要約: 地元の選択は学生が考えるトークンを見逃しかねないが、学生のみの選択は訓練の早い段階で不正確なランキングに頼ることができる。
本稿では,学生の提案と教師指導を組み合わせた位置特化フレームワークである適応的局所アライメント(ALRA)を提案する。
ALRAは最強の蒸留ベースラインである0.94点と0.83点を越え、予修蒸留を2.31点と2.91点に改善する。
- 参考スコア(独自算出の注目度): 4.5311655360445515
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Logit-based knowledge distillation for autoregressive language models usually aligns teacher and student next-token distributions over the entire vocabulary. However, this global objective overlooks relative preferences among likely token alternatives. Existing local approaches often select candidate tokens from either the teacher or the student alone. Teacher-only selection can miss tokens that the student considers likely, while student-only selection can rely on an inaccurate ranking early in training. We propose Adaptive Local Relational Alignment (ALRA), a position-specific framework combining student proposals with teacher guidance. At each valid prediction position, the student proposes likely tokens, while the teacher's most probable token is included as an anchor. ALRA adjusts the number of selected tokens according to how broadly the teacher distributes probability within this candidate set relative to the current batch. Adaptive Local Divergence retains the mass-matching term and separately matches the relative token distributions within the selected and remaining vocabulary regions. Unlike the exact full-vocabulary decomposition, it replaces the teacher-mass coefficients of the two conditional terms with unit coefficients, preventing either term from being downweighted solely because its region has low teacher probability. Student-Weighted Pairwise Relational Alignment emphasizes high-probability token pairs with small student probability gaps and gives less weight to unlikely or clearly separated pairs. Experiments on The Pile with randomly initialized 200M- and 500M-parameter students across nine zero-shot benchmarks yield average accuracies of 36.62% and 37.40%. ALRA exceeds the strongest competing distillation baseline by 0.94 and 0.83 percentage points and improves over pre-training without distillation by 2.31 and 2.91 points, respectively.
- Abstract(参考訳): 自己回帰言語モデルのための論理に基づく知識蒸留は、通常、教師と学生が語彙全体を次々に分配する。
しかし、このグローバルな目的は、トークン代替品の相対的な選好を見落としている。
既存のローカルアプローチでは、教師または学生のみから候補トークンを選択することが多い。
教師のみの選択は学生が考えるトークンを見逃しかねないが、学生のみの選択は訓練の早い段階で不正確なランキングに頼ることができる。
本稿では,学生の提案と教師指導を組み合わせた位置特化フレームワークである適応的局所関係アライメント(ALRA)を提案する。
各有効な予測位置において、生徒は潜在的トークンを提案し、教師の最も確率の高いトークンはアンカーとして含められる。
ALRAは、選択されたトークンの数を、教師が現在のバッチに対して、この候補セット内の確率をどの程度広く分配するかに応じて調整する。
Adaptive Local Divergenceは、質量マッチング項を保持し、選択された語彙領域と残りの語彙領域内の相対トークン分布を別々に一致させる。
正確な完全語彙分解とは異なり、2つの条件項の教師質量係数を単位係数に置き換え、その領域が教師確率が低いため、どちらの項も重み付けされない。
学生関係アライメントは、学生の確率ギャップが小さい高確率トークンペアを強調し、不可能または明確に分離されたペアの重量を減らしている。
9つのゼロショットベンチマークでランダムに初期化した200Mと500Mの学生によるパイルの実験では、平均精度は36.62%と37.40%である。
ALRAは最強の蒸留ベースラインを0.94ポイントと0.83ポイントで越え、蒸留なしでの事前トレーニングを2.31ポイントと2.91ポイントで改善する。
関連論文リスト
- Mismatch Matters: On-Policy Distillation Beyond Token Agreement [27.396104103072844]
ミスマッチトークンは,主に学生不足トークンと学生不足トークンの2種類に分類される。
そこで本研究では,有界ヘリンジャー成形法を応用し,最も重大なサンプル過剰を抑えるためのTIDEと,欠陥のある確率質量を復元するための分析教師の上位K$インジェクションを提案する。
論文 参考訳(メタデータ) (2026-08-10T16:53:14Z) - PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation [1.1440940588722308]
On-policy Self-distillation (OPSD) は、特権教師を用いて、自身のロールアウトからサンプリングされたプレフィックスの推論モデルを監督する。
PAST(Privleged Adaptation from Students Trajectories)を紹介する。
PASTは、学生の蒸留プレフィックスをそのまま残しながら、各学生軌跡をOPSD教師に追加の特権情報として扱う。
論文 参考訳(メタデータ) (2026-08-09T14:20:12Z) - Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models [23.382646724389545]
オンライン蒸留(OPD)は、現在の学生政策の軌跡をサンプリングし、学生と教師の次点分布のトークンレベルのばらつきを最小限にする。
本稿では,ローカルで実現可能な教師の訂正のみを蒸留するemphFisher-Projected On-Policy Distillation (FP-OPD)を提案する。
論文 参考訳(メタデータ) (2026-08-02T14:16:14Z) - Prediction-Only Distillation in Linear and Logistic Regression [61.07540493350384]
自己蒸留は典型的には、学生が教師の元々のトレーニングインプットで再訓練されるときに研究される。
我々は、新しいX予測混合方式により、この予測のみの方式でSDを研究する。
二項ロジスティック回帰では、予測混合は教師と純蒸留の両方より優れていることを示す。
論文 参考訳(メタデータ) (2026-07-16T20:45:56Z) - Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions [80.33276868889341]
Z-Rewardは効率的な報酬展開から推論と重大な判断を分離する。
Z-Reward はテキスト・画像の最適化のための識別可能な報酬信号として機能することを示す。
論文 参考訳(メタデータ) (2026-06-08T06:20:12Z) - X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation [19.064775527374618]
クロストケナイザーの知識蒸留により、学生モデルは語彙を持つ教師から学ぶことができる。
ログベースの手法は正しい確率のみを使用し、教師の分布に完全な「暗黒の知識」を欠いている。
本稿では,これらの問題を対象とした2つの相補的損失定式化手法であるX-Tokenを提案する。
論文 参考訳(メタデータ) (2026-05-20T19:59:31Z) - When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning [45.79647925282674]
On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-05-20T18:14:03Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment [82.00769536768509]
Rank-Surprisal Ratioは、推論軌道の適合性を評価するためにアライメントとインフォメーションの両方をキャプチャする単純な計量である。
軌道選択と教師選択の両方において,その実用性を実証する。
論文 参考訳(メタデータ) (2026-01-20T18:58:10Z) - Judging with Confidence: Calibrating Autoraters to Preference Distributions [56.17041629492863]
信頼性の高いオートラッターは、対象の個体群によって定義される嗜好の完全な分布をモデル化することを学ぶ必要がある、と我々は主張する。
異なるデータ条件に合わせた2つの学習方法を提案する。
この結果から, 分布マッチング目的の微調整オートレーダは, 目的の好み分布に整合した有言確率予測を導出することがわかった。
論文 参考訳(メタデータ) (2025-09-30T20:36:41Z) - Selective Classification Can Magnify Disparities Across Groups [89.14499988774985]
選択的分類は平均的精度を向上させることができるが、既存の精度格差を同時に増大させることができる。
禁忌の増大は、一部のグループでのアキュラシーを減少させることもある。
我々は,グループ間で類似のフルカバレッジ精度を実現する分散ロバストモデルを訓練し,選択分類が各グループを均一に改善することを示す。
論文 参考訳(メタデータ) (2020-10-27T08:51:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。