論文の概要: Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation
- arxiv url: http://arxiv.org/abs/2606.00628v1
- Date: Sat, 30 May 2026 09:03:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.562859
- Title: Robust Reasoning via Dynamic Token Selection for Distribution-Aligned Self-Distillation
- Title(参考訳): 分散型自己蒸留のための動的トークン選択によるロバスト推論
- Authors: Ruiqi Zhang, Lingxiang Wang, Hainan Zhang Zhiming Zheng,
- Abstract要約: 自己蒸留は、モデル自身の分布によくマッチするトレーニングデータとして参照回答を書き換えることで、学習効率を向上させる。
しかし、参照された答えはまた、強いスタイル的バイアスをもたらし、生成モデルは有用な推論パターンを学ぶのではなく、表面の形状を模倣する。
本稿では,DASD(Distributed-Aligned Self-Distillation)を提案する。これは,応答認識参照モデルを用いて候補トークンを生成し,ベースモデルの信頼性に応じて動的にフィルタする。
- 参考スコア(独自算出の注目度): 10.71966126081564
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-distillation improves learning efficiency by rewriting reference answers as training data that better matches the model's own distribution. However, reference answers also introduce strong stylistic biases, causing the generative model to imitate surface forms rather than learn useful reasoning patterns. We observe that the rewriting data contains a large number of high-perplexity (PPL) tokens, coming from two distinct sources: beneficial knowledge-enhancing logical corrections, and harmful stylistic drift induced by reference imitation. Treating all such tokens equally can disrupt the base model's original distribution and degrade performance, especially on difficult reasoning tasks. To address this, we propose Distribution-Aligned Self-Distillation (DASD), which uses an answer-aware reference model to generate candidate tokens and dynamically filters them according to the base model's confidence. DASD preserves tokens that encode useful logical knowledge while suppressing distributionally misaligned style noise. Experiments on math, code, and commonsense reasoning benchmarks show that DASD consistently outperforms competitive baselines, reduces high-PPL tokens, and improves robustness across tasks of varying difficulty.
- Abstract(参考訳): 自己蒸留は、モデル自身の分布によくマッチするトレーニングデータとして参照回答を書き換えることで、学習効率を向上させる。
しかし、参照された答えはまた、強いスタイル的バイアスをもたらし、生成モデルは有用な推論パターンを学ぶのではなく、表面形状を模倣する。
書き換えデータには,有益な知識向上論理補正と参照模倣による有害なスタイリスティックドリフトという,2つの異なる情報源から得られた,多数の高パープレキシティ(PPL)トークンが含まれていることが観察された。
このようなトークンを同じように扱うことは、ベースモデルの本来の分布を妨害し、特に困難な推論タスクにおいてパフォーマンスを低下させる可能性がある。
そこで本研究では,DASD(Distributed-Aligned Self-Distillation)を提案する。このDASDは,応答認識参照モデルを用いて候補トークンを生成し,ベースモデルの信頼性に応じて動的にフィルタする。
DASDは、分布的に不整合なスタイルのノイズを抑えながら、有用な論理的知識を符号化するトークンを保存する。
数学、コード、コモンセンス推論のベンチマークの実験では、DASDは競争ベースラインを一貫して上回り、高いPPLトークンを減らし、様々な困難を伴うタスク間の堅牢性を向上させる。
関連論文リスト
- MixSD: Mixed Contextual Self-Distillation for Knowledge Injection [29.7616760417696]
Supervised Fine-tuning (SFT) は言語モデルに新しい知識を注入するために広く使われている。
このことは、人間や外部システムからの微調整対象が、モデルの自動回帰分布から逸脱するためである、と我々は主張する。
分布整合型知識注入のための簡易な外部教師なし手法であるMixSDを提案する。
論文 参考訳(メタデータ) (2026-05-16T07:57:09Z) - Not all tokens contribute equally to diffusion learning [16.928860227988086]
条件拡散モデルは、推論中に意味的に重要なトークンを無視し、バイアスまたは不完全な世代をもたらす。
本研究では,分布の偏りと整合性の観点から意味指導を改善する統一的なフレームワークである分散型空間整合・アンサンブル型空間整合性(DARE)を提案する。
DAREは一貫してセマンティックアライメントを改善し、既存のアプローチよりも大幅に向上する。
論文 参考訳(メタデータ) (2026-04-08T12:45:21Z) - Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation [25.195244084313114]
CoPeD (Chain-of-Thought Correctness Perception Distillation) は,学生モデルの推論品質の向上を目的としている。
CoPeDは学生モデルに対して、正しい合理性に基づいて回答を予測し、誤ったときに修正するよう推奨する。
論文 参考訳(メタデータ) (2025-09-06T05:33:17Z) - Reinforced Context Order Recovery for Adaptive Reasoning and Planning [23.229513376337607]
現在の因果関係と拡散モデルでは、適応的なトークン生成順序を必要とする問題で難題に遭遇する。
適応型・データ依存型トークン生成順序を抽出する強化学習ベースのフレームワークであるReinforced Context Order Recovery (ReCOR)を提案する。
論文 参考訳(メタデータ) (2025-08-18T16:42:55Z) - Continuous Visual Autoregressive Generation via Score Maximization [69.67438563485887]
本稿では,ベクトル量子化なしで直接視覚的自己回帰生成を可能にする連続VARフレームワークを提案する。
このフレームワークの中で必要なのは、厳密な適切なスコアを選択し、最適化のトレーニング目標として設定することだけです。
論文 参考訳(メタデータ) (2025-05-12T17:58:14Z) - Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability [53.51560766150442]
臨界トークンは推論軌道内の要素であり、誤った結果に大きな影響を及ぼす。
本稿では,これらのトークンをロールアウトサンプリングによって識別する新しいフレームワークを提案する。
クリティカルトークンの識別と置換がモデル精度を大幅に向上させることを示す。
論文 参考訳(メタデータ) (2024-11-29T18:58:22Z) - DIVE: Subgraph Disagreement for Graph Out-of-Distribution Generalization [44.291382840373]
本稿では,グラフ機械学習におけるアウト・オブ・ディストリビューションの一般化の課題に対処する。
従来のグラフ学習アルゴリズムは、この仮定が失敗する現実世界のシナリオで失敗する。
この準最適性能に寄与する主な要因は、ニューラルネットワークの本質的な単純さバイアスである。
論文 参考訳(メタデータ) (2024-08-08T12:08:55Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - Disentanglement via Latent Quantization [60.37109712033694]
本研究では,組織化された潜在空間からの符号化と復号化に向けた帰納的バイアスを構築する。
本稿では,基本データレコーダ (vanilla autoencoder) と潜時再構成 (InfoGAN) 生成モデルの両方に追加することで,このアプローチの広範な適用性を実証する。
論文 参考訳(メタデータ) (2023-05-28T06:30:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。