論文の概要: Hán Dān Xué Bù (Mimicry) or Qīng Chū Yú Lán (Mastery)? A Cognitive Perspective on Reasoning Distillation in Large Language Models
- arxiv url: http://arxiv.org/abs/2601.05019v1
- Date: Thu, 08 Jan 2026 15:27:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-09 17:01:53.250783
- Title: Hán Dān Xué Bù (Mimicry) or Qīng Chū Yú Lán (Mastery)? A Cognitive Perspective on Reasoning Distillation in Large Language Models
- Title(参考訳): Hán Dān Xué (Mimicry) または Qīng Chū Yú Lán (Mastery) : 大規模言語モデルにおける共鳴蒸留の認知的視点
- Abstract要約: 本研究は,SFT(Supervised Fine-Tuning)による追跡情報を模倣する学習モデルが,この認知構造を伝達できないことを示す。
分析の結果,SFTは,教師の動的資源配分政策を内部化せずに,言語的推論(動詞)の形式を儀礼的に再現する「カルゴカルト」効果を誘導することが示された。
- 参考スコア(独自算出の注目度): 2.0584844707927226
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent Large Reasoning Models trained via reinforcement learning exhibit a "natural" alignment with human cognitive costs. However, we show that the prevailing paradigm of reasoning distillation -- training student models to mimic these traces via Supervised Fine-Tuning (SFT) -- fails to transmit this cognitive structure. Testing the "Hán Dān Xué Bù" (Superficial Mimicry) hypothesis across 14 models, we find that distillation induces a "Functional Alignment Collapse": while teacher models mirror human difficulty scaling ($\bar{r}=0.64$), distilled students significantly degrade this alignment ($\bar{r}=0.34$), often underperforming their own pre-distillation baselines ("Negative Transfer"). Our analysis suggests that SFT induces a "Cargo Cult" effect, where students ritualistically replicate the linguistic form of reasoning (verbosity) without internalizing the teacher's dynamic resource allocation policy. Consequently, reasoning distillation decouples computational cost from cognitive demand, revealing that human-like cognition is an emergent property of active reinforcement, not passive imitation.
- Abstract(参考訳): 強化学習を通じて訓練された近年の大規模推論モデルは、人間の認知コストと「自然な」整合性を示す。
しかし, 蒸留を推理する一般的なパラダイムである, 学生モデルを用いたスーパービジョンファインチューニング(SFT)によるこれらのトレースの再現が, この認知構造を伝達できないことを示す。
14モデルにまたがって「Hán Dān Xué B'」仮説を検証したところ、蒸留は「Functional Alignment Collapse」を誘導することがわかった: 教師モデルが人間の困難さを反映する(「\bar{r}=0.64$」)一方で、蒸留された学生はこのアライメント(「\bar{r}=0.34$」)を著しく劣化させ、しばしば独自の蒸留前のベースラインを過小評価する(「Negative Transfer」)。
分析の結果,SFTは,教師の動的資源配分政策を内部化せずに,言語的推論(動詞)の形式を儀礼的に再現する「カルゴカルト」効果を誘導することが示された。
その結果、蒸留の推論は計算コストを認知的需要から切り離し、人間の様の認知が能動的強化の創発的な特性であり、受動的模倣ではないことを明らかにした。
関連論文リスト
- Rethinking On-Policy Self-Distillation for Thinking Models [32.29580112160733]
自己蒸留は、言語モデルにおける自己改善のための有望なレシピである。
特権的な自己蒸留は、長い推論トレースに基づいて思考モデルを劣化させることを示す。
我々の診断は、この障害モードを、高エントロピーなフォーク位置での学習に特権を持つ教師のコンテキストがどう影響するかに関連付ける。
論文 参考訳(メタデータ) (2026-07-06T15:01:35Z) - Answer-then-Edit: Reasoning Skeleton Editing for Anti-Distillation with Preserved Utility [13.916452483499185]
蒸留効率を阻害する防御出力を生成するために, 抗蒸留法 (AD) が提案されている。
textbfunderline-textbfunderlineGuided textbfunderlineReasoning textbfunderlineEditing (SGRE)を提案する。
回答段階では、教師モデルはまず、元の推論精度を保ったクリーンな推論トレースを生成する。
編集段階では,スケルトン抽出,スケルトングラフ粗化,スケルトン音声による3段階戦略を導入する。
論文 参考訳(メタデータ) (2026-05-12T04:36:20Z) - A Survey of On-Policy Distillation for Large Language Models [19.95776080082138]
この調査は、大規模言語モデル(LLM)のオン・ポリシィ蒸留に関する最初の包括的概要を提供する。
オンラインのサンプルに対して$f$-divergenceフレームワークを導入し,emphfeedbackシグナル(ログベース,結果ベース,自己プレイ),emphteacherアクセス(ホワイトボックス,ブラックボックス,教師フリー),emphloss最小化(トケンレベル,シーケンスレベル,ハイブリッド)の3つの次元に沿ってランドスケープを整理する。
論文 参考訳(メタデータ) (2026-04-01T08:32:34Z) - Learning from Partial Chain-of-Thought via Truncated-Reasoning Self-Distillation [15.338493974763471]
本稿では,部分的推論トレースから正しい予測を生成するための軽量なポストトレーニング手法であるTrncated-Reasoning Self-Distillation(TRSD)を紹介する。
TRSDは, 様々な推論モデルに適用した場合, 精度のトレードオフをはるかに低減し, 絡み合った推論に対するロバスト性の向上を実証する。
論文 参考訳(メタデータ) (2026-02-27T06:08:22Z) - Probing to Refine: Reinforcement Distillation of LLMs via Explanatory Inversion [84.20493238687187]
単純な模倣を超えて、より深い概念的理解を具現化する新しい枠組みを導入する。
underlinetextitFirst, to address pattern memorization, Explanatory Inversion (EI) generated target explanatory probes'
underlinetextitSecondは、一般化を改善するために、Explainatory GRPO (texttEXGRPO) は、新しいダイアログ構造ユーティリティーボーナスを用いた強化学習アルゴリズムを使用する。
論文 参考訳(メタデータ) (2026-02-26T23:01:46Z) - Long-Chain Reasoning Distillation via Adaptive Prefix Alignment [57.130176131042965]
本稿では,教師のCoTを適応的接頭辞アライメントによる蒸留に活用するフレームワークを提案する。
P-ALIGNは、残りの接尾辞が簡潔かどうかを判断することで、教師生成の推論軌道を適応的に切り離す。
複数の数学的推論ベンチマークの実験では、P-ALIGNはすべてのベースラインを3%以上上回っている。
論文 参考訳(メタデータ) (2026-01-15T04:40:45Z) - Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation [0.0]
本稿では,報酬誘導型データセット蒸留フレームワークAdvDistillを提案する。
我々は,教師からの複数の世代(応答)を各プロンプトに利用し,ルールベースの検証に基づいて報酬を割り当てる。
これらの様々な、通常は分散された報酬は、学生モデルを訓練する際の重みとなる。
論文 参考訳(メタデータ) (2025-06-25T20:07:47Z) - Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions [100.41062461003389]
フラーミング推論は,断片化された知識間の「点の接続」をモデルが支援し,非推論モデルにおいて拡張された推論トレースを生成することを示す。
提案手法を3つのベンチマークで評価し,一貫した改善点を観察する。
論文 参考訳(メタデータ) (2025-06-10T15:51:16Z) - Thinking Out Loud: Do Reasoning Models Know When They're Right? [25.683190106676893]
大規模推論モデル(LRM)は、最近、複雑な推論タスクにおいて印象的な機能を示した。
本研究では,LRMが他のモデル行動とどのように相互作用するかを,言語的信頼度を解析することによって検討する。
推論モデルには、知識境界に対する認識の低下がある可能性がある。
論文 参考訳(メタデータ) (2025-04-09T03:58:19Z) - Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones? [58.80794196076336]
大型言語モデル(LLM)の蒸留は、教師による微調整(SFT)を通して教師モデルの応答を伝達するのが一般的である。
本稿では, 応答と報酬の両方を伝達する新しい蒸留パイプラインを提案する。
本手法は,教師と生徒の両方の反応の固有構造を利用した自己教師機構によって擬似回帰を生成する。
論文 参考訳(メタデータ) (2025-02-26T20:50:11Z) - Avatar Knowledge Distillation: Self-ensemble Teacher Paradigm with
Uncertainty [21.082196680422328]
使い捨て蒸留のための多様な教師モデルを訓練するのは経済的ではない。
我々は,教師の推論アンサンブルモデルである蒸留用Avatarsという新しい概念を導入した。
Avatar Knowledge Distillation AKDは、既存の方法や洗練と根本的に異なる。
論文 参考訳(メタデータ) (2023-05-04T10:43:11Z) - SCOTT: Self-Consistent Chain-of-Thought Distillation [68.40232422158569]
大規模言語モデル(LM)は、チェーン・オブ・シークレット・プロンプトを通じて予測のための自由テキスト論理を生成する。
そこで本研究では,教師モデルから,小規模で自己整合的なCoTモデルを学習するための忠実な知識蒸留法を提案する。
忠実蒸留を確実にするために,教師生成の合理性を用いて,反実的推論目的の学生LMを学習する。
論文 参考訳(メタデータ) (2023-05-03T03:47:00Z) - HomoDistil: Homotopic Task-Agnostic Distillation of Pre-trained
Transformers [49.79405257763856]
本稿では,タスク非依存蒸留に焦点をあてる。
これは、計算コストとメモリフットプリントを小さくして、様々なタスクで簡単に微調整できるコンパクトな事前訓練モデルを生成する。
本稿では, 反復刈り込みによる新規なタスク非依存蒸留法であるHomotopic Distillation (HomoDistil)を提案する。
論文 参考訳(メタデータ) (2023-02-19T17:37:24Z) - On student-teacher deviations in distillation: does it pay to disobey? [54.908344098305804]
知識蒸留は「学生」ネットワークのテスト精度を向上させるために広く用いられている。
教師の確率に合うように訓練されているにもかかわらず、生徒は教師の確率から大きく逸脱するだけでなく、パフォーマンスにおいて教師を上回ることもある。
論文 参考訳(メタデータ) (2023-01-30T14:25:02Z) - Revisiting Self-Distillation [50.29938732233947]
自己蒸留とは、大きなモデル(教師)からよりコンパクトなモデル(生徒)に「知識」を移す手順である。
いくつかの作品では、自給自足の生徒が保持されたデータで教師より優れているという逸話がある。
我々は、自己蒸留がより平坦なミニマムをもたらすことを示すための広範な実験を行い、その結果、より良い一般化をもたらす。
論文 参考訳(メタデータ) (2022-06-17T00:18:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。