論文の概要: SCOReD: Student-Aware CoT Optimization for Recommendation Distillation
- arxiv url: http://arxiv.org/abs/2607.05734v2
- Date: Thu, 09 Jul 2026 22:26:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.406156
- Title: SCOReD: Student-Aware CoT Optimization for Recommendation Distillation
- Title(参考訳): SCOReD:レコメンデーション蒸留のための学生用CoT最適化
- Authors: Haz Sameen Shahgir, Yufei Li, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Sandeep Pandey, Luke Simon, Yue Dong, Xi Liu,
- Abstract要約: 推薦領域におけるCoT蒸留は、RLトレーニングの先駆となるが、生の教師の痕跡はこの課題に不適である。
推奨蒸留(SCOReD)のための学生意識型CoT最適化を提案する。
SCOReDは、各教師のトレースを型付きセグメントに解析し、学生のLLMの注意を使って各セグメントの重要性を評価する。
- 参考スコア(独自算出の注目度): 8.97207702089753
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Chain-of-thought (CoT) distillation in the recommendation domain is a necessary precursor to RL training, but raw teacher traces are ill-suited to this task. Large teachers approach the recommendation task with unusually high reasoning uncertainty, repeatedly rechecking their answers without revising them; supervised fine-tuning on such traces produces verbose students that never revise their initial guess. Furthermore, due to the novelty of the recommendation domain, the teacher's reasoning traces are highly out-of-distribution for the small student LLM. We propose Student-Aware CoT Optimization for Recommendation Distillation (SCOReD), a CoT optimization framework tailored to recommendation that first parses each teacher trace into typed segments and uses the student LLM's attention to score the importance of each segment. Then SCOReD dynamically selects a per-segment edit (KEEP / REWRITE / FUSE / PRUNE) based on the output length and comparative log probability lift of the answer given the edit as per the student. Therefore, SCOReD prunes redundant sections of the reasoning trace while preserving information-dense sections and adapts raw teacher traces to the student's output distribution. Training on SCOReD-optimized CoTs provides a cleaner learning signal to the student model and improves over baseline SFT by 1.56% NDCG and 1.9% Recall@5, while reducing reasoning length by 27.3%.
- Abstract(参考訳): 推薦領域におけるCoT蒸留は、RLトレーニングの先駆となるが、生の教師の痕跡はこの課題に不適である。
大規模教師は、異常に高い推論の不確実性を伴う推薦課題にアプローチし、修正することなく繰り返し回答を再確認し、そのようなトレースを監督した微調整は、最初の推測を決して修正しない冗長な学生を生み出す。
さらに,レコメンデーションドメインの新規性から,小学生のLSMには,教師の推論の痕跡が極めて欠落している。
本研究では,まず各教師のトレースを型付きセグメントに解析し,各セグメントの重要性を評価することを推奨するCOT最適化フレームワークであるSCOReDを提案する。
そして、SCOReDは、学生に与えられた回答の出力長と比較ログ確率リフトに基づいて、セグメントごとの編集(KEEP / REWRITE / FUSE / PRUNE)を動的に選択する。
そのため、SCOReDは情報密度を保ちながら推論トレースの冗長な部分を取り除き、生の教師トレースを学生の出力分布に適応させる。
SCOReD 最適化 CoTs のトレーニングは、学生モデルに対するよりクリーンな学習信号を提供し、ベースライン SFT を1.56% NDCG と 1.9% Recall@5 で改善し、推論長を27.3%削減する。
関連論文リスト
- Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts [48.550535291129584]
Prefix-Guided On-Policy Distillation (PG-OPD) は、固定長プレフィックスを用いて、高価な長距離発生前に軌跡値を推定する単純なロールアウト・アロケーションフレームワークである。
AMC、AIME、HMMTベンチマークの様々な教師/学生の組み合わせで、PG-OPDはトレーニング時間を最大2.46倍にし、平均精度を4.80ポイントまで改善している。
論文 参考訳(メタデータ) (2026-06-20T11:18:34Z) - ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning [69.64972562984882]
提案するThoughtFoldは,よりきめ細かい選好学習を,効率的な推論のための冗長探索に活用するフレームワークである。
ThoughtFoldは効率を大幅に向上させる。
最先端の精度を維持しつつ、DeepSeek-R1-Distill-Qwen-7Bのトークン使用量を約56%削減する。
論文 参考訳(メタデータ) (2026-06-02T11:21:27Z) - Stop Overthinking: Unlocking Efficient Listwise Reranking with Minimal Reasoning [9.10992705914357]
推論長とランキング品質の関係について検討する。
長さ正規化自己蒸留フレームワークを提案する。
提案手法は,異なる検索環境において,推論トークンの消費量を34%~37%削減しつつ,教師の有効性を維持する。
論文 参考訳(メタデータ) (2026-05-14T06:44:44Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z) - Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding [25.81162875653095]
我々は,予測パープレキシティに基づくスコアリングとビームサーチによって導かれるステップワイズ推論合成を行う,協調型マルチ教師デコーディングフレームワークであるCoRDを紹介する。
実験の結果,CoRDは質の高い推論データを生成し,教師レベルに近い成績を得られた。
論文 参考訳(メタデータ) (2026-05-04T07:26:41Z) - Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment [82.00769536768509]
Rank-Surprisal Ratioは、推論軌道の適合性を評価するためにアライメントとインフォメーションの両方をキャプチャする単純な計量である。
軌道選択と教師選択の両方において,その実用性を実証する。
論文 参考訳(メタデータ) (2026-01-20T18:58:10Z) - Reinforced Latent Reasoning for LLM-based Recommendation [92.56166822197919]
大きな言語モデル(LLM)は、複雑な問題解決タスクにおいて印象的な推論能力を示している。
既存の手法は通常、明示的なチェーン・オブ・シント(CoT)データによる微調整に依存している。
本研究では, 明示的なCoT推論から, コンパクトで情報密度の高い潜伏推論へ移行する代替手法について検討する。
論文 参考訳(メタデータ) (2025-05-25T11:03:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。