Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning
Abstractの概要
本論文は、言語モデルの推論蒸留において、インスタンス固有の解答軌跡ではなく、再利用可能な問題解決の戦略を目標とすべきであると主張している。強力なモデルの応答から構造化された戦略記述を抽出し、それを用いて同じ問題に対する生徒モデルのガイドあり・ガイドなしの振る舞いを比較する戦略主導型方策最適化(SGPO)を提案している。SGPOは、自律的なGRPOベースの探索と、トークンレベルのforward-KL蒸留を組み合わせるだけでなく、学習を安定させ戦略ガイドの適用タイミングを制御するための近接制約と適応型インスタンス重み付けを採用している。実験は、Qwen2.5およびLlama-3.2モデルファミリーにおける4つの数学的推論ベンチマークで実施されている。
新規性
主な新規性は、蒸留の焦点を軌跡の模倣から戦略レベルの転移へとシフトさせた点にあり、生徒モデルは教師の推論過程を正確にコピーするのではなく、戦略的ガイドが自身のトークン分布をどのように変化させるかを内面化するように学習する。forward-KL目的関数、到達可能なターゲットの選択、および適応型重み付けを組み合わせることで、これが標準的な教師あり模倣ではなく、戦略蒸留のための方策最適化フレームワークとなっている。
成果
4つの数学ベンチマークと3つのベースモデルにおいて、SGPOは比較手法の中で最高の平均性能を達成し、SFT、SFT+GRPO、HPT、LUFFYを上回った。Qwen2.5-7B-Instructでは、最強のベースラインの平均スコア49.9から52.1へと向上し、アブレーション分析により戦略蒸留や近接制約の削除が大幅な性能低下をもたらすことが示された。追加分析では、ガイド付き軌跡においてKLベースの蒸留が直接的なSFTよりも効果的であること、およびベースモデルの能力が高いほど性能向上が大きくなる傾向があることが示されている。
論文の注目点
- SGPOは各問題に対して自律的な軌跡と戦略ガイド付きの軌跡の両方を構築し、戦略の条件付けによって生じる分布の変化をガイドなしの方策に蒸留する。
- この手法は、トークンレベルのforward-KL、到達可能なターゲットの選択、KLクリッピング、適応型インスタンス重み付けを使用し、学習の安定性を維持しながら戦略情報を転移させる。
- 経験的に、SGPOは数学的推論ベンチマークにおいて軌跡ベースのベースラインを一貫して上回り、分析によりその学習シグナルが日常的なトークンではなく戦略的に重要な決定ポイントに焦点を当てていることが示唆されている。