FuguReport

Dynamic Important Example Mining for Reinforcement Finetuning

著者 Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia Liu, Chirui Chang, Shaofeng Zhang, Samm Sun, Xiuzhe Wu, Ruobing Xie, Xiaojuan Qi
所属 Stanford University / Tencent / The Chinese University of Hong Kong / The University of Hong Kong
カテゴリ Method / Reinforcement Learning / Reinforcement fine-tuning techniques, Method / Data Selection / Dynamic example mining framework, Application / Model Optimization / Improving large model inference capability
ライセンス CC BY 4.0

Abstractの概要

本論文では、大規模言語モデルおよび視覚言語モデルの強化学習ファインチューニング(RFT)におけるデータ活用を研究し、方策学習が非定常であるにもかかわらず、従来のデータ中心の手法の多くがサンプルの重要性を固定的なものとして扱っていると指摘しています。著者らは、各最適化反復において、サンプルごとの重要性を測る勾配アライメント推定器と、全体の勾配ノルムを維持する制約付き再重み付けスキームという2つのステップを通じて学習中のサンプル利用を適応させる「Dynamic Important Example Mining(DIEM)」を提案しています。このフレームワークは、個別の選択モデルを必要とすることなく、GRPOやPPOなどの既存の方策勾配ベースのRFT手法やその関連変種に統合できるように設計されています。また、重要度推定器の理論的な誤差限界を示し、本手法を適応的かつ自己組織化的なカリキュラム機構として位置づけています。

新規性

主な新規性は、静的な選択やヒューリスティックな難易度スコアに依存するのではなく、バッチの更新方向との勾配アライメントから各サンプルの瞬間的な価値を測定する、RFT向けの完全自動化された動的サンプルマイニングフレームワークにあります。もう一つの特徴的な要素は、更新スケールの安定性を明示的に維持しながら有用性の高いサンプルを強調する、制約付きバッチ再重み付けの定式化です。

成果

LLMの数学推論ベンチマークにおいて、DIEMは報告された4つのQwenモデルすべてでGRPOを一貫して上回り、平均で+1.68から+3.36ポイントの性能向上を達成しました。マルチモーダル推論では、DIEMはQwen2.5-VL-7Bで平均61.8、Qwen2.5-VL-32Bで平均67.3に達し、報告されたVanilla RFTや他の静的・動的データ選択ベースラインを上回りました。また、速度テストにおいて本手法の追加学習時間オーバーヘッドは約1.28%にとどまると報告されています。

論文の注目点

  1. DIEMは、方策改善への限界貢献度を表すプロキシとして勾配アライメントを使用し、各RFTステップ中にサンプルの重要性を推定する。
  2. 再重み付け手順は、最適化の安定性を維持することを目的として、勾配ノルム保持制約のもとで総効用を最大化するように定式化されている。
  3. 言語および視覚言語の推論ベンチマークの双方における実験で、最小限の追加学習コストでありながら、GRPO、HVS、LIMR、PCL、SPEED-RLを上回る優れた性能を示している。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。