論文の概要: Towards Scalable RLVR: Multimodal Instruction Following Data Synthesis and Distillation
- arxiv url: http://arxiv.org/abs/2609.16059v1
- Date: Sun, 13 Sep 2026 08:50:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.11856
- Title: Towards Scalable RLVR: Multimodal Instruction Following Data Synthesis and Distillation
- Title(参考訳): スケーラブルRLVRに向けて:データ合成と蒸留によるマルチモーダルインストラクション
- Abstract要約: 我々は、RL対応マルチモーダルデータを生成するために設計された系統的パイプラインMIFSを提案する。
実データと比較すると,MIFS学習MLLMは4つのMMIFベンチマークで平均8.13%,3$times$のトレーニングコンバージェンスで平均8.13%向上することがわかった。
- 参考スコア(独自算出の注目度): 21.111047537783563
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multimodal instruction following (MMIF) is crucial for building generalist agents. However, current training paradigms rely heavily on Supervised Fine-Tuning (SFT), which often leads to surface-level pattern matching and degrades general capabilities. While Reinforcement Learning with Verifiable Rewards (RLVR) offers a promising alternative, its scalability in MMIF is severely bottlenecked by the scarcity of high-quality, RL-ready multimodal data. To bridge this gap, we present MIFS (\textbf{M}ultimodal \textbf{I}nstruction \textbf{F}ollowing \textbf{S}ynthesis), a systematic pipeline designed to generate RL-ready multimodal data. Specifically, MIFS introduces a generative constraint protocol to synthesize diverse raw samples, followed by a learnability-aware distillation mechanism that filters data based on RL training dynamics to ensure stable policy optimization. Furthermore, a code-based verifier provides high-precision reward signals for policy learning. The resulting dataset comprises 90k samples across 8 constraint categories and 14 task domains. Empirical evaluations demonstrate that MIFS-trained MLLMs achieve an average improvement of 8.13\% on four MMIF benchmarks and a 3$\times$ faster training convergence compared to using raw data. Crucially, our approach mitigates the generalization trade-offs typical of SFT, preserving core visual capabilities while significantly boosting instruction-following precision.
- Abstract(参考訳): 汎用エージェントの構築にはMMIF(Multimodal instruction following)が不可欠である。
しかし、現在のトレーニングパラダイムはスーパービジョンファインチューニング(SFT)に大きく依存しており、しばしば表面レベルのパターンマッチングにつながり、一般的な能力を低下させる。
Reinforcement Learning with Verifiable Rewards (RLVR)は有望な代替手段を提供するが、MMIFのスケーラビリティは高品質のRL対応マルチモーダルデータの不足によって著しくボトルネックになっている。
このギャップを埋めるために、RL対応マルチモーダルデータを生成するために設計された系統的なパイプラインであるMIFS(\textbf{M}ultimodal \textbf{I}nstruction \textbf{F}ollowing \textbf{S}ynthesis)を提案する。
特に、MIFSは、多様なサンプルを合成するための生成的制約プロトコルを導入し、続いて、RLトレーニングダイナミクスに基づくデータをフィルタリングして安定したポリシー最適化を保証する学習可能性を考慮した蒸留機構を導入している。
さらに、コードベースの検証器は、ポリシー学習のための高精度な報酬信号を提供する。
その結果得られたデータセットは、8つの制約カテゴリと14のタスクドメインにわたる90kのサンプルで構成されている。
実データと比較すると,MIFS学習MLLMは4つのMMIFベンチマークで平均8.13倍,3$\times$高速なトレーニングコンバージェンスを実現している。
重要な点として,本手法はSFTの典型的な一般化トレードオフを緩和し,コア視覚能力を保ちながら,命令追従精度を大幅に向上させる。
関連論文リスト
- Unified Data Selection for LLM Reasoning [66.0118347918729]
複雑で長いCoT推論のための大規模言語モデル(LLM)のトレーニングは、しばしば大量の高品質な推論データの必要性によってボトルネックとなる。
本研究では,各推論サンプルの上位(例えば0.5%)のエントロピートークンのみを和らげることで,推論品質を定量化する学習自由度指標であるHigh-Entropy Sum(HES)を提案する。
論文 参考訳(メタデータ) (2026-05-21T12:21:41Z) - MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning [59.03162187361455]
マルチステージ強化学習(MSRL)は、限られたマルチモーダルデータを持つマルチモーダル報酬モデルに対してスケーラブルなRLを実現することができる。
MSRLは、従来のRLVRベースのトレーニングパラダイムを、一般化可能な報酬推論能力を初めて学習することで置き換える。
大規模な実験により、MSRLはRLVRベースの生成型MRMのトレーニングを効果的にスケールすることが示された。
論文 参考訳(メタデータ) (2026-03-26T07:27:11Z) - Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration [56.074760766965085]
PRISMは、モデルの既存の知識との認知的対立度に基づいてデータを調停する動的認識フレームワークを実現する。
この結果から,内部最適化方式に基づくデータ分離が,スケーラブルでロバストなエージェントアライメントに不可欠であることが示唆された。
論文 参考訳(メタデータ) (2026-01-12T05:43:20Z) - RS-Prune: Training-Free Data Pruning at High Ratios for Efficient Remote Sensing Diffusion Foundation Models [14.093802378976315]
拡散型リモートセンシング(RS)生成基盤モデルは、多量のグローバルな代表データに依存している。
本稿では,高プルーニング率で高品質なサブセットを迅速に選択する,トレーニングフリーな2段階データプルーニング手法を提案する。
実験の結果, トレーニングデータの85%を刈り取った後も, コンバージェンスと生成品質が著しく向上することがわかった。
論文 参考訳(メタデータ) (2025-12-29T06:44:06Z) - OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe [69.90298686714036]
細調整と強化学習にまたがるマルチモーダル推論のための完全透明な2段階レシピであるOpenMMReasonerを紹介する。
提案手法は,9つのマルチモーダル推論ベンチマークにおいて,Qwen2.5-VL-7B-インストラクタベースラインよりも11.6%向上した。
論文 参考訳(メタデータ) (2025-11-20T13:11:45Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - Reinforcement Learning on Pre-Training Data [55.570379963147424]
我々は,大規模言語モデル(LLM)を最適化するための新しい訓練時間スケーリングパラダイムである,事前学習データ(R)の強化学習を紹介する。
Rは、有意義な軌道を自律的に探索し、事前学習データから学び、強化学習(RL)を通してその能力を向上させる。
複数のモデルにわたる一般領域および数学的推論ベンチマークの広範な実験は、Rの有効性を検証した。
論文 参考訳(メタデータ) (2025-09-23T17:10:40Z) - A Distribution-Aware Flow-Matching for Generating Unstructured Data for Few-Shot Reinforcement Learning [1.0709300917082865]
数発の強化学習のための合成非構造化データを生成するための分布認識フローマッチング手法を提案する。
我々のアプローチは、オーバーフィッティングやデータ相関など、従来のモデルベースRLにおける重要な課題に対処する。
提案手法は,初期タイムスタンプのフレームレートを30%向上させながら,最大Q値で安定した収束を実現することを示す。
論文 参考訳(メタデータ) (2024-09-21T15:50:59Z) - MCDFN: Supply Chain Demand Forecasting via an Explainable Multi-Channel Data Fusion Network Model [0.0]
CNN,Long Short-Term Memory Network (LSTM), Gated Recurrent Units (GRU)を統合したハイブリッドアーキテクチャであるMulti-Channel Data Fusion Network (MCDFN)を紹介する。
我々の比較ベンチマークは、MCDFNが他の7つのディープラーニングモデルより優れていることを示している。
本研究は,需要予測手法を進歩させ,MCDFNをサプライチェーンシステムに統合するための実践的ガイドラインを提供する。
論文 参考訳(メタデータ) (2024-05-24T14:30:00Z) - Take the Bull by the Horns: Hard Sample-Reweighted Continual Training
Improves LLM Generalization [165.98557106089777]
大きな言語モデル(LLM)の能力を高めることが大きな課題だ。
本研究は,従来の事前学習データセットを用いたLCMの光連続訓練に関する実証的戦略から始まった。
次に、この戦略をインスタンス重み付け分散ロバスト最適化の原則化されたフレームワークに定式化します。
論文 参考訳(メタデータ) (2024-02-22T04:10:57Z) - Task Aware Modulation using Representation Learning: An Approach for Few Shot Learning in Environmental Systems [15.40286222692196]
TAM-RLは異種システムにおける少数ショット学習のための新しいフレームワークである。
2つの実環境データセット上でのTAM-RLの評価を行った。
論文 参考訳(メタデータ) (2023-10-07T07:55:22Z) - Multifidelity Reinforcement Learning with Control Variates [3.2895195535353317]
多くの計算科学や工学の応用において、与えられた入力に対応する興味あるシステムの出力は、異なるコストで異なるレベルの忠実度でクエリすることができる。
本研究では、与えられた制御タスクに対して、異なるレベルの忠実度を持つ複数の環境が存在する場合の強化学習問題について検討する。
状態-作用値関数の推定におけるばらつきを低減するために,低忠実度と高忠実度との相互相関を利用した多忠実度推定器を提案する。
論文 参考訳(メタデータ) (2022-06-10T15:01:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。