論文の概要: MMVistaReason: Toward Open-Data and Post-Training Recipes for Multimodal Reasoning
- arxiv url: http://arxiv.org/abs/2610.01352v1
- Date: Thu, 01 Oct 2026 09:22:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.027758
- Title: MMVistaReason: Toward Open-Data and Post-Training Recipes for Multimodal Reasoning
- Title(参考訳): MMVistaReason:マルチモーダル推論のためのオープンデータとポストトレーニングレシピを目指して
- Abstract要約: MMVistaReason(MVR)は3つのコンポーネントからなるオープンデータポストトレーニングレシピである。
より小規模な学生は、選択された監督の恩恵を受ける一方、より大きな学生は、軌跡の変化と混合ドメイン干渉に対して堅牢である。
15のマルチモーダルベンチマークで、MVR-4Bは平均スコア72.8に達し、Qwen3.5-9B(インストラクト)とMMFineReason-8Bを上回っ、MMFineReasonよりも70%少ないサンプルを使用する。
- 参考スコア(独自算出の注目度): 35.00186557978545
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Open multimodal reasoning models have benefited from large-scale reasoning supervision, yet reliable post-training remains challenging due to uneven data quality, inefficient supervision construction, imbalanced difficulty, and cross-domain interference. We introduce MMVistaReason (MVR), an open-data post-training recipe with three components: (1) broader capability coverage across complementary Analytical and Real-World reasoning groups, emphasizing structured reasoning versus visual perception and spatial grounding; (2) efficient SFT and RL data construction, standardizing heterogeneous open data through staged cleaning and annotation, combining difficulty-aware cascaded teacher distillation with answer-likelihood-based trajectory selection to construct MVR-SFT-528K, and applying scale-specific frontier filtering for MVR-RL-63K; and (3) specialize-then-integrate training, which trains complementary RL experts and consolidates their capabilities through multi-teacher on-policy distillation (MOPD). Our analyses reveal a capacity-dependent interaction between supervision difficulty, trajectory quality, and model capacity: smaller students benefit more from selected supervision, while larger students are robust to trajectory variation and mixed-domain interference. Mixed-domain RL introduces benchmark-level negative transfer, whereas MOPD provides consistent capability integration, with the preferred KL direction varying across model scales. Across 15 multimodal benchmarks, MVR-4B achieves an average score of 72.8, outperforming Qwen3.5-9B (Instruct) and MMFineReason-8B while using about 70% fewer samples than MMFineReason. Scaling to 9B improves the average to 74.4, surpassing Qwen3.5-35B-A3B (Instruct). Overall, MMVistaReason demonstrates that systematic open-data construction and capacity-aware post-training provide a practical and scalable path toward reliable multimodal reasoning.
- Abstract(参考訳): オープンマルチモーダル推論モデルは大規模推論の監督の恩恵を受けているが、不均一なデータ品質、非効率な監視構築、不均衡な困難、ドメイン間の干渉のために信頼性の高い後トレーニングは難しいままである。
MMVistaReason(MMVistaReason, MVR)は,(1)補完的分析と実世界推論グループにまたがる広範な機能カバレッジ,(2)視覚的知覚と空間的接地による構造的推論の強調,(2)効率的なSFTとRLデータ構築,ステージドクリーニングとアノテーションによる異種オープンデータの標準化,MVR-SFT-528K構築のための解答に類似した学習経路選択と解答に基づく学習経路選択を組み合わせたMVR-SFT-528Kの構築,(3)MVR-RL-63Kのスケール特異的フロンティアフィルタリングの適用,(3)補完的RL専門家を訓練し,多言語学習による多言語学習(PD)を通してその機能を統合する,という3つのコンポーネントを備えたオープンデータポストトレーニング手法である。
分析の結果,教師の難易度,軌道品質,モデル能力の相互関係が明らかとなり,より小規模の学生はより選抜された監督の恩恵を受ける一方,大学生は軌跡変動や混合ドメイン干渉に対して頑健であることがわかった。
混合ドメイン RL はベンチマークレベルの負の転送を導入し、MOPD はモデルのスケールによって KL の方向が変わるため、一貫した機能統合を提供する。
15のマルチモーダルベンチマークで、MVR-4Bは平均スコア72.8に達し、Qwen3.5-9B(インストラクト)とMMFineReason-8Bを上回っ、MMFineReasonよりも70%少ないサンプルを使用する。
9Bへのスケーリングは平均74.4に改善され、Qwen3.5-35B-A3B(インストラクション)を上回った。
全体として、MMVistaReasonは、体系的なオープンデータ構築とキャパシティアウェアのポストトレーニングが、信頼性のあるマルチモーダル推論への実践的でスケーラブルなパスを提供することを示した。
関連論文リスト
- NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research [5.287668610154937]
トレーニング後のアライメントは、大きな言語モデルの能力に従って、推論と人間の好みを決定する。
この研究は、Qwen3-8Bベース上に構築された完全に透明でアブレーション駆動のポストトレーニングパイプラインであるNebulaExpを提示する。
論文 参考訳(メタデータ) (2026-06-25T07:03:25Z) - VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models [10.513021831152363]
本稿では、3Bパラメータを持つコンパクトな密度モデルVibeThinker-3Bについて紹介する。
VibeThinker-3Bは高要求の検証タスクにおいてフロンティアレベルの性能を実現する。
論文 参考訳(メタデータ) (2026-06-15T02:57:19Z) - AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution [61.593935260052795]
Supervised Fine-Tuning (SFT) とReinforcement Learning (RL) による後学習は多モーダル大規模言語モデル(MLLM)における推論の強化に不可欠である
既存のパラダイムは、静的データの制限により、しばしばパフォーマンスのボトルネックに達する。
我々は,真理に順応したデータキュレーションとモデル進化を統合する新しいパラダイムであるアンカー進化(AnE)を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:26:34Z) - Hierarchical Mixture-of-Experts with Two-Stage Optimization [84.70724165894501]
ルーティング制御を2つの結合レベルに分解するグループ化されたMoEフレームワークであるHi-MoEを提案する。
我々は,最近のスパースルーティングやグループ化されたMoEベースラインに対する一貫した改善をNLPおよびビジョンベンチマークで観察する。
58Bトークンの大規模事前トレーニングでは、Hi-MoE-7Bは5.6%のパープレキシティ低減と、OLMoE-7Bよりも40%のエキスパートバランスの改善を実現している。
論文 参考訳(メタデータ) (2026-05-08T09:21:46Z) - Specializing Foundation Models via Mixture of Low-Rank Experts for Comprehensive Head CT Analysis [6.04562866374803]
複数の特殊な低ランクアダプタと教師なしソフトルーティングでLoRAを拡張したMixture of Low-Rank Experts (MoLRE) フレームワークを提案する。
2次元および3次元のアーキテクチャ、一般ドメイン、医療ドメイン、頭部CT固有の事前訓練、および7Mから431Mのモデルサイズにまたがる6つの最先端医療画像基盤モデルのMoLREのベンチマークを提示する。
論文 参考訳(メタデータ) (2026-02-28T14:32:38Z) - Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models [0.0]
大規模言語モデルにおけるマルチホップ文脈推論の制御に関する研究について述べる。
マルチエージェントシステムは逆パターンを示し、ルールベースのメソッドが失敗する推論タスクを最大80%達成する。
論文 参考訳(メタデータ) (2026-01-06T20:18:55Z) - RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization [111.1749164063616]
大規模言語モデル(LLM)のための新しいハイブリッド政治最適化手法RL-PLUSを提案する。
RL-PLUSは、外部データと内部エクスプロイトを相乗化して、より強力な推論能力を達成し、ベースモデルのバウンダリを超える。
提案手法の優位性と一般化性を示すため,理論解析と広範な実験を行った。
論文 参考訳(メタデータ) (2025-07-31T23:55:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。