V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
Abstractの概要
本論文は、ビジョン・言語モデルの事後学習における視覚的忠実性を研究し、この問題を単なる評価の課題ではなく信用割り当ての課題として位置付けています。著者らは、参照回答を視覚的忠実性、推論の一貫性、指示追従にまたがる原子的なルーブリック項目へと分解するVisual Rubrics-Based Reinforcement Learningを提案しています。また、17の視覚的根拠に基づくデータソースから抽出され、重み付けされたルーブリック基準が付与された50,248例の訓練セット「V-Rubrics 50K」を構築しました。OpenMMReasoner-SFT-874KでファインチューニングされたQwen3-VL-8B-Instructモデルを出発点とし、コンポーネント別およびプレフィックス局所化ルーブリック信用割り当てを用いたGRPOによる訓練を行っています。実験では、一般、知識、視覚数学、チャート、論理ベンチマークにおいて、共通のSFTベースラインおよび回答のみに基づくGRPOと本手法を比較しています。
新規性
本論文の主な新規性は、シーケンスレベルの回答報酬のみに依存するのではなく、視覚的根拠に基づくインスタンス固有のルーブリックをVLM事後学習の強化学習報酬コンポーネントとして使用した点にあります。また、項目レベルのルーブリックスコアリングとプレフィックス局所化信用割り当てを組み合わせた点や、この訓練設定のためのV-Rubrics 50Kデータセットを公開した点にも独自性があります。
成果
ルーブリックに基づくGRPOは全体として共通のSFTベースラインと回答のみのGRPOの両方を上回り、推論負荷が高く視覚的根拠を要するタスクで最も明確な向上を示しました。一般・知識スイートのOverall Avg.はSFTの64.93、回答のみのGRPOの66.25に対して68.04となり、視覚数学・チャート・論理スイートではそれぞれの58.45と61.94に対して62.45を記録したと報告されています。アブレーション結果においても、スカラーのシーケンスレベル集約よりも、完全なコンポーネント別かつプレフィックス局所化されたルーブリック設計が支持されています。
論文の注目点
- V-Rubricsは参照回答を視覚的忠実性、推論の一貫性、指示追従にわたる原子的な重み付き基準に変換し、よりきめ細かな報酬信号を実現する。
- 著者らは17の公開視覚根拠データソースからV-Rubrics 50Kを構築し、50,248例と352,938個のルーブリック項目を強化学習の訓練に使用した。
- 実証的な向上は根拠に基づく中間推論を要するベンチマークに集中しており、全タスクで一律に向上するというよりは一般的なVLM能力が概ね維持されている。
参考リンク
- arXiv: https://arxiv.org/abs/2608.25580v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2608.25580v1
- Hugging Face Papers: https://huggingface.co/papers/2608.25580
- Project: https://shulin16.github.io/v-rubrics/