FuguReport

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

著者 Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao, Jingkang Yang, Hongyuan Zhu, Ziwei Liu
所属 Nanyang Technological University / University of Illinois Urbana-Champaign / A*STAR / Independent Researcher
カテゴリ Method / Reinforcement Learning / Visuals-based reinforcement learning approach, Evaluation / Visual Faithfulness / Assessing adequacy of visual evidence, Application / Model Training / Training with rubric credit signals
ライセンス CC BY 4.0

Abstractの概要

本論文は、ビジョン・言語モデルの事後学習における視覚的忠実性を研究し、この問題を単なる評価の課題ではなく信用割り当ての課題として位置付けています。著者らは、参照回答を視覚的忠実性、推論の一貫性、指示追従にまたがる原子的なルーブリック項目へと分解するVisual Rubrics-Based Reinforcement Learningを提案しています。また、17の視覚的根拠に基づくデータソースから抽出され、重み付けされたルーブリック基準が付与された50,248例の訓練セット「V-Rubrics 50K」を構築しました。OpenMMReasoner-SFT-874KでファインチューニングされたQwen3-VL-8B-Instructモデルを出発点とし、コンポーネント別およびプレフィックス局所化ルーブリック信用割り当てを用いたGRPOによる訓練を行っています。実験では、一般、知識、視覚数学、チャート、論理ベンチマークにおいて、共通のSFTベースラインおよび回答のみに基づくGRPOと本手法を比較しています。

新規性

本論文の主な新規性は、シーケンスレベルの回答報酬のみに依存するのではなく、視覚的根拠に基づくインスタンス固有のルーブリックをVLM事後学習の強化学習報酬コンポーネントとして使用した点にあります。また、項目レベルのルーブリックスコアリングとプレフィックス局所化信用割り当てを組み合わせた点や、この訓練設定のためのV-Rubrics 50Kデータセットを公開した点にも独自性があります。

成果

ルーブリックに基づくGRPOは全体として共通のSFTベースラインと回答のみのGRPOの両方を上回り、推論負荷が高く視覚的根拠を要するタスクで最も明確な向上を示しました。一般・知識スイートのOverall Avg.はSFTの64.93、回答のみのGRPOの66.25に対して68.04となり、視覚数学・チャート・論理スイートではそれぞれの58.45と61.94に対して62.45を記録したと報告されています。アブレーション結果においても、スカラーのシーケンスレベル集約よりも、完全なコンポーネント別かつプレフィックス局所化されたルーブリック設計が支持されています。

論文の注目点

  1. V-Rubricsは参照回答を視覚的忠実性、推論の一貫性、指示追従にわたる原子的な重み付き基準に変換し、よりきめ細かな報酬信号を実現する。
  2. 著者らは17の公開視覚根拠データソースからV-Rubrics 50Kを構築し、50,248例と352,938個のルーブリック項目を強化学習の訓練に使用した。
  3. 実証的な向上は根拠に基づく中間推論を要するベンチマークに集中しており、全タスクで一律に向上するというよりは一般的なVLM能力が概ね維持されている。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。