論文の概要: Visual-Advantage On-Policy Distillation for Vision-Language Models
- arxiv url: http://arxiv.org/abs/2605.21924v1
- Date: Thu, 21 May 2026 02:48:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 20:14:18.511213
- Title: Visual-Advantage On-Policy Distillation for Vision-Language Models
- Title(参考訳): ビジョンランゲージモデルのための視覚アドバンテージオンポリシィ蒸留
- Authors: Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, Shu Wu,
- Abstract要約: ビジュアル・アドバンテージ(VA)は、教師が詳細なビジュアルディテールにアクセスせずに学生が生成したロールアウトを得点した場合、トークンレベルのログ確率差である。
VA-OPDは、各ベンチマークにおける標準的なオンライン蒸留よりも改善され、教師サイズとデータスケールの両方の軸に沿って単調に上昇する。
- 参考スコア(独自算出の注目度): 32.05491249378337
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On-policy knowledge distillation has proven effective for language models, yet its application to vision-language models (VLMs) remains underexplored. We observe that standard on-policy distillation can improve a student's output quality while failing to strengthen its reliance on visual input: on vision-critical tokens, the student's predictions remain largely unchanged whether or not fine-grained visual detail is present, even though the teacher's predictions depend heavily on it.To make this difference observable, we introduce visual advantage (VA), the token-level log-probability difference when the teacher scores a student-generated rollout with versus without access to fine-grained visual detail. VA is concentrated in a small minority of tokens, and these high-VA tokens are the ones that actually carry the visual supervision signal. This motivates a distillation objective that treats them differently from language scaffolding, so their contribution is not diluted by the abundant surrounding language tokens.We propose Visual-Advantage On-Policy Distillation (VA-OPD), which uses VA at two granularities: rollout-level reweighting by trajectory-averaged VA, and token-level KL averaged within high-VA and low-VA groups separately. We train on two math datasets (Geometry3K and ViRL39K) and evaluate on eight benchmarks covering both mathematical reasoning and visual understanding, across three teacher sizes (4B, 8B, and 32B) on the Qwen3-VL family. VA-OPD improves over standard on-policy distillation on every benchmark, with the gain growing monotonically along both the teacher-size and data-scale axes, suggesting that these factors compound consistently.
- Abstract(参考訳): オンラインの知識蒸留は言語モデルに有効であることが証明されているが、そのビジョン言語モデル(VLM)への応用は未検討である。
教師の予測に大きく依存しているにもかかわらず、視覚クリティカルなトークンでは、教師の予測が細かな視覚的詳細が存在するか否かがほとんど変化していないため、教師が微妙な視覚的詳細にアクセスせずに生徒が生成したロールアウトを得点した場合の、トークンレベルの対数確率差である視覚的優位性(VA)を導入する。
VAは少数のトークンに集中しており、これらのハイVAトークンは実際に視覚的な監視信号を運ぶものである。
そこで我々は, VA を2つの粒度で用いる Visual-Advantage On-Policy Distillation (VA-OPD) を提案し, トラジェクティブ平均 VA によるロールアウトレベル再重み付けと, 高VA および低VA グループで平均値のトークンレベル KL を分離した。
我々は2つの数学データセット(Geometry3KとViRL39K)をトレーニングし、Qwen3-VLファミリー上の3つの教師サイズ(4B、8B、32B)の数学的推論と視覚的理解の両方をカバーする8つのベンチマークを評価した。
VA-OPDは、各ベンチマークにおける標準的なオンライン蒸留よりも改善され、教師サイズとデータスケールの両方の軸に沿って単調に増加し、これらの因子が一貫して合成されることが示唆されている。
関連論文リスト
- AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals [65.71225905458182]
自己蒸留は、生徒と教師の両方と同じモデルを用いて、言語モデルが自身の軌道から政治学を学ぶことを可能にする。
このセットアップは、別の外部モデルに頼ることなく、密集したトークンレベルのフィードバックを提供する。
複数の特権情報ビューを持つ自己蒸留法であるAVSDを紹介する。
論文 参考訳(メタデータ) (2026-05-20T03:06:36Z) - Selective Training for Large Vision Language Models via Visual Information Gain [7.834991119179473]
本稿では,視覚情報ゲイン(VIG)について紹介する。
VIGは視覚入力による予測の不確実性の低減を測定する。
本稿では,高VIGサンプルとトークンを優先するVIG誘導型選択学習手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T09:12:21Z) - Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy [75.66913260900726]
検証可能なリワードによる強化学習は、大規模言語モデルにおいてかなり高度な推論能力を持っている。
既存のパラダイムは、テキスト中心の成果報酬によって推進され、モデルが視覚的知覚をバイパスすることを奨励します。
我々はtextbfDifferential Visual Reasoning Policy によって駆動されるフレームワーク Deltas を用いた textbfThinking を提案する。
論文 参考訳(メタデータ) (2026-01-11T08:25:34Z) - Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy [59.44168425139687]
BayesVLA(ベイズVLA)は、前もってポリシーを視覚的アクションに分解し、ルック・トゥ・アクティベーションと言語条件付き可能性をサポートし、即時特定を可能にするベイズ因子化である。
実験は、既存の方法と比較して、目に見えない命令、オブジェクト、環境に対して優れた一般化を示す。
論文 参考訳(メタデータ) (2025-12-12T01:59:23Z) - EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens [37.11253070112327]
効率的なマルチモーダル大言語モデル(MLLM)は、リソース消費を減らすために視覚トークンを圧縮するが、視覚情報の喪失は理解能力を低下させる可能性がある。
学生モデルを強化するために知識蒸留を導入した先駆者もいるが、細粒度の視覚理解の根本的な違いを見落としている。
本稿では,知識蒸留による効率的なMLLMを実現する新しいパラダイムであるEM-KDを提案する。
論文 参考訳(メタデータ) (2025-11-26T06:45:59Z) - Probing Visual Language Priors in VLMs [51.016683265437536]
我々は,意図的に分布外画像を特徴付けるベンチマークであるViLPを紹介した。
ViLPの各質問には、3つの潜在的な答えと3つの対応するイメージが結合される。
本稿では,モデルが新たなVQAデータを生成し,ピクセルレベルおよびセマンティックな汚職を適用して,自己学習のための「良いバッド」画像ペアを生成する自己改善フレームワークを提案する。
論文 参考訳(メタデータ) (2024-12-31T17:54:29Z) - Silkie: Preference Distillation for Large Visual Language Models [56.10697821410489]
本稿では,大型視覚言語モデル(LVLM)の嗜好蒸留について検討する。
まず,AIアノテーションを用いた視覚言語フィードバックデータセットを構築した。
我々は, GPT-4V を用いて, 有用性, 視覚的忠実性, 倫理的考察のアウトプットを評価する。
結果として得られたモデルSilkieは、認知能力と認知能力に関するMMEベンチマークで6.9%と9.5%の相対的な改善を達成している。
論文 参考訳(メタデータ) (2023-12-17T09:44:27Z) - Visual Perturbation-aware Collaborative Learning for Overcoming the
Language Prior Problem [60.0878532426877]
本稿では,視覚的摂動校正の観点から,新しい協調学習手法を提案する。
具体的には、異なる摂動範囲で2種類のキュレートされた画像を構築するための視覚コントローラを考案する。
2つの診断VQA-CPベンチマークデータセットの実験結果は、その効果を明らかに示している。
論文 参考訳(メタデータ) (2022-07-24T23:50:52Z) - Compressing Visual-linguistic Model via Knowledge Distillation [43.73998154661652]
変圧器を用いた大規模視覚言語モデルを小型モデルに圧縮するための知識蒸留の研究を行う。
提案した蒸留は,画像キャプションおよび視覚的質問応答タスクにおける小型VLモデルの性能を有意に向上させることを示した。
論文 参考訳(メタデータ) (2021-04-05T18:02:17Z) - PatchVAE: Learning Local Latent Codes for Recognition [38.82903227239025]
VAEによって学習された教師なしの表現は、教師なしの学習によって認識のために学習された表現によって著しく優れています。
我々の仮説は、モデルを認識する上で有用な表現を学ぶためには、データ内の反復パターンと一貫したパターンについて学ぶことを奨励する必要がある、というものである。
実験により,本手法で学習した表現は,バニラVAEで学習した表現よりも,認識タスクにおいて優れることが示された。
論文 参考訳(メタデータ) (2020-04-07T18:01:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。