論文の概要: LEGO-OPD: Factorized Teacher Composition for Multimodal On-Policy Distillation
- arxiv url: http://arxiv.org/abs/2610.00333v1
- Date: Tue, 29 Sep 2026 13:57:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.613959
- Title: LEGO-OPD: Factorized Teacher Composition for Multimodal On-Policy Distillation
- Title(参考訳): LEGO-OPD:マルチモーダルオンポリティー蒸留のための分解型教師構成
- Abstract要約: LEGO-OPDは、言語エキスパートとグラウンドの専門家から選択的に、マルチモーダルPDのための1つの教師配布に分解する。
一般化されたベイズ的定式化の下では、言語専門家は候補トークンよりも先行する一方、基底の専門家は完全な予測分布を転送するのではなく、この前を更新する視覚的可能性に寄与する。
Qwen3モデルによる実験によると、LEGO-OPDは、マルチモーダルおよびテキストのみの推論タスクにおいて、評価されたシングルティーチングとマルチティーチングのPDベースラインを一貫して上回っている。
- 参考スコア(独自算出の注目度): 45.88028371034407
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal on-policy distillation (OPD) aims to improve visual grounding while preserving the strong reasoning capabilities of language models. Recent multi-teacher approaches combine LLM and VLM teachers to provide complementary supervision. However, directly using a VLM's full predictive distribution entangles its visual grounding signal with its own language prior, preventing the grounding information from being transferred independently. Conversely, increasing the strength of visual supervision can improve perception but may overemphasize visual evidence and degrade language reasoning. To address this trade-off, we introduce LEGO-OPD, which selectively composes factors from a Language Expert and a Grounding expert into One teacher distribution for multimodal OPD. Under a generalized Bayesian formulation, the language expert provides a prior over candidate tokens, while the grounding expert contributes a visual likelihood that updates this prior, rather than transferring its complete predictive distribution. This factorized composition allows language reasoning and visual grounding to be controlled independently. We further introduce adaptive calibration to determine how strongly the visual likelihood should update the language prior at each decoding prefix. Specifically, LEGO-OPD uses the grounding expert's image-induced prediction shift as a prefix-dependent reference, preventing both insufficient and excessive visual supervision. Experiments with Qwen3 models show that LEGO-OPD consistently outperforms the evaluated single- and multi-teacher OPD baselines on both multimodal and text-only reasoning tasks. Moreover, it improves the initial student's visual perception while preserving text-only reasoning.
- Abstract(参考訳): マルチモーダルオンライン蒸留(OPD)は,言語モデルの強い推論能力を保ちながら,視覚的接地を改善することを目的としている。
近年のマルチ教師アプローチでは,LLMとVLMの教師を組み合わせて補完的な指導を行っている。
しかしながら、VLMの完全な予測分布を直接使用すると、その視覚的接地信号がそれ以前の言語と絡み合うため、接地情報が独立して転送されるのを防ぐことができる。
逆に、視覚的監督の強さの増大は知覚を向上させるが、視覚的証拠を過度に強調し、言語推論を低下させる可能性がある。
このトレードオフに対処するため、LEGO-OPDを導入し、言語エキスパートとグラウンドの専門家から、マルチモーダルPDのための1つの教師分布に選択的に要素を組み立てる。
一般化されたベイズ的定式化の下では、言語専門家は候補トークンよりも先行する一方、基底の専門家は完全な予測分布を転送するのではなく、この前を更新する視覚的可能性に寄与する。
この分解された構成は、言語推論と視覚的接地を独立して制御することを可能にする。
さらに適応キャリブレーションを導入し、各デコードプレフィックスに先立って、視覚的可能性がどのように言語を更新すべきかを判断する。
具体的には、LEGO-OPDは、接地の専門家による画像誘発予測シフトをプレフィックス依存参照として使用し、不十分かつ過剰な視覚的監視の両方を防ぐ。
Qwen3モデルによる実験によると、LEGO-OPDは、マルチモーダルおよびテキストのみの推論タスクにおいて、評価されたシングルティーチングとマルチティーチングのPDベースラインを一貫して上回っている。
さらに、テキストのみの推論を保ちながら、初等生の視覚的知覚を向上させる。
関連論文リスト
- Distilling Visual Reasoning into Text Space [78.35420007882202]
Visual-to-Text Chain-of-Thought Distillation (V2T)は、LVLMが推論時に中間的な視覚表現を生成することなく、視覚的推論を内部化することを可能にするフレームワークである。
V2Tはまず,教師のLVLMを視覚的およびテキスト的思考の連鎖を用いて訓練し,その後,知識蒸留を用いて教師のロジットを用いて生徒のLVLMを訓練し,地道的テキスト的推論からクロスエントロピーを監督する。
論文 参考訳(メタデータ) (2026-09-28T06:20:00Z) - OPD-V: Visual On-Policy Self-Distillation with Modality Balance [60.972871141106886]
On-Policy Self-Distillation (OPSD)は、大規模言語モデル(MLLM)における視覚的推論を改善するための訓練後の標準的なアプローチとなっている。
既存の方法は、様々な入力源から特権情報を引き出し、自己蒸留を誘導する。
我々は,視覚的OPSDパラダイムであるOPD-Vを紹介し,正の教師と負の教師を通してそのような情報をインスタンス化する。
論文 参考訳(メタデータ) (2026-08-05T17:53:06Z) - Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning [12.622982203412478]
強化学習(Reinforcement Learning, RL)は、視覚言語モデル(VLM)の推論能力を改善するための重要なパラダイムである。
まず,6つの一般的なVQAベンチマークから,視覚的・言語的因果関係を明確化してサンプルをキュレートするFWS戦略を提案する。
VLMベースの裁判官は、データセットをさらに浄化し、強力な因果一貫性と視覚的忠実性を保証するために使用される。
実験の結果,このような忠実な指導は回答の精度を向上し,RL訓練を安定させ,視覚的に支持できない推論を減少させることがわかった。
論文 参考訳(メタデータ) (2026-06-29T08:58:33Z) - Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding [76.37424140943456]
我々は,視覚言語モデル (VLM) 蒸留の標準的なモノリシックな見方に挑戦し,損失を2つの異なるコンポーネント(言語先行と視覚接地)に数学的に分解する。
本稿では、更新ベクトルを動的に並べ替えて視覚的な部分空間を優先順位付けするVisual Gradient Steering(VGS)を紹介する。
複数の蒸留条件と複雑なマルチモーダルベンチマークの実験結果は、VGSがオン・ポリケート蒸留の標準的なモノリシックな定式化を著しく上回っていることを示している。
論文 参考訳(メタデータ) (2026-05-30T06:34:37Z) - Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy [75.66913260900726]
検証可能なリワードによる強化学習は、大規模言語モデルにおいてかなり高度な推論能力を持っている。
既存のパラダイムは、テキスト中心の成果報酬によって推進され、モデルが視覚的知覚をバイパスすることを奨励します。
我々はtextbfDifferential Visual Reasoning Policy によって駆動されるフレームワーク Deltas を用いた textbfThinking を提案する。
論文 参考訳(メタデータ) (2026-01-11T08:25:34Z) - Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy [59.44168425139687]
BayesVLA(ベイズVLA)は、前もってポリシーを視覚的アクションに分解し、ルック・トゥ・アクティベーションと言語条件付き可能性をサポートし、即時特定を可能にするベイズ因子化である。
実験は、既存の方法と比較して、目に見えない命令、オブジェクト、環境に対して優れた一般化を示す。
論文 参考訳(メタデータ) (2025-12-12T01:59:23Z) - MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning [20.14427952871989]
MLLMにおける視覚的推論を強化するマルチモーダル強化事前学習フレームワークであるMMRPTを紹介する。
我々は,大規模視覚言語モデルの事前学習に強化学習を直接取り入れた最初の人物である。
実験では、様々なベンチマークで一貫したゼロショットゲインが示され、教師付き微調整下ではロバスト性が大幅に改善された。
論文 参考訳(メタデータ) (2025-12-08T06:26:13Z) - Improving Visual Commonsense in Language Models via Multiple Image Generation [41.565399860320966]
既存の大規模言語モデル(LLM)は、主にテキストデータのみを使用して訓練されている。
視覚言語モデルは視覚的に指向するタスクに優れており、基本的なコモンセンス推論のような視覚的でないタスクでは失敗することが多い。
この分散は、基本的なテキストベースの言語推論と堅牢な視覚的理解の統合という、重要な課題を浮き彫りにする。
論文 参考訳(メタデータ) (2024-06-19T15:17:10Z) - Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners [15.178598145436142]
我々はLARC(Language-Regularized Concept Learner)を提案する。
LARCは言語からの制約を正規化として使用し、ニューロシンボリックな概念学習者の精度を大幅に向上させる。
LARCは自然に監督された3次元視覚グラウンドにおける先行作業の性能を向上させる。
論文 参考訳(メタデータ) (2024-04-30T16:44:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。