論文の概要: Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.01263v1
- Date: Sun, 02 Aug 2026 14:16:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.143899
- Title: Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models
- Title(参考訳): 学生が見るもの:ビジョン・ランゲージ・モデルのための漁業計画型オン・ポリティクス蒸留
- Authors: Leyan Xue, Feng Xiong, Mingjun Ma, Changqing Zhang,
- Abstract要約: オンライン蒸留(OPD)は、現在の学生政策の軌跡をサンプリングし、学生と教師の次点分布のトークンレベルのばらつきを最小限にする。
本稿では,ローカルで実現可能な教師の訂正のみを蒸留するemphFisher-Projected On-Policy Distillation (FP-OPD)を提案する。
- 参考スコア(独自算出の注目度): 23.382646724389545
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) samples trajectories from the current student policy and minimizes token-level divergence between student and teacher next-token distributions at prefixes along those trajectories. This aligns the distillation states with the student's own generation distribution. However, it still assumes that the complete teacher distribution is an appropriate target across student capacities. In vision--language reasoning, teacher corrections can depend on visual distinctions that a compact student cannot represent. Our target-scaling study shows that, as the target approaches the complete teacher distribution, the student realizes less of the prescribed shift and obtains worse downstream performance. We therefore propose \emph{Fisher-Projected On-Policy Distillation} (FP-OPD), which distills only locally realizable teacher corrections. FP-OPD uses continuous visual perturbations to estimate the student's local visual tangent space and projects the centered teacher--student log-probability gap onto this space under the student's Fisher metric. The resulting capacity-aware target is optimized with full-vocabulary reverse KL on student trajectories, retaining the standard OPD framework. In 8B-to-2B distillation, FP-OPD improves all seven evaluated multimodal benchmarks. It raises the average score by 2.77 points over the pretrained student and by 1.60 points over standard OPD. These results demonstrate that locally realizable teacher corrections provide a more effective target for distilling compact vision--language models.
- Abstract(参考訳): オンライン蒸留(OPD)は、現在の学生政策からトラジェクトリをサンプリングし、それらのトラジェクトリに沿ったプレフィックスにおける学生と教師の次のトケン分布間のトークンレベルのばらつきを最小限にする。
これは、蒸留状態と生徒自身の世代分布とを一致させる。
しかし、教師の完全な分布は学生の能力にまたがる適切な目標であるといえよう。
視覚-言語推論では、教師の補正は、コンパクトな学生が表現できない視覚的区別に依存することができる。
本研究は, 対象が教師の分布に近づくにつれて, 学生が所定のシフトを減らし, 下流の成績が悪化することを示すものである。
そこで我々は, 局所的に実現可能な教師の訂正のみを蒸留する<emph{Fisher-Projected On-Policy Distillation} (FP-OPD)を提案する。
FP-OPDは、学生の局所的な視覚的接点空間を推定するために、連続的な視覚的摂動を用いており、学生のフィッシャー計量の下で、教師中心の対数確率ギャップをこの空間に投影している。
得られたキャパシティ・アウェア・ターゲットは、学生軌道上の全語彙逆KLで最適化され、標準のPDフレームワークが保持される。
8B-to-2B蒸留では、FP-OPDは7つの評価されたマルチモーダルベンチマークをすべて改善する。
プレトレーニングを受けた生徒の平均スコアは2.77ポイント、標準PDよりも1.60ポイント上昇する。
これらの結果は、局所的に実現可能な教師補正が、コンパクトな視覚言語モデルを蒸留する上で、より効果的なターゲットとなることを示している。
関連論文リスト
- Weak-to-Strong On-Policy Distillation [21.651421588571296]
Weak-to-Strong On-Policy Distillation (W2S-OPD)を導入した。
4つの数学と3つのコードベンチマークで、W2S-OPDはOPDを上回り、学生がドメイン教師を超越し、監督源が弱くなっても改善を続けることができる。
論文 参考訳(メタデータ) (2026-07-28T20:31:48Z) - Contrastive On-Policy Distillation [36.47487086937924]
対照的なオンライン蒸留フレームワークである COPD を提案する。
COPDは生徒モデルに直接、より簡潔で効率的な推論戦略を学ぶよう促す。
論文 参考訳(メタデータ) (2026-07-21T12:35:04Z) - DemoPSD: Disagreement-Modulated Policy Self-Distillation [49.30809363804017]
大規模言語モデルを訓練するための実践的な方法として、オンデマンド自己蒸留が登場している。
DemoPSDは、教師と生徒の分布の重み付けされた幾何学的組み合わせに向けて学生を操縦する。
論文 参考訳(メタデータ) (2026-07-02T17:58:29Z) - DOPD: Dual On-policy Distillation [59.65986569617147]
オンライン蒸留は、高密度のトークンレベルの信号で学生サンプルの軌跡を監督することで、優れた容量転送を提供する。
特権教師と特権学生の政策の間のトークンレベルの監督を動的にルーティングするアドバンテージ・アウェアな二重蒸留パラダイムであるDOPDを提案する。
大きな言語モデル(LLM)と視覚言語モデル(VLM)の両方の実験は、DOPDがバニラPDを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-06-29T17:55:53Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning [45.79647925282674]
On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-05-20T18:14:03Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - On-Policy Distillation with Best-of-N Teacher Rollout Selection [54.91780727674628]
本報告では, オンライン蒸留のためのベスト・オブ・Nロールアウト教員選抜フレームワークBRTSを提案する。
BRTSは、教師軌道から構築された教師コンテキスト管理ブランチで、標準の学生コンテキストOPDを強化する。
BRTSは、挑戦的な推論ベンチマークにおいて、標準的なPDよりも改善されており、より難しいデータセットに対して最大の利益がある。
論文 参考訳(メタデータ) (2026-05-10T19:49:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。