論文の概要: H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation
- arxiv url: http://arxiv.org/abs/2607.02592v1
- Date: Wed, 01 Jul 2026 07:37:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.34321
- Title: H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation
- Title(参考訳): H-OPD:不均一多型型マルチモーダルオン政治蒸留の信頼性
- Abstract要約: H-OPDはマルチモーダル推論のための信頼度を考慮したヘテロジニアスマルチテラーPDフレームワークとして提案されている。
同じ推論プロセスで異種教員の相補性を検証することにより、H-OPDはタスクやサンプルレベルの教師ルーティングを置き換える。
H-OPDは、テキストのみの教師が重要な視覚的意味論にアクセスできるようにするために、視覚から言語への記述転送を利用する。
- 参考スコア(独自算出の注目度): 31.41588745047352
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: On-policy distillation (OPD) has recently emerged as an effective post-training paradigm by providing supervision on student-generated trajectories. However, existing OPD methods for multimodal reasoning usually rely on a static teacher routing, assigning each sample to a single teacher based on modality or task type. This ignores that visual grounding and abstract reasoning may dominate different decoding steps, making a single teacher insufficient for the full trajectory. To this end, H-OPD is proposed as a confidence-aware heterogeneous multi-teacher OPD framework for multimodal reasoning. By verifying the complementarity of heterogeneous teachers in the same reasoning process, H-OPD replaces task or sample level teacher routing with token-level teacher arbitration along the shared student trajectory. H-OPD employs vision-to-language description transfer to enable text-only teachers to access key visual semantics, and uses a confidence-aware arbitration mechanism to dynamically combine vision-language teacher and text-only teachers at each token. Extensive evaluations over 11 widely-used reasoning benchmarks showcase the superior performance of our method.
- Abstract(参考訳): オンライン蒸留(OPD)は近年,学生が生み出す軌跡の監督を行うことによって,効果的なポストトレーニングパラダイムとして登場した。
しかし、既存のマルチモーダル推論のためのPDメソッドは、通常静的な教師ルーティングに依存し、各サンプルをモダリティやタスクタイプに基づいて単一の教師に割り当てる。
このことは、視覚的接地と抽象的推論が異なる復号ステップを支配している可能性を無視しており、単一の教師が完全な軌道に不十分である。
この目的のために、H-OPDはマルチモーダル推論のための信頼度に配慮した異種マルチテラーPDフレームワークとして提案されている。
同じ推論プロセスで異種教員の相補性を検証することにより、H-OPDは、タスクやサンプルレベルの教師のルーティングを、共有学生軌道に沿ったトークンレベルの教師仲裁に置き換える。
H-OPDは、テキストのみの教師が主要な視覚的セマンティクスにアクセスできるようにするために、視覚から言語への記述転送を採用しており、信頼を意識した調停機構を使用して、各トークンで視覚言語教師とテキストのみの教師を動的に組み合わせている。
提案手法の優れた性能を示すため,11種以上の大規模評価を行った。
関連論文リスト
- Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models [68.52262705081098]
オンライン蒸留は、生徒自身の方針からサンプリングされた軌跡を監督することによって、教師の能力を伝達する。
OPDは,特定の問題に対する回答よりも,教師の推論行動を伝達することがわかった。
論文 参考訳(メタデータ) (2026-08-17T14:46:53Z) - REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation [10.492445451268727]
REOPDは、オンデマンド蒸留のための信頼性適応型報酬外挿フレームワークである。
信頼性の高い教師参照方向に沿って選択的に外挿しながら、教師のアライメントを保ちます。
論文 参考訳(メタデータ) (2026-08-12T06:15:33Z) - STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models [14.682283642975271]
本稿では,教師を超えて学習対象を拡大する画像生成のためのオンライン蒸留フレームワークSTEP-OPDを提案する。
教師を最終目標として扱う代わりに、各タスク固有の教師と共有ベースモデルの速度差を更なる学習の方向として利用する。
さらに、学生と教師の表現変化の方向と大きさを調整し、学生がどのように表現が徐々に変換されるかを学習できるようにする。
論文 参考訳(メタデータ) (2026-08-05T14:11:27Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context [40.91201403670402]
本研究では,教師が学習可能なソフトプロンプトのみで生徒と異なる方法を提案する。
メソッドは、マージされたコーパスの各例を対応するソフトプロンプトの教師にルーティングすることで、マルチタスク設定に自然に拡張する。
Qwen3-1.7BベースとPhi-4-mini-インストラクタでは、単一タスクの変種が完全な微調整と一致するか、あるいは超える。
論文 参考訳(メタデータ) (2026-06-30T19:56:05Z) - DOPD: Dual On-policy Distillation [59.65986569617147]
オンライン蒸留は、高密度のトークンレベルの信号で学生サンプルの軌跡を監督することで、優れた容量転送を提供する。
特権教師と特権学生の政策の間のトークンレベルの監督を動的にルーティングするアドバンテージ・アウェアな二重蒸留パラダイムであるDOPDを提案する。
大きな言語モデル(LLM)と視覚言語モデル(VLM)の両方の実験は、DOPDがバニラPDを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-06-29T17:55:53Z) - SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation [25.25989941933095]
マルチターンOPD用に設計された検証不要な選択的介入フレームワークであるSAGE-OPDを提案する。
SAGE-OPDは、教師の監督を全ターンで均一に行うのではなく、まず環境フィードバックを観察し、各生徒の反応をスキップするか介入するかを決定するために教師の判断を使用する。
エージェントタスクの実験では、SAGE-OPDはベースラインよりも一貫して改善され、ALFWorldの13.3%の相対的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-17T23:58:14Z) - OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing [62.62736813348113]
大規模言語モデルの強化学習は、複雑な推論タスクにおいて深刻な報酬の分散によって妨げられることが多い。
我々は,フロンティア生成論理を教師側の特権的証拠として利用するフレームワークであるOmniOPSDを提案する。
MER-UniBenchの実験では、OmniOPSDは平均スコアが84.19ドルで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2026-06-14T16:51:22Z) - Breaking the Tokenizer Barrier: On-Policy Distillation across Model Families [32.34854415784466]
On-Policy Distillation (OPD)は、ドメインエキスパートから学生モデルへ知識を伝達するためのLarge Language Models (LLM)のポストトレーニングにおいて、中核となる技術となっている。
既存のOPD蒸留法では、教師と学生が同じトークン化剤を共有する必要があり、モデルシリーズにおけるPDの適用性を制限している。
本研究では, 標準的なオンライン蒸留法をモデルファミリ間で動作させることにより, 高忠実度トークンレベル信号が異なるトークン化器間で伝搬することを保証する。
論文 参考訳(メタデータ) (2026-06-08T13:12:01Z) - Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation [49.117085054884676]
オンライン蒸留は、より強い教師からの強いフィードバックを使って、学生モデルを独自のロールアウトで訓練する。
我々は、この原則を軌跡固有のリリースルールで運用する。
強弱蒸留作業による実験結果から, この放出規則は標準全軌道PDよりも一貫して優れていたことが示唆された。
論文 参考訳(メタデータ) (2026-05-13T15:05:30Z) - Teacher-Guided Policy Optimization for LLM Distillation [90.49982387646861]
Teacher-Guided Policy Optimization (TGPO) は、生徒のロールアウトに条件付き教師予測を活用することで、高密度な方向性誘導を取り入れたオンラインアルゴリズムである。
複雑な推論ベンチマークの実験では、TGPOは標準ベースラインを著しく上回り、異なる教師にとって堅牢であることが示されている。
論文 参考訳(メタデータ) (2026-05-13T09:20:03Z) - Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe [53.40076304466524]
LLM(Large Language Models)とMLLM(Multimodal Large Language Models)をまたいで一般化する統一OPDフレームワークであるUni-OPDを提案する。
具体的には、学生の立場から、学習中の情報発信状態の探索を促進するために、2つのデータバランス戦略を採用する。
我々は,正しい軌道と間違った軌道の順序の整合性を取り戻すために,結果誘導マージンキャリブレーション機構を開発した。
論文 参考訳(メタデータ) (2026-05-05T12:15:21Z) - "The Whole Is Greater Than the Sum of Its Parts": A Compatibility-Aware Multi-Teacher CoT Distillation Framework [16.96094045628127]
CoT(Chain-of-Thought)推論は、大きな言語モデル(LLM)に優れた能力を与えるが、通常は禁止的なパラメータスケールを必要とする。
CoT蒸留は、推論技術をコンパクトな学生モデル(SLM)に伝達するための有望なパラダイムとして登場した。
我々は,教師の勾配を動的に重み付けすることで,教師の指導を適応的に融合させるフレームワークCompactを紹介する。
論文 参考訳(メタデータ) (2026-01-20T14:05:19Z) - Heuristic-Free Multi-Teacher Learning [0.6597195879147557]
Teacher2Taskは、手動のアグリゲーションを不要にする、マルチ先生学習のための新しいフレームワークである。
集約されたラベルに頼る代わりに、このフレームワークは、Nの教師による基礎的な真理ラベルとアノテーションからなるトレーニングデータをN+1の異なるタスクに変換する。
論文 参考訳(メタデータ) (2024-11-19T18:45:16Z) - Representation Consolidation for Training Expert Students [54.90754502493968]
マルチヘッド多タスク蒸留法は,タスク固有の教師の表現を集約し,下流のパフォーマンスを向上させるのに十分であることを示す。
また,本手法では,複数のドメインで訓練された複数の教師の表現的知識を1つのモデルに組み合わせることができる。
論文 参考訳(メタデータ) (2021-07-16T17:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。