論文の概要: OPOD: On-Policy Omni Distillation
- arxiv url: http://arxiv.org/abs/2607.20918v2
- Date: Fri, 24 Jul 2026 07:07:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:30.983704
- Title: OPOD: On-Policy Omni Distillation
- Title(参考訳): OPOD:オンポリシィオムニ蒸留
- Authors: Tong Zhao, Yuyang Hu, Yutao Zhu, Reed Li, Haijin Liang, Haibo Shi, Yu Lu, Zhicheng Dou,
- Abstract要約: プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
- 参考スコア(独自算出の注目度): 55.440058537827134
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Omni-modal models can handle text, images, and audio in one system, but improving all of these abilities together remains difficult. Training a single model on pooled multimodal data often fails to match models specialized for individual modalities. On-policy distillation (OPD) offers a way to combine such specialists: the student generates a response, and a teacher evaluates that same response, so the student learns directly from behaviors it actually produces. Yet using several teachers can introduce competing guidance and improve one modality at the expense of another. We present On-Policy Omni Distillation (OPOD), which routes each student response to the matching text, image, or audio teacher. OPOD keeps teacher guidance only on tokens where the teacher assigns a higher probability than the student, adjusts the influence of each modality teacher independently during training, and asks the routed teacher to assess both the final answer and whether the reasoning supports the correct answer. Across twelve benchmarks and three backbone sizes, OPOD achieves the best average score at every scale, reaching 70.8, 51.7, and 46.2 and exceeding the strongest comparator by 2.1, 1.8, and 1.7 points. On the 30B model, it outperforms both the base model and a counterpart post-trained jointly on pooled multimodal data on all twelve benchmarks, and ranks first or second on eleven even when the individual specialists are included. The specialists are discarded after training, leaving one deployable omni-modal model. These results show that coordinating modality-specific teachers is an effective way to improve a shared model while maintaining cross-modal balance.
- Abstract(参考訳): オムニモーダルモデルは1つのシステムでテキスト、画像、音声を扱うことができるが、これらすべての能力を同時に改善することは困難である。
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
オンライン蒸留(OPD)は、学生が反応を生成し、教師が同じ反応を評価することによって、学生が実際に発生する行動から直接学習する、そのような専門家を組み合わせる方法を提供する。
しかし、複数の教師が競合する指導を導入し、他の教師を犠牲にして1つのモダリティを改善できる。
本報告では,オムニ蒸留法(Omni Distillation,OPOD)について述べる。
OPODは、教師が生徒よりも高い確率を割り当てるトークンにのみ教師指導を保持し、訓練中に各モダリティ教師の影響を個別に調整し、ルーティングされた教師に最終回答と正しい回答を支持するかどうかを判断する。
12のベンチマークと3つのバックボーンサイズで、OPODは各スケールで最高の平均スコアを獲得し、70.8, 51.7, 46.2に達し、2.1, 1.8, 1.7ポイントの最も高いコンパレータを超えた。
30Bモデルでは、12のベンチマークすべてでプールされたマルチモーダルデータに対して、ベースモデルと、それと共同でトレーニングされた後訓練後の双方を上回り、個々のスペシャリストが含まれた場合でも、11で1位または2位にランク付けする。
専門家は訓練後に放棄され、1つのデプロイ可能なオムニモーダルモデルを残します。
これらの結果から,モダリティ固有の教師の調整は,モダリティ間のバランスを維持しつつ,共有モデルを改善する効果的な方法であることが示唆された。
関連論文リスト
- H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation [31.41588745047352]
H-OPDはマルチモーダル推論のための信頼度を考慮したヘテロジニアスマルチテラーPDフレームワークとして提案されている。
同じ推論プロセスで異種教員の相補性を検証することにより、H-OPDはタスクやサンプルレベルの教師ルーティングを置き換える。
H-OPDは、テキストのみの教師が重要な視覚的意味論にアクセスできるようにするために、視覚から言語への記述転送を利用する。
論文 参考訳(メタデータ) (2026-07-01T07:37:10Z) - Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles [32.54156025863882]
強化学習駆動オーケストレーションフレームワークであるMaestroを紹介します。
Maestroは、階層的なモデルスキルレジストリ上でのシーケンシャルな意思決定プロセスとして、異質なマルチモーダルタスクを再構成する。
数学的推論,チャート理解,高分解能知覚,ドメイン固有分析を対象とする10の代表的なマルチモーダルベンチマークに対して,Maestroの評価を行った。
論文 参考訳(メタデータ) (2026-05-21T08:47:49Z) - When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning [45.79647925282674]
On-policy Self-distillation (OPSD) は、特権教師を使って生徒を自身のロールアウトで訓練する。
既存のエントロピーに基づくPD手法は、教師エントロピーによるトークンレベルの監督を調節することで、この一様性を緩和する。
そこで我々は,PW-OPSD(Pight-Weighted On-Policy Self-Distillation)を提案する。
論文 参考訳(メタデータ) (2026-05-20T18:14:03Z) - Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe [53.40076304466524]
LLM(Large Language Models)とMLLM(Multimodal Large Language Models)をまたいで一般化する統一OPDフレームワークであるUni-OPDを提案する。
具体的には、学生の立場から、学習中の情報発信状態の探索を促進するために、2つのデータバランス戦略を採用する。
我々は,正しい軌道と間違った軌道の順序の整合性を取り戻すために,結果誘導マージンキャリブレーション機構を開発した。
論文 参考訳(メタデータ) (2026-05-05T12:15:21Z) - UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models [59.693733170193944]
大規模言語モデル(LLM)は、教育環境において、回答提供者からインテリジェントな家庭教師へとシフトしている。
最近の強化学習アプローチはこの制限に対処するが、2つの重要な課題に直面している。
これらの課題に対処するために一方向認知最適化法(UCO)を提案する。
論文 参考訳(メタデータ) (2025-11-12T01:27:02Z) - Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation [47.814833568523255]
PerSynは、各学生モデルに適したデータを作成するために、新しいRoute、Generateのパラダイムの下で運用されている。
モデルファミリとスケールの異なる実験は、PerSynが一貫して優れたパフォーマンスまたは同等のパフォーマンスを達成していることを示している。
論文 参考訳(メタデータ) (2025-10-13T02:36:36Z) - More Than One Teacher: Adaptive Multi-Guidance Policy Optimization for Diverse Exploration [103.1589018460702]
ガイダンス・オン・デマンド」アプローチは、自己発見の価値を保ちながら探究を広げる。
実験の結果、AMPOは強いベースラインを大幅に上回ることが示された。
ピアサイズの4人の教師を用いて、より強力な1人の教師を活用できる手法に匹敵する結果が得られる。
論文 参考訳(メタデータ) (2025-10-02T17:14:00Z) - Merge-of-Thought Distillation [23.53356244978525]
マージ・オブ・ソート蒸留(Merge-of-Thought Distillation、MoT)は、教師固有の教師付き微調整ブランチと、結果として生じる生徒の変種をマージする重み空間を代替する軽量フレームワークである。
競合数学のベンチマークでは、Qwen3-14Bの学生にMoTを適用すると、Deepseek-R1、Qwen3-32B、OpenAI-O1といった強力なモデルを超える。
MoTは、最高の単教師蒸留よりも優れており、数学以外の一般的な推論を改善し、分散シフトとピアレベルの教師に対して堅牢性を示している。
論文 参考訳(メタデータ) (2025-09-10T17:46:57Z) - Learning to Teach with Student Feedback [67.41261090761834]
対話的知識蒸留 (Interactive Knowledge Distillation, IKD) は、教師が生徒のフィードバックから教えることを学ぶことを可能にする。
IKDは教師モデルを訓練し、特定の学生のトレーニングステップごとに特定のソフトターゲットを生成する。
教師と生徒の協調的な最適化は2つの反復的なステップによって達成される。
論文 参考訳(メタデータ) (2021-09-10T03:01:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。