論文の概要: Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding
- arxiv url: http://arxiv.org/abs/2609.09300v1
- Date: Tue, 08 Sep 2026 18:00:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.772455
- Title: Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding
- Title(参考訳): Video-MOPD: ビデオ理解のためのマルチ教師のオンライン蒸留
- Abstract要約: ビデオ理解は、知覚、時間的理解、複雑な推論にまたがる相補的能力の収束を要求する。
本稿では,ビデオ理解タスク専用のオープンウェイトモデルであるVideo-MOPD-8Bを紹介する。
我々は3つのコアドメイン(VTG、一般ビデオ理解、ビデオSTEM推論)を対象とする強化学習(RL)の最適化を行う。
- 参考スコア(独自算出の注目度): 32.55965761036089
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video understanding demands a convergence of complementary capabilities across perception, temporal understanding, and complex reasoning, which are difficult to jointly optimize within a single model. We introduce Video-MOPD-8B, an open-weight model dedicated to video understanding tasks. To fundamentally enhance its capabilities, we conduct targeted reinforcement learning (RL) optimization across three core domains: video temporal grounding (VTG), general video comprehension, and video STEM reasoning. We then unify their complementary capabilities via Multi-Teacher On-Policy Distillation (MOPD), which consolidates expert knowledge by supervising student-generated trajectories with routed teacher feedback. We further introduce Reliability-Aware Informative Sampling (RAIS), which selects examples with consistently reliable teacher supervision and large teacher-student performance gaps. Together, these components enable Video-MOPD-8B to achieve coordinated and comprehensive performance gains across diverse video understanding tasks. Extensive experiments on comprehensive benchmarks covering general video understanding, temporal grounding, video reasoning, and video STEM tasks demonstrate that Video-MOPD-8B achieves state-of-the-art performance among existing models at a comparable scale. The trained model weights are available at https://huggingface.co/LandH/Video-MOPD-8B.
- Abstract(参考訳): ビデオ理解は、知覚、時間的理解、複雑な推論にまたがる相補的能力の収束を必要とし、単一のモデル内で協調的に最適化することは困難である。
本稿では,ビデオ理解タスク専用のオープンウェイトモデルであるVideo-MOPD-8Bを紹介する。
本研究は,映像時間グラウンドリング(VTG),一般映像理解,ビデオSTEM推論の3分野を対象として,目標強化学習(RL)の最適化を行う。
次に,多教師オンポリシィ蒸留(MOPD, Multi-Teacher On-Policy Distillation)による相補的能力の統合を行った。
さらに,信頼性の高い教師監督と大きな教師学生のパフォーマンスギャップを有する事例を選定するRAIS(Reliability-Aware Informative Smpling)を紹介する。
これらのコンポーネントによって、ビデオMOPD-8Bは、多様なビデオ理解タスク間で協調的で包括的なパフォーマンス向上を達成することができる。
一般的なビデオ理解、時間的グラウンド、ビデオ推論、ビデオSTEMタスクを含む包括的なベンチマークに関する広範な実験は、ビデオ-MOPD-8Bが既存のモデル間で同等のスケールで最先端のパフォーマンスを達成することを実証している。
トレーニングされたモデルウェイトはhttps://huggingface.co/LandH/Video-MOPD-8Bで入手できる。
関連論文リスト
- VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding [73.10050069618302]
VideoGAIAは、汎用人工知能アシスタントのためのエージェントビデオ理解ベンチマークである。
VideoGAIAには、多様で複雑な現実世界のシナリオをカバーする、モデルと人間の共同設計タスクが271個含まれている。
GPT-5.5やKim-K3のようなフロンティアモデルを含む全ての評価されたMLLMは、ビデオGAIAで60%未満の精度を実現している。
論文 参考訳(メタデータ) (2026-08-12T03:24:44Z) - EasyVideoR1: Easier RL for Video Understanding [51.760544033045726]
検証可能な報酬(RLVR)からの強化学習は,大規模言語モデルの推論能力向上に顕著な効果を示した。
EasyVideoR1は、ビデオ理解タスクで大きな視覚言語モデルをトレーニングするために特別に設計された、完全かつ効率的な強化学習フレームワークである。
論文 参考訳(メタデータ) (2026-04-18T07:56:32Z) - Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models [78.32948112203228]
ビデオ理解はコンピュータビジョンにおける最も困難なフロンティアである。
近年,映像理解タスクにおいて,映像多時間モデルが顕著に出現している。
Surveyは、ビデオ-LMM能力を向上するための統一的なフレームワークを研究者や実践者に提供することを目的としている。
論文 参考訳(メタデータ) (2025-10-06T17:10:44Z) - ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts [56.75723197779384]
ARC-Hunyuan-Videoは、構造化理解のために視覚、音声、テキストの信号をエンドツーエンドに処理するマルチモーダルモデルである。
本モデルでは,複数粒度のタイムスタンプ付きビデオキャプションと要約,オープンなビデオ質問応答,時間的ビデオグラウンド,ビデオ推論が可能である。
論文 参考訳(メタデータ) (2025-07-28T15:52:36Z) - VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding [45.83476222676765]
Instructed Temporal Grounding for Videos (VideoITG) を提案する。
VideoITGの中核は、人間のアノテーションプロセスを明示的に模倣する自動アノテーションフレームワークであるVidThinkerパイプラインである。
我々は,複数のマルチモーダルビデオ理解ベンチマークにおいて,ビデオITGが一貫した性能向上を実現していることを示す。
論文 参考訳(メタデータ) (2025-07-17T17:59:59Z) - Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency [56.475612147721264]
本稿では、離散的かつ連続的な報酬信号を通して意味的推論と時間的推論の両方を監督する二重回帰定式化を提案する。
我々は,ビデオQA,テンポラルビデオグラウンディング,グラウンドドビデオQAを含む8つの代表的なビデオ理解タスクに対するアプローチを評価した。
その結果、MLLMを用いた推論中心のビデオ理解の進展において、報酬設計とデータ選択の重要性が浮き彫りになった。
論文 参考訳(メタデータ) (2025-06-02T17:28:26Z) - SF2T: Self-supervised Fragment Finetuning of Video-LLMs for Fine-Grained Understanding [23.96372422130216]
ビデオベースのLarge Language Models (VideoVid-LLMs) は近年大きく進歩している。
彼らは細かな理解に苦しむが、特に視覚力学やビデオの詳細などの側面においてである。
これらの欠点に対処するため、自己監督的断片化タスクにおける細調整ビデオLLMは、そのきめ細かい映像理解能力を大幅に向上させる。
論文 参考訳(メタデータ) (2025-04-10T13:40:34Z) - STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training [87.58996020705258]
Video Large Language Models (Video-LLMs) は近年,ビデオ理解タスクに強い派生性を示している。
ビデオLLMは、多段階の明示的時間的推論を必要とする構成的推論と、オブジェクトの関係、相互作用、イベントに苦労する。
本稿では,ビデオLLMが生ビデオから推論に富んだ微調整データを生成し,自己改善を実現するための,グラフ誘導型自己学習手法STEPを提案する。
論文 参考訳(メタデータ) (2024-11-29T11:54:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。