論文の概要: VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
- arxiv url: http://arxiv.org/abs/2607.14935v1
- Date: Thu, 16 Jul 2026 12:47:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.097384
- Title: VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
- Title(参考訳): VideoChat3: 効率的で汎用的なビデオ理解のための完全なオープンビデオMLLM
- Abstract要約: VideoChat3は、完全にオープンで効率的で汎用的なビデオ中心のMLLMである。
Inflated 3D Vision Transformer (ID-ViT)とAdaptive Frame Resolution for Streaming Video Perceptionを導入する。
有効性のために、我々は3つの多様な高品質なトレーニングデータセットをキュレートするデータ合成パイプラインを開発した。
- 参考スコア(独自算出の注目度): 82.55178663351913
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in video understanding have spanned motion, long video, and streaming interaction, driving this field toward real-world applications. Despite this progress, current open-source models remain limited in several ways. They often struggle to generalize across diverse video types, making them effective only in specific domains. High computational demands further restrict their efficiency and scalability. Moreover, most models are only partially open, with key components such as training code, strategy, or datasets unavailable, which hinders reproducibility and slows community-driven development. To address these issues, we introduce VideoChat3, a fully open, efficient, and generalist video-centric MLLM. VideoChat3 advances video understanding through two complementary designs. For efficiency, we introduce Inflated 3D Vision Transformer (I3D-ViT) and Adaptive Frame Resolution for Streaming Video Perception, which enables efficient spatiotemporal representation and reduces the cost of processing video inputs during training and inference. For effectiveness, we develop a scalable video data synthesis pipeline that curates three diverse, high-quality training datasets: VideoChat3-Academic2M, VideoChat3-LV116K, and VideoChat3-OL617K, covering general, long-form, and streaming video scenarios, improving the model's generalization across domains. By integrating these designs, VideoChat3 achieves a rare balance of broad generalization and computational efficiency. Experiments across general, long-form, and streaming benchmarks demonstrate that VideoChat3 surpasses prior open-source models with equal or larger parameter counts with only 4B parameters and higher efficiency.
- Abstract(参考訳): ビデオ理解の最近の進歩は、動き、長いビデオ、ストリーミングの相互作用に及び、この分野を現実世界のアプリケーションに向けて推進してきた。
この進歩にもかかわらず、現在のオープンソースモデルは、いくつかの点で制限されている。
彼らは多種多様なビデオタイプにまたがる一般化に苦しむことが多く、特定のドメインでのみ有効である。
高い計算要求は、その効率性とスケーラビリティをさらに制限する。
さらに、ほとんどのモデルは部分的にのみオープンで、トレーニングコードや戦略、データセットが利用できないといった重要なコンポーネントがあるため、再現性が損なわれ、コミュニティ主導の開発が遅くなる。
これらの問題に対処するために、完全にオープンで効率的で汎用的なビデオ中心型MLLMであるVideoChat3を紹介する。
VideoChat3は2つの相補的なデザインを通じて、ビデオの理解を深める。
Inflated 3D Vision Transformer (I3D-ViT) とAdaptive Frame Resolution for Streaming Video Perceptionを導入し、効率的な時空間表現を可能にし、トレーニングや推論中にビデオ入力を処理するコストを削減する。
有効性のために,ビデオChat3-Academic2M,ビデオChat3-LV116K,ビデオChat3-OL617Kという3つの多様な高品質なトレーニングデータセットをキュレートするスケーラブルなビデオデータ合成パイプラインを開発した。
これらの設計を統合することで、VideoChat3は広範な一般化と計算効率のバランスを取ることができる。
一般的な、長いフォーマット、ストリーミングのベンチマークによる実験では、VideoChat3は、4Bパラメータのみと高効率のパラメータ数で、以前のオープンソースモデルを上回ることが示されている。
関連論文リスト
- Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation [50.504140880964336]
本稿では,ビデオ拡散モデルのためのエージェント型,ネイティブな,トレーニング不要なアクセラレーションフレームワークであるSol Video Inferenceを紹介する。
キャッシュ、スパースアテンション、トークンプルーニング、量子化、カーネル融合の5つの広く適用可能なテクニックをエージェントアクセラレーションスタックにまとめる。
ほぼロスレスなVBench品質を維持しながら、エンドツーエンドのアクセラレーションを2倍以上に向上させる。
論文 参考訳(メタデータ) (2026-06-21T17:23:20Z) - Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models [28.68367581677484]
本稿では、情報密度に基づく適応型ビデオサンプリング(AVS)と、マルチモーダル大言語モデル(MLLM)と統合されたオートエンコーダベースの時間的ビデオ圧縮(SVC)を含む、長文ビデオ理解のための新しいエンドツーエンドスキーマを提案する。
提案システムでは,各期間の映像系列から重要な情報を適応的に取得し,重要な識別情報を保存しながら高い圧縮率を達成する。
論文 参考訳(メタデータ) (2026-02-19T22:04:27Z) - ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts [56.75723197779384]
ARC-Hunyuan-Videoは、構造化理解のために視覚、音声、テキストの信号をエンドツーエンドに処理するマルチモーダルモデルである。
本モデルでは,複数粒度のタイムスタンプ付きビデオキャプションと要約,オープンなビデオ質問応答,時間的ビデオグラウンド,ビデオ推論が可能である。
論文 参考訳(メタデータ) (2025-07-28T15:52:36Z) - FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding [17.71123451197036]
ビデオデータの複雑さとコンテキスト処理の制限は、長いビデオの理解を妨げる。
本稿では,複数のフレームを単一の表現に統合する新しいフレームワークであるFiLA-Videoを提案する。
FiLA-Videoは、従来の方法に比べて、長時間ビデオ理解において優れた効率と精度を実現している。
論文 参考訳(メタデータ) (2025-04-29T03:09:46Z) - Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge [57.01131456894516]
現在のビデオ理解モデルは、長いビデオシーケンスの処理、マルチターン対話のサポート、現実の動的シナリオへの適応に苦労している。
本稿では,ストリーミングビデオ推論と対話インタラクションのためのトレーニング不要フレームワークStreamChatを提案する。
我々のフレームワークは並列システムスケジューリング戦略を取り入れており、処理速度を向上し、レイテンシを低減し、現実世界のアプリケーションで堅牢な性能を保証する。
論文 参考訳(メタデータ) (2025-01-23T08:33:10Z) - Making Every Frame Matter: Continuous Activity Recognition in Streaming Video via Adaptive Video Context Modeling [19.205142489726875]
ビデオのアクティビティ認識は、ロボットやAIの具体化においてますます重要になっている。
適応型ビデオコンテキストモデリングにより,これらの問題を克服するための新しいシステムCARSを導入する。
当社のCARSは、一般的なエッジデバイス上で30FPS以上の速度で動作し、すべてのベースラインを1.2%から79.7%の精度で上回っている。
論文 参考訳(メタデータ) (2024-10-19T05:50:00Z) - VideoMamba: State Space Model for Efficient Video Understanding [46.17083617091239]
VideoMambaは既存の3D畳み込みニューラルネットワークとビデオトランスフォーマーの限界を克服する。
線形複雑度演算子は、効率的な長期モデリングを可能にする。
VideoMambaはビデオ理解のための新しいベンチマークを設定している。
論文 参考訳(メタデータ) (2024-03-11T17:59:34Z) - InternVideo: General Video Foundation Models via Generative and
Discriminative Learning [52.69422763715118]
動的および複雑なビデオレベルの理解タスクのための一般的なビデオ基盤モデルであるInternVideoを提案する。
InternVideoは、事前学習対象として、マスク付きビデオモデリングとビデオ言語コントラスト学習を効率的に探索する。
InternVideoは、ビデオアクション認識/検出、ビデオ言語アライメント、オープンワールドビデオアプリケーションなど、39のビデオデータセットの最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2022-12-06T18:09:49Z) - Video Mobile-Former: Video Recognition with Efficient Global
Spatial-temporal Modeling [125.95527079960725]
トランスフォーマーベースのモデルは、主要なビデオ認識ベンチマークで最高のパフォーマンスを達成した。
Video Mobile-Formerはトランスフォーマーベースの最初のビデオモデルであり、1G FLOP内で計算予算を制限している。
論文 参考訳(メタデータ) (2022-08-25T17:59:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。