論文の概要: VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs
- arxiv url: http://arxiv.org/abs/2609.16722v1
- Date: Tue, 15 Sep 2026 06:47:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.377594
- Title: VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs
- Title(参考訳): VideoMM:効率的なビデオMLLMのための適応マクロマイクロ推論
- Abstract要約: VideoMMは、モデル中心のダウンサイズから適応的な知覚的粒度へのパラダイムシフトである。
6.13$times$のスピードアップと、LongVideoBenchのフルコンテキストベースラインよりも7.4%の精度向上を実現している。
- 参考スコア(独自算出の注目度): 38.33158077819229
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling Multimodal Large Language Models (MLLMs) to long-form video understanding is bottlenecked by the explosion of visual tokens, which saturates context windows and incurs prohibitive costs. Current solutions predominantly rely on auxiliary models for token reduction but face a fundamental dilemma: lightweight encoder-driven approaches often overlook critical semantic information, whereas heavyweight MLLM-driven reduction negates the efficiency gains. {In this work, we identify a more fundamental inefficiency underlying this dilemma: while fine-grained visual details are essential for detailed understanding, they are largely redundant for the preliminary task of selecting semantically relevant regions. } Motivated by this, we introduce \textbf{VideoMM}, which marks a paradigm shift from model-centric downsizing to adaptive perceptual granularity. Specifically, our framework {decouples selection from reasoning} by executing semantic filtering on a cost-effective \textit{Macro Proxy} (derived from downscaled frames), and projecting the selected regions onto high-fidelity \textit{Micro Tokens} for detailed understanding only when necessary. Extensive evaluations show that VideoMM significantly outperforms existing solutions. It achieves a 6.13$\times$ speedup and a 7.4\% accuracy gain over full-context baselines on LongVideoBench, and further accelerates inference by 2.73$\times$ over current leading methods, establishing a highly scalable paradigm for long-video understanding. Our code is available at: https://github.com/adfh917k/VideoMM.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)の長期ビデオ理解への拡張は、コンテキストウィンドウを飽和させ、禁止コストを発生させる視覚トークンの爆発によってボトルネックとなる。
軽量エンコーダ駆動のアプローチは、しばしば重要な意味情報を見落としてしまうが、重いMLLM駆動の還元は効率の向上を否定する。
この研究において、我々はこのジレンマの根底にあるより基本的な非効率性を識別する:細粒度の視覚的詳細は詳細な理解に不可欠であるが、意味的に関係のある領域を選択するための予備的なタスクには、ほとんど冗長である。
モデル中心のダウンサイズ化から適応的な知覚的粒度へのパラダイムシフトを示す。
具体的には、コスト効率の良い \textit{Macro Proxy} 上でセマンティックフィルタリングを実行し、選択した領域を高忠実な \textit{Micro Tokens} に投影し、必要なときにのみ詳細な理解を行うことにより、推論から選択を分離する。
大規模な評価では、ビデオMMは既存のソリューションよりも大幅に優れていた。
これは、LongVideoBenchのフルコンテキストベースラインよりも6.13$\times$のスピードアップと7.4\%の精度向上を実現し、現在のリードメソッドよりも2.73$\times$の推論を加速し、ロングビデオ理解のための高度にスケーラブルなパラダイムを確立する。
私たちのコードは、https://github.com/adfh917k/VideoMM.comで利用可能です。
関連論文リスト
- FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding [55.700832127331324]
FLoCは、施設位置関数に基づく効率的なビジュアルトークン圧縮フレームワークである。
本手法は,トークンのコンパクトな部分集合を迅速に選択することにより,顕著な効率向上を実現する。
私たちのアプローチは、トレーニング不要、モデル非依存、クエリ非依存で、汎用的なソリューションを提供しています。
論文 参考訳(メタデータ) (2025-10-31T17:29:39Z) - Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding [56.45689495743107]
Vgentは、長いビデオ理解のためにLVLMを強化するグラフベースの検索推論拡張生成フレームワークである。
我々は,3つの長ビデオ理解ベンチマークを用いて,様々なオープンソースLVLMを用いてフレームワークの評価を行った。
論文 参考訳(メタデータ) (2025-10-15T19:14:58Z) - Reasoning-Enhanced Domain-Adaptive Pretraining of Multimodal Large Language Models for Short Video Content Governance [34.134289344567705]
本稿では,不適切なコンテンツ検出を統一するためのMLLM事前学習パラダイムを提案する。
短いビデオコンテンツとMLLMのオリジナル事前学習データとの分配ギャップに対処するために,3つの目標事前学習タスクを導入する。
実験結果から,ゼロショットおよび教師付き微調整環境におけるMLLMの性能は,事前学習により有意に向上することが示された。
論文 参考訳(メタデータ) (2025-09-25T19:46:34Z) - Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration [24.337139909108117]
過剰なフレームが文脈の希釈によってパラドックス的に性能を低下させる「レスはそれ以上」現象である。
視覚エコー」は「視覚エコー」という時間的冗長性を有する
AFP"は、ResNet-50とCLIPの機能空間に適応的な階層的クラスタリングアルゴリズムを用いて、これらのエコーを単一の代表に識別し、マージする。
我々の完全なアプローチは、必要なフレームを86.9%まで、合計入力トークンを83.2%まで劇的に削減することを示しています。
論文 参考訳(メタデータ) (2025-08-05T11:31:55Z) - Free-MoRef: Instantly Multiplexing Context Perception Capabilities of Video-MLLMs within Single Inference [88.57742986765238]
Free-MoRefは、ビデオMLLMのコンテキスト認識能力を多重化するトレーニング不要のアプローチである。
実験によると、Free-MoRefは1つのA100 GPUで圧縮することなく、2$times$から8$times$の入力フレームを完全に認識できる。
論文 参考訳(メタデータ) (2025-08-04T07:31:10Z) - CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms [16.41418610688371]
性能劣化を最小限に抑えた視覚トークン量を大幅に削減するCrossLMMを提案する。
また,テキスト・ツー・ビジュアル・クロスアテンション機構を導入し,テキスト・トークンを元のビジュアル・トークンとのインタラクションによって拡張する。
提案手法は,多様なビデオベース大規模言語モデルベンチマークにおいて,同等あるいは優れた性能を実現する。
論文 参考訳(メタデータ) (2025-05-22T17:59:53Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - Adaptive Keyframe Sampling for Long Video Understanding [75.7837692594814]
本稿では、適応鍵フレームサンプリング(AKS)という、単純だが効果的なアルゴリズムを提案する。
これはAdaptive Keyframe Sampling (AKS)と呼ばれるプラグインとプレイモジュールを挿入し、ビデオトークンの固定数で有用な情報を最大化することを目的としている。
2つの長いビデオ理解ベンチマークの実験は、AKSが情報的出会いを選択する際にビデオQA精度を改善することを検証する。
論文 参考訳(メタデータ) (2025-02-28T17:46:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。