論文の概要: Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs
- arxiv url: http://arxiv.org/abs/2609.10355v1
- Date: Wed, 09 Sep 2026 15:50:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:09.08742
- Title: Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs
- Title(参考訳): ビデオがなぜ重要か? : ビデオとオーディオのLLMにおける推論効率のメカニズムに関する調査
- Abstract要約: ビデオ理解はビデオ大言語モデル(VideoLLMs)へと急速に進化した
キャプション、質問応答、検索、時間的グラウンドにおける彼らの強いパフォーマンスは、フレーム数とコンテキストの長さで増大する計算とメモリコストである。
この調査では、パラメータ数、入力毎のFLOP、レイテンシ、メモリ、およびビジュアルおよびオーディオトークン数の具体的な削減を報告した、視覚的およびオーディオ的ビデオLLMの推論効率メカニズムについて取り上げる。
- 参考スコア(独自算出の注目度): 2.1665689529884697
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video understanding has rapidly evolved toward video large language models (VideoLLMs): systems that couple video representations with pretrained large language models and condition generation on a textual prompt. Their strong performance on captioning, question answering, retrieval and temporal grounding comes at a computation and memory cost that grows with frame count and context length, limiting deployment in real-time, mobile and resource-constrained settings. This survey covers inference-efficiency mechanisms for visual and audiovisual VideoLLMs that report concrete reductions in parameter count, FLOPs per input, latency, memory, or visual and audio token count. We analyze bottlenecks across frame sampling, modality encoding, connector-level token reduction, and LLM prefilling and decoding. We organize methods by the pipeline stage at which they act, covering VideoLLMs developed since late 2022 together with earlier frame-sampling and vision-encoder mechanisms that remain components of current pipelines. We assemble literature-reported accuracy--cost comparisons under shared host models and input protocols wherever available, distinguish them from heterogeneous cross-paper evidence, and identify gaps in audiovisual efficiency and standardized evaluation. We maintain a repository at https://github.com/momentslab/awesome-efficient-videollm.
- Abstract(参考訳): ビデオ理解はビデオ大言語モデル (VideoLLMs) へと急速に進化してきた。
キャプション、質問応答、検索、時間的グラウンドにおける彼らの強力なパフォーマンスは、フレーム数とコンテキストの長さで増大する計算とメモリコストであり、リアルタイム、モバイル、リソース制限された設定でのデプロイメントを制限する。
この調査では、パラメータ数、入力毎のFLOP、レイテンシ、メモリ、およびビジュアルおよびオーディオトークン数の具体的な削減を報告した、視覚的およびオーディオ的ビデオLLMの推論効率メカニズムについて取り上げる。
我々は,フレームサンプリング,モダリティ符号化,コネクタレベルのトークン削減,LLMプリフィルとデコーディングのボトルネックを分析した。
2022年後半に開発されたVideoLLMと、現在のパイプラインのコンポーネントである以前のフレームサンプリングとビジョンエンコーダ機構を対象とする、パイプラインステージによるメソッドの編成を行う。
我々は,共用ホストモデルと入力プロトコルに基づいて文献報告された精度-コスト比較を組み立て,異種クロスペーパーエビデンスと区別し,オーディオ視覚効率と標準化された評価のギャップを識別する。
私たちはhttps://github.com/momentslab/awesome- efficient-videollm.comにリポジトリを保持します。
関連論文リスト
- Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs [81.04673240949074]
強化学習は、大規模言語モデルの推論能力を改善した。
結果のみの報酬をビデオマルチモーダルな大規模言語モデルに適用することは、どの視覚的証拠が答えを支持するべきかを限定的なガイダンスを提供する。
本稿では,エビデンス対応ビデオ推論のための時間アノテーションフリープロセスレベル報酬フレームワークであるConsensus Frame GRPOを紹介する。
論文 参考訳(メタデータ) (2026-06-16T19:42:54Z) - SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM [36.28285195488772]
大規模言語モデル(LLM)は、テキスト理解において例外的な能力を示した。
Vid-LLMは高品質なフレームレベルのセマンティック情報を同時に保持するのに苦労する。
この制限は、Vid-LLMの微細なビデオ理解への進歩を妨げる。
論文 参考訳(メタデータ) (2026-02-03T14:39:16Z) - TV-RAG: A Temporal-aware and Semantic Entropy-Weighted Framework for Long Video Retrieval and Understanding [14.570869250170139]
TV-RAGは、時間的アライメントとエントロピー誘導のセマンティクスを結合して、長時間ビデオの推論を改善する、トレーニング不要のアーキテクチャである。
これらの時間的および意味的な信号を織り合わせることで、TV-RAGは、再トレーニングや微調整なしに任意のLVLMに移植できる二重レベルの推論ルーチンを実現する。
論文 参考訳(メタデータ) (2025-12-29T14:10:22Z) - FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding [55.700832127331324]
FLoCは、施設位置関数に基づく効率的なビジュアルトークン圧縮フレームワークである。
本手法は,トークンのコンパクトな部分集合を迅速に選択することにより,顕著な効率向上を実現する。
私たちのアプローチは、トレーニング不要、モデル非依存、クエリ非依存で、汎用的なソリューションを提供しています。
論文 参考訳(メタデータ) (2025-10-31T17:29:39Z) - ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts [56.75723197779384]
ARC-Hunyuan-Videoは、構造化理解のために視覚、音声、テキストの信号をエンドツーエンドに処理するマルチモーダルモデルである。
本モデルでは,複数粒度のタイムスタンプ付きビデオキャプションと要約,オープンなビデオ質問応答,時間的ビデオグラウンド,ビデオ推論が可能である。
論文 参考訳(メタデータ) (2025-07-28T15:52:36Z) - Multimodal Long Video Modeling Based on Temporal Dynamic Context [13.979661295432964]
時間的動的コンテキスト(TDC)と呼ばれるフレーム間の時間的関係を利用した動的長ビデオ符号化手法を提案する。
ビデオはフレーム間の類似性に基づいて意味的に一貫したシーンに分割し、各フレームを視覚音響エンコーダを使用してトークンにエンコードする。
極端に長いビデオを扱うために,複数のビデオセグメントから回答を段階的に抽出する学習自由連鎖戦略を提案する。
論文 参考訳(メタデータ) (2025-04-14T17:34:06Z) - VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers [23.541896057977745]
VideoScanは、リアルタイムビデオインタラクションのための効率的な視覚言語モデル(VLM)推論フレームワークである。
VideoScanでは、各フレームを表すために単一のセマンティックキャリアトークンを使用している。
論文 参考訳(メタデータ) (2025-03-12T13:30:40Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding [65.46303012350207]
LongVUは、長いビデオの視覚的詳細を保存しながら、ビデオトークンの数を減らす適応圧縮機構である。
DINOv2の機能を利用して、高い類似性を示す冗長なフレームを削除します。
時間的依存関係に基づいて,フレーム間の空間トークン削減を行う。
論文 参考訳(メタデータ) (2024-10-22T21:21:37Z) - Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization [52.63845811751936]
ダイナミックスビデオのモデリングのため、ビデオ事前トレーニングは難しい。
本稿では,ビデオ事前学習におけるこのような制限を,効率的なビデオ分解によって解決する。
筆者らのフレームワークは,13のマルチモーダルベンチマークにおいて,画像と映像のコンテントの理解と生成が可能であることを実証した。
論文 参考訳(メタデータ) (2024-02-05T16:30:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。