論文の概要: Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models
- arxiv url: http://arxiv.org/abs/2608.03112v1
- Date: Tue, 04 Aug 2026 04:32:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.033979
- Title: Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models
- Title(参考訳): ビデオ言語モデルにおける効率的な推論のための適応的2段階視覚トーンプルーニング
- Abstract要約: 視覚言語モデルは画像やビデオの理解が優れているが、高い推論遅延に悩まされている。
本稿では,ビデオ処理に特化して設計された2段階適応型トークンプルーニング戦略を提案する。
我々の手法は完全にポストホックであり、訓練や微調整は必要ありません。
- 参考スコア(独自算出の注目度): 6.202364388194408
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models excel at image and video understanding but suffer from high inference latency due to the need to process thousands of tokens per image, limiting their deployment on resource-constrained edge devices and in real-time surveillance applications. This challenge is further amplified in video processing, where multiple frames must be analyzed simultaneously. Existing token reduction techniques are largely developed for single-image inputs and therefore fail to account for the temporal and inter-frame redundancies present in video sequences. In addition, these methods generally rely on a fixed, uniform pruning ratio applied across all inputs, which is suboptimal because the degree of redundancy can vary significantly between different videos, necessitating content-dependent pruning levels to preserve critical information. To address these limitations, we propose a two-stage adaptive token pruning strategy specifically designed for video processing. In the first stage, we prune out the redundant frames, and in the second stage, token-level pruning is applied within the retained frames. Crucially, the pruning ratio in the second stage is determined adaptively based on the content of each video. This is achieved by analyzing the correlation structure of token embeddings to quantify redundancy, which is used to determine the ratio. Importantly, our method is entirely post-hoc and requires no additional training or fine-tuning, while achieving strong empirical gains; notably, it improves accuracy by +7\% on a video captioning benchmark at 10\% token retention, while reducing computation TFLOPs by 95\%.
- Abstract(参考訳): ビジョン言語モデルは画像とビデオの理解に優れていますが、イメージ毎に数千のトークンを処理する必要があり、リソース制約のあるエッジデバイスやリアルタイム監視アプリケーションへのデプロイが制限されるため、高い推論レイテンシに悩まされます。
この課題はビデオ処理においてさらに増幅され、複数のフレームを同時に分析する必要がある。
既存のトークン低減技術は、主にシングルイメージ入力のために開発されており、ビデオシーケンスに存在する時間的およびフレーム間冗長性を考慮していない。
さらに、これらの手法は一般に、すべての入力に対して適用される固定された均一なプルーニング比に依存しており、これは、重要な情報を保持するためにコンテンツ依存プルーニングレベルを必要とするため、異なるビデオ間で冗長性の程度が著しく異なるため、最適ではない。
これらの制約に対処するため,ビデオ処理に特化して設計された2段階適応型トークンプルーニング戦略を提案する。
第1段階では冗長フレームを抜粋し,第2段階では,保持フレーム内にトークンレベルのプルーニングを適用する。
要は、各映像の内容に基づいて第2段のプルーニング比を適応的に決定する。
これは、トークン埋め込みの相関構造を分析して、その比率を決定するために使用される冗長性を定量化する。
特に,ビデオキャプションベンチマークにおいて,トークン保持率10\%で精度を+7\%向上し,計算TFLOPを95\%削減する。
関連論文リスト
- Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting [18.71433885255431]
適応的ビデオトークン化(Adaptive Video tokenisation)は、シーケンスの基盤となる視覚的複雑さに基づいて、トークンの予算を動的に割り当てる。
凍結連続ビデオトークンの潜伏空間は,直接利用可能な時間的冗長性を本質的に符号化していることを示す。
パラメータフリー適応トークン割り当て機構を導入し,時間-L1差分に対する固定しきい値を適用した。
論文 参考訳(メタデータ) (2026-06-04T13:31:12Z) - PARE: Pruning and Adaptive Routing for Efficient Video Generation [71.54959622788608]
ビデオ拡散変換器(DiT)は高品質なビデオを生成するが、広いブロック、深いアーキテクチャ、反復的なサンプリングのためにかなりの計算を必要とする。
最近の手法では、幅、深さ、サンプリングのステップを圧縮することでコストを削減するが、通常は個々の入力に適応できない固定されたアーキテクチャにコミットする。
本稿では,構造対応プルーニングと入力適応ルーティングを併用して,幅と深さを共同で圧縮するPAREを提案する。
論文 参考訳(メタデータ) (2026-05-26T17:43:25Z) - StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding [29.539015046656615]
重要な情報を保持しつつコンテキスト長を削減する手段としてトークンプルーニングを提案する。
具体的には、空間隣接ビデオトークン(MSSAVT)に対する最大類似性という新しい冗長度指標を導入する。
マスク付きプルーニング戦略も設計し、互いに不適切なトークンがプルーニングされることを保証します。
論文 参考訳(メタデータ) (2025-12-14T05:35:11Z) - Dense Video Understanding with Gated Residual Tokenization [49.17263029080152]
高時間分解能は、ビデオ理解における微細な細部を捉えるのに不可欠である。
現在のベンチマークは主に低フレームレートサンプリングに依存している。
Dense Video Understanding (DVU)は、トークン化時間とトークンオーバーヘッドの両方を削減することで、高FPSビデオの理解を可能にする。
論文 参考訳(メタデータ) (2025-09-17T17:34:40Z) - FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers [63.788600404496115]
FullDiT2は、ビデオ生成と編集の両方における一般的な制御性のための効率的なコンテキスト内条件付けフレームワークである。
FullDiT2は、拡散ステップ当たりの平均時間コストにおいて、計算の大幅な削減と2~3倍の高速化を実現している。
論文 参考訳(メタデータ) (2025-06-04T17:57:09Z) - VideoScan: Enabling Efficient Streaming Video Understanding via Frame-level Semantic Carriers [23.541896057977745]
VideoScanは、リアルタイムビデオインタラクションのための効率的な視覚言語モデル(VLM)推論フレームワークである。
VideoScanでは、各フレームを表すために単一のセマンティックキャリアトークンを使用している。
論文 参考訳(メタデータ) (2025-03-12T13:30:40Z) - Transform-Equivariant Consistency Learning for Temporal Sentence
Grounding [66.10949751429781]
ビデオ毎により差別的な表現を学習するために,新しい同変一貫性規則学習フレームワークを導入する。
私たちのモチベーションは、クエリ誘導アクティビティの時間的境界を一貫して予測することにある。
特に,ビデオの完全性と滑らか性を高めるために,自己教師付き一貫性損失モジュールを考案した。
論文 参考訳(メタデータ) (2023-05-06T19:29:28Z) - ASCNet: Self-supervised Video Representation Learning with
Appearance-Speed Consistency [62.38914747727636]
本研究では,1)明示的な監督のためのラベルの欠如,2)構造化されていない,ノイズの多い視覚情報による自己指導型映像表現学習について検討する。
既存の方法は、主にビデオクリップをインスタンスとしてコントラスト損失を使用し、互いにインスタンスを識別することで視覚的表現を学ぶ。
本稿では,ロバストな映像表現を学ぶ上で,正のサンプル間の一貫性が鍵となることを観察する。
論文 参考訳(メタデータ) (2021-06-04T08:44:50Z) - Temporal Distinct Representation Learning for Action Recognition [139.93983070642412]
2次元畳み込みニューラルネットワーク (2D CNN) はビデオの特徴付けに用いられる。
ビデオの異なるフレームは同じ2D CNNカーネルを共有しており、繰り返し、冗長な情報利用をもたらす可能性がある。
本稿では,異なるフレームからの特徴の識別チャネルを段階的にエキサイティングにするためのシーケンシャルチャネルフィルタリング機構を提案し,繰り返し情報抽出を回避する。
本手法は,ベンチマーク時相推論データセットを用いて評価し,それぞれ2.4%,1.3%の可視性向上を実現している。
論文 参考訳(メタデータ) (2020-07-15T11:30:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。