論文の概要: GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models
- arxiv url: http://arxiv.org/abs/2608.03083v1
- Date: Tue, 04 Aug 2026 03:51:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.023154
- Title: GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models
- Title(参考訳): GSTEP:高効率ビデオ大言語モデルのためのグローバル時空間密度駆動型ビジュアルトーケンプルーニング
- Abstract要約: 本稿では,映像を連続的な時空間情報フローとしてモデル化するプラグアンドプレイプルーニングフレームワークであるGSTEPを提案する。
GSTEPは、高い精度と効率のトレードオフを一貫して達成し、モデルアーキテクチャや評価設定にわたってうまく一般化する。
- 参考スコア(独自算出の注目度): 23.830073542329913
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video large language models (VideoLLMs) achieve strong video understanding performance, but their inference remains expensive due to the large number of redundant spatio-temporal visual tokens in long videos. Existing token pruning methods alleviate this cost by reducing redundant tokens, yet most of them rely on segment-level local pruning, where videos are partitioned into isolated segments and tokens are selected independently within each segment. Such designs may under-preserve short but semantically dense segments and discard tokens that appear non-salient locally but remain critical from a global perspective. To address this issue, we propose GSTEP (Global Spatio-Temporal Density Pruning), a plug-and-play pruning framework that models video as a continuous spatio-temporal information flow. GSTEP constructs a token-level spatio-temporal density by combining a continuous temporal density, obtained from a smoothed centered frame-level change signal, with intra-frame spatial density, and then performs global token sampling by jointly balancing information density and coverage. Extensive experiments on multiple VideoLLMs and public benchmarks demonstrate that GSTEP consistently achieves strong accuracy-efficiency trade-offs and generalizes well across model architectures and evaluation settings. On LLaVA-OneVision-7B, GSTEP prunes 75% of visual tokens, preserves up to 100.2% of the original average performance across benchmarks, and achieves a 1.17 end-to-end speedup.
- Abstract(参考訳): ビデオ大言語モデル (VideoLLMs) はビデオ理解性能は高いが, 長いビデオでは時空間の冗長なトークンが多いため, 推論は高価である。
既存のトークンプルーニング手法は、冗長なトークンを減らすことでこのコストを軽減するが、そのほとんどはセグメントレベルのローカルプルーニングに依存しており、ビデオは分離されたセグメントに分割され、トークンは各セグメント内で独立して選択される。
このような設計は、短くてセマンティックに密集したセグメントを低く保存し、局所的に非塩分に見えるトークンを廃棄する。
この問題に対処するために,ビデオを連続時空間情報フローとしてモデル化するプラグアンドプレイプルーニングフレームワークであるGSTEP(Global Spatio-Temporal Density Pruning)を提案する。
GSTEPは、スムーズな中心フレームレベル変化信号から得られる連続時空間密度とフレーム内空間密度とを組み合わせてトークンレベルの時空間密度を構築し、情報密度とカバレッジを協調的にバランスさせて大域的トークンサンプリングを行う。
複数のVideoLLMと公開ベンチマークに関する大規模な実験は、GSTEPが一貫して高い精度と効率のトレードオフを達成し、モデルアーキテクチャや評価設定にわたってうまく一般化していることを示している。
LLaVA-OneVision-7Bでは、GSTEPは75%の視覚トークンを持ち、ベンチマークの平均性能の最大100.2%を保持し、1.17のエンドツーエンドのスピードアップを達成する。
関連論文リスト
- Tango: Taming Visual Signals for Efficient Video Large Language Models [51.43125826972642]
この研究は、注目に基づく選択と類似性に基づくクラスタリングという、2つの主要なトークン処理パラダイムを再考し、進化させます。
これらのボトルネックに対処するために,視覚信号の利用を最適化する新しいフレームワークであるTangoを提案する。
論文 参考訳(メタデータ) (2026-04-10T17:59:56Z) - HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models [43.7747080569325]
HieraVidは階層的なプルーニングフレームワークで、視覚的冗長性を徐々に動的に減少させる。
HieraVidの有効性を評価するために,広範に使用されている4つのビデオ理解ベンチマークについて広範な実験を行った。
トークンの30%しか保持されていないHieraVidは、それぞれLLaVA-Video-7BとLLaVA-OneVision-7Bのパフォーマンスの98%と99%を維持しながら、新しい最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-04-02T10:40:15Z) - Unified Spatio-Temporal Token Scoring for Efficient Video VLMs [61.08183446817756]
トケンプルーニングは視覚言語モデルの計算効率を高めるために不可欠である。
本稿では,視覚トークンを ViT と LLM の両方にわたってプルークする,シンプルで軽量なモジュールである Spatio-Temporal Token Scoring (STTS) を紹介する。
STTSはアーキテクチャ全体の視覚トークンの50%を突破し、トレーニングと推論の両方で効率が62%向上した。
論文 参考訳(メタデータ) (2026-03-18T17:59:56Z) - Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models [61.11154533305096]
ビデオ大言語モデル(VLLM)は、強力なビデオ理解を示すが、冗長な視覚トークンによる非効率性に悩まされる。
フレーム内およびフレーム間コンテキスト内でトークン textbfAnchors を詳述する新しい視点を提案する。
提案するAOTは,先行するビデオLLMのショート・ビデオベンチマークとロング・ビデオベンチマークの競合性能を比較検討する。
論文 参考訳(メタデータ) (2026-03-02T03:06:40Z) - TrajTok: Learning Trajectory Tokens enables better Video Understanding [63.1260672430712]
ビデオモデルのトークン化は、通常、パッチ化によって、過剰で冗長な数のトークンを生成する。
そこで我々は,ビデオモデルと完全に統合され,共にトレーニングされたビデオトークンモジュールであるTrajTokを提案する。
本稿では,前処理した視覚特徴量(TrajAdapter)の探索ヘッドとしてシームレスに統合できるか,特に長ビデオ推論において高い性能を持つ視覚言語モデル(TrajVLM)のアライメントコネクタとして利用できることを示す。
論文 参考訳(メタデータ) (2026-02-26T09:15:34Z) - Spatio-Temporal Attention for Consistent Video Semantic Segmentation in Automated Driving [0.46664938579243564]
マルチフレームコンテキストを組み込むためにトランスフォーマーアテンションブロックを拡張したApatio S-Temporal Attention (STA) 機構を提案する。
提案手法は,計算効率を保ちながら,プロセス時間的特徴系列に標準的自己アテンションを付加する。
CityscapesとBDD100kデータセットに関する包括的な評価は、時間的一貫性のメトリクスにおいて、9.20ポイントの大幅な改善を示している。
論文 参考訳(メタデータ) (2026-02-10T18:18:37Z) - Fast SAM2 with Text-Driven Token Pruning [52.8350457627401]
Segment Anything Model 2 (SAM2) では、視覚計算モデルがプロンプト駆動のビデオオブジェクトセグメンテーションにおいて大幅に進歩している。
SAM2パイプラインは、イメージエンコーダが生成するすべての視覚トークンを、ターゲットオブジェクトとの関係にかかわらず、下流の時間的推論モジュールを通じて伝達する。
本稿では,時間的伝播に先立ってトークン密度を選択的に低減し,推論効率を向上させるためのテキスト誘導型トークンプルーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-24T18:59:05Z) - Dense Video Understanding with Gated Residual Tokenization [49.17263029080152]
高時間分解能は、ビデオ理解における微細な細部を捉えるのに不可欠である。
現在のベンチマークは主に低フレームレートサンプリングに依存している。
Dense Video Understanding (DVU)は、トークン化時間とトークンオーバーヘッドの両方を削減することで、高FPSビデオの理解を可能にする。
論文 参考訳(メタデータ) (2025-09-17T17:34:40Z) - VQToken: Neural Discrete Token Representation Learning for Extreme Token Reduction in Video Large Language Models [35.38573641029626]
最小限の離散トークンを用いてビデオ全体を表現することを目的としたExtreme Short Token Reductionという新しいタスクを紹介した。
Extreme Short Token Reductionタスクでは、私たちのVQTokenはシーケンスをオリジナルの長さのわずか0.07パーセントまで圧縮し、NextQA-MCベンチマークでは0.6%の精度しか達成していません。
論文 参考訳(メタデータ) (2025-03-21T09:46:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。