論文の概要: Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.28138v1
- Date: Fri, 28 Aug 2026 09:59:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.266612
- Title: Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models
- Title(参考訳): Token-Budget 蒸留:圧縮ビデオビジョンランゲージモデルへのフルトーケンセマンティクスの変換
- Abstract要約: Token-Budget Distillation (TBD) は、ビデオビジョン言語モデルを適用するためのパラメータ効率の良い微調整フレームワークである。
LLaVA-Video, LLaVA-OneVision, Qwen3-VL-8B-Instruct などのビデオVLMバックボーン上でTBDを評価する。
- 参考スコア(独自算出の注目度): 20.77624638873576
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adapting video vision-language models (VLMs) is computationally expensive because video inputs produce a large number of visual tokens, making both fine-tuning and inference costly. Although visual token compression can reduce this overhead, direct adaptation on compressed inputs often causes semantic drift and noticeable performance degradation. We present Token-Budget Distillation (TBD), a parameter-efficient fine-tuning framework for adapting video VLMs under a fixed token budget. TBD freezes the pretrained backbone, updates only LoRA adapters, and integrates FlashVID-based visual token compression into the video pathway. To preserve full-token semantics under compression, TBD employs a dual-path teacher-student design, where a full-token teacher provides stable supervision and a compressed student is optimized with task loss, answer-region KL distillation, GT-anchored margin distillation, and reliability-aware KD control. This design enables the student to recover the semantic behavior of the full-token model while remaining efficient under aggressive token reduction. We evaluate TBD on three video VLM backbones, including LLaVA-Video, LLaVA-OneVision, and Qwen3-VL-8B-Instruct, across four video understanding benchmarks. TBD consistently outperforms compression-only baselines under both moderate and aggressive compression. On LLaVA-Video at retention ratio R = 10 percent, TBD preserves 97.0 percent of the Vanilla model's average accuracy; on LLaVA-OneVision at R = 10 percent, it achieves an average score of 58.4 and matches 100.0 percent relative accuracy.
- Abstract(参考訳): ビデオビジョン言語モデル(VLM)への適応は、ビデオ入力が多数の視覚トークンを生成するため、微調整と推論の両方にコストがかかるため、計算コストがかかる。
ビジュアルトークン圧縮は、このオーバーヘッドを軽減することができるが、圧縮された入力への直接適応は、しばしば意味的なドリフトと顕著なパフォーマンス劣化を引き起こす。
Token-Budget Distillation (TBD) は、固定トークン予算の下でビデオVLMを適応するためのパラメータ効率の良い微調整フレームワークである。
TBDはトレーニング済みのバックボーンを凍結し、LoRAアダプタのみを更新し、FlashVIDベースのビジュアルトークン圧縮をビデオパスに統合する。
TBDは、圧縮下でのフルトーケントのセマンティクスを維持するために、デュアルパスの教師学生が安定した監督を提供し、圧縮された学生がタスクロス、応答領域KL蒸留、GTアンカレッドマージン蒸留、信頼性に配慮したKD制御を最適化する。
この設計により、学生は攻撃的なトークン還元の下で効率を保ちながら、フルトークンモデルのセマンティックな振る舞いを回復することができる。
LLaVA-Video, LLaVA-OneVision, Qwen3-VL-8B-Instructを含む3つのビデオVLMバックボーン上でTBDを評価する。
TBDは、中程度の圧縮とアグレッシブな圧縮の両方で圧縮のみのベースラインを一貫して上回っている。
保持率R=10%のLLaVA-Videoでは、TBDはバニラモデルの平均精度の97.0パーセントを保持し、R=10%のLLaVA-OneVisionでは平均スコア58.4に達し、相対精度は100.0%である。
関連論文リスト
- CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models [9.660619113725843]
我々はCRAFT: Resive Adaptive Fusion Video Tokensによる圧縮を提案する。
CRAFTは、最先端のトークン圧縮手法よりも一貫して優れている。
圧縮価格は約8ドルで、バックボーンの平均精度の約97%を保持します。
論文 参考訳(メタデータ) (2026-08-03T03:27:46Z) - LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs [90.77662862634509]
LiteFrameは、ビデオ大言語モデルのための強力な、しかし非常に効率的なバックボーンである。
LiteFrameはエンドツーエンドのレイテンシを35%削減し、8$times$より多くのフレームを処理する。
計算予算の固定化により,より長めの映像理解を解き明かす可能性を示した。
論文 参考訳(メタデータ) (2026-05-17T05:02:52Z) - Small Vision-Language Models are Smart Compressors for Long Video Understanding [73.65465038390771]
長時間のビデオ理解は、欲求に満ちたコンテキストではなく、意図駆動の効率に頼っている。
本稿では,下流の理解のために長い動画を圧縮する効率的なクエリ認識フレームワークであるTempoを提案する。
テストでは、Tempoが1時間のビデオを理論的限界以下に圧縮し、真のロングフォームビデオ理解が意図駆動の効率に依存することを示した。
論文 参考訳(メタデータ) (2026-04-09T11:40:25Z) - DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference [14.714791872881397]
DUET-VLMは汎用的なプラグアンドプレイデュアル圧縮フレームワークである。
精度を犠牲にすることなく、視覚的(イメージ/ビデオ)入力を小さくする堅牢な適応を可能にする。
本研究は,DUET-VLMによるエンドツーエンドトレーニングに焦点を当てた。
論文 参考訳(メタデータ) (2026-02-21T14:22:49Z) - PIO-FVLM: Rethinking Training-Free Visual Token Reduction for VLM Acceleration from an Inference-Objective Perspective [59.24570811503256]
本稿では,視覚モデル(VLM)における冗長な視覚トークンを減らし,推論を高速化するPIO-FVLMを提案する。
提案されているPIO-FVLMは、トレーニングフリーで、FlashAttentionと互換性があり、実用的なアプリケーションやデプロイメントに親しみやすい。
LLaVA-Next-7Bでは、PIO-FVLMは視覚トークンの11.1%しか保持していないが、オリジナルのパフォーマンスの97.2%を維持している。
論文 参考訳(メタデータ) (2026-02-04T15:33:10Z) - MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding [13.02027465520324]
構造的検索とRLに基づく蒸留を統合したMARCを提案する。
MARCは1フレームのトークンのみを使用してほぼベースラインの精度を達成する。
これにより、リソース制約のある環境での効率的なリアルタイムビデオ理解の可能性を示す。
論文 参考訳(メタデータ) (2025-10-09T08:07:19Z) - METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding [55.38256656122857]
トレーニング不要なマルチステージイベントベースのToken圧縮フレームワークであるMETokを提案する。
我々はMETokが情報的視覚トークンを動的に選択することで効率と精度の最適なトレードオフを実現することを示す。
例えば、LongVA-7BをMETokに装備すると、80.6%のFLOPが削減され、93.5%のKVキャッシュメモリが節約される。
論文 参考訳(メタデータ) (2025-06-03T13:19:41Z) - ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding [55.320254859515714]
ReTaKeは、ビデオLLMsが8倍のフレーム(最大2048年まで)を処理し、類似のモデルも3~5%縮小し、ビデオMME、MLVU、LongVideoBench、LVBenchなどと競合する。
私たちのコードはhttps://github.com/SCZwangxiao/video-ReTaKe.comで公開されています。
論文 参考訳(メタデータ) (2024-12-29T15:42:24Z) - Token Compensator: Altering Inference Cost of Vision Transformer without Re-Tuning [63.43972993473501]
視覚変換器(ViT)の訓練と推論を高速化するトークン圧縮
しかし、下流タスクに適用した場合、圧縮度はトレーニングと推論の段階で不一致となる。
本稿では,2段階間の圧縮度を分離するモデル演算フレームワークを提案する。
論文 参考訳(メタデータ) (2024-08-13T10:36:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。