論文の概要: Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding
- arxiv url: http://arxiv.org/abs/2607.12557v1
- Date: Tue, 14 Jul 2026 09:27:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.096545
- Title: Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding
- Title(参考訳): 長時間映像理解における事象認識型視覚アロケーションのためのガウス混合モデル
- Authors: Yifan Lu, Ziqi Zhang, Chunfeng Yuan, Jun Gao, Bing Li, Weiming Hu,
- Abstract要約: LVLM(Large Vision-Language Models)は、一様サンプリングに伴う計算コストと情報損失により、長いビデオ理解において重大な課題に直面している。
本稿ではGMM-EVAを提案する。GMM-EVAはガウス混合モデルを用いて離散フレームからイベントレベルの構造をモデル化する。
次に、時間的文脈を維持しトークン予算を最適化するために低分解能二次観測を用いながら、高忠実度詳細のためにイベント毎の1次高分解能を1つ保持するために、分化したアロケーション戦略を適用する。
- 参考スコア(独自算出の注目度): 55.04091863981529
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Vision-Language Models (LVLMs) face significant challenges in long video understanding due to the excessive computational cost and information loss associated with uniform sampling. Existing keyframe selection methods often treat video frames as atomic entities and allocate visual budgets equally, thereby overlooking high-level semantic structures and introducing substantial redundancy. To address these limitations, we propose GMM-EVA (Gaussian Mixture Modeling for Event-Aware Visual Allocation), which leverages Gaussian Mixture Models to model event-level structure from discrete frame-wise observations. A differentiated allocation strategy is then applied to preserve one primary high-resolution keyframe per event for high-fidelity detail, while utilizing lower-resolution secondary keyframes to maintain temporal context and optimize token budgets. GMM-EVA is a training-free, plug-and-play framework that generalizes robustly across various relevance measures and downstream LVLMs. Extensive experiments on multiple long video benchmarks demonstrate that our method significantly outperforms uniform sampling. Notably, GMM-EVA achieves comparable performance to baseline selection methods while utilizing only approximately half of the visual token budget, highlighting its superior efficiency and effectiveness.
- Abstract(参考訳): LVLM(Large Vision-Language Models)は、一様サンプリングに伴う計算コストと情報損失により、長いビデオ理解において重大な課題に直面している。
既存のキーフレーム選択法は、しばしばビデオフレームをアトミックな実体として扱い、視覚的予算を等しく割り当てる。
これらの制約に対処するため,GMM-EVA(Gaussian Mixture Modeling for Event-Aware Visual Allocation)を提案する。
次に、区別されたアロケーション戦略を適用して、1イベント毎に1つの主要な高解像度キーフレームを高忠実度の詳細に保存し、低解像度のセカンダリキーフレームを使用して時間的コンテキストを維持し、トークン予算を最適化する。
GMM-EVAはトレーニングフリーのプラグイン・アンド・プレイフレームワークであり、様々な関連尺度や下流のLVLMに対して堅牢に一般化する。
複数の長ビデオベンチマークによる大規模な実験により,本手法が一様サンプリングを著しく上回っていることが示された。
特に、GMM-EVAは、視覚トークン予算の約半分しか利用せず、ベースライン選択法に匹敵する性能を達成し、その優れた効率と有効性を強調している。
関連論文リスト
- Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding [21.306038832082553]
MLLM(Multimodal Large Language Models)は,ビデオ質問応答において高い性能を示した。
ロングフォームビデオへのそれらの応用は、コンテキスト長と計算コストの制限によって制限される。
本稿では,情報理論に基づくエビデンス駆動サンプリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-01T15:02:50Z) - GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding [63.62445065977448]
GIFT: Global Irreplaceability Frame Targetingはトレーニング不要のフレームワークで、固有の非配置性を評価してフレームを選択する。
GIFTは,LLaVA-Video-7Bの長文ビデオベンチマークにおいて,一様サンプリングに比べて最大12.5%向上したことを示す。
論文 参考訳(メタデータ) (2026-03-26T06:21:41Z) - MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval [111.99106496142474]
Visual Document Retrieval (VDR)は、微細な視覚的詳細とグローバルな文書構造の両方をキャプチャする表現を必要とする。
既存のVDRモデルは、高解像度文書を処理する際に効率と効率のバランスをとるのに苦労する。
本稿では,X-VisEmbパラダイムを提案する。X-VisEmbパラダイムは,多分解能サンプリングと符号化から,粒度横断的特徴融合から適応的表現蒸留へと進展する。
論文 参考訳(メタデータ) (2026-03-07T15:17:22Z) - DUAL-VAD: Dual Benchmarks and Anomaly-Focused Sampling for Video Anomaly Detection [8.294763803639391]
ビデオ異常検出(VAD)は、監視と公衆の安全のために重要である。
既存のベンチマークはフレームレベルかビデオレベルのタスクに限られている。
本研究は、フルビデオカバレッジを維持しながら、異常度セグメントを優先するソフトマックスベースのフレーム割り当て戦略を導入する。
論文 参考訳(メタデータ) (2025-09-15T05:48:22Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning [68.76048244253582]
ビデオ理解におけるフレーム選択の最適化にルールベース強化学習(RL)を利用する最初のフレームワークであるViaRLを紹介する。
ViaRLは、下流モデルの応答精度を報奨信号として利用し、試行錯誤によってフレームセレクタを訓練する。
ViaRLは、多様なビデオ理解タスクに対して、時間的基盤性能と堅牢な一般化を一貫して提供します。
論文 参考訳(メタデータ) (2025-05-21T12:29:40Z) - Selective State Space Memory for Large Vision-Language Models [0.0]
State Space Memory Integration (SSMI)は、LVLMの効率的な微調整のための新しいアプローチである。
SSMIは長距離依存関係をキャプチャし、タスク固有の視覚的およびシーケンシャルなパターンを効果的に注入する。
COCO Captioning、VQA、Flickr30kといったベンチマークデータセットの実験は、SSMIが最先端のパフォーマンスを達成することを実証している。
論文 参考訳(メタデータ) (2024-12-13T05:40:50Z) - Cauchy-Schwarz Regularized Autoencoder [68.80569889599434]
変分オートエンコーダ(VAE)は、強力で広く使われている生成モデルのクラスである。
GMMに対して解析的に計算できるCauchy-Schwarz分散に基づく新しい制約対象を導入する。
本研究の目的は,密度推定,教師なしクラスタリング,半教師なし学習,顔分析における変分自動エンコーディングモデルの改善である。
論文 参考訳(メタデータ) (2021-01-06T17:36:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。