論文の概要: The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding
- arxiv url: http://arxiv.org/abs/2607.24570v1
- Date: Mon, 27 Jul 2026 15:36:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.48244
- Title: The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding
- Title(参考訳): 視覚ボトルネック:空間・時間同時撮影のためのMLLMのスパースフレーム適応
- Abstract要約: 大規模なビデオプラットフォームは1時間に数百万のアップロードを処理する。
システムはビデオあたり8フレームから16フレームのスパース入力に制限された。
トレーニング戦略はスパースフレームビデオグラウンドのモデルスケールを支配している。
- 参考スコア(独自算出の注目度): 0.8594140167290097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large-scale video platforms process millions of uploads hourly, requiring moderation systems that can localize when and where policy violations occur within each video. Processing every frame is infeasible at scale, so systems are constrained to sparse inputs of 8 to 16 frames per video. Yet state-of-the-art multimodal large language models (MLLMs) are pretrained on dense sequences of hundreds of frames, creating a fundamental mismatch between training and deployment conditions. This mismatch causes severe performance collapse: the Qwen3-VL 8B model drops from 56.0% to 22.3% temporal mIoU when frames are reduced to 16, a 60.2% relative degradation. We present a systematic empirical study of training strategies to close this gap for spatial-temporal video grounding. Our results suggest that visual feature extraction is the dominant bottleneck under sparse-frame inputs. Adapting only the final three ViT layers, 4% of total parameters, achieves 68.8% temporal mIoU and surpasses a zero-shot 8B model using dense inputs by 12.8 points. Language model fine-tuning, by contrast, offers negligible or negative returns. A boundary-aware sampling strategy, Hybrid16, further improves temporal mIoU by 26 points over uniform sampling when temporal boundaries are available. We conclude that for sparse-frame video grounding, training strategy dominates model scale: a fine-tuned 2B model consistently outperforms a zero-shot 8B model, with or without dense frame access.
- Abstract(参考訳): 大規模なビデオプラットフォームは、数百万のアップロードを1時間に処理し、各ビデオ内でポリシー違反が発生した時と場所をローカライズできるモデレーションシステムを必要とする。
各フレームの処理は大規模な処理では不可能であるため、システムはビデオあたり8フレームから16フレームのスパース入力に制約される。
しかし、最先端のマルチモーダル言語モデル(MLLM)は数百フレームの高密度なシーケンスで事前訓練されており、トレーニングとデプロイメント条件の根本的なミスマッチを生み出している。
Qwen3-VL 8Bモデルはフレームが16に減少すると56.0%から22.3%に減少し、相対分解率は60.2%となる。
本研究では,このギャップを埋める訓練戦略の体系的研究を行った。
この結果から,視覚的特徴抽出がスパースフレーム入力における主要なボトルネックであることが示唆された。
合計パラメータの4%である最後の3つのViT層のみに適応すると68.8%の時間mIoUが達成され、12.8ポイントの高密度入力を用いたゼロショット8Bモデルを超える。
対照的に、言語モデルの微調整は無視または否定的なリターンを提供する。
境界対応サンプリング戦略であるHybrid16は、時間境界が利用できる場合、一様サンプリングよりも時間mIoUを26ポイント改善する。
細調整された2Bモデルは、フレームアクセスが密であるか否かに関わらず、ゼロショット8Bモデルより一貫して優れており、スパースフレームビデオグラウンドでは、トレーニング戦略がモデルスケールを支配していると結論付けている。
関連論文リスト
- FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding [6.929741688224915]
FORGEは、事前訓練されたマルチモーダル埋め込み空間上でクエリ条件付き幾何を誘導するモデルに依存しない手法である。
16,32,64フレームの予算での Video-MME と LongVideoBench の実験は、ForGE が最強のトレーニングフリーベースラインよりも11.0-15.3 ポイント向上したことを示している。
その結果,埋め込み空間とクエリの高次元構造との整合性は,推論時間による映像理解に有望な方向であることが示唆された。
論文 参考訳(メタデータ) (2026-07-28T04:09:49Z) - TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs [36.2604844032041]
ビデオマルチモーダル大言語モデル(MLLM)は、ビデオ内で何が起こるかを記述することができるが、支持された証拠がいつ発生したかを特定することは滅多にない。
本研究では,ビデオの長さ,領域,クエリフォーム,視点をまたいだエビデンス間隔の変動心電図を1つのモデルで予測する一般的なビデオ時間的グラウンドについて検討する。
TimeLens2は、時間的エビデンスを、監督と最適化を通じて設定されたインターバルとして扱う。
論文 参考訳(メタデータ) (2026-07-19T22:04:33Z) - LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence [107.63317552620231]
LLaVA-OneVision-2(LLaVA-OV-2)について述べる。
幅広いマルチモーダルベンチマークで優れたパフォーマンスを実現している。
際立った能力は、ビデオ理解、時間的接地、空間的接地、操作言語推論にまたがる統一的な認識である。
論文 参考訳(メタデータ) (2026-05-25T15:54:04Z) - QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding [37.18078731710843]
量子キャリブレーションプロットのための最初のVLMベンチマークであるQCalEvalを紹介する。
超伝導量子ビットと中性原子にまたがる22の実験系から87種類のシナリオタイプにまたがる243試料について検討した。
最高の汎用ゼロショットモデルは平均スコア72.3に達し、多くのオープンウェイトモデルはマルチイメージのインコンテキスト学習で劣化する。
論文 参考訳(メタデータ) (2026-04-28T17:28:33Z) - MiVID: Multi-Strategic Self-Supervision for Video Frame Interpolation using Diffusion Model [2.9795035162522194]
この記事では、ビデオレンダリングのための軽量で自己監督型の拡散ベースのフレームワークであるMiVIDを紹介する。
本モデルでは,3次元U-Netバックボーンとトランスフォーマスタイルの時間的注意を組み合わせることで,明示的な動き推定の必要性を解消する。
この結果から,MiVIDは50エポックしか得られず,教師付きベースラインと競合することがわかった。
論文 参考訳(メタデータ) (2025-11-08T14:10:04Z) - LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning [73.90466023069125]
ビデオクリップに適応的にズームイン可能なモデルであるLOVE-R1を提案する。
モデルはまず、密度の高いサンプルフレームが提供されるが、小さな解像度で提供される。
空間的詳細が必要な場合、大きなフレーム解像度で興味のあるクリップを拡大することができる。
論文 参考訳(メタデータ) (2025-09-29T13:43:55Z) - BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding [51.49345400300556]
大規模ビデオ言語モデル (VLM) は様々なビデオ理解タスクにおいて有望な進歩を示した。
均一なフレームサンプリングのような伝統的なアプローチは、必然的に無関係なコンテンツにリソースを割り当てる。
本稿では,フレーム選択戦略の総合的研究を通じて,付加的なトレーニングを伴わずに大規模VLMをブーストする方法であるBOLTを紹介する。
論文 参考訳(メタデータ) (2025-03-27T13:18:40Z) - Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors [54.8852848659663]
Buffer Anytimeは、ビデオから深さと正規マップ(幾何バッファと呼ばれる)を推定するためのフレームワークです。
時間的整合性制約を持つ単一画像の先行値を活用することによって,高品質なビデオバッファ推定を実証する。
論文 参考訳(メタデータ) (2024-11-26T09:28:32Z) - ZeroSmooth: Training-free Diffuser Adaptation for High Frame Rate Video Generation [81.90265212988844]
本稿では,プラグイン・アンド・プレイ方式で生成ビデオモデルを作成するためのトレーニング不要なビデオ手法を提案する。
我々は,映像モデルを隠れ状態補正モジュールを備えた自己カスケード映像拡散モデルに変換する。
私たちのトレーニングフリーの手法は、巨大な計算リソースと大規模データセットによってサポートされているトレーニングモデルにさえ匹敵するものです。
論文 参考訳(メタデータ) (2024-06-03T00:31:13Z) - Spatiotemporal Contrastive Video Representation Learning [87.56145031149869]
ラベルのないビデオから視覚的表現を学習するための,自己指導型コントラスト映像表現学習(CVRL)法を提案する。
我々の表現は、コントラスト時間的損失を用いて学習され、同じ短いビデオから2つの強化されたクリップが埋め込み空間にまとめられる。
本研究では,ビデオ自己教師型学習におけるデータ向上の要因について検討し,空間的情報と時間的情報の両方が重要であることを明らかにする。
論文 参考訳(メタデータ) (2020-08-09T19:58:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。