論文の概要: FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding
- arxiv url: http://arxiv.org/abs/2607.25266v2
- Date: Thu, 30 Jul 2026 21:59:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.231919
- Title: FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding
- Title(参考訳): FORGE: 長期ビデオ理解のための関係幾何学におけるフレーム直交性
- Authors: Ghazal Kaviani, Ghassan AlRegib,
- Abstract要約: FORGEは、事前訓練されたマルチモーダル埋め込み空間上でクエリ条件付き幾何を誘導するモデルに依存しない手法である。
16,32,64フレームの予算での Video-MME と LongVideoBench の実験は、ForGE が最強のトレーニングフリーベースラインよりも11.0-15.3 ポイント向上したことを示している。
その結果,埋め込み空間とクエリの高次元構造との整合性は,推論時間による映像理解に有望な方向であることが示唆された。
- 参考スコア(独自算出の注目度): 6.929741688224915
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal large language models (MLLMs) have enabled long-form video understanding at a scale that was not previously possible. However, the density of relevant content decreases sharply as video sequence length increases, and exposing the model to more irrelevant content measurably reduces its accuracy. In this paper, we address the problem of maximizing query-relevant information in a frame subset selected at inference time, without training. FORGE (Frame Orthogonality in Relevance Geometry) is a model-agnostic method that induces a query-conditioned geometry on a pretrained multimodal embedding space, unifying relevance and diversity into a single objective. In this space, frames that cover independent query-relevant directions are far apart, and selecting the subset of maximum information captures diverse query-relevant content within the budget. Experiments on Video-MME and LongVideoBench at budgets of 16, 32, and 64 frames show that FORGE improves the unified keyframe selection score by 11.0-15.3 points over the strongest training-free baseline and up to doubles keyframe recall (0.415 vs. 0.204 at K=64 on Video-MME). The gains extend to question answering, where accuracy improves in every evaluated setting across eight open-source MLLMs spanning 4B to 32B parameters, by up to 8.7 points over uniform sampling and 5.2 points over the strongest baseline. Our findings suggest that aligning the embedding space with the query's high-dimensional structure is a promising direction for inference-time video understanding.
- Abstract(参考訳): MLLM(Multimodal large language model)は、従来不可能だったスケールでの長めのビデオ理解を可能にする。
しかし、動画のシーケンス長が増加するにつれて関連コンテンツの密度は急激に減少し、より無関係なコンテンツにモデルを露出させることで、その精度が著しく低下する。
本稿では,推論時間に選択したフレームサブセットにおいて,学習なしでクエリ関連情報を最大化する問題に対処する。
FORGE (Frame Orthogonality in Relevance Geometry) は、事前訓練されたマルチモーダル埋め込み空間上でクエリ条件付き幾何を誘導し、妥当性と多様性を単一の目的に統一するモデルに依存しない手法である。
この領域では、独立したクエリ関連方向をカバーするフレームははるかに離れており、最大情報のサブセットを選択することは、予算内で様々なクエリ関連コンテンツをキャプチャする。
ビデオMMEとLongVideoBenchの16、32、64フレームでの試験では、ForGEは最強のトレーニングフリーベースラインで11.0-15.3ポイント、最大2倍のキーフレームリコール(K=64では0.415対0.204)で、統一キーフレーム選択スコアを11.0-15.3ポイント改善している。
4Bから32Bパラメータにまたがる8つのオープンソースMLLMに対して、一様サンプリングで最大8.7ポイント、最強ベースラインで最大5.2ポイントの精度が向上する。
その結果,埋め込み空間とクエリの高次元構造との整合性は,推論時間による映像理解に有望な方向であることが示唆された。
関連論文リスト
- Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors [69.75895255395702]
MLLMの検証選択抽出層におけるクロスモーダルな注意は、自己回帰生成を必要とせずに、クエリ関連フレーム証拠を既に提供している。
2Bパラメータしか持たない軽量MLLMセレクタは、クエリ条件アグリゲーションにより、選択した層注目値を関連スコアに変換することにより、フレームレベルのエビデンスを抽出することができる。
32フレームの予算下では,ビデオMMEで最大6.4ポイントの均一サンプリングを改良し,フレーム予算の一致したトレーニングベースセレクタよりも優れていた。
論文 参考訳(メタデータ) (2026-07-17T07:04:31Z) - QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding [78.36929439152566]
本稿では,長いビデオからコンパクトだが情報に富んだフレームを選択可能なクエリ・アンド・コンテント・アウェア(QCA)選択フレームワークを提案する。
QCAは最もクエリ関連性の高いフレームにアンカーし、クエリのセマンティックな関連性を維持しながら、多様性を最大化するために追加のフレームを反復的に組み込む。
我々の方法は追加のトレーニングを必要とせず、既存のVideo-LLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-07-01T14:19:24Z) - DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding [19.492762364136393]
時間ウィンドウとサンプリング密度を1つの自己回帰パス内でネイティブトークンとして出力するフレームワークであるDynFrameを提案する。
この学習可能なスパン密度検索は、単一の検索ステップで多粒度証拠の取得を可能にする。
論文 参考訳(メタデータ) (2026-05-26T08:16:16Z) - Event-Anchored Frame Selection for Effective Long-Video Understanding [67.56884568828508]
Event-Anchored Frame Selection (EFS)は階層的なイベント認識パイプラインである。
トレーニング不要のプラグイン・アンド・プレイモジュールとして、EFSは既製のLVLMにシームレスに統合できる。
論文 参考訳(メタデータ) (2026-03-01T08:25:37Z) - Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding [43.587729230845525]
現在のメソッドは、通常、与えられたクエリに高い関連性を持つフレームを選択する。
トレーニング不要なフレームワークであるセマンティック境界(WFS-SB)の検出によるウェーブレットベースのフレーム選択を提案する。
WFS-SBはLVLMの性能を大幅に向上させ、ビデオMMEでは5.5%、MLVUでは9.5%、LongVideoBenchでは6.2%の精度向上を実現した。
論文 参考訳(メタデータ) (2026-02-28T07:18:07Z) - LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning [73.90466023069125]
ビデオクリップに適応的にズームイン可能なモデルであるLOVE-R1を提案する。
モデルはまず、密度の高いサンプルフレームが提供されるが、小さな解像度で提供される。
空間的詳細が必要な場合、大きなフレーム解像度で興味のあるクリップを拡大することができる。
論文 参考訳(メタデータ) (2025-09-29T13:43:55Z) - An LMM for Efficient Video Understanding via Reinforced Compression of Video Cubes [85.00111442236499]
本稿では,非時間密度の動画をGumbel Softmax を用いて様々な立方体に分割する新しい知覚パラダイムを持つ LMM である textbfQuicksviewer を提案する。
言語バックボーンから3段階のプログレッシブステージを通じてモデルをトレーニングし、それぞれが知覚効率によって平均420s/1fpsの長大なビデオを組み込む。
トレーニング用ビデオテキストサンプルは0.8Mに過ぎず, 精度が最大8.72倍に向上した。
論文 参考訳(メタデータ) (2025-04-21T17:57:21Z) - BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding [51.49345400300556]
大規模ビデオ言語モデル (VLM) は様々なビデオ理解タスクにおいて有望な進歩を示した。
均一なフレームサンプリングのような伝統的なアプローチは、必然的に無関係なコンテンツにリソースを割り当てる。
本稿では,フレーム選択戦略の総合的研究を通じて,付加的なトレーニングを伴わずに大規模VLMをブーストする方法であるBOLTを紹介する。
論文 参考訳(メタデータ) (2025-03-27T13:18:40Z) - Semi-Parametric Video-Grounded Text Generation [21.506377836451577]
本稿では,セミパラメトリックなビデオグラウンドテキスト生成モデルSeViTを提案する。
ビデオを外部データストアとして扱うことで、SeViTは、いくつかのクエリ関連フレームを選択する非パラメトリックフレームレトリバーを含む。
実験により,より長いビデオと因果的ビデオ理解において,本手法が有意な優位性を示した。
論文 参考訳(メタデータ) (2023-01-27T03:00:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。