論文の概要: Allocate Before You Embed: Adaptive Visual Input Allocation for Video Embeddings
- arxiv url: http://arxiv.org/abs/2609.01778v1
- Date: Tue, 01 Sep 2026 18:49:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.882164
- Title: Allocate Before You Embed: Adaptive Visual Input Allocation for Video Embeddings
- Title(参考訳): 埋め込み前にアロケートする:ビデオ埋め込みのための適応的な視覚入力アロケーション
- Authors: Song Jin, Zhongtao Jiang, Chenglei Shen, Huanxuan Liao, Haozhe Chi, Zhiwei Wang, Kun Xu, Yong Liu,
- Abstract要約: 大規模なビデオ検索では、密なビジュアルインプットと推論予算の下で、長く多様なビデオをエンコードするために埋め込みモデルが必要である。
我々の経験的分析は、時間的カバレッジの拡大は、固定された視覚入力予算の下でも、検索を改善することを示している。
この発見に触発されたAllocEmbedは、多くのフレームにまたがる固定された視覚入力予算を再配置する、アロケートされた組込みフレームワークである。
- 参考スコア(独自算出の注目度): 17.842710275340142
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large-scale video retrieval requires embedding models to encode long and diverse videos under tight visual-input and inference budgets. Existing methods typically sample a small, fixed set of frames at their original resolution, limiting temporal coverage and ignoring frame importance. Our empirical analysis shows that expanding temporal coverage improves retrieval even under a fixed visual-input budget. Gains are larger when the original per-frame resolution is preserved, highlighting the complementary roles of temporal coverage and spatial fidelity. Motivated by this finding, we propose AllocEmbed, an allocate-then-embed framework that reallocates a fixed visual-input budget across more frames. A lightweight allocator uses low-cost previews to assign frame-wise resolutions before the embedding backbone, preserving more detail where it most benefits retrieval while reducing visual cost elsewhere. We further introduce Retrieval-Driven Policy Optimization (RDPO), which learns the allocator directly from retrieval feedback using a rank-validated similarity gap and a confidence-guided efficiency incentive. Operating entirely before the backbone, AllocEmbed integrates with existing retrieval systems without modifying the embedding model or downstream pipeline. Experiments on the MMEB-V2 V-QA and V-RET tasks and our LongRet benchmark show that AllocEmbed achieves the best overall retrieval performance among the evaluated budget-matched methods and transfers across embedding backbones. Our code is publicly available at https://github.com/jinsong8/AllocEmbed.
- Abstract(参考訳): 大規模なビデオ検索では、密なビジュアルインプットと推論予算の下で、長く多様なビデオをエンコードするために埋め込みモデルが必要である。
既存の方法は通常、小さな固定されたフレームを元の解像度でサンプリングし、時間的カバレッジを制限し、フレームの重要性を無視する。
我々の経験的分析は、時間的カバレッジの拡大は、固定された視覚入力予算の下でも、検索を改善することを示している。
元のフレーム単位の解像度が保存されている場合、利得はより大きくなり、時間的カバレッジと空間的忠実性の相補的な役割が強調される。
この発見に触発されたAllocEmbedは、多くのフレームにまたがる固定された視覚入力予算を再配置する、アロケートされた組込みフレームワークである。
軽量アロケータは、低コストのプレビューを使用して、埋め込みバックボーンの前にフレームの解像度を割り当てる。
さらに,検索フィードバックから直接アロケータを学習するRDPO(Retrieval-Driven Policy Optimization)を導入する。
AllocEmbedはバックボーンの前に完全に動作し、埋め込みモデルや下流パイプラインを変更することなく既存の検索システムと統合する。
MMEB-V2のV-QAタスクとV-RETタスクおよびLongRetベンチマークを用いて、AllocEmbedは、評価された予算適合手法と埋め込みバックボーン間の転送の中で、最高の総合的な検索性能を達成していることを示す。
私たちのコードはhttps://github.com/jinsong8/AllocEmbed.comで公開されています。
関連論文リスト
- A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos [27.879461637513984]
ビデオの時間文グラウンド(TSGV)は、非トリミングビデオからの文クエリに意味的に対応する時間セグメントをローカライズすることを目的としている。
現在のほとんどの手法では、オフライン機能抽出のために事前訓練されたクエリ非依存のビジュアルエンコーダを採用しており、ビデオバックボーンは凍結されており、TSGVに最適化されていない。
本稿では,ビデオバックボーンとローカライゼーションヘッドを協調的に最適化する,完全なエンドツーエンドパラダイムを提案する。
論文 参考訳(メタデータ) (2026-04-03T08:26:12Z) - GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding [63.62445065977448]
GIFT: Global Irreplaceability Frame Targetingはトレーニング不要のフレームワークで、固有の非配置性を評価してフレームを選択する。
GIFTは,LLaVA-Video-7Bの長文ビデオベンチマークにおいて,一様サンプリングに比べて最大12.5%向上したことを示す。
論文 参考訳(メタデータ) (2026-03-26T06:21:41Z) - VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding [9.415923244280542]
VideoBrainは、Vision-Language Modelsが学習したサンプリングポリシーを通じて視覚情報を適応的に取得することを可能にするエンドツーエンドフレームワークである。
提案手法は,ビデオ間の意味検索を行うCLIPエージェントと,時間間隔内での高密度サンプリングを行うUniformエージェントの2つの補完エージェントを特徴とする。
論文 参考訳(メタデータ) (2026-02-04T00:08:35Z) - ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding [52.050036778325094]
ReFoCUS(Reinforcement-guided Frame Optimization for Contextual UnderStanding)は、新しいフレームレベルのポリシー最適化フレームワークである。
ReFoCUSは、参照LMMから派生した報酬信号を用いて、フレームに対するモデル固有の嗜好を反映して、強化学習を通じてフレーム選択ポリシーを学習する。
提案手法は複数のビデオQAベンチマークにおける推論性能を継続的に改善する。
論文 参考訳(メタデータ) (2025-06-02T03:08:07Z) - T*: Re-thinking Temporal Search for Long-Form Video Understanding [66.72243342954823]
現在の時間探索法は、Longvideobenchサブセットで2.1%の時間F1スコアしか達成していない。
画像中の視覚探索に触発されて,空間探索として高価な時間探索を再構成する軽量な時間探索フレームワークT*を提案する。
大規模な実験により、T*と既存の方法を統合することにより、SOTAの長めのビデオ理解が大幅に向上することが示された。
論文 参考訳(メタデータ) (2025-04-03T04:03:10Z) - Collaborative Feedback Discriminative Propagation for Video Super-Resolution [66.61201445650323]
ビデオ超解像法(VSR)の主な成功は、主に空間情報と時間情報を探索することに由来する。
不正確なアライメントは通常、重要なアーティファクトを備えたアライメント機能につながる。
伝搬モジュールは同じタイムステップ機能のみを前方または後方に伝播する。
論文 参考訳(メタデータ) (2024-04-06T22:08:20Z) - UMMAFormer: A Universal Multimodal-adaptive Transformer Framework for
Temporal Forgery Localization [16.963092523737593]
本稿では,時間的フォージェリー・ローカライゼーション(TFL)のための新しいフレームワークを提案し,マルチモーダル適応によるフォルジェリー・セグメントの予測を行う。
提案手法は,Lav-DF,TVIL,Psyndなど,ベンチマークデータセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2023-08-28T08:20:30Z) - You Can Ground Earlier than See: An Effective and Efficient Pipeline for
Temporal Sentence Grounding in Compressed Videos [56.676761067861236]
ビデオがトリミングされていない場合、時間的文のグラウンド化は、文問合せに従って目的のモーメントを意味的に見つけることを目的としている。
それまでの優れた作品は、かなり成功したが、それらはデコードされたフレームから抽出されたハイレベルな視覚的特徴にのみ焦点を当てている。
本稿では,圧縮された映像を直接視覚入力として利用する,圧縮された領域のTSGを提案する。
論文 参考訳(メタデータ) (2023-03-14T12:53:27Z) - Recurrent Video Restoration Transformer with Guided Deformable Attention [116.1684355529431]
本稿では,グローバルなリカレントフレームワーク内で,隣接するフレームを並列に処理するRVRTを提案する。
RVRTは、バランスの取れたモデルサイズ、メモリとランタイムをテストするベンチマークデータセット上で、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-06-05T10:36:09Z) - Temporal Early Exits for Efficient Video Object Detection [1.1470070927586016]
本稿では,フレーム単位の動画オブジェクト検出の計算複雑性を低減するため,時間的早期出口を提案する。
提案手法は,既存の手法と比較して,フレーム単位の動画オブジェクト検出の計算複雑性と実行を最大34倍に削減する。
論文 参考訳(メタデータ) (2021-06-21T15:49:46Z) - End-to-End Learning for Video Frame Compression with Self-Attention [25.23586503813838]
ビデオフレームを圧縮するエンド・ツー・エンドの学習システムを提案する。
我々のシステムはフレームの深い埋め込みを学習し、その差分を潜時空間でエンコードする。
実験の結果,提案システムは高い圧縮率と高客観的な視覚的品質を実現することがわかった。
論文 参考訳(メタデータ) (2020-04-20T12:11:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。