論文の概要: Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation
- arxiv url: http://arxiv.org/abs/2605.08810v1
- Date: Sat, 09 May 2026 09:02:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.900007
- Title: Compressed Video Aggregator: Content-driven Module for Efficient Micro-Video Recommendation
- Title(参考訳): 圧縮ビデオアグリゲータ: 効率的なマイクロビデオレコメンデーションのためのコンテンツ駆動モジュール
- Abstract要約: 本稿では,映像情報を優先学習から切り離す軽量なマイクロビデオレコメンデーションモジュールであるCompressed Video Aggregator (CVA)を提案する。
CVAは、凍結されたVFM埋め込みを集約し、クロスアテンションプロジェクションなしで遅延推論を使用し、レコメンダのためのコンパクトなビデオ埋め込みを生成する。
- 参考スコア(独自算出の注目度): 17.099852332965465
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose Compressed Video Aggregator (CVA), a lightweight micro-video recommendation module that decouples video information from preference learning. It aggregates frozen VFM embeddings, and uses latent reasoning without cross-attention projection, producing compact video embeddings for recommenders. Due to the redundancy in the frame count of the original benchmark and its overly coarse sampling, we used titles to re-select key frames based on CLIP. Experiments on MicroLens and Short-Video show consistent gains with orders-of-magnitude reductions in training time and GPU memory, and re-selected frames can further enhance the performance of all methods, including CVA. Furthermore, we also discussed the impact of several scenarios involving erroneous titles on our method. Code will be released soon.
- Abstract(参考訳): 本稿では,映像情報を優先学習から切り離す軽量なマイクロビデオレコメンデーションモジュールであるCompressed Video Aggregator (CVA)を提案する。
凍結されたVFM埋め込みを集約し、クロスアテンションプロジェクションなしで遅延推論を使用し、レコメンダのためのコンパクトなビデオ埋め込みを生成する。
元のベンチマークのフレーム数と過大な粗いサンプリングのために、我々はCLIPに基づいてキーフレームを再選択するためにタイトルを使用した。
MicroLensとShort-Videoの実験では、トレーニング時間とGPUメモリのオーダー・オブ・マグニチュード削減による一貫したゲインを示し、再選択されたフレームは、CVAを含むすべてのメソッドのパフォーマンスをさらに向上させることができる。
さらに,誤ったタイトルがメソッドに与える影響についても検討した。
コードはまもなくリリースされる。
関連論文リスト
- Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language [60.91064560080974]
本稿では,クエリ関連クリップをトリムするスポットVMRを提案する。
提案するSpotVMRは,最新のVMR手法の効率性を実現するプラグイン・アンド・プレイモジュールとして機能する。
論文 参考訳(メタデータ) (2026-05-28T11:42:28Z) - Towards Effective and Efficient Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval [57.88666884515147]
ワンショットビデオクリップに基づく検索オーグメンテーション(OneClip-RAG)を提案する。
OneClip-RAGは、ビデオ理解のためのビデオクリップの利点をフル活用している。
また、新しいクエリ誘導ビデオチャンキングアルゴリズムも備えている。
論文 参考訳(メタデータ) (2025-12-09T09:40:20Z) - REGEN: Learning Compact Video Embedding with (Re-)Generative Decoder [52.698595889988766]
生成モデルのためのビデオ埋め込み学習について,新しい視点を提示する。
入力ビデオの正確な再生を必要とせず、効果的な埋め込みは視覚的に妥当な再構築に焦点を当てるべきである。
本稿では,従来のエンコーダ・デコーダ・ビデオ埋め込みをエンコーダ・ジェネレータ・フレームワークに置き換えることを提案する。
論文 参考訳(メタデータ) (2025-03-11T17:51:07Z) - Streaming Video Question-Answering with In-context Video KV-Cache Retrieval [10.990431921021585]
我々は,効率的なストリーミングビデオ質問応答(StreamingVQA)を可能にするトレーニング不要な手法であるReKVを提案する。
提案手法は,長い動画をストリーミング形式で分析し,ユーザの問い合わせが受信されたら即座に応答することができる。
論文 参考訳(メタデータ) (2025-03-01T15:53:33Z) - OCSampler: Compressing Videos to One Clip with Single-step Sampling [82.0417131211353]
本稿では,OCSampler というフレームワークを提案する。
我々の基本的な動機は、効率的なビデオ認識タスクは、フレームをシーケンシャルに拾うのではなく、シーケンス全体を一度に処理することにある。
論文 参考訳(メタデータ) (2022-01-12T09:50:38Z) - Efficient Video Object Segmentation with Compressed Video [36.192735485675286]
ビデオの時間的冗長性を利用した半教師付きビデオオブジェクトセグメンテーションのための効率的なフレームワークを提案する。
提案手法は,圧縮したビデオビットストリームの動作と残差に基づいて,選択したベクトルの推測を行い,他のフレームの予測を行う。
ベースモデルとしてトップkフィルタリングを用いたSTMでは,DAVIS16とYouTube-VOSにおいて,精度の低下とともに最大4.9倍の高速化を実現した。
論文 参考訳(メタデータ) (2021-07-26T12:57:04Z) - COMISR: Compression-Informed Video Super-Resolution [76.94152284740858]
ウェブやモバイルデバイスのほとんどのビデオは圧縮され、帯域幅が制限されると圧縮は厳しい。
圧縮によるアーティファクトを導入せずに高解像度コンテンツを復元する圧縮インフォームドビデオ超解像モデルを提案する。
論文 参考訳(メタデータ) (2021-05-04T01:24:44Z) - Video Captioning in Compressed Video [1.953018353016675]
保存した圧縮映像を直接操作する映像キャプション手法を提案する。
ビデオキャプションの識別的視覚表現を学習するために,Iフレームに注目する領域を検出する残差支援エンコーダ (RAE) を設計する。
本手法を2つのベンチマークデータセットで評価し,本手法の有効性を示す。
論文 参考訳(メタデータ) (2021-01-02T03:06:03Z) - Video Super-resolution with Temporal Group Attention [127.21615040695941]
本稿では,時間的情報を階層的に効果的に組み込む新しい手法を提案する。
入力シーケンスは複数のグループに分けられ、それぞれがフレームレートの種類に対応する。
これは、いくつかのベンチマークデータセットにおける最先端のメソッドに対して良好なパフォーマンスを達成する。
論文 参考訳(メタデータ) (2020-07-21T04:54:30Z) - M-LVC: Multiple Frames Prediction for Learned Video Compression [111.50760486258993]
低レイテンシシナリオのためのエンドツーエンドの学習ビデオ圧縮方式を提案する。
提案方式では, 移動ベクトル(MV)場を現在のフレームと前のフレームの間で計算する。
実験の結果,提案手法は,低遅延モードにおける既存の学習ビデオ圧縮法よりも優れていた。
論文 参考訳(メタデータ) (2020-04-21T20:42:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。