論文の概要: Enhancing Long-Video VLM Embeddings with Query-Aware Streaming Latent Reasoning
- arxiv url: http://arxiv.org/abs/2610.04864v1
- Date: Sun, 04 Oct 2026 02:05:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 08:21:44.338352
- Title: Enhancing Long-Video VLM Embeddings with Query-Aware Streaming Latent Reasoning
- Title(参考訳): クエリ対応ストリーミング遅延推論による長時間ビデオVLM埋め込みの強化
- Abstract要約: 長いビデオの埋め込みには、限られた視覚的な予算の下で、スパースクエリ関連エビデンスをキャプチャする必要がある。
textbfQuery-Aware Streaming Latent Reasoning (QASLR)を紹介する。
QASLRはフレームの有界集合を選択し、時間順を復元し、ヴィジュアル言語によるバックボーンでクリップで処理する。
- 参考スコア(独自算出の注目度): 48.92009312610144
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-video embedding requires capturing sparse query-relevant evidence under a limited visual-token budget. Uniform sampling can miss brief events in videos spanning minutes or hours, whereas encoding more frames in a single context increases memory and computation. We introduce \textbf{Query-Aware Streaming Latent Reasoning} (QASLR), a post-training framework that accumulates evidence across clips while keeping the embedding size fixed. QASLR selects a bounded set of frames, restores their temporal order, and processes them clip by clip with a vision-language backbone. A compact set of persistent think tokens cross-attends to each clip's features, while an embed token reads out a normalized representation after every update. This design integrates evidence across multiple backbone calls without requiring all selected frames to share a single context. Training combines final contrastive learning, step-wise contrastive supervision, and final-embedding self-distillation. Intermediate supervision trains partial-video readouts for retrieval, while self-distillation regularizes them toward the final representation. Query-aware selection produces query-conditioned representations for candidate-set scoring and reranking, whereas query-independent selection enables reusable corpus indexing. Under the full training recipe, HourVideo retrieval Hit@1 increases from 54.2 to 70.7 and from 57.4 to 72.8 for 2B and 8B Qwen3-VL-Embedding backbones, respectively. Gains extend to the evaluated moment-retrieval and video-QA tasks, and the streaming head transfers to a second Qwen-family embedding backbone. These results support streaming latent aggregation as an effective approach to integrating long-video evidence into fixed-dimensional representations.
- Abstract(参考訳): 長いビデオの埋め込みには、限られた視覚的な予算の下で、スパースクエリ関連エビデンスをキャプチャする必要がある。
均一サンプリングは、数分または数時間にわたるビデオの短いイベントを見逃すことがあり、一方、1つのコンテキストでより多くのフレームを符号化することで、メモリと計算量が増加する。
埋め込みサイズを固定したまま、クリップ間で証拠を蓄積する後トレーニングフレームワークである、textbf{Query-Aware Streaming Latent Reasoning} (QASLR)を紹介した。
QASLRはフレームの有界集合を選択し、時間順を復元し、ヴィジュアル言語によるバックボーンでクリップで処理する。
永続的なシンクトークンのコンパクトなセットは、各クリップの特徴と交差し、埋め込みトークンは更新毎に正規化された表現を読み取る。
この設計では、複数のバックボーンコールにエビデンスを統合する。
トレーニングは、最終のコントラスト学習、ステップワイドのコントラスト指導、そして最終の自己蒸留を組み合わせる。
中間監督は検索のために部分ビデオ読み出しを訓練し、自己蒸留は最終表現に向けてそれらを正規化する。
クエリ対応の選択は、候補セットのスコアリングと再ランクのためのクエリ条件付き表現を生成するが、クエリ非依存の選択は、再利用可能なコーパスインデックスを可能にする。
フルトレーニングのレシピでは、HourVideo検索Hit@1は54.2から70.7に増加し、2Bは57.4から72.8に増加し、8B Qwen3-VL-Embedding Backbonesとなった。
ゲインは評価されたモーメント検索タスクとビデオQAタスクに拡張され、ストリーミングヘッドは第2のQwenハウス埋め込みバックボーンに転送される。
これらの結果は、長期映像証拠を固定次元表現に統合するための効果的なアプローチとして、ストリーミング潜時集約を支持している。
関連論文リスト
- VideoScout: Learning Agentic Active Exploration with Adaptive Reasoning Pacing for Long Video Understanding [61.00809248898572]
ロングビデオ理解(英: Long video understanding)とは、エージェントが時間軸に沿って回転してビデオを読み取る問題である。
適応推論によるSEAパラダイムをインスタンス化するマルチターン推論エージェントである textbfVideoScout を提案する。
長いビデオ理解と推論のベンチマーク実験により、我々の7Bモデルは、既存の訓練された7Bエージェントモデルと比較して、強い性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-09-14T14:04:03Z) - Intrinsic Temporal Adaptation of CLIP for Partially Relevant Video Retrieval [40.983482307220676]
PRVRは、テキストクエリに関連するモーメントを含む未編集のビデオを検索することを目的としている。
Intrinsic Temporal Adaptation (ITA) framework for PRVRを提案する。
提案手法は,PRVRベンチマーク上での最先端性能を実現する。
論文 参考訳(メタデータ) (2026-09-04T06:58:59Z) - RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding [55.75126327155788]
RIDGEはフレーム選択フレームワークであり、時間信号としてフレームクエリの類似性曲線を読み取る。
タイムラインを構造的なリージョンに分割し、固定予算の下でイベントコア、トランジション、ビルドアップ、アフターマス、コンテキストフレームを保存するために、リージョン固有の選択を適用する。
ほとんどの設定で最高のパフォーマンスを達成し、他の設定では競争力を維持します。
論文 参考訳(メタデータ) (2026-08-30T18:40:51Z) - Training-Free Temporal Abstraction for General Video Understanding [12.051446549851844]
映像を意味的に意味のある時間的チャンクに分割する訓練不要なSTITCHを提案する。
我々は,汎用イベント境界検出,言語に基づくモーメント検索,長ビデオVLM推論のためのフレーム選択についてSTITCHを評価する。
論文 参考訳(メタデータ) (2026-08-28T05:10:54Z) - Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language [60.91064560080974]
本稿では,クエリ関連クリップをトリムするスポットVMRを提案する。
提案するSpotVMRは,最新のVMR手法の効率性を実現するプラグイン・アンド・プレイモジュールとして機能する。
論文 参考訳(メタデータ) (2026-05-28T11:42:28Z) - VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG [33.938909878793815]
VideoStirは構造化されマルチモーダルなインテント対応長ビデオRAGフレームワークである。
ビデオは、クリップレベルでテンポラルグラフとして構成され、エビデンスを集約するマルチホップ検索を実行する。
また、MLLMが支援するインテント関連スコアラを導入し、クエリの推論インテントとのアライメントに基づいてフレームを取得する。
論文 参考訳(メタデータ) (2026-04-07T04:26:59Z) - SeViCES: Unifying Semantic-Visual Evidence Consensus for Long Video Understanding [36.30263540665245]
本稿では,効果的で信頼性の高いロングビデオ理解のためのフレームワークを提案する。
SeViCESはトレーニング不要でモデルに依存しない2つの重要なコンポーネントを導入している。
長いビデオ理解ベンチマークの実験によると、SeViCESは精度と堅牢性の両方で最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2025-10-23T14:55:28Z) - A Flexible and Scalable Framework for Video Moment Search [51.47907684209207]
本稿では,テキストクエリにマッチする任意の長さの動画のコレクションからランク付けされたモーメントのリストを取得するためのフレキシブルなフレームワークを提案する。
SPR(Segment-Proposal-Ranking)と呼ばれる我々のフレームワークは,探索プロセスを,セグメント検索,提案生成,モーメント改善という3つの独立した段階に単純化する。
TVR-Rankingデータセットの評価から,我々のフレームワークは,計算コストと処理時間を大幅に削減して最先端の性能を実現することを示す。
論文 参考訳(メタデータ) (2025-01-09T08:54:19Z) - Temporal Context Aggregation for Video Retrieval with Contrastive
Learning [81.12514007044456]
フレームレベルの特徴間の時間的長距離情報を組み込んだビデオ表現学習フレームワークTCAを提案する。
提案手法は,映像レベルの特徴を持つ最先端の手法に対して,FIVR-200Kでは17% mAPの大幅な性能上の優位性を示す。
論文 参考訳(メタデータ) (2020-08-04T05:24:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。