論文の概要: Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
- arxiv url: http://arxiv.org/abs/2603.19054v1
- Date: Thu, 19 Mar 2026 15:47:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.240131
- Title: Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
- Title(参考訳): Em-Garde: Propose-Match Framework for Proactive Streaming Video Understanding
- Authors: Yikai Zheng, Xin Ding, Yifan Yang, Shiqi Jiang, Hao Wu, Qianxi Zhang, Weijun Wang, Ting Cao, Yunxin Liu,
- Abstract要約: Em-Gardeは、セマンティック理解とストリーミング知覚を分離する新しいフレームワークである。
StreamingBench と OVO-Bench の実験では、事前のモデルよりも前向きな応答精度と効率で一貫した改善が示されている。
- 参考スコア(独自算出の注目度): 19.76957611582713
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in Streaming Video Understanding has enabled a new interaction paradigm where models respond proactively to user queries. Current proactive VideoLLMs rely on per-frame triggering decision making, which suffers from an efficiency-accuracy dilemma. We propose Em-Garde, a novel framework that decouples semantic understanding from streaming perception. At query time, the Instruction-Guided Proposal Parser transforms user queries into structured, perceptually grounded visual proposals; during streaming, a Lightweight Proposal Matching Module performs efficient embedding-based matching to trigger responses. Experiments on StreamingBench and OVO-Bench demonstrate consistent improvements over prior models in proactive response accuracy and efficiency, validating an effective solution for proactive video understanding under strict computational constraints.
- Abstract(参考訳): Streaming Video Understandingの最近の進歩により、モデルがユーザのクエリに対して積極的に応答する、新たなインタラクションパラダイムが実現された。
現在のプロアクティブビデオLLMはフレーム単位のトリガ決定に依存しており、効率の精度のジレンマに悩まされている。
本稿では,ストリーミング認識から意味理解を分離する新しいフレームワークであるEm-Gardeを提案する。
Instruction-Guided Proposal Parserは、ユーザクエリを構造化された視覚的提案に変換する。ストリーミング中は、軽量提案マッチングモジュールが効率的な埋め込みベースのマッチングを実行してレスポンスをトリガーする。
StreamingBench と OVO-Bench の実験は、厳密な計算制約下でのプロアクティブ応答精度と効率において、先行モデルよりも一貫した改善を示し、プロアクティブビデオ理解に有効な解を検証した。
関連論文リスト
- Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding [37.682165829414494]
Video-QTRは、クエリ誘導推論プロセスとしてビデオ理解を再定義する軽量フレームワークである。
ビデオQTRは,入力フレームの消費を最大73%削減し,最先端の性能を実現する。
論文 参考訳(メタデータ) (2025-12-10T06:28:00Z) - StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding [52.55809460075286]
本稿では,今後のタスク関連情報を含むと思われる時間間隔と空間領域を予測できるStreamAgentを提案する。
我々は,重要な出来事の時間的進行を予測するために,予測エージェントに期待を促すことによって,質問の意味論と歴史的観察を統合する。
提案手法は,応答精度とリアルタイム効率において既存の手法よりも優れており,実世界のストリーミングシナリオの実用的価値を強調している。
論文 参考訳(メタデータ) (2025-08-03T18:15:42Z) - ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding [71.654781631463]
ReAgent-Vは、新しいエージェントビデオ理解フレームワークである。
推論中に効率の良いフレーム選択とリアルタイムの報酬生成を統合する。
12のデータセットに対する大規模な実験は、一般化と推論において大きな成果を上げている。
論文 参考訳(メタデータ) (2025-06-02T04:23:21Z) - Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction [81.34648970317383]
本稿では,知覚,決定,反応を両立させるシステムであるDispiderを紹介する。
実験により、Dispiderは従来のビデオQAタスクにおいて高いパフォーマンスを維持しているだけでなく、ストリーミングシナリオ応答における従来のオンラインモデルを大幅に上回っていることがわかった。
論文 参考訳(メタデータ) (2025-01-06T18:55:10Z) - AntPivot: Livestream Highlight Detection via Hierarchical Attention
Mechanism [64.70568612993416]
本稿では,Livestream Highlight Detectionという新たなタスクを定式化し,上記の課題を議論・分析し,新しいアーキテクチャAntPivotを提案する。
我々は、このタスクをインスタンス化し、我々のモデルの性能を評価するために、完全に注釈付きデータセットAntHighlightを構築した。
論文 参考訳(メタデータ) (2022-06-10T05:58:11Z) - FineDiving: A Fine-grained Dataset for Procedure-aware Action Quality
Assessment [93.09267863425492]
競争力のあるスポーツビデオにおける行動の高レベル意味論と内部時間構造の両方を理解することが、予測を正確かつ解釈可能なものにする鍵である、と我々は主張する。
本研究では,多様なダイビングイベントに対して,アクションプロシージャに関する詳細なアノテーションを付加した,ファインディビングと呼ばれる詳細なデータセットを構築した。
論文 参考訳(メタデータ) (2022-04-07T17:59:32Z) - Video Super-Resolution with Recurrent Structure-Detail Network [120.1149614834813]
ほとんどのビデオ超解像法は、時間的スライディングウィンドウ内の隣接するフレームの助けを借りて単一の参照フレームを超解する。
本稿では,従来のフレームを有効かつ効率的に利用し,現行のフレームを超解する新しいビデオ超解法を提案する。
論文 参考訳(メタデータ) (2020-08-02T11:01:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。