論文の概要: StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video
- arxiv url: http://arxiv.org/abs/2605.16381v1
- Date: Mon, 11 May 2026 05:01:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 23:51:08.308865
- Title: StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video
- Title(参考訳): StreamPro: リアクティブパーセプションからストリーミングビデオにおけるプロアクティブな意思決定へ
- Authors: Ao Li, Zihan Xiao, Zihao Yue, Boshen Xu, Linli Yao, Jiaze Li, Pei Fu, Jianzhong Ju, Jian Luan, Qin Jin,
- Abstract要約: プロアクティブなストリーミングビデオ理解には、ビデオストリームを継続的に処理し、応答すべきタイミングを決定するモデルが必要である。
既存のベンチマークは、明確な証拠が現れた後にのみ応答がトリガーされる"シー・ザ・アンサー"パラダイムに大きく従っている。
StreamProは、パーセプション理解、テンポラル推論、プロアクティブエージェンシーの3つの相補的な視点からストリーミングモデルを評価する新しいベンチマークである。
- 参考スコア(独自算出の注目度): 53.82672457255517
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Proactive streaming video understanding requires models to continuously process video streams and decide when to respond, rather than merely what to respond. This naturally introduces a decision-making problem under partial observations, where models must balance early prediction against sufficient evidence. However, existing benchmarks largely follow a "see-then-answer" paradigm, where responses are triggered only after explicit evidence appears, effectively reducing proactive reasoning to delayed perception. As a result, they fail to evaluate a model's ability to make timely and reliable decisions under incomplete observations. Moreover, training proactive models is inherently challenging due to the extreme imbalance between silence and response signals in streaming trajectories, as well as the need to jointly optimize response correctness and timing. To address these challenges, we introduce StreamPro-Bench, a new benchmark that evaluates streaming models from three complementary perspectives: Perception Understanding, Temporal Reasoning, and Proactive Agency, where the last measures a model's ability to make early yet reliable decisions under partial observations. We further propose StreamPro, a two-stage training framework for proactive learning. First, we introduce CB-Stream Loss to mitigate the severe supervision imbalance during supervised fine-tuning (SFT). Then, we apply Group Relative Policy Optimization (GRPO) with a multi-grained reward design that involves both turn-level and trajectory-level rewards. Experiments show that StreamPro significantly improves proactive performance. On StreamPro-Bench, it achieves 41.5, substantially outperforming the previous best (10.4), while also maintaining strong performance on real-time streaming benchmarks, achieving 78.9 on StreamingBench-RTVU.
- Abstract(参考訳): プロアクティブなストリーミングビデオ理解には、ビデオストリームを継続的に処理し、応答すべきタイミングを決定するモデルが必要である。
このことは、モデルが十分な証拠に対して早期予測のバランスをとる必要がある部分的な観察の下での意思決定問題を自然に導入する。
しかし、既存のベンチマークは、明確な証拠が現れた後にのみ応答がトリガーされる「シー・ザ・アン・アンサー」パラダイムに大きく従っているため、遅延知覚に対する積極的推論が効果的に減少する。
結果として、不完全な観察の下でタイムリーかつ信頼性の高い決定を行うモデルの能力を評価することができない。
さらに、ストリーミングトラジェクトリにおけるサイレント信号と応答信号の極端不均衡と、応答の正しさとタイミングを協調的に最適化する必要があるため、プロアクティブモデルのトレーニングは本質的に困難である。
これらの課題に対処するために、StreamPro-Benchという、パーセプション理解、テンポラル推論、プロアクティブエージェンシーの3つの相補的な視点からストリーミングモデルを評価する新しいベンチマークを紹介します。
さらに,プロアクティブ学習のための2段階のトレーニングフレームワークであるStreamProを提案する。
まず,教師付き微調整(SFT)における厳しい監督の不均衡を軽減するため,CB-Stream Lossを導入する。
次に,グループ相対政策最適化 (GRPO) をターンレベルとトラジェクトリレベルの両方の報酬を含む多粒な報酬設計で適用する。
実験によると、StreamProはプロアクティブなパフォーマンスを大幅に改善する。
StreamPro-Benchでは41.5を達成し、以前の最高点(10.4)を大幅に上回り、リアルタイムストリーミングベンチマークでは78.9をStreamingBench-RTVUで達成している。
関連論文リスト
- Don't Pause! Every prediction matters in a streaming video [55.509551643600794]
一般的なストリーミング知覚とアシスト機能を評価するマルチターンプロアクティブクエリを特徴とするSPOT-Benchを提案する。
SPOT-BenchにはTimeliness-F1が付属している。
i)オフラインモデルは、確実にイベントを検知するが、スパム予測は失敗する; (ii) サイレントをトレーニングした後、スパムを減らし、応答を低下させる; (iii) ストリーミングビデオの半分は応答を期待しない。
論文 参考訳(メタデータ) (2026-04-27T11:07:03Z) - SHARP: Short-Window Streaming for Accurate and Robust Prediction in Motion Forecasting [53.74101174559609]
本稿では,進化するシーンに特化して焦点をあてた,ストリーミングベースの新たな動き予測フレームワークを提案する。
本手法は,入ってくる観測ウィンドウを段階的に処理し,インスタンス対応コンテキストストリーミングを利用して潜時エージェント表現の維持と更新を行う。
我々のモデルは,Argoverse 2マルチエージェントベンチマークのストリーミング推論における最先端性能を実現し,遅延を最小限に抑えながら,実世界の展開に適していることを強調した。
論文 参考訳(メタデータ) (2026-03-30T06:47:19Z) - STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding [77.20037111885226]
現実のデプロイメントでは、ストリーミングの認識とプロアクティブなインタラクションがますます必要になります。
本研究では、構造化シーケンスモデリング問題として、ストリーミングビデオのアクティブなアクティベーションを再考する。
本稿では,アクティベーションインタフェースに軽量なマスク付き拡散モジュールを用いて,アクティベーション信号を共同で予測し,段階的に洗練するSTRIDEを提案する。
論文 参考訳(メタデータ) (2026-03-29T09:23:45Z) - Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding [19.76957611582713]
Em-Gardeは、セマンティック理解とストリーミング知覚を分離する新しいフレームワークである。
StreamingBench と OVO-Bench の実験では、事前のモデルよりも前向きな応答精度と効率で一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-03-19T15:47:50Z) - StreamReady: Learning What to Answer and When in Long Streaming Videos [28.99829321053373]
我々は、Answer Readiness Score (ARS) を用いたストリーミングビデオ理解の可読性を考慮した定式化を導入する。
ARSは、モデルが正しいかどうかではなく、適切なタイミングで答えられるかどうかを測定する効果的な精度を定義します。
この定式化に基づいて、リアルタイム応答と時間的推論を統一するフレームワークStreamReadyを導入します。
論文 参考訳(メタデータ) (2026-03-09T17:02:44Z) - Streaming Motion Forecasting for Autonomous Driving [71.7468645504988]
ストリーミングデータにおける将来の軌跡を問うベンチマークを導入し,これを「ストリーミング予測」と呼ぶ。
我々のベンチマークは本質的に、スナップショットベースのベンチマークでは見過ごされていない安全上の問題であるエージェントの消失と再出現を捉えている。
我々は,任意のスナップショットベースの予測器をストリーミング予測器に適応させることのできる,"Predictive Streamer"と呼ばれるプラグアンドプレイメタアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-10-02T17:13:16Z) - StreamYOLO: Real-time Object Detection for Streaming Perception [84.2559631820007]
将来を予測する能力を備えたモデルを提供し、ストリーミング知覚の結果を大幅に改善する。
本稿では,複数の速度を駆動するシーンについて考察し,VasAP(Velocity-Awared streaming AP)を提案する。
本手法は,Argoverse-HDデータセットの最先端性能を実現し,SAPとVsAPをそれぞれ4.7%,VsAPを8.2%改善する。
論文 参考訳(メタデータ) (2022-07-21T12:03:02Z) - Teaching BERT to Wait: Balancing Accuracy and Latency for Streaming
Disfluency Detection [3.884530687475798]
BERTをベースとしたシーケンスタギングモデルは,リアルタイムに分散を検出することができる。
モデルは、インクリメンタルな拡散検出に関する最近の研究と比較して、最先端のレイテンシと安定性のスコアを得る。
論文 参考訳(メタデータ) (2022-05-02T02:13:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。