論文の概要: MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding
- arxiv url: http://arxiv.org/abs/2607.01751v1
- Date: Thu, 02 Jul 2026 06:07:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.692447
- Title: MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding
- Title(参考訳): MedStreamBench: ストリーミングとプロアクティブな医療ビデオ理解のためのタイムアウェアベンチマーク
- Abstract要約: 既存のベンチマークは、モデルが正しい回答を生成するかどうかを主に評価するが、それが正しいタイミングで回答するかどうかを評価することは滅多にない。
我々は、タイムアウェアな医療ビデオ理解のためのベンチマークであるMedStreamBenchを紹介する。
- 参考スコア(独自算出の注目度): 19.013019166564433
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Existing medical video benchmarks primarily evaluate whether a model produces the correct answer, but rarely assess whether it answers at the right time. In real clinical settings, AI systems must decide not only what to predict, but also when to answer, defer judgment, or proactively raise alerts. This creates a critical gap between benchmark evaluation and deployment requirements. We present MedStreamBench, a benchmark for time-aware medical video understanding. MedStreamBench integrates 22 medical datasets and 5,419 QA instances across four temporal settings: retrospective, present, future, and proactive. Unlike conventional benchmarks that assume full-video access, MedStreamBench restricts models to temporally bounded evidence windows and supports both single-turn and streaming evaluation. We further introduce a proactive monitoring setting that requires models to determine whether and when clinically relevant alerts should be triggered. Beyond answer correctness, MedStreamBench evaluates temporal behavior through responsiveness and post-evidence stability. Experiments on leading general-purpose and medical vision-language models reveal a substantial gap between offline recognition and temporally grounded decision-making, with performance dropping markedly in streaming and proactive settings. Our benchmark is available at https://huggingface.co/datasets/Venn2024/MedStreamBench.
- Abstract(参考訳): 既存の医療ビデオのベンチマークでは、モデルが正しい回答を生成するかどうかを主に評価するが、適切なタイミングで回答するかどうかを評価することは滅多にない。
実際の臨床環境では、AIシステムは何を予測すべきかだけでなく、いつ答えるか、判断を遅らせるか、あるいは警告を積極的に起こすかを判断する必要がある。
これにより、ベンチマーク評価とデプロイメント要件の間に重要なギャップが生じます。
我々は、タイムアウェアな医療ビデオ理解のためのベンチマークであるMedStreamBenchを紹介する。
MedStreamBenchは、22の医療データセットと5,419のQAインスタンスを4つの時間的設定(ふりかえり、現在、未来、前向き)に統合する。
フルビデオアクセスを前提とする従来のベンチマークとは異なり、MedStreamBenchはモデルを時間的に制限されたエビデンスウィンドウに制限し、シングルターンとストリーミング評価の両方をサポートする。
さらに,臨床的に関連のあるアラートを起動するかどうかをモデルに判断するプロアクティブなモニタリング設定を導入する。
回答の正しさ以外にも、MedStreamBenchは応答性やポストエビデンス安定性を通じて時間的挙動を評価する。
一般向けおよび医療向け視覚言語モデルを先導する実験では、オフライン認識と時間的基盤による意思決定の間に大きなギャップがあり、ストリーミングやプロアクティブな設定でパフォーマンスが著しく低下している。
私たちのベンチマークはhttps://huggingface.co/datasets/Venn2024/MedStreamBench.orgで公開されています。
関連論文リスト
- StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation [48.448082116311156]
StreamAV-Benchは、ストリーミングオーディオビデオ生成用に調整された最初の包括的なベンチマークである。
解析の結果,現在のモデルでは,対話制御時の進行的生成と応答性のボトルネックが時間的変動に悩まされていることが明らかとなった。
包括的故障解析に基づいて、ネイティブな共同音声-ビデオストリーミングモデルの開発を進めるための洞察を共有する。
論文 参考訳(メタデータ) (2026-08-26T19:16:24Z) - EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision [9.701124246177661]
連続エピソードメモリは自律エージェントのコア機能である。
Egostreamは、egocentric Visionにおけるエピソードメモリ評価の診断ベンチマークである。
論文 参考訳(メタデータ) (2026-05-29T17:20:10Z) - StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video [53.82672457255517]
プロアクティブなストリーミングビデオ理解には、ビデオストリームを継続的に処理し、応答すべきタイミングを決定するモデルが必要である。
既存のベンチマークは、明確な証拠が現れた後にのみ応答がトリガーされる"シー・ザ・アンサー"パラダイムに大きく従っている。
StreamProは、パーセプション理解、テンポラル推論、プロアクティブエージェンシーの3つの相補的な視点からストリーミングモデルを評価する新しいベンチマークである。
論文 参考訳(メタデータ) (2026-05-11T05:01:15Z) - Don't Pause! Every prediction matters in a streaming video [55.509551643600794]
一般的なストリーミング知覚とアシスト機能を評価するマルチターンプロアクティブクエリを特徴とするSPOT-Benchを提案する。
SPOT-BenchにはTimeliness-F1が付属している。
i)オフラインモデルは、確実にイベントを検知するが、スパム予測は失敗する; (ii) サイレントをトレーニングした後、スパムを減らし、応答を低下させる; (iii) ストリーミングビデオの半分は応答を期待しない。
論文 参考訳(メタデータ) (2026-04-27T11:07:03Z) - MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling [51.31633278218137]
MedScope(メドスコープ)は、ロングフォームなプロシージャを追求する粗大な証拠を実行する、ツールを用いた臨床ビデオ推論モデルである。
ClinVideoSuiteは、エビデンス中心の、きめ細かい臨床ビデオスイートだ。
フルできめ細かいビデオ理解ベンチマークでは、MedScopeは最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-02-11T09:47:02Z) - TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models [75.42002690128486]
TemporalBenchは、ビデオの微細な時間的理解を評価するための新しいベンチマークだ。
ビデオクリップの時間的ダイナミクスを詳述した2Kの高品質な人間のアノテーションから派生した10KのビデオQ&Aペアで構成されている。
GPT-4oのような最先端のモデルは、TemporalBench上で38.5%の質問応答精度しか達成していない。
論文 参考訳(メタデータ) (2024-10-14T17:59:58Z) - Streaming Motion Forecasting for Autonomous Driving [71.7468645504988]
ストリーミングデータにおける将来の軌跡を問うベンチマークを導入し,これを「ストリーミング予測」と呼ぶ。
我々のベンチマークは本質的に、スナップショットベースのベンチマークでは見過ごされていない安全上の問題であるエージェントの消失と再出現を捉えている。
我々は,任意のスナップショットベースの予測器をストリーミング予測器に適応させることのできる,"Predictive Streamer"と呼ばれるプラグアンドプレイメタアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-10-02T17:13:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。