論文の概要: TRACE: Temporal Audit and Condition-aware Evaluation of Streaming Video Understanding
- arxiv url: http://arxiv.org/abs/2609.30670v1
- Date: Fri, 25 Sep 2026 01:21:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.181263
- Title: TRACE: Temporal Audit and Condition-aware Evaluation of Streaming Video Understanding
- Title(参考訳): TRACE:ストリーミング映像理解の時間的監査と条件認識評価
- Abstract要約: TRACE (Temporal Audit and Condition-Aware Evaluation) は条件対応のベンチマークおよび評価フレームワークである。
517本の動画から1,240枚の記録を収集し、8つの構成で8つの公開モデルやシステムを評価した。
ほぼ同一のQA精度は、完成率、正解率、生成負荷のかなりの差を隠蔽できることがわかった。
- 参考スコア(独自算出の注目度): 13.520645078385343
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Streaming video understanding requires models to interpret evidence as it arrives, yet current evaluations often report task scores without specifying when evidence becomes valid, how visual history is maintained, or how responses are triggered. As a result, similar scores may correspond to different workloads, failure modes, and operational behavior. We introduce TRACE (Temporal Audit and Condition-aware Evaluation), a condition-aware benchmark and evaluation framework that makes these factors explicit. TRACE combines temporally audited visual tasks with evidence timing and instruction-dependent trigger annotations, a unified causal Core--Adapter protocol that controls information availability while recording actual history processing and response events, and multidimensional reporting of answer quality, timeliness, response-selection behavior, workload, completion, and reliability. On 1,240 records from 517 videos, we evaluate eight publicly available models or systems in eight configurations. We find that nearly identical QA accuracy can mask substantial differences in completion, answer validity, and generation workload, while proactive performance separates into response quality, response delay, false alarms (responses emitted while no target window is currently valid and a later one remains), and missed target windows. These results show that streaming-video performance should be interpreted as execution-conditioned system behavior rather than a single score. Our benchmark and code can be accessed at \href{https://github.com/om-ai-lab/trace-bench}{https://github.com/om-ai-lab/trace-bench}.
- Abstract(参考訳): ビデオ理解をストリーミングするには、証拠が到着するたびにモデルを解釈する必要があるが、現在の評価では、証拠がいつ有効になるか、どのように視覚的履歴が維持されるか、どのように反応が引き起こされるかを特定することなく、しばしばタスクスコアを報告している。
結果として、同様のスコアは、さまざまなワークロード、障害モード、運用動作に対応できる。
TRACE(Temporal Audit and Condition-Aware Evaluation)は条件対応のベンチマークおよび評価フレームワークで,これらの要因を明確にする。
TRACEは、時間的に監査された視覚タスクとエビデンスタイミングと命令依存トリガアノテーション、実際の履歴処理とレスポンスイベントを記録しながら情報可用性を制御する統合因果コア-アダプタプロトコル、応答品質、タイムライン、応答選択行動、ワークロード、完了、信頼性の多次元レポートを組み合わせる。
517本の動画から1,240枚の記録を収集し、8つの構成で8つの公開モデルやシステムを評価した。
ほぼ同一のQA精度は,応答品質,応答遅延,偽アラーム(現在ターゲットウィンドウが有効であり,後続のウィンドウが残っていない場合に発生する応答)とターゲットウィンドウが欠落している間に,完成度,応答妥当性,生成負荷のかなりの差を隠蔽する可能性がある。
これらの結果から,ストリーミング・ビデオのパフォーマンスは単一スコアではなく,実行条件のシステム動作として解釈されるべきであることが示唆された。
私たちのベンチマークとコードは、 \href{https://github.com/om-ai-lab/trace-bench}{https://github.com/om-ai-lab/trace-bench}でアクセスできます。
関連論文リスト
- AVTrace: Diagnosing Audio-Visual Temporal Reasoning in Omni Models [21.282677668992275]
AVTraceは、オンセットとスパングラウンド、同期、次ステップ予測、クロスモーダルローカライゼーション、チェーン解析、イベントコンディショナブル理解にまたがる診断スイートである。
基準ブラインド応答正規化と決定論的スコアリングを用いて,それぞれの入力構成に基づいて5つのオープンオムニモデルを評価する。
論文 参考訳(メタデータ) (2026-09-17T09:58:27Z) - Spike-Killer: Evidence-Gated LLM Assistance for Safe Performance Diagnosis on a Real Windows Workstation [0.0]
LLM支援エージェントは、システムエビデンスを合成し、構成変更を提案し、診断タスクを自動化することができる。
我々は、実際のWindowsワークステーションでフレームタイムの苦情を診断するための、人間公認のワークフローであるSpike-Killerを紹介する。
論文 参考訳(メタデータ) (2026-08-21T13:11:15Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Explainable Runtime Dependency Tracking for AI-RAN Conflict Monitoring [0.0]
将来のAI統合無線アクセスネットワーク(AI-RAN)は、オープンプログラム可能性と学習可能なxApp、rApp、共有パラメータとキーパフォーマンスインジケータ(KPI)に作用するコントロール機能を組み合わせる。
競合監視では、どのアプリケーションがデプロイされているかを知るだけでは十分ではなく、実行時診断によって仮定されるパラメータ--KPI依存性が、現在の運用体制の下で有効であるかどうかを知る必要がある。
本稿では,ストリーミングテレメトリイベントから解釈可能な依存性表現を追跡する,軽量なモニタリングプリミティブについて検討する。
論文 参考訳(メタデータ) (2026-06-04T19:21:32Z) - Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA [15.724849094439987]
TimeLogicQAは、ビデオ質問応答システムが時間的関係について推論できるかどうかを評価する。
我々はこの課題を視覚的エビデンスルーティングパイプラインで解決し、認識を象徴的な時間的推論から分離する。
論文 参考訳(メタデータ) (2026-05-31T08:49:04Z) - Detecting Object Tracking Failure via Sequential Hypothesis Testing [80.7891291021747]
ビデオにおけるリアルタイムのオンラインオブジェクト追跡は、コンピュータビジョンにおける中核的なタスクである。
本稿では,物体追跡を逐次的仮説テストとして解釈することを提案する。
本研究では,地中追跡情報と内部追跡情報の両方を活用することにより,教師なしと教師なしの両方の変種を提案する。
論文 参考訳(メタデータ) (2026-02-13T14:57:15Z) - VIPER: Process-aware Evaluation for Generative Video Reasoning [64.86465792516658]
我々は、時間的、構造的、象徴的、空間的、物理的、計画的推論にまたがる16のタスクにまたがる包括的なベンチマークVIPERを紹介する。
実験の結果,現状の映像モデルでは約20%のPOC@1.0しか達成できず,良好な結果が得られた。
論文 参考訳(メタデータ) (2025-12-31T16:31:59Z) - What Happens When: Learning Temporal Orders of Events in Videos [23.17822149091485]
Video Large Multimodal Models (VLMM) はビデオ理解において顕著な性能を示しているが、複数のイベントの時間順序を正確に把握する能力はいまだ探索されていない。
本稿では,イベントの時間的順序を識別するモデルの能力を明確に評価するために,VECTORを提案する。
本稿では,詳細なイベント・バイ・イベントの映像記述をモデルとしてトレーニングし,時間的意識を高めるために,推論時にチェーン・オブ・ソート・プロンプトを利用するMECOTを提案する。
論文 参考訳(メタデータ) (2025-12-05T07:50:59Z) - Perception Test: A Diagnostic Benchmark for Multimodal Video Models [78.64546291816117]
本稿では,事前学習したマルチモーダルモデルの知覚と推論能力を評価するために,新しいマルチモーダルビデオベンチマークを提案する。
知覚テストは、スキル(記憶、抽象化、物理学、セマンティックス)と、ビデオ、オーディオ、テキストモダリティ間の推論(記述的、説明的、予測的、反ファクト的)のタイプに焦点を当てている。
このベンチマークは、ゼロショット/少数ショットまたは限定的な微調整方式で、転送機能の事前訓練されたモデルを探索する。
論文 参考訳(メタデータ) (2023-05-23T07:54:37Z) - CONVIQT: Contrastive Video Quality Estimator [63.749184706461826]
知覚ビデオ品質評価(VQA)は、多くのストリーミングおよびビデオ共有プラットフォームにおいて不可欠な要素である。
本稿では,視覚的に関連のある映像品質表現を自己指導的に学習する問題について考察する。
本研究は, 自己教師型学習を用いて, 知覚力による説得力のある表現が得られることを示す。
論文 参考訳(メタデータ) (2022-06-29T15:22:01Z) - ASCNet: Self-supervised Video Representation Learning with
Appearance-Speed Consistency [62.38914747727636]
本研究では,1)明示的な監督のためのラベルの欠如,2)構造化されていない,ノイズの多い視覚情報による自己指導型映像表現学習について検討する。
既存の方法は、主にビデオクリップをインスタンスとしてコントラスト損失を使用し、互いにインスタンスを識別することで視覚的表現を学ぶ。
本稿では,ロバストな映像表現を学ぶ上で,正のサンプル間の一貫性が鍵となることを観察する。
論文 参考訳(メタデータ) (2021-06-04T08:44:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。