論文の概要: StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos
- arxiv url: http://arxiv.org/abs/2608.18532v1
- Date: Wed, 19 Aug 2026 04:31:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.27936
- Title: StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos
- Title(参考訳): StateTrace:ロングビデオにおける隠れ状態時空間推論のためのオブジェクト中心フレームワーク
- Abstract要約: StateTraceは、トラジェクトリ、オブジェクト間関係、状態遷移イベントを構造化された推論基板にまとめる再利用可能な時間状態メモリを構築する。
StateTraceは、パブリックベンチマークとHSR-Benchの両方のパフォーマンスを継続的に改善することを示す。
- 参考スコア(独自算出の注目度): 45.587387649513325
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing VLMs have achieved strong performance in video understanding, yet they struggle with long-video spatiotemporal reasoning when target objects become invisible, often mistaking "invisible" for "unknown". We define this challenge as hidden-state spatiotemporal reasoning: inferring object states during prolonged invisible intervals from context interactions. To address this, we propose StateTrace, a novel object-centric framework that endows VideoLLMs with an explicit mechanism for hidden state reasoning in long videos. StateTrace builds a reusable spatiotemporal state memory that organizes object trajectories, inter-object relations, and state-transition events into a structured reasoning substrate. At inference time, it retrieves question-relevant state-evolution trajectories and converts them into compact reasoning cues, enabling the model to explicitly reason about why an object disappears, how its state evolves while invisible, and whether that state should persist at query time. We further build HSR-Bench, a diagnostic benchmark for hidden-state reasoning, containing 1,427 video-QA samples from 1,384 unique videos. Extensive experiments across multiple VideoLLMs show that StateTrace consistently improves performance on both public benchmarks and HSR-Bench (e.g., improving VideoLLaMA3 from 39.6 to 64.2 on HSR-Bench).
- Abstract(参考訳): 既存のVLMはビデオ理解において高いパフォーマンスを達成しているが、ターゲットオブジェクトが見えなくなると長時間ビデオの時空間的推論に苦慮し、しばしば「未知」を「見えない」と誤解する。
我々は、この課題を隠れ状態の時空間的推論として定義する。
これを解決するために、長いビデオで隠された状態推論の明示的なメカニズムをビデオLLMに付与する、新しいオブジェクト中心のフレームワークであるStateTraceを提案する。
StateTraceは再利用可能な時空間メモリを構築し、オブジェクトのトラジェクトリ、オブジェクト間の関係、状態遷移イベントを構造化された推論基板に整理する。
推論時には、疑問に関連のある状態進化軌跡を検索し、それらをコンパクトな推論キューに変換することで、オブジェクトが消えた理由、その状態が見えない状態でどのように進化するか、クエリ時にその状態が持続するかどうかを明確に推論することができる。
我々はさらに、1,384のユニークなビデオから1,427のビデオQAサンプルを含む隠れ状態推論の診断ベンチマークであるHSR-Benchを構築した。
複数のVideoLLMの広範な実験により、StateTraceはパブリックベンチマークとHSR-Benchの両方のパフォーマンスを継続的に改善している(例えば、ビデオLLaMA3はHSR-Benchでは39.6から64.2に改善されている)。
関連論文リスト
- Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events [52.031070006859544]
ビデオマルチモーダル大言語モデル(MLLM)は、一般的なビデオ理解と長大なビデオ理解を急速に進歩させてきたが、短い回答クリティカルな視覚的証拠を保存できる能力はいまだに未発見のままである。
本稿では,映像MLLMの時間的忠実度を時間的視覚的事象理解によって診断するためのベンチマークであるMoment-Videoを紹介する。
論文 参考訳(メタデータ) (2026-06-01T17:32:20Z) - TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models [9.648992690108086]
ビデオ大言語モデル(ビデオ-LLM)は、一般的なビデオ理解において大きな進歩を遂げているが、時間的オブジェクトの一貫性を維持する能力はいまだ探索されていない。
ビデオLLMにおける時間的オブジェクトの一貫性を評価するための診断ベンチマークであるTOC-Benchを紹介する。
論文 参考訳(メタデータ) (2026-05-11T02:47:59Z) - Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models [154.39583176906893]
大規模言語モデル(ML)は高度な理解を持ち、シーンにおける幻覚の傾向が高い。
これは、時間的モニタリングの失敗、オブジェクトの動的アイデンティティ、状態、そして時間とともに関係を永続的に追跡する能力に起因している、と我々は主張する。
既存のベンチマークでは、局所的な視覚的手がかりや統計的先行によってしばしば解決される1つの最終回答クエリに頼って、この欠陥を曖昧にしている。
論文 参考訳(メタデータ) (2026-05-09T14:32:36Z) - VCBench: A Streaming Counting Benchmark for Spatial-Temporal State Maintenance in Long Videos [20.761149440325614]
我々は,世界的メンテナンス能力の診断のための最小限のプローブとしてカウントするストリーミングカウントベンチマークであるVCBenchを提案する。
VCBenchには、フレーム単位のアノテーションで10,071のイベント発生モーメントとオブジェクト状態変更モーメントを備えた406のビデオが含まれている。
数値精度,軌道整合性,時間的認識の3つの相補的指標を設計する。
論文 参考訳(メタデータ) (2026-03-13T06:28:46Z) - A Unified Reasoning Framework for Holistic Zero-Shot Video Anomaly Analysis [64.42659342276117]
ビデオの異常な研究のほとんどは、フレームワイド検出で停止し、なぜイベントが異常なのかについての洞察はほとんど得られない。
近年の動画の局所化と映像の異常理解手法は、説明可能性を改善するが、データに依存し、タスク固有のままである。
本稿では,時間的検出,空間的局所化,テキスト的説明のギャップを埋める統一的推論フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-02T14:49:08Z) - Open-o3 Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence [70.2803680525165]
我々は、明示的な証拠をビデオ推論に統合する非エージェントフレームワークであるOpen-o3 Videoを紹介した。
このモデルは、キーオブジェクトとバウンディングボックスをその答えとともに強調し、推論を具体的な視覚的な観察で基礎付けることができる。
V-STARベンチマークでは、Open-o3 Videoは最先端のパフォーマンスを達成し、mAMを14.4%、mLタイムスタンプを24.2%向上させた。
論文 参考訳(メタデータ) (2025-10-23T14:05:56Z) - When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding [12.410012029024342]
我々は,3つの重要なイノベーションを導入することで,制限を克服するビデオLLMであるGrounded VideoDiTを紹介する。
第一に、拡散時間遅延(DTL)エンコーダは境界感度を高め、時間的一貫性を維持する。
第二に、オブジェクト基底表現は、クエリエンティティを局所化された視覚的エビデンスに明示的に結合し、アライメントを強化する。
第三に、離散時間的タイムスタンプトークンを持つ混合トークンスキームは明示的なモデリングを提供し、きめ細かい時間的推論を可能にする。
論文 参考訳(メタデータ) (2025-08-21T15:12:14Z) - V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning [40.18308199837137]
これらの問題点に対処するために,ビデオS-テンポラル推論(V-STa)ベンチマークを導入する。
我々は,ビデオLLMの時空間推論プロセスを実現するためのデータセットを構築した。
14のビデオ-LLMによる実験では、現在のビデオ-LLMと、堅牢で一貫性のある推論の必要性の間に大きなギャップが示されている。
論文 参考訳(メタデータ) (2025-03-14T15:21:44Z) - Learning to Track with Object Permanence [61.36492084090744]
共同物体の検出と追跡のためのエンドツーエンドのトレーニング可能なアプローチを紹介します。
私たちのモデルは、合成データと実データで共同トレーニングされ、KITTIおよびMOT17データセットの最先端を上回ります。
論文 参考訳(メタデータ) (2021-03-26T04:43:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。