論文の概要: Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs
- arxiv url: http://arxiv.org/abs/2605.07568v1
- Date: Fri, 08 May 2026 10:40:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:39.002601
- Title: Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs
- Title(参考訳): 時間経過の追跡:ビデオLLMにおける時間的情報フローの診断
- Abstract要約: フレーム中心のエンコーダは、フレーム中心のエンコーダがそうでないのに対し、ビデオ中心のテンポラリなテンポラリなモデリングによるエンコーダが強いテンポラリなテンポラリなテンポラリなテンポラリなテンポラリなテンポラリな信号をエンコードしている。
ビデオ中心の表現が標準のVideo-LLMアーキテクチャに渡すと、パフォーマンスが崩壊し、時間的情報フローのボトルネックが明らかになる。
我々は、時間対応ビデオ中心エンコーダ、時間保存プロジェクタ、およびAoT監督を備えたビデオLLMを構築し、AoT$_PPB$での人間のパフォーマンスを98.1%精度で上回る。
- 参考スコア(独自算出の注目度): 7.722366540557897
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Arrow-of-Time (AoT) task, determining whether a video plays forward or backward by recognizing temporal irreversibility, is one humans solve with near-perfect accuracy, yet frontier Video Large Language Models (Video-LLMs) perform only modestly above chance. This gap raises a key question: do visual backbones fail to encode temporal information, or does information bottleneck lie elsewhere in the Video-LLM architecture? We address this question by isolating the vision encoder from the Video-LLM and tracing temporal information across the encoder, projector, and LLM. We find that video-centric encoders with explicit temporal modeling encode strong temporal signals, whereas frame-centric encoders do not. However, when video-centric representations are passed through a standard Video-LLM architecture, performance often collapses, revealing a bottleneck of temporal information flow. We identify projector design as a key factor: Q-Former disrupts temporal information, while a time-preserved MLP projection substantially improves the LLM's access to such information. Our layer-wise analysis further shows temporal representation dynamics across encoder layers. Guided by these findings, we build a Video-LLM with temporal-aware video-centric encoder, time-preserved projector, and AoT supervision, surpassing human performance on AoT$_{PPB}$ with 98.1\% accuracy, and improving broader temporal reasoning tasks by up to 6.0 points on VITATECS-Direction and 1.3 points on TVBench. Our results show that temporal reasoning in Video-LLMs requires both effective temporal encoding and reliable transfer of this information to the LLM.
- Abstract(参考訳): アロー・オブ・タイム(AoT)タスクは、時間的不可逆性を認識してビデオが前方または後方で再生されるかどうかを判定するタスクであり、人間がほぼ完璧な精度で解決するが、フロンティアビデオ大言語モデル(Video-LLMs)はわずかに上回っている。
視覚的なバックボーンは時間情報のエンコードに失敗するのか、あるいは Video-LLM アーキテクチャの他の部分にはボトルネックがあるのか?
本稿では,視覚エンコーダを Video-LLM から分離し,エンコーダ,プロジェクタ,LLM にまたがる時間情報を追跡することによって,この問題に対処する。
フレーム中心のエンコーダは、フレーム中心のエンコーダがそうでないのに対し、ビデオ中心のテンポラリなテンポラリなモデリングによるエンコーダが強いテンポラリなテンポラリなテンポラリなテンポラリなテンポラリなテンポラリな信号をエンコードしている。
しかし、ビデオ中心の表現が標準のVideo-LLMアーキテクチャに渡されると、パフォーマンスはしばしば崩壊し、時間的情報フローのボトルネックが明らかになる。
Q-Former は時間保存型 MLP プロジェクションが LLM のそのような情報へのアクセスを大幅に改善する一方で、時間保存型 MLP プロジェクションは時間情報を破壊します。
層構造解析により,エンコーダ層間の時間的表現のダイナミクスがさらに明らかになった。
これらの結果から,映像中心エンコーダ,時間保存プロジェクタ,およびAoT監督機能を備えたビデオLLMを構築し,AoT$_{PPB}$98.1\%の精度で人的パフォーマンスを上回り,VITATECS-Directionで最大6.0ポイント,TVBenchで1.3ポイントの時間的推論タスクを改善する。
以上の結果から,ビデオLLMにおける時間的推論には,効果的な時間的エンコーディングと信頼性の両立が求められることがわかった。
関連論文リスト
- TV-RAG: A Temporal-aware and Semantic Entropy-Weighted Framework for Long Video Retrieval and Understanding [14.570869250170139]
TV-RAGは、時間的アライメントとエントロピー誘導のセマンティクスを結合して、長時間ビデオの推論を改善する、トレーニング不要のアーキテクチャである。
これらの時間的および意味的な信号を織り合わせることで、TV-RAGは、再トレーニングや微調整なしに任意のLVLMに移植できる二重レベルの推論ルーチンを実現する。
論文 参考訳(メタデータ) (2025-12-29T14:10:22Z) - Enhancing Temporal Understanding in Video-LLMs through Stacked Temporal Attention in Vision Encoders [9.162827706080337]
本稿では,視覚エンコーダ内に直接重畳された時間的注意モジュールを導入したビデオLLMアーキテクチャを提案する。
この設計では、視覚エンコーダの時間的注意が組み込まれており、モデルがアクションの進行とフレーム間の関係をよりよく捉えることができる。
その結果,本手法は時間的推論を著しく改善し,ビデオ質問応答タスクにおける既存モデルよりも優れることがわかった。
論文 参考訳(メタデータ) (2025-10-29T23:50:57Z) - Harnessing Synthetic Preference Data for Enhancing Temporal Understanding of Video-LLMs [54.502280390499756]
我々はTimeWarpを提案し、モデルからの応答を微調整し、与えられた入力ビデオにフォーカスするよう促すために、ターゲットとなる合成時間データセットを作成する。
提案手法を既存モデルに適用すると,時間的理解ベンチマークの性能が大幅に向上することが実証された。
論文 参考訳(メタデータ) (2025-10-04T21:48:40Z) - Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data [100.5266292850922]
Streferはビデオ大モデルに参照と推論機能を持たせるために設計された合成データ生成フレームワークである。
Streferは、時間的に密度が高くきめ細かなビデオメタデータを擬似アノテーションするデータエンジンを使用して、多様な命令生成データを生成する。
我々のアプローチは、ビデオLLMが空間的および時間的参照を解釈する能力を高め、現実のAIコンパニオンに不可欠な、より汎用的で時空間対応の推論を育む。
論文 参考訳(メタデータ) (2025-09-03T17:33:20Z) - FRAME: Pre-Training Video Feature Representations via Anticipation and Memory [55.046881477209695]
FRAMEは、高密度ビデオ理解に適した自己監督型ビデオフレームエンコーダである。
同社は、過去と現在のRGBフレームから現在と将来のDINOパッチ機能を予測することを学ぶ。
画像エンコーダや既存の自己監督型ビデオモデルよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-06-05T19:44:47Z) - STORM: Token-Efficient Long Video Understanding for Multimodal LLMs [116.4479155699528]
STORMは、イメージエンコーダとビデオLLMの間に専用のテンポラリエンコーダを組み込んだ、新しいアーキテクチャである。
我々は,STORMが様々な長いビデオ理解ベンチマークにおいて最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2025-03-06T06:17:38Z) - Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries [50.47265863322891]
Video Question Answering (ビデオQA)は、ビデオ全体を理解するためにモデルを必要とする、難しいビデオ理解タスクである。
近年のMLLM(Multimodal Large Language Models)の進歩は,ビデオQAに特有なコモンセンス推論機能を活用して変化している。
本稿では,フレーム単位の視覚知覚とLCMの推論能力の間に疑問を導いた時間的ブリッジを生成する,新しい時間的モデリング手法であるT-Formerを提案する。
論文 参考訳(メタデータ) (2024-12-26T17:53:14Z) - Do Language Models Understand Time? [2.290956583394892]
大規模言語モデル(LLM)は、アクション認識、異常検出、要約を含む、ビデオベースのコンピュータビジョンアプリケーションに革命をもたらした。
本研究は,ビデオ処理におけるLLMの役割を,時間的推論能力に着目して批判的に考察する。
LLMの時間的理解を制限するため、バイアス、時間的アノテーションの欠如、ドメイン固有の制限など、既存のビデオデータセットによる課題を分析します。
論文 参考訳(メタデータ) (2024-12-18T13:38:06Z) - Temporal Reasoning Transfer from Text to Video [51.68487044397409]
ビデオ大言語モデル(ビデオLLM)は、時間的変化の追跡と時間的関係の推論に苦労する。
テキストからビデオ領域への時間的推論能力を伝達するために、テキスト時間的推論転送(T3)を導入する。
LongVA-7Bモデルは、包括的なビデオベンチマーク上での競合性能を実現する。
論文 参考訳(メタデータ) (2024-10-08T16:10:29Z) - Enhancing Temporal Modeling of Video LLMs via Time Gating [38.86742466948778]
ビデオ大言語モデル (Video Large Language Models, ビデオLLM) は、ビデオ質問応答などのビデオ・アンド・ランゲージ・タスクにおいて、優れたパフォーマンスを達成している。
既存のビデオLLMはビデオデータの時間的情報を無視しており、時間的認識のビデオ理解に苦慮している。
時間ゲーティングビデオLLM(TG-Vid)を提案する。
論文 参考訳(メタデータ) (2024-10-08T06:21:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。