論文の概要: TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2607.17423v1
- Date: Sun, 19 Jul 2026 22:04:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.464593
- Title: TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
- Title(参考訳): TimeLens2:マルチモーダルLDMを用いた汎用ビデオ時間グラウンド
- Abstract要約: ビデオマルチモーダル大言語モデル(MLLM)は、ビデオ内で何が起こるかを記述することができるが、支持された証拠がいつ発生したかを特定することは滅多にない。
本研究では,ビデオの長さ,領域,クエリフォーム,視点をまたいだエビデンス間隔の変動心電図を1つのモデルで予測する一般的なビデオ時間的グラウンドについて検討する。
TimeLens2は、時間的エビデンスを、監督と最適化を通じて設定されたインターバルとして扱う。
- 参考スコア(独自算出の注目度): 36.2604844032041
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Video multimodal large language models (MLLMs) can describe what happens in a video, but rarely identify when the supporting evidence occurs. We study generalist video temporal grounding, in which one model predicts a variable-cardinality set of evidence intervals across video lengths, domains, query forms, and viewpoints. Existing training strategies are misaligned with this set-valued task: long-video labels often rely on brittle one-pass annotation, while reinforcement-learning rewards either fail to distinguish non-overlapping predictions or require fragile segment matching. TimeLens2 treats temporal evidence as an interval set throughout supervision and optimization. TimeLens2-93K constructs reliable multi-span supervision through caption-derived proposals, independent localization, cross-agent consensus, semantic verification, and boundary refinement. Our temporal Wasserstein reward computes exact one-dimensional \(W_1\) between uniform distributions over merged interval supports, providing dense, matching-free feedback under unequal cardinalities and equivalent fragmentation; temporal IoU complements it with precise-overlap feedback. Across seven benchmarks, TimeLens2-2B outperforms all size-matched baselines on every benchmark, while the 4B and 8B variants achieve state-of-the-art performance, surpassing open-source models with up to 397B parameters. The 2B, 4B, and 8B variants improve over their Qwen3-VL backbones by 14.2, 13.0, and 18.1 mIoU points, respectively.
- Abstract(参考訳): ビデオマルチモーダル大言語モデル(MLLM)は、ビデオ内で何が起こるかを記述することができるが、支持された証拠がいつ発生したかを特定することは滅多にない。
本研究では,ビデオの長さ,領域,クエリフォーム,視点をまたいだエビデンス間隔の変動心電図を1つのモデルで予測する一般的なビデオ時間的グラウンドについて検討する。
既存のトレーニング戦略は、この設定済みのタスクと不一致である: 長いビデオラベルは、しばしば脆弱なワンパスアノテーションに依存し、強化学習報酬は、重複しない予測の区別に失敗するか、脆弱なセグメントマッチングを必要とする。
TimeLens2は、時間的エビデンスを、監督と最適化を通じて設定されたインターバルとして扱う。
TimeLens2-93Kは、キャプション由来の提案、独立ローカライゼーション、クロスエージェントコンセンサス、セマンティック検証、境界修正を通じて、信頼性の高いマルチスパン監視を構築する。
我々の時間的ワッサースタイン報酬は、統合区間サポート上の一様分布間の正確な一次元 \(W_1\) を計算し、不等濃度下での密集した一致のないフィードバックと等価なフラグメンテーションを提供し、時間的IoUはそれを正確なオーバーラップフィードバックで補完する。
7つのベンチマークでTimeLens2-2Bはすべてのベンチマークでサイズにマッチしたベースラインを上回り、4Bと8Bは最先端のパフォーマンスを達成し、最大397Bパラメータを持つオープンソースモデルを上回っている。
2B, 4B, 8BはQwen3-VLのバックボーンをそれぞれ14.2, 13.0, 18.1 mIoUで改善している。
関連論文リスト
- VideoScout: Learning Agentic Active Exploration with Adaptive Reasoning Pacing for Long Video Understanding [61.00809248898572]
ロングビデオ理解(英: Long video understanding)とは、エージェントが時間軸に沿って回転してビデオを読み取る問題である。
適応推論によるSEAパラダイムをインスタンス化するマルチターン推論エージェントである textbfVideoScout を提案する。
長いビデオ理解と推論のベンチマーク実験により、我々の7Bモデルは、既存の訓練された7Bエージェントモデルと比較して、強い性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-09-14T14:04:03Z) - Adaptive Multi-Granularity Temporal Modeling for Weakly Supervised Video Anomaly Detection [1.2072875728151518]
弱教師付きビデオ異常検出(WSVAD)が重要な研究フロンティアとして登場した。
既存のほとんどのアプローチは、厳密で手作りの時間的優先順位に依存して異常スコアを監督するMultiple Instance Learning (MIL)フレームワークでWSVADを定式化する。
本稿では,複数の時間的粒度にまたがるビデオダイナミックスの変化を明示的に考慮したWSVADの適応時間的モデリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-04T12:27:43Z) - Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding [86.37002814396674]
ビデオ時間グラウンドのためのフォアシー・ツー・グラウンド(F2G)を提案する。
F2Gは予測的時間知覚とエビデンス駆動推論を統合している。
さまざまなベンチマークでグラウンド化の精度を一貫して向上させる。
論文 参考訳(メタデータ) (2026-05-21T04:03:25Z) - Inference-Time Temporal Probability Smoothing for Stable Video Segmentation with SAM2 under Weak Prompts [0.0]
提案するフレームワークは軽量で、モデルに依存しず、リアルタイムでインタラクティブなビデオセグメンテーションに適している。
提案手法は,フレームワイドおよび時間安定性指標の総合的セットを用いて,4つの多様な映像系列に対して評価する。
論文 参考訳(メタデータ) (2026-04-18T19:16:22Z) - TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning [54.70019148172847]
テスト時強化学習(Test-Time Reinforcement Learning)のパラダイムをビデオ言語データに活用することにより,事前学習されたモデルを明示的なラベルなしで,テスト時のビデオサンプルに適応させることができる。
ビデオアプローチのためのテスト時間適応(TTA-Vid)は、同時に動作する2つのコンポーネントを組み合わせる。
TTA-Vidは、様々なビデオ推論タスクで一貫した改善をもたらし、大規模データで訓練された最先端の手法より優れている。
論文 参考訳(メタデータ) (2026-04-01T09:52:57Z) - DATE: Dynamic Absolute Time Enhancement for Long Video Understanding [8.720269393713451]
長期ビデオ理解はマルチモーダル大言語モデル(MLLM)の根本的な課題であり続けている
MLLMにおける時間的意識を高める動的絶対時間拡張(DATE)を提案する。
本稿では,意味的関連性と時間的関連性の両方を保証するための2段階アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-09-11T08:49:22Z) - Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding [18.027290155746112]
時間探索(Temporal Search)は、MLLMが時間領域を探索し、長いビデオの理解を反復的に改善する訓練不要のフレームワークである。
モデルの生成信頼度は、時間間隔によって異なるため、予測精度と高い相関関係がある。
よりきめ細かな時間間隔に注意を移し、長いビデオの理解を深めることで、モデルの焦点を洗練させる。
論文 参考訳(メタデータ) (2025-06-28T15:24:05Z) - Multi-Pair Temporal Sentence Grounding via Multi-Thread Knowledge Transfer Network [57.72095897427665]
時間文グラウンドディング(TSG)は、ビデオ中のクエリ関連セグメントを見つけることを目的としている。
従来のメソッドは、異なるペアを一緒にトレーニングできないシングルスレッドフレームワークに従っていた。
我々はこれらのペアを協調訓練することを目的としたMulti-Pair TSGを提案する。
論文 参考訳(メタデータ) (2024-12-20T08:50:11Z) - TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models [75.42002690128486]
TemporalBenchは、ビデオの微細な時間的理解を評価するための新しいベンチマークだ。
ビデオクリップの時間的ダイナミクスを詳述した2Kの高品質な人間のアノテーションから派生した10KのビデオQ&Aペアで構成されている。
GPT-4oのような最先端のモデルは、TemporalBench上で38.5%の質問応答精度しか達成していない。
論文 参考訳(メタデータ) (2024-10-14T17:59:58Z) - Transform-Equivariant Consistency Learning for Temporal Sentence
Grounding [66.10949751429781]
ビデオ毎により差別的な表現を学習するために,新しい同変一貫性規則学習フレームワークを導入する。
私たちのモチベーションは、クエリ誘導アクティビティの時間的境界を一貫して予測することにある。
特に,ビデオの完全性と滑らか性を高めるために,自己教師付き一貫性損失モジュールを考案した。
論文 参考訳(メタデータ) (2023-05-06T19:29:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。