論文の概要: TimePLE: Rethinking Temporal Representation for Video Temporal Grounding
- arxiv url: http://arxiv.org/abs/2607.23951v1
- Date: Mon, 27 Jul 2026 02:56:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.29159
- Title: TimePLE: Rethinking Temporal Representation for Video Temporal Grounding
- Title(参考訳): Timeple:ビデオの時間的グラウンド化のための時間的表現の再考
- Abstract要約: ビデオ時間グラウンド(VTG)は、自然言語クエリによって記述された連続的なビデオ間隔をローカライズすることを目的としている。
本稿では,VTGを終端予測からインターバルネイティブグラウンドに再構成するTimePLEを提案する。
4つのVTGベンチマークによる実験によると、TimePLEは終端予測ベースラインを一貫して上回っている。
- 参考スコア(独自算出の注目度): 45.27333302368563
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Video temporal grounding (VTG) aims to localize the continuous video interval described by a natural-language query. However, current VLM-based methods typically produce this interval indirectly through two endpoint outputs, represented either as discrete timestamp tokens or continuous boundary coordinates. These formulations differ in how endpoints are encoded, but not in what is predicted: the event interval remains a derived object, while interval validity, duration, and interval-level similarity are handled only implicitly. We propose TimePLE, which reformulates VTG from endpoint prediction to interval-native grounding by predicting a single joint distribution over valid temporal intervals. TimePLE maps each interval to a point in a canonical position-duration square, where every support point corresponds to a valid span and neighboring points represent geometrically similar intervals. Given a video and query, the VLM generates a single latent <|TIMESPAN|> token whose hidden state is decoded into a joint interval distribution, refined through duration-aware coordinate correction, and converted into continuous boundaries. The same interval representation is used to encode input temporal anchors, aligning video-side temporal evidence with output-side span prediction. To reliably align the latent span representation with complete event intervals, we curate 90K-scale grounded samples and human-verify 3K-scale benchmark annotations. Experiments across four VTG benchmarks show that TimePLE consistently outperforms endpoint prediction baselines, achieving an average mIoU of 58.9, with clear gains on short-duration and medium-duration events.
- Abstract(参考訳): ビデオ時間グラウンド(VTG)は、自然言語クエリによって記述された連続的なビデオ間隔をローカライズすることを目的としている。
しかしながら、現在のVLMベースの手法は、2つのエンドポイント出力を通してこの間隔を間接的に生成し、離散タイムスタンプトークンまたは連続境界座標として表される。
これらの定式化は、エンドポイントのエンコード方法が異なるが、予測対象にはない: イベント間隔は導出対象のままであり、インターバルの妥当性、期間、インターバルレベルの類似性は暗黙的にのみ扱われる。
本稿では,VTGを終端予測から時分割グラウンド化へ変換するTimePLEを提案する。
タイムプルは各間隔を正準位数正方形の点にマッピングし、各サポートポイントは有効スパンに対応し、隣接するポイントは幾何学的に類似した間隔を表す。
ビデオとクエリが与えられた後、VLMは単一の遅延<|TIMESPAN|>トークンを生成し、隠れ状態は結合間隔分布にデコードされ、持続時間対応座標補正によって洗練され、連続境界に変換される。
同じ間隔表現は、入力時間アンカーを符号化し、ビデオ側時間証拠と出力側スパン予測を一致させる。
遅延スパン表現を完全なイベント間隔に確実に整列させるため,90Kスケールのグラウンドドサンプルと人間検証3Kスケールのベンチマークアノテーションをキュレートする。
4つのVTGベンチマークによる実験によると、TimePLEは終端予測ベースラインを一貫して上回り、平均mIoUは58.9であり、短期や中長期のイベントでは明らかである。
関連論文リスト
- Learning Hyperspherical Time-Frequency Representations for Time-Series Out-of-Distribution Detection [0.2160500132391863]
本研究は,超球面埋め込みを用いた表現学習として時系列OOD検出を定式化する。
学習された表現は、ドメイン固有のエンコーダを介して入力信号の時間領域と周波数領域のビューを組み合わせる。
クロスデータセットプロトコルを用いて,UCRとUEAの時系列アーカイブを大規模に評価する。
論文 参考訳(メタデータ) (2026-05-29T11:04:34Z) - TIE: Time Interval Encoding for Video Generation over Events [50.66585165263848]
ディレクタースタイルのプロンプト、ロボットアクション予測、インタラクティブなビデオエージェントは、同時イベントに対する時間的根拠を要求する。
現代のビデオジェネレータは、ポイントワイドな位置エンコーディングを通して、タイムを離散的なポイントとして表現する。
Time Interval TIEは、プラグイン・アンド・プレイ・インターバル・アウェアの一般化である。
論文 参考訳(メタデータ) (2026-05-11T13:23:14Z) - Time2General: Learning Spatiotemporal Invariant Representations for Domain-Generalization Video Semantic Segmentation [9.929390581043334]
ドメイン一般化ビデオセマンティック(DGVSS)は、単一のラベル付き駆動ドメインでトレーニングされる。
Time2Generalは、以前のDGVSSとVSSベースラインよりも、クロスドメインの精度と時間的安定性を大幅に改善する。
論文 参考訳(メタデータ) (2026-02-10T10:55:25Z) - E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching [87.38371267983263]
時間的ビデオグラウンディングは、クエリイベントに対応する時間セグメントを正確にローカライズすることを目的としている。
E.M.GroundはTVGのための新しいVid-LLMで、総合的で一貫性のあるイベント知覚に焦点を当てている。
E.M.Ground は最先端の Vid-LLM を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-05T02:16:00Z) - TimeRefine: Temporal Grounding with Time Refining Video LLM [75.99665302872901]
ビデオの時間的接地は、テキストのプロンプトが与えられたビデオの中で、関連する時間的境界をローカライズすることを目的としている。
我々は時間的接地タスクを時間的精錬タスクとして再構成する。
我々は、予測セグメントが基底真理からさらに逸脱した場合、モデルをよりペナルティ化する補助予測ヘッドを組み込む。
論文 参考訳(メタデータ) (2024-12-12T18:59:11Z) - Spatial Decomposition and Temporal Fusion based Inter Prediction for
Learned Video Compression [59.632286735304156]
学習ビデオ圧縮のための空間分解と時間融合に基づく相互予測を提案する。
SDDに基づく動きモデルと長時間の時間的融合により,提案した学習ビデオはより正確な相互予測コンテキストを得ることができる。
論文 参考訳(メタデータ) (2024-01-29T03:30:21Z) - Learning Sequence Descriptor based on Spatio-Temporal Attention for
Visual Place Recognition [16.380948630155476]
ビジュアルプレース認識(VPR)は、クエリフレームと同じ場所に位置するタグ付きデータベースからフレームを取得することを目的としている。
ジオリーエイリアスシナリオにおけるVPRのロバスト性を改善するために,シーケンスベースのVPR手法を提案する。
我々はスライディングウィンドウを用いて時間的注意範囲を制御し、相対的な位置エンコーディングを用いて異なる特徴間の逐次的関係を構築する。
論文 参考訳(メタデータ) (2023-05-19T06:39:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。