論文の概要: Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes
- arxiv url: http://arxiv.org/abs/2608.04426v1
- Date: Wed, 05 Aug 2026 04:12:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.708243
- Title: Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes
- Title(参考訳): 予測、そして検索:ビデオのプレフィックスから、クロスインスタンスの未来の検索
- Authors: Quynh Vo, Thong Nguyen, Vinh-Hien Do, Cong-Duy Nguyen, Anh-Tuan Luu,
- Abstract要約: 本稿では、モデルが短いビデオプレフィックスと、オブジェクトの将来の状態に関する時間的質問を観察するタスクである予測状態検索(PSR)を紹介する。
PSRは予測と、複数の時間的地平線を横断するクロスインスタンス検索を組み合わせる。
また,凍結エンコーダを用いた軽量レトリバーLFTRを提案する。
- 参考スコア(独自算出の注目度): 39.17422574355306
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: We introduce Predictive State Retrieval (PSR), a task in which a model observes a short video prefix and a temporal question about an object's future state, then retrieves instances from other videos or images that depict that state. Unlike action anticipation, which predicts a label, moment retrieval, which localizes an observed event within a video, or video generation, which synthesizes pixels, PSR combines anticipation with cross-instance retrieval across multiple temporal horizons. We construct a benchmark from four datasets with graded, human-validated ground truth, difficulty tiers, and an oracle ceiling. We also propose LFTR, a lightweight retriever with frozen encoders that predicts a question- and horizon-conditioned future latent and matches it in complementary semantic and visual spaces. A ceiling decomposition reveals a clear bottleneck: the true future state is highly retrievable once specified, whereas every predictor we evaluate, including a large multimodal language model with access to the prefix frames, remains far below the oracle. Thus, forecasting rather than perception is the central learnable challenge. LFTR narrows this gap at substantially lower inference cost, and ablations attribute its gains to cross-space fusion and hard-negative training rather than latent rollout. We release the benchmark, code, and evaluation scripts.
- Abstract(参考訳): 予測状態検索(Predictive State Retrieval:PSR)は、モデルがオブジェクトの将来の状態に関する短いビデオプレフィックスと時間的質問を観察し、その状態を表す他のビデオや画像からインスタンスを検索するタスクである。
ラベルを予測するアクション予測、ビデオ内の観測イベントをローカライズするモーメント検索、ピクセルを合成するビデオ生成とは異なり、PSRは予測と複数の時間的地平線をまたいだクロスインスタンス検索を組み合わせる。
そこで我々は, 4つのデータセットから, 評価済み, 検証済みの地上真実, 難易度層, オラクル天井のベンチマークを構築した。
また,凍結エンコーダを用いた軽量レトリバーLFTRを提案する。
一方,プレフィックスフレームへのアクセスが可能な大規模マルチモーダル言語モデルを含む,評価対象となるすべての予測子は,オラクルよりはるかに低いままである。
したがって、知覚よりも予測が中心的な学習可能な課題である。
LFTRは、このギャップをかなり低い推論コストで狭くし、アブレーションは、ラテントロールアウトではなく、宇宙間融合とハード負のトレーニングによって、その利点を享受している。
ベンチマーク、コード、評価スクリプトをリリースします。
関連論文リスト
- Towards Generative Predictive Display for Vision-Based Teleoperation: A Zero-Shot Benchmark of Off-the-Shelf Video Models [0.0]
本稿では,ショートホライズン予測表示のためのオフ・ザ・シェルフ生成ビデオモデルのベンチマークを示す。
性能は、予測精度、ロールアウト毎のレイテンシ、ピークGPUメモリ使用量、時間的エラー進化を用いて評価される。
発見は、汎用な生成ビデオ合成と遠隔操作における予測表示の要件とのギャップを浮き彫りにする。
論文 参考訳(メタデータ) (2026-05-10T17:36:22Z) - Rethinking Video Human-Object Interaction: Set Prediction over Time for Unified Detection and Anticipation [18.693454975393703]
ビデオベースヒューマンオブジェクトインタラクション(HOI)の理解には、進行中のインタラクションを検出し、将来の進化を予測する必要がある。
対象対象の局所化,現在のHOI検出,将来の予測を共同で行う,ペア中心のフレームワークであるDETAnt-HOIとHOI-DAを紹介する。
実験では、検出と予測の両方において一貫した改善が見られ、より長い地平線でより大きな利得が得られた。
論文 参考訳(メタデータ) (2026-04-12T01:07:43Z) - EPRBench: A High-Quality Benchmark Dataset for Event Stream Based Visual Place Recognition [54.55914886780534]
イベントストリームに基づく視覚的位置認識(VPR)は、従来の可視光カメラの不安定性に対して、低照度、過剰露光、高速モーションといった困難な条件下で魅力的な解決策を提供する、新たな研究方向である。
イベントストリームベースのVPR用に特別に設計された高品質なベンチマークであるEPRBenchを紹介する。
EPRBenchは10Kのイベントシーケンスと65Kのイベントフレームで構成され、ハンドヘルドと車載のセットアップを使用して収集され、さまざまな視点、気象条件、照明シナリオで現実世界の課題を包括的にキャプチャする。
論文 参考訳(メタデータ) (2026-02-13T13:25:05Z) - Towards Fine-Grained Video Question Answering [17.582244704442747]
本稿では,MOMA-QAデータセットについて述べる。
地上の真実のシーングラフと時間間隔アノテーションにより、MOMA-QAはきめ細かいビデオ理解のためのモデルを開発するのに最適である。
本稿では、シーングラフ予測器、効率的なフレーム検索器、時間的局所化と微粒化の関係理解のための事前学習された大規模言語モデルを含む、新しいビデオ言語モデルSGVLMを提案する。
論文 参考訳(メタデータ) (2025-03-10T01:02:01Z) - TimeRefine: Temporal Grounding with Time Refining Video LLM [75.99665302872901]
ビデオの時間的接地は、テキストのプロンプトが与えられたビデオの中で、関連する時間的境界をローカライズすることを目的としている。
我々は時間的接地タスクを時間的精錬タスクとして再構成する。
我々は、予測セグメントが基底真理からさらに逸脱した場合、モデルをよりペナルティ化する補助予測ヘッドを組み込む。
論文 参考訳(メタデータ) (2024-12-12T18:59:11Z) - Object-Centric Temporal Consistency via Conditional Autoregressive Inductive Biases [69.46487306858789]
Conditional Autoregressive Slot Attention (CA-SA) は、ビデオ中心の視覚タスクにおいて抽出されたオブジェクト中心の表現の時間的一貫性を高めるフレームワークである。
本稿では,提案手法が下流タスクのベースラインよりも優れていることを示す定性的,定量的な結果を示す。
論文 参考訳(メタデータ) (2024-10-21T07:44:44Z) - Predicting Long-horizon Futures by Conditioning on Geometry and Time [49.86180975196375]
我々は,過去を前提とした将来のセンサ観測の課題を探求する。
マルチモーダリティを扱える画像拡散モデルの大規模事前学習を活用する。
我々は、屋内と屋外のシーンにまたがる多様なビデオのセットについて、ビデオ予測のためのベンチマークを作成する。
論文 参考訳(メタデータ) (2024-04-17T16:56:31Z) - Video Prediction at Multiple Scales with Hierarchical Recurrent Networks [24.536256844130996]
本稿では,異なるレベルの粒度の将来の結果を同時に予測できる新しい映像予測モデルを提案する。
空間的および時間的ダウンサンプリングを組み合わせることで、MSPredは長い時間的地平線上での抽象表現を効率的に予測することができる。
実験では,提案モデルが将来の映像フレームだけでなく,様々なシナリオにおける他の表現を正確に予測できることを実証した。
論文 参考訳(メタデータ) (2022-03-17T13:08:28Z) - A Closer Look at Debiased Temporal Sentence Grounding in Videos:
Dataset, Metric, and Approach [53.727460222955266]
テンポラル・センテンス・グラウンディング・イン・ビデオ(TSGV)は、未編集のビデオに自然言語文を埋め込むことを目的としている。
最近の研究では、現在のベンチマークデータセットには明らかなモーメントアノテーションバイアスがあることが判明している。
偏りのあるデータセットによる膨らませ評価を緩和するため、基礎的リコールスコアを割引する新しい評価基準「dR@n,IoU@m」を導入する。
論文 参考訳(メタデータ) (2022-03-10T08:58:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。