論文の概要: Search over the Visual World: Persistent Visual Memory, Layered Indexes, and Source-Grounded Evidence
- arxiv url: http://arxiv.org/abs/2608.08075v1
- Date: Sat, 08 Aug 2026 11:46:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.649928
- Title: Search over the Visual World: Persistent Visual Memory, Layered Indexes, and Source-Grounded Evidence
- Title(参考訳): ビジュアルワールド上の検索:永続的なビジュアルメモリ、階層化されたインデックス、およびソースを取り巻くエビデンス
- Authors: Sankalp Nagaonkar, Rohit Garg, Ankit Raj, Ashish Choithani, Ashutosh Trivedi,
- Abstract要約: ほとんどのビデオ検索システムは有界コーパスを仮定し、ランク付けされたファイルやタイムスタンプを返す。
このようなコーパスの検索は,ビデオファイルのランク付けに還元できないようなインフラストラクチャの問題である,と我々は主張する。
我々は,アナライザ定義シーン,永続的理解アーティファクト,視覚記憶を共存シーン空間として構築した視覚世界に関する概念的,形式的な探索モデルを開発する。
- 参考スコア(独自算出の注目度): 4.1830851982127415
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most video-retrieval systems assume a bounded corpus and return ranked files or timestamps. Agents operating over cameras, screens, streams, and archives face a different systems problem: observations arrive continuously; models interpret them at different temporal granularities; context must be selected without replaying the complete visual record; and results must stay connected to inspectable source evidence. We argue that search over such a corpus is an infrastructure problem that cannot be reduced to ranking video files. We develop a conceptual and formal model of search over the visual world built on analyzer-defined scenes, persistent understanding artifacts, visual memory as coexisting scene spaces over shared source time, and capability-declared indexes, distinguishing memory (everything retained), context (what is selected for a task), and evidence (the source intervals that ground it). The VideoDB data format (VDB) realizes this model in production, exposed through a typed search surface spanning planned retrieval, stateful investigation, direct access, and grounded synthesis. We contrast this model-agnostic infrastructure, where segmentation, sampling, model choice, embeddings, and ranking are system decisions and live streams are first-class sources, with video-native foundation models offered as fixed APIs. In a semantic-retrieval comparison against a commercial video-native engine spanning 9,800+ queries over four public datasets, a pipeline of general-purpose components achieves higher macro-averaged Recall@1/@3/@10 (73.09/83.39/91.20 versus 65.75/77.13/89.10), while the baseline is higher at Recall@50 (96.42 versus 96.07). Retrieval quality over the visual world is today governed more by system design than by video-specific pretraining, and visual-memory infrastructure can deliver it while keeping playable, source-grounded evidence first-class.
- Abstract(参考訳): ほとんどのビデオ検索システムは有界コーパスを仮定し、ランク付けされたファイルやタイムスタンプを返す。
カメラ、スクリーン、ストリーム、アーカイブを操作しているエージェントは異なるシステム問題に直面している: 観測が継続的に到着する; モデルは異なる時間的粒度でそれらを解釈する; 完全な視覚記録を再生せずにコンテキストを選択しなければならない; 結果は検査可能な情報源の証拠に関連付けられなければならない。
このようなコーパスの検索は,ビデオファイルのランク付けに還元できないようなインフラストラクチャの問題である,と我々は主張する。
本研究では, アナライザ定義シーン, 永続的理解アーティファクト, 共有ソース時間上で共存するシーン空間としての視覚記憶, 能力宣言インデックス, メモリの識別(すべての保持), コンテキストの選択(タスクの選択), エビデンス(ソース間隔)に基づいて, 視覚世界を探索する概念的, フォーマルなモデルを構築した。
VideoDBデータフォーマット(VDB)は、計画された検索、ステートフルな調査、直接アクセス、接地された合成にまたがる、タイプ付き検索サーフェスを通じて、本番環境でこのモデルを実現する。
セグメンテーション、サンプリング、モデル選択、埋め込み、ランキングがシステム決定であり、ライブストリームが第一級ソースであり、固定APIとしてビデオネイティブ基盤モデルが提供される、このモデルに依存しないインフラストラクチャとは対照的です。
4つのパブリックデータセットにまたがる9,800以上のクエリにまたがる商用ビデオネイティブエンジンに対するセマンティック検索比較では、汎用コンポーネントのパイプラインがマクロ平均のRecall@1/@3/@10(73.09/83.39/91.20対65.75/77.13/89.10)を達成する一方、ベースラインはRecall@50(96.42対96.07)である。
今日では、ビジュアルワールドの検索品質は、ビデオ固有の事前訓練よりもシステム設計によって支配されており、視覚記憶インフラは、再生可能で、ソースを基準とした証拠を第一級に保ちながら、それを実現することができる。
関連論文リスト
- VCG: A Multimodal Retrieval Framework for E-Commerce Video Feeds under Extreme Cold-Start Conditions [2.5997680822076688]
新しいショートフォームビデオは、協調フィルタリングに必要な密接な相互作用履歴を欠いている。
没入フィードは、標準的なエンゲージメントシグナルを歪ませる強い位置と持続バイアスをもたらす。
大規模なeコマース環境でこれらの課題を解決するために設計されたスケーラブルなマルチモーダル検索エンジンを実演する。
論文 参考訳(メタデータ) (2026-06-17T22:08:31Z) - VideoAtlas: Navigating Long-Form Video in Logarithmic Compute [3.705718227493618]
textbfVideoAtlasは、動画を階層的なグリッドとして表現するためのタスクに依存しない環境である。
階層構造により、アクセス深度はビデオ長と対数的にのみ増大する。
ビデオRLMは1時間から10時間に及ぶベンチマークのスケーリングにおいて、最小限の精度の劣化を伴う最も長い時間ロバストな方法である。
論文 参考訳(メタデータ) (2026-03-18T17:20:19Z) - Beyond Closed-Pool Video Retrieval: A Benchmark and Agent Framework for Real-World Video Search and Moment Localization [23.065896054579085]
実世界のビデオメモリ検索を総合的に評価するシステムである textbfRVMS-Bench について述べる。
textbf1,440のサンプルからなり、textbf20の多様なカテゴリとtextbffourの持続時間グループで構成されている。
我々は,人間のリコール-検索-検証の認知過程をシミュレートするために,帰納的推論を用いたエージェントフレームワークであるtextbfRACLOを提案する。
論文 参考訳(メタデータ) (2026-02-10T03:50:59Z) - ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search [29.542439490458126]
編集要件をオブジェクト指向のショット記述として形式化するベンチマークであるShotFinderを紹介する。
私たちは、20のテーマカテゴリーにわたるYouTubeから1210の高品質なサンプルを使用し、人間の検証による生成のために大きなモデルを使用します。
提案するShotFinderはテキスト駆動型3段階検索およびローカライゼーションパイプラインである。
論文 参考訳(メタデータ) (2026-01-30T18:01:17Z) - Video-BrowseComp: Benchmarking Agentic Video Research on Open Web [64.53060049124961]
Video-BrowseCompは、オープンウェブのエージェントによるビデオ推論に適した210の質問からなるベンチマークである。
これは時間的視覚的証拠に必須に依存しており、回答はテキスト検索のみでは導き出せないことを保証している。
初のオープンWebビデオ調査ベンチマークとして、Video-BrowseCompは、受動的知覚を越えて、プロアクティブなビデオ推論へと分野を前進させた。
論文 参考訳(メタデータ) (2025-12-28T19:08:27Z) - T*: Re-thinking Temporal Search for Long-Form Video Understanding [66.72243342954823]
現在の時間探索法は、Longvideobenchサブセットで2.1%の時間F1スコアしか達成していない。
画像中の視覚探索に触発されて,空間探索として高価な時間探索を再構成する軽量な時間探索フレームワークT*を提案する。
大規模な実験により、T*と既存の方法を統合することにより、SOTAの長めのビデオ理解が大幅に向上することが示された。
論文 参考訳(メタデータ) (2025-04-03T04:03:10Z) - Video Decomposition Prior: A Methodology to Decompose Videos into Layers [74.36790196133505]
本稿では,プロのビデオ編集の実践からインスピレーションを得た,VDP以前の新しいビデオ分解手法を提案する。
VDPフレームワークは、ビデオシーケンスを複数のRGBレイヤと関連する不透明度レベルに分解する。
ビデオオブジェクトのセグメンテーション、デハジング、リライティングといったタスクに対処する。
論文 参考訳(メタデータ) (2024-12-06T10:35:45Z) - Towards Debiasing Frame Length Bias in Text-Video Retrieval via Causal
Intervention [72.12974259966592]
トリミングビデオクリップのトレーニングセットとテストセットのフレーム長差による時間偏差について,一意かつ体系的に検討した。
Epic-Kitchens-100, YouCook2, MSR-VTTデータセットについて, 因果脱バイアス法を提案し, 広範な実験およびアブレーション研究を行った。
論文 参考訳(メタデータ) (2023-09-17T15:58:27Z) - Single-Stage Visual Query Localization in Egocentric Videos [79.71065005161566]
エンドツーエンドのトレーニングが可能なシングルステージのVQLフレームワークを提案する。
我々は,クエリとビデオフレーム間の問合せ対応を考慮し,問合せとビデオの関係を確立する。
実験により,提案手法の精度は従来のVQL手法よりも20%向上し,推論速度は10倍向上した。
論文 参考訳(メタデータ) (2023-06-15T17:57:28Z) - Correspondence Matters for Video Referring Expression Comprehension [64.60046797561455]
ビデオ参照表現(REC)は、文章に記述された参照オブジェクトをビデオフレーム内の視覚領域にローカライズすることを目的としている。
既存の手法では,1)ビデオフレーム間の非一貫性な局所化結果,2)参照オブジェクトとコンテキストオブジェクトの混同という2つの問題に悩まされている。
本稿では、フレーム間およびクロスモーダルの両方で密接な関連性を明確に強化する新しいデュアル対応ネットワーク(DCNet)を提案する。
論文 参考訳(メタデータ) (2022-07-21T10:31:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。