論文の概要: Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
- arxiv url: http://arxiv.org/abs/2607.09876v1
- Date: Fri, 10 Jul 2026 18:09:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.233471
- Title: Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
- Title(参考訳): Prompting-MammAlps:カメラ・トラックデータのための細粒度テキスト・ビデオ検索
- Abstract要約: 大規模ビデオ言語モデル(VLM)に基づくテキスト間検索(TVR)手法は、簡単なテキストクエリで記述することで、興味のあるイベントを検索する可能性がある。
本稿では,最初のカメラトラップTVベンチマークであるPrompting-MammAlpsを紹介し,細粒度で解釈可能なTVR法を提案する。
具体的には、視覚変換器を訓練し、時間的動作のローカライゼーションを行い、その出力を構造化されたテキストに変換し、各ビデオを記述する。
エスロジにインスパイアされたクエリは,LLM(Large-Language Model)ベースのエージェントによって処理される
- 参考スコア(独自算出の注目度): 49.717366362764956
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatically retrieving videos from large camera-trap datasets remains challenging. Text-to-Video retrieval (TVR) methods based on large video-language models (VLMs) have potential to retrieve events of interest by describing them with simple text queries. However, current methods often lack spatiotemporal understanding and do not generalize well to ecological data. In this work, we introduce Prompting-MammAlps, the first camera-trap TVR benchmark, and propose a fine-grained and interpretable TVR method. Specifically, we trained a vision transformer to perform spatiotemporal action localization, and convert its output to structured text, describing each video. Independently, ethology-inspired queries are processed by a Large-Language Model (LLM) based coding agent to parse the structured text per video and retrieve videos accordingly. We harnessed the LLM to use functions from a custom parsing library to minimize the risk of LLM hallucinations and to improve method interpretability. This retrieval approach applied on the Prompting-MammAlps benchmark achieved a set-based F1-score of 34\% on a test set of 135 ecologically-relevant queries and 775 candidate videos. In comparison the best zero-shot VLM achieved a F1-score of 18\%, while also lacking interpretability. Project page: https://cnai.epfl.ch/prompting-mammalps
- Abstract(参考訳): 大規模なカメラトラップデータセットから自動的にビデオを取得することは、依然として難しい。
大規模ビデオ言語モデル(VLM)に基づくテキスト間検索(TVR)手法は、簡単なテキストクエリで記述することで、興味のあるイベントを検索する可能性がある。
しかし、現在の手法は時空間的理解に欠けることが多く、生態学的なデータによく当てはまらない。
本稿では,最初のカメラトラップTVRベンチマークであるPrompting-MammAlpsを紹介し,細粒度で解釈可能なTVR法を提案する。
具体的には、視覚変換器を訓練し、時空間動作の局所化を行い、その出力を構造化されたテキストに変換し、各ビデオを記述する。
独立して、エスロジにインスパイアされたクエリは、Large-Language Model (LLM)ベースのコーディングエージェントによって処理され、ビデオ毎に構造化されたテキストを解析し、それに従ってビデオを取得する。
我々は LLM を利用して, LLM の幻覚のリスクを最小限に抑え, メソッドの解釈可能性を向上させるために, カスタム解析ライブラリの機能を利用する。
Prompting-MammAlpsベンチマークで適用したこの検索手法は、135の生態学的関連クエリと775の候補ビデオを用いて、F1スコアを34\%に設定した。
比較すると、最高のゼロショットVLMは18 %のF1スコアを達成したが、解釈性に欠けていた。
プロジェクトページ: https://cnai.epfl.ch/prompting-mammalps
関連論文リスト
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement [31.30208652334818]
VideoSearch-R1は、ビデオ検索エンジンとのマルチターンインタラクションによる反復的なビデオ検索と推論のためのエージェントフレームワークである。
VideoSearch-R1は、VCMR(Video Moment Retrieval)上の3つのデータセットにわたる最先端のパフォーマンスを実現する
論文 参考訳(メタデータ) (2026-07-01T04:59:24Z) - Prompts to Summaries: Zero-Shot Language-Guided Video Summarization [12.200609701777907]
Prompts-to-Summaries:最初のゼロショット・テキストクエリ可能なビデオ要約器を紹介する。
市販のビデオ言語モデル(VidLMs)のキャプションを、大きな言語モデル(LLMs)によるユーザガイドのスキムに変換する。
我々のパイプラインは、メモリ効率の高いバッチスタイルのVidLMプロンプトスキームにより、リッチなシーンレベルの記述を生成する。
SumMe と TVSum では、我々のデータフリーアプローチは、以前のデータハングリーな教師なし手法を全て上回っている。
論文 参考訳(メタデータ) (2025-06-12T15:23:11Z) - CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval [24.203328970223527]
本稿では,詳細な動画キャプションと検索のためのベンチマークであるCaReBenchを紹介する。
同様に、ビデオごとに手動で分離された空間アノテーションと時間アノテーションを提供する。
この設計に基づいて、ビデオ検索とビデオキャプションタスクに特化して、ReBiasとCapSTという2つの評価指標を導入する。
論文 参考訳(メタデータ) (2024-12-31T15:53:50Z) - Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text Retrieval [49.44777976302792]
クロスモーダル検索(例えば、画像テキスト、ビデオテキスト)は、情報検索およびマルチモーダル視覚言語理解分野において重要なタスクである。
本稿では,新しい時間強調ビデオテキスト検索データセットRTimeを紹介する。
私たちのRTimeデータセットは、現在1ビデオにつき10キャプションの21Kビデオで構成されており、合計で約122時間です。
論文 参考訳(メタデータ) (2024-12-26T11:32:00Z) - VaQuitA: Enhancing Alignment in LLM-Assisted Video Understanding [63.075626670943116]
本稿では,映像情報とテキスト情報の相乗効果を向上するための最先端フレームワークであるVaQuitAを紹介する。
データレベルでは、フレームを均一にサンプリングする代わりに、CLIPスコアランキングでガイドされるサンプリング手法を実装している。
機能レベルでは、Visual-Query Transformerと一緒にトレーニング可能なVideo Perceiverを統合します。
論文 参考訳(メタデータ) (2023-12-04T19:48:02Z) - HowToCaption: Prompting LLMs to Transform Video Annotations at Scale [72.69268311756082]
本稿では,大言語モデル(LLM)の能力を活用して,大規模ビデオに対応する高品質な映像記述を実現することを提案する。
本稿では,より長い字幕テキストを考慮に入れたプロンプト手法を提案する。
我々は、HowTo100Mデータセットの字幕にメソッドを適用し、新しい大規模データセット、HowToCaptionを作成します。
論文 参考訳(メタデータ) (2023-10-07T19:32:55Z) - Zero-shot Audio Topic Reranking using Large Language Models [42.774019015099704]
実例によるマルチモーダルビデオ検索 (MVSE) では, ビデオクリップを情報検索の問合せ語として利用する。
本研究の目的は,この高速アーカイブ検索による性能損失を,再ランク付け手法を検証することによって補償することである。
パブリックなビデオアーカイブであるBBC Rewind corpusでトピックベースの検索のパフォーマンスを評価する。
論文 参考訳(メタデータ) (2023-09-14T11:13:36Z) - Contrastive Video-Language Learning with Fine-grained Frame Sampling [54.542962813921214]
FineCoは、ビデオフレーム上で操作する微妙なコントラスト対象で、ビデオと言語表現をよりよく学習するアプローチである。
テキストと意味的に等価なフレームを選択することで、ビデオの削除を支援し、クロスモーダル対応を改善する。
論文 参考訳(メタデータ) (2022-10-10T22:48:08Z) - Video Corpus Moment Retrieval with Contrastive Learning [56.249924768243375]
ビデオコーパスモーメント検索(VCMR)は、与えられたテキストクエリに意味的に対応する時間モーメントを取得することです。
VCMRのためのコントラシブラーニング(ReLoCLNet)を用いた検索・ローカリゼーションネットワークを提案する。
実験の結果、ReLoCLNetは効率のためにテキストとビデオを個別にエンコードし、その検索精度はクロスモーダル相互作用学習を採用するベースラインと匹敵する。
論文 参考訳(メタデータ) (2021-05-13T12:54:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。