論文の概要: Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
- arxiv url: http://arxiv.org/abs/2607.09876v1
- Date: Fri, 10 Jul 2026 18:09:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.233471
- Title: Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
- Title(参考訳): Prompting-MammAlps:カメラ・トラックデータのための細粒度テキスト・ビデオ検索
- Authors: Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis,
- Abstract要約: 大規模ビデオ言語モデル(VLM)に基づくテキスト間検索(TVR)手法は、簡単なテキストクエリで記述することで、興味のあるイベントを検索する可能性がある。
本稿では,最初のカメラトラップTVベンチマークであるPrompting-MammAlpsを紹介し,細粒度で解釈可能なTVR法を提案する。
具体的には、視覚変換器を訓練し、時間的動作のローカライゼーションを行い、その出力を構造化されたテキストに変換し、各ビデオを記述する。
エスロジにインスパイアされたクエリは,LLM(Large-Language Model)ベースのエージェントによって処理される
- 参考スコア(独自算出の注目度): 49.717366362764956
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatically retrieving videos from large camera-trap datasets remains challenging. Text-to-Video retrieval (TVR) methods based on large video-language models (VLMs) have potential to retrieve events of interest by describing them with simple text queries. However, current methods often lack spatiotemporal understanding and do not generalize well to ecological data. In this work, we introduce Prompting-MammAlps, the first camera-trap TVR benchmark, and propose a fine-grained and interpretable TVR method. Specifically, we trained a vision transformer to perform spatiotemporal action localization, and convert its output to structured text, describing each video. Independently, ethology-inspired queries are processed by a Large-Language Model (LLM) based coding agent to parse the structured text per video and retrieve videos accordingly. We harnessed the LLM to use functions from a custom parsing library to minimize the risk of LLM hallucinations and to improve method interpretability. This retrieval approach applied on the Prompting-MammAlps benchmark achieved a set-based F1-score of 34\% on a test set of 135 ecologically-relevant queries and 775 candidate videos. In comparison the best zero-shot VLM achieved a F1-score of 18\%, while also lacking interpretability. Project page: https://cnai.epfl.ch/prompting-mammalps
- Abstract(参考訳): 大規模なカメラトラップデータセットから自動的にビデオを取得することは、依然として難しい。
大規模ビデオ言語モデル(VLM)に基づくテキスト間検索(TVR)手法は、簡単なテキストクエリで記述することで、興味のあるイベントを検索する可能性がある。
しかし、現在の手法は時空間的理解に欠けることが多く、生態学的なデータによく当てはまらない。
本稿では,最初のカメラトラップTVRベンチマークであるPrompting-MammAlpsを紹介し,細粒度で解釈可能なTVR法を提案する。
具体的には、視覚変換器を訓練し、時空間動作の局所化を行い、その出力を構造化されたテキストに変換し、各ビデオを記述する。
独立して、エスロジにインスパイアされたクエリは、Large-Language Model (LLM)ベースのコーディングエージェントによって処理され、ビデオ毎に構造化されたテキストを解析し、それに従ってビデオを取得する。
我々は LLM を利用して, LLM の幻覚のリスクを最小限に抑え, メソッドの解釈可能性を向上させるために, カスタム解析ライブラリの機能を利用する。
Prompting-MammAlpsベンチマークで適用したこの検索手法は、135の生態学的関連クエリと775の候補ビデオを用いて、F1スコアを34\%に設定した。
比較すると、最高のゼロショットVLMは18 %のF1スコアを達成したが、解釈性に欠けていた。
プロジェクトページ: https://cnai.epfl.ch/prompting-mammalps
関連論文リスト
- Prompts to Summaries: Zero-Shot Language-Guided Video Summarization [12.200609701777907]
Prompts-to-Summaries:最初のゼロショット・テキストクエリ可能なビデオ要約器を紹介する。
市販のビデオ言語モデル(VidLMs)のキャプションを、大きな言語モデル(LLMs)によるユーザガイドのスキムに変換する。
我々のパイプラインは、メモリ効率の高いバッチスタイルのVidLMプロンプトスキームにより、リッチなシーンレベルの記述を生成する。
SumMe と TVSum では、我々のデータフリーアプローチは、以前のデータハングリーな教師なし手法を全て上回っている。
論文 参考訳(メタデータ) (2025-06-12T15:23:11Z) - CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval [24.203328970223527]
本稿では,詳細な動画キャプションと検索のためのベンチマークであるCaReBenchを紹介する。
同様に、ビデオごとに手動で分離された空間アノテーションと時間アノテーションを提供する。
この設計に基づいて、ビデオ検索とビデオキャプションタスクに特化して、ReBiasとCapSTという2つの評価指標を導入する。
論文 参考訳(メタデータ) (2024-12-31T15:53:50Z) - Reversed in Time: A Novel Temporal-Emphasized Benchmark for Cross-Modal Video-Text Retrieval [49.44777976302792]
クロスモーダル検索(例えば、画像テキスト、ビデオテキスト)は、情報検索およびマルチモーダル視覚言語理解分野において重要なタスクである。
本稿では,新しい時間強調ビデオテキスト検索データセットRTimeを紹介する。
私たちのRTimeデータセットは、現在1ビデオにつき10キャプションの21Kビデオで構成されており、合計で約122時間です。
論文 参考訳(メタデータ) (2024-12-26T11:32:00Z) - HowToCaption: Prompting LLMs to Transform Video Annotations at Scale [72.69268311756082]
本稿では,大言語モデル(LLM)の能力を活用して,大規模ビデオに対応する高品質な映像記述を実現することを提案する。
本稿では,より長い字幕テキストを考慮に入れたプロンプト手法を提案する。
我々は、HowTo100Mデータセットの字幕にメソッドを適用し、新しい大規模データセット、HowToCaptionを作成します。
論文 参考訳(メタデータ) (2023-10-07T19:32:55Z) - Video Corpus Moment Retrieval with Contrastive Learning [56.249924768243375]
ビデオコーパスモーメント検索(VCMR)は、与えられたテキストクエリに意味的に対応する時間モーメントを取得することです。
VCMRのためのコントラシブラーニング(ReLoCLNet)を用いた検索・ローカリゼーションネットワークを提案する。
実験の結果、ReLoCLNetは効率のためにテキストとビデオを個別にエンコードし、その検索精度はクロスモーダル相互作用学習を採用するベースラインと匹敵する。
論文 参考訳(メタデータ) (2021-05-13T12:54:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。