arxivcs.CVcs.AIq-bio.NCq-bio.QM2026-07-10
Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data
Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, et al.
Automatically retrieving videos from large camera-trap datasets remains challenging. Text-to-Video retrieval (TVR) methods based on large video-language models (VLMs) have potential to retrieve events of interest by describing them with simple text queries. However, current metho…