Saltar al contenido

Blog

por Larry

Video2Any ahora aparta la cámara del ponente

Una charla grabada casi nunca es solo diapositivas. La cámara del ponente ocupa la pantalla mientras responde una pregunta, la emisión pasa al público, entre dos partes queda un fotograma en negro. Video2Any guarda una imagen cada vez que la pantalla cambia y luego se queda quieta, así que un ponente que se quedaba quieto diez segundos acababa convertido en diapositiva. En una charla de una hora de FOSDEM que publicamos como ejemplo, 73 de los 141 fotogramas eran la cámara del ponente.

Desde el 5 de octubre, Video2Any revisa cada fotograma cuando termina la extracción y aparta los que no parecen diapositivas. Lo hace en tu dispositivo, sin que tengas que hacer nada, y no borra nada.

Prueba la revisión con ocho fotogramas de charlas reales

Cuatro son diapositivas y cuatro no. El botón ejecuta en esta pestaña la misma revisión que hace el editor; la primera vez tiene que cargarla antes.

Fotogramas de grabaciones de FOSDEM 2021, licencia CC BY 2.0 BE.

Mira la charla de FOSDEM de una hora, ya sin los fotogramas de cámara

En esta página

Qué vas a ver

Cuando termina la extracción, las diapositivas aparecen como siempre. Poco después, si algún fotograma parecía la cámara, el público o una pantalla en negro, sale de la cuadrícula y encima aparece una línea que dice cuántos apartamos. Si pulsas Recuperarlas, vuelven todos; deshacer también funciona.

Los fotogramas apartados no cuentan, no se exportan y no se comparten, pero se guardan con el resultado, así que siguen ahí si recargas la página. Video2Any nunca toca los fotogramas que capturas a mano. Y si en un video nada parece una diapositiva —alguien hablando a cámara durante una hora, una clase en pizarra—, Video2Any lo deja todo como está en vez de darte un resultado vacío.

El modo por lotes hace lo mismo, clase tras clase, sin que el siguiente video tenga que esperar: el número de diapositivas de cada fila baja solo poco después de que esa clase termine.

Cuántas veces se equivoca

Medimos la revisión con charlas que no había visto al entrenarse: repartimos las charlas en cinco grupos, entrenamos con cuatro y probamos con el quinto, cinco veces. De 3.052 diapositivas reales, apartó 6 por error: más o menos una de cada quinientas. De 620 fotogramas de cámara, público o pantalla en negro, detectó el 94 %.

Se equivoca con las diapositivas muy escuetas: una sola palabra sobre un color liso, una foto a página completa, una diapositiva en la que el video del ponente ocupa media pantalla. Se le escapan los planos generales de una sala llena, la foto de perfil del ponente sobre fondo blanco, un escenario visto desde el fondo de la sala. A veces también aparta un proyector grabado desde el público, más o menos una vez de cada once. Por eso aparta en lugar de borrar: si se equivoca, te cuesta un clic.

Cómo lo hicimos

La revisión la hace un modelo de imagen pequeño y de código abierto que funciona dentro de tu navegador. Solo ve los fotogramas que ya están en tu pantalla, y esos fotogramas nunca salen de tu ordenador.

Lo entrenamos con unos 4.100 fotogramas que etiquetamos a mano: 1.313 de 115 charlas de FOSDEM de cuatro años, publicadas con una licencia que lo permite; los 2.092 fotogramas de nuestras propias presentaciones de ejemplo, y 720 de otras 29 grabaciones de reuniones, clases y videos cortos. Ni un solo fotograma de lo que sube la gente: nunca lo vemos. El modelo que publicamos aprendió de todos estos fotogramas, nuestras presentaciones de ejemplo incluidas, así que la charla de ejemplo de una hora ya la había visto, y los fotogramas de la prueba de abajo vienen de las grabaciones de FOSDEM 2021 con las que aprendió, así que puede que también los haya visto. Los porcentajes de error salen de las pruebas con charlas apartadas, no de estos.

Probamos opciones más pequeñas y más grandes. Un modelo seis veces más pequeño detectó el 80 % de los fotogramas de cámara con el mismo nivel de exigencia; el que publicamos llega al 94 %. Un modelo capaz de leer la diapositiva y transcribir su texto acertó casi palabra por palabra en chino y en inglés, pero pesa más de 2 GB y tarda unos diez segundos por fotograma en un ordenador normal: sirve en un servidor, no en una pestaña del navegador.

Lo que le pide a tu ordenador

La primera vez, tu navegador carga la revisión mientras lee tu video. Leer el video no usa la red, así que casi siempre la revisión está lista antes que las diapositivas, y después tu navegador la guarda. Mientras trabaja ocupa algo más de memoria durante un minuto más o menos, y luego la libera.

En móviles, tabletas, ordenadores con menos de 4 GB de memoria y conexiones en modo de ahorro de datos no se ejecuta, y el resultado sale exactamente igual que antes.

Lo que sí registramos son dos números, sin ninguna imagen: cuántos fotogramas apartó y cuántos recuperaste. El segundo nos dirá si la línea está en el sitio adecuado para grabaciones como las tuyas.

Preguntas frecuentes

¿Esto sube mi video o mis diapositivas?
No. El modelo viene a tu navegador; tu video y tus fotogramas no van a ningún sitio. Lo que sí recibimos son dos números: cuántos fotogramas se apartaron y cuántos se recuperaron.
¿Puedo desactivarlo?
No hay interruptor, porque no se pierde nada: Recuperarlas devuelve todos los fotogramas apartados con un clic, y deshacer funciona igual. En móviles y ordenadores con poca memoria ni siquiera se ejecuta.
¿Por qué apartó una diapositiva real?
Normalmente porque la diapositiva parece una foto o un color liso: un título de una sola palabra, una imagen a pantalla completa. Si la recuperas, se queda, incluso al recargar.
¿Funciona en el modo por lotes?
Sí. Cada clase se revisa en segundo plano después de guardarse, así que el siguiente video empieza enseguida, y el número de diapositivas de la fila se actualiza solo.

Pruébalo con una grabación tuya

Arrastra a Video2Any una charla o una reunión grabada. Las diapositivas salen como siempre, y lo que sea la cámara del ponente se aparta, con una línea que te dice cuántos fotogramas son.