Gemini lleva los agentes de IA al análisis de vídeos y mejora sustancialmente sus resultados

Google comprension agentica de videos gemini

No es secreto que la inteligencia artificial nos ha facilitado la vida en un montón de situaciones, pero tampoco lo es el hecho de que todavía hay cosas que le cuestan. Un buen ejemplo es el análisis de vídeos para buscar cosas en ellos; las diferentes plataformas de IA pueden hacerlo, pero gastan muchísimos recursos en ello.

Google sabía de este problema, así que comenzó a trabajar en optimizar su IA para resolverlo y lo lograron. ¿Cómo? Con la comprensión de vídeos basada en agentes, que hace que Gemini ahora entienda y analice vídeos mejor que nunca.

Consumo de tokens hasta un 88% menor, mayor precisión y menor carga de trabajo: así es la comprensión de vídeos basada en agentes de Gemini

como funciona el analisis de videos con agente de inteligencia artificial en gemini

Google presentó la comprensión de vídeos basada en agentes, una nueva forma para que Gemini sea capaz de analizar y buscar contenido en vídeos que tú le pidas inspeccionar, que es más rápida, precisa y eficiente.

Hasta ahora se utilizaba el procesamiento estático, con el que se analizaba cada video a una tasa de fotogramas por segundo fija. Generalmente, esa tasa era de 1 FPS, lo que significaba que Gemini analizaba cada fotograma del video de manera independiente. Sí, se podía cambiar para que el análisis se hiciese a mayor velocidad e inspeccionase varios cuadros en simultáneo, pero esto aumentaba considerablemente el consumo de tokens.

Recomendado:  Chrome revoluciona la experiencia móvil con su nuevo autocompletado avanzado

El procesamiento agéntico de vídeos es diferente, pues Gemini ahora puede analizar fotogramas, audio y transcripciones para encontrar señales y patrones que le acerquen a la tarea que le pediste.

Los agentes también ayudan a definir qué ver y con qué tanta velocidad/precisión examinar algo en un vídeo. Una vez encuentra coincidencias, estudia solamente esos momentos para dar respuesta a tu consulta, desechando el resto que no le sirve.

Esto ya podía hacerse, pero era el usuario quien tenía que especificar gran parte de los patrones de búsqueda a seguir. Aparte, si las indicaciones no eran cuasiperfectas, Gemini podía desechar fragmentos importantes y perder mucha precisión.

mejoras comprension agentica videos gemini

El agente lo hace todo por sí solo mediante bucles automatizados en los que, además, se siguen dos metodologías para aumentar la precisión:

  • La detección de anomalías mediante el remuestreo de partes del vídeo a mayor velocidad (más FPS) para identificar mejor movimientos rápidos y artefactos.
  • El conteo de acciones y objetos para registrar movimientos repetitivos e identificar objetos recurrentes a lo largo del vídeo y determinar si son o no relevantes.

rendimiento comprension agentica videos gemini versus otros lenguajes ia

Según Google, el análisis y comprensión de vídeos mediante agentes ha hecho que Gemini mejore en todos estos niveles:

  • Análisis hasta un 66% menos costosos.
  • Hasta un 88% de ahorro en el consumo de tokens por consulta.
  • Precisión mejorada hasta en un 7%.
Recomendado:  Modo infantil de Grok: cómo activarlo para usar la app con más control

Los desarrolladores apuntan que estas mejoras son especialmente relevantes al analizar vídeos de larga duración. Además, el procesamiento agéntico de vídeos posicionaría a Gemini todavía más arriba en la gráfica que compara la precisión y costo de análisis de distintos tipos de modelos de IA, como muestra la imagen que dejamos más arriba.

Disponibilidad de la comprensión agéntica de vídeos en Gemini

La comprensión agéntica de vídeos ya está disponible a través de la API de Gemini para cargar vídeos a YouTube desde Google AI Studio. También está disponible en la plataforma Gemini Enterprise Agent y es compatible con los siguientes modelos de lenguaje:

  • Gemini 3.7 Flash.
  • Gemini 3.6 Flash.
  • Gemini 3.5 Flash y Flash-Lite.

¿Qué quiere decir esto? Que el análisis de vídeos mediante agentes todavía no está disponible para usuarios regulares de la plataforma, solo para los que tengan suscripciones a Google AI Studio y Gemini Enterprise Agent.

Sin embargo, Google espera implementar esta funcionalidad en la aplicación de Gemini para todos los usuarios en los próximos meses. Asimismo, quieren agregarla a la sección «Pregúntale a YouTube» en la página de reproducción de los vídeos de esta plataforma.