Google Gemini reduce hasta 88% el uso de tokens al analizar videos

By: www.diariobitcoin.com|2026/09/02 15:09:29

**Google incorporó análisis de video basado en agentes a varios modelos Gemini Flash. La herramienta selecciona de forma autónoma las escenas, fotogramas, audio o transcripciones relevantes y, según la compañía, puede reducir el uso de tokens hasta 88% mientras mejora ligeramente la precisión en determinadas evaluaciones.


Los modelos Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite pueden analizar segmentos de menos de un segundo, incluidos cambios de estado y cortes que podrían perderse con un muestreo convencional de un fotograma por segundo. Esta capacidad resulta relevante para la edición automatizada, donde una transición breve o una modificación instantánea puede alterar el significado de una escena.

El sistema también puede localizar momentos específicos en horas de grabación sin consumir millones de tokens durante el proceso. Para ello, identifica ventanas de tiempo potencialmente relevantes y vuelve a muestrearlas a una velocidad de fotogramas más alta cuando detecta una anomalía o una señal que requiere mayor resolución temporal.

Además de encontrar escenas, Gemini puede contar movimientos repetidos y objetos individuales a lo largo del tiempo. La herramienta no se limita a observar imágenes, porque combina fotogramas, audio y transcripciones según la naturaleza de la tarea que el desarrollador le haya planteado.

Google sostiene que esta selección autónoma permite que el modelo concentre sus recursos en los momentos y señales que realmente importan. La consecuencia es un flujo de análisis menos rígido, en el que la inteligencia artificial decide qué examinar, a qué velocidad hacerlo y mediante cuál modalidad antes de entregar una respuesta.

Hasta ahora, Gemini utilizaba un procesamiento estático que, de manera predeterminada, muestreaba el video a un fotograma por segundo, aunque los desarrolladores podían ajustar esa configuración mediante la API. Desde el lanzamiento del análisis nativo de video en 2025, el sistema combinaba el estudio de los fotogramas con la transcripción de la pista de audio.

El enfoque basado en agentes conecta el razonamiento del modelo directamente con las herramientas nativas de video. De acuerdo con Google, Gemini puede iniciar un ciclo de búsqueda, recuperar una parte concreta del archivo, observar el resultado y decidir si necesita consultar otro segmento, aumentar la velocidad de muestreo o cambiar de modalidad.

Las ventajas de eficiencia son más visibles en materiales largos, que pueden ir desde tutoriales de 10 minutos hasta conferencias de 90 minutos y archivos de varias horas. Con el método estático, los desarrolladores debían escoger entre asumir un consumo elevado de tokens o utilizar técnicas selectivas propias que podían descartar detalles relevantes.

Google afirma que sus resultados en 1H-VideoQA y LVBench muestran una caída de 88% en el uso de tokens, acompañada por un aumento ligero de la precisión. En la evaluación 1H-VideoQA de la compañía, Gemini 3.7 Flash con análisis basado en agentes alcanza la mayor precisión con el menor costo por consulta, según los datos presentados por la empresa.

La compañía también incluyó LongVideoBench entre las pruebas utilizadas para comparar el desempeño de los modelos. En ese conjunto de evaluaciones, Google describe a Gemini 3.7 Flash como la alternativa con la mayor calidad general y la mejor combinación entre precisión y eficiencia de costos.

Estos resultados son afirmaciones de Google y reflejan sus propios benchmarks, por lo que no equivalen por sí solos a una validación independiente de todos los escenarios de uso. Aun así, el ahorro potencial puede ser relevante para aplicaciones que procesan grandes bibliotecas audiovisuales, especialmente cuando cada consulta requiere buscar un instante concreto y no describir el video completo.

El análisis agéntico ya está activo para videos subidos y videos de YouTube mediante la API de Gemini en Google AI Studio y en Gemini Enterprise Agent Platform. Los desarrolladores deben configurar el modo de procesamiento como "agentic" dentro de la API para activar el comportamiento selectivo.

Google planea extender la tecnología a sus propios productos en una fecha posterior. La empresa espera llevarla próximamente a todos los usuarios de la aplicación Gemini que utilicen dispositivos Flash y Flash Lite, mientras que en los próximos meses también prevé emplearla en la función Ask YouTube dentro de la página de reproducción.

Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.

Te puede gustar

iconiconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y CM:bd@weex.com
Programa VIP:support@weex.com