MOUNTAIN VIEW, 26 de julio de 2026. Google DeepMind presentó OmniFlash, el primer modelo de la familia Omni con arquitectura any-to-any: acepta y produce distintas modalidades en un mismo hilo de trabajo. La compañía lo describe como un sistema que genera videos de hasta 10 segundos y permite editarlos en varios turnos de conversación a través de la Interactions API, con instrucciones del tipo "hacelo de día" que rehacen luz, cielo y sombras.

El anuncio se encuadra en la línea de modelos multimodales que salieron en la primera mitad de 2026. A diferencia de un generador de video de un solo disparo, OmniFlash se presenta como un editor conversacional: el usuario mantiene el contexto y pide cambios sucesivos sin reiniciar la escena desde cero. DeepMind no publicó en el material de lanzamiento el tamaño del modelo ni el costo por segundo de video generado.

Un video de 10 segundos no es cine: es una unidad de prueba de si el modelo retiene la escena entre turnos.

La familia Omni, según el laboratorio, apunta a unificar entradas y salidas de texto, imagen y video bajo una misma interfaz de agente. OmniFlash es el primer eslabón anunciado. Queda por medir, en tableros externos y en uso real, cuánto de la edición multi-turno se sostiene sin degradar identidad de objetos, coherencia temporal y fidelidad a la instrucción, y si el producto llega con precios y límites de cuota públicos o solo en acceso restringido.