El video con IA ya se itera en 360p y se renderiza en 4K: la economía draft-first de Omni 1.1 Flash
Google lanzó Gemini Omni 1.1 Flash el 27 de agosto de 2026: escenas de 10 segundos que se extienden a 40 con continuidad, control de primer y último fotograma y borradores baratos en 360p antes del render 4K. Aquí está la matemática del flujo draft-first que usamos en Virtalio y por qué cambia la economía de producir video con IA para marcas.
El 27 de agosto de 2026 Google lanzó Gemini Omni 1.1 Flash, y lo más importante del anuncio no es que el video llegue a 40 segundos ni que haya 4K: es que el costo de iterar video con IA se partió en dos. Ahora existe una resolución de borrador —360p, barata— y una resolución de entrega —4K, la cara—. Ese desdoblamiento convierte el flujo de producción correcto en un problema de aritmética, y la aritmética favorece a los equipos que iteran barato y renderizan caro una sola vez.
En Mintec producimos video con IA todos los días para Virtalio y para clientes de la agencia. La pregunta que cambió esta semana no es "¿el video con IA ya se ve bien?" —esa quedó respondida hace meses— sino "¿cuántas iteraciones puedes pagar antes del render final?". Y la respuesta se multiplicó.
Qué cambió de verdad en Omni 1.1 Flash
El anuncio oficial de Google resume la versión 1.1 Flash en control y economía, no en un salto mágico de fotorrealismo. Los cinco cambios verificables:
- Escenas de 10 segundos que se extienden a 40. El modelo genera clips de hasta 10 segundos y los extiende en intervalos de 10 segundos, conservando el aspecto, el movimiento y el storytelling del clip original. El resultado máximo es una pieza de 40 segundos con flujo narrativo coherente.
- Control de primer y último fotograma. Puedes fijar cómo empieza y cómo termina una escena. Esto es lo que convierte la generación en dirección: el modelo ya no decide solo el encuadre inicial ni el final.
- Referencias de video. No solo imágenes de referencia: clips como ancla de estilo, luz y movimiento.
- 4K por upscaling. El detalle que casi todos los titulares omiten: la salida 4K es escalada, no generación nativa —la cobertura especializada lo verifica contra la documentación del modelo. Importa para producción, lo veremos abajo.
- Borradores 360p baratos. Google lo dice directo: renderiza borradores rápidos y baratos en 360p antes de comprometer el render de alta resolución.
Ese quinto punto es el terremoto silencioso del anuncio, y casi nadie lo puso de titular.
La curva de costos se partió en dos
Hasta esta semana, el video con IA se producía en un solo modo: un prompt, un render, revisas el resultado, y si no sirve pagas el siguiente render al mismo precio. El costo de equivocarte era constante y alto. Iterar era caro, así que los equipos iteraban poco, aceptaban resultados mediocres o regresaban a producción tradicional.
Con dos niveles de resolución, la matemática se invierte:
| Flujo | Iteraciones por escena | Costo por iteración | Cómo se corrige un error | Costo de descartar una versión |
|---|---|---|---|---|
| One-shot (render final directo) | 1–2 | Alto, resolución de entrega | Se re-promptea y se paga el render completo otra vez | El 100% del render |
| Draft-first (360p → 4K) | 10–20 en borrador, 1 final | Fracción mínima en 360p | Se amenda el bloque, se aprueba, se escala | Centavos, no dólares |
La regla que aplicamos en Mintec: la calidad del resultado final correlaciona con el número de iteraciones que pagaste, no con la resolución del primer intento. Veinte borradores en 360p cuestan menos que dos renders 4K descartados, y el vigésimo borrador es casi siempre mejor que el primer render directo. El 4K no mejora una escena mal dirigida; solo la hace más nítida.
Cómo producimos en Virtalio: el flujo que 1.1 Flash acelera
En Virtalio ya trabajábamos con Gemini Omni con un principio: intención primero, segmentos explícitos de 10 segundos, imagen de referencia como ancla y enmiendas iterativas. La versión 1.1 Flash no nos obliga a cambiar el método —nos abarata cada paso del mismo método.
Nuestro flujo para un anuncio de 30–40 segundos:
- Ancla visual. Una imagen de referencia fija la identidad del personaje, la paleta y el estilo antes de escribir un solo prompt de movimiento. Sin ancla, cada generación es una lotería nueva; con ancla, cada iteración es una versión de la misma pieza.
- Bloques de 10 segundos. No prompteamos "un anuncio de 40 segundos". Escribimos cuatro bloques narrativos de 10 segundos —gancho, argumento, demostración, cierre— y los extendemos en secuencia. La extensión con continuidad de 1.1 Flash es exactamente esta mecánica, ahora con contexto explícito entre bloques.
- Iteración en borrador. La escena se amenda en 360p hasta que la dirección, el encuadre y el ritmo son correctos. Texto en pantalla, cámara fija, movimientos naturales: cada corrección cuesta una fracción de lo que costaba.
- Render final único. El 4K —o la resolución de entrega real— se paga una sola vez, sobre la versión ya aprobada.
Este flujo es la diferencia entre producir video con IA y operar una máquina tragamonedas. Y es la razón por la que 1.1 Flash importa más para agencias y marcas que para usuarios casuales: los casuales generan una vez; los equipos iteran hasta aprobar.
Extender a 40 segundos: planificar en bloques, no en prompts gigantes
El salto de 10 a 40 segundos no significa "escribe un prompt más largo". El modelo extiende en intervalos de 10 segundos con hasta 10 segundos de contexto previo como memoria de continuidad. Eso convierte la pieza larga en un problema de guion, no de prompt.
El método que nos funciona: cada bloque de 10 segundos debe poder sostenerse como micro-escena —un sujeto, una acción, un cambio de encuadre opcional— porque el modelo conserva estilo y movimiento entre bloques, pero tú sigues dirigiendo el contenido bloque a bloque. Si el bloque 2 falla, no descartas los 40 segundos: re-generas el bloque 2 y pides la extensión de nuevo.
Esto se conecta con algo que ya escribimos: un brief de ventas no es un brief de video — la pieza larga necesita una estructura documentada antes de tocar la herramienta. El bloque de 10 segundos es la unidad atómica de esa estructura.
Lo que el anuncio no dice
Tres matices que no vimos en los titulares y que deberían moderar el entusiasmo de producción:
- El 4K es upscaling, no generación nativa. Para anuncios y social, irrelevante: el material se consume en 1080p o menos. Para pantallas grandes o post-producción exigente, hay que probar contra el brief. La regla que aplicamos: si el formato de entrega es social, la capa de upscale es suficiente; si es broadcast, se valida frame a frame.
- La ventana de continuidad es finita. El contexto de extensión cubre hasta 10 segundos previos. En piezas de 40 segundos, los bloques tardíos dependen de que los primeros estén bien dirigidos —otro argumento para el ancla visual y el guion por bloques.
- El draft-first no elimina la selección de modelo. Sigue habiendo modelos para una toma, modelos para control fino y modelos con claim dudoso. Antes de comprometer arquitectura de pipeline, aplicamos el protocolo de verificación que publicamos con el caso Wan 3.0 — y el plan de salida que ya cubrimos cuando Sora apagó su API sigue siendo obligatorio con cualquier proveedor.
Cuándo draft-first y cuándo one-shot
La economía nueva no elimina el modo anterior; lo re-clasifica:
- Draft-first gana cuando hay aprobación de cliente, consistencia de marca o brief complejo: el costo del error lo paga la iteración barata, y el 4K se reserva para la versión aprobada. Es nuestro default en Virtalio.
- One-shot sigue ganando cuando el formato es corto y descartable —clips de prueba, volumen para testing creativo— o cuando la pieza necesita continuidad narrativa y de audio de un solo aliento. Para esa decisión mantenemos el framework de Seedance 2.5 y la generación de una sola toma: una toma no es mejor ni peor, es la herramienta correcta para ciertos guiones.
La respuesta corta: si la pieza va a pasar por ojos humanos antes de publicarse, itera en 360p. Si va directo a test sin revisión, genera one-shot y mide.
El costo ya no es la excusa
Durante dos años, la objeción estándar contra el video con IA en producción era el costo de iterar: "cada cambio cuesta otro render". Omni 1.1 Flash, al separar borrador de entrega, elimina esa objeción de la conversación. Lo que queda expuesto —y esto es lo que separa a los equipos— es si tienes un método de dirección, un guion por bloques y una imagen ancla, o si sigues re-prompt-eando a ciegas.
Iterar barato no te salva de dirigir mal. Solo te cobra menos por aprender.
Preguntas Frecuentes
¿Qué es Gemini Omni 1.1 Flash?
Es el modelo de generación y edición de video de Google anunciado el 27 de agosto de 2026. Genera escenas de hasta 10 segundos, las extiende en bloques de 10 segundos hasta 40 segundos manteniendo coherencia visual y narrativa, acepta control de primer y último fotograma, referencias de video, salida 4K por upscaling y borradores económicos en 360p.
¿Por qué renderizar borradores en 360p primero?
Porque la calidad final del video con IA depende del número de iteraciones que puedes pagar, y el costo por iteración colapsa en la resolución de borrador. Iterar en 360p cuesta una fracción del render 4K: puedes permitirte 10 o 20 intentos de una escena por el precio de uno solo en calidad final, y el 4K se reserva para la versión ya aprobada.
¿Cómo funciona la extensión de escenas a 40 segundos?
Generas una escena base de hasta 10 segundos y pides extensiones de 10 segundos, cada una informada por el contexto previo (hasta 10 segundos de continuidad). El modelo conserva el aspecto, el movimiento y la narrativa del clip original, lo que permite planificar piezas de 40 segundos como una secuencia de bloques coherentes en lugar de un prompt gigante de una sola vez.



