Vídeo: canal NextGen IA Hub en YouTube. Los derechos del vídeo pertenecen a su autor.
Imagen ilustrativa: Unsplash
Generar ocho segundos de vídeo con inteligencia artificial es hoy casi trivial. Generar dos minutos que parezcan la misma película, con el mismo personaje, la misma luz y el mismo tono, sigue siendo el problema difícil. Esta guía práctica explica qué es Google Flow, el estudio creativo de Google Labs construido sobre el modelo de vídeo Veo, y qué herramientas reales ofrece para encadenar tomas hasta conseguir una secuencia larga sin desperdiciar créditos.
Por qué es tan difícil un vídeo largo y coherente
Los generadores de vídeo actuales no producen una película: producen clips sueltos. Cada generación parte casi de cero, así que dos tomas creadas con el mismo texto pueden diferir en el rostro del personaje, en el color de la chaqueta, en la altura de la cámara o en la temperatura de la luz. A eso se suma que la duración por generación es corta. En Flow, los modelos Veo 3.1 generan clips de 4, 6 u 8 segundos. Cualquier narración más larga es, por definición, un montaje de piezas. El trabajo del creador no consiste en pedir un vídeo de dos minutos, sino en diseñar la continuidad entre piezas de ocho segundos.
Qué ofrece Flow realmente
Flow no es un modelo, es una interfaz que reúne varios. Para vídeo hay varias variantes de Veo 3.1 (Lite, Fast y Quality); para imágenes, la familia Nano Banana, útil para fabricar fotogramas de referencia. Las variantes no son equivalentes: Veo 3.1 Lite admite texto a vídeo, fotogramas a vídeo e ingredientes; Veo 3.1 Quality es la opción de máxima calidad pero con menos funciones. Conviene comprobar la tabla oficial de modelos antes de planificar, porque las funciones cambian entre versiones y entre países.
Los tres modos de creación son la base de todo:
- Texto a vídeo: describes sujeto, acción, entorno, iluminación y estilo.
- Fotogramas a vídeo: aportas un fotograma inicial, o inicial y final, y el modelo genera el movimiento entre ambos. Es la herramienta clave para las transiciones.
- Ingredientes a vídeo: subes referencias visuales de personajes, objetos o estilo y el modelo las reutiliza. Google recomienda hasta tres ingredientes por prompt.
A eso se añaden Extend, que continúa un clip existente a partir de sus fotogramas finales y que solo funciona con vídeos generados con Veo, y Scenebuilder, donde se ordenan los clips, se recortan por el principio y el final, se previsualiza y se descarga la secuencia completa. Veo genera además audio nativo: diálogo, efectos y ambiente descritos en el propio prompt.
Cómo escribir un prompt que mantenga la coherencia
La recomendación oficial de Google es estructurar el prompt en bloques: sujeto y acción, composición y movimiento de cámara, localización e iluminación, estilo, y audio o diálogo. Para una secuencia, lo importante es que el bloque de personaje y el bloque de luz se repitan literalmente en todas las tomas. Define una vez tu ficha de continuidad y cópiala sin reescribirla:
PERSONAJE FIJO: mujer de unos 35 años, pelo castaño recogido, cicatriz corta en la ceja izquierda, abrigo de lana gris oscuro, bufanda burdeos. LUZ FIJA: tarde nublada, luz suave y difusa, temperatura fría, sin sol directo. ESTILO FIJO: cine digital, lente 35 mm, grano leve, paleta desaturada.
Y después, solo cambia el bloque de acción y cámara:
[PERSONAJE FIJO] [LUZ FIJA] [ESTILO FIJO] Toma 1: plano medio, cámara fija a la altura del pecho. Ella cruza un patio de adoquines mojados y se detiene al oír un ruido. Audio: pasos sobre piedra mojada, viento lejano, sin música.
[PERSONAJE FIJO] [LUZ FIJA] [ESTILO FIJO] Toma 2: primer plano, ligero travelling de acercamiento. Ella mira hacia la izquierda del encuadre y susurra una frase corta. Audio: susurro cercano, ambiente de patio vacío.
Para que el parecido no dependa solo del texto, guarda un fotograma del primer clip como imagen y úsalo como ingrediente o como fotograma inicial de la siguiente toma.
Cómo encadenar clips hasta una secuencia larga
- Escribe el guion en tomas de ocho segundos y decide antes qué cambia en cada una.
- Genera la toma 1 con un modelo barato hasta que el encuadre y el personaje te convenzan.
- Extrae el último fotograma útil y úsalo como fotograma inicial de la toma 2, o guarda el personaje como ingrediente.
- Cuando quieras continuar la misma acción sin corte, usa Extend describiendo cómo sigue el movimiento. Google indica que así se pueden alcanzar vídeos de un minuto o más. Ten en cuenta que sobre un clip extendido no se pueden aplicar después otros modos de edición, así que extiende al final del proceso.
- Lleva todo a Scenebuilder, recorta los primeros y últimos cuadros de cada clip (suelen ser los más inestables), ordena y descarga.
Administrar los créditos sin desperdiciarlos
En Flow todo consume créditos y el coste depende del modelo: las variantes ligeras gastan bastante menos por generación que las de máxima calidad, y el escalado a 4K tiene su propio coste y está reservado al plan superior. Las asignaciones también varían: sin suscripción se recibe una bolsa inicial por una sola vez más una recarga diaria modesta, mientras que los planes de pago dan asignaciones mensuales que no se acumulan de un mes al siguiente.
Traducido a la práctica: con el plan gratuito caben unas pocas generaciones al día, suficiente para una toma bien resuelta, no para experimentar a ciegas. Consulta siempre las cifras vigentes en la ayuda oficial, porque Google las ajusta con frecuencia.
Tres hábitos que ahorran mucho: prueba siempre el encuadre con el modelo más barato y reserva el caro para la toma definitiva; genera una sola variante por intento en lugar de cuatro; y prepara las imágenes de referencia con un generador de imágenes antes de tocar vídeo, porque corregir un personaje en imagen es mucho más barato que regenerar el clip.
Qué hacer si se agotan los créditos
Las opciones honestas son pocas: esperar al reinicio diario del plan gratuito, esperar al ciclo de facturación si tienes plan de pago, o subir de plan. Mientras tanto el tiempo no se pierde: se puede avanzar escribiendo el guion por tomas, preparando ingredientes con generación de imágenes y montando en Scenebuilder lo ya generado. Si trabajas con volumen, el acceso a Veo mediante la API de Gemini es otra vía, con su propio modelo de precios.
Errores típicos
- Reescribir el prompt del personaje en cada toma en lugar de copiar el mismo bloque literal.
- Cambiar de modelo a mitad de secuencia, lo que suele romper el estilo y la piel del personaje.
- Pedir demasiadas acciones en ocho segundos: una acción por clip funciona mejor que tres.
- Olvidar el bloque de audio y descubrir después que cada toma tiene un ambiente sonoro distinto.
- Gastar créditos en calidad máxima antes de haber validado el encuadre.
- No recortar los extremos de cada clip en el montaje.
Limitaciones que conviene aceptar
La coherencia de personajes mejora con ingredientes y fotogramas de referencia, pero no es perfecta: rostros, manos y logotipos siguen derivando. Los saltos de iluminación entre tomas son frecuentes y a veces solo se arreglan con corrección de color en un editor externo. El audio nativo es notable, aunque el ambiente puede variar de clip a clip y el diálogo largo sigue siendo poco fiable. Y la duración real por generación es de segundos, no de minutos: lo largo siempre es el resultado de encadenar, no de una única salida.
SynthID y derechos de uso
Todo lo que se genera en Flow lleva incrustada una marca de agua invisible SynthID, la tecnología de Google DeepMind que permite identificar contenido generado con IA mediante detección automática. Además existe una marca de agua visible que en algunos países se aplica de forma obligatoria. Quitar la marca invisible no es una opción legítima ni fiable.
Sobre los derechos, Google indica que no reclama la propiedad del contenido que generas, pero el uso queda sujeto a los Términos del Servicio y a las políticas de uso aceptable, y las condiciones concretas para uso comercial pueden variar según el plan y el país. Antes de publicar material generado en una campaña o en un producto de pago, lee los términos vigentes de tu plan y evita usar rostros de personas reales, marcas registradas o material protegido como ingredientes.
Fuentes: Google Labs, Flow, crear vídeos en Flow, gestionar los créditos de Flow, novedades de Veo 3.1 en Flow, documentación de Veo en la API de Gemini y Google DeepMind, SynthID. Precios, créditos y funciones pueden cambiar: verifica en la web oficial.
No te pierdas lo próximo que publiquemos
Cada día, las noticias y guías de inteligencia artificial que importan, directas a tu correo.
Es gratis. Sin spam. Puedes darte de baja cuando quieras.