FLUX 3: qué es y cómo generar vídeo a partir de dos imágenes

Desde que descubrí FLUX, el modelo de generación de imágenes de Black Forest Labs, se convirtió en uno de mis favoritos. Generaba imágenes con una calidad impresionante. Ya no eran esas imágenes que «cantaban» a IA, como ocurría con las primeras versiones de DALL·E, tan recargadas y saturadas de color. Estas parecían fotografías. Y si escribías un prompt con cierto conocimiento técnico, los resultados podían ser realmente espectaculares.

web black forest labs flux 3

Además, se podía utilizar en local porque Black Forest Labs publicó versiones con pesos abiertos. Bastaba con descargar el modelo adecuado desde su colección oficial en Hugging Face y cargarlo en mi curso de ComfyUI (sustituye esta URL por la definitiva de tu curso). Por primera vez tenía en mi ordenador un modelo capaz de generar imágenes de una calidad extraordinaria.

Con FLUX 2 la situación cambió. El modelo creció muchísimo y ya no era tan fácil moverlo, incluso con mi RTX 4080. Afortunadamente aparecieron versiones más ligeras que permitieron seguir utilizándolo en tarjetas más modestas e incluso en mi MacBook Pro sin demasiados problemas.

¿Es código abierto?

Aquí conviene hacer una aclaración. No. FLUX 3 no es un proyecto de código abierto en el sentido tradicional. Actualmente está disponible en acceso anticipado.

Lo que sí ha explicado Black Forest Labs es que pretende publicar más adelante una versión con pesos abiertos («open weights»), siguiendo una filosofía similar a la de versiones anteriores de FLUX.

Es importante distinguir ambos conceptos:

  • Código abierto (Open Source): se publica también el código del proyecto.
  • Pesos abiertos (Open Weights): se publican los parámetros entrenados del modelo para poder ejecutarlo o adaptarlo, aunque el resto del software no sea necesariamente abierto.

¿Qué hace diferente a FLUX 3?

Y ahora llegamos a FLUX 3. Aquí es donde, en mi opinión, está el verdadero cambio.

FLUX 3 es un modelo multimodal. ¿Qué significa eso? Algo parecido a lo que ocurre con ChatGPT o Gemini. Son capaces de entender y generar distintos tipos de contenido. La diferencia es que Black Forest Labs ha diseñado un único modelo capaz de comprender imágenes, vídeo, audio e incluso la relación entre todos ellos.

Imagina que le hablas de una pelota.

No solo entiende cómo es visualmente. También sabe cómo se mueve porque ha aprendido a partir de vídeos. Y además sabe cómo suena cuando rebota. Ese sonido no se añade después con otro sistema. Forma parte de lo que el propio modelo ha aprendido.

Ese es, para mí, el verdadero salto.

La predicción de acciones

Hay otra capacidad de la que apenas se está hablando y que me parece especialmente interesante: la predicción de acciones.

El modelo puede observar una escena y predecir cuál debería ser el siguiente movimiento.

Por ejemplo:

  • Cómo coger un objeto.
  • Cómo utilizar una herramienta.
  • Qué movimiento debería realizar un robot para completar una tarea.
flux 3 prediction actions

Por eso Black Forest Labs ya no habla únicamente de generación de imágenes. Empieza a utilizar conceptos como Visual Intelligence o Real World Models, tal y como explican en la presentación oficial de FLUX 3. El objetivo ya no es solo crear imágenes bonitas, sino desarrollar modelos capaces de comprender cómo funciona el mundo físico.

¿Cómo puede evolucionar esto?

Si el objetivo de Black Forest Labs es desarrollar modelos que realmente entiendan el mundo, me pregunto si el futuro pasará por seguir creando modelos específicos como FLUX Depth, FLUX Canny, FLUX Normal o FLUX Pose.

Mi intuición me dice que quizá el camino sea justo el contrario: evolucionar un único modelo hasta el punto de que sea capaz de comprender por sí mismo la profundidad, las relaciones espaciales o la geometría de una escena, sin depender de tantos preprocessadores externos.

Primer plano fotorrealista de un pulpo generado con FLUX 3 mediante inteligencia artificial.

Insisto en que esto no deja de ser una hipótesis personal basada en la dirección que parece tomar la compañía. No es algo que Black Forest Labs haya anunciado. Pero, si esa visión llega a hacerse realidad, podría cambiar por completo la forma en que trabajamos hoy con ComfyUI (sustituye la URL por la de tu curso o categoría).

Una prueba práctica con dos fotografías reales

Para probar FLUX 3 he utilizado dos fotografías reales de la misma calle tomadas desde posiciones ligeramente diferentes. La primera funciona como fotograma inicial y la segunda como fotograma final, de modo que el modelo debe construir una transición coherente entre ambas, respetando la identidad de la calle, los edificios, el cableado, los vehículos y las personas. En el prompt le pedí que aprovechara el movimiento natural sugerido por las dos imágenes y que, durante la transición, transformara el entorno de forma sutil en una versión futurista y creíble de una ciudad filipina, con arquitectura avanzada al fondo, vehículos eléctricos autónomos, drones de reparto y elementos holográficos discretos. También indiqué un tratamiento visual cinematográfico, con gradación Kodak Vision3, lente anamórfica, luz volumétrica y sonido ambiente urbano generado junto al vídeo.

Fotogramas de referencia

Create a seamless cinematic transition between these two real photographs.

Preserve the identity of the street, buildings, utility poles, tangled overhead cables, vehicles and people.

Use the natural camera movement implied by the two images.

While transitioning, subtly evolve the environment into a believable near-future Philippine city with elegant futuristic architecture in the distance, autonomous electric vehicles, delivery drones and discreet holographic public information displays.

Everything should remain realistic and grounded. Avoid cyberpunk aesthetics.

Hollywood cinematic look, Kodak Vision3 color grading, anamorphic lens, volumetric sunlight, realistic motion, extremely photorealistic.

Generate immersive ambient city audio with traffic, tricycles, distant conversations, birds and subtle drone sounds.
Modo: Image to Video
Relación de aspecto: 16:9
Duración: 5 segundos
Resolución: HD
Generación de audio: Activada
Safety tolerance: 2
Draft: Desactivado
Fotogramas clave: imagen inicial e imagen final

Cómo construir un prompt para FLUX 3

Una de las primeras cosas que he aprendido al probar FLUX 3 es que el prompt funciona mejor cuando no se plantea como una simple lista de palabras clave. En lugar de escribir algo como «cinematic, photorealistic, HDR, masterpiece», resulta más útil describir la escena como si estuviéramos dando instrucciones a un director de fotografía.

El prompt puede dividirse en varias partes: qué ocurre en la escena, cómo se mueve la cámara, qué elementos deben conservarse, cómo debe evolucionar el entorno, qué tipo de iluminación buscamos, cuál debe ser el tratamiento cinematográfico y qué sonido queremos generar. Esta estructura ayuda a que el modelo entienda mejor la intención completa de la secuencia.

También conviene dejar muy claro qué elementos no deben cambiar. En mi caso era importante conservar la identidad de la calle, los edificios, los postes, el cableado, los vehículos y las personas. A partir de ahí podía pedir una evolución futurista del entorno sin perder la referencia original.

tarlac night flux 3

La parte visual también necesita instrucciones concretas. En lugar de limitarme a pedir un resultado «de cine», especifiqué una gradación de color inspirada en Kodak Vision3, lentes anamórficas, luz volumétrica, movimiento realista y un acabado fotorrealista. Lo mismo ocurre con el audio: FLUX 3 puede generarlo junto al vídeo, así que merece la pena describir el ambiente sonoro con el mismo cuidado que la imagen.

En resumen, la idea es pensar el prompt por bloques:

  • Escena y acción.
  • Movimiento de cámara.
  • Elementos que deben conservarse.
  • Transformación del entorno.
  • Iluminación y atmósfera.
  • Tratamiento cinematográfico.
  • Audio.

Este enfoque no garantiza un resultado perfecto, pero sí permite controlar mucho mejor la intención de la escena y entender qué parte del resultado responde a cada instrucción.

Una reflexión para terminar

¿Y si FLUX 3 no fuera solo un nuevo modelo, sino el comienzo de una nueva generación de IA capaz de hacerlo prácticamente todo?

Es solo una reflexión personal, pero me parece un debate apasionante. Me gustaría saber qué opinas. Te leo abajo, en los comentarios.

Referencias

Deja un comentario

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.

Logo de Zao3D
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

Puedes revisar nuestra política de privacidad.