Desde que descubrí FLUX, el modelo de generación de imágenes de Black Forest Labs, se convirtió en uno de mis favoritos. Generaba imágenes con una calidad impresionante. Ya no eran esas imágenes que «cantaban» a IA, como ocurría con las primeras versiones de DALL·E, tan recargadas y saturadas de color. Estas parecían fotografías. Y si escribías un prompt con cierto conocimiento técnico, los resultados podían ser realmente espectaculares.

Además, se podía utilizar en local porque Black Forest Labs publicó versiones con pesos abiertos. Bastaba con descargar el modelo adecuado desde su colección oficial en Hugging Face y cargarlo en mi curso de ComfyUI (sustituye esta URL por la definitiva de tu curso). Por primera vez tenía en mi ordenador un modelo capaz de generar imágenes de una calidad extraordinaria.
Con FLUX 2 la situación cambió. El modelo creció muchísimo y ya no era tan fácil moverlo, incluso con mi RTX 4080. Afortunadamente aparecieron versiones más ligeras que permitieron seguir utilizándolo en tarjetas más modestas e incluso en mi MacBook Pro sin demasiados problemas.
Tabla de contenidos
¿Es código abierto?
Aquí conviene hacer una aclaración. No. FLUX 3 no es un proyecto de código abierto en el sentido tradicional. Actualmente está disponible en acceso anticipado.
Lo que sí ha explicado Black Forest Labs es que pretende publicar más adelante una versión con pesos abiertos («open weights»), siguiendo una filosofía similar a la de versiones anteriores de FLUX.
Es importante distinguir ambos conceptos:
- Código abierto (Open Source): se publica también el código del proyecto.
- Pesos abiertos (Open Weights): se publican los parámetros entrenados del modelo para poder ejecutarlo o adaptarlo, aunque el resto del software no sea necesariamente abierto.
¿Qué hace diferente a FLUX 3?
Y ahora llegamos a FLUX 3. Aquí es donde, en mi opinión, está el verdadero cambio.
FLUX 3 es un modelo multimodal. ¿Qué significa eso? Algo parecido a lo que ocurre con ChatGPT o Gemini. Son capaces de entender y generar distintos tipos de contenido. La diferencia es que Black Forest Labs ha diseñado un único modelo capaz de comprender imágenes, vídeo, audio e incluso la relación entre todos ellos.
Imagina que le hablas de una pelota.
No solo entiende cómo es visualmente. También sabe cómo se mueve porque ha aprendido a partir de vídeos. Y además sabe cómo suena cuando rebota. Ese sonido no se añade después con otro sistema. Forma parte de lo que el propio modelo ha aprendido.
Ese es, para mí, el verdadero salto.
La predicción de acciones
Hay otra capacidad de la que apenas se está hablando y que me parece especialmente interesante: la predicción de acciones.
El modelo puede observar una escena y predecir cuál debería ser el siguiente movimiento.
Por ejemplo:
- Cómo coger un objeto.
- Cómo utilizar una herramienta.
- Qué movimiento debería realizar un robot para completar una tarea.

Por eso Black Forest Labs ya no habla únicamente de generación de imágenes. Empieza a utilizar conceptos como Visual Intelligence o Real World Models, tal y como explican en la presentación oficial de FLUX 3. El objetivo ya no es solo crear imágenes bonitas, sino desarrollar modelos capaces de comprender cómo funciona el mundo físico.
¿Cómo puede evolucionar esto?
Si el objetivo de Black Forest Labs es desarrollar modelos que realmente entiendan el mundo, me pregunto si el futuro pasará por seguir creando modelos específicos como FLUX Depth, FLUX Canny, FLUX Normal o FLUX Pose.
Mi intuición me dice que quizá el camino sea justo el contrario: evolucionar un único modelo hasta el punto de que sea capaz de comprender por sí mismo la profundidad, las relaciones espaciales o la geometría de una escena, sin depender de tantos preprocessadores externos.

Insisto en que esto no deja de ser una hipótesis personal basada en la dirección que parece tomar la compañía. No es algo que Black Forest Labs haya anunciado. Pero, si esa visión llega a hacerse realidad, podría cambiar por completo la forma en que trabajamos hoy con ComfyUI (sustituye la URL por la de tu curso o categoría).
Una prueba práctica con dos fotografías reales
Para probar FLUX 3 he utilizado dos fotografías reales de la misma calle tomadas desde posiciones ligeramente diferentes. La primera funciona como fotograma inicial y la segunda como fotograma final, de modo que el modelo debe construir una transición coherente entre ambas, respetando la identidad de la calle, los edificios, el cableado, los vehículos y las personas. En el prompt le pedí que aprovechara el movimiento natural sugerido por las dos imágenes y que, durante la transición, transformara el entorno de forma sutil en una versión futurista y creíble de una ciudad filipina, con arquitectura avanzada al fondo, vehículos eléctricos autónomos, drones de reparto y elementos holográficos discretos. También indiqué un tratamiento visual cinematográfico, con gradación Kodak Vision3, lente anamórfica, luz volumétrica y sonido ambiente urbano generado junto al vídeo.
Fotogramas de referencia


Create a seamless cinematic transition between these two real photographs.
Preserve the identity of the street, buildings, utility poles, tangled overhead cables, vehicles and people.
Use the natural camera movement implied by the two images.
While transitioning, subtly evolve the environment into a believable near-future Philippine city with elegant futuristic architecture in the distance, autonomous electric vehicles, delivery drones and discreet holographic public information displays.
Everything should remain realistic and grounded. Avoid cyberpunk aesthetics.
Hollywood cinematic look, Kodak Vision3 color grading, anamorphic lens, volumetric sunlight, realistic motion, extremely photorealistic.
Generate immersive ambient city audio with traffic, tricycles, distant conversations, birds and subtle drone sounds.
Modo: Image to Video
Relación de aspecto: 16:9
Duración: 5 segundos
Resolución: HD
Generación de audio: Activada
Safety tolerance: 2
Draft: Desactivado
Fotogramas clave: imagen inicial e imagen final


Create a short cinematic sequence, 5 seconds, from this real photograph of a narrow Hong Kong alley at night, light rain falling.\n\nKeep the exact location: the violet neon spill on the left wall, the pipes and air conditioning units, the wet reflective pavement with rain ripples, the warm amber restaurant glow at the far end.\n\nCamera holds a static telephoto framing down the alley with a subtle handheld sway, natural and unstable, never smooth.\n\nNothing else moves in the alley except the falling rain. At the far end, a door bursts open and a young woman is shoved out abruptly, stumbling forward off balance, seen only in silhouette against the warm light behind her. The door slams shut immediately, cutting the light. She staggers a few steps into the alley, stops, and looks down at the ground, rain visible around her silhouette.\n\nAnamorphic lens, Kodak Vision3 500T emulation, deep shadows, warm light against cool violet ambience, subtle film grain, photorealistic, Wong Kar-wai influenced.\n\nAudio: everything distant, as if heard from the near end of the alley looking toward the far end. Steady light rain close to camera, soft and present. Muffled raised voices in Cantonese and a sharp door slam, far away and reverberant. Cars passing on the street behind the camera, closer than anything at the far end, tires hissing on wet asphalt. Faint neon hum. No score.
Cómo construir un prompt para FLUX 3
Una de las primeras cosas que he aprendido al probar FLUX 3 es que el prompt funciona mejor cuando no se plantea como una simple lista de palabras clave. En lugar de escribir algo como «cinematic, photorealistic, HDR, masterpiece», resulta más útil describir la escena como si estuviéramos dando instrucciones a un director de fotografía.
El prompt puede dividirse en varias partes: qué ocurre en la escena, cómo se mueve la cámara, qué elementos deben conservarse, cómo debe evolucionar el entorno, qué tipo de iluminación buscamos, cuál debe ser el tratamiento cinematográfico y qué sonido queremos generar. Esta estructura ayuda a que el modelo entienda mejor la intención completa de la secuencia.
También conviene dejar muy claro qué elementos no deben cambiar. En mi caso era importante conservar la identidad de la calle, los edificios, los postes, el cableado, los vehículos y las personas. A partir de ahí podía pedir una evolución futurista del entorno sin perder la referencia original.

La parte visual también necesita instrucciones concretas. En lugar de limitarme a pedir un resultado «de cine», especifiqué una gradación de color inspirada en Kodak Vision3, lentes anamórficas, luz volumétrica, movimiento realista y un acabado fotorrealista. Lo mismo ocurre con el audio: FLUX 3 puede generarlo junto al vídeo, así que merece la pena describir el ambiente sonoro con el mismo cuidado que la imagen.
En resumen, la idea es pensar el prompt por bloques:
- Escena y acción.
- Movimiento de cámara.
- Elementos que deben conservarse.
- Transformación del entorno.
- Iluminación y atmósfera.
- Tratamiento cinematográfico.
- Audio.
Este enfoque no garantiza un resultado perfecto, pero sí permite controlar mucho mejor la intención de la escena y entender qué parte del resultado responde a cada instrucción.
Una reflexión para terminar
¿Y si FLUX 3 no fuera solo un nuevo modelo, sino el comienzo de una nueva generación de IA capaz de hacerlo prácticamente todo?
Es solo una reflexión personal, pero me parece un debate apasionante. Me gustaría saber qué opinas. Te leo abajo, en los comentarios.