La empresa Black Forest Labs lanzó en acceso anticipado de FLUX 3, un modelo fundacional multimodal capaz de generar imágenes, video y audio, además de predecir acciones para aplicaciones de robótica e inteligencia artificial física.
La evolución de la inteligencia artificial ya no pasa únicamente por generar texto o imágenes. El próximo gran objetivo de Black Forest Labs es construir modelos capaces de comprender el mundo de forma similar a los seres humanos, integrando simultáneamente visión, sonido, movimiento y lenguaje. Con esa meta, la empresa responsable de FLUX presentó FLUX 3, un nuevo modelo fundacional multimodal que busca convertirse en la base de una nueva generación de sistemas de inteligencia visual.
Disponible desde esta semana en Early Access, FLUX 3 fue diseñado para aprender de imágenes, videos y audio dentro de una única arquitectura, abandonando el enfoque tradicional de entrenar modelos independientes para cada modalidad.
Según la compañía, el propósito no es que el modelo aprenda únicamente a interpretar fotografías, videos o sonidos por separado, sino que construya una representación coherente del mundo físico.
«Ninguna modalidad ofrece una descripción completa de la realidad. Cada una es una proyección de un mismo mundo subyacente capturada por distintos sensores, que inevitablemente pierden parte de la información«, explica la empresa en la presentación del modelo.
En ese sentido, las imágenes aportan relaciones espaciales, los videos incorporan la dimensión temporal y las leyes físicas del movimiento, mientras que el audio permite comprender relaciones causales que la visión por sí sola no puede detectar. El lenguaje, por su parte, conecta esas percepciones con objetivos, instrucciones y conceptos abstractos.
Un único modelo para múltiples capacidades
FLUX 3 fue desarrollado sobre Self-Flow, una arquitectura creada por la compañía para unificar tareas de comprensión y generación multimodal.
A partir de esa base, los investigadores ampliaron significativamente la capacidad de cómputo y el volumen de datos utilizados durante el entrenamiento para procesar de manera conjunta imágenes, videos y audio.
El resultado es un único modelo capaz de realizar múltiples tareas utilizando distintas combinaciones de modalidades.
Entre sus principales funciones se destacan:
- Generación de video a partir de instrucciones de texto.
- Conversión de imágenes en video mediante animaciones.
- Creación de nuevos videos utilizando otros videos como referencia.
- Continuación automática de secuencias de video y audio.
- Generación de transiciones mediante fotogramas clave.
- Producción de diálogos en varios idiomas.
- Creación de contenidos en múltiples estilos visuales y relaciones de aspecto.
- Encadenamiento automático de escenas para construir secuencias de varios minutos.
- Generación precisa de tipografías y diseños animados.
Además, todos los videos generados incorporan audio nativo, sin necesidad de utilizar herramientas externas para crear la banda sonora.
Actualmente el modelo puede producir videos de hasta 20 segundos en una única generación.
Primeras comparaciones con la competencia
Aunque la compañía aclara que los resultados todavía son preliminares y que espera mejorar el modelo durante la fase de acceso anticipado, las primeras evaluaciones internas muestran un desempeño competitivo frente a varias de las principales plataformas del mercado.
En pruebas comparativas, FLUX 3 fue preferido frente a Grok Imagine Video en hasta el 69% de las evaluaciones.
También obtuvo mejores resultados que:
- Kling v3 Pro, en el 60% de las comparaciones.
- Happy Horse v1, con 59%.
- Happy Horse 1.1, con 57%.
- Seedance 2.0 y Gemini Omni Flash, ambos con 52%.
Las diferencias fueron aún mayores frente a otras plataformas especializadas.
Según la empresa, FLUX 3 fue elegido por los evaluadores sobre Runway Gen-4.5 en el 77% de las comparaciones y sobre Luma Ray 3.2 en el 93%.
Los desarrolladores destacan especialmente la capacidad del modelo para representar expresiones faciales humanas, sincronizar sonidos con eventos físicos y mantener la consistencia de personajes durante secuencias largas.
Más allá de la creación de contenidos
Uno de los aspectos más novedosos de FLUX 3 es que su arquitectura también fue diseñada para aplicaciones de inteligencia artificial física.
Además de generar contenido audiovisual, el modelo puede predecir acciones y comprender dinámicas del mundo real.
Para ello, la compañía desarrolló dos enfoques distintos.
El primero incorpora directamente capacidades de predicción de acciones dentro del propio modelo.
El segundo utiliza la base de FLUX 3 para entrenar modelos especializados destinados a robots y sistemas físicos.
Uno de los primeros socios en acceder a esta tecnología fue mimic robotics, empresa con la que desarrolló FLUX-mimic, una plataforma orientada al aprendizaje robótico para tareas de manipulación de precisión.
La tecnología ya comenzó a evaluarse en procesos industriales de Audi, donde se analiza su potencial para automatizar tareas de producción mediante robots capaces de interpretar escenas y ejecutar acciones complejas.
Hoja de ruta
Durante las próximas semanas y meses la compañía irá habilitando progresivamente las distintas capacidades de FLUX 3 tras completar las fases de pruebas y validaciones de seguridad.
El plan contempla:
- FLUX 3 Video, para generación y edición de video y audio mediante API y acceso privado a los modelos.
- FLUX 3 Image, orientado a síntesis y edición de imágenes.
- FLUX-mimic y FLUX 3 Action, destinados a predicción de acciones e inteligencia artificial física junto a socios comerciales y de investigación.
- FLUX 3 Dev, una versión con pesos abiertos del modelo multimodal para desarrolladores.
La empresa también anticipó que publicará más detalles técnicos sobre la arquitectura utilizada y confirmó que ya trabaja en la próxima generación de modelos.
Su objetivo final es construir una plataforma capaz de unificar percepción, predicción de acciones y comprensión del lenguaje en un único sistema de inteligencia artificial, una dirección que, según sus desarrolladores, permitirá extender estas capacidades desde la creación de contenidos hasta la robótica, la simulación y la interacción con entornos físicos y digitales.

