Los creadores de Black Forest Labs han lanzado un nuevo modelo llamado FLUX 3 Image. Esta creación multimodal permite a los agentes construir imágenes a partir de nada más que cuadros delimitadores. Fue construido con una comprensión de cómo deben organizarse las imágenes en un lienzo, para que las personas puedan colocar cada elemento dentro de su propio cuadro, explicar lo que pertenece dentro de él y dejar el trabajo final al modelo en sí.
Esta herramienta está dirigida a agentes que requieren una generación y edición de imágenes rápidas. Incluye soporte para renderizado en nativo 4K, edición de píxeles perfectos y una licencia de pesos comerciales para empresas que deseen ejecutar la generación de imágenes a escala.
Cómo Funcionan los Cuadros Delimitadores
Una cuadrícula fija con coordenadas de 0 a 1000 constituye la base de todo el proceso. En ella, se dibujan y etiquetan cuadros con descripciones. Cada cuadro se describe utilizando cuatro números: sus valores y y x más bajos y más altos, dispuestos como [y_min, x_min, y_max, x_max].
Una leyenda global describe toda la imagen en un párrafo. A continuación, viene una tabla de elementos, un array JSON con una fila por elemento. Cada fila incluye un id, un cuadro delimitador y una descripción. La leyenda cita cada elemento por su id, como animal_1, donde ese elemento aparece por primera vez.
Si no desea dibujar cada cuadro a mano, un LLM puede encargarse de la planificación del diseño. Le proporciona una línea y una relación de aspecto, y produce una leyenda junto con una tabla de elementos. Esa tabla asigna un cuadro y un id semántico a cada elemento que importa, manteniendo cada cuadro editable para que pueda mover los que no le gustan. El modelo genera entonces en el resto según lo colocó el agente.
Editando una Imagen Existente
El modelo también admite la edición de imágenes que ya ha creado. Puede realizar varias ediciones específicas a la vez, re-describiendo, reemplazando o moviendo cuadros individuales. Todo lo que no tocó se mantiene exactamente donde estaba, por lo que una imagen se mantiene unida a través de una ronda de ediciones tras otra.
El programa FLUX 3 deja sus cajas dibujadas intactas. En cambio, toma su breve entrada y la expande en una leyenda completa que coincide con lo que el modelo fue diseñado para. El potenciatador podría añadir detalles alrededor de sus cajas y proponer elementos adicionales, pero cada caja que dibujó se envía al modelo exactamente como apareció, manteniendo intacto su id y sus coordenadas. Solo lo que la leyenda realmente se refiere pasará.
¿Qué Tipos de Imágenes Son Adecuadas para las Cajas Delimitadoras
Este enfoque ofrece sus mejores resultados cuando se aplica a piezas construidas a partir de numerosos elementos dispuestos con conexiones precisas entre sí. Se aplica a diseños donde el texto se coloca alrededor de una imagen, a collages, a cuadrículas de paneles y a extensiones editoriales, así como a escenas ocupadas donde cada rostro ocupa su propia posición distinta.
La ilustración dada es un entorno de festival ensamblado a partir de cajas delimitadoras. La leyenda ofrece una descripción de la imagen completa, mientras que la lista de elementos establece cada caja según su id, posición y contenido.
- Fr_Text_1: «LE FESTIVAL DU SOLEIL» en una tipografía serif delgada y elegante en un color crema claro
- town_1: luces tenues y pequeños edificios de una ciudad costera al pie de las colinas
- dome_1: una enorme cúpula parabólica lisa de hormigón pálido
- swimmers_1: docenas de pequeñas figuras silueteadas dispersas en el agua oscura, vadeando
- crowd_1: una gran multitud de personas sentadas en la playa con ropa de verano casual y de colores claros
Usando el Playground y la API
Los usuarios pueden acceder al sistema a través de dos vías: el Playground, donde dibujan cajas a mano, o la API de BFL, que les permite enviar una solicitud de diseño directamente a FLUX 3.
Las empresas obtienen la libertad de ajustar y poner el modelo en funcionamiento en sus propios servidores a través de la licencia de pesos comerciales. Black Forest Labs respalda estas implementaciones con asistencia.
Preguntas frecuentes (
A continuación, se presenta un vistazo rápido a las respuestas a las preguntas comunes sobre el modelo, que componen la FAQ. (
| Pregunta ( | Respuesta ( |
|---|---|
| ¿Qué es FLUX 3 Image? ( | FLUX 3 es el modelo multimodal de Black Forest Labs para video, audio, imágenes y acciones. FLUX 3 Image es la parte que genera y edita imágenes. ( |
| ¿Cómo funcionan las cajas delimitadoras? ( | Arrastre una caja para cada elemento que importa y describa lo que hay en ella. Luego, proporcione a la escena una línea que une los elementos, y FLUX 3 lo renderiza con cada elemento dentro de su caja. ( |
| ¿Cómo se ve un aviso de diseño? ( | Tiene dos partes: un pie de foto global que describe toda la imagen, seguido de una tabla de elementos, una matriz JSON con una fila por elemento. ( |
| ¿Tengo que dibujar cada caja yo mismo? ( | No. Dé al agente una línea y una proporción de aspecto, y un LLM planifica el diseño para usted. ( |
| ¿Puedo editar una imagen que ya he creado? | Sí, y puede realizar varias ediciones específicas a la vez. Cada caja permanece editable. |
| ¿FLUX 3 modifica las cajas que dibujo? | No. Un amplificador de prompts transforma su solicitud concisa en la densa leyenda sobre la que fue entrenado FLUX 3, pero cada caja que dibuja llega al modelo textualmente. |
El Resumen de FLUX 3 Image
FLUX 3 Image es una herramienta poderosa para agentes que necesitan generar o editar imágenes rápidamente. El enfoque de las cajas delimitadoras proporciona un control preciso sobre la composición, y la función de edición de píxeles perfectos significa que puede apuntar a los cambios sin tocar el resto de la imagen.
El diseño del sistema divide el trabajo entre dos partes: una parte aprende a leer la disposición y composición de las imágenes, mientras que la otra se encarga del renderizado real. Todo el propósito se basa en esa separación.
Una licencia para pesos comerciales otorga a las empresas permiso para ejecutar la generación de imágenes a gran escala. Cualquiera que esté construyendo contenido visual descubrirá que la combinación de exactitud y libertad de elección vale la pena probarla.
The Playground y la API de BFL son actualmente las dos formas de acceder al sistema. La sección de preguntas frecuentes cubre preguntas comunes sobre el modelo, mientras que el ejemplo de escena demuestra cómo funciona el método de las cajas delimitadoras en la práctica.
El modelo responde a la exploración práctica produciendo resultados basados en lo que los usuarios dibujan y etiquetan. Se dibujan cajas, se agregan leyendas, y la salida del modelo sigue.
Vea la imagen 3 en bfl.ai.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

