Die Macher von Black Forest Labs haben ein neues Modell namens FLUX 3 Image vorgestellt. Diese multimodale Kreation ermöglicht es Agenten, Bilder ausschließlich aus Bounding Boxes zu erstellen. Es wurde mit einem Verständnis dafür entwickelt, wie Bilder auf einer Leinwand angeordnet werden sollten, sodass Nutzer jedes Element innerhalb seiner eigenen Box platzieren, erklären können, was sich darin befindet, und die abschließende Arbeit dem Modell selbst überlassen können.
Dieses Tool richtet sich an Agenten, die eine schnelle Bilderzeugung und -bearbeitung benötigen. Es beinhaltet Unterstützung für das Rendern in nativer 4K-Auflösung, pixelgenaue Bearbeitung und eine kommerzielle Gewichts-Lizenz für Unternehmen, die Bildgeneration in großem Maßstab betreiben möchten.
Wie Bounding Boxes funktionieren
Ein festes Raster mit Koordinaten von 0 bis 1000 bildet die Grundlage des gesamten Prozesses. Darauf werden Boxen gezeichnet und mit Beschreibungen versehen. Jede Box wird mit vier Zahlen beschrieben: den niedrigsten und höchsten y- und x-Werten, angeordnet als [y_min, x_min, y_max, x_max].
Eine globale Bildunterschrift beschreibt das gesamte Bild in einem Absatz. Darunter befindet sich eine Elementtabelle, ein JSON-Array mit einer Zeile pro Element. Jede Zeile beinhaltet eine ID, eine Bounding Box und eine Beschreibung. Die Bildunterschrift zitiert jedes Element anhand seiner ID, wie z. B. animal_1, wo dieses Element zum ersten Mal erscheint.
Wenn Sie nicht jede Box von Hand zeichnen möchten, kann ein LLM die Layoutplanung für Sie übernehmen. Sie liefern ihm eine Zeile und ein Seitenverhältnis, und er erzeugt eine Bildunterschrift zusammen mit einer Elementtabelle. Diese Tabelle weist jedem relevanten Element eine Box und eine semantische ID zu, wobei jede Box weiterhin bearbeitbar bleibt, sodass Sie diejenigen verschieben können, die Ihnen nicht gefallen. Das Modell generiert dann das Innere im Sinne der Platzierung durch den Agenten.
Bearbeiten eines bestehenden Bildes
Das Modell unterstützt auch das Bearbeiten von Bildern, die Sie bereits erstellt haben. Sie können mehrere gezielte Bearbeitungen gleichzeitig vornehmen, indem Sie Beschreibungen anpassen, Elemente ersetzen oder einzelne Boxen verschieben. Alles, was Sie nicht berührt haben, bleibt genau dort, wo es war, sodass ein Bild über eine Runde der Bearbeitungen nach der anderen zusammenhält.
Das Tool FLUX 3 lässt Ihre gezeichneten Boxen unberührt. Stattdessen nimmt es Ihre kurze Eingabe entgegen und erweitert sie zu einer vollständigen Bildunterschrift, die dem entspricht, worauf das Modell aufgebaut wurde. Der Hochskalierer könnte Details um Ihre Boxen herum hinzufügen und zusätzliche Elemente vorschlagen, doch jede von Ihnen gezeichnete Box wird dem Modell genau so übermittelt, wie sie erschien, wobei ihre ID und ihre Koordinaten intakt bleiben. Nur das, worauf sich die Bildunterschrift tatsächlich bezieht, gelangt durch.
Welche Arten von Bildern eignen sich für Begrenzungsrahmen?
Dieser Ansatz liefert seine stärksten Ergebnisse, wenn er auf Elemente angewendet wird, die aus zahlreichen Elementen bestehen, die mit präzisen Verbindungen zwischen ihnen angeordnet sind. Es gilt für Layouts, bei denen Text um ein Bild herum platziert wird, für Collagen, Raster und Editorial-Doppelseiten sowie für belebte Szenen, in denen jedes Gesicht eine eigene, eindeutige Position einnimmt.
Die gezeigte Illustration ist ein Festivalsetting, das aus Begrenzungsrahmen zusammengesetzt ist. Die Bildunterschrift bietet eine Beschreibung des gesamten Bildes, während die Artikeliste jede Box gemäß ihrer ID, Position und ihrem Inhalt aufführt.
- Fr_Text_1: „LE FESTIVAL DU SOLEIL“ in einer dünnen, eleganten Serifenschrift in einer hellcremfarbenen Farbe
- town_1: schwache Lichter und kleine Gebäude einer Küstenstadt am Fuße der Hügel
- dome_1: eine massive, glatte parabolische Kuppel aus hellem Beton
- swimmers_1: Dutzende kleine, verschattete Figuren, verstreut im dunklen Wasser, waten
- crowd_1: eine große Menschenmenge, die am Strand in lockerer, hellfarbener Sommerkleidung sitzt
Verwendung des Playground und der API
Benutzer können das System über zwei Pfade nutzen: den Playground, wo sie Boxen von Hand zeichnen, oder die BFL API, die es ihnen ermöglicht, eine Layout-Anfrage direkt an FLUX 3 zu senden.
Unternehmen gewinnen die Freiheit, das Modell anzupassen und auf ihren eigenen Servern in Betrieb zu nehmen, durch die kommerzielle Gewichts-Lizenz. Black Forest Labs unterstützt diese Bereitstellungen mit Unterstützung.
Häufig gestellte Fragen (Frequently Asked Questions)
Im Folgenden finden Sie einen schnellen Überblick über die Antworten auf häufige Fragen zum Modell, die diese FAQ bilden.
| Frage (Question) | Antwort (Answer) |
|---|---|
| Was ist FLUX 3 Image? (What is FLUX 3 Image?) | FLUX 3 ist das multimodale Modell von Black Forest Labs für Video, Audio, Bilder und Aktionen. FLUX 3 Image ist der Teil, der Bilder generiert und bearbeitet. |
| Wie funktionieren Begrenzungsrahmen? (How do bounding boxes work?) | Ziehen Sie für jedes relevante Element einen Rahmen um ihn herum und beschreiben Sie, was sich darin befindet. Beschreiben Sie dann die Szene in einer Zeile, die die Elemente miteinander verbindet, und FLUX 3 rendert sie mit jedem Element innerhalb seines Rahmens. |
| Wie sieht eine Layout-Aufforderung aus? (What does a layout prompt look like?) | Sie hat zwei Teile: eine globale Bildunterschrift, die das gesamte Bild beschreibt, gefolgt von einer Elementtabelle, einem JSON-Array mit einer Zeile pro Element. |
| Muss ich jeden Rahmen selbst zeichnen? (Do I have to draw every box myself?) | Nein. Geben Sie dem Agenten eine Zeile und ein Seitenverhältnis an, und ein LLM plant das Layout für Sie. |
| Kann ich ein Bild bearbeiten, das ich bereits erstellt habe? | Ja, und Sie können mehrere gezielte Bearbeitungen gleichzeitig vornehmen. Jedes Feld bleibt bearbeitbar. |
| Ändert FLUX 3 die von mir gezeichneten Felder? | Nein. Ein Prompt-Upsampler wandelt Ihre kurze Anfrage in die dichte Bildunterschrift um, auf die FLUX 3 trainiert wurde, aber jedes von Ihnen gezeichnete Feld erreicht das Modell wortwörtlich. |
Das Fazit zu FLUX 3 Image
FLUX 3 Image ist ein leistungsstarkes Werkzeug für Agenten, die Bilder schnell generieren oder bearbeiten müssen. Der Ansatz mit den Begrenzungsfeldern bietet präzise Kontrolle über die Komposition, und die Funktion zur pixelgenauen Bearbeitung bedeutet, dass Sie Änderungen vornehmen können, ohne den Rest des Bildes zu berühren.
Das Design des Systems teilt die Arbeit zwischen zwei Teilen auf: ein Teil lernt, die Anordnung und Komposition von Bildern zu lesen, während der andere die eigentliche Darstellung übernimmt. Das gesamte System basiert auf dieser Trennung.
Eine Lizenz für kommerzielle Gewichte gewährt Unternehmen die Erlaubnis, die Bildgenerierung in großem Maßstab zu betreiben. Jeder, der visuelle Inhalte erstellt, wird feststellen, dass die Mischung aus Genauigkeit und Entscheidungsfreiheit einen Test wert ist.
Das Playground und die BFL-API sind derzeit die beiden Möglichkeiten, auf das System zuzugreifen. Die FAQ behandelt häufige Fragen zum Modell, während die Beispielszene demonstriert, wie die Methode der Begrenzungsfelder in der Praxis funktioniert.
Das Modell reagiert auf die manuelle Erkundung, indem es Ergebnisse liefert, die auf dem basieren, was Benutzer zeichnen und beschriften. Felder werden gezeichnet, Bildunterschriften werden hinzugefügt, und die Ausgabe des Modells folgt.
Sehen Sie sich das 3 Image unter bfl.ai an.
Das Notizbuch abonnieren.
Die besten Geschichten des Tages und jedes neue Urteil, in klarem Deutsch, um sieben im Postfach. Eine Mail am Tag, nicht mehr.

