Kurzfassung
- Qwen-Image-3.0, veröffentlicht am 21. Juli vom Qwen-Team von Alibaba, akzeptiert 4.500 Token an Anweisungen.
- Dies ermöglicht die einmalige Generierung komplexer Layouts wie Zeitungen, Storyboards und dichter Infografik-Raster.
- Im Gegensatz zu seinem Vorgänger wurde die Veröffentlichung ohne offene Modellgewichte, Benchmarks oder einen technischen Bericht ausgeliefert; es ist unter chat.qwen.ai verfügbar, die API-Preise wurden noch nicht bekannt gegeben.
Das Qwen-Team von Alibaba hat am Dienstag Qwen Image 3.0 gestartet, und das Verkaufsargument hat nichts damit zu tun, wie schön die Ausgabe aussieht. Es geht darum, ob die Ausgabe tatsächlich bei der Arbeit verwendet werden kann.
Die meisten KI-Bildtools – Reve, Nano Banana, Seedream – sind darauf ausgelegt, in bestimmten Bereichen zu glänzen: Kreativität, Realismus, Bearbeitungsfähigkeiten und so weiter. Qwen Image 3.0 geht in eine andere Richtung. „Qwen-Image-3.0 verfolgt nicht nur ‚gut aussehend‘ – es verfolgt ‚nützlich‘ und macht die Bildgenerierung zu einem wirklich einsetzbaren Produktivitätstool“, schrieb das Qwen-Team in der offiziellen Ankündigung.
Das Herzstück ist das, was der chinesische Gigant Alibaba als reichhaltigen Inhalt bezeichnet. Das Modell akzeptiert bis zu 4.500 Token, das 4,5-fache dessen, was die vorherige Generation verarbeiten konnte. Token sind die Texteinheiten, die eine KI liest; stellen Sie sich einen Token als etwa ein Wort oder einen Teil eines Wortes vor, also entsprechen 4.500 Token mehreren Seiten detaillierter Anweisungen.
Das reicht aus, um neun separate Infografik-Panels in einer einzigen Aufforderung zu beschreiben und sie als ein vollständiges Bild zurückzuerhalten.

„Das gesamte Bild oben wurde von Qwen-Image-3.0 in einem einzigen Durchgang generiert, nicht aus mehreren Bildern zusammengesetzt“, schrieb Alibaba in seinem Blog. Jedes Panel in der Demo enthält eigene Diagramme, Formeln, Bildunterschriften und Kleingedrucktes – alles in einem Durchgang gerendert, nicht nachträglich zusammengesetzt.
Dies ist das einzige Modell, das dies ohne größere Fehler erreichen kann.
Der zweite Teil ist das, was das Unternehmen als authentische Details bezeichnet. Laut Alibaba „unterstützt das Modell die präzise Darstellung von Text, der nur 10 Pixel groß ist, und gibt Details wie Poren und Haarsträhnen lebensecht und auf mikroskopischer Ebene wieder.“ Zehn Pixel sind Kleingedrucktes – wie man es auf pharmazeutischen Haftungsausschlüssen sieht. Das Modell verarbeitet auch LaTeX – das Notationssystem, das Forscher zum Schreiben komplexer mathematischer Gleichungen verwenden – präzise in vollständigen akademischen Papierentwürfen.
In unseren üblichen Tests geben wir Modellen ein paar Sätze und bewerten, wie sie diese verarbeiten. Qwen Image 3.0 war in der Lage, das folgende Bild zu generieren, so Alibabas offizieller Blog.

Wir haben diese Funktion mit der schnellsten Konfiguration des Modells getestet. Qwen Image 3.0 konnte einen vollständigen Artikel von Decrypt reproduzieren. Die Ausführung war wirklich beeindruckend, aber das Ergebnis war nicht fehlerfrei.

Die dritte Säule von Qwen Image 3.0 ist tiefes Wissen. Laut dem Qwen-Team „unterstützt das Modell die native Darstellung von 12 Sprachen, simuliert gängige Oberflächen wie Webseiten, Spiele und Livestreams und greift auf umfangreiches Weltwissen zurück.“ Es verbindet sich auch mit dem Internet, um Live-Daten abzurufen, sodass eine Aufforderung zur Erstellung einer Wettervorhersagegrafik für eine bestimmte Stadt und ein bestimmtes Datum eine genaue Grafik zurückgibt, keine Schätzung.
Zum Beispiel teilte Alibaba ein Foto eines Insekts auf einem Blatt. Das Modell konnte basierend auf seinem Verständnis des Bildes relevanten Text generieren.

Alibaba richtet sich an Designstudios, Content-Teams, E-Commerce-Betreiber und Pädagogen, die produktionsreife visuelle Assets in großen Mengen benötigen.
Es ist jedoch erwähnenswert, dass in Alibabas eigenem Qwen-Image-Bench-Evaluierung – einem Benchmark, der Bildqualität, Ästhetik und Realitätstreue über 18 Modelle hinweg bewertet – Qwen Image 2.0 Pro, das vorherige Flaggschiff, den fünften Platz belegte. OpenAI's GPT Image 2 führte die Rangliste an. Das neue Modell könnte besser abschneiden, aber der Launch bietet keine messbare Möglichkeit, dies zu bestätigen, da er ohne Benchmark-Tabelle, herunterladbare Gewichte oder technischen Bericht auskam.
Qwen Image 1.0 wurde mit offenen Gewichten unter einer Apache-2.0-Lizenz und einem technischen Bericht am selben Tag veröffentlicht. Dieses Modell nicht. Im Rahmen von Alibabas jüngstem KI-Vorstoß basieren die Belege hier ausschließlich auf den handverlesenen Beispielbildern, die das Unternehmen veröffentlicht hat. API-Tests sind unter chat.qwen.ai verfügbar. Die Preisgestaltung wurde noch nicht bekannt gegeben.




