W skrócie

  • Qwen-Image-3.0, wydany 21 lipca przez zespół Qwen firmy Alibaba, akceptuje 4500 tokenów instrukcji.
  • Umożliwia to jednoprzebiegowe generowanie złożonych układów, takich jak gazety, storyboardy i gęste siatki infografik.
  • W przeciwieństwie do swojego poprzednika, wydanie nie zawierało otwartych wag modelu, benchmarków ani raportu technicznego; jest dostępne na chat.qwen.ai, a ceny API nie zostały jeszcze ujawnione.

Zespół Qwen firmy Alibaba uruchomił we wtorek Qwen Image 3.0, a główna teza nie dotyczy tego, jak pięknie wyglądają wyniki. Chodzi o to, czy wyniki mogą być faktycznie używane w pracy.

Większość narzędzi AI do obrazów—Reve, Nano Banana, Seedream—jest zaprojektowana, aby wyróżniać się w określonych obszarach: kreatywność, realizm, możliwości edycji i tak dalej. Qwen Image 3.0 idzie w innym kierunku. „Qwen-Image-3.0 nie tylko dąży do 'ładnego wyglądu'—dąży do 'użyteczności', czyniąc generowanie obrazów naprawdę wdrażalnym narzędziem produktywności” – napisał zespół Qwen w oficjalnym ogłoszeniu.

Centralnym punktem jest to, co chiński gigant Alibaba nazywa bogatą treścią. Model akceptuje do 4500 tokenów, co jest 4,5 razy więcej niż poprzednia generacja mogła przetworzyć. Tokeny to jednostki tekstu, które czyta AI; wyobraź sobie token jako mniej więcej jedno słowo lub część słowa, więc 4500 z nich to kilka stron szczegółowych instrukcji.

To wystarczy, aby opisać dziewięć oddzielnych paneli infografik w jednym poleceniu i otrzymać je jako jeden kompletny obraz.

„Cały powyższy obraz został wygenerowany przez Qwen-Image-3.0 w jednym przebiegu, a nie złożony z wielu obrazów” – napisał Alibaba na swoim blogu. Każdy panel w demo zawiera własne diagramy, wzory, podpisy i drobny druk – wyrenderowane za jednym razem, a nie składane w postprodukcji.

To jedyny model zdolny do osiągnięcia tego bez większych błędów.

Druga część to to, co firma nazywa autentycznymi szczegółami. Według Alibaby model „wspiera precyzyjne renderowanie tekstu o wielkości zaledwie 10 pikseli, żywo odtwarzając szczegóły takie jak pory i pasma włosów z realistycznym, mikroskopijnym odwzorowaniem”. Dziesięć pikseli to drobny druk – taki, jaki widzisz na ulotkach leków. Model radzi sobie również z LaTeX – systemem notacji używanym przez naukowców do zapisywania złożonych równań matematycznych – dokładnie w całych makietach artykułów akademickich.

W naszych standardowych testach dajemy modelom kilka zdań i oceniamy, jak je przetwarzają. Qwen Image 3.0 był w stanie wygenerować poniższy obraz, zgodnie z oficjalnym blogiem Alibaby.

Przetestowaliśmy tę funkcję, używając najszybszej konfiguracji modelu. Qwen Image 3.0 był w stanie odtworzyć jeden pełny artykuł z Decrypt. Wykonanie było naprawdę imponujące, ale wynik nie był bezbłędny.

Trzecim filarem Qwen Image 3.0 jest głęboka wiedza. Według zespołu Qwen, model „obsługuje natywne renderowanie w 12 językach, symuluje główne interfejsy, takie jak strony internetowe, gry i transmisje na żywo, oraz czerpie z bogatej wiedzy o świecie”. Łączy się również z internetem, aby pobierać dane na żywo, co oznacza, że zapytanie o wizualizację prognozy pogody dla konkretnego miasta i daty zwraca dokładną grafikę, a nie zgadywanie.

Na przykład Alibaba udostępniła zdjęcie owada na liściu. Model był w stanie wygenerować odpowiedni tekst na podstawie zrozumienia obrazu.

Alibaba kieruje swoją ofertę do studiów projektowych, zespołów treści, operacji e-commerce oraz edukatorów, którzy potrzebują gotowych do produkcji zasobów wizualnych w dużych ilościach.

Warto jednak zauważyć, że w własnej ocenie Qwen-Image-Bench firmy Alibaba – benchmarku oceniającym jakość obrazu, estetykę i wierność rzeczywistości w 18 modelach – Qwen Image 2.0 Pro, poprzedni flagowy model, zajął piąte miejsce. Na czele rankingu znalazł się GPT Image 2 od OpenAI. Nowy model może działać lepiej, ale premiera nie oferuje mierzalnego sposobu, aby to potwierdzić, ponieważ pojawił się bez tabeli benchmarków, możliwych do pobrania wag ani raportu technicznego.

Qwen Image 1.0 został wydany z otwartymi wagami na licencji Apache 2.0 i z raportem technicznym tego samego dnia. Ten model nie. W ramach ostatniego nacisku AI Alibaby, dowody tutaj to wyłącznie starannie wybrane przykładowe obrazy, które firma zdecydowała się opublikować. Próby API są dostępne na chat.qwen.ai. Ceny nie zostały ogłoszone.