Кратко
- Qwen-Image-3.0, выпущенная 21 июля командой Qwen от Alibaba, принимает 4500 токенов инструкций.
- Это позволяет за один проход генерировать сложные макеты, такие как газеты, раскадровки и плотные сетки инфографики.
- В отличие от своего предшественника, релиз был выпущен без открытых весов модели, бенчмарков или технического отчета; он доступен на chat.qwen.ai, цены на API пока не раскрыты.
Команда Qwen из Alibaba запустила Qwen Image 3.0 во вторник, и основная идея не связана с тем, насколько красивым выглядит результат. Речь идет о том, можно ли результат использовать в работе.
Большинство инструментов для создания изображений с ИИ — Reve, Nano Banana, Seedream — предназначены для достижения успеха в определенных областях: креативность, реалистичность, возможности редактирования и так далее. Qwen Image 3.0 идет в другом направлении. «Qwen-Image-3.0 стремится не просто к „красивому“ — он стремится к „полезному“, делая генерацию изображений по-настоящему развертываемым инструментом производительности», — написали в команде Qwen в официальном объявлении.
Центральным элементом является то, что китайский гигант Alibaba называет богатым контентом. Модель принимает до 4500 токенов, что в 4,5 раза больше, чем могла обработать предыдущая версия. Токены — это единицы текста, которые читает ИИ; представьте токен как примерно одно слово или часть слова, так что 4500 токенов — это несколько страниц подробных инструкций.
Этого достаточно, чтобы описать девять отдельных панелей инфографики в одном запросе и получить их в виде одного цельного изображения.

«Все изображение выше было сгенерировано Qwen-Image-3.0 за один проход, а не собрано из нескольких изображений», — написал Alibaba в своем блоге. Каждая панель в демонстрации содержит собственные диаграммы, формулы, подписи и мелкий текст — все это отображается за один раз, а не собирается постфактум.
Это единственная модель, способная достичь этого без серьезных ошибок.
Вторая часть — это то, что компания называет аутентичными деталями. По словам Alibaba, модель «поддерживает точное отображение текста размером до 10 пикселей, живо воспроизводя такие детали, как поры и волоски, с реалистичной микроскопической прорисовкой». Десять пикселей — это мелкий шрифт, который можно увидеть в фармацевтических предупреждениях. Модель также точно обрабатывает LaTeX — систему обозначений, используемую исследователями для записи сложных математических уравнений, — в полных макетах академических статей.
В наших обычных тестах мы даем моделям несколько предложений и оцениваем, как они их обрабатывают. Qwen Image 3.0 смог сгенерировать изображение ниже, согласно официальному блогу Alibaba.

Мы опробовали эту функцию, используя самую быструю конфигурацию модели. Qwen Image 3.0 смог воспроизвести одну полную статью из Decrypt. Выполнение было действительно впечатляющим, но результат не был безупречным.

Третья опора Qwen Image 3.0 — глубокие знания. По словам команды Qwen, модель «поддерживает нативное отображение 12 языков, симулирует основные интерфейсы, такие как веб-страницы, игры и прямые трансляции, и опирается на богатые мировые знания». Она также подключается к интернету для получения актуальных данных, что означает, что запрос визуализации прогноза погоды для конкретного города и даты возвращает точное изображение, а не догадку.
Например, Alibaba поделилась фотографией насекомого на листе. Модель смогла сгенерировать соответствующий текст на основе своего понимания изображения.

Alibaba нацеливается на дизайн-студии, контент-команды, операторов электронной коммерции и преподавателей, которым нужны готовые к производству визуальные ресурсы в больших объемах.
Однако стоит отметить, что в собственной оценке Alibaba Qwen-Image-Bench — бенчмарке, оценивающем качество изображений, эстетику и реалистичность 18 моделей, — Qwen Image 2.0 Pro, предыдущий флагман, занял пятое место. Лидировал GPT Image 2 от OpenAI. Новая модель может работать лучше, но запуск не предоставляет измеримого способа это подтвердить, поскольку он состоялся без таблицы бенчмарков, загружаемых весов или технического отчета.
Qwen Image 1.0 был запущен с открытыми весами по лицензии Apache 2.0 и техническим отчетом в тот же день. Этот — нет. В рамках недавнего продвижения ИИ от Alibaba доказательства здесь полностью состоят из выборочных примеров изображений, которые компания решила опубликовать. Пробные версии API доступны на chat.qwen.ai. Цены еще не объявлены.




