Qwen-Image-3.0: генерация картинок, которая держит мелкий текст и сложную вёрстку
Alibaba выпустила третье поколение Qwen-Image: промпт до 4,5 тысячи токенов, текст от 10 пикселей, 12 языков и редактирование готовых изображений. Разбираем на примерах из анонса и показываем, где это экономит время.

21 июля Alibaba выпустила Qwen-Image-3.0 — третье поколение своей модели генерации изображений. Если первая версия была про точность, а вторая добавила разнообразие и красоту, то третья заявлена одним иероглифом — 实, «реальное». Речь не о том, чтобы картинка была красивой, а о том, чтобы её можно было сразу пустить в работу: газетная полоса с читаемым текстом, инфографика с подписями, страница научной статьи с формулами, макет интерфейса. Разбираем, что именно изменилось, на примерах из официального анонса.

Три вещи, ради которых стоит смотреть на 3.0
Богатое содержимое. Модель принимает промпт длиной до 4,5 тысячи токенов и раскладывает его в сложную композицию — газету, раскадровку, экзаменационный лист.
Достоверные детали. Точная отрисовка текста от 10 пикселей, проработка пор кожи и отдельных волосков.
Глубокие знания. Нативная поддержка 12 языков, 20 начертаний, больше сотни художественных стилей и знание того, как выглядят реальные интерфейсы — сайты, игры, стримы.
Смысл обновления в том, что генерация картинок перестаёт быть про «красиво» и становится про «пригодно к работе».
Богатое содержимое: сколько всего влезает в один кадр
Начнём с картинки — это слайд по математике, сгенерированный целиком: и формулы, и чертёж, и подписи, и взаимное расположение объектов.

Выглядит убедительно, но это ещё не главное. На самом деле перед вами одна девятая настоящего результата: слайд — лишь одна ячейка сетки 3×3, которую модель нарисовала за один проход, а не собрала из отдельных картинок.

Каждая ячейка — самостоятельная инфографика: комикс по технике безопасности в тоннеле, урок стереометрии, разбор классического текста, физика баллистического движения, биология паразитов, медицинская схема боли в правом боку, теоремы Силова из теории групп, схема банковского внутреннего контроля и сравнение структур ДНК. На точное описание всей сетки ушло 3,7 тысячи токенов промпта — и модель удержала их без взаимных помех между ячейками.
Это и называется горизонтальным расширением: сколько параллельных смыслов помещается на одном холсте. Есть и вертикальное — вложенность. Ниже один промпт развернулся в четыре слоя: интерфейс VSCode, внутри него Qwen Chat, внутри — мессенджер, а в нём постер про кофе. Каждый слой сохраняет собственную стилистику.

Достоверные детали: мелкий текст и фактура
Если предыдущий блок отвечал на вопрос «сколько нарисовать», то этот — «насколько мелко». Начнём с текста. Вот справочная инфографика про китовую акулу: подписи, выноски, схемы — всё читается.

Более жёсткая проверка — страница научной статьи. Формулы LaTeX, верхние и нижние индексы, греческие буквы, нумерация теорем: ошибка в одном символе сразу заметна.

И совсем другой жанр — газетная полоса. Здесь модель не только набирает плотный текст, но и имитирует саму фактуру газеты: бумагу, тени, заломы.

Мелкий текст работает и в режиме редактирования. На развороте книги модель дорисовала пометки от руки — подчёркивания, волнистые линии, стрелки, короткие комментарии красной ручкой.

До редактирования

После: пометки выглядят как настоящие конспекты
Вторая сторона достоверности — фактура. На портретах видно поры, отдельные волоски и естественный рельеф кожи.


То же и с предметной съёмкой: материал, блики, микрорельеф.




Детализация не теряется и при работе с референсами: по нескольким исходным картинкам собирается одна сцена.




Результат по трём референсам
Отдельный сценарий — реставрация. Модели дали повреждённую традиционную живопись, и она достроила утраченные фрагменты, сохранив манеру письма: градиенты туши, фактуру перьев и композиционный баланс, а пятна плесени и следы разрушения убрала.

До

После
Глубокие знания: языки, интерфейсы, реальный мир
Третья ось — насколько широко модель понимает мир. Заявлены 12 языков, 20 начертаний и больше сотни художественных стилей. В примерах ниже — японский, корейский и испанский.



Знание мира проявляется и в интерфейсах: модель воспроизводит узнаваемые макеты сайтов, приложений и игровых экранов вместе с их логикой — панелями, кнопками, типичными отступами.


Отсюда вырастает практичный сценарий: превратить обычную фотографию в научную иллюстрацию. Из снимка насекомого модель собрала готовую для публикации фигуру — с таксономией, морфологическими выносками, увеличенными фрагментами и масштабной линейкой.

Исходное фото

Результат: фигура, пригодная для публикации
Кроме собственных знаний, модель умеет обращаться к интернету за актуальными данными — например, нарисовать карточку прогноза погоды на конкретный день.

И работать с узнаваемыми персонажами: вот Ци Байши и Ван Гог ведут стрим про Qwen-Image-3.0.

Где это пригодится на практике
Из трёх заявленных свойств складывается вполне конкретный список задач, где модель экономит время дизайнера:
Карточки товаров и баннеры с текстом — надписи, цены и бейджи можно задавать прямо в промпте, а не набирать поверх картинки в редакторе.
Обучающие материалы — схемы, плакаты, разборы с подписями и формулами.
Раскадровки и сториборды — несколько сцен в одной сетке за один запрос.
Макеты интерфейсов для презентаций и концептов.
Правка готовых изображений — дорисовать элемент, восстановить повреждённый скан, добавить аннотации к фотографии.
Главный практический приём — не описывать надписи приблизительно. Текст, который должен появиться в кадре, пишите дословно и в кавычках, а расположение задавайте явно: «в верхней трети», «под заголовком», «в правом нижнем углу». Ниже два примера, которые можно скопировать и запустить.
Product card for an online store, 4:5 vertical composition. A matte ceramic coffee mug in warm beige stands on a light concrete surface, soft daylight from the left, gentle shadow. Top left corner: bold headline text "SPECIAL PRICE" in dark grey. Under the mug, centered: price text "1 490 ₽" in large bold type, with crossed-out "1 990 ₽" in smaller grey type next to it. Bottom right: small badge with text "FREE DELIVERY" in white on a blue rounded rectangle. Clean minimal e-commerce style, sharp focus on the mug, plenty of empty space, no extra text anywhere else.
Educational infographic poster, A3 vertical layout, clean flat vector style on off-white background. Title at the top: "THE WATER CYCLE". Center: a large circular diagram with four labeled stages arranged clockwise — "EVAPORATION", "CONDENSATION", "PRECIPITATION", "COLLECTION" — connected by curved blue arrows, each stage illustrated with a simple icon (sun over sea, cloud, rain, river). Left column: three short explanatory paragraphs in small legible type. Bottom: a horizontal scale bar with numbered steps 1 to 4. Muted blue and grey palette, thin outlines, consistent icon style, all text sharp and readable.
Как попробовать в Smartluvon
Обе версии модели уже подключены в Smartluvon — регистрироваться на платформе Alibaba и разбираться с API не нужно:
Модель | Цена | Для чего |
|---|---|---|
Qwen Image 3.0 Pro | 4 токена за генерацию | Флагман: сложные композиции, мелкий текст, вывод до 2K |
Qwen Image 3.0 | 3 токена за генерацию | Быстрее и дешевле, для повседневных задач |
Обе работают и на генерацию с нуля, и на редактирование: можно приложить до трёх референсов — исходное фото, пример стиля, образец объекта — и попросить внести правки. Разрешение выбирается между 1K и 2K, соотношение сторон — от квадрата до вертикали и горизонтали; в режиме «Авто» формат берётся из вашей исходной картинки.
Коротко
Qwen-Image-3.0 — про пригодность к работе: мелкий текст, плотная вёрстка, инфографика и интерфейсы, а не только красивая картинка.
Промпт до 4,5 тысячи токенов позволяет описать сложную композицию целиком — вплоть до сетки из девяти разных инфографик за один проход.
Текст отрисовывается от 10 пикселей, поддерживается 12 языков нативно.
Редактирование сохраняет манеру и фактуру исходника — от пометок на полях до реставрации повреждённой живописи.
Надписи в промпте задавайте дословно и в кавычках, а их расположение — явно.

