Все статьи

Qwen-Image-3.0: генерация картинок, которая держит мелкий текст и сложную вёрстку

Alibaba выпустила третье поколение Qwen-Image: промпт до 4,5 тысячи токенов, текст от 10 пикселей, 12 языков и редактирование готовых изображений. Разбираем на примерах из анонса и показываем, где это экономит время.

Qwen-Image-3.0: генерация картинок, которая держит мелкий текст и сложную вёрстку

21 июля Alibaba выпустила Qwen-Image-3.0 — третье поколение своей модели генерации изображений. Если первая версия была про точность, а вторая добавила разнообразие и красоту, то третья заявлена одним иероглифом — 实, «реальное». Речь не о том, чтобы картинка была красивой, а о том, чтобы её можно было сразу пустить в работу: газетная полоса с читаемым текстом, инфографика с подписями, страница научной статьи с формулами, макет интерфейса. Разбираем, что именно изменилось, на примерах из официального анонса.

Анонс Qwen-Image-3.0

Три вещи, ради которых стоит смотреть на 3.0

  • Богатое содержимое. Модель принимает промпт длиной до 4,5 тысячи токенов и раскладывает его в сложную композицию — газету, раскадровку, экзаменационный лист.

  • Достоверные детали. Точная отрисовка текста от 10 пикселей, проработка пор кожи и отдельных волосков.

  • Глубокие знания. Нативная поддержка 12 языков, 20 начертаний, больше сотни художественных стилей и знание того, как выглядят реальные интерфейсы — сайты, игры, стримы.

Смысл обновления в том, что генерация картинок перестаёт быть про «красиво» и становится про «пригодно к работе».

Богатое содержимое: сколько всего влезает в один кадр

Начнём с картинки — это слайд по математике, сгенерированный целиком: и формулы, и чертёж, и подписи, и взаимное расположение объектов.

Сгенерированный слайд по математике с формулами и чертежом

Выглядит убедительно, но это ещё не главное. На самом деле перед вами одна девятая настоящего результата: слайд — лишь одна ячейка сетки 3×3, которую модель нарисовала за один проход, а не собрала из отдельных картинок.

Сетка 3×3 из девяти сложных инфографик, сгенерированная за один проход

Каждая ячейка — самостоятельная инфографика: комикс по технике безопасности в тоннеле, урок стереометрии, разбор классического текста, физика баллистического движения, биология паразитов, медицинская схема боли в правом боку, теоремы Силова из теории групп, схема банковского внутреннего контроля и сравнение структур ДНК. На точное описание всей сетки ушло 3,7 тысячи токенов промпта — и модель удержала их без взаимных помех между ячейками.

Это и называется горизонтальным расширением: сколько параллельных смыслов помещается на одном холсте. Есть и вертикальное — вложенность. Ниже один промпт развернулся в четыре слоя: интерфейс VSCode, внутри него Qwen Chat, внутри — мессенджер, а в нём постер про кофе. Каждый слой сохраняет собственную стилистику.

Четыре вложенных интерфейса в одном изображении

Достоверные детали: мелкий текст и фактура

Если предыдущий блок отвечал на вопрос «сколько нарисовать», то этот — «насколько мелко». Начнём с текста. Вот справочная инфографика про китовую акулу: подписи, выноски, схемы — всё читается.

Инфографика про китовую акулу с множеством подписей

Более жёсткая проверка — страница научной статьи. Формулы LaTeX, верхние и нижние индексы, греческие буквы, нумерация теорем: ошибка в одном символе сразу заметна.

Страница научной статьи по алгебраической геометрии с формулами

И совсем другой жанр — газетная полоса. Здесь модель не только набирает плотный текст, но и имитирует саму фактуру газеты: бумагу, тени, заломы.

Сгенерированная газетная полоса с плотным текстом

Мелкий текст работает и в режиме редактирования. На развороте книги модель дорисовала пометки от руки — подчёркивания, волнистые линии, стрелки, короткие комментарии красной ручкой.

Разворот книги до редактирования

До редактирования

Тот же разворот с дорисованными пометками от руки

После: пометки выглядят как настоящие конспекты

Вторая сторона достоверности — фактура. На портретах видно поры, отдельные волоски и естественный рельеф кожи.

Портрет с детальной проработкой кожи и волосВторой портретный пример

То же и с предметной съёмкой: материал, блики, микрорельеф.

Предметный кадр с детальной фактуройПредметный кадр с детальной фактуройПредметный кадр с детальной фактуройПредметный кадр с детальной фактурой

Детализация не теряется и при работе с референсами: по нескольким исходным картинкам собирается одна сцена.

Референс 1Референс 2Референс 3Результат: сцена, собранная по трём референсам

Результат по трём референсам

Отдельный сценарий — реставрация. Модели дали повреждённую традиционную живопись, и она достроила утраченные фрагменты, сохранив манеру письма: градиенты туши, фактуру перьев и композиционный баланс, а пятна плесени и следы разрушения убрала.

Повреждённая традиционная картина до реставрации

До

Та же картина после восстановления

После

Глубокие знания: языки, интерфейсы, реальный мир

Третья ось — насколько широко модель понимает мир. Заявлены 12 языков, 20 начертаний и больше сотни художественных стилей. В примерах ниже — японский, корейский и испанский.

Пример текста на японскомПример текста на корейскомПример текста на испанском

Знание мира проявляется и в интерфейсах: модель воспроизводит узнаваемые макеты сайтов, приложений и игровых экранов вместе с их логикой — панелями, кнопками, типичными отступами.

Сгенерированный интерфейсЕщё один сгенерированный интерфейс

Отсюда вырастает практичный сценарий: превратить обычную фотографию в научную иллюстрацию. Из снимка насекомого модель собрала готовую для публикации фигуру — с таксономией, морфологическими выносками, увеличенными фрагментами и масштабной линейкой.

Исходная фотография насекомого

Исходное фото

Научная иллюстрация с выносками и масштабной линейкой

Результат: фигура, пригодная для публикации

Кроме собственных знаний, модель умеет обращаться к интернету за актуальными данными — например, нарисовать карточку прогноза погоды на конкретный день.

Сгенерированная карточка прогноза погоды

И работать с узнаваемыми персонажами: вот Ци Байши и Ван Гог ведут стрим про Qwen-Image-3.0.

Ци Байши и Ван Гог в стриме

Где это пригодится на практике

Из трёх заявленных свойств складывается вполне конкретный список задач, где модель экономит время дизайнера:

  • Карточки товаров и баннеры с текстом — надписи, цены и бейджи можно задавать прямо в промпте, а не набирать поверх картинки в редакторе.

  • Обучающие материалы — схемы, плакаты, разборы с подписями и формулами.

  • Раскадровки и сториборды — несколько сцен в одной сетке за один запрос.

  • Макеты интерфейсов для презентаций и концептов.

  • Правка готовых изображений — дорисовать элемент, восстановить повреждённый скан, добавить аннотации к фотографии.

Главный практический приём — не описывать надписи приблизительно. Текст, который должен появиться в кадре, пишите дословно и в кавычках, а расположение задавайте явно: «в верхней трети», «под заголовком», «в правом нижнем углу». Ниже два примера, которые можно скопировать и запустить.

Карточка товара с надписями
Product card for an online store, 4:5 vertical composition. A matte ceramic coffee mug in warm beige stands on a light concrete surface, soft daylight from the left, gentle shadow. Top left corner: bold headline text "SPECIAL PRICE" in dark grey. Under the mug, centered: price text "1 490 ₽" in large bold type, with crossed-out "1 990 ₽" in smaller grey type next to it. Bottom right: small badge with text "FREE DELIVERY" in white on a blue rounded rectangle. Clean minimal e-commerce style, sharp focus on the mug, plenty of empty space, no extra text anywhere else.
Обучающий плакат со схемой
Educational infographic poster, A3 vertical layout, clean flat vector style on off-white background. Title at the top: "THE WATER CYCLE". Center: a large circular diagram with four labeled stages arranged clockwise — "EVAPORATION", "CONDENSATION", "PRECIPITATION", "COLLECTION" — connected by curved blue arrows, each stage illustrated with a simple icon (sun over sea, cloud, rain, river). Left column: three short explanatory paragraphs in small legible type. Bottom: a horizontal scale bar with numbered steps 1 to 4. Muted blue and grey palette, thin outlines, consistent icon style, all text sharp and readable.

Как попробовать в Smartluvon

Обе версии модели уже подключены в Smartluvon — регистрироваться на платформе Alibaba и разбираться с API не нужно:

Модель

Цена

Для чего

Qwen Image 3.0 Pro

4 токена за генерацию

Флагман: сложные композиции, мелкий текст, вывод до 2K

Qwen Image 3.0

3 токена за генерацию

Быстрее и дешевле, для повседневных задач

Обе работают и на генерацию с нуля, и на редактирование: можно приложить до трёх референсов — исходное фото, пример стиля, образец объекта — и попросить внести правки. Разрешение выбирается между 1K и 2K, соотношение сторон — от квадрата до вертикали и горизонтали; в режиме «Авто» формат берётся из вашей исходной картинки.

Коротко

  • Qwen-Image-3.0 — про пригодность к работе: мелкий текст, плотная вёрстка, инфографика и интерфейсы, а не только красивая картинка.

  • Промпт до 4,5 тысячи токенов позволяет описать сложную композицию целиком — вплоть до сетки из девяти разных инфографик за один проход.

  • Текст отрисовывается от 10 пикселей, поддерживается 12 языков нативно.

  • Редактирование сохраняет манеру и фактуру исходника — от пометок на полях до реставрации повреждённой живописи.

  • Надписи в промпте задавайте дословно и в кавычках, а их расположение — явно.

Читайте также

10 стилей анимации в Seedance 2.5: от пластилина до восковых мелков
Гайды

10 стилей анимации в Seedance 2.5: от пластилина до восковых мелков

Разбираем десять визуальных направлений для Seedance 2.5 — от гравюрного кубизма и деревянных кукол до силикона и восковых мелков. С готовыми видео и практической схемой промпта.

·5 мин
Как писать промпты для Seedance 2.5: официальный гайд на русском
Гайды

Как писать промпты для Seedance 2.5: официальный гайд на русском

Перевели официальный prompt guide ByteDance для Seedance 2.5: какие задачи фиксируют формат ролика, сколько референсов подавать, как размечать таймкоды и что писать при редактировании. Внутри — 12 рабочих промптов и примеры с видео.

·16 мин