AI

Qwen выпустила Qwen-Image-3.0 — модель генерирует сложные макеты и текст от 10 пикселей

Qwen представила Qwen-Image-3.0 — третье поколение модели для генерации и редактирования изображений. Она принимает инструкции объёмом до 4,5 тысячи токенов, создаёт сложные композиции за один запрос и, по заявлению разработчиков, воспроизводит читаемый текст размером от 10 пикселей.

Модель доступна в Qwen Studio — в веб-версии, а также в приложениях для iOS, Android, macOS и Windows. Подробнее в материале Postium.

Что умеет нейросеть Qwen-Image-3.0

Модель рассчитана на создание изображений с большим количеством взаимосвязанных элементов: газетных полос, раскадровок, учебных материалов, инфографики и интерфейсов. В анонсе Qwen показала сетку 3 × 3, где в каждой ячейке размещена отдельная сложная схема с текстом, формулами и иллюстрациями. Вся сетка создана одной генерацией по инструкции объёмом 3,7 тысячи токенов.

Qwen-Image-3.0 также умеет строить вложенные композиции. Например, в одном изображении можно задать интерфейс редактора кода, внутри него — окно Qwen Chat, затем мессенджер и постер. По заявлению компании, модель сохраняет структуру и визуальный стиль каждого уровня.

Отдельно Qwen заявляет о более точной прорисовке мелкого текста, формул, дробей, индексов и специальных символов. В примерах модель создавала страницу научной статьи, газетную полосу и рукописные пометки на фотографии книжной страницы.

Для редактирования изображений Qwen-Image-3.0 может добавлять надписи и аннотации, а также восстанавливать утраченные части иллюстраций, сохраняя исходный стиль. В качестве примера компания показала реставрацию традиционной китайской живописи.

Модель поддерживает 12 языков, более 100 художественных стилей, а также генерацию интерфейсов сайтов, игр и трансляций. Qwen также показала создание исследовательской инфографики на основе фотографии насекомого: модель добавила подписи, шкалу, классификацию и увеличенные фрагменты.

Как пользоваться Qwen-Image-3.0

Откройте чат-бот Qwen, выберите режим создания изображения, введите промпт и при необходимости прикрепите исходные изображения.

Для работы через API создайте ключ в Alibaba Cloud Model Studio и укажите в запросе модель qwen-image-3.0-pro.

В один запрос можно включить подробный промпт объёмом до 4,5 тысячи токенов. Например, задать структуру многостраничного макета, тексты, формулы, расположение блоков и стиль.

Для редактирования загрузите исходное изображение и опишите, что нужно изменить: восстановить повреждённый участок, добавить пометки, новые элементы или изменить композицию.

Почему это важно

За последние два дня Alibaba представила Qwen3.8 Max Preview — предварительную флагманскую языковую модель, а также линейку Qwen-Audio-3.0-TTS для озвучивания текста и клонирования голоса. Теперь компания обновила и генератор изображений: Qwen-Image-3.0 делает ставку на создание сложных макетов, работу с мелким текстом и точную передачу визуальных деталей.

Итог

Qwen-Image-3.0 расширяет возможности генерации изображений для создания сложных макетов, инфографики, интерфейсов и редактирования изображений.

Источник

Добавить комментарий

Кнопка «Наверх»