Исходный размер 795x1118

Обучение генеративной модели авторскому языку fashion-иллюстрации

Проект принимает участие в конкурсе

Концепция

Исходной точкой создания проекта стала серия иллюстраций, созданная в рамках исследования истории костюма 1800–1990 гг. Основной задачей было изучение того, как на протяжении почти двух столетий менялись силуэт, пропорции и характерные элементы одежды.

post

Несмотря на различия между эпохами, изображения объединены одинаковым принципом стилизации: акцентом на силуэте, преувеличенными объёмами, упрощённой фигурой, контрастным контуром и ограниченной цветовой палитрой. Благодаря этому исторический костюм рассматривается не как набор отдельных вещей, а как последовательность трансформаций формы человеческого тела посредством одежды. При этом характерные особенности каждой эпохи сохраняются, но переводятся в общую визуальную систему. Серия позволяет проследить изменения пропорций и объёмов костюма, одновременно выявляя повторяющиеся формы и элементы, которые возникают в разные исторические периоды.

В данном проекте я продолжаю работу с этой серией, используя созданные иллюстрации для обучения генеративной нейросети. На их основе модель осваивает характерный визуальный язык серии — особенности силуэтов, пропорций, линий и стилизации — и применяет его при создании новых изображений.

Исходные изображения

big
Исходный размер 2108x1154

Описание процесса обучения

В качестве основы была выбрана генеративная модель Stable Diffusion XL (SDXL). Вместо полного переобучения модели использовался метод LoRA, позволяющий дообучить уже существующую модель на небольшом авторском датасете и передать ей его характерные визуальные особенности.

post
  1. Настройка среды
    Работа начинается с подготовки среды Google Colab и проверки доступности видеокарты. Устанавливаются библиотеки, необходимые для работы с генеративной моделью: Diffusers, Transformers, Accelerate, PEFT и BitsAndBytes.
    Дополнительно загружается скрипт train_dreambooth_lora_sdxl.py, предназначенный для дообучения Stable Diffusion XL методом DreamBooth + LoRA.
post
  1. Формирование датасета
    Для обучающих изображений создаётся отдельная директория my_drawings. В неё загружаются авторские иллюстрации, которые становятся исходным датасетом модели.
    После загрузки изображения собираются в единую выборку и выводятся в виде превью, что позволяет проверить содержимое датасета перед началом обучения.
post
  1. Создание описаний изображений
    Следующий этап — создание текстовых описаний для каждого изображения. Для этого используется модель BLIP Image Captioning.
    BLIP анализирует каждую иллюстрацию и автоматически генерирует caption — текстовое описание её содержания. Таким образом формируются пары:
    изображение ↔ текстовое описание
post
  1. Создание идентификатора IRNSTYLE
    К автоматически созданным описаниям добавляется общий префикс:
    in the IRNSTYLE style,
    Слово IRNSTYLE используется как специальный идентификатор обучаемого визуального языка. Например, итоговая подпись строится по принципу:
    in the IRNSTYLE style, + описание изображения
post
  1. Запускается основной процесс обучения.
    Изображения обрабатываются в разрешении 512 × 512 px, размер batch составляет 2 изображения, скорость обучения — 1e-4, а весь процесс рассчитан на 500 шагов.
    Для уменьшения нагрузки на GPU используются fp16, gradient checkpointing и 8-bit Adam.
    Контрольные версии модели сохраняются каждые 250 шагов, поэтому появляются checkpoint-250 и checkpoint-500. Полученные данные сохраняются в директории IRNSTYLE_LoRA.
post
  1. Генерация
    Формируется текстовый запрос. Например:
    in IRNSTYLE style, fashion illustration of a woman wearing a dramatic voluminous dress.
    В запросе IRNSTYLE вызывает изученный визуальный язык, а остальная часть prompt задаёт содержание нового изображения — силуэт, одежду, объёмы и другие характеристики.
    После этого генерируется изображение.

Сгенерированные изображения

Исходный размер 1024x1024

prompt = «in IRNSTYLE style, fashion illustration of a woman wearing a dramatic voluminous dress with huge puff sleeves, front view»

Исходный размер 1024x1024

prompt = «in IRNSTYLE style, fashion illustration of a woman wearing an oversized Victorian inspired dress with a wide skirt and large sleeves, upper body composition»

Исходный размер 1024x1024

prompt = «in IRNSTYLE style, fashion illustration of a woman wearing a romantic dress with a large white Peter Pan collar and balloon sleeves, front view»

Исходный размер 1024x1024

prompt = «in IRNSTYLE style, fashion illustration of a woman wearing a structured dress with exaggerated shoulders and a narrow waist, three quarter view»

Исходный размер 1024x1024

prompt = «in IRNSTYLE style, fashion illustration of a woman wearing a dramatic striped gown with an enormous skirt and sculptural sleeves, seated pose»

Исходный размер 1024x1024

prompt = «in IRNSTYLE style, with light blue colors, fashion illustration of a woman wearing a dress with an off shoulder ruffled neckline and long fitted sleeves, elegant pose»

Исходный размер 1024x1024
Обучение генеративной модели авторскому языку fashion-иллюстрации
Проект создан 26.09.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше