
Календарь продолжается — эксперимент по обучению Stable Diffusion XL на моей авторской серии из 22 календарных иллюстраций, посвящённых праздникам и дням рождения известных личностей.
В основе проекта моя серия из 22 квадратных иллюстраций для календаря, последовательно распределённых по датам с 23 января по 13 февраля. Поводами для изображений становились праздники, памятные даты и дни рождения известных людей.
Главной задачей исходной серии было не буквальное изображение события, а поиск простой визуальной метафоры. Каждый сюжет строился вокруг одного образа или действия: предмет мог менять свою функцию, увеличиваться в масштабе, соединяться с другим объектом или превращаться во что-то неожиданное.
Я хотела проверить, сможет ли модель подхватить не только ограниченную палитру, неровную линию и условных персонажей, но и сам принцип проекта — построение изображения вокруг одной простой визуальной метафоры.

Календарь праздников, иллюстрации с помощью нейросети и человека
Исходная серия
Календарь праздников, ручные иллюстрации
Для обучения я использовала 22 собственные иллюстрации размером 700 × 700 px.
Все изображения были созданы до начала работы с нейросетью и объединены общей визуальной системой: ограниченной палитрой, плоскими цветовыми пятнами, тёмным неровным контуром, упрощёнными персонажами и лаконичной композицией.
Несмотря на разные сюжеты, в серии сохраняется общий принцип: в центре изображения обычно находится одна визуальная ситуация, которая должна считываться быстро, но не быть полностью буквальной.
Календарь праздников с 23 января по 13 февраля, ручные иллюстрации
Подготовка датасета
В датасет вошли только отдельные квадратные иллюстрации без календарной сетки, дат и типографики. Это было сделано специально, чтобы модель обучалась именно на изображениях, а не на оформлении календаря.
Для каждого изображения была автоматически создана текстовая подпись с помощью BLIP. К ней добавлялся общий маркер стиля:
metaphorical flat illustration in KSCALSTYLE style
Автоматические подписи оказались не всегда точными. Особенно сложно модели было описывать изображения, построенные на метафоре: она часто буквально перечисляла предметы и персонажей, не считывая отношения между ними.
Этот этап сам по себе показал разницу между распознаванием объектов и пониманием визуальной идеи.
Обучение модели
Для проекта использовалась Stable Diffusion XL с методом DreamBooth LoRA.
LoRA позволяет дообучить базовую модель на собственном наборе изображений, не переобучая Stable Diffusion целиком. В результате создаётся отдельный небольшой файл весов, который затем подключается к исходной SDXL для генерации.
Обучение проводилось в Google Colab на GPU T4.
Основные параметры первого обучения:
— датасет — 22 изображения;
— разрешение обучения — 512 × 512 px;
— 500 шагов;
— learning rate — 1e-4;
— mixed precision — fp16;
— использовались индивидуальные captions;
— промежуточные checkpoint сохранялись после 250 и 500 шагов.
После 500 шагов был получен файл LoRA pytorch_lora_weights.safetensors.
Генерация
Сравнение стилистики ручных иллюстраций и нейросети
После обучения я стала использовать маркер KSCALSTYLE в новых промптах.
Первые эксперименты показали интересную особенность. Модель довольно быстро переняла внешние признаки серии — цвета, характер линии и тип персонажей, — но сама по себе не всегда продолжала принцип визуальной метафоры.
Например, если в запросе было только название праздника, модель могла создавать декоративную композицию из многочисленных тематических символов.
Поэтому структура промптов постепенно изменилась. Вместо общего: a metaphorical illustration for Valentine’s Day in KSCALSTYLE style
я стала описывать конкретную визуальную ситуацию: two small figures assembling one heart from two separate pieces или:
a person climbing a ladder toward a small moon Дополнительно в промптах использовались формулировки: simple composition, one central visual metaphor, white background. Так генерации стали ближе к композиционному принципу исходной серии.
Итоговая серия
Что модель смогла перенять
Наиболее устойчивым результатом оказалась палитра. В новых изображениях постоянно возвращаются розовый, сиреневый, жёлтый и тёмно-синий цвета исходного проекта.
Хорошо сохранились и другие формальные признаки:
— плоские цветовые пятна;
— тёмный рисованный контур;
— упрощённые человеческие фигуры;
— отсутствие реалистического объёма;
— намеренно немного наивная пластика;
— крупные предметы и изменение привычного масштаба.
В некоторых изображениях модель довольно точно продолжает и композиционный принцип серии: одна фигура взаимодействует с одним сильно увеличенным предметом, и именно это взаимодействие становится метафорой.
Что оказалось сложнее
Хуже всего модель воспроизводит не визуальный стиль, а логику метафоры.
Она может прекрасно повторить палитру и линию, но при слишком общем запросе заменяет метафору набором очевидных символов. Например, тема любви легко превращается в большое количество сердечек, а тема космоса — в декоративный набор планет.
Таким образом, обучение на авторской серии не означает, что модель автоматически усвоила способ придумывания образов.
Для получения наиболее убедительных результатов метафору приходилось сначала сформулировать текстом, а затем просить модель выразить её в изученном визуальном языке.
Это стало одним из основных выводов проекта.
Вариативность результатов




