
Знакомая ситуация: вы пишете подробный промпт — «девушка сидит на скамейке в парке, закат, кинематографический свет» — а Stable Diffusion выдаёт что-то своё. Поза не та, скамейка уехала за кадр, вместо заката — полдень. Обычная текстовая генерация — лотерея: можно менять seed и перегенерировать десятки вариантов, но композицию сеть каждый раз рисует по-своему.
ControlNet превращает эту лотерею в работу с пультом управления. Вы задаёте референс — скелет с нужной позой, контур рисунка, карту глубины сцены или планировку комнаты — и нейросеть повторяет геометрию кадра точно, а промпт лишь описывает, чем её наполнить. Поза, перспектива и композиция оказываются под вашим контролем, а не под капризами генератора.
В этом гайде разберём, что такое ControlNet в Stable Diffusion и как он работает, какие бывают типы управления, где его взять и как включить, а также пройдём три практических сценария — от «как заставить нейросеть повторить позу» с фотографии до смены стиля интерьера с сохранением планировки.
Объясним ControlNet для чайников, без формул: это бесплатная надстройка к Stable Diffusion, которая показывает нейросети каркас будущей картинки.
Обычная генерация: промпт → сеть фантазирует → результат. С ControlNet добавляется второй вход — референс-каркас. Процесс становится таким: промпт + каркас → сеть фантазирует только внутри рамок → результат, совпадающий с замыслом.
Работает принцип «разделим обязанности»:
Например, вы отдаёте сети фото с нужной позой. ControlNet извлекает из него скелет — только позу, без лица, одежды и фона — и на каждом шаге генерации подталкивает диффузионную модель: «человек стоит именно так». А промпт в это время решает, кто этот человек, во что одет и где находится. Итог — предсказуемая композиция вместо случайной.
Технически ControlNet — это набор обученных модулей, подключённых к слоям основной модели и мягко «придерживающих» её в сторону нужной геометрии. Для практической работы знать это не обязательно: каркас задаёт референс, содержание — промпт.
За разные задачи отвечают разные типы ControlNet. Основные для Stable Diffusion 3.5 в 2026 году:
| Тип | Что контролирует | Когда использовать |
|---|---|---|
| OpenPose | Позу человека — скелет из точек и «костей» | Повторить позу с фото, поставить персонажа в нужное положение, сцены с несколькими фигурами |
| Canny / Lineart | Контуры и линии объектов | Превратить набросок или фото в картинку, сохранив форму; перерисовать эскиз в готовый арт |
| Depth | Глубину сцены и расположение объектов в пространстве | Сохранить объём и перспективу: передний план, средний, дальний |
| Scribble | Грубый набросок от руки | Быстро накидать композицию мышкой или стилусом и получить детализированную картинку |
| Segmentation | Зоны объектов: где небо, где вода, где человек | Жёстко задать планировку сцены по областям — интерьеры, пейзажи |
Как выбрать:
Типы комбинируются: Depth для общей геометрии сцены + OpenPose для фигуры персонажа — частая связка. И ComfyUI, и WebUI позволяют подключать несколько ControlNet-блоков к одной генерации.
ControlNet бесплатен и работает локально на вашем компьютере. Путь установки зависит от интерфейса.
ComfyUI/models/controlnet.models/ControlNet.Критичный момент — соответствие версий: модель ControlNet обучается под конкретную базу Stable Diffusion. Модель для SD 3.5 не заработает с чекпоинтом другой версии и наоборот. Если с подключённым референсом картинка генерируется «как будто ControlNet выключен» — первым делом проверяйте совместимость.
Задача: есть фото с идеальной позой — например, модель в развороте с рукой на поясе — и нужно сгенерировать своего персонажа (эльфийку, космонавта, рыцаря) в точно такой же позе.
Какой тип: OpenPose. Препроцессор DWPose извлечёт из фото скелет — чистую позу без лишних деталей исходного кадра.
Шаги:
Пример промпта:
portrait of an elven archer, long silver braid, leather armor,
standing three-quarter view, confident look, forest background,
golden hour light, highly detailed, 8k
Negative: deformed hands, extra limbs, blurry, low quality
Здесь сила влияния максимальная: скелет — жёсткий каркас, сеть не имеет права его ломать, поэтому весь «творческий» вес ложится на промпт.
Задача: есть карандашный набросок или цифровой эскиз с продуманной композицией — нужно превратить его в детализированное изображение в выбранном стиле.
Какой тип: Scribble для грубых каракуль, Canny/Lineart — если линии чёткие.
Шаги:
Пример промпта:
cozy medieval tavern interior, warm candlelight, wooden beams,
travelers at long tables, detailed digital painting,
fantasy concept art, rich colors
Negative: sketch, lineart, monochrome, flat, blurry
Сила влияния здесь компромиссная: контуры заданы вами, но сеть свободно наполняет их светом, текстурами и деталями.
Задача: есть фото реальной комнаты — своей или из каталога — и хочется увидеть её в другом стиле, не меняя планировку, окна и дверные проёмы.
Какой тип: Depth — он удержит объёмы и расстановку мебели, но позволит перерисовать материалы и декор. Для жёсткой фиксации стен и окон добавьте Segmentation.
Шаги:
Пример промпта:
living room interior, scandinavian style, white walls, light oak floor,
minimalist furniture, large windows, soft natural light,
interior design magazine photo, photorealistic
Negative: clutter, dark, vintage, ornate, distorted geometry
Сила влияния — «направляющая»: Depth мягко держит перспективу и объёмы, всё остальное отдаёт промпту. Именно так дизайнеры готовят нейросетевые визуализации интерьеров.
Главный регулятор — вес ControlNet (Control Weight / strength): он определяет, насколько жёстко референс сковывает генерацию.
Правило простое: чем точнее нужен повтор — тем выше вес. Но есть ловушка: на единице и выше сеть иногда «перенапрягается» — появляются задвоенные конечности и грязные текстуры. Начинайте с 0.6–0.8 и двигайтесь по результату.
Второй регулятор — CFG Scale, сила следования промпту. Эти настройки работают в паре: если CFG 12+ и вес ControlNet тоже высокий, модель получает два жёстких требования одновременно и начинает ломаться. Если картинка «рвётся» — снизьте CFG до 6–8 или уменьшите вес. Стартовая точка для экспериментов: CFG 7, вес 0.7.
В Midjourney v8 есть собственные инструменты контроля: --sref переносит стиль по референсу, --cref — внешность персонажа. Проще некуда: дописал параметр в промпт — и готово, ничего устанавливать не нужно. Но это именно ограниченные аналоги: sref не зафиксирует позу и планировку кадра, а cref сохранит облик персонажа, но не его точное положение в сцене.
ControlNet контролирует именно геометрию — скелет, контур, глубину — с высокой точностью, но требует установки и понимания весов.
Когда что выбирать. Нужна быстрая генерация красивых кадров «настроение + стиль» без возни — Midjourney с sref/cref. Нужен точный контроль позы, контура или планировки — комиксы, сторибординг, визуализация интерьеров, повторяемые сцены с одним персонажем — ControlNet в Stable Diffusion. Многие художники совмещают: в Midjourney ищут идеи, в Stable Diffusion с ControlNet доводят их до продакшена.
ControlNet добавляет к генерации примерно 10–20% нагрузки по сравнению с обычным запуском Stable Diffusion. Для SD 3.5 комфортный минимум — видеокарта с 8–10 ГБ видеопамяти; если её меньше, помогают режимы экономии и снижение разрешения. Всё считается локально и бесплатно, подписка не нужна, но без дискретной видеокарты генерация будет мучительно медленной.
Да. Актуальные сборки ComfyUI и WebUI поддерживают ControlNet-модели, обученные специально под SD 3.5, — скачать их можно бесплатно на Hugging Face. Главное правило — не смешивать версии: ControlNet-модель для SD 3.5 не подойдёт к чекпоинту другой версии Stable Diffusion, и наоборот. Всегда проверяйте, что база ControlNet-модели совпадает с базой вашей основной генерирующей модели.
Технически да: ControlNet извлекает скелет или контур, а не лицо и личность человека. Но этика и закон требуют аккуратности. Для публичных и коммерческих работ берите фото со свободной лицензией (Unsplash, Pexels), собственные съёмки или готовые скелеты из библиотек OpenPose. Воссоздавать по фото конкретного человека его образ без согласия — плохая идея и потенциальная проблема.
Три частые причины. Первая — вес контроля слишком низкий (ниже 0.3) или блок ControlNet вообще отключён. Вторая — несоответствие версий: модель ControlNet обучена под другую базу Stable Diffusion, чем ваш чекпоинт. Третья — препроцессор не распознал референс: например, OpenPose не нашёл человека на фото. Проверяйте по порядку: вес → совместимость версий → препроцессинг.
Нет. Базовый сценарий «загрузил фото → выбрал OpenPose → поднял вес до 0.8» осваивается за один вечер. Комбинации из нескольких блоков и тонкости препроцессоров — уже продвинутый уровень, он подтянется по мере практики. Начните с одного типа — OpenPose или Canny, отработайте вес — и дальше кривая обучения пойдёт легко.
ControlNet — тот самый недостающий пульт управления, который превращает Stable Diffusion из генератора сюрпризов в предсказуемый инструмент. Вы задаёте каркас — позу, контур, глубину или планировку, — а нейросеть наполняет его содержанием по вашему промпту. Бесплатно, локально, без подписок.
Начните с простого: возьмите OpenPose, повторите позу с любого фото, поиграйте с весом 0.6–0.9 — разницу почувствуете сразу. Дальше добавляйте Depth для сцен, Canny для рисунков, пробуйте комбинировать блоки.
Что почитать дальше на dailyprompts.ru:
Удачных генераций — и пусть лотерея останется в прошлом!
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.