Личный опыт: сравниваю Flux, Dalle-3, Midjourney и Stable Diffusion в одной связке

Современные генеративные модели развиваются настолько стремительно, что выбор подходящего инструмента для создания изображений превращается в отдельную задачу. Разные нейросети по-разному интерпретируют один и тот же запрос, по-своему работают со стилями, текстом и комбинированием персонажей. Чтобы не полагаться на абстрактные обзоры, я решила провести собственное практическое сравнение четырёх популярных решений: Stable Diffusion, Midjourney, Flux и Dalle-3. Все они доступны в едином пространстве, что позволяет быстро переключаться между моделями и оценивать результат в одинаковых условиях.

Для чистоты эксперимента я использовала два базовых запроса. Первый звучал так: «Дональд Дак держит в руках золотую монету». Второй — «Девушка сидит на траве на фоне гор». Эти сюжеты достаточно просты, но при этом хорошо показывают, как модель работает с персонажем, предметом, композицией и окружением. Дальше я последовательно прогоняла их через каждую нейросеть и фиксировала, насколько точно передаются детали, насколько естественно выглядят люди и объекты, а также как модель реагирует на стилизацию.

Первое впечатление от Flux

Начала я с нейросети Flux. В интерфейсе всё устроено довольно просто: достаточно открыть раздел с нейросетями и выбрать соответствующую модель. После отправки первого запроса результат появился практически сразу. Больше всего меня порадовало то, как Flux справляется с реалистичностью человеческих фигур. Руки, пальцы, пропорции — всё выглядит естественно, без типичных для многих генеративных моделей артефактов. Это особенно заметно на втором изображении с девушкой на фоне гор: поза получилась живой, а пейзаж — объёмным и детализированным.

Дополнительно мне было интересно проверить, как Flux работает со стилями. В меню доступно более сорока вариантов оформления, и это открывает широкий простор для экспериментов. Для первого изображения я выбрала стили «Steampunk», «Logo», «Horror» и «Space». Каждый из них кардинально менял настроение сцены: стимпанк добавил латунные механизмы и плотный индустриальный фон, логотип превратил персонажа в лаконичный графический знак, хоррор привнёс мрачную атмосферу, а космическая тема унесла героя в фантастическое пространство.

Второй запрос я прогнала через стили «Anime», «Gothic», «Comicbook» и «Futuristic». Здесь Flux тоже показал себя гибко: аниме-версия получилась мягкой и воздушной, готическая — тёмной и таинственной, комиксовая — контрастной и динамичной, а футуристическая — холодной и технологичной. Важно, что при всех трансформациях модель сохраняла исходную сцену, а не просто рисовала нечто отдалённо похожее.

Отдельного внимания заслуживает работа Flux с надписями. Я задала промпт, в котором на монете должно было появиться слово «Rich». Модель справилась с этой задачей с первой попытки и выдала чёткий, хорошо читаемый текст. Правда, пока только на английском языке, но для большинства творческих задач этого достаточно.

Ещё один любопытный тест — совмещение персонажей. Я попросила объединить Дональда Дака и стрекозу. Flux выдал неожиданную, но органичную интерпретацию, в которой черты обоих существ переплелись в едином образе. Подобные эксперименты сильно зависят от формулировки запроса и фантазии автора, но модель охотно откликается на нестандартные идеи.

Что показала Dalle-3

Следующей на очереди была Dalle-3. Она тоже доступна в том же пространстве, и для неё предусмотрен ежедневный запас баллов, которых хватает на несколько генераций. Я активировала режим «Multi-image» и отправила те же два запроса, чтобы сравнение было максимально честным.

Первое, что бросилось в глаза, — более мягкая цветовая палитра и слегка иная трактовка персонажа. Дональд Дак у Dalle-3 выглядит более мультяшно, чем у Flux, но при этом сцена остаётся целостной. Девушка на фоне гор получилась романтичной, с аккуратной композицией и приятным естественным освещением. Разница между моделями чувствуется, но не в ущерб качеству: каждая из них просто имеет собственный визуальный почерк.

Стили Dalle-3 также отработала достойно. Я применила те же варианты, что и в случае с Flux: «Steampunk», «Logo», «Horror», «Anime», «Gothic» и «Comicbook». Модель уверенно меняла атмосферу изображений, хотя в некоторых случаях её интерпретации были менее детализированными, чем у конкурента. Например, в стиле «Horror» Flux выдал более мрачную и фактурную картинку, тогда как Dalle-3 сделала акцент на цветовом контрасте. Тем не менее все результаты оставались узнаваемыми и соответствовали запросу.

С текстом на изображении Dalle-3 тоже справляется, хотя и не всегда идеально. Надпись «Rich» на монете появилась, но в одном из вариантов буквы были слегка искажены. Это не критично, однако Flux в данном тесте оказалась точнее. Что касается совмещения персонажей, то Дональд Дак со стрекозой у Dalle-3 получился более сюрреалистичным и менее предсказуемым, чем у Flux. Такой результат может быть как плюсом, так и минусом — всё зависит от задачи.

Midjourney: узнаваемый стиль и широкие возможности

Дальше я переключилась на Midjourney. Многие привыкли работать с ней через Discord, но такой формат не всегда удобен: возникают сложности с оплатой, нужен VPN, да и сам интерфейс может отпугивать новичков. В едином пространстве всё проще: выбираешь модель и сразу отправляешь запрос. При этом доступна актуальная версия Midjourney v 6.1 со всеми основными функциями.

Результаты Midjourney сложно спутать с другими моделями. У неё очень характерная эстетика: насыщенные цвета, выразительное освещение, кинематографичная глубина. Дональд Дак с золотой монетой выглядел как кадр из дорогого анимационного фильма, а девушка на фоне гор — как фотосессия в стиле travel-блога. При этом модель отлично держит композицию и не допускает грубых ошибок в анатомии.

Стили Midjourney интерпретирует по-своему. В «Steampunk» она добавила больше пара и металлических деталей, в «Logo» сделала минималистичный, но очень цепляющий знак, а в «Horror» создала по-настоящему тревожную атмосферу. Аниме-версия вышла детализированной, с плавными линиями и характерными бликами, готическая — глубокой и мрачной, а комиксовая — стилизованной под классический американский комикс. В сравнении с Flux и Dalle-3 Midjourney чаще делает более «дорогую» картинку, но иногда уходит в излишнюю художественность.

Надпись «Rich» Midjourney воспроизвела без серьёзных ошибок, хотя и с лёгкой художественной небрежностью. А вот совмещение Дональда Дака и стрекозы получилось очень интересным: модель создала гибридный образ, который выглядит одновременно странно и эстетично. В Midjourney также есть множество дополнительных инструментов: можно менять версии персонажей, дорисовывать фон, увеличивать изображение с переработкой деталей и объединять два изображения в одно.

Ключевое преимущество такого подхода — возможность комбинировать разные нейросети в одной платформе. Например, сначала сгенерировать изображение в Midjourney, Dalle или Flux, а затем обработать его с помощью функции «Inpaint» от Stable Diffusion. Это позволяет удалять лишние объекты, менять фон, корректировать детали и даже заменять лица на фотографиях. Такая связка заметно расширяет творческие возможности.

Stable Diffusion: гибкость и технический контроль

Последней я протестировала Stable Diffusion. Эта модель известна своей вариативностью: здесь можно выбирать разные модели, сэмплеры, форматы, использовать конструктор изображений и подключать модели «LoRa». Для новичков такой набор может показаться сложным, но для тех, кто любит контролировать процесс, это настоящая находка.

Базовые генерации Stable Diffusion выглядят несколько иначе, чем у Midjourney или Flux. Они могут быть менее «глянцевыми», зато дают больше свободы для последующей доработки. Стили модель тоже поддерживает: я прогнала оба запроса через «Steampunk», «Logo», «Horror», «Anime», «Gothic» и «Comicbook». Результаты получились разнообразными, хотя в некоторых случаях стилизация была менее выраженной, чем у конкурентов.

Важный нюанс: Stable Diffusion пока не умеет корректно встраивать текст в изображение. Запрос с надписью «Rich» она не выполнила так, как Flux или Dalle-3. Зато с совмещением персонажей модель справляется отлично. Для этого используется специальный синтаксис: [дональд дак:стрекоза:0.5]. Такой промпт заставляет нейросеть сначала наполовину сформировать первого героя, а затем интегрировать второго. Результат получается необычным и часто более точным, чем при обычном текстовом описании.

Stable Diffusion также выделяется возможностью бесплатного тестирования: ежедневно начисляются баллы, которых хватает на несколько генераций. Это удобно для знакомства с платформой и отработки промптов. В целом модель подойдёт тем, кто готов вникать в настройки и хочет получить максимум контроля над процессом.

Сравнение четырёх нейросетей в равных условиях показало, что универсального лидера нет. Flux лучше всего работает с реализмом и текстом, Dalle-3 привлекает простотой и стабильностью, Midjourney выдаёт самые эффектные художественные результаты, а Stable Diffusion предлагает наибольшую гибкость и технические возможности. Выбор зависит от конкретной задачи: для быстрых креативных генераций я бы выбрала Midjourney, для точных реалистичных сцен — Flux, для экспериментов с настройками — Stable Diffusion, а Dalle-3 оставила бы как надёжный универсальный вариант. Главное — не бояться пробовать разные модели и комбинировать их сильные стороны.

Обсудим

?
12 - 1 = ?