Почему эксперимент «две нейросети рисуют русалку» стал вирусным
В интернете набирают популярность ролики, где две нейросети по очереди создают изображение по одному и тому же запросу — например, «русалка». Сначала одна генерирует картинку, затем вторая «видит» её и описывает словами, а первая на основе этого описания рисует снова. Цикл повторяется несколько раз. Результат часто оказывается абсурдным: русалка превращается в рыбу с человеческой головой, теряет хвост или обрастает лишними деталями.
Этот формат стал популярен благодаря сочетанию неожиданности и юмора. Зритель видит, как ИИ «забывает» исходный запрос, путает части тела или добавляет случайные элементы. Прикол заключается в том, что нейросети, которые обычно воспринимаются как серьёзные инструменты, в таком сценарии ведут себя как неловкие ученики.
С точки зрения технологий, это наглядная демонстрация ограничений современных генеративных моделей. Они не обладают долговременной памятью и не понимают контекст так, как человек. Каждый новый шаг — это интерпретация предыдущего результата, а не сверка с оригинальным заданием. Поэтому за несколько итераций образ может измениться до неузнаваемости.
Как устроен процесс: от текста к картинке и обратно
В типичном эксперименте участвуют две нейросети: одна генерирует изображение по текстовому описанию (text-to-image), вторая — описывает изображение текстом (image-to-text). Первая нейросеть получает запрос «нарисуй русалку» и создаёт картинку. Вторая «смотрит» на эту картинку и выдаёт текстовое описание: «девушка с рыбьим хвостом сидит на камне». Затем первая нейросеть получает это описание как новый запрос и генерирует следующее изображение.
На каждом шаге возможны искажения. Модель text-to-image может неправильно интерпретировать детали: например, вместо «сидит на камне» нарисовать «камень на голове». Модель image-to-text, в свою очередь, может опустить важные элементы или добавить лишние. В результате за 4–5 итераций русалка может превратиться в абстрактную композицию или забавного монстра.
Этот процесс напоминает детскую игру «испорченный телефон», где сообщение искажается при передаче от одного участника к другому. В случае с нейросетями искажения возникают из-за того, что каждая модель обучена на разных данных и имеет свои «слепые зоны». Например, одна нейросеть может хорошо распознавать лица, но путать хвосты с ногами, а другая — наоборот.
Почему нейросети «прикалываются»: типичные ошибки и их причины
Когда две нейросети пытаются нарисовать русалку, зрители часто смеются над тем, как ИИ «шутит». На самом деле это не шутки, а системные ошибки, вызванные особенностями обучения моделей.
Потеря контекста. Нейросеть не помнит, что исходный запрос был «русалка». Она работает только с текущим текстовым описанием. Если во втором шаге описание стало «женщина с рыбьим хвостом», то на третьем шаге модель может решить, что это просто «женщина», и нарисовать обычного человека.
Смешение признаков. Некоторые модели склонны объединять несвязанные элементы. Например, если в описании есть «чешуя» и «волосы», нейросеть может нарисовать волосы, похожие на чешую, или наоборот.
Добавление случайных деталей. Генеративные модели часто «фантазируют», чтобы заполнить пробелы. Если описание неполное, нейросеть дорисовывает то, что кажется ей логичным. В результате русалка может получить лишнюю руку или необычный фон.
Эффект «испорченного телефона». Каждая итерация усиливает искажения. То, что на первом шаге было мелкой ошибкой (например, неправильный цвет хвоста), на пятом шаге превращается в принципиально другой объект.
Эти «приколы» — не баги, а особенности работы вероятностных моделей. Они показывают, что ИИ не понимает смысла, а лишь предсказывает наиболее вероятные пиксели или слова на основе обучающей выборки.
Какие нейросети чаще всего участвуют в таких экспериментах
Для создания вирусных роликов «две нейросети рисуют русалку» обычно используют популярные генеративные модели.
Midjourney — одна из самых известных нейросетей для создания изображений. Она выдаёт высокодетализированные и художественные картинки, но её стиль легко узнаваем. В эксперименте Midjourney часто добавляет драматическое освещение и сложные текстуры, что может привести к неожиданным результатам при повторной генерации.
DALL-E от OpenAI — модель, которая хорошо понимает сложные запросы и умеет генерировать реалистичные изображения. Однако она может путать части тела или добавлять лишние объекты, если описание неоднозначно.
Stable Diffusion — открытая модель, которую можно запускать локально. Она даёт больше свободы в настройке, но качество зависит от конкретной версии и настроек. В экспериментах Stable Diffusion часто «фантазирует» сильнее других моделей.
НейроХолст — российский сервис, который поддерживает русский язык и не требует VPN. Он удобен для пользователей из России, но его результаты могут быть менее детализированными по сравнению с Midjourney.
Fabula AI — ещё одна российская платформа, которая предлагает генерацию изображений на основе FLUX. Она также поддерживает русский язык и подходит для быстрых экспериментов.
Выбор нейросетей влияет на характер «приколов». Например, Midjourney может сделать русалку слишком «художественной», а Stable Diffusion — добавить сюрреалистические элементы.
Как правильно составить запрос, чтобы получить осмысленный результат
Хотя эксперимент «две нейросети рисуют русалку» задуман как развлечение, он наглядно демонстрирует важность грамотного составления промптов. Если вы хотите, чтобы нейросеть создала изображение, близкое к задумке, следуйте нескольким правилам.
Будьте конкретны. Вместо «русалка» напишите «русалка с зелёным хвостом, длинными рыжими волосами, сидит на скале на закате». Чем больше деталей, тем меньше простора для «фантазий» модели.
Используйте негативные промпты. Укажите, чего не должно быть: «без лишних рук», «без очков», «без фона с городом». Это помогает избежать случайных элементов.
Уточняйте стиль. Если вам нужен реализм, добавьте «фотореалистично, 8K, детализированно». Если хотите мультяшный стиль — укажите «в стиле аниме» или «мультяшно».
Избегайте противоречий. Не пишите «русалка с ногами» — это сбивает модель с толку. Лучше сформулировать как «русалка, у которой вместо ног рыбий хвост».
Экспериментируйте с длиной. Слишком короткий запрос даёт модели слишком много свободы, слишком длинный — может запутать. Оптимальная длина — 2–3 предложения.
Даже при идеальном промпте в многошаговом эксперименте искажения неизбежны, но на одношаговой генерации эти правила значительно повышают качество результата.
Что говорят такие эксперименты о современном состоянии ИИ
Вирусные ролики с «двумя нейросетями, рисующими русалку» — это не просто развлечение. Они подсвечивают несколько важных аспектов развития искусственного интеллекта.
Отсутствие понимания смысла. Нейросети оперируют статистическими закономерностями, а не логикой. Они не знают, что русалка — это мифическое существо с определёнными атрибутами. Они лишь предсказывают, какие пиксели чаще всего встречаются рядом со словом «русалка» в обучающей выборке.
Проблема «забывания». В многошаговых процессах модели теряют исходный контекст. Это ограничение важно для задач, где требуется последовательное рассуждение, например, в диалоговых системах или при генерации длинных текстов.
Зависимость от данных. Если в обучающей выборке было много изображений русалок в одном стиле (например, диснеевских), нейросеть будет копировать этот стиль, даже если запрос подразумевает другое.
Творческий потенциал. Несмотря на ошибки, такие эксперименты показывают, что ИИ способен создавать неожиданные и оригинальные комбинации. Некоторые художники намеренно используют многошаговую генерацию для получения сюрреалистических образов.
Таким образом, «приколы» нейросетей — это не недостаток, а особенность, которую можно использовать как для развлечения, так и для творчества.
Как повторить эксперимент самостоятельно: инструменты и советы
Если вы хотите сами попробовать «две нейросети рисуют русалку» и посмотреть, какие приколы получатся, вам понадобятся два инструмента: генератор изображений и генератор текста по изображению.
Шаг 1. Выберите платформу. Для генерации изображений подойдут Midjourney (через Discord), DALL-E (через веб-интерфейс), Stable Diffusion (локально или через онлайн-сервисы) или российские аналоги — НейроХолст, Fabula AI. Для описания изображений можно использовать ту же модель, если она поддерживает image-to-text, или отдельные сервисы вроде GPT-4 с Vision.
Шаг 2. Задайте начальный запрос. Начните с простого: «нарисуй русалку». Затем возьмите полученное изображение и передайте его второй нейросети с просьбой описать.
Шаг 3. Повторите цикл. Используйте текстовое описание как новый запрос для первой нейросети. Повторите 3–5 раз.
Шаг 4. Записывайте результаты. Сохраняйте каждое изображение и текст, чтобы отслеживать изменения.
Советы:
- Используйте разные нейросети для генерации и описания — это усилит эффект «испорченного телефона».
- Начинайте с конкретного запроса, чтобы было интереснее наблюдать за искажениями.
- Не бойтесь экспериментировать с разными темами: «робот на пляже», «кот в космосе» и т.д.
Такой эксперимент — отличный способ понять, как работают нейросети, и получить порцию хорошего настроения.
Практическое применение: как использовать «приколы» нейросетей в творчестве
То, что выглядит как ошибка, может стать источником вдохновения. Многие художники и дизайнеры намеренно используют многошаговую генерацию для создания необычных образов.
Сюрреалистическое искусство. Искажения, возникающие при повторных итерациях, напоминают работы сюрреалистов. Русалка, превратившаяся в абстрактное пятно, может стать основой для картины или иллюстрации.
Генерация идей. Если вы застряли в творческом блоке, запустите цикл «две нейросети рисуют русалку» и посмотрите, что получится. Неожиданные комбинации могут натолкнуть на новые концепции.
Мемы и контент для соцсетей. Вирусные ролики с «приколами» нейросетей набирают миллионы просмотров. Вы можете создавать подобный контент, используя бесплатные сервисы вроде НейроХолста или Fabula AI.
Обучение и презентации. Такие эксперименты наглядно демонстрируют ограничения ИИ и могут использоваться в образовательных целях — на лекциях по машинному обучению или в статьях о технологиях.
Разработка игр и анимации. Сгенерированные «странные» изображения можно использовать как концепт-арты для монстров, инопланетян или фантастических существ.
Таким образом, даже «приколы» нейросетей могут быть полезны, если подойти к ним творчески.
Ограничения и этические аспекты: что нужно знать перед экспериментом
Прежде чем запускать «две нейросети рисуют русалку», стоит учитывать несколько моментов.
Качество изображений. Бесплатные версии нейросетей часто имеют ограничения: низкое разрешение, водяные знаки или лимит на количество генераций. Например, НейроХолст даёт 25 «красок» для бесплатного теста, что позволяет создать до 50 изображений. Fabula AI предлагает 50 генераций в день бесплатно.
Авторские права. Сгенерированные изображения могут случайно напоминать существующие работы, защищённые авторским правом. Используйте их с осторожностью в коммерческих проектах.
Этичность контента. Не стоит генерировать изображения, которые могут оскорбить других людей или нарушить законы. Большинство сервисов имеют фильтры, но они не идеальны.
Зависимость от региона. Некоторые международные сервисы (Midjourney, DALL-E) могут быть недоступны в России без VPN. Российские аналоги — НейроХолст, Fabula AI, GenAPI — работают без ограничений.
Конфиденциальность. Если вы загружаете свои изображения для описания, убедитесь, что сервис не использует их для обучения моделей без вашего согласия.
Эксперимент безопасен, если соблюдать базовые правила. Главное — получать удовольствие от процесса и не воспринимать результаты слишком серьёзно.
Вопросы и ответы
Почему две нейросети не могут нарисовать русалку одинаково?
Каждая нейросеть обучена на разных наборах данных и использует разные алгоритмы. Когда одна генерирует изображение, а другая его описывает, возникают искажения из-за разного понимания деталей. Например, одна модель может акцентировать хвост, а другая — лицо. В результате на каждом шаге образ меняется, и за несколько итераций русалка может стать неузнаваемой.
Какой сервис лучше всего подходит для такого эксперимента в России?
Для пользователей из России удобны сервисы, которые работают без VPN и поддерживают русский язык. НейроХолст предлагает бесплатный старт (25 красок) и понимает русские запросы. Fabula AI даёт 50 бесплатных генераций в день и также поддерживает русский. Оба сервиса позволяют генерировать изображения по тексту и могут использоваться в паре с другими инструментами для описания.
Можно ли использовать результаты эксперимента в коммерческих проектах?
Это зависит от условий конкретного сервиса. Например, НейроХолст и Fabula AI разрешают коммерческое использование сгенерированных изображений, но лучше уточнить в пользовательском соглашении. Однако помните, что изображения могут случайно напоминать чужие работы, поэтому перед коммерческим использованием стоит проверить их на уникальность.
Сколько итераций нужно, чтобы русалка превратилась в нечто неузнаваемое?
Обычно достаточно 3–5 итераций. На первом шаге изображение ещё близко к исходному запросу. На втором-третьем появляются заметные искажения (лишние детали, изменение пропорций). К четвёртой-пятой итерации русалка может превратиться в абстрактный объект или существо, не похожее на исходную задумку.
Какие ещё темы можно использовать для такого эксперимента?
Подойдут любые конкретные образы: «робот на пляже», «кот в космосе», «дракон в библиотеке», «единорог в городе». Чем детальнее запрос, тем интереснее наблюдать за искажениями. Также можно попробовать абстрактные темы, например «грусть» или «радость», но результат будет менее предсказуемым.
Почему нейросети добавляют лишние детали, например, третью руку?
Это связано с тем, что генеративные модели предсказывают пиксели на основе вероятностей. Если в обучающей выборке часто встречаются изображения с несколькими руками (например, на групповых фото), модель может «решить», что это нормально. Также нейросети иногда «заполняют» пробелы, добавляя случайные элементы, чтобы изображение выглядело целостным.
Можно ли избежать искажений, если использовать одну и ту же нейросеть для генерации и описания?
Искажения всё равно будут, но они могут быть менее выраженными, поскольку модель «знает» свои собственные шаблоны. Однако эффект «испорченного телефона» сохранится, так как даже одна модель не может идеально восстановить изображение по текстовому описанию. Для чистоты эксперимента лучше использовать разные нейросети.