Сгенерировать картинку нейросетью: формула запроса и цены
Картинку по описанию делает любая фото-модель, но результат отличается в разы — и зависит он не от везения, а от двух вещей: как описана задача и какая модель выбрана. Разбираем формулу запроса, которая работает во всех студиях, что писать в раздел «чего быть не должно», чем отличаются модели за один токен и за восемь, и как не платить дважды за один и тот же кадр.
- Формула запроса из пяти частей — Объект, окружение, ракурс и свет, стиль и отдельно запреты — структура, по которой модель понимает задачу с первого раза.
- Картинка от одного токена — Черновики делаются на модели за 1 токен, и только утверждённый кадр перезапускается на дорогой.
- Работа по своему фото — Можно не только рисовать с нуля: загруженный кадр редактируется — фон, свет, качество, детали.
- Русские описания — Описывать задачу можно по-русски, модель переводит сама. Для сложных сцен есть приём с переводом за один шаг.
- Цена видна до запуска — Стоимость написана на кнопке: вы видите сумму до нажатия и можете сменить модель, если дорого.
Содержание
- Видеоурок по теме
- Обзор: с чего начинается результат
- Возможности и формула запроса из пяти частей
- Готовые примеры промптов
- Какую модель выбрать
- Сколько это стоит
- Как не платить дважды
- Работа по своей фотографии
- Частые ошибки
Видеоурок по теме
Как создать фото в Genosai — 3:48
Смотреть во ВКонтакте · весь бесплатный курс
Урок снят в живом кабинете: первая картинка по описанию — от запроса до результата. Смотреть можно прямо здесь, без регистрации.
Обзор: с чего начинается результат
Одна и та же модель по запросу «красивая картинка» и по внятному описанию выдаёт результаты, которые отличаются в разы. Стоят они при этом одинаково — цена не зависит от длины описания. Поэтому первое, что стоит освоить, это не поиск «лучшей нейросети», а структура запроса.
Причина простая: модель не угадывает, а дополняет. Всё, что вы не сказали, она додумает сама — ракурс, свет, фон, стиль, время суток. Чем больше додумывает, тем дальше результат от того, что было в голове.
Возможности и формула запроса из пяти частей
Работает во всех фото-студиях и не требует специальных терминов.
1. Объект. Что именно в кадре, с деталями: не «чашка», а «белая керамическая чашка с латте и рисунком на пене».
2. Окружение. Где это стоит и что вокруг: «на деревянной стойке кофейни, на заднем плане размытые полки».
3. Ракурс и свет. Откуда смотрим и какое освещение: «крупный план сбоку, тёплый утренний свет из окна, мягкие тени».
4. Стиль. Как это должно выглядеть: «фотореалистично, рекламная предметная съёмка» или «плоская векторная иллюстрация».
5. Запреты. Чего быть не должно: «без текста, без логотипов, без людей в кадре».
Пятая часть важнее, чем кажется. Именно запреты убирают самые частые сюрпризы: случайные надписи, лишние руки, водяные знаки, посторонние предметы.
Готовые примеры промптов
Предметная съёмка для карточки товара:
Белая керамическая чашка с латте и рисунком на пене стоит на деревянной стойке
кофейни, на заднем плане размытые полки с зёрнами. Крупный план сбоку,
тёплый утренний свет из окна, мягкие тени, фотореалистичная рекламная съёмка.
Без текста, без логотипов, без людей в кадре.
Портрет для сайта:
Портрет женщины около 35 лет в светлой блузке на ровном сером фоне,
кадр по грудь, взгляд в камеру, спокойное доброжелательное выражение.
Мягкий студийный свет без резких теней, фотореалистично.
Без текста и логотипов.
Иллюстрация в плоском стиле:
Плоская векторная иллюстрация: человек за ноутбуком в уютной комнате с растениями,
ограниченная палитра из трёх цветов, простые формы, без градиентов.
Без текста и подписей.
Эти три шаблона закрывают большинство задач: подставьте свой предмет и место.
Какую модель выбрать
Разница между моделями не в «качестве вообще», а в том, что каждая делает лучше.
Z-Image — один токен за кадр. На ней удобно подбирать композицию и проверять идею: пять дублей стоят пять рублей. Слабее на лицах. Подробный разбор — в уроке про Z-Image.
Nano Banana Pro — восемь токенов. Берут, когда в кадре человек и важно лицо, или когда нужна аккуратная детализация ткани, кожи, предметов. Разбор — в уроке про Nano Banana.
ChatGPT Image 2 — сильна там, где нужен связный текст прямо в изображении, например на обложке. Разбор — в уроке про ChatGPT Image.
Общая логика студии и сравнение моделей между собой — в уроке про фото-студию.
Сравнение моделей под задачу
| Задача | Модель | Цена за кадр | Почему |
|---|---|---|---|
| Подбор идеи и композиции | Z-Image | 1 токен | Дёшево, десять дублей стоят десять рублей |
| Человек в кадре, важно лицо | Nano Banana Pro | 8 токенов | Аккуратно держит черты и не «пластмассит» кожу |
| Текст прямо в изображении | ChatGPT Image 2 | 6 токенов | Лучше остальных вписывает надписи в кадр |
| Правка своего фото | Nano Banana Pro | 8 токенов | Меняет фон и свет, сохраняя человека |
Отдельно про скорость: разница между моделями в секундах ожидания невелика, поэтому выбирать стоит по задаче и цене, а не по «быстроте».
Сколько это стоит
Внутренняя валюта — токены, один токен равен одному рублю, подписки нет. Цена написана прямо на кнопке запуска.
Ориентиры: кадр на Z-Image — 1 токен, на средних моделях — 4–6, на Nano Banana Pro — 8. То есть серия из десяти черновиков обходится в десять рублей, а финальный кадр в хорошем качестве — ещё в восемь.
Что реально бесплатно, а где начинаются деньги, подробно разобрано на отдельной странице — нейросети бесплатно.
Как не платить дважды
Самая частая ошибка новичка — сразу запускать дорогую модель и переделывать по десять раз.
Рабочий порядок обратный. Сначала два-три дубля на дешёвой модели: так вы проверяете, правильно ли поняли друг друга, — та ли композиция, тот ли ракурс, нет ли лишнего в кадре. Дальше правите описание, а не модель. И только когда кадр в целом устраивает, повторяете тот же промпт на дорогой модели.
Второе правило: не запускайте пачку однотипных картинок сразу. Сделайте одну, посмотрите, добавьте недостающий запрет — и потом остальные. Это экономит больше токенов, чем любой выбор «более дешёвой нейросети».
Работа по своей фотографии
Генерация с нуля — только половина возможностей. Если загрузить в форму свой кадр, та же модель начинает не рисовать, а редактировать: менять фон, свет, одежду, убирать лишние предметы, повышать резкость и детализацию.
Два практических сценария разобраны отдельно: как улучшить качество фото — когда снимок мыльный и мелкий, и фото на документы — когда нужен ровный белый фон и деловой вид.
В обоих случаях есть общее правило: если на фото человек, добавляйте в описание явный запрет менять лицо, возраст и черты. Без него модель воспринимает задачу как разрешение «улучшить» человека и возвращает похожего, но другого.
Соотношение сторон и куда пойдёт кадр
Формат задаётся в форме до генерации, и менять его потом — значит платить второй раз. Поэтому решайте заранее, где картинка будет жить.
Квадрат подходит для ленты и аватарок, горизонтальный кадр — для обложек статей и презентаций, вертикальный — для карточек товара и сторис. Обрезать горизонтальный кадр в вертикальный почти всегда плохо: композиция строилась под другую рамку, и обрезка съедает то, ради чего кадр делался.
Отдельно про разрешение. Для ленты и сайта хватает базового: там картинку всё равно пережмут. Высокое разрешение имеет смысл, когда кадр идёт в печать или будет заметно увеличен.
Как повторять один стиль в серии
Задача, которая возникает сразу после первой удачной картинки: нужно ещё пять таких же, но с другим предметом.
Работает так. Возьмите удачный промпт и разделите его мысленно на две части: «что в кадре» и «как снято». Вторая часть — ракурс, свет, стиль, палитра, запреты — переносится без изменений во все кадры серии. Меняете только первую.
Второй приём — референсы: если модель принимает картинки на вход, положите туда свой удачный кадр и попросите сохранить стиль и свет, поменяв предмет. Так серия получается заметно однороднее, чем при повторении одного текста.
Третий — сохраняйте формулировки, которые сработали. Через неделю вспомнить точный промпт по памяти не получится, а повторить его дословно — единственный способ получить тот же результат.
Что делать, если результат «почти тот»
Отдельный навык — не переписывать промпт с нуля, а править точечно. Три приёма, которые закрывают большинство случаев.
Не то настроение. Добавьте время суток и характер света: «раннее утро, холодный рассеянный свет» против «тёплый закат, длинные тени». Свет меняет ощущение сильнее, чем любые прилагательные вроде «уютный».
Лишние детали в кадре. Не описывайте их заново — вынесите в запреты. Список «без людей, без текста, без посуды на заднем плане» работает точнее, чем попытка переписать сцену.
Не тот масштаб. Скажите прямо, какая часть объекта занимает кадр: «предмет занимает две трети кадра», «кадр по грудь», «общий план комнаты целиком». Модель плохо угадывает крупность и охотно берёт средний план по умолчанию.
И общее правило: меняйте одну вещь за раз. Если переписать сразу свет, ракурс и стиль, вы не поймёте, что именно сработало, и следующий кадр придётся подбирать заново.
Ограничения и советы новичку
Частые ошибки
Слишком короткое описание. «Красивый закат» — модель додумает всё остальное, и почти наверняка не так, как вы представляли.
Нет запретов. Появляются случайные надписи, лишние пальцы, посторонние предметы. Строчка «без текста, без логотипов» решает половину проблем.
Требование текста внутри картинки. Кириллица моделям даётся хуже латиницы: длинные слова плывут. Надёжнее сгенерировать чистый кадр и положить надпись сверху в редакторе.
Дорогая модель на этапе поиска идеи. Подбор композиции стоит рубль, а не восемь. Перезапуски на дорогой модели и есть главная статья лишних расходов.
FAQ
Сколько стоит сгенерировать одну картинку?
От одного токена на модели Z-Image — это буквально рубль за кадр. Модели с более аккуратными лицами и деталями стоят 4–8 токенов. Цена написана на кнопке до запуска.
Можно ли писать описание по-русски?
Да, все фото-модели принимают русский текст и переводят его сами. Для сложных художественных сцен описание можно перевести на английский текстовой моделью за один шаг.
Почему получается не то, что я просил?
Чаще всего описание слишком короткое: модель дополняет недосказанное по-своему. Помогает структура из пяти частей и отдельный список того, чего в кадре быть не должно.
Можно ли изменить свою фотографию, а не рисовать с нуля?
Да. Если загрузить кадр, генерация превращается в редактирование: меняются фон, свет, одежда, качество. Лицо при этом лучше явно запретить менять.
Умеет ли нейросеть писать текст на картинке?
Отдельные модели умеют, но кириллица даётся им хуже латиницы. Если надпись критична, надёжнее сгенерировать чистый кадр и добавить текст в редакторе.
Сколько вариантов приходит за один запуск?
Обычно один кадр за запуск. Поэтому дешевле сделать несколько дублей на недорогой модели, выбрать композицию и повторить её на дорогой.