Особые возможности моделей

Примерить одежду, стереть предмет, склонировать голос, написать песню, заменить объект в готовом ролике — всё это в сервисе есть, но живёт в блоке «Дополнительно» у конкретных моделей и снаружи не видно: ни в каталоге, ни в описании, пока не выберешь модель и не раскроешь блок. Здесь эти возможности собраны от задачи к модели, а не наоборот.

Работа с изображениями

Примерить одежду на человека

Есть модели виртуальной примерочной: у них два отдельных слота — «Человек» и «Одежда».

Модель примерочной: слоты «Человек» и «Одежда»

Слоты выглядят одинаково и стоят друг под другом — перепутать их легко, а результат тогда получится бессмысленный. В каждый идёт по одному файлу.

Промпт тут почти не нужен — модель работает с двумя картинками. Фото человека берите в полный рост и анфас, одежду — на белом фоне и без человека: так вещь переносится точнее.

Стереть объект с картинки

Модель стирания объекта: промпт не нужен, нужны картинка и маска

Обратите внимание на две подписи на этом кадре. Над каталогом моделей: «Для выбранной модели требуются "Своё изображение" и маска». И в поле запроса вместо обычной подсказки — «Промпт не требуется для этой модели — нажмите "Создать"».

Это редкий случай, когда писать нечего: вы отмечаете маской лишнее, и всё. Такие модели ищутся в каталоге по метке UTILS.

Дальше закрашиваете кистью то, что должно исчезнуть: окно так и подписано — «Закрашенная область будет изменена при генерации». Как устроено само окно рисования, разобрано в разделе Генератор.

А в блоке «Дополнительно» у таких моделей есть параметр «Расширение маски (px)», и в его описании дан готовый рецепт: расширение помогает закрыть края, мягкие контуры и тени. По умолчанию стоит 10, а для волос, меха и дыма рекомендуется 15–20.

Параметр выглядит техническим, а решает главную проблему стирания — ореол по краям. Про маску — в разделе Генератор.

Ещё одна особенность стирающих моделей: размер результата берётся из исходной картинки, поэтому привычного выбора разрешения у них нет — и это не пропажа настройки.

Дорисовать кадр за его границами

Кнопка «Дорисовать» над готовой работой предлагает четыре стороны по одному нажатию. А у специальных моделей аутпейнтинга есть числовые поля на все четыре стороны сразу и настройка «обрезать исходник по границам холста».

Разница простая: кнопка — быстро и на глаз, модель — точно и по числам. Для баннера с заданными полями берите вторую.

Серия связанных изображений

У части моделей есть режим серии: генерация нескольких связанных между собой кадров в одном задании.

Это готовый ответ на «как сделать комикс, сториборд или карусель для поста». Обычная генерация даёт независимые картинки, а здесь модель держит персонажа между кадрами. Опишите героя один раз и перечислите сцены.

Задать цветовую палитру результата

Сначала палитру нужно включить отдельным переключателем — «Задайте набор цветов для управления цветовой схемой результата»; сам набор появляется только после него. Дальше палитр в сервисе две разные, и их легко перепутать:

  • простая — до пяти цветов, которые модель будет использовать;
  • продвинутая — от трёх до десяти цветов с весами: главному цвету можно дать больший вес.

Палитра цветов и цвет фона

Рядом встречается и отдельное поле «Цвет фона» — оно задаёт только подложку и с палитрой не связано. Их часто путают: палитра управляет всей гаммой кадра, цвет фона — тем, что за объектом.

Это единственный способ попасть в фирменные цвета без подбора промпта. Возьмите цвета из своего логотипа, поставьте главному больший вес — получите серию картинок в одной гамме. А чтобы найти в ленте чужие работы в той же гамме, есть поиск по цветам — приём тот же, только наоборот.

Прозрачный фон

У части моделей есть настройка фона со значениями авто / непрозрачный / прозрачный.

Прозрачный фон — это готовый PNG без фона прямо из генератора, без прохода через «Удалить фон». Для логотипов, стикеров и наложений это главное, а само собой этого не видно.

Удалить фон — двумя способами

  1. Кнопкой над готовой работой — ничего настраивать не нужно;
  2. переключателем «Удалить фон» в блоке «Своё изображение», когда картинка уже загружена.

Для товарных карточек и коллажей это быстрее любого редактора: сгенерировали предмет → нажали «Удалить фон» → получили картинку без фона.

Профессиональное редактирование одной кнопкой

Есть модель-«мини-фотостудия», где нужное действие выбирается списком: раскрасить, переосветить, восстановить, смешать, сменить сезон, превратить набросок в изображение. К ней прилагаются выбор сезона, десяток видов освещения — от полудня и синего часа до лунного и боке — направление света (спереди, сбоку, снизу, сверху) и режим цвета: современный, насыщенный, чёрно-белый, сепия.

«Переосветить» плюс направление света — самый быстрый способ привести разнородные фото товаров к одному виду. По названию модели об этом не догадаешься.

Увеличить под печать

Апскейл запускается прямо с готовой работы — кнопкой над картинкой, и таких кнопок две:

  • «Увеличить разрешение» — обычный апскейл, меню ×2 и ×4;
  • «Увеличить разрешение ×2 + промпт» — апскейл, который дорисовывает детали по вашему описанию.

Мягкую, «замыленную» картинку вытягивает именно второй вариант. Но он может поменять мелочи — если важна точность, берите обычный.

Есть и отдельные модели-апскейлеры. У них другой подход: не кратность, а целевой размер в мегапикселях (1 МП ≈ 1000×1000), плюс настройки реализма и детализации.

В описании такой модели прямо сказано, что меньший размер дешевле большего. Не берите максимум, если печатаете А4 — платить придётся за мегапиксели, которые вы не увидите.

Референс персонажа и референс стиля

У части моделей это два разных слота: «кто» и «как». Причём к референсу персонажа можно приложить маску — она определяет, к какой области применить референс.

Разделение «кто» и «как» — редкая вещь: можно взять лицо с одной картинки, а манеру с другой.

Одна картинка — три разных смысла

Загруженное изображение может пониматься моделью по-разному, и это решается настройкой:

  • ремикс — обычный img2img, картинка как основа;
  • набросок — картинка как эскиз композиции, плюс ползунок «сила скетча»;
  • референс персонажа — из картинки берётся герой, а не композиция.

Режим наброска — массовая функция, а не экзотика. Нарисовали кривые линии в окне рисования, включили режим наброска — получили готовый кадр по вашей композиции. Как это выглядит на практике — в разделе Генератор.

Узнать запрос по картинке

Для этого есть отдельная кнопка — «Распознать промпт из картинки». Она живёт не над результатом, а на самом превью в блоке «Своё изображение»: загрузите картинку, и в левом нижнем углу превью появится значок с лупой.

Кнопка распознавания промпта

Распознанный запрос в поле ввода

Сервис прочитает изображение и напишет в поле запроса подробное описание — композиция, стиль, цвета, свет.

Описание не заменяет ваш запрос, а дописывается к нему — новым абзацем снизу. Если распознать несколько картинок подряд, описания будут копиться в поле.

Пишется описание на языке интерфейса и занимает около десятка секунд. На бесплатном тарифе кнопка вместо распознавания открывает витрину тарифов.

Это самый быстрый способ разобрать чужой приём. Понравилась работа в галерее — отправьте её в «Своё изображение», нажмите лупу и посмотрите, какими словами описывается то, что вы видите.

Второй путь — ИИ-чат: у готовой работы есть кнопка «Обсудить с ИИ в чате». Там можно не просто получить описание, а спросить, что именно изменить. Нужна модель с меткой VISION — см. ИИ-чат.

Работа с видео

Оживить фото под музыку и задать движение камеры

У части видео-моделей есть режим «оживить фото под аудио» и отдельный выбор движения камеры списком.

Движение камеры выбирается из списка, а не описывается словами — не нужно угадывать формулировку промпта.

Говорящий аватар с озвучкой текста

Путей два, и они принципиально разные.

Первый — готовым звуком. Модель просит фото персонажа и звуковую дорожку, а губы подгоняет под неё сама. Такие модели ищутся по метке AVATAR.

Модель говорящего аватара: слоты «Аудио» и «Фото персонажа»

Второй — текстом. Есть модель, где текст сразу превращается в речь внутри видео: включаете озвучку, пишете текст, выбираете голос и язык, а стиль речи задаёте словами. Отдельная генерация аудио не нужна.

У таких моделей длительность ролика определяется речью — а значит, и цена. Длинный текст = длинный ролик = дороже.

Ролик из нескольких сцен

У ряда видео-моделей есть мультипромпт: сценарий описывается сценами, а не одной фразой. Там же выбирается тип кадрирования — крупность плана берётся из списка, а не описывается словами.

У части моделей есть галочка нативного звука, и в её описании прямо сказано: звук генерируется вместе с видео и стоит дороже за секунду.

Заменить объект в готовом ролике

Есть модели, которые редактируют готовое видео, а не генерируют с нуля: заменяют персонажа или объект. У них встречаются настройки «оставить звуковую дорожку исходника» и синхрон по звуку — подгонка движения губ под звук.

Модель редактирования видео: слот «Исходное видео»

Не путайте «Исходное видео» с «Референсами (видео)». В первый слот идёт ролик, который вы правите, во второй — ролик-образец, у которого берут только манеру движения. Слоты выглядят одинаково, а результат противоположный.

У исходного клипа есть предел длительности, и он написан прямо в подписи к полю — обычно это несколько секунд снизу и не больше получаса сверху. Длинный ролик такие модели не возьмут: режьте нужный кусок заранее.

Продолжить свой ролик и другие видео-настройки

  • продолжение ролика с его последних кадров — дороже обычной генерации;
  • рефрейм готового клипа — перекадрировать уже снятое, не переснимая;
  • рендер в 1080p — отдельная платная галочка, без неё 720p;
  • битрейт — выше значит больше деталей в движении и тяжелее файл;
  • до 60 кадров в секунду;
  • HDR — расширенный динамический диапазон;
  • зацикливание — готовый ответ на «как сделать бесшовную гифку или фон»;
  • как вписывать исходник — полями или заполнением кадра;
  • экспорт в профессиональный формат для монтажа — для тех, кто знает, зачем.

Отдельно стоит предел короткой стороны: он задаёт размер иначе, чем обычное разрешение, и вместе с выбором разрешения не работает — что-то одно.

Работа со звуком

Три вида аудио-моделей

Аудио-модели делятся на три группы, и от группы зависит и набор настроек, и способ оплаты:

  • озвучка текста — текст в речь, клонирование голоса;
  • музыка — трек по описанию, с текстом песни или без;
  • звуковые эффекты — отдельные звуки, не музыка и не речь.

Не ищите «звук дождя» в музыкальной модели — под эффекты есть своя, и результат будет совсем другим. Кубик случайного примера тоже подставляет разное в зависимости от группы.

Выбрать готовый голос

У моделей озвучки список голосов приходит готовым: у одних их единицы, у других десятки, а рядом часто стоит список языков.

Это принципиально другой путь, чем клонирование: не нужно ничего записывать. Нужен просто «нормальный голос» — берите модель с большим списком и слушайте пресеты. Клонирование нужно, только когда голос должен быть конкретным.

Клонировать голос — три разных задачи

Это не одна возможность, а три, и их легко перепутать:

Модель клонирования голоса: слот образца и настройки речи

  1. скопировать конкретный голос — загрузите или запишите фрагмент чистой речи; расшифровывать сказанное не нужно, транскрипт определится сам. Допустимая длина у каждой модели своя — у одной от секунды до полутора минут, у другой 5–30 секунд, — и написана прямо в подписи под полем;
  2. озвучить этим голосом другой язык — отдельная настройка для дубляжа;
  3. придумать голос с нуля словами — «тёплый мужской голос, спокойный темп».

У части моделей загрузка своего голоса отключает выбор пресета — эти два пути взаимоисключающие.

Записать образец можно прямо в браузере — в блоке голоса есть кнопка микрофона.

Несколько голосов в одной озвучке

У части моделей можно загрузить до трёх образцов речи и ссылаться на них прямо в тексте промпта — как @Audio1, @Audio2, @Audio3.

Это диалог двух-трёх персонажей одной генерацией, а не три отдельные озвучки, которые потом надо склеивать. Сам синтаксис живёт в подписи к полю, которую никто не читает.

Образцы берите одинакового качества и без музыки на фоне: модель повторяет и тембр, и эмоцию — спокойный образец даст спокойную реплику.

Рядом обычно есть «Скорость речи», «Высота тона» (сдвиг на октаву вверх и вниз) и «Громкость». Все три не отправляются, пока стоят по умолчанию, — трогать их стоит осознанно.

Написать песню

Музыкальные модели — это полноценная студия: свой текст песни, темп, тональность, размер такта и язык вокала.

Настройки музыкальной модели: темп, текст песни, тональность, размер такта

У поля текста есть свой предел длины, и у разных моделей он разный — счётчик показан прямо в поле. Заранее это не видно, поэтому длинную песню лучше проверять по счётчику, а не по ощущению.

Размечайте текст тегами секций[Intro], [Verse], [Chorus], [Bridge], [Outro], [Inst]. Без тегов получается каша, с тегами — песня со структурой.

Теги в разных моделях подсказаны на разных языках. В одной линейке в пустом поле стоит [Куплет] / [Припев], в другой — [Verse] / [Chorus]. Скопируете русские теги в англоязычную модель — она прочитает их как текст песни. Правило простое: пишите теги ровно так, как они стоят в подсказке того поля, в котором вы находитесь.

Хотите минус — включите «Инструментал». Поля текста при этом пропадают целиком, и это не сбой: инструменталу текст не нужен. Выключите обратно — поля вернутся с прежним текстом.

Кавер и ремикс своей песни

Отдельная возможность, о которой не пишут: у части музыкальных моделей есть поле исходного трека — модель сделает по нему кавер или ремикс.

Длительность берётся из трека — а значит, и цена. Загрузили пятиминутную песню — платите за пять минут.

Референсное аудио означает четыре разные вещи

Одно и то же по названию поле у разных моделей делает разное: клонирует голос, делает кавер по треку, клонирует голос диалога или принимает до трёх образцов для нескольких голосов. Читайте подпись под полем — она всегда объясняет, что именно ждёт эта модель.

Озвучить свой ролик: звуки под картинку

Модель звуковых эффектов принимает на вход видео: «прикрепите ролик — эффекты будут синхронизированы с картинкой».

Это единственное место в сервисе, где на вход даёшь видео, а на выходе получаешь звук. Угадать это невозможно: модель лежит во вкладке «Аудио», а начинать надо с ролика.

Сценарий целиком: сделали ролик → скачали → переключились на аудио → выбрали модель эффектов → приложили ролик → описали, что должно звучать.

Смонтировать звук в ролик сервис не умеет — на выходе отдельный аудиофайл. Соединять придётся в любом видеоредакторе. Поле с роликом необязательное: без него та же модель делает звук просто по описанию.

Для эффектов описывайте событие, а не настроение: «шаги по гравию, три шага» работает, «атмосферно и тревожно» — нет.

Настройки, которые встречаются повсюду

«Авто-улучшение промпта» под разными именами

Одна и та же по смыслу настройка называется у разных моделей по-разному: авто-улучшение промпта, расширение промпта, улучшение промпта, «улучшить промпт», magic prompt. Смысл один: перед генерацией ваш запрос расширяет и уточняет отдельная модель.

У музыкальных моделей та же настройка называется «Авто-текст» и работает не с промптом, а с текстом песни — дорабатывает написанные вами строки.

И у этого есть последствие, о котором сказано прямо в описании: авто-улучшение влияет на воспроизводимость. То есть с включённой настройкой один и тот же «Шум» не даст тот же кадр — вот прямой ответ на «почему у меня не повторяется результат».

Добиваетесь повторяемости — выключите авто-улучшение и задайте «Шум». Ищете идеи — наоборот, включите и не задавайте.

У части моделей есть ещё и режим расширения: прямое — быстрое дополнение, агентное — более глубокая переработка, недоступная вместе с референсами.

Скорость против качества — под пятью именами

Помимо общего «Режима творчества» у моделей встречаются свои настройки того же смысла: скорость рендеринга (турбо / обычный / качественный), уровень качества, «ускоренная генерация», глубина размышления, «креативность» от буквальной до максимальной, а у текстовых моделей — развёрнутость ответа.

Это не то же самое, что «Режим творчества»: тот общий для сервиса, а эти живут в «Дополнительно» конкретной модели. Человек обычно крутит оба и путается. И помните: у части моделей максимальный уровень стоит дороже — это прямо написано в описании поля.

Модели, которые ищут в интернете

У некоторых картиночных моделей есть даже два отдельных переключателя: «Веб-поиск» — модель сверяется с актуальными фактами и событиями, — и «Поиск изображений», когда ей нужны визуальные референсы. Включаются они независимо.

Это не тот же веб-поиск, что в чате. Там модель ищет ответ, здесь — факты и референсы для изображения. Различие тонкое, но переключатель искать надо в разных местах.

Ссылки на файлы в промпте

У отдельных моделей под загруженным файлом появляется кнопка со значком собачки: она вставляет в промпт ссылку вида @Image1, чтобы модель поняла, о каком именно файле речь. Нумерация идёт по порядку загрузки.

Кнопка есть далеко не у всех моделей. И синтаксис у аудио другой — там @Audio1. Не перепутайте.

Обязательные поля и почему кнопка не нажимается

Часть моделей требует загрузку обязательно: исходный клип, голос, фото человека, одежду. Такие поля помечены звёздочкой и подсвечиваются, пока не заполнены.

Это одна из частых причин «кнопка Создать не нажимается» — наряду со слишком коротким промптом. Полный список причин — в Если что-то не работает.

Настройки, меняющиеся от загруженного файла

У отдельных моделей при загрузке референса список размеров сужается, а часть настроек пропадает: провайдер не принимает их вместе с референсом. Это редкость, но встречается.

Куда дальше

Редактировать на GitHub