Разбираем, как работает InfiniteTalk AI — доступная модель для липсинка и создания говорящих аватаров. Сравниваем результаты, смотрим на цены и особенности настройки.
Оживить фотографию так, чтобы человек на ней действительно заговорил или запел, — задача из раздела липсинка. InfiniteTalk AI решает её дешевле всех остальных моделей каталога: наш ролик на десять секунд стоил примерно как чашка кофе.
Мы прогнали через неё ровно тот же тест, что и через MiniMax H3 avatars — то же фото, ту же дорожку, тот же промпт. Дальше можно сравнивать напрямую.
Слайдера длительности нет. Ролик длится ровно столько же, сколько загруженная дорожка. Удобно, но подрезать звук нужно заранее: рычага, которым можно ограничить ролик, у вас не будет.
Соотношение сторон задавать не нужно. Как только вы загружаете фотографию, выбор формата исчезает: ролик наследует пропорции снимка. Вертикальное фото даёт вертикальный ролик, и никак иначе.
Настроек здесь вообще минимум: изображение, аудио, описание сцены и разрешение. Ошибиться почти негде.
Мы взяли ту же вертикальную фотографию диджея за пультом.
И тот же припев фирменного трека VeoSuno, подрезанный ровно до десяти секунд.
Припев фирменного трека VeoSuno, подрезанный до 10 секунд:
Промпт использовали тот же самый:
A blonde DJ with tattooed arms stands behind her mixer and sings the chorus straight into the room, chin lifting slightly on the long notes. Her head and shoulders move with the beat, her right hand rests on the mixer, her left hand rides a fader. Behind her the neon VeoSuno sign glows and thin laser lines drift across the wall, haze moving slowly through the light. The camera pushes in a few centimetres, very slowly, and settles. Shot on a 50mm lens, shallow depth of field, natural film grain, soft bloom around the neon, warm practical light on her face, real skin texture with visible pores and stray hairs, her braided strands swaying slightly. Cinematic music video look, not a 3D render, not a video game.
Разрешение выбрали 480p — минимальное, чтобы посмотреть, что модель отдаёт за минимальные деньги. Ролик обошёлся в 60 ₽.
Кадр остался кадром. Модель ничего не дорисовала и не переставила: композиция, свет, вывеска, колонки — всё ровно как на исходной фотографии, только ожившее. Что загрузили, то и получили в движении.
Камера не поехала. В промпте был описан медленный наезд, но ролик остался статичным. Это логика модели: она занимается героем, а не съёмкой. Промпт здесь влияет на поведение персонажа, а не на движение камеры.
Артикуляция попадает в вокал. Рот открывается под голос, губы идут за фразой. С пением модель справляется, не только с речью.
Картинка мягкая. 480p есть 480p: лицо узнаваемо, но ресницы, поры и рисунок татуировок смазаны. На общем плане, где голова занимает малую часть кадра, это видно сильнее всего.
Звук пережимается. Мы загружали стерео 44,1 кГц, а получили моно 16 кГц. Для речи разница почти незаметна, а музыка теряет верх и объём. Если делаете клип, звук лучше подложить отдельно при монтаже.
Цена считается за секунду готового ролика и зависит только от разрешения:
| Разрешение | За секунду | Ролик на 10 секунд |
|---|---|---|
| 480p | 6 ₽ | 60 ₽ |
| 720p | 24 ₽ | 240 ₽ |
Обратите внимание на разрыв между режимами. Переход с 480p на 720p удорожает ролик вчетверо. Наш десятисекундный ролик в 480p обошёлся в 60 ₽, он же в 720p стоил бы 240 ₽.
Практический вывод: 480p здесь не запасной вариант, а основной рабочий режим — именно в нём модель даёт то соотношение цены и результата, ради которого её стоит выбирать. Если задача требует картинки чётче, имеет смысл сравнить цену с другими моделями раздела: ссылки на разборы в конце статьи.
Модель доступна в каталоге — открывайте InfiniteTalk AI и загружайте фотографию с дорожкой.
Дорожку можно собрать с нуля, сделать кавером готовой песни или вырастить из демозаписи.
Совет: Кадрируйте фотографию до среднего плана заранее. Формат, длительность и движение камеры вы здесь не контролируете — единственный рычаг, которым можно улучшить результат, это сам исходный снимок.
Остальные модели раздела мы разбираем на том же тесте: Kling AI Avatar 2.0 даёт 1080p и ролики до пяти минут, OmniHuman 1.5 делает упор на мимику и жесты. Если раньше не работали с генерацией видео, начните с общего гайда.
InfiniteTalk AI — модель, которая оживляет фотографию под загруженную звуковую дорожку: синхронизирует губы, мимику, повороты головы и движения тела. Это самый доступный способ получить говорящего аватара в каталоге.
6 ₽ за секунду в 480p и 24 ₽ в 720p. Десятисекундный ролик обойдётся в 60 ₽ или 240 ₽ соответственно. Разница между режимами четырёхкратная, поэтому 480p здесь основной рабочий режим.
Длительность равна длительности загруженной звуковой дорожки — отдельного ползунка в интерфейсе нет. Поэтому обрезать аудио нужно заранее, до генерации.
Никак — ролик наследует пропорции загруженного снимка. Вертикальное фото даёт вертикальное видео, горизонтальное — горизонтальное. Кадрировать нужно до загрузки.
Нет. Модель занимается героем, а не съёмкой: композиция остаётся такой же, как на исходном снимке. Инструкции о наездах и панорамах в промпте она не выполняет.
Дорожка пережимается в моно 16 кГц. Для речи разница почти незаметна, а музыка теряет верх и объём — в клипе звук лучше подкладывать отдельно при монтаже.
Да, студийная съёмка не нужна. Важнее крупность: чем больше места занимает лицо в кадре, тем чище прорисовывается артикуляция.