Пополни на 250 ₽

Пополни баланс на 250 рублей и получи 30 руб. бонусом

Пополнить

Пример промпта для изображения

Блог
Говорящее видео из фото: Kling AI Avatar 2.0 pro и standart

Говорящее видео из фото: Kling AI Avatar 2.0 pro и standart

Разбираем модели Kling AI Avatar 2.0 от VeoSuno: как быстро оживить фотографию с помощью звуковой дорожки, чем отличается версия pro от standart и сколько стоит генерация видео.

мин
veosuno

Kling AI Avatar 2.0 делает из фотографии и звуковой дорожки говорящего героя. Модель существует в двух версиях, pro и standart, и различаются они ровно одним параметром — разрешением.

Особенность этой пары в другом: настраивать здесь практически нечего. Загружаете снимок, загружаете аудио, пишете описание сцены — и всё.

Что умеет

  • Оживляет фотографию под вашу звуковую дорожку: губы, мимика, повороты головы, движения плеч
  • Две версии: standart в 720p и pro в 1080p
  • Длительность ролика равна длительности аудио, у pro — до пяти минут
  • Аудио в MP3, WAV или OGG
  • Звук на выходе не пережимается: стереодорожка остаётся стереодорожкой
  • 30 кадров в секунду
  • Цена от 16 ₽ за секунду в версии standart и от 32 ₽ в pro

Настроек нет — и это осознанно

В интерфейсе всего три поля: изображение, аудио и описание сцены.

Ни слайдера длительности, ни выбора соотношения сторон, ни переключателя разрешения внутри модели. Формат ролика наследуется от пропорций снимка, длина — от длины дорожки, а разрешение вы выбираете в момент, когда решаете между standart и pro.

Ошибиться тут негде, но и подкрутить нечего. Единственный рычаг — сам исходный кадр и текст промпта.

Ещё одно ограничение стоит держать в голове: поле промпта вмещает 2500 символов. Для описания сцены этого с запасом, но детальную раскадровку по секундам, как в моделях для генерации с нуля, сюда уже не поместить.

Пример: диджей поёт припев

Мы взяли фирменный трек VeoSuno с женским вокалом, вырезали припев и привели файл ровно к десяти секундам.

Пример звуковой дорожки для оживления фото:

Фотография — вертикальный кадр 2:3, диджей за пультом на фоне неоновой вывески.

Диджей за пультом на фоне неоновой вывески говорящее видео

Промпт описывал не речь, а сцену вокруг неё:

A blonde DJ with tattooed arms stands behind her mixer and sings the chorus straight into the room, chin lifting slightly on the long notes. Her head and shoulders move with the beat, her right hand rests on the mixer, her left hand rides a fader. Behind her the neon VeoSuno sign glows and thin laser lines drift across the wall, haze moving slowly through the light. The camera pushes in a few centimetres, very slowly, and settles. Shot on a 50mm lens, shallow depth of field, natural film grain, soft bloom around the neon, warm practical light on her face, real skin texture with visible pores and stray hairs, her braided strands swaying slightly. Cinematic music video look, not a 3D render, not a video game.

Сначала прогнали через standart. Ролик 784×1168, 160 ₽:

Затем через pro с теми же файлами и тем же промптом. Ролик 1168×1760, 320 ₽:

Что получилось

Разрешение отрабатывает доплату. У pro картинка ощутимо детальнее: читается фактура кожи, рисунок татуировок на руках, надпись на футболке. У standart всё это заметно мягче, особенно на лице, которое в общем плане занимает малую часть кадра.

Камера слушается промпта. Обе версии отработали медленный наезд: к финалу героиня в кадре крупнее, напольные колонки из кадра уходят. Для моделей липсинка это не само собой разумеющееся.

Звук сохраняется без потерь. Мы загружали стерео 44,1 кГц и получили ровно его же. Для клипа это принципиально: пережатая дорожка обесценила бы всю работу над треком.

А вот с мимикой модель самовольничает. На исходной фотографии героиня смотрит в камеру спокойно, почти строго. В обоих роликах она широко улыбается, а глаза значительную часть хронометража закрыты — ни в снимке, ни в промпте этого нет, модель добавила настроение от себя. У pro первые секунды ближе к оригиналу, дальше расхождение растёт.

Черты лица плывут. Овал, скулы и подбородок к концу ролика отличаются от исходных. Героиня узнаётся, но это уже слегка другой человек. У standart расхождение сильнее, у pro мягче.

Совет: если для вас важно точное портретное сходство, берите фотографию, где лицо занимает больше места в кадре, и не рассчитывайте на длинный ролик — чем дольше идёт генерация, тем дальше уходит лицо от оригинала.

Сколько стоит генерация видео

Цена считается за секунду готового ролика:

Версия Разрешение За секунду Ролик на 10 секунд
standart 720p 16 ₽ 160 ₽
pro 1080p 32 ₽ 320 ₽

Зависимость линейная, скидок за длину нет. Ролик на минуту в standart обойдётся в 960 ₽, в pro — в 1920 ₽.

Отсюда рабочий порядок: сначала короткий прогон в standart, чтобы проверить, как модель обходится с вашим лицом и попадает ли артикуляция в звук, и только потом полная версия в pro.

Как попробовать

Обе версии доступны в каталоге — Kling AI Avatar 2.0 standart и Kling AI Avatar 2.0 pro.

Дорожку необязательно записывать самому: трек можно собрать с нуля, сделать кавером готовой песни или вырастить из собственной демозаписи.

Остальные модели раздела мы прогнали на том же фото и той же дорожке, так что результаты можно сравнить самому: MiniMax H3 avatars, InfiniteTalk AI, OmniHuman 1.5. Если раньше не работали с генерацией видео, начните с общего гайда.

FAQ: частые вопросы о Kling AI Avatar 2.0

Что такое Kling AI Avatar 2.0

Kling AI Avatar 2.0 — модель, которая делает из фотографии и звуковой дорожки говорящего героя. Существует в двух версиях: standart в 720p и pro в 1080p.

Чем pro отличается от standart

Разрешением и ценой. Pro выдаёт 1080p и стоит 32 ₽ за секунду, standart — 720p за 16 ₽. Набор настроек и логика работы у версий одинаковые.

Сколько стоит ролик в Kling AI Avatar 2.0

Десять секунд обойдутся в 160 ₽ в версии standart и в 320 ₽ в pro. Зависимость линейная, скидок за длину нет: минута стоит 960 ₽ и 1920 ₽ соответственно.

Какая максимальная длина ролика

Длительность равна длительности загруженной дорожки, отдельного ползунка нет. У версии pro заявлены ролики до пяти минут.

Сколько символов помещается в описание сцены

2500 символов. Этого хватает на подробное описание героя, обстановки и движения камеры, но детальную раскадровку по секундам сюда уже не поместить.

Двигается ли камера в ролике

Да, обе версии выполняют указания о движении камеры из промпта. В нашем тесте медленный наезд отработал: к финалу героиня в кадре заметно крупнее.

Что происходит со звуком на выходе

Дорожка сохраняется как есть, включая стерео и частоту дискретизации. Обе версии выдают видео с 30 кадрами в секунду.