Прогнали одно фото и одну дорожку через MiniMax, InfiniteTalk, Kling и OmniHuman. Смотрим, кто лучше сохраняет лицо, а кто работает с кадром, и считаем стоимость видео.
AI аватар — это видео, где человек с фотографии говорит или поёт под загруженную вами звуковую дорожку. В VeoSuno за такие ролики отвечают четыре модели, и выбрать между ними по описаниям на витрине невозможно: у всех написано примерно одно и то же.
Поэтому мы прогнали через них один и тот же материал. Одна фотография, одна дорожка на десять секунд, один промпт. Ниже — пять готовых роликов и всё, что мы намерили.
Все генерации сделаны на одинаковых входных данных. Это принципиально: разница в результате объясняется моделью, а не разными исходниками.
Звуковая дорожка — припев фирменного трека VeoSuno с женским вокалом, ровно десять секунд.
Фотография — вертикальный кадр 2:3, диджей за пультом на фоне неоновой вывески.
Промпт описывал сцену, а не речь. За артикуляцию отвечает аудиофайл, за всё остальное — текст:
A blonde DJ with tattooed arms stands behind her mixer and sings the chorus straight into the room, chin lifting slightly on the long notes. Her head and shoulders move with the beat, her right hand rests on the mixer, her left hand rides a fader. Behind her the neon VeoSuno sign glows and thin laser lines drift across the wall, haze moving slowly through the light. The camera pushes in a few centimetres, very slowly, and settles. Shot on a 50mm lens, shallow depth of field, natural film grain, soft bloom around the neon, warm practical light on her face, real skin texture with visible pores and stray hairs, her braided strands swaying slightly. Cinematic music video look, not a 3D render, not a video game.
Одно отступление: у OmniHuman 1.5 поле промпта вмещает всего 300 символов, поэтому там пришлось оставить только первые три предложения. Инструкция о движении камеры в них не попала.
Здесь удобнее один раз посмотреть, чем читать описания:
Слева сверху — MiniMax, он единственный переделал вертикальное фото в горизонтальный кадр. Остальные сохранили пропорции снимка, поэтому идут вертикальными плитками.
| Параметр | MiniMax H3 avatars | InfiniteTalk AI | Kling AI Avatar 2.0 | OmniHuman 1.5 |
|---|---|---|---|---|
| Разрешение | 768P / 2K | 480p / 720p | 720p / 1080p | 720p / 1080p |
| Кадров в секунду | 24 | 25 | 30 | 25 |
| Длительность | 4–15 сек, ползунком | равна аудио | равна аудио | равна аудио |
| Соотношение сторон | восемь вариантов | от фото | от фото | от фото |
| Лимит промпта | 7000 символов | 2500 символов | 2500 символов | 300 символов |
| Звук на выходе | стерео | моно 16 кГц | стерео | моно |
| Движение камеры | выполняет | не выполняет | выполняет | не проверяли |
| Трогает ли кадр | достраивает сцену | не трогает | не трогает | переписывает фон |
Цена везде считается за секунду готового ролика и зависит от разрешения. Исключение — OmniHuman: у него 720p и 1080p стоят одинаково.
| Модель и режим | За секунду | Ролик на 10 секунд |
|---|---|---|
| InfiniteTalk AI, 480p | 6 ₽ | 60 ₽ |
| MiniMax H3 avatars, 768P | 12 ₽ | 120 ₽ |
| Kling AI Avatar 2.0 standart | 16 ₽ | 160 ₽ |
| MiniMax H3 avatars, 2K | 19 ₽ | 190 ₽ |
| InfiniteTalk AI, 720p | 24 ₽ | 240 ₽ |
| Kling AI Avatar 2.0 pro | 32 ₽ | 320 ₽ |
| OmniHuman 1.5, 720p и 1080p | 40 ₽ | 400 ₽ |
Разброс почти семикратный: от 60 до 400 ₽ за одинаковые десять секунд.
Обратите внимание на InfiniteTalk. В 480p это самая доступная модель каталога, но переход на 720p удорожает ролик вчетверо — и он становится дороже, чем MiniMax в полноценном 2K.
Единственная модель, которая выдаёт 2K, и единственная, которая меняет формат кадра. Мы задали 16:9 при вертикальном исходнике — она достроила боковые стены с лазерами, вторую пару колонок и продолжение подиума, сохранив героиню, вывеску и пульт нетронутыми.
Наезд камеры из промпта отработала: к финалу лицо в кадре заметно крупнее. Побочный эффект — верх неоновой вывески к концу подрезается краем кадра.
Подробный разбор — в статье про MiniMax H3 avatars.
Полная противоположность предыдущей. Кадр не тронула вообще: композиция, свет, вывеска и колонки остались ровно как на снимке, только ожили. Камеру не двинула, хотя наезд в промпте был — эта модель занимается героем, а не съёмкой.
Артикуляция попадает в вокал, но картинка в 480p мягкая: ресницы, поры и рисунок татуировок смазаны. И звук пережимается в моно 16 кГц — для речи почти незаметно, для музыки слышно.
Подробный разбор — в статье про InfiniteTalk AI.
Две версии одной модели, разница только в разрешении и цене. Обе отработали наезд камеры и обе сохранили звук как есть.
Общая для них особенность видна сразу: модель придумывает мимику. На фотографии героиня смотрит в камеру спокойно, почти строго, а в роликах широко улыбается, и глаза значительную часть времени закрыты. Ни в снимке, ни в промпте этого нет.
Черты лица к финалу тоже уходят от оригинала: овал, скулы и подбородок меняются. У pro расхождение мягче и первые секунды ближе к исходнику, у standart заметнее.
Подробный разбор — в статье про Kling AI Avatar 2.0.
Лучше всех сохранила лицо: героиня узнаётся на всём протяжении ролика. Мимика сдержанная и идёт за вокальной линией, без выдуманной улыбки.
Отдельно стоит отметить жест: на шестой секунде модель сама поднимает руку к груди, сжав кулак. В промпте этого нет.
Зато фон переписала сильнее всех — редкие оранжевые лазеры превратились в плотный веер розово-пурпурных лучей, и рисунок меняется по ходу ролика.
Подробный разбор — в статье про OmniHuman 1.5.
Универсального ответа нет, и это главный вывод теста. У каждой модели своя логика, и то, что в одной задаче достоинство, в другой мешает.
Последнее и есть главное. Наш тест показывает, как модели ведут себя на одном конкретном снимке и одной дорожке. С вашим лицом, вашим кадром и вашим голосом расклад может оказаться другим — поэтому лучший способ выбрать модель это прогнать через две-три короткие генерации свой собственный материал.
Все четыре модели доступны в каталоге: MiniMax H3 avatars, InfiniteTalk AI, Kling AI Avatar 2.0 standart и pro, OmniHuman 1.5.
Дорожку необязательно записывать самому: трек можно собрать с нуля, сделать кавером готовой песни или вырастить из собственной демозаписи.
Совет: Начинайте с минимального разрешения и короткой дорожки. Тест на несколько десятков рублей покажет, справляется ли модель именно с вашим лицом, — а это выясняется только на практике.
Если вы ещё не генерировали видео, начните с пошагового гайда для новичка.
AI аватар — видео, в котором человек с фотографии говорит или поёт под заранее записанную звуковую дорожку. Модель синхронизирует губы со звуком и добавляет мимику, повороты головы и движения плеч. Голос берётся из вашего файла, а не синтезируется.
От 60 до 400 ₽ за ролик на десять секунд, в зависимости от модели и разрешения. Цена везде считается за секунду готового видео: от 6 ₽ у InfiniteTalk AI в 480p до 40 ₽ у OmniHuman 1.5.
В VeoSuno генерация платная, бесплатного тарифа нет. Но минимальный тест обходится недорого: десять секунд в InfiniteTalk AI стоят 60 ₽, и этого достаточно, чтобы понять, справляется ли модель с вашим фото.
В нашем тесте лучше всех держала портретное сходство OmniHuman 1.5. Kling AI Avatar 2.0 к финалу ролика заметнее других менял черты лица. При этом результат зависит от исходного снимка, поэтому свой кадр стоит проверить отдельно.
Три вещи: фотография героя, звуковая дорожка в MP3, WAV или OGG и короткое описание сцены. Студийное качество снимка не обязательно, важнее крупность лица в кадре.
Да, но только в MiniMax H3 avatars: там соотношение сторон выбирается отдельно от пропорций снимка, а недостающую часть сцены модель достраивает. Остальные модели наследуют формат исходного изображения.
У трёх моделей длительность равна длительности загруженной дорожки, поэтому аудио нужно подрезать заранее. У MiniMax H3 avatars длина задаётся ползунком и ограничена пятнадцатью секундами.