Пополни на 250 ₽

Пополни баланс на 250 рублей и получи 30 руб. бонусом

Пополнить

Пример промпта для изображения

Блог
AI аватар из фото: сравнили 4 нейросети на одном тесте

AI аватар из фото: сравнили 4 нейросети на одном тесте

Прогнали одно фото и одну дорожку через MiniMax, InfiniteTalk, Kling и OmniHuman. Смотрим, кто лучше сохраняет лицо, а кто работает с кадром, и считаем стоимость видео.

мин
veosuno

AI аватар — это видео, где человек с фотографии говорит или поёт под загруженную вами звуковую дорожку. В VeoSuno за такие ролики отвечают четыре модели, и выбрать между ними по описаниям на витрине невозможно: у всех написано примерно одно и то же.

Поэтому мы прогнали через них один и тот же материал. Одна фотография, одна дорожка на десять секунд, один промпт. Ниже — пять готовых роликов и всё, что мы намерили.

Условия теста

Все генерации сделаны на одинаковых входных данных. Это принципиально: разница в результате объясняется моделью, а не разными исходниками.

Звуковая дорожка — припев фирменного трека VeoSuno с женским вокалом, ровно десять секунд.

Фотография — вертикальный кадр 2:3, диджей за пультом на фоне неоновой вывески.

Диджей за пультом — AI аватар

Промпт описывал сцену, а не речь. За артикуляцию отвечает аудиофайл, за всё остальное — текст:

A blonde DJ with tattooed arms stands behind her mixer and sings the chorus straight into the room, chin lifting slightly on the long notes. Her head and shoulders move with the beat, her right hand rests on the mixer, her left hand rides a fader. Behind her the neon VeoSuno sign glows and thin laser lines drift across the wall, haze moving slowly through the light. The camera pushes in a few centimetres, very slowly, and settles. Shot on a 50mm lens, shallow depth of field, natural film grain, soft bloom around the neon, warm practical light on her face, real skin texture with visible pores and stray hairs, her braided strands swaying slightly. Cinematic music video look, not a 3D render, not a video game.

Одно отступление: у OmniHuman 1.5 поле промпта вмещает всего 300 символов, поэтому там пришлось оставить только первые три предложения. Инструкция о движении камеры в них не попала.

Все пять генераций разом

Здесь удобнее один раз посмотреть, чем читать описания:

Слева сверху — MiniMax, он единственный переделал вертикальное фото в горизонтальный кадр. Остальные сохранили пропорции снимка, поэтому идут вертикальными плитками.

Сводная таблица

Параметр MiniMax H3 avatars InfiniteTalk AI Kling AI Avatar 2.0 OmniHuman 1.5
Разрешение 768P / 2K 480p / 720p 720p / 1080p 720p / 1080p
Кадров в секунду 24 25 30 25
Длительность 4–15 сек, ползунком равна аудио равна аудио равна аудио
Соотношение сторон восемь вариантов от фото от фото от фото
Лимит промпта 7000 символов 2500 символов 2500 символов 300 символов
Звук на выходе стерео моно 16 кГц стерео моно
Движение камеры выполняет не выполняет выполняет не проверяли
Трогает ли кадр достраивает сцену не трогает не трогает переписывает фон

Сколько стоит AI аватар

Цена везде считается за секунду готового ролика и зависит от разрешения. Исключение — OmniHuman: у него 720p и 1080p стоят одинаково.

Модель и режим За секунду Ролик на 10 секунд
InfiniteTalk AI, 480p 6 ₽ 60 ₽
MiniMax H3 avatars, 768P 12 ₽ 120 ₽
Kling AI Avatar 2.0 standart 16 ₽ 160 ₽
MiniMax H3 avatars, 2K 19 ₽ 190 ₽
InfiniteTalk AI, 720p 24 ₽ 240 ₽
Kling AI Avatar 2.0 pro 32 ₽ 320 ₽
OmniHuman 1.5, 720p и 1080p 40 ₽ 400 ₽

Разброс почти семикратный: от 60 до 400 ₽ за одинаковые десять секунд.

Обратите внимание на InfiniteTalk. В 480p это самая доступная модель каталога, но переход на 720p удорожает ролик вчетверо — и он становится дороже, чем MiniMax в полноценном 2K.

Что получилось у каждой модели

MiniMax H3 avatars

Единственная модель, которая выдаёт 2K, и единственная, которая меняет формат кадра. Мы задали 16:9 при вертикальном исходнике — она достроила боковые стены с лазерами, вторую пару колонок и продолжение подиума, сохранив героиню, вывеску и пульт нетронутыми.

Наезд камеры из промпта отработала: к финалу лицо в кадре заметно крупнее. Побочный эффект — верх неоновой вывески к концу подрезается краем кадра.

Подробный разбор — в статье про MiniMax H3 avatars.

InfiniteTalk AI

Полная противоположность предыдущей. Кадр не тронула вообще: композиция, свет, вывеска и колонки остались ровно как на снимке, только ожили. Камеру не двинула, хотя наезд в промпте был — эта модель занимается героем, а не съёмкой.

Артикуляция попадает в вокал, но картинка в 480p мягкая: ресницы, поры и рисунок татуировок смазаны. И звук пережимается в моно 16 кГц — для речи почти незаметно, для музыки слышно.

Подробный разбор — в статье про InfiniteTalk AI.

Kling AI Avatar 2.0 standart и pro

Две версии одной модели, разница только в разрешении и цене. Обе отработали наезд камеры и обе сохранили звук как есть.

Общая для них особенность видна сразу: модель придумывает мимику. На фотографии героиня смотрит в камеру спокойно, почти строго, а в роликах широко улыбается, и глаза значительную часть времени закрыты. Ни в снимке, ни в промпте этого нет.

Черты лица к финалу тоже уходят от оригинала: овал, скулы и подбородок меняются. У pro расхождение мягче и первые секунды ближе к исходнику, у standart заметнее.

Подробный разбор — в статье про Kling AI Avatar 2.0.

OmniHuman 1.5

Лучше всех сохранила лицо: героиня узнаётся на всём протяжении ролика. Мимика сдержанная и идёт за вокальной линией, без выдуманной улыбки.

Отдельно стоит отметить жест: на шестой секунде модель сама поднимает руку к груди, сжав кулак. В промпте этого нет.

Зато фон переписала сильнее всех — редкие оранжевые лазеры превратились в плотный веер розово-пурпурных лучей, и рисунок меняется по ходу ролика.

Подробный разбор — в статье про OmniHuman 1.5.

Что выбрать под задачу

Универсального ответа нет, и это главный вывод теста. У каждой модели своя логика, и то, что в одной задаче достоинство, в другой мешает.

  • Нужен большой экран или другой формат кадра. MiniMax H3 avatars — 2K и восемь соотношений сторон на выбор.
  • Кадр уже собран, его надо просто оживить. InfiniteTalk AI в 480p ничего не переделает и обойдётся дешевле всех.
  • Важно портретное сходство. OmniHuman 1.5 держит лицо лучше остальных.
  • Нужен длинный ролик. У Kling AI Avatar 2.0 pro заявлены генерации до пяти минут.
  • Проверить идею перед дорогой генерацией. Прогон в InfiniteTalk за 60 ₽ покажет, ложится ли дорожка на лицо.

Итог

  • Разброс цен почти семикратный, при этом дороже не значит лучше: самая дорогая модель теста не выиграла ни по одному параметру, кроме сохранения лица.
  • Модели по-разному относятся к вашему кадру: одна достраивает сцену, две не трогают, одна переписывает фон.
  • Половина моделей выполняет указания о движении камеры, половина игнорирует.
  • Половина сохраняет стереозвук, половина сводит в моно.
  • Мимику модели додумывают сами, и это невозможно предсказать по описанию — только проверить.

Последнее и есть главное. Наш тест показывает, как модели ведут себя на одном конкретном снимке и одной дорожке. С вашим лицом, вашим кадром и вашим голосом расклад может оказаться другим — поэтому лучший способ выбрать модель это прогнать через две-три короткие генерации свой собственный материал.

Как попробовать

Все четыре модели доступны в каталоге: MiniMax H3 avatars, InfiniteTalk AI, Kling AI Avatar 2.0 standart и pro, OmniHuman 1.5.

Дорожку необязательно записывать самому: трек можно собрать с нуля, сделать кавером готовой песни или вырастить из собственной демозаписи.

Совет: Начинайте с минимального разрешения и короткой дорожки. Тест на несколько десятков рублей покажет, справляется ли модель именно с вашим лицом, — а это выясняется только на практике.

Если вы ещё не генерировали видео, начните с пошагового гайда для новичка.

FAQ: частые вопросы об AI аватарах

Что такое AI аватар

AI аватар — видео, в котором человек с фотографии говорит или поёт под заранее записанную звуковую дорожку. Модель синхронизирует губы со звуком и добавляет мимику, повороты головы и движения плеч. Голос берётся из вашего файла, а не синтезируется.

Сколько стоит создать AI аватара

От 60 до 400 ₽ за ролик на десять секунд, в зависимости от модели и разрешения. Цена везде считается за секунду готового видео: от 6 ₽ у InfiniteTalk AI в 480p до 40 ₽ у OmniHuman 1.5.

Можно ли сделать AI аватар бесплатно

В VeoSuno генерация платная, бесплатного тарифа нет. Но минимальный тест обходится недорого: десять секунд в InfiniteTalk AI стоят 60 ₽, и этого достаточно, чтобы понять, справляется ли модель с вашим фото.

Какая модель лучше сохраняет лицо

В нашем тесте лучше всех держала портретное сходство OmniHuman 1.5. Kling AI Avatar 2.0 к финалу ролика заметнее других менял черты лица. При этом результат зависит от исходного снимка, поэтому свой кадр стоит проверить отдельно.

Что нужно, чтобы создать видео аватар AI

Три вещи: фотография героя, звуковая дорожка в MP3, WAV или OGG и короткое описание сцены. Студийное качество снимка не обязательно, важнее крупность лица в кадре.

Можно ли получить горизонтальный ролик из вертикального фото

Да, но только в MiniMax H3 avatars: там соотношение сторон выбирается отдельно от пропорций снимка, а недостающую часть сцены модель достраивает. Остальные модели наследуют формат исходного изображения.

Сколько длится ролик с AI аватаром

У трёх моделей длительность равна длительности загруженной дорожки, поэтому аудио нужно подрезать заранее. У MiniMax H3 avatars длина задаётся ползунком и ограничена пятнадцатью секундами.