Липсинк вышел за пределы аватаров и добрался до дубляжа

Синхронизация артикуляции с готовой звуковой дорожкой заметно подтянулась и переехала из нишевых сервисов говорящих голов в обычный производственный цикл. Типичный сценарий выглядит так: снятое или сгенерированное видео, отдельно записанная озвучка, а губы подгоняются под неё уже постфактум.

Основной спрос идёт от локализации. Переозвученный на другом языке ролик с несведённой артикуляцией смотрится дёшево, и правка губ оказывается заметно дешевле пересъёмки.

Где синхронизация ещё выдаёт себя

Слабые места держатся в одних и тех же точках. Взрывные согласные и резкие смыкания губ модели воспроизводят убедительно, а вот длинные гласные и паузы часто дают вялую, недоартикулированную мимику, из-за которой лицо выглядит отстранённым от речи.

Второй устойчивый дефект — рассинхрон мимики и остального лица: губы двигаются точно, а брови, скулы и дыхание остаются неподвижными. Именно этот разрыв, а не сама артикуляция, обычно и создаёт ощущение подделки.

Что это значит

Подробности и первичное описание опубликованы на странице как добиться читаемого текста на картинке, там же собраны условия доступа и ограничения, о которых заявили разработчики.

Похожие материалы и обновления по теме мы собираем в разделе «Генерация видео нейросетями» — он пополняется по мере выхода новых сообщений.