Липсинк вышел за пределы аватаров и добрался до дубляжа
Синхронизация артикуляции с готовой звуковой дорожкой заметно подтянулась и переехала из нишевых сервисов говорящих голов в обычный производственный цикл. Типичный сценарий выглядит так: снятое или сгенерированное видео, отдельно записанная озвучка, а губы подгоняются под неё уже постфактум.
Основной спрос идёт от локализации. Переозвученный на другом языке ролик с несведённой артикуляцией смотрится дёшево, и правка губ оказывается заметно дешевле пересъёмки.
Где синхронизация ещё выдаёт себя
Слабые места держатся в одних и тех же точках. Взрывные согласные и резкие смыкания губ модели воспроизводят убедительно, а вот длинные гласные и паузы часто дают вялую, недоартикулированную мимику, из-за которой лицо выглядит отстранённым от речи.
Второй устойчивый дефект — рассинхрон мимики и остального лица: губы двигаются точно, а брови, скулы и дыхание остаются неподвижными. Именно этот разрыв, а не сама артикуляция, обычно и создаёт ощущение подделки.
Что это значит
Подробности и первичное описание опубликованы на странице как добиться читаемого текста на картинке, там же собраны условия доступа и ограничения, о которых заявили разработчики.
Похожие материалы и обновления по теме мы собираем в разделе «Генерация видео нейросетями» — он пополняется по мере выхода новых сообщений.