Синхронизация звука с артикуляцией персонажа улучшилась на новой архитектуре

Видеомодель теперь учитывает аудиосигнал не только как контекстную информацию, но и как прямое управление параметрами движения лица и положения рта во время генерации. Ранее синхронизация требовала отдельного постпроцесса или использования дополнительных инструментов для выравнивания видео и звука.

Архитектурные изменения позволили модели лучше предсказывать микродвижения мышц лица в соответствии с фонемами и просодией речи, что значительно улучшило натуральность результата.

Применение в озвучивании

Синхронизированная генерация видео с одновременно созданным или заданным звуком упрощает создание контента для разных языков и ускоряет локализацию готовых материалов.

Улучшенная артикуляция критична для видео с говорящими персонажами, интервью и образовательного контента, где отсутствие синхрона быстро разрушает восприятие реалистичности.

Дальнейший прогресс в этом направлении предполагает работу над более сложными выражениями и эмоциональной окраской речи, отражаемой в движениях лица.