Синхронизация звука с артикуляцией персонажа улучшилась на новой архитектуре
Видеомодель теперь учитывает аудиосигнал не только как контекстную информацию, но и как прямое управление параметрами движения лица и положения рта во время генерации. Ранее синхронизация требовала отдельного постпроцесса или использования дополнительных инструментов для выравнивания видео и звука.
Архитектурные изменения позволили модели лучше предсказывать микродвижения мышц лица в соответствии с фонемами и просодией речи, что значительно улучшило натуральность результата.
Применение в озвучивании
Синхронизированная генерация видео с одновременно созданным или заданным звуком упрощает создание контента для разных языков и ускоряет локализацию готовых материалов.
Улучшенная артикуляция критична для видео с говорящими персонажами, интервью и образовательного контента, где отсутствие синхрона быстро разрушает восприятие реалистичности.
Дальнейший прогресс в этом направлении предполагает работу над более сложными выражениями и эмоциональной окраской речи, отражаемой в движениях лица.