Голосовой ассистент определяет пол говорящего с вероятностью 85 процентов
Исследовательская группа опубликовала результаты оценки точности классификации пола говорящего в системе речевого распознавания. Модель достигла 85-процентной точности на тестовом наборе данных, включающем 10 тысяч образцов речи на русском языке.
Алгоритм анализирует спектральные характеристики голоса, включая частоту основного тона, формантные характеристики и динамику произнесения. Высокая точность позволяет использовать определение пола для персонализации отклика ассистента.
Практическое применение
Определение пола может помочь при выборе подходящего голоса для ответа, адаптации тона и стиля коммуникации, а также для анализа статистики использования голосового помощника по демографическим группам. Это повышает естественность взаимодействия с системой.
Авторы отмечают, что точность зависит от качества записи и уровня шума в окружающей среде. На зашумленных записях из реальных условий погрешность возрастает до 12–15 процентов.
В будущем результаты предполагается применить для разработки адаптивных голосовых интерфейсов, которые автоматически подстраиваются под аудиторию и контекст использования.