Голосовой ассистент определяет пол говорящего с вероятностью 85 процентов

Исследовательская группа опубликовала результаты оценки точности классификации пола говорящего в системе речевого распознавания. Модель достигла 85-процентной точности на тестовом наборе данных, включающем 10 тысяч образцов речи на русском языке.

Алгоритм анализирует спектральные характеристики голоса, включая частоту основного тона, формантные характеристики и динамику произнесения. Высокая точность позволяет использовать определение пола для персонализации отклика ассистента.

Практическое применение

Определение пола может помочь при выборе подходящего голоса для ответа, адаптации тона и стиля коммуникации, а также для анализа статистики использования голосового помощника по демографическим группам. Это повышает естественность взаимодействия с системой.

Авторы отмечают, что точность зависит от качества записи и уровня шума в окружающей среде. На зашумленных записях из реальных условий погрешность возрастает до 12–15 процентов.

В будущем результаты предполагается применить для разработки адаптивных голосовых интерфейсов, которые автоматически подстраиваются под аудиторию и контекст использования.