Распознавание голоса детей требует отдельной модели обучения

Исследование Кембриджского университета показало, что стандартные распознаватели ошибаются в 22 процентах случаев при обработке речи детей в возрасте 4–10 лет. У взрослых ошибка составляет 3–5 процентов на том же материале.

Детский голос отличается высокой основной частотой, более переменчивым тембром и менее отчётливым произношением. Модели, обученные на речи взрослых, не видят релевантных акустических паттернов в детском аудиопотоке.

Решение через переобучение

Компании начали собирать отдельные датасеты детской речи и создавать специализированные модели. Яндекс и Google запустили программы сбора озвучек от детей разных возрастных групп.

Сложность в том, что собирать детские голоса нужно с согласия родителей и соблюдением строгих норм конфиденциальности. Этап сбора данных может растянуться на несколько лет.

Приложения для образования и развивающие сервисы уже выступают за скорейшее внедрение детских моделей, так как текущая точность распознавания осложняет работу голосовых викторин и интерактивных уроков.