Распознавание речи в метро улучшилось на 35 процентов
Инженеры обработали специальный датасет с записями речи в метро в часы пик. Шум поездов, объявления, голоса пассажиров — всё это ранее сильно снижало точность распознавания. После переобучения модели на этих примерах ошибки сократились с 28 до 18 процентов.
Решение основано на адаптивной фильтрации: система прослушивает окружающий фон, выделяет его спектральные характеристики и вычитает из входящего сигнала. Дополнительно применена пространственная фильтрация через микрофонные решётки.
Техническое улучшение
Новая версия модели обучена распознавать не только человеческую речь, но и отличать её от других звуков: скрип тормозов, писк дверей, объявления на других языках. Это позволило значительно снизить false positive.
Результаты проверены на независимом тестовом наборе, записанном в московском метро. Точность транскрипции подтверждена живыми проверками.
Обновление уже доступно в приложении для мобильных устройств. Особенно полезно для путешественников, которые хотят записать идею или продиктовать сообщение в пути.