Шум упирается не в алгоритм распознавания, а в уровень сигнала
Современные модели распознавания речи хорошо справляются с шумом благодаря предварительной обработке: спектральное вычитание, адаптивные фильтры и другие техники позволяют извлечь речь из сложного фонового звука. Проблема вовсе не в том, чтобы отделить голос от шума, когда оба присутствуют в достаточном количестве.
Критическая точка наступает, когда сигнал просто слишком слабый. Если микрофон расположен далеко от говорящего или характеристики микрофона низкие, аудиосигнал может быть записан на уровне, близком к шуму микрофона самого устройства. На этом этапе никакая предварительная обработка не спасает — просто нечего анализировать.
Где рвётся цепочка
Индустрия постепенно понимает, что борьба должна начинаться не в софте, а в железе. Требования к микрофонам, расстояниям и условиям записи оказываются более влиятельны, чем сложность алгоритма распознавания.
Поэтому в корпоративных применениях распознавания речи — например, в call-центрах — так много внимания уделяется выбору телефонной гарнитуры и аудиокабелей. Хороший микрофон решает больше проблем, чем кварталы разработки.
Для потребительских приложений это означает, что рост точности в шумных условиях упирается в готовность пользователей держать устройство ближе ко рту или использовать гарнитуру, а не в совершенствование моделей.