Распознавание речи на смартфоне: приватность важнее точности
Облачные системы распознавания речи работают лучше: они имеют доступ к большим моделям, могут использовать контекст всего разговора и адаптироваться к голосу пользователя. Но каждый раз, когда человек говорит в микрофон, его голос отправляется на сервер — что вызывает опасения о приватности.
Технологические и общественные сдвиги вынуждают разработчиков предложить альтернативу: модели распознавания, которые работают целиком на устройстве, без загрузки аудио куда-либо. Это требует значительной переработки: модели должны быть маленькими, быстрыми и по-прежнему достаточно точными.
Компромисс между размером и качеством
Модель распознавания на устройстве обычно приносит в жертву какое-то качество, чтобы вместиться в несколько десятков мегабайт памяти. На чистой речи это почти не видно, но как только уровень фонового шума растёт или говорящий говорит с акцентом, ошибки начинают накапливаться.
Несмотря на этот компромисс, рынок двигается в сторону on-device решений. Пользователи готовы пожертвовать немного точностью, чтобы гарантировать, что их голос остался на смартфоне. Для корпоративных применений это означает возможность работать без интернета, что само по себе ценно.
Поэтому разработчики инвестируют в сжатие моделей и оптимизацию под мобильные чипы. Раньше это считалось нишей, теперь это становится стандартным требованием любого серьёзного приложения распознавания речи.