Нейросети учат различать слова по звучанию — готовится фильтр спама

Группа исследователей представила подход к обучению нейросетей различению слов по акустическим характеристикам. Методика позволяет моделям выявлять спам и опасный контент даже при фонетическом маскировании, когда злоумышленники подменяют буквы на похожие по звучанию символы.

Такие фильтры становятся актуальны с ростом голосовых интерфейсов и автоматических систем распознавания речи. Текущие методы анализа текста малоэффективны против фонетических подстановок, так как ориентированы на письменное представление.

Применение в боевых системах

Разработка получила интерес у компаний, занимающихся фильтрацией контента в голосовых ассистентах и системах call-центров. На начальных тестах точность распознавания спама достигает 92 процентов даже при намеренном искажении произношения.

Подход требует предварительного обучения на размеченных выборках фонетических вариаций, что увеличивает временные затраты на подготовку моделей. Однако полученные веса переносятся между языками лучше, чем текстовые эмбеддинги.

Промышленное внедрение ожидается в течение года на площадках с высокой долей голосовых интерфейсов и пользовательского контента.