Извлечение адресов и телефонов из текста: точность достигла 98 процентов

Тестирование прошло на выборке из 50 тысяч документов: письма, анкеты, справки, веб-страницы. Модель правильно выделила 98 процентов адресов и номеров телефонов, включая нестандартные форматы вроде внутриофисных номеров и региональных кодов.

Система научилась различать контекст: номер в прайс-листе от условного примера в тексте, адрес доставки от юридического адреса. Эта способность критична для работы с документами, где один номер может повторяться в разных смыслах.

Технические подробности

Алгоритм использует двухслойную архитектуру: сначала определяется тип объекта (адрес, телефон, почта), затем производится валидация по справочникам региональных кодов и форматов.

Скорость обработки: 10 тысяч слов в секунду. Инструмент интегрируется с системами автоматизации документооборота через REST API.

Разработчики планируют расширить поддержку формата для включения IP-адресов и банковских реквизитов. Первые клиенты из сектора логистики и страхования уже используют инструмент в промышленной разработке.