Извлечение адресов и телефонов из текста: точность достигла 98 процентов
Тестирование прошло на выборке из 50 тысяч документов: письма, анкеты, справки, веб-страницы. Модель правильно выделила 98 процентов адресов и номеров телефонов, включая нестандартные форматы вроде внутриофисных номеров и региональных кодов.
Система научилась различать контекст: номер в прайс-листе от условного примера в тексте, адрес доставки от юридического адреса. Эта способность критична для работы с документами, где один номер может повторяться в разных смыслах.
Технические подробности
Алгоритм использует двухслойную архитектуру: сначала определяется тип объекта (адрес, телефон, почта), затем производится валидация по справочникам региональных кодов и форматов.
Скорость обработки: 10 тысяч слов в секунду. Инструмент интегрируется с системами автоматизации документооборота через REST API.
Разработчики планируют расширить поддержку формата для включения IP-адресов и банковских реквизитов. Первые клиенты из сектора логистики и страхования уже используют инструмент в промышленной разработке.