Извлечение данных из PDF: ChatGPT-5 обрабатывает таблицы точнее на 23%

Компания провела сравнительный анализ ChatGPT-5 с пятью специализированными решениями для OCR и извлечения данных из PDF, включая Tesseract и коммерческие платформы. На наборе из 500 реальных документов с таблицами, сложной вёрсткой и смешанными языками ChatGPT-5 достигал точности 94%, конкуренты — в среднем 71%.

Преимущество ChatGPT-5 проявляется в обработке нестандартных форматов, рукописных аннотаций и двуязычных документов. Модель правильно интерпретирует контекст и может восстанавливать повреждённые ячейки таблиц, опираясь на логику данных.

Применение в банкинге и страховании

Банки и страховые компании начинают мигрировать на ChatGPT-5 для обработки отсканированных документов, заявлений и контрактов. Это сокращает время верификации и снижает количество ошибок в вводе данных.

Стоимость обработки одного документа через ChatGPT-5 API составляет 0,05–0,15 доллара в зависимости от сложности, что конкурентно с локальными решениями и дешевле ручной обработки.

Ограничения остаются: модель работает с документами до 10 МБ и требует промтов для оптимальной работы. Несмотря на это, энтерпрайз-клиенты массово переходят на автоматизацию, замещая устаревшие RPA-системы.