Извлечение данных из PDF: ChatGPT-5 обрабатывает таблицы точнее на 23%
Компания провела сравнительный анализ ChatGPT-5 с пятью специализированными решениями для OCR и извлечения данных из PDF, включая Tesseract и коммерческие платформы. На наборе из 500 реальных документов с таблицами, сложной вёрсткой и смешанными языками ChatGPT-5 достигал точности 94%, конкуренты — в среднем 71%.
Преимущество ChatGPT-5 проявляется в обработке нестандартных форматов, рукописных аннотаций и двуязычных документов. Модель правильно интерпретирует контекст и может восстанавливать повреждённые ячейки таблиц, опираясь на логику данных.
Применение в банкинге и страховании
Банки и страховые компании начинают мигрировать на ChatGPT-5 для обработки отсканированных документов, заявлений и контрактов. Это сокращает время верификации и снижает количество ошибок в вводе данных.
Стоимость обработки одного документа через ChatGPT-5 API составляет 0,05–0,15 доллара в зависимости от сложности, что конкурентно с локальными решениями и дешевле ручной обработки.
Ограничения остаются: модель работает с документами до 10 МБ и требует промтов для оптимальной работы. Несмотря на это, энтерпрайз-клиенты массово переходят на автоматизацию, замещая устаревшие RPA-системы.