Анализ загруженных файлов упирается в распознавание, а не в самую модель
Когда пользователь загружает PDF с таблицей или скан-копию документа, начинается не сразу анализ модели, а предварительная обработка: распознавание текста, разбор структуры, извлечение таблиц. Каждый этап может потерять информацию.
Отсканированная таблица с наклонённым текстом может быть неправильно распознана на этапе OCR, и модель будет анализировать уже испорченные данные. Идеальные условия для распознавания — чёрный текст на белом фоне, прямой ракурс и хорошее разрешение.
Где теряется качество анализа
Проблема усугубляется, если в документе смешаны таблицы, график и текст. Система должна распознать границы таблицы, извлечь её как структурированные данные, отделить от графики. На каждом шаге может накопиться ошибка.
Если файл плохого качества, результат может быть хуже, чем если бы пользователь просто переписал данные в текст. Поэтому некоторые команды вручную подготавливают документы перед анализом: сканируют повторно, выпрямляют, уменьшают помехи.
Практика показывает, что лучше один раз потратить время на подготовку исходного файла, чем потом разбираться с ошибками интерпретации. Проверка формата и качества перед загрузкой экономит на переделках.