Сырой текст или размеченный: какой формат парсится лучше

Размеченный текст — с тегами, разделителями, структурой — парсится точнее, чем сплошной. Модель лучше разделяет смысловые блоки, когда они явно отмечены. Однако это не означает, что нужно добавлять HTML или XML к любому тексту: эффективность разметки зависит от типа задачи.

Для анализа логов, таблиц, конфигов и структурированных данных разметка критична: JSON, YAML, CSV с заголовками — всё это значительно улучшает точность. Для литературных текстов, писем, описаний сыромясо часто даёт результат лучше, чем избыточная разметка.

Практическое правило

Если исходные данные по природе структурированы, но присланы как сплошной текст, переформатируйте их. Если это свободный текст, избегайте искусственных тегов: они только отвлекают модель. Промежуточный вариант — минимальная разметка: разделители для секций, нумерация для пунктов.

Тесты показывают, что модель стабильнее работает, когда формат исходных данных совпадает с их смыслом: таблица как таблица, граф как список связей, письмо как письмо.