Извлечение имён из древних текстов: ИИ работает, где люди расслаблялись

Нейросеть, обученная на оцифрованных корпусах древних текстов и их филологических комментариях, научилась находить имена в рукописях, где они написаны непоследовательно, сокращены, или обозначены иносказательно. Система обрабатывает латинские, греческие, древнерусские и арабские тексты, выполняя то, что филолог делал вручную десятилетиями: ведение именных указателей к собраниям сочинений.

Испытания на готовых изданиях показали, что модель не только правильно идентифицирует имена, но и связывает разные написания одного персонажа, восстанавливая единую запись. Например, в манускриптах Иван может быть записан как Ивань, Иван, Иво, и нейросеть соотносит эти варианты с одним исторической фигурой на основании контекста и истории текста.

Применение в палеографии и архивных работах

Практическое значение огромно: цифровизация и индексирование больших архивов становятся автоматизированными. Музеи, библиотеки и университеты, которые занимаются оцифровкой средневековых кодексов и летописей, теперь получают готовый именной указатель вместе с текстом, в то время как раньше это требовало специалистов-филологов и занимало годы.

Нейросеть также помогает исправлять опечатки в рукописях: система различает намеренное сокращение (которое нужно расшифровать) и ошибку переписчика (которую нужно исправить), опираясь на контекст и исторические варианты названий. Точность на тестовых наборах составляет 94 процента, что приемлемо для последующего ручного контроля филолога.

Первые крупные проекты уже запущены: оцифровка латинских хроник X–XII века, каталогизация ближневосточных документов, создание единого именного указателя к фондам русских летописей. Результаты выкладываются в открытый доступ, ускоряя исторические исследования и делая древние тексты более доступными.