Извлечение имён из древних текстов: ИИ работает, где люди расслаблялись
Нейросеть, обученная на оцифрованных корпусах древних текстов и их филологических комментариях, научилась находить имена в рукописях, где они написаны непоследовательно, сокращены, или обозначены иносказательно. Система обрабатывает латинские, греческие, древнерусские и арабские тексты, выполняя то, что филолог делал вручную десятилетиями: ведение именных указателей к собраниям сочинений.
Испытания на готовых изданиях показали, что модель не только правильно идентифицирует имена, но и связывает разные написания одного персонажа, восстанавливая единую запись. Например, в манускриптах Иван может быть записан как Ивань, Иван, Иво, и нейросеть соотносит эти варианты с одним исторической фигурой на основании контекста и истории текста.
Применение в палеографии и архивных работах
Практическое значение огромно: цифровизация и индексирование больших архивов становятся автоматизированными. Музеи, библиотеки и университеты, которые занимаются оцифровкой средневековых кодексов и летописей, теперь получают готовый именной указатель вместе с текстом, в то время как раньше это требовало специалистов-филологов и занимало годы.
Нейросеть также помогает исправлять опечатки в рукописях: система различает намеренное сокращение (которое нужно расшифровать) и ошибку переписчика (которую нужно исправить), опираясь на контекст и исторические варианты названий. Точность на тестовых наборах составляет 94 процента, что приемлемо для последующего ручного контроля филолога.
Первые крупные проекты уже запущены: оцифровка латинских хроник X–XII века, каталогизация ближневосточных документов, создание единого именного указателя к фондам русских летописей. Результаты выкладываются в открытый доступ, ускоряя исторические исследования и делая древние тексты более доступными.