Извлечение имён авторов из научных работ теперь вычисляется из подсказок модели

Инженеры научили нейросеть распознавать авторство в текстах научных работ, когда имена указаны в разных форматах или с опечатками. Модель сравнивает извлеченные имена с базой ученых и устраняет дубликаты одного автора с различными транслитерациями.

Система анализирует контекст, в котором упоминается автор, и определяет степень уверенности в идентификации. При низкой уверенности модель предлагает несколько вариантов для ручной проверки.

Значение для научных баз данных

Библиотеки и издательства используют функцию для автоматизации индексирования научных публикаций. Ручной ввод данных об авторах сокращается с часов на минуты, что ускоряет наполнение электронных каталогов.

Точность извлечения авторов составляет около 94% для текстов на английском языке и 88% для русскоязычных работ. Ошибки возникают при омонимии имен и в случаях, когда автор упоминается косвенно через его теорему или результаты.

Разработчики продолжают обучение модели на корпусе научных статей, чтобы повысить точность и расширить поддержку других языков и форматов публикаций.