Разметка голосов: система путает спикеров и теряет контекст диалога

Когда разработчики начинают работать с расшифровкой встреч и интервью, первый вопрос решается просто: какие слова произносит говорящий. Второй вопрос выходит сложнее: кто это произносит. Эта задача называется speaker diarization, и она почти независима от распознавания речи.

Система должна услышать, что голос сменился, угадать, говорит ли это тот же человек, что и раньше, или кто-то новый, и отслеживать эти переходы. Сложность возрастает с каждым новым участником встречи, и уже на нескольких одновременных голосах ошибки становятся частыми.

Почему разметка важнее расшифровки

Оказывается, пользователи готовы простить небольшие ошибки в распознавании слов, если известно, кто что сказал. Но если спикеры перепутаны — когда реплика приписана не тому человеку — вся расшифровка теряет смысл. Смешивание голосов даже одного человека разные моменты может раздробить его высказывание на несвязные куски.

На практике это вынуждает компании держать две отдельные системы: одну для распознавания слов, другую для разметки спикеров. И даже две хорошие системы часто работают не очень хорошо вместе, потому что ошибка в разметке затем передаётся дальше по цепочке.

Поэтому инструменты транскрибации всё чаще предлагают ручное или полуручное редактирование именно разметки спикеров, оставляя сами слова почти нетронутыми. Пользователь сам распределяет реплики по говорящим, а система работает дальше более ответственно.