Совещания с многими участниками: разметка голосов сложнее расшифровки
Когда компания начинает записывать свои совещания и встречи, первый вопрос решается просто: какие слова были сказаны. Второй вопрос быстро становится главным: кто это сказал. На встречах с несколькими постоянными участниками система может ещё разобраться, но с растущим числом голосов точность падает стремительно.
Проблема усугубляется тем, что люди говорят с разной интенсивностью, часто перебивают друг друга, и звук может быть записан неравномерно. Микрофон может стоять ближе к одному участнику и дальше от другого, что усложняет жизнь системе разметки спикеров.
Как контекст помогает или мешает
Система разметки может использовать информацию о том, кого пригласили на встречу, чтобы ограничить количество ожидаемых голосов. Но если участник не говорил, система может забыть про него, и когда он начнёт говорить, может неправильно определить, кто это. Контекст помогает, но не гарантирует точность.
На крупных корпоративных встречах, где участников много, система транскрибации часто просто сдаётся и помечает говорящих как Speaker 1, Speaker 2 и так далее, оставляя пользователю задачу разобраться, кто есть кто. Люди тогда вручную заполняют имена, но это требует времени.
Поэтому для серьёзной работы с расшифровками встреч лучше всего использовать живые субтитры с подтверждением: показывать предложенное имя спикера, дав пользователю возможность быстро исправить ошибку во время встречи, пока ещё ясно, кто говорил. Это требует интеграции с системой организации встреч, но работает эффективнее полностью автоматической разметки.