Система распознавания личности в голосовых помощниках операторов работает на основе технологии автоматического распознавания речи. cloud.vk.com Она позволяет обрабатывать голос и переводить аудио в текст. cloud.vk.com
Процесс можно разделить на три ключевых этапа: cloud.vk.com
- Анализ сигнала. cloud.vk.com Система получает голосовой сигнал, записывает и посылает на сервер. cloud.vk.com Сервер очищает сигнал от шумов и помех, затем делит запись на фонемы — фрагменты длиной до 25 миллисекунд. cloud.vk.com Каждый фрагмент сервер пропускает через акустическую модель, которая определяет, какие именно звуки произнесены. cloud.vk.com
- Расшифровка аудио. cloud.vk.com Речевые фрагменты записи сравнивают с эталонными произношениями слогов и слов из акустической модели. cloud.vk.com Система использует машинное обучение, чтобы подобрать фонетические варианты произнесённых слов и определить их контекст. cloud.vk.com
- Преобразование речи в текст. cloud.vk.com С помощью языковой модели алгоритм определяет порядок слов и подбирает нераспознанные слова по контексту. cloud.vk.com Полученная информация поступает в декодер, который объединяет данные от акустической и языковой моделей и преобразует их в текст. cloud.vk.com
Для распознавания голоса в голосовых помощниках также используют метод обработки естественного языка (NLP). cyberleninka.ru Он предполагает, например, такую последовательность действий: cyberleninka.ru
- Запись речи человека. cyberleninka.ru
- Преобразование машиной слов из аудио в электронный текст. cyberleninka.ru
- Разбор текста на основные составляющие для понимания контекста беседы и целей человека. cyberleninka.ru
- По результатам работы система определяет команду на выполнение. cyberleninka.ru