Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Алгоритмы > Распознание речи


Автор: abraziv 13.3.2017, 14:35
Доброго времени суток. Стоит задача отличить один язык  от другого в аудиозаписи. В общем случае как это делать я понял, но есть несколько моментов, которые требуют пояснений. Если стоит задача просто отличить один язык (их всего два) от другого, то я представляю аудиофайл, как один кадр и вычисляю для него MFCC или же следует разбивать на кадры по 20-100 мс, но тогда как дальше ??? 
Допустим есть у меня MFCC, какой классификатор лучше выбрать ? Как его обучать? 
Допустим у меня 12 мел-кепстральных коэффициентов и я хочу использовать многослойную нейронную сеть, пусть с одним скрытым слоем. Тогда первый слой должен иметь 12 нейронов? Выходной 1, т.к. всего два состояния ? Может кто нибудь объяснить на пальцах и подсказать алгоритм обучения НС или пнуть в литературу?

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)