| Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате |
| Форум программистов > Алгоритмы > Распознание речи |
| Автор: abraziv 13.3.2017, 14:35 |
| Доброго времени суток. Стоит задача отличить один язык от другого в аудиозаписи. В общем случае как это делать я понял, но есть несколько моментов, которые требуют пояснений. Если стоит задача просто отличить один язык (их всего два) от другого, то я представляю аудиофайл, как один кадр и вычисляю для него MFCC или же следует разбивать на кадры по 20-100 мс, но тогда как дальше ??? Допустим есть у меня MFCC, какой классификатор лучше выбрать ? Как его обучать? Допустим у меня 12 мел-кепстральных коэффициентов и я хочу использовать многослойную нейронную сеть, пусть с одним скрытым слоем. Тогда первый слой должен иметь 12 нейронов? Выходной 1, т.к. всего два состояния ? Может кто нибудь объяснить на пальцах и подсказать алгоритм обучения НС или пнуть в литературу? |